Entrevistas
Amr Nour-Eldin, Vicepresidente de Tecnología en LXT – Serie de Entrevistas

Amr Nour-Eldin, es el Vicepresidente de Tecnología en LXT. Amr es un científico de investigación con doctorado y más de 16 años de experiencia profesional en los campos del procesamiento de habla y audio y el aprendizaje automático en el contexto del Reconocimiento Automático de Habla (ASR), con un enfoque particular y experiencia práctica en los últimos años en técnicas de aprendizaje profundo para el reconocimiento de habla de extremo a extremo.
LXT es un líder emergente en datos de entrenamiento de IA para impulsar la tecnología inteligente para organizaciones globales. En asociación con una red internacional de contribuyentes, LXT recopila y anota datos en múltiples modalidades con la velocidad, escala y agilidad requeridas por las empresas. Su experiencia global abarca más de 145 países y más de 1000 configuraciones lingüísticas.
¿Qué te interesó inicialmente en este campo al perseguir un doctorado en Procesamiento de Señales en la Universidad McGill?
Siempre quise estudiar ingeniería y realmente me gustaban las ciencias naturales en general, pero me sentí más atraído por las matemáticas y la física. Me encontré siempre tratando de descubrir cómo funciona la naturaleza y cómo aplicar ese entendimiento para crear tecnología. Después de la escuela secundaria, tuve la oportunidad de ingresar a la medicina y otras profesiones, pero específicamente elegí la ingeniería porque representaba la combinación perfecta, en mi opinión, de teoría y aplicación en los dos campos más cercanos a mi corazón: matemáticas y física. Y luego, una vez que la había elegido, había muchos caminos posibles – mecánica, civil, y así sucesivamente. Pero elegí específicamente la ingeniería eléctrica porque es la más cercana y la más difícil, en mi opinión, a los problemas de matemáticas y física que siempre encontré desafiantes y, por lo tanto, disfruté más, así como la base de la tecnología moderna que siempre me ha impulsado.
Dentro de la ingeniería eléctrica, hay varias especializaciones para elegir, que generalmente se dividen en dos categorías: telecomunicaciones y procesamiento de señales, y la de energía y ingeniería eléctrica. Cuando llegó el momento de elegir entre esas dos, elegí telecomunicaciones y procesamiento de señales porque está más cerca de cómo describimos la naturaleza a través de la física y las ecuaciones. Estás hablando de señales, ya sea audio, imágenes o video; entendiendo cómo nos comunicamos y qué perciben nuestros sentidos, y cómo representar matemáticamente esa información de manera que nos permita aprovechar ese conocimiento para crear y mejorar la tecnología.
¿Podrías discutir tu investigación en la Universidad McGill sobre el aspecto teórico de la información de la extensión de banda artificial (BWE)?
Después de terminar mi licenciatura, quería seguir estudiando el campo del Procesamiento de Señales de manera académica. Después de un año de estudiar Óptica como parte de una maestría en Física, decidí regresar a la Ingeniería para perseguir mi maestría en Procesamiento de Audio y Habla, centrándome en el reconocimiento de habla. Cuando llegó el momento de hacer mi doctorado, quería ampliar un poco mi campo hacia el procesamiento de audio y habla en general, así como hacia los campos relacionados del Aprendizaje Automático y la Teoría de la Información, en lugar de centrarme solo en la aplicación del reconocimiento de habla.
El vehículo para mi doctorado fue la extensión de banda de la habla de banda estrecha. La habla de banda estrecha se refiere a la habla telefónica convencional. El contenido de frecuencia de la habla se extiende hasta alrededor de 20 kilohertz, pero la mayoría del contenido de información se concentra hasta solo 4 kilohertz. La extensión de banda se refiere a extender artificialmente el contenido de la habla desde 3.4 kilohertz, que es el límite de frecuencia superior en la telefonía convencional, a más de 8 kilohertz o más. Para reconstruir mejor el contenido de frecuencia superior que falta dado solo el contenido de banda estrecha disponible, primero hay que cuantificar la información mutua entre el contenido de la habla en las dos bandas de frecuencia, y luego usar esa información para entrenar un modelo que aprenda esa información compartida; un modelo que, una vez entrenado, pueda generar contenido de banda ancha dado solo la habla de banda estrecha y lo que el modelo aprendió sobre la relación entre la habla de banda estrecha disponible y el contenido de banda ancha que falta. La cuantificación y representación de esa información mutua compartida es donde entra en juego la Teoría de la Información. La Teoría de la Información es el estudio de la cuantificación y representación de la información en cualquier señal. Así que mi investigación se centró en incorporar la Teoría de la Información para mejorar la extensión de banda artificial de la habla. Como tal, mi doctorado fue más una actividad de investigación interdisciplinaria donde combiné el procesamiento de señales con la Teoría de la Información y el Aprendizaje Automático.
Fuiste científico principal de habla en Nuance Communications, ahora parte de Microsoft (MSFT ), durante más de 16 años, ¿cuáles fueron algunos de tus principales conocimientos obtenidos de esta experiencia?
Desde mi perspectiva, el beneficio más importante fue que siempre estuve trabajando en técnicas de vanguardia y de última generación en procesamiento de señales y aprendizaje automático, y aplicando esa tecnología a aplicaciones del mundo real. Tuve la oportunidad de aplicar esas técnicas a productos de Inteligencia Conversacional en múltiples dominios. Esos dominios abarcaron desde la empresa, la atención médica, el automóvil y la movilidad, entre otros. Algunas de las aplicaciones específicas incluyeron asistentes virtuales, respuesta de voz interactiva, correo de voz a texto, y otros donde la representación y transcripción adecuadas son críticas, como en la atención médica con interacciones entre médicos y pacientes. A lo largo de esos 16 años, tuve la suerte de presenciar y ser parte de la evolución de la Inteligencia Conversacional, desde los días del modelado estadístico utilizando Modelos de Markov Ocultos, a través de la toma gradual del Aprendizaje Profundo, hasta ahora donde el aprendizaje profundo prolifera y domina casi todos los aspectos de la IA, incluyendo la IA Generativa, así como la IA predictiva o discriminatoria tradicional. Otro conocimiento clave que obtuve de esta experiencia es el papel crucial que juega los datos, en términos de cantidad y calidad, como un impulsor clave de las capacidades y el rendimiento de los modelos de IA.
Has publicado una docena de artículos, incluyendo en publicaciones tan aclamadas como IEEE. En tu opinión, ¿cuál es el artículo más innovador que publicaste y por qué fue importante?
El más impactante, según el número de citas en Google (GOOGL ) Scholar, sería un artículo de 2008 titulado “Extensión de banda de habla de banda estrecha basada en coeficientes cefálicos de frecuencia de Mel”. A nivel alto, el enfoque de este artículo es cómo reconstruir el contenido de la habla utilizando una representación de características ampliamente utilizada en el campo del reconocimiento automático de habla (ASR), los coeficientes cefálicos de frecuencia de Mel.
Sin embargo, el artículo más innovador a mi parecer es un artículo con la segunda mayor cantidad de citas, un artículo de 2011 titulado “Aproximación basada en memoria del marco del modelo de mezcla de Gaussianas para la extensión de banda de habla de banda estrecha“. En ese trabajo, propuse una nueva técnica de modelado estadístico que incorpora información temporal en la habla. La ventaja de esa técnica es que permite modelar información a largo plazo en la habla con una complejidad mínima y de una manera que aún permite la generación de habla de banda ancha en tiempo real o en streaming.
En junio de 2023, fuiste reclutado como Vicepresidente de Tecnología en LXT, ¿qué te atrajo a este puesto?
A lo largo de mi experiencia académica y profesional antes de unirme a LXT, siempre he trabajado directamente con datos. De hecho, como mencioné anteriormente, una de las principales conclusiones que saqué de mi trabajo en ciencia de la habla y aprendizaje automático fue el papel crucial que juegan los datos en el ciclo de vida del modelo de IA. Tener suficientes datos de calidad en el formato correcto es, y sigue siendo, vital para el éxito de las técnicas de IA de última generación basadas en aprendizaje profundo. Así que, cuando me encontré en una etapa de mi carrera en la que estaba buscando un entorno similar al de una startup donde pudiera aprender, ampliar mis habilidades, así como aprovechar mi experiencia en habla y IA para tener el mayor impacto, tuve la suerte de tener la oportunidad de unirme a LXT. Fue la elección perfecta. No solo LXT es un proveedor de datos de IA que crece a un ritmo impresionante y constante, sino que también vi que estaba en la etapa perfecta en términos de crecimiento en conocimientos de IA, así como en tamaño y diversidad de clientes, y por lo tanto en tipos de datos de IA. Me gustó la oportunidad de unirme y ayudar en su viaje de crecimiento; tener un gran impacto al traer la perspectiva de un usuario final de datos después de haber sido un usuario científico de datos de IA durante todos esos años.
¿Cómo se ve tu día promedio en LXT?
Mi día promedio comienza con la investigación de los últimos avances en un tema u otro, que últimamente se ha centrado en la IA generativa, y cómo podemos aplicar eso a las necesidades de nuestros clientes. Afortunadamente, tengo un equipo excelente que es muy hábil para crear y adaptar soluciones a las necesidades de datos de IA de nuestros clientes, a menudo especializadas. Así que trabajo en estrecha colaboración con ellos para establecer esa agenda.
Hay, por supuesto, también planificación estratégica anual y trimestral, y desglose de objetivos estratégicos en metas de equipo individuales y mantenerme al tanto de los desarrollos a lo largo de esos planes. En cuanto al desarrollo de características que estamos haciendo, generalmente tenemos dos pistas tecnológicas. Una es asegurarnos de que tengamos las piezas correctas en su lugar para entregar los mejores resultados en nuestros proyectos actuales y nuevos. La otra pista es mejorar y expandir nuestras capacidades tecnológicas, con un enfoque en incorporar el aprendizaje automático en ellas.
¿Podrías discutir los tipos de algoritmos de aprendizaje automático con los que trabajas en LXT?
Las soluciones de IA están transformando empresas en todas las industrias, y en LXT nos enorgullecemos de proporcionar los datos de alta calidad para entrenar los algoritmos de aprendizaje automático que las impulsan. Nuestros clientes están trabajando en una amplia gama de aplicaciones, incluyendo realidad aumentada y virtual, visión por computadora, IA conversacional, IA generativa, relevancia de búsqueda y procesamiento de habla y lenguaje natural (NLP), entre otros. Estamos comprometidos a impulsar los algoritmos y tecnologías de aprendizaje automático del futuro a través de la generación y mejora de datos en todos los idiomas, culturas y modalidades.
Internamente, también estamos incorporando el aprendizaje automático para mejorar y optimizar nuestros procesos internos, que van desde la automatización de nuestra validación de calidad de datos hasta la habilitación de un modelo de etiquetado con intervención humana en todas las modalidades de datos en las que trabajamos.
El procesamiento de habla y audio se está acercando rápidamente a la perfección cuando se trata de inglés y específicamente de hombres blancos. ¿Cuánto tiempo crees que tomará hasta que sea un campo de juego nivelado en todos los idiomas, géneros y etnias?
Esta es una pregunta complicada, y depende de una serie de factores, incluyendo los económicos, políticos, sociales y tecnológicos, entre otros. Pero lo que es claro es que la prevalencia del idioma inglés es lo que ha impulsado a la IA a donde estamos ahora. Así que llegar a un lugar donde sea un campo de juego nivelado realmente depende de la velocidad a la que crece la representación de datos de diferentes etnias y poblaciones en línea, y el ritmo al que crece es lo que determinará cuándo llegaremos allí.
Sin embargo, LXT y empresas similares pueden tener un gran papel en impulsar hacia un campo de juego más nivelado. Mientras que los datos para lenguas, géneros y etnias menos representadas sean difíciles de acceder o simplemente no estén disponibles, ese cambio vendrá más lentamente. Pero estamos tratando de hacer nuestra parte. Con cobertura para más de 1,000 configuraciones lingüísticas y experiencia en 145 países, LXT ayuda a hacer que el acceso a más datos lingüísticos sea posible.
¿Cuál es tu visión para cómo LXT puede acelerar los esfuerzos de IA para diferentes clientes?
Nuestro objetivo en LXT es proporcionar las soluciones de datos que permitan un desarrollo de IA eficiente, preciso y más rápido. A través de nuestros 12 años de experiencia en el espacio de datos de IA, no solo hemos acumulado un conocimiento extenso sobre las necesidades de los clientes en términos de todos los aspectos relacionados con los datos, sino que también hemos afinado continuamente nuestros procesos para entregar los datos de la más alta calidad al ritmo más rápido y a los mejores precios. En consecuencia, como resultado de nuestro compromiso inquebrantable para proporcionar a nuestros clientes la combinación óptima de calidad de datos de IA, eficiencia y precio, nos hemos convertido en un socio de confianza de datos de IA, como lo evidencian nuestros clientes que siguen regresando a LXT para satisfacer sus necesidades de datos de IA en constante evolución. Mi visión es cementar, mejorar y expandir ese “modus operandi” de LXT a todas las modalidades de datos en las que trabajamos, así como a todos los tipos de desarrollo de IA que ahora servimos, incluyendo la IA generativa. Lograr este objetivo gira en torno a expandir estratégicamente nuestras propias capacidades de aprendizaje automático y ciencia de datos, tanto en términos de tecnología como de recursos. Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar LXT.












