Entrevistas
Steve Nemzer, Sr. Director, Crecimiento e Innovación de IA, TELUS Digital – Serie de Entrevistas

Steve Nemzer, Sr. Director, Crecimiento e Innovación de IA, TELUS Digital, lidera iniciativas enfocadas en avanzar en la formación de datos y la infraestructura de entrenamiento para sistemas de inteligencia artificial de próxima generación. Su trabajo incluye el desarrollo de conjuntos de datos para modelos de investigación en profundidad, entornos de aprendizaje por refuerzo, datos de modelo de mundo, iniciativas de inteligencia artificial soberana y marcos de mitigación de riesgos de inteligencia artificial, con un fuerte énfasis en prácticas de inteligencia artificial responsables, como abordar el sesgo en los conjuntos de datos y apoyar condiciones de trabajo justas para los formadores de inteligencia artificial. Al comienzo de su carrera, Nemzer fundó VeriTest Labs, ayudando a líderes tecnológicos tempranos, incluyendo Microsoft (MSFT ), Intel (INTC ), Oracle (ORCL ) y Sun Microsystems, a construir ecosistemas de software de terceros prósperos antes de que la empresa fuera adquirida por Lionbridge.
TELUS Digital es una empresa de servicios tecnológicos globales que ayuda a las organizaciones a diseñar, construir y operar plataformas digitales y soluciones impulsadas por inteligencia artificial. Operando en decenas de países, la empresa proporciona servicios como formación de datos y anotación de inteligencia artificial, ingeniería de productos digitales y gestión de experiencias del cliente. Sus plataformas y servicios apoyan a empresas de diversas industrias, incluyendo tecnología, finanzas, atención médica, telecomunicaciones y juegos, a medida que modernizan sus operaciones y despliegan capacidades de inteligencia artificial avanzadas.
Dado su trasfondo en pruebas de inteligencia artificial, validación de datos y despliegue responsable, ¿cómo ve el cambio de la inteligencia artificial generativa impulsada por lenguaje hacia modelos de mundo que apuntan a razonar sobre situaciones y resultados del mundo real, particularmente en su papel actual en TELUS Digital?
Los grandes modelos de lenguaje (LLM) son fundamentalmente sistemas de predicción de patrones. Generan respuestas prediciendo el siguiente token en función de patrones aprendidos de grandes corpus estáticos. Aunque esto puede parecer razonamiento, el modelo no está modelando realmente cómo las acciones cambian el estado del mundo.
Los modelos de mundo adoptan un enfoque diferente. En lugar de predecir la próxima palabra o token, apuntan a predecir el próximo estado de un sistema modelando transiciones de estado. Esto permite que los sistemas simulen cómo evoluciona el entorno en respuesta a acciones. En la práctica, eso abre la puerta al razonamiento hipotético, donde un modelo puede evaluar diferentes resultados posibles antes de tomar una decisión. Para sistemas interactivos, esto puede apoyar una toma de decisiones y planificación más confiable.
Este cambio también altera cómo pensamos sobre el despliegue responsable. Con los sistemas de inteligencia artificial generativa tradicionales, gran parte del enfoque ha estado en cuestiones como el sesgo y las alucinaciones. A medida que los modelos se dirigen hacia el razonamiento sobre entornos y acciones, otros riesgos se vuelven más prominentes.
Por ejemplo, las organizaciones necesitan considerar la brecha “sim-to-real”, donde los comportamientos aprendidos en entornos simulados pueden no traducirse limpiamente a condiciones del mundo real. La variación de distribución también se convierte en una preocupación clave, ya que los entornos que los modelos encuentran durante el despliegue pueden diferir de los datos con los que se entrenaron.
Esto es donde las pruebas y la validación se vuelven críticas, lo cual es un gran enfoque en mi papel en TELUS Digital. A medida que los sistemas de inteligencia artificial van más allá de la generación de lenguaje hacia sistemas que interactúan con entornos y toman decisiones, las organizaciones necesitan marcos de evaluación rigurosos para garantizar que los modelos se comporten de manera confiable en condiciones del mundo real.
Muchas personas están familiarizadas con los grandes modelos de lenguaje, pero pocas entienden los modelos de mundo. En términos simples, ¿qué problema están tratando de resolver los modelos de mundo que los LLM fundamentan con dificultades?
Un modelo de mundo es un sistema que puede predecir “qué sucede a continuación” dado un estado actual y una acción. La fórmula es: Estado + Acción → Próximo Estado
Si estoy sosteniendo una manzana y la dejo caer, un modelo de mundo predice que la manzana cae. No solo sabe qué aspecto tienen las manzanas o qué dicen las personas sobre dejar caer manzanas, sino que predice la consecuencia basada en una comprensión de la física. Un modelo de mundo sofisticado predecirá qué sucedería si hiciera lo mismo mientras estuviera en la Estación Espacial Internacional en lugar de estar en la superficie de la Tierra.
Esto es diferente de un LLM. Un LLM predice: “Dada esta secuencia de tokens, ¿qué token viene a continuación?” Está entrenado en texto – lo que los humanos escribieron sobre el mundo, no el mundo en sí. Puede decirte que las manzanas caídas caen porque ha leído sobre eso. Pero no tiene un motor de física interno que simule la caída.
En otras palabras, los LLM son buenos para predecir estadísticamente la próxima palabra en una respuesta a una pregunta, pero la comprensión del mundo real va más allá de la descripción y cohesión del lenguaje. Los modelos de mundo apuntan a comprender cómo evolucionan las situaciones paso a paso, qué es el próximo estado dado el estado actual y la acción que va a ocurrir, qué restricciones hay.
Los modelos de mundo a menudo se describen como habilitadores de sistemas de inteligencia artificial para simular resultados antes de tomar acción. ¿Cómo se ve esto en la práctica y cuán cerca estamos de ver que esto funcione de manera confiable fuera de entornos de investigación?
Un desafío al responder a esta pregunta es que el término “modelo de mundo” se utiliza de manera bastante suelta, y el significado tiende a cambiar dependiendo del contexto. Una definición simple de modelos de mundo es que permiten a un agente simular su estado de entorno actual y predecir estados futuros, y razonar sobre consecuencias posteriores. Los investigadores tienden a categorizar los modelos de mundo de manera un poco más granular, basándose en sus métodos de representación y procesamiento. Hay modelos de mundo latentes, que destilan la “esencia” de un entorno en un espacio compacto y enfocado. Hay modelos de mundo generativos que “entienden” la física para crear representaciones visuales fotograma a fotograma, y hay modelos de Arquitectura Predictiva de Conjunto de Incrustación (JEPA) que predicen resultados a partir de acciones pasadas.
Los modelos de mundo latentes ya están fuera del laboratorio de investigación y están asistiendo en aplicaciones como la conducción autónoma, las operaciones de almacén, las operaciones industriales y la agricultura. Los modelos de mundo generativos están apareciendo en la creación de datos sintéticos para el desarrollo de motores de juegos, para casos de uso de conducción autónoma, casos de uso de inteligencia artificial encarnada para simulaciones de video de movimientos humanos y para crear renderizados arquitectónicos,
El enfoque JEPA, favorecido por luminarias de la industria como Yan LeCun, predice resultados en un espacio de representación abstracto en lugar de generar píxeles. Los robots han estado en gran medida confinados a entornos controlados, pero JEPA está cambiando eso, permitiendo que los robots se muevan hacia entornos del mundo real y abiertos. Los vehículos autónomos son un buen ejemplo – algunos están utilizando Genie 3 para generar simulaciones interactivas hiperrealistas para el entrenamiento y para manejar mejor eventos raros como zonas de construcción.
Obviamente, se requiere mucha más prueba de seguridad y confiabilidad para escalar y mover estos modelos fuera de entornos aislados y hacia el mundo real.
Desde una perspectiva empresarial, ¿dónde espera que los modelos de mundo entreguen un valor significativo primero, ya sea en robótica, sistemas de toma de decisiones autónomos, gemelos digitales o entornos de negocios más abstractos?
Mi sensación instintiva es que los gemelos digitales probablemente entreguen valor práctico primero. Replicar el estado de un sistema del mundo real para probar escenarios antes de actuar. Por ejemplo, en un sistema de cadena de suministro, un fabricante puede construir un gemelo de su red de socios de componentes. La simulación puede alimentarse con datos de sensores, registros, datos de telemetría y puede responder a preguntas como “¿Qué sucedería si el estrecho de Ormuz estuviera cerrado?” Así podemos probar la re-routing de envíos antes de cambiar realmente la logística real. Esto nos ayuda a movernos desde monitorear un sistema en vivo a simular un sistema en vivo.
El valor significativo de los modelos de mundo para la robótica está avanzando en paralelo. Tener robots que entiendan propiedades fundamentales de la física, como la fricción en una superficie al recoger un objeto, impulsará el despliegue de la inteligencia artificial encarnada a toda velocidad.
Mucha de su carrera se ha centrado en la recopilación de conjuntos de datos, anotación y validación. ¿Cómo cambian los desafíos de datos al moverse de la formación de texto estático a la enseñanza de sistemas sobre cómo se comporta el mundo con el tiempo?
La situación de recopilación de datos para la habilitación de modelos de mundo requiere un gran cambio de los métodos de entrenamiento de LLM de ayer. En primer lugar, no tenemos un gran corpus de datos de pre-entrenamiento disponible, petabytes de Common Crawl y miles de millones de páginas web. Algunos investigadores de robótica han especulado que solo tenemos 1/1000 de la cantidad de datos necesarios para entrenar la inteligencia física y los modelos de mundo, para llegar a un punto de rendimiento equivalente al de GPT2.
Así que tomará algún tiempo construir esos conjuntos de datos. En el caso de la inteligencia artificial encarnada, necesitaremos millones de horas de conjuntos de datos de sensores múltiples egocéntricos anotados. Algunos son teleoperados, algunos provienen de entornos sintéticos como Isaac Sim. En TELUS Digital, hemos hecho la transición de texto a conjuntos de datos multimodales y multisensores y conjuntos de datos de simulación. Por supuesto, nos ayuda nuestro fuerte trasfondo en recopilación de datos y anotación en visión por computadora. Hemos estado a la vanguardia allí durante muchos años.
Más allá de la escasez de datos de pre-entrenamiento y datos de ajuste fino anotados, habrá muchos otros desafíos de entrenamiento al escalar el aprendizaje por refuerzo. Puede que haya nuevos paradigmas transformadores (sin pun intended) como GPT y conceptos de RL necesarios para acelerar avances de eficiencia en los métodos de entrenamiento de modelos de mundo.
Los modelos de mundo influyen en las decisiones en lugar de solo generar salidas. ¿Qué nuevos riesgos de seguridad o gobernanza introduce esto en comparación con los sistemas de inteligencia artificial generativa?
Hay muchos riesgos de seguridad y gobernanza, ya que los modelos de mundo están inherentemente destinados a apoyar operaciones de agentes. Así que todas las preocupaciones que tenemos sobre la generación actual de agentes de inteligencia artificial todavía se aplican en el escenario de los modelos de mundo. Necesitamos supervisión humana para toda la toma de decisiones importante, ya sea relacionada con la seguridad de transporte, seguridad ocupacional, atención médica, finanzas y actividades diarias.
Un ejemplo específico de los modelos de mundo es la brecha entre los datos de entrenamiento de simulación y los entornos del mundo real. Una variación de superficie microscópica puede hacer que el mundo real sea complicado para los robots que están bien entrenados en simulación.
Otro riesgo se relaciona con el comportamiento humano. A medida que los sistemas se vuelven más y más autónomos, los humanos comenzarán a confiar en ellos mucho, y la supervisión puede volverse laxa, y eventualmente el sistema no recibirá las recalibraciones necesarias.
El sesgo y la confianza siguen siendo barreras importantes para la adopción de la inteligencia artificial. ¿Cómo evolucionan esas preocupaciones cuando los sistemas de inteligencia artificial comienzan a modelar y actuar en entornos sociales o del mundo real complejos?
Desde el público en general hasta la suite C, la confianza en los modelos de inteligencia artificial ya es bastante baja y no veo que cambie mucho en el corto plazo.
Las preocupaciones sobre el poder de la inteligencia artificial concentrado en muy pocas manos, sobre la inteligencia artificial quitando empleos, el sesgo en la inteligencia artificial poniendo a los grupos subrepresentados en desventaja, los modelos tomando decisiones que afectan la salud, la carrera y las finanzas de uno, los modelos utilizando la propiedad intelectual sin consentimiento, así como la preocupación por los deepfakes de inteligencia artificial, ya son muy altas. Los ejecutivos se preocupan por manejar transiciones de la fuerza laboral, privacidad de datos y cumplimiento normativo, y perder terreno a los competidores en una “carrera de armas” de inteligencia artificial.
Los desarrollos recientes en las noticias sobre la presión del gobierno sobre los constructores de modelos de inteligencia artificial fundamentales para relajar los términos de uso con respecto a cosas como armas autónomas o vigilancia masiva solo están amplificando esas preocupaciones. Un despliegue más amplio de robots más inteligentes y autónomos basados en modelos de mundo también lo hará.
Por otro lado, estamos viendo bolsillos de adopción y confianza generalizados en la inteligencia artificial. Un ejemplo es la forma en que los agentes de codificación han despegado en los últimos meses. Los gerentes de desarrollo de software tienen una gran confianza en los agentes de codificación, y hay un cambio fundamental en la forma en que se realiza el desarrollo de software, desde el desarrollo de PRD hasta las pruebas de regresión posteriores al lanzamiento. El mundo del desarrollo de software está evolucionando a toda velocidad, y mucho de eso se debe a la confianza en los agentes de codificación de alto rendimiento. A medida que la confianza del usuario crece en otros casos de uso, espero que la adopción despegue de manera similar.
Las soluciones para construir la confianza incluyen conjuntos de datos y entornos de entrenamiento diversos, y una prueba de estrés y pruebas de equipo rojo como una barrera de seguridad antes del despliegue. La supervisión regulatoria proactiva es una necesidad. Algunos han sugerido que los constructores de modelos de inteligencia artificial fundamentales deben proporcionar “Informes de Impacto Social”, similares a los Informes de Impacto Ambiental (EIA), antes de que se lancen nuevos modelos.
En TELUS Digital, gran parte del trabajo implica desplegar la inteligencia artificial a escala para empresas y usuarios reales. ¿Cómo se cruzan ideas como los modelos de mundo con preocupaciones prácticas como la transparencia, el impacto en la fuerza laboral y el mantenimiento de la confianza del cliente?
Para aclarar, TELUS Digital trabaja tanto directamente con los constructores de modelos fundamentales como con las empresas que despliegan modelos de inteligencia artificial. Nuestro campo de juego es de extremo a extremo:

La pregunta sobre las preocupaciones prácticas está relacionada con la investigación anterior sobre la confianza. Veamos la confianza en la fuerza laboral. A medida que los modelos de mundo habilitados para la inteligencia artificial se vuelven más generalizados, los ejecutivos necesitan ser transparentes con sus empleados, contratistas y clientes. Se requieren comunicaciones claras sobre lo que los modelos son buenos, cómo se han entrenado, qué datos se utilizaron para entrenarlos, qué guardias se han establecido y dónde entra la supervisión humana. Los líderes empresariales necesitan mostrar a la fuerza laboral actual el valor de los nuevos modelos, por ejemplo, haciendo todo el trabajo tedioso en un trabajo. Y necesitan mostrar caminos de transición para los trabajadores afectados que pueden estar moviéndose hacia nuevos trabajos emergentes a medida que los modelos de mundo habilitados para la inteligencia artificial se vuelven más comunes en la automatización.
Hay una brecha creciente entre lo que los investigadores de inteligencia artificial entienden y lo que el público percibe. ¿Cómo pueden las organizaciones comunicar avances como los modelos de mundo de una manera que construya la confianza sin exagerar sus capacidades?
Nuevamente, se trata de la transparencia sobre las limitaciones de los modelos y sobre lo que los modelos son buenos. Comunicar cómo los modelos se han entrenado para mitigar el sesgo potencial. Qué supervisión humana está en su lugar. Algunas demostraciones del mundo real de las capacidades y casos de uso del modelo, combinadas con estudios longitudinales, pueden ir muy lejos para aumentar la confianza general del público y la fuerza laboral.
Finalmente, ¿qué es una concepción errónea común sobre los modelos de mundo de inteligencia artificial, ya sea demasiado optimista o demasiado cautelosa, que cree que necesita ser corregida ahora?
Hasta donde el público en general está informado sobre los modelos de mundo, una concepción errónea es que los modelos de mundo necesitan entender todo de la física y la ciencia para ser efectivos. Los modelos de mundo se implementarán antes de lo que uno podría esperar porque los casos de uso individuales se pueden reducir. Un vehículo autónomo solo necesita entender la dinámica del tráfico y la física relacionada con la carretera, y cómo las condiciones actuales (por ejemplo, estar cerca de una escuela primaria o una prevalencia de vehículos SUV cercanos con siluetas altas) afectarán su visión y toma de decisiones. Un vehículo autónomo no necesita la física que subyace a cómo funciona un soufflé para funcionar.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar TELUS Digital.












