Entrevistas

Rob May, CEO y Co-Fundador de NeuroMetric – Serie de Entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Rob May, CEO y Co-Fundador de NeuroMetric, es un emprendedor y inversor experimentado con una larga trayectoria que abarca la computación en la nube, startups de inteligencia artificial y capital de riesgo, actualmente liderando Neurometric AI mientras también se desempeña como Director Gerente en HalfCourt Ventures, donde ha respaldado a más de 100 empresas de tecnología. Junto con sus roles de operación e inversión, co-fundó la Comunidad de Innovadores de Inteligencia Artificial y previamente construyó y salió de empresas como Backupify, reflejando una profunda experiencia en múltiples ciclos tecnológicos. También es ampliamente conocido por su newsletter de larga duración Invertir en Inteligencia Artificial, que comenzó a escribir hace más de una década para analizar tendencias emergentes de inteligencia artificial, estrategias de inversión y cambios en el mercado, y que desde entonces ha evolucionado en una plataforma para obtener una comprensión más profunda del paisaje de inteligencia artificial en rápida evolución.

NeuroMetric AI se centra en resolver uno de los desafíos más críticos en la inteligencia artificial hoy en día: el costo y la eficiencia de la inferencia a escala. La plataforma evalúa dinámicamente las cargas de trabajo de inteligencia artificial y aplica estrategias de optimización, como combinar modelos especializados más pequeños con técnicas de cómputo avanzadas en el momento de la prueba, para mejorar el rendimiento mientras reduce drásticamente los costos, lo que permite a las empresas lograr un mejor retorno de la inversión en las implementaciones de inteligencia artificial. Al orquestar las cargas de trabajo y adaptar el uso de los modelos a tareas específicas, Neurometric pretende hacer que los sistemas de inteligencia artificial sean significativamente más rápidos y asequibles, posicionándose en la intersección de la infraestructura de inteligencia artificial, la eficiencia y la escalabilidad en el mundo real a medida que las organizaciones pasan de la experimentación a la producción.

Ha fundado y dirigido múltiples empresas de inteligencia artificial, ha invertido en más de 100 startups a través de HalfCourt Ventures y previamente construyó y salió de Backupify. ¿Cómo han moldeado esas experiencias su perspectiva sobre dónde se crea valor duradero en la inteligencia artificial hoy en día?

Creo que la mayoría de los inversores y emprendedores están persiguiendo barreras de entrada a corto plazo, cosas que parecen brechas obvias en el mercado hoy, pero brechas que serán cerradas rápidamente por empresas existentes. La inteligencia artificial hará que dirigir un negocio se colapse en una serie de decisiones probabilísticas. Las empresas en las que hay que invertir o construir son aquellas que tienen las mejores estimaciones generales de esas probabilidades. A veces eso vendrá de la integración vertical y a veces de la escala horizontal, depende del mercado.

En su newsletter Invertir en Inteligencia Artificial, ha argumentado que los modelos se están volviendo cada vez más intercambiables y que la verdadera defensibilidad se desplaza hacia la capa de sistemas. ¿Cómo se ve una verdadera “barrera de sistemas” en la práctica?

Una verdadera barrera de sistemas tiene tres propiedades: se acumula con el uso, es específica del cliente y no puede ser replicada intercambiando un modelo mejor.

La defensibilidad vive en lo que llamo un “Sistema de Contexto” — una arquitectura integrada que conecta los modelos de base con todo lo que hace que una empresa sea única: sus datos, flujos de trabajo, conocimiento de dominio, historial de decisiones. El sistema captura señales de cada interacción — qué modelos tienen éxito en qué tareas, dónde importa la latencia, qué patrones empresariales específicos surgen — y los retroalimenta para mejorar el sistema.

La idea clave es que esto crea un volante multiplicativo, no aditivo. No se trata solo de acumular un registro de decisiones pasadas. Se trata de generar señales de entrenamiento que producen modelos especializados que mejoran la ruta, lo que captura datos más valiosos. La barrera se amplía con cada inferencia.

En la práctica, una barrera de sistemas se parece a una integración de flujo de trabajo profunda donde los costos de cambio no se deben a las API — se deben a la reescritura de la lógica empresarial. Se parece a un contexto propietario que ningún competidor puede replicar porque se generó a través de meses de uso de producción dentro de una empresa específica. Y se parece a un bucle de especialización continuo donde el sistema se vuelve significativamente mejor para ese cliente de maneras en que un proveedor de modelos genérico nunca lo hará.

La era de los modelos nos dio la capacidad bruta. La era de los sistemas es donde esa capacidad se convierte en valor en el mundo real.

¿Cómo deberían pensar las empresas sobre la construcción de una estrategia de múltiples modelos, incluyendo lógica de enrutamiento, caminos de escalación y evaluación continua, en lugar de confiar en un solo modelo de vanguardia?

Lo primero que las empresas necesitan internalizar es que “simplemente usar el mejor modelo” es una estrategia perdedora a escala. Es equivalente a ejecutar cada consulta a través de su ingeniero más senior. Es costoso, es lento y — contraintuitivamente — a menudo no produce los mejores resultados.

Esto se relaciona con lo que llamo la Franja Jagged de Inferencia: el rendimiento del modelo es específico de la tarea y impredecible. Los modelos de vanguardia pierden ante modelos especializados más pequeños en tareas específicas todo el tiempo. Hemos visto que los sistemas compuestos de múltiples modelos alcanzan un 72,7% de precisión en tareas de CRM donde los modelos de vanguardia obtuvieron un 58%. La superficie de rendimiento no se correlaciona limpiamente con el recuento de parámetros. Así que la verdadera pregunta no es “¿cuál es el mejor modelo?” — es “¿cuál es el mejor modelo para esta subtask específica?”

Esa reformulación es la base de una estrategia de múltiples modelos real. Aquí hay cómo les diría a las empresas que piensen en ella en tres capas.

Lógica de enrutamiento comienza con la creación de un mapa de su paisaje de inferencia. Catalogar cada punto en su sistema donde se realiza una llamada a un modelo de lenguaje grande, y para cada uno, documentar el tipo de tarea, la complejidad de entrada/salida, los requisitos de latencia, el umbral de precisión y el volumen de llamadas. Eso les da un mapa de calor. Rápidamente encontrarán que la mayoría de su volumen es trabajo de alta frecuencia y alcance estrecho — clasificación, extracción de entidades, enrutamiento de intención, generación de plantillas — donde un modelo más pequeño ajustado coincide o supera al modelo de vanguardia a una fracción del costo. Reserven sus llamadas de vanguardia costosas para las tareas que genuinamente requieren razonamiento complejo. Un agente que realiza 50 llamadas por tarea no necesita GPT-4 para todas las 50.

Caminos de escalación se tratan de construir desviaciones inteligentes, no solo fallas. El sistema necesita reconocer cuándo un modelo más pequeño está devolviendo resultados de baja confianza y escalar a un modelo más capaz — o a una combinación de modelo-estrategia completamente diferente. Aquí es donde entran en juego las estrategias de cómputo en el momento de la prueba. A veces la respuesta correcta no es un modelo más grande — es el mismo modelo con una cadena de pensamiento, búsqueda de haz o muestreo de los mejores-N. La configuración óptima cambia no solo por modelo, sino por el algoritmo de pensamiento que se empareja con él.

Evaluación continua es la pieza que la mayoría de las empresas pasa por alto por completo, y es donde emerge la verdadera defensibilidad. La selección de modelos no es una decisión de una sola vez — es un problema de optimización continuo. Los nuevos modelos se lanzan constantemente, sus casos de uso evolucionan y el rendimiento se degrada de maneras que fallan silenciosamente. No sabrán que su bot de servicio al cliente dio una respuesta un 40% peor porque usaron el modelo incorrecto para ese tipo de consulta — solo verán la deserción tres meses después. Necesitan infraestructura que mida continuamente lo que realmente funciona en combinaciones de modelo-tarea y ajuste la ruta en función de datos de rendimiento real, no de benchmarks.

La razón por la que la mayoría de las empresas no han hecho este cambio es que nadie es despedido por elegir el modelo de vanguardia — es el “nadie es despedido por comprar IBM” de la inteligencia artificial. El ecosistema de proveedores de vanguardia porque ahí es donde están las ganancias. Y la infraestructura de orquestación necesaria para ejecutar realmente una arquitectura de múltiples modelos — lógica de enrutamiento, mecanismos de desviación, gestión de modelos, observabilidad — simplemente no existe en la mayoría de las empresas. Están atascadas en un óptimo local donde los costos de cambio y la incertidumbre de múltiples modelos se sienten más altos que el gasto continuo en inferencia de vanguardia.

¿Cuáles son los errores más grandes que ve que cometen las empresas cuando pasan de pilotos de inteligencia artificial a sistemas de producción?

Suponen que sus elecciones pueden ser estáticas y de larga duración. En realidad, cada capa de la pila tecnológica para la inteligencia artificial está cambiando rápidamente. Las empresas necesitan tomar decisiones que proporcionen opcionalidad y flexibilidad.

¿En qué tipos de flujos de trabajo ha visto que los modelos más pequeños y específicos de tareas superan a los modelos de vanguardia, y por qué eso es estratégicamente importante?

Lo hemos visto en casi todas las tareas de trabajo diario comunes – cosas como contabilidad básica, resumen de texto, extracción de entidades de varios documentos. Hemos explorado SLM para cientos de tareas de trabajo y casi siempre ganan si el problema está estructurado correctamente.

Ha escrito sobre la disminución del costo marginal de implementar inteligencia artificial en nuevos casos de uso. ¿Cómo cambia eso la economía a largo plazo de la adopción de inteligencia artificial para las empresas?

La narrativa de la burbuja supone que los ingresos de la inteligencia artificial requieren una inversión en investigación y desarrollo proporcional en nuevos modelos. No es así. Los modelos están construidos. La infraestructura existe. Cada caso de uso adicional es un prompt, una conexión de datos, tal vez un poco de ajuste fino — no otra carrera de entrenamiento de $100M. La curva de costo marginal se curva hacia abajo a medida que la plataforma madura.

Esto es lo opuesto a los ferrocarriles o las telecomunicaciones, donde cada milla de pista era costosa. En la inteligencia artificial, construir el motor fue costoso. Conectar cosas al motor es barato, y se vuelve más barato — los costos de inferencia han disminuido aproximadamente 1.000 veces en dos años. La pregunta para las empresas no es si la inteligencia artificial compensa. Es cuántos casos de uso pueden apilar en la misma infraestructura antes de que la curva de ingresos supere la curva de costos.

¿Qué señalesales deben usar los equipos técnicos para determinar cuándo cambiar de modelo, ajustar o construir modelos especializados pequeños para tareas?

Las señalesales no son necesariamente técnicas. Son más bien impulsadas por el rendimiento o económicamente. Por ejemplo, cambiar un modelo o ajustar un modelo o construir un SLM personalizado podrían funcionar todos. La decisión depende de si se está optimizando para la latencia o el costo, con qué frecuencia se ejecuta la tarea y cuánto tiempo lleva construir y desplegar cada solución.

¿Cómo diseñarían barreras, monitoreo y gobernanza de una manera que realmente se escalone con el uso en lugar de convertirse en un cuello de botella?

El error que cometen la mayoría de las empresas es tratar la gobernanza como un punto de control — una capa de revisión manual soldada encima de los flujos de trabajo de inteligencia artificial. Eso no se escalona. Se convierte en el cuello de botella en el momento en que aumenta el uso.

La gobernanza tiene que estar incrustada en la capa de orquestación en sí. Cuando su infraestructura de enrutamiento ya evalúa cada llamada de inferencia — qué modelo, qué tarea, qué nivel de confianza — agregar barreras es un costo marginal, no un nuevo sistema. La misma capa que decide qué modelo maneja una consulta puede hacer cumplir la política: filtrado de PII antes de la llamada, validación de salida después, registros de auditoría capturados automáticamente, asignación de costos por departamento.

La idea clave es que las empresas no fallan dentro de los sistemas de inteligencia artificial. Fallan entre ellos — en las entregas, escalaciones y excepciones. La gobernanza que se escalona se parece a un plano de control que hace que cada acción de inteligencia artificial sea segura, auditable y repetible como subproducto de la ejecución, no un obstáculo para ella.

Ha comparado el paisaje de inteligencia artificial actual con la transición de los mainframes a las PC. ¿Qué significa esa descentralización para las startups que construyen en la capa de sistemas?

Estamos en la fase de mainframe de la inteligencia artificial en este momento. Los grandes modelos de vanguardia centralizados de OpenAI, Anthropic y Google (GOOGL ) fueron necesarios para centrar los esfuerzos y demostrar lo que la inteligencia artificial podía hacer. Esa fase funcionó. Las capacidades están bien entendidas. Pero al igual que la computación no se quedó centralizada, la inteligencia artificial no lo hará. Estamos entrando en la era de la PC — un ecosistema descentralizado donde los modelos más pequeños y especializados se ejecutan más cerca del trabajo.

Los datos de gasto ya reflejan esto. La inversión en inteligencia artificial empresarial se divide ahora casi equitativamente entre infraestructura y aplicaciones, y la participación de las aplicaciones crece más rápido. La expansión es lateral — a través de RRHH, legal, marketing, operaciones, finanzas — no vertical hacia modelos más grandes.

Para las startups que construyen en la capa de sistemas, esta es la oportunidad de una generación. En un mundo centralizado, el proveedor de modelos captura la mayoría del valor. En un mundo descentralizado, el valor migra a las empresas que resuelven la orquestación, el enrutamiento, la evaluación y la especialización — los desafíos operativos de implementar un ecosistema de modelo heterogéneo a escala.

Mi proyección es que aproximadamente el 25% de la inferencia de inteligencia artificial requerirá modelos de vanguardia. Esas empresas estarán bien — eso es un par de billones en TAM. Pero el 75% se ejecutará en modelos de código abierto y modelos de tareas especializados pequeños. Entrenamos un modelo de 4 mil millones de parámetros que superó a los modelos de vanguardia en una tarea de CRM específica, y es tan barato de ejecutar que es casi gratuito. Ese es el futuro — y necesita una capa de sistemas completamente nueva para gestionarlo.

La analogía se mantiene en todo: los proveedores de mainframe estuvieron bien, pero la creación de riqueza real ocurrió en el ecosistema de la PC. Lo mismo será cierto en la inteligencia artificial.

Mirando hacia adelante cinco años, ¿cree que los proveedores de modelos de vanguardia capturarán la mayoría del valor, o será que la mayoría del impacto económico provendrá de la orquestación, la optimización y los sistemas aplicados construidos alrededor de ellos?

Creo que el mercado de inferencia de inteligencia artificial será uno de los mercados más grandes en la historia del mundo. Eso significa que los laboratorios de modelos de vanguardia estarán increíblemente bien y todavía habrá oportunidades masivas para las empresas que construyen alrededor de ellos. Cuando tienes mercados de un billón de dólares, resolver pequeños casos de borde en esos mercados puede convertirse en empresas de mil millones de dólares.

Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar NeuroMetric AI, o pueden suscribirse al boletín de noticias Invertir en Inteligencia Artificial.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.