Financiación

Deep Cogito recauda $43M Serie A para crear el motor de post‑entrenamiento para IA auto‑mejorable

mm
Añade Unite.AI a tus fuentes preferidas en Google

Deep Cogito ha recaudado una Serie A de $43 millones mientras el laboratorio de IA de San Francisco busca escalar una parte cada vez más importante de la pila de inteligencia artificial: lo que ocurre después de que un modelo de base ya ha sido pre‑entrenado.

La ronda fue liderada por TQ Ventures, con la participación de Benchmark, Nexus Venture Partners, Atreides Management, South Park Commons y la empresa de seguridad en la nube Zscaler, que es tanto cliente como inversor estratégico. La financiación eleva el total de fondos de Deep Cogito a más de $56 millones.

Fundada por Drishan Arora y Dhruv Malrana, que anteriormente trabajaron en los productos de IA de búsqueda de Google, incluidos AI Mode y AI Overviews, Deep Cogito apuesta a que los futuros avances en la inteligencia artificial provendrán cada vez más de mejores algoritmos de aprendizaje y de post‑entrenamiento, en lugar de simplemente ampliar los procesos de pre‑entrenamiento.

Eso sitúa a la compañía en una parte diferente de la carrera de IA respecto a los laboratorios que se centran principalmente en construir modelos de base cada vez más grandes desde cero.

Por qué Deep Cogito apuesta al post‑entrenamiento

El pre‑entrenamiento es responsable de proporcionar a un modelo de lenguaje extenso su base amplia de conocimientos al exponerlo a enormes cantidades de datos. El post‑entrenamiento, a su vez, moldea cómo ese modelo se comporta, razona, sigue instrucciones, usa herramientas y realiza tareas específicas.

La tesis de Deep Cogito es que esta segunda etapa tiene considerablemente más margen para evolucionar.

La investigación de la empresa se centra en el aprendizaje por refuerzo a gran escala y en métodos que permiten a los modelos mejorar progresivamente sus propias capacidades. En lugar de tratar un modelo pre‑entrenado como un producto casi terminado que necesita solo una alineación adicional, Deep Cogito lo ve como un punto de partida cuyas capacidades subyacentes pueden seguir desarrollándose.

Arora resumió la distinción al anunciar la ronda: “El pre‑entrenamiento le brinda a un modelo una enorme cantidad de conocimiento y capacidad. El post‑entrenamiento determina lo que ese modelo puede llegar a ser realmente”.

Esto es particularmente relevante a medida que la economía de simplemente escalar el pre‑entrenamiento se vuelve más exigente. Entrenar modelos de base de frontera requiere conjuntos de datos colosales, clústeres de GPU, infraestructura eléctrica y capital. Un sistema de post‑entrenamiento suficientemente eficaz podría extraer sustancialmente más inteligencia de un modelo existente sin repetir todo ese proceso.

Convertir razonamiento costoso en mejor intuición

En el centro de la investigación de Deep Cogito está Iterated Distillation and Amplification (IDA), un enfoque que la compañía presentó públicamente con su primer familia de modelos Cogito.

El concepto es relativamente sencillo aunque implementarlo a gran escala no lo es.

Durante la fase de amplificación, a un modelo se le otorgan cómputo adicional y técnicas que le permiten llegar a una respuesta más sólida de la que podría generar inmediatamente. La mejora resultante se destila de nuevo en los parámetros del modelo. Ese modelo mejorado se convierte en el punto de partida para otra iteración.

En lugar de requerir que el modelo realice un proceso de razonamiento cada vez más largo cada vez que se enfrenta a una pregunta difícil, el objetivo es internalizar gradualmente parte de lo que aprendió durante esos pasos de razonamiento más costosos computacionalmente.

Deep Cogito describe esto como mejorar la “intuición” de un modelo.

La distinción podría volverse importante para la economía de la inferencia. Las cadenas de razonamiento largas pueden mejorar la precisión, pero también aumentan el consumo de tokens, la latencia y el costo. Un modelo que haya internalizado mejores trayectorias de razonamiento podría alcanzar conclusiones similares con menos cómputo en tiempo de inferencia.

Los modelos Cogito proporcionan una prueba pública del enfoque

Deep Cogito ha estado usando su familia de modelos de peso abierto Cogito como campo de pruebas para estas técnicas.

Sus lanzamientos iniciales abarcaron de 3 mil millones a 70 mil millones de parámetros, antes de que la empresa ampliara la familia con modelos de 70 B, 109 B de mezcla de expertos (MoE), 405 B y 671 B MoE.

Con Cogito v2, la compañía informó que su modelo de 671 B generó cadenas de razonamiento aproximadamente un 60 % más cortas que DeepSeek R1 0528, manteniéndose competitivo en varias evaluaciones. Deep Cogito también señaló que gastó menos de $3,5 millones en total entrenando ocho modelos Cogito que van de 3 B a 671 B, aunque el rendimiento en benchmarks y las comparaciones de costos de entrenamiento no se traducen necesariamente de forma directa a la economía de producción.

La empresa siguió refinando el sistema con Cogito v2.1 671 B, que utiliza un modelo base de DeepSeek con licencia abierta que Deep Cogito luego post‑entrena internamente. Su lanzamiento de investigación v2.1 indica que el modelo emplea supervisión de procesos durante el razonamiento, con un entrenamiento diseñado para mejorar la capacidad del modelo de identificar rutas de razonamiento productivas en lugar de simplemente alentarlo a razonar durante más tiempo.

Esta progresión es importante para el argumento más amplio de Deep Cogito. La compañía no necesita demostrar que puede pre‑entrenar un modelo de base mejor que los laboratorios de IA más grandes. Necesita demostrar que su proceso de post‑entrenamiento puede convertir de forma constante modelos existentes fuertes en modelos más capaces.

Zscaler señala la oportunidad empresarial

El otro lado del negocio consiste en llevar esas técnicas de post‑entrenamiento más allá de los modelos Cogito de acceso público y aplicarlas a la IA empresarial.

En lugar de depender exclusivamente de un modelo de frontera de uso general, las empresas pueden entrenar potencialmente modelos especializados alrededor de sus datos propietarios, flujos de trabajo, criterios de evaluación y resultados deseados.

Eso puede ir considerablemente más profundo que la generación aumentada por recuperación (RAG), que típicamente brinda a un modelo general acceso a información externa de la empresa en tiempo de inferencia. El enfoque de Deep Cogito busca cambiar el propio modelo entrenando capacidades específicas de dominio directamente en sus pesos.

Zscaler ofrece un ejemplo temprano. La empresa de ciberseguridad comenzó como cliente de Deep Cogito antes de participar en la Serie A. Ambas compañías también han colaborado en inteligencia de seguridad especializada, con Deep Cogito argumentando que las aplicaciones de seguridad pueden beneficiarse de modelos post‑entrenados con los propios datos y resultados de seguridad de una organización.

La propuesta empresarial más amplia trata tanto de especialización como de control. La cobertura del Wall Street Journal sobre la financiación señala que Deep Cogito está posicionando su tecnología alrededor de modelos que las empresas pueden entrenar y poseer usando datos propietarios, en lugar de depender totalmente de sistemas de frontera cerrados.

Qué financiará la Serie A de $43 M

Deep Cogito planea usar la Serie A para ampliar su organización de investigación e ingeniería, incrementar la infraestructura informática disponible para entrenamientos a gran escala, desarrollar futuros modelos Cogito y trabajar con más empresas que busquen modelos especializados.

La infraestructura probablemente será una parte particularmente importante de esa expansión. Los propios materiales de contratación de Deep Cogito describen a investigadores trabajando en algoritmos novedosos de aprendizaje por refuerzo, canalizaciones de datos, evaluación e infraestructura distribuida mientras entrenan modelos que superan los 400 mil millones de parámetros.

Por lo tanto, la financiación brinda a la compañía una capacidad considerablemente mayor para probar si las mejoras demostradas con sus primeros modelos continúan a medida que aplica más cómputo y ejecuta más iteraciones de su proceso de post‑entrenamiento.

La implicación mayor: IA que aprende de su propio razonamiento

La mayor relevancia del trabajo de Deep Cogito es la posibilidad de que el desarrollo de IA pase de sistemas entrenados mayormente con datos generados por humanos a modelos que generen, evalúen e internalicen cada vez más sus propias mejoras.

Enfoques como Iterated Distillation and Amplification buscan convertir el razonamiento costoso en una capacidad duradera. Un modelo puede usar cómputo adicional para resolver problemas más difíciles y luego destilar esas ganancias de nuevo en sus pesos, creando un punto de partida más sólido para el próximo ciclo de entrenamiento.

Con el tiempo, esto podría producir un bucle de desarrollo de razonar, evaluar, aprender y mejorar.

Aún existe una brecha importante entre el post‑entrenamiento iterativo y la verdadera auto‑mejora recursiva. Los modelos necesitan evaluaciones fiables, objetivos diseñados cuidadosamente y salvaguardas contra la consolidación de errores. Pero incluso versiones limitadas de este enfoque podrían reducir la dependencia de corridas de pre‑entrenamiento cada vez más grandes y hacer que la IA especializada entrenada con datos propietarios de la empresa sea más práctica.

Si esa trayectoria continúa, la ventaja competitiva en IA podría depender menos exclusivamente de quién posee los clústeres de cómputo más grandes y más de qué modelos son los mejores para aprender de su propia experiencia.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.