Фінансування

Deep Cogito залучає $43 млн у раунді Series A для створення двигуна пост‑тренування самовдосконалюючого ШІ

mm
Додайте Unite.AI до бажаних джерел у Google

Deep Cogito залучила $43 млн у раунді Series A, оскільки лабораторія штучного інтелекту з Сан‑Франциско прагне масштабувати все більш важливу частину стеку штучного інтелекту: що відбувається після того, як фундаментальна модель вже була попередньо навчена.

Раунд очолювали TQ Ventures, за участю Benchmark, Nexus Venture Partners, Atreides Management, South Park Commons та компанії з хмарної безпеки Zscaler, яка є одночасно клієнтом і стратегічним інвестором. Це фінансування підвищує загальну суму інвестицій Deep Cogito до понад $56 млн.

Заснована Дрішаном Аророю та Дхрувом Малранаою, які раніше працювали над продуктами Google AI Search, включаючи AI Mode та AI Overviews, Deep Cogito робить ставку на те, що майбутні покращення інтелекту ШІ все більше будуть походити від кращих алгоритмів навчання та пост‑тренування, а не лише від збільшення масштабів попереднього навчання.

Це розташовує компанію в іншій частині змагання в галузі ШІ, ніж лабораторії, які зосереджені переважно на створенні все більших фундаментальних моделей з нуля.

Чому Deep Cogito робить ставку на пост‑тренування

Попереднє навчання забезпечує великий мовний модель широкою базою знань, піддаючи її величезним обсягам даних. Пост‑тренування ж формує, як модель поводиться, міркує, слідує інструкціям, використовує інструменти та виконує конкретні завдання.

Теза Deep Cogito полягає в тому, що цей другий етап має значно більше простору для розвитку.

Дослідження компанії зосереджені на масштабному підкріплювальному навчанні та методах, які дозволяють моделям поступово покращувати свої власні можливості. Замість того, щоб розглядати попередньо навчену модель як майже завершений продукт, що потребує лише додаткового вирівнювання, Deep Cogito сприймає її як стартову точку, здатну й надалі розвиватися.

Арора підсумував різницю під час оголошення раунду: «Попереднє навчання дає моделі величезну кількість знань і можливостей. Пост‑тренування визначає, якою ця модель може стати насправді».

Це особливо актуально, оскільки економіка простого масштабування попереднього навчання стає дедалі вимогливішою. Навчання передових фундаментальних моделей вимагає величезних наборів даних, GPU‑кластерів, енергетичної інфраструктури та капіталу. Достатньо ефективна система пост‑тренування могла б потенційно витягнути значно більше інтелекту з існуючої моделі без повторення всього процесу.

Перетворення дорогих міркувань у кращу інтуїцію

У центрі досліджень Deep Cogito знаходиться ітеративна дистиляція та підсилення (IDA), підхід, який компанія вперше представила публічно разом зі своєю першою сім’єю моделей Cogito.

Концепція досить проста, хоча її масштабна реалізація не є такою.

Під час етапу підсилення моделі надаються додаткові обчислення та методи, які дозволяють їй отримати більш сильну відповідь, ніж вона могла б згенерувати одразу. Отримане покращення потім дистилюється назад у параметри моделі. Оновлена модель стає стартовою точкою для наступної ітерації.

Замість того, щоб вимагати від моделі виконання все довших процесів міркування щоразу, коли вона стикається зі складним питанням, мета — поступово інтерналізувати частину того, чого вона навчилася під час цих більш обчислювально дорогих кроків міркування.

Deep Cogito описує це як покращення «інтуїції» моделі.

Ця різниця може стати важливою з точки зору економіки інференції. Довгі ланцюги міркувань підвищують точність, але й збільшують споживання токенів, затримку та вартість. Модель, яка інтерналізувала кращі траєкторії міркування, може досягати подібних висновків з меншими обчислювальними ресурсами під час інференції.

Моделі Cogito забезпечують публічне випробування підходу

Deep Cogito використовує свою сім’ю відкритих моделей Cogito як випробувальне середовище для цих технологій.

Початкові випуски варіювалися від 3 мільярдів до 70 мільярдів параметрів, після чого компанія розширила сімейство моделями 70B, 109B mixture-of-experts (MoE), 405B та 671B MoE.

З Cogito v2 компанія повідомила, що її модель 671B генерує ланцюги міркувань приблизно на 60 % коротші, ніж DeepSeek R1 0528, залишаючись конкурентоспроможною за кількома оцінками. Deep Cogito також зазначила, що витратила менше $3,5 млн у сумі на навчання восьми моделей Cogito від 3B до 671B, хоча порівняння продуктивності та вартості навчання не обов’язково безпосередньо відображають економіку виробництва.

Компанія продовжила удосконалювати систему з Cogito v2.1 671B, яка використовує відкриту ліцензійну базову модель DeepSeek, яку Deep Cogito потім пост‑тренувала в межах компанії. Її дослідницький випуск v2.1 повідомляє, що модель застосовує контроль процесу під час міркування, а навчання спрямоване на покращення здатності моделі виявляти продуктивні траєкторії міркування, а не просто заохочувати її до довшого міркування.

Цей прогрес важливий для ширшого аргументу Deep Cogito. Компанії не потрібно доводити, що вона може попередньо навчити кращу фундаментальну модель, ніж найбільші лабораторії ШІ. Потрібно продемонструвати, що її процес пост‑тренування може послідовно перетворювати потужні існуючі моделі у більш здатні.

Zscaler вказує на можливості для підприємств

Інша сторона бізнесу — застосування цих технік пост‑тренування не лише до публічно випущених моделей Cogito, а й до корпоративного ШІ.

Замість того, щоб покладатися виключно на загальнопризначену передову модель, компанії можуть потенційно навчати спеціалізовані моделі на основі власних даних, робочих процесів, критеріїв оцінки та бажаних результатів.

Це може бути значно глибше, ніж генерація з доповненням пошуку (RAG), яка зазвичай надає загальній моделі доступ до зовнішньої інформації компанії під час інференції. Підхід Deep Cogito спрямований на зміну самої моделі шляхом навчання доменно‑специфічних можливостей у її вагах.

Zscaler є раннім прикладом. Компанія з кібербезпеки спочатку була клієнтом Deep Cogito, а потім взяла участь у раунді Series A. Обидві компанії також співпрацювали над спеціалізованою безпековою розвідкою, причому Deep Cogito стверджує, що безпекові застосунки можуть виграти від моделей, пост‑тренованих на власних даних та результатах безпеки організації.

Стаття Wall Street Journal про фінансування зазначає, що Deep Cogito позиціонує свою технологію навколо моделей, які бізнес може навчати та володіти, використовуючи власні дані, а не залишатися повністю залежним від закритих передових систем.

На що підуть $43 млн Series A

Deep Cogito планує використати інвестиції Series A для розширення дослідницької та інженерної команди, збільшення обчислювальної інфраструктури, доступної для масштабного навчання, розробки майбутніх моделей Cogito та співпраці з більшою кількістю підприємств, які шукають спеціалізовані моделі.

Інфраструктура, ймовірно, буде особливо важливою частиною цього розширення. У власних матеріалах з набору персоналу Deep Cogito описує дослідників, які працюють над новими алгоритмами підкріплювального навчання, конвеєрами даних, оцінюванням та розподіленою інфраструктурою під час навчання моделей, що перевищують 400 мільярдів параметрів.

Тому фінансування надає компанії значно більшу спроможність протестувати, чи продовжуватимуться покращення, продемонстровані в її ранніх моделях, коли вона застосовуватиме більше обчислювальних ресурсів і проведе більше ітерацій процесу пост‑тренування.

Глибша інтерпретація: ШІ, який навчається на власному міркуванні

Велике значення роботи Deep Cogito полягає в можливості, що розвиток ШІ може перейти від систем, навчених переважно на даних, створених людьми, до моделей, які все більше генерують, оцінюють і інтерналізують власні покращення.

Підходи, такі як ітеративна дистиляція та підсилення, прагнуть перетворити дорогі міркування у стійкі можливості. Модель може використати додаткові обчислення для розв’язання складніших задач, а потім дистилювати ці здобутки назад у свої ваги, створюючи міцнішу стартову точку для наступного циклу навчання.

З часом це може створити цикл розвитку: міркувати, оцінювати, вчитися та вдосконалюватись.

Проте між ітеративним пост‑тренуванням і справжнім рекурсивним самовдосконаленням ще існує суттєвий розрив. Моделям потрібні надійні оцінки, ретельно розроблені цілі та захисти від закріплення помилок. Однак навіть обмежені версії цього підходу можуть знизити залежність від все більших попередніх навчань і зробити спеціалізований ШІ, навчений на власних даних підприємства, більш практичним.

Якщо ця динаміка продовжиться, конкурентна перевага в ШІ може залежати менш виключно від того, хто має найбільші обчислювальні кластери, а більше від того, чиї моделі найкраще навчаються на власному досвіді.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.