Financování

Deep Cogito získává 43 milionů dolarů v sérii A na vývoj post‑tréninkového motoru pro samoučící se AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Deep Cogito získalo 43 milionů dolarů v sérii A, protože laboratoř AI ze San Franciska chce rozšířit stále důležitější část AI stacku: co se stane po tom, co byl základní model již předtrénován.

Financování vedl TQ Ventures, s účastí Benchmark, Nexus Venture Partners, Atreides Management, South Park Commons a společnosti pro cloudovou bezpečnost Zscaler, která je zároveň zákazníkem i strategickým investorem. Toto financování zvyšuje celkové investice Deep Cogito na více než 56 milionů dolarů.

Společnost založili Drishan Arora a Dhruv Malrana, kteří dříve pracovali na Googlových AI produktů pro vyhledávání, včetně AI Mode a AI Overviews. Deep Cogito sází na to, že budoucí zisky v inteligenci AI budou čím dál tím více pocházet z lepších učících algoritmů a post‑tréninku, než jen ze zvětšování rozsahu předtréninku.

To umisťuje společnost do jiné části závodu o AI než laboratoře, které se primárně zaměřují na budování stále větších základních modelů od nuly.

Proč Deep Cogito sází na post‑trénink

Předtrénink je zodpovědný za poskytnutí velkému jazykovému modelu široké základny znalostí tím, že jej vystavuje obrovskému množství dat. Post‑trénink pak formuje, jak se model chová, uvažuje, následuje instrukce, používá nástroje a vykonává konkrétní úkoly.

Teze Deep Cogito je, že tato druhá fáze má podstatně více prostoru k vývoji.

Výzkum společnosti se soustředí na velkorozměrové posilované učení a metody, které umožňují modelům postupně zlepšovat své vlastní schopnosti. Místo toho, aby se předtrénovaný model považoval za téměř dokončený produkt, který potřebuje jen drobné doladění, Deep Cogito jej vnímá jako výchozí bod, jehož základní schopnosti lze nadále rozvíjet.

Arora shrnul rozdíl při oznámení kola financování: „Předtrénink poskytuje modelu obrovské množství znalostí a schopností. Post‑trénink určuje, čím se model může skutečně stát.“

To je zvláště relevantní, protože ekonomika pouhého zvětšování předtréninku se stává náročnější. Trénování špičkových základních modelů vyžaduje obrovské datové sady, GPU clustery, energetickou infrastrukturu a kapitál. Dostatečně efektivní systém post‑tréninku by mohl potenciálně získat podstatně více inteligence ze stávajícího modelu, aniž by bylo nutné celý proces opakovat.

Přeměna nákladného uvažování na lepší intuici

V jádru výzkumu Deep Cogito stojí Iterativní destilace a zesílení (IDA), přístup, který společnost veřejně představila se první rodinou modelů Cogito.

Koncept je relativně jednoduchý, i když jeho nasazení ve velkém měřítku není.

Během fáze zesílení je modelu poskytnuta další výpočetní kapacita a techniky, které mu umožní dosáhnout silnější odpovědi, než by mohl okamžitě vygenerovat. Výsledné zlepšení je následně destilováno zpět do parametrů modelu. Tento vylepšený model se pak stane výchozím bodem pro další iteraci.

Místo toho, aby model musel pokaždé při setkání s obtížnou otázkou provádět stále delší řetězec uvažování, je cílem postupně internalizovat část toho, co se během těch nákladných uvažovacích kroků naučil.

Deep Cogito to popisuje jako zlepšení „intuice“ modelu.

Rozlišení by mohlo získat na významu pro ekonomiku inference. Dlouhé řetězce uvažování mohou zvyšovat přesnost, ale také spotřebu tokenů, latenci a náklady. Model, který si osvojil lepší uvažovací trajektorie, může dosáhnout podobných závěrů s menší výpočetní zátěží během inference.

Modely Cogito poskytují veřejný test přístupu

Deep Cogito používá svou rodinu otevřených modelů Cogito jako testovací platformu pro tyto techniky.

Počáteční verze se pohybovaly od 3 miliard až po 70 miliard parametrů, než společnost rozšířila rodinu o modely 70 B, 109 B mixture‑of‑experts (MoE), 405 B a 671 B MoE.

S Cogito v2 společnost uvedla, že její 671 B model vytvářel řetězce uvažování přibližně o 60 % kratší než DeepSeek R1 0528 a přitom zůstal konkurenceschopný v několika hodnoceních. Deep Cogito také uvedlo, že na trénování osmi modelů Cogito v rozmezí 3 B až 671 B vynaložilo méně než 3,5 milionu dolarů, i když srovnání výkonu a nákladů na trénink nemusí nutně přímo přenést do produkčních ekonomik.

Společnost pokračovala v dolaďování systému s modelem Cogito v2.1 671 B, který využívá otevřeně licencovaný základní model DeepSeek, jenž Deep Cogito následně post‑trénuje interně. Jeho výzkumné vydání v2.1 uvádí, že model během uvažování používá procesní supervizi, přičemž trénink je navržen tak, aby zlepšil schopnost modelu identifikovat produktivní uvažovací cesty, místo aby jej jenom nutil k delšímu uvažování.

Tento vývoj je důležitý pro širší argumentaci Deep Cogito. Společnost nemusí dokazovat, že dokáže předtrénovat lepší základní model než největší AI laboratoře. Musí prokázat, že její post‑tréninkový proces dokáže konzistentně proměnit silné existující modely v ještě schopnější.

Zscaler ukazuje na podnikatelskou příležitost

Druhá část podnikání spočívá v aplikaci těchto post‑tréninkových technik mimo veřejně vydané modely Cogito a jejich nasazení v podnikovém AI.

Místo spoléhaní výhradně na obecný špičkový model mohou společnosti potenciálně trénovat specializované modely kolem svých proprietárních dat, pracovních postupů, kritérií hodnocení a požadovaných výsledků.

To může jít mnohem hlouběji než retrieval‑augmented generation (RAG), který typicky poskytuje obecné modelu přístup k externím firemním informacím během inference. Přístup Deep Cogito usiluje o změnu samotného modelu tím, že do jeho vah trénuje doménově specifické schopnosti.

Zscaler poskytuje raný příklad. Tato společnost v oblasti kybernetické bezpečnosti začala jako zákazník Deep Cogito ještě před vstupem do série A. Obě firmy také spolupracovaly na specializované bezpečnostní inteligenci, přičemž Deep Cogito argumentuje, že bezpečnostní aplikace mohou těžit z modelů post‑trénovaných na vlastních bezpečnostních datech a výstupech organizace.

Širší podniková nabídka se týká jak specializace, tak kontroly. Zpráva Wall Street Journal o financování uvádí, že Deep Cogito pozicuje svou technologii kolem modelů, které firmy mohou trénovat a vlastnit pomocí proprietárních dat, místo aby zůstaly zcela závislé na uzavřených špičkových systémech.

Na co bude financována série A ve výši 43 milionu dolarů

Deep Cogito plánuje použít sérii A k rozšíření výzkumné a inženýrské organizace, zvýšení výpočetní infrastruktury pro velkorozměrový trénink, vývoji budoucích modelů Cogito a spolupráci s více podniky, které hledají specializované modely.

Infrastruktura bude pravděpodobně zvlášť důležitou součástí tohoto rozšíření. Interní materiály Deep Cogito popisují výzkumníky pracující na nových algoritmech posilovaného učení, datových pipelinech, hodnocení a distribuované infrastruktuře při tréninku modelů přesahujících 400 miliard parametrů.

Financování tak společnosti poskytuje podstatně větší kapacitu k testování, zda se zlepšení demonstrována v jejích raných modelech projeví i při nasazení větší výpočetní síly a více iteracích post‑tréninkového procesu.

Větší implikace: AI, která se učí ze svého vlastního uvažování

Větší význam práce Deep Cogito spočívá v možnosti, že vývoj AI by se mohl posunout od systémů trénovaných převážně na datech vytvořených lidmi k modelům, které čím dál tím více generují, hodnotí a internalizují vlastní vylepšení.

Přístupy jako Iterativní destilace a zesílení usilují o přeměnu nákladného uvažování na trvalou schopnost. Model může použít dodatečnou výpočetní kapacitu k řešení složitějších problémů a poté destilovat tyto zisky zpět do svých vah, čímž vytvoří silnější výchozí bod pro další tréninkový cyklus.

Postupem času by se tak mohl vytvořit vývojový cyklus: uvažovat, hodnotit, učit se a zlepšovat.

Stále existuje značná mezera mezi iterativním post‑tréninkem a skutečným rekurzivním samoučícím se procesem. Modely potřebují spolehlivé hodnocení, pečlivě navržené cíle a ochranné mechanismy proti posilování chyb. I omezené verze tohoto přístupu by však mohly snížit závislost na stále větších předtréninkových bězích a učinit specializované AI trénované na proprietárních podnicích datech praktičtějším.

Pokud tento trend bude pokračovat, konkurenční výhoda v AI může záviset méně výhradně na tom, kdo má největší výpočetní clustery, a více na tom, čí modely jsou nejlepší v učení se ze svých vlastních zkušeností.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.