Finansiering

Deep Cogito samlar in $43M i Serie A för att bygga post‑träningsmotorn för självförbättrande AI

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Deep Cogito har samlat in en Serie A på 43 miljoner dollar då AI‑labbet i San Francisco vill skala en allt viktigare del av AI‑stacken: vad som händer efter att en grundmodell redan har förtränats.

Finansieringsrundan leddes av TQ Ventures, med deltagande från Benchmark, Nexus Venture Partners, Atreides Management, South Park Commons och molnsäkerhetsföretaget Zscaler, som både är kund och strategisk investerare. Finansieringen tar Deep Cogitos totala kapital till över 56 miljoner dollar.

Företaget grundades av Drishan Arora och Dhruv Malrana, som tidigare arbetat med Googles AI‑sökprodukter inklusive AI Mode och AI Overviews. Deep Cogito satsar på att framtida framsteg i AI‑intelligens i allt högre grad kommer från bättre inlärningsalgoritmer och post‑träning snarare än att bara göra förträningskörningar större.

Detta placerar företaget i en annan del av AI‑kapplöpningen än laboratorier som främst fokuserar på att bygga allt större grundmodeller från grunden.

Varför Deep Cogito satsar på post‑träning

Förtränning ger en stor språkmodell sin breda kunskapsbas genom att exponera den för enorma mängder data. Post‑träning formar sedan hur modellen beter sig, resonerar, följer instruktioner, använder verktyg och utför specifika uppgifter.

Deep Cogitos tes är att detta andra steg har betydligt mer utrymme att utvecklas.

Företagets forskning fokuserar på storskalig förstärkningsinlärning och metoder som låter modeller successivt förbättra sina egna förmågor. Istället för att betrakta en förtränad modell som ett i stort sett färdigt produkt som bara behöver viss justering, ser Deep Cogito den som en utgångspunkt vars underliggande kapaciteter kan fortsätta utvecklas.

Arora sammanfattade skillnaden när han tillkännagav rundan: “Förtränning ger en modell en enorm mängd kunskap och förmåga. Post‑träning avgör vad modellen faktiskt kan bli.”

Detta är särskilt relevant eftersom ekonomin kring att bara skala förtränning blir allt mer krävande. Att träna frontier‑grundmodeller kräver enorma datamängder, GPU‑kluster, kraftinfrastruktur och kapital. Ett tillräckligt effektivt post‑träningssystem skulle potentiellt kunna extrahera betydligt mer intelligens från en befintlig modell utan att upprepa hela processen.

Omvandla dyr resonemang till bättre intuition

Iterated Distillation and Amplification (IDA) står i centrum för Deep Cogitos forskning, en metod som företaget offentligt introducerade med sin första Cogito‑modellsfamilj.

Konceptet är relativt enkelt även om implementeringen i stor skala inte är det.

Under förstärkningsstadiet får en modell extra beräkningskraft och tekniker som gör att den kan nå ett starkare svar än vad den skulle generera omedelbart. Den resulterande förbättringen destilleras sedan tillbaka in i modellens parametrar. Den uppgraderade modellen blir utgångspunkten för en ny iteration.

Istället för att kräva att modellen utför en allt längre resonemangsprocess varje gång den möter en svår fråga, är målet att gradvis internalisera en del av det den lärde sig under de mer beräkningsintensiva resonemangsstegen.

Deep Cogito beskriver detta som att förbättra en modells “intuition”.

Distinktionen kan bli viktig för inferensekonomin. Långa resonemangskedjor kan förbättra noggrannheten, men de ökar också tokenförbrukning, latens och kostnad. En modell som har internaliserat bättre resonemangsbanor kan potentiellt nå liknande slutsatser med mindre beräkningstid under inferens.

Cogito‑modeller ger ett offentligt test av metoden

Deep Cogito har använt sin Cogito‑familj av öppna modeller som en testbädd för dessa tekniker.

De första utgåvorna sträckte sig från 3 miljarder till 70 miljarder parametrar, innan företaget utökade familjen med 70 B, 109 B mixture‑of‑experts (MoE), 405 B och 671 B MoE‑modeller.

Med Cogito v2 rapporterade företaget att deras 671 B‑modell producerade resonemangskedjor ungefär 60 % kortare än DeepSeek R1 0528 samtidigt som den förblev konkurrenskraftig i flera utvärderingar. Deep Cogito uppgav också att de spenderade mindre än 3,5 miljoner dollar totalt på att träna åtta Cogito‑modeller från 3 B till 671 B, även om benchmark‑prestanda och kostnadsjämförelser inte nödvändigtvis översätts direkt till produktions­ekonomi.

Företaget fortsatte att förfina systemet med Cogito v2.1 671 B, som använder en öppet licensierad DeepSeek‑basmodell som Deep Cogito sedan post‑tränade internt. Dess v2.1‑forskningsutgåva anger att modellen använder process‑övervakning under resonemang, med träning utformad för att förbättra modellens förmåga att identifiera produktiva resonemangsvägar snarare än att bara uppmuntra den att resonera längre.

Denna utveckling är viktig för Deep Cogitos bredare argumentation. Företaget behöver inte bevisa att de kan förträna en bättre grundmodell än de största AI‑labben. De måste visa att deras post‑träningsprocess konsekvent kan omvandla starka befintliga modeller till mer kapabla.

Zscaler pekar på företagsmöjligheten

Den andra sidan av verksamheten är att ta dessa post‑träningsmetoder bortom de offentligt släppta Cogito‑modellerna och tillämpa dem på företags‑AI.

Istället för att enbart förlita sig på en generell frontier‑modell kan företag potentiellt träna specialiserade modeller kring sin egen proprietära data, arbetsflöden, utvärderingskriterier och önskade resultat.

Detta kan gå betydligt djupare än retrieval‑augmented generation (RAG), som vanligtvis ger en generell modell tillgång till extern företagsinformation under inferens. Deep Cogitos metod syftar till att förändra själva modellen genom att träna domänspecifika förmågor i dess vikter.

Zscaler är ett tidigt exempel. Cybersäkerhetsföretaget började som kund till Deep Cogito innan de deltog i Serie A. Företagen har också samarbetat kring specialiserad säkerhetsintelligens, där Deep Cogito hävdar att säkerhetsapplikationer kan dra nytta av modeller som post‑tränats på en organisations egna säkerhetsdata och resultat.

Det bredare företagsförslaget handlar både om specialisering och kontroll. Wall Street Journals rapportering om finansieringen påpekar att Deep Cogito positionerar sin teknik kring modeller som företag kan träna och äga med hjälp av proprietär data, snarare än att vara helt beroende av slutna frontier‑system.

Vad de 43 M $ i Serie A kommer att finansiera

Deep Cogito planerar att använda Serie A för att expandera sin forsknings‑ och ingenjörsorganisation, öka den beräkningsinfrastruktur som finns tillgänglig för storskalig träning, utveckla framtida Cogito‑modeller och samarbeta med fler företag som söker specialiserade modeller.

Infrastruktur kommer sannolikt att vara en särskilt viktig del av den expansionen. Deep Cogitos egna rekryteringsmaterial beskriver forskare som arbetar med nya förstärkningsinlärningsalgoritmer, datapipelines, utvärdering och distribuerad infrastruktur medan de tränar modeller som överstiger 400 miljarder parametrar.

Finansieringen ger därför företaget avsevärt mer kapacitet att testa om de förbättringar som demonstrerats med deras tidiga modeller fortsätter när de tillför mer beräkning och kör fler iterationer av sin post‑träningsprocess.

Den större implikationen: AI som lär sig av sitt eget resonemang

Den större betydelsen av Deep Cogitos arbete är möjligheten att AI‑utveckling kan skifta från system som mestadels tränas på mänskligt genererad data till modeller som i allt högre grad genererar, utvärderar och internaliserar sina egna förbättringar.

Metoder som Iterated Distillation and Amplification syftar till att omvandla dyrt resonemang till bestående förmåga. En modell kan använda extra beräkning för att lösa svårare problem, för att sedan destillera dessa vinster tillbaka i sina vikter, vilket skapar en starkare utgångspunkt för nästa träningscykel.

Med tiden kan detta skapa en utvecklingsloop av resonera, utvärdera, lära och förbättra.

Det finns fortfarande ett stort glapp mellan iterativ post‑träning och sann rekursiv självförbättring. Modeller behöver pålitliga utvärderingar, noggrant utformade mål och skydd mot att förstärka misstag. Men även begränsade versioner av denna metod kan minska beroendet av ständigt större förträningskörningar och göra specialiserad AI som tränas kring proprietär företagsdata mer praktisk.

Om den utvecklingen fortsätter kan konkurrensfördelen inom AI bli mindre beroende av vem som har de största beräkningsklustren och mer av vem vars modeller är bäst på att lära sig av sin egen erfarenhet.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.