Finanțare
Pathway atrage o nouă finanțare la o valoare de 500 de milioane de dolari pentru a scala inteligența artificială post-Transformer

Compania de cercetare în domeniul inteligenței artificiale, Pathway, a obținut o finanțare suplimentară la o valoare de $500 de milioane, ajungând la o finanțare totală de 30 de milioane de dolari pentru runda de seed, pe măsură ce se pregătește să scaleze o nouă generație de modele construite în jurul arhitecturii sale post-Transformer.
Finanțarea include participarea unor investitori precum Id4 Ventures, TQ Ventures, Red Bridge Ventures, Kadmos Capital și WS Investment Co., brațul de investiții al Wilson Sonsini, alături de Jonathan Frankle, șeful științific al inteligenței artificiale de la Databricks. Pathway a declarat că o parte semnificativă a noii capitalurii va fi alocată pentru extinderea capacității de calcul, inclusiv sistemele NVIDIA GB300.
Investiția vine odată cu noi rezultate pentru modelul de raționament BDH-CQ al Pathway, oferind finanțării un context tehnic mai concret decât promisiunea din ce în ce mai frecventă de a construi simple modele de bază mai mari. Pathway declară că modelul său de 150 de milioane de parametri a obținut un scor de 29,5% pe setul de evaluare public ARC-AGI-1 la un cost de inferență calculat de aproximativ 0,0007 dolari pe sarcină.
Finanțarea vine pe măsură ce Pathway pariază împotriva scalării brute
O mare parte a cursei actuale pentru modelele de frontieră s-a concentrat pe scară: clusteri mai mari, mai multe date de antrenare, mai mulți parametri și cantități tot mai mari de computație la momentul testării. Pathway adoptă o abordare diferită, susținând că unele dintre limitările de cost și de memorie ale industriei sunt arhitecturale, și nu pot fi rezolvate în mod indefinit prin adăugarea de computație.
Această teză se află în centrul arhitecturii sale BDH, sau Dragon Hatchling. Pathway descrie BDH ca o arhitectură post-Transformer destinată să combine raționamentul, memoria și adaptarea în interiorul modelului însuși, și nu să se bazeze în primul rând pe o fereastră de context în expansiune sau sisteme de memorie externe.
Arhitectura se bazează pe idei care includ starea persistentă, activitatea rară, interacțiunile locale și ajustarea continuă. Pathway descrie proiectarea ca fiind inspirată biologic, și nu o încercare de a reproduce direct modul în care funcționează creierul.
Noile finanțări oferă companiei resurse suplimentare pentru a testa dacă aceste caracteristici continuă să se mențină pe măsură ce modelele BDH devin semnificativ mai mari.
Pathway adaugă, de asemenea, Adam Kurzrok în funcția de Director de Produs. Kurzrok a ocupat anterior funcția de Manager de Produs pentru Gemini la Google DeepMind și va conduce direcția produsului cu privire la ambalarea, evaluarea și implementarea modelelor bazate pe BDH.
Compania formalizează, de asemenea, un grup consultativ care include co-inventatorul Transformer, Łukasz Kaiser, Frankle, profesorul de la NYU, Martín Farach-Colton, și economistul Jacques Attali.
Ce BDH-CQ diferit
BDH-CQ este o extensie a arhitecturii BDH mai largi, proiectată în jurul învățării în context și al raționamentului latent recurent.
În loc să solicite modelului să exprime mult din raționamentul său intermediar sub formă de text generat, BDH-CQ efectuează calcule iterative într-un spațiu latent continuu. Exemplele furnizate în timpul inferenței actualizează o stare de memorie recurentă, după care sistemul rezolvă problema intern înainte de a decoda răspunsul său. Parametrii modelului rămân fixați în timpul acestui proces.
Aceasta contează deoarece raționamentul bazat pe tokenuri poate deveni scump pe măsură ce urmele de raționament se prelungesc. În abordările convenționale de lanț de gândire, pașii intermediari sunt generați secvențial și apoi reintroduși în etapele ulterioare ale procesului de raționament.
BDH-CQ este proiectat pentru a păstra mai multă parte a acestei computații în interiorul stării sale interne, și nu pentru a traduce în mod continuu raționamentul intermediar în limbaj.
Distincția nu înseamnă că raționamentul bazat pe limbaj este în mod inerent învechit. Mai degrabă, Pathway testează dacă unele sarcini de raționament pot fi gestionate mai eficient fără a necesita ca fiecare pas computațional intermediar să fie serializat ca text.
Rezultatele ARC-AGI pun eficiența costurilor în centrul atenției
Cel mai remarcabil rezultat care însoțește finanțarea vine de la ARC-AGI-1, o benchmark destinată să testeze dacă sistemele de inteligență artificială pot infera transformări dintr-un număr mic de exemple și aplica acele reguli la intrări nevizionate.
Modelul BDH-CQ de 150 de milioane de parametri al Pathway a obținut un scor de 29,5% la setul de evaluare public ARC-AGI-1.
Evaluarea tehnică estimează că fiecare sarcină a necesitat aproximativ 0,85 secunde de timp de procesare pe GPU H200, ceea ce corespunde unui cost calculat de aproximativ 0,0007 dolari pe sarcină la un cost de 3 dolari pe oră de GPU H200.
Pathway susține că acest lucru plasează BDH-CQ dincolo de frontiera Pareto a costului și acurateței raportate anterior pentru ARC-AGI-1.
Importanța nu constă în faptul că sistemul cu 150 de milioane de parametri are acum cel mai mare scor ARC absolut. Unele sisteme de raționament mai mari obțin scoruri mai mari. În schimb, Pathway se concentrează pe cât de multă performanță de raționament poate oferi modelul pentru fiecare dolar cheltuit pe inferență.
Acest lucru poate deveni din ce în ce mai important pe măsură ce întreprinderile mută inteligența artificială de la interacțiunile ocazionale cu chatbot-urile către agenți și alte sisteme care pot efectua un număr mare de operații de raționament în mod continuu.
Rezultatele tehnice arată, de asemenea, unde BDH-CQ se confruntă cu dificultăți
Evaluarea mai amplă prezintă o imagine mai nuanțată decât scorul de benchmark principal.
La ConceptARC, care separă problemele de raționament în categorii conceptuale diferite, performanța BDH-CQ a variat considerabil. A performant deosebit de bine la mai multe sarcini care implică extinderea granițelor și diferențierea regiunilor umplute de la cele neumplute, în timp ce zonele care implică copierea și ordonarea au fost mai dificile.
Experimentele controlate au produs un model similar.
Propagarea granițelor și copierea au rămas precise pe măsură ce aceste operații au fost extinse în interiorul gamei testate. Performanța a scăzut mai semnificativ pe măsură ce secvențele de ordonare au devenit mai lungi. Problemele relaționale încorporate au devenit, de asemenea, mai dificile odată ce adâncimea necesară a încorporării a crescut.
Cercetătorii au constatat, de asemenea, că furnizarea de demonstrații mai aproape de complexitatea problemei țintă a putut îmbunătăți semnificativ performanța în unele cazuri, sugerând că o parte a limitării se referă la cât de departe poate extrapola sistemul de la exemplele pe care le primește.
Slăbiciunile acestea contează deoarece ARC-AGI rămâne o benchmark de raționament vizual specializat. O eficiență a costurilor puternică pe ARC nu demonstrează că aceeași arhitectură poate depăși modelele de limbaj generalizate în sarcinile de producție.
În schimb, rezultatele oferă dovezi pentru o idee mai îngustă, dar posibil mai semnificativă: capacitățile de raționament sofisticat nu necesită întotdeauna număruri masive de parametri sau secvențe lungi de tokenuri de raționament generate.
Pathway construiește, de asemenea, infrastructură pentru inteligență artificială în timp real
Lucrarea Pathway precede împingerea sa către modele post-Transformer. În paralel cu BDH, compania dezvoltă un cadru de procesare a datelor destinat datelor de flux, analizei în timp real, aplicațiilor modelelor de limbaj și generării augmentate de recuperare.
Platforma este proiectată pentru a ajuta sistemele de inteligență artificială să lucreze cu informații care se schimbă continuu, și nu să se bazeze în întregime pe seturi de date statice sau pe indici reconstruiți periodic.
Fundalul infrastructurii se potrivește îndeaproape cu direcția de cercetare a Pathway. Tehnologia sa existentă se concentrează pe menținerea aplicațiilor de inteligență artificială sincronizate cu datele externe în schimbare, în timp ce BDH explorează dacă memoria persistentă și adaptarea pot deveni din ce în ce mai mult proprietăți ale arhitecturii modelului însuși.
Acest lucru poate conta pentru agenții de inteligență artificială și alte sisteme cu execuție lungă care trebuie să păstreze starea în timp ce reacționează la informații noi pe perioade prelungite.
Ce urmează pentru Pathway
Pathway intenționează să utilizeze noua capitală pentru a crește capacitatea modelului și a antrena sisteme BDH mai cuprinzătoare.
Drumul său include raționamentul matematic, ARC-AGI-2 și ARC-AGI-3, precum și dezvoltarea unui model de limbaj mare care incorporează raționamentul latent.
Compania declară că experimentele de pre-antrenare timpurie la scări care variază de la 1 miliard la 600 de miliarde de parametri au arătat un comportament de scalare similar cu cel al Transformer-ului, păstrând în același timp caracteristicile asociate cu abordarea de raționament latentă a BDH.
Acest lucru rămâne o indicație timpurie, și nu o dovadă că avantajele arhitecturii vor persista în modele generale și de mari dimensiuni.
Pathway vizează în cele din urmă domenii precum serviciile financiare, sănătatea și tehnologia, unde memoria persistentă, informațiile în schimbare și costurile de inferență ar putea deveni deosebit de importante pe măsură ce sistemele de inteligență artificială se îndreaptă către fluxuri de lucru cu execuție lungă.
Pentru moment, valoarea de 500 de milioane de dolari reprezintă o pariu semnificativ pe o alternativă la strategia de scalare dominantă a industriei. Testul mai important va veni pe măsură ce Pathway mută BDH dincolo de benchmark-urile de raționament relativ constrânse și demonstrează dacă avantajele sale arhitecturale persistă în limbaj, matematică, agenți și aplicații din lumea reală.












