Finansowanie

Pathway Zabezpiecza Nowe Finansowanie O Wartości 500 Mln Dolarów, Aby Rozwinąć Sztuczną Inteligencję Poza Architekturą Transformer

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Firma badawcza Pathway zabezpieczyła dodatkowe finansowanie o wartości 500 milionów dolarów, zwiększając łączne finansowanie nasionkowe do 30 milionów dolarów, przygotowując się do rozwoju nowej generacji modeli opartych na swojej architekturze post-Transformer.

Finansowanie obejmuje udział Id4 Ventures, TQ Ventures, Red Bridge Ventures, Kadmos Capital oraz WS Investment Co., oddziału inwestycyjnego Wilson Sonsini, obok głównego naukowca AI w Databricks, Jonathana Frankle. Pathway powiedział, że znaczna część nowego kapitału zostanie wykorzystana na rozwinięcie pojemności obliczeniowej, w tym systemów NVIDIA GB300.

Inwestycja pojawia się wraz z nowymi wynikami dla modelu wnioskowania BDH-CQ Pathway, nadając finansowaniu bardziej konkretny techniczny kontekst niż coraz częstsze obietnice budowania coraz większych modeli podstawowych. Pathway mówi, że jego model o 150 milionach parametrów uzyskał wynik 29,5% w publicznym zestawie oceny ARC-AGI-1 przy szacowanym koszcie inferencji wynoszącym zaledwie 0,0007 dolara za zadanie.

Finansowanie Przypływa, Gdy Pathway Postawiło Na Alternatywę Dla Dominującej Strategii Skalowania

Większość bieżącej rywalizacji na froncie modeli skierowana jest na skalę: większe klastry, więcej danych szkoleniowych, więcej parametrów i rosnące ilości obliczeń w czasie testów. Pathway idzie w innym kierunku, twierdząc, że niektóre z ograniczeń kosztowych i pamięciowych branży są architektoniczne, a nie problemy, które można rozwiązać nieograniczenie przez dodawanie większej ilości obliczeń.

To założenie jest centralnym elementem jego architektury BDH, czyli Dragon Hatchling. Pathway opisuje BDH jako projekt post-Transformer, który ma połączyć wnioskowanie, pamięć i adaptację w ramach samego modelu, zamiast polegać głównie na rozwijającym się oknie kontekstowym lub zewnętrznych systemach pamięci.

Architektura opiera się na pomysłach, takich jak stan trwały, rzadka aktywność, lokalne interakcje i ciągłe dostosowanie. Pathway opisuje projekt jako inspirowany biologicznie, a nie próbę bezpośredniego odtworzenia, jak działa mózg.

Nowe finansowanie daje firmie dodatkowe środki, aby przetestować, czy te cechy nadal obowiązują, gdy modele BDH staną się znacznie większe.

Pathway dodaje również Adama Kurzroka jako Chief Product Officer. Kurzrok wcześniej pełnił funkcję menedżera produktu w Gemini w Google DeepMind i będzie kierował kierunkiem produktu wokół pakowania, oceny i wdrażania modeli opartych na BDH.

Firma formalizuje również grupę doradczą, w skład której wchodzą współwynalazca Transformer, Łukasz Kaiser, Frankle, profesor NYU Martín Farach-Colton oraz ekonomista Jacques Attali.

Co Wyróżnia BDH-CQ

BDH-CQ to rozwinięcie szerszej architektury BDH, zaprojektowanej wokół uczenia się w kontekście i wnioskowania latentnego.

Zamiast wymagania, aby model wyraził większość swego pośredniego wnioskowania jako wygenerowany tekst, BDH-CQ wykonuje iteracyjne obliczenia wewnątrz ciągłego latentnego obszaru roboczego. Przykłady podane podczas inferencji aktualizują stan pamięci, a następnie system wewnętrznie rozwiązuje nowy problem, zanim zdekoduje swoją odpowiedź. Parametry modelu pozostają niezmienne podczas tego procesu.

To ma znaczenie, ponieważ wnioskowanie oparte na tokenach może stać się drogie, gdy ślady wnioskowania wydłużają się. W konwencjonalnych podejściach łańcuchowych, pośrednie kroki są generowane sekwencyjnie, a następnie wprowadzane z powrotem do późniejszych etapów procesu wnioskowania.

BDH-CQ jest zaprojektowany tak, aby utrzymywać więcej obliczeń wewnątrz swego wewnętrznego stanu, zamiast ciągłego tłumaczenia pośrednich kroków wnioskowania na język.

Różnica nie oznacza, że wnioskowanie oparte na języku jest z natury przestarzałe. Pathway testuje raczej, czy niektóre obciążenia wnioskowania mogą być obsługiwane bardziej efektywnie bez wymagania, aby każdy pośredni krok obliczeniowy był seryjnie tłumaczony na język.

Wyniki ARC-AGI Umieszczają Efektywność Kosztową Na Środku

Najbardziej godny uwagi wynik towarzyszący finansowaniu pochodzi z ARC-AGI-1, benchmarku zaprojektowanego do testowania, czy systemy AI mogą wnioskować transformacje z niewielkiej liczby przykładów i stosować te reguły do niezobaczonych danych wejściowych.

Model BDH-CQ o 150 milionach parametrów uzyskał wynik 29,5% w publicznym zestawie oceny ARC-AGI-1.

Techniczna ocena szacuje, że każde zadanie wymagało około 0,85 sekundy czasu procesora NVIDIA H200, co odpowiada szacowanemu kosztowi około 0,0007 dolara za zadanie, przy założeniu kosztu H200 na poziomie 3 dolarów za godzinę GPU.

Pathway twierdzi, że to umieszcza BDH-CQ poza wcześniej zgłoszonym przedziałem kosztów a dokładnością dla ARC-AGI-1.

Znaczenie nie polega na tym, że system o 150 milionach parametrów ma teraz najwyższy bezwzględny wynik ARC. Niektóre większe systemy wnioskowania uzyskują wyższe wyniki. Pathway koncentruje się raczej na tym, jak wiele wydajności wnioskowania model może dostarczyć za każdy dolar wydatków na inferencję.

To może stać się coraz ważniejsze, gdy przedsiębiorstwa przenoszą sztuczną inteligencję z okazjonalnych interakcji z chatbotami w kierunku agentów i innych systemów, które mogą wykonywać dużą liczbę operacji wnioskowania w sposób ciągły.

Wyniki Techniczne Pokazują Także, Gdzie BDH-CQ Ma Trudności

Szeroka ocena przedstawia bardziej nuansowany obraz niż nagłówek benchmarku.

W ConceptARC, który dzieli problemy wnioskowania na różne kategorie pojęciowe, wyniki BDH-CQ znacznie się różniły. Wykonał szczególnie dobrze w kilku zadaniach związanych z rozszerzaniem granic i rozróżnianiem wypełnionych i nie wypełnionych obszarów, podczas gdy obszary związane z kopiowaniem i porządkowaniem okazały się trudniejsze.

Eksperymenty kontrolowane wykazały podobny wzorzec.

Propagacja granic i kopiowanie były dokładne, gdy te operacje były rozszerzane w ramach przetestowanych zakresów. Wyniki znacznie się pogorszyły, gdy sekwencje porządkowe stały się dłuższe. Zagadnienia relacyjne zagnieżdżone również stały się trudniejsze, gdy wymagana głębokość zagnieżdżania wzrosła.

Badacze stwierdzili również, że dostarczanie demonstracji bliżej złożoności docelowego problemu może znacznie poprawić wyniki w niektórych przypadkach, co sugeruje, że część ograniczenia dotyczy tego, jak daleko system może ekstrapolować z otrzymanych przykładów.

Te słabości mają znaczenie, ponieważ ARC-AGI pozostaje specjalistycznym benchmarkiem wnioskowania wizualnego. Silna efektywność kosztowa w ARC nie dowodzi, że ta sama architektura może przewyższyć modele językowe ogólnego przeznaczenia w produkcji.

Zamiast tego wyniki dostarczają dowodów na węższą, ale potencjalnie doniosłą ideę: zaawansowane możliwości wnioskowania mogą nie zawsze wymagać ogromnych liczb parametrów lub długich sekwencji wygenerowanych tokenów wnioskowania.

Pathway Buduje Także Infrastrukturę Dla Sztucznej Inteligencji W Czasie Rzeczywistym

Praca Pathway poprzedza jego wysiłki w kierunku modeli post-Transformer. Obok BDH firma rozwija ramę przetwarzania danych ukierunkowaną na strumieniowe dane, analitykę w czasie rzeczywistym, aplikacje dużych modeli językowych i generację wspomaganą przez odzyskiwanie.

Platforma jest zaprojektowana tak, aby pomóc systemom AI w pracy z informacjami, które ciągle się zmieniają, zamiast polegać wyłącznie na statycznych zestawach danych lub okresowo odbudowywanych indeksach.

Ten kontekst infrastrukturalny ściśle pasuje do kierunku badawczego Pathway. Ich istniejąca technologia koncentruje się na utrzymaniu aplikacji AI zsynchronizowanych z zmieniającymi się danymi zewnętrznymi, podczas gdy BDH bada, czy pamięć trwała i adaptacja mogą coraz częściej stawać się cechami samej architektury modelu.

To może mieć znaczenie dla agentów AI i innych długotrwałych systemów, które muszą utrzymywać stan, reagując na nowe informacje w ciągu dłuższego okresu.

Co Dalej Dla Pathway

Pathway zamierza wykorzystać nowy kapitał, aby zwiększyć pojemność modelu i przeszkolić bardziej wszechstronne systemy oparte na BDH.

Ich mapa drogowa obejmuje wnioskowanie matematyczne, ARC-AGI-2 i ARC-AGI-3, a także rozwój dużego modelu językowego z latentnym wnioskowaniem.

Firma mówi, że wczesne eksperymenty wstępne na skalach od 1 miliarda do 600 miliardów parametrów wykazały zachowanie skalowania podobne do Transformer, zachowując jednocześnie cechy związane z latentnym wnioskowaniem BDH.

To pozostaje wczesnym wskazaniem, a nie dowodem, że zalety architektury będą trwałe w dużych, ogólnych modelach.

Pathway koncentruje się ostatecznie na obszarach takich jak usługi finansowe, opieka zdrowotna i technologia, gdzie pamięć trwała, zmieniające się informacje i koszty inferencji mogą stać się szczególnie ważne, gdy systemy AI przechodzą do dłuższych workflow.

Na razie wycena na poziomie 500 milionów dolarów reprezentuje znaczące zaufanie do alternatywy dla dominującej strategii skalowania branży. Bardziej istotna próba nastąpi, gdy Pathway przeniesie BDH poza stosunkowo ograniczone benchmarki wnioskowania i pokaże, czy jego zalety architektoniczne będą trwałe w języku, matematyce, agentach i aplikacjach świata rzeczywistego.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.