펀딩

패스웨이, 5억 달러 평가로 새로운 자금을 확보하여 포스트-트랜스포머 AI를 확대합니다

mm
Unite.AI를 Google의 선호 소스에 추가

AI 연구 회사 패스웨이(Pathway)는 5억 달러의 평가를 기준으로 새로운 자금을 확보하여 총 시드 자금을 3,000만 달러로 늘렸습니다. 이는 포스트-트랜스포머 아키텍처를 기반으로 하는 새로운 모델 세대를 확장하기 위한 준비입니다.

자금에는 Id4 Ventures, TQ Ventures, Red Bridge Ventures, Kadmos Capital, 및 WS Investment Co.가 참여했습니다. WS Investment Co.는 윌슨 소니시(Wilson Sonsini)의 투자 부문이며, 데이터브릭스(Databricks) 최고 AI 과학자 Jonathan Frankle도 참여했습니다. 패스웨이는 새로운 자금의 대부분을 컴퓨팅 능력 확장에 사용할 계획입니다. 이는 NVIDIA GB300 시스템을 포함합니다.

패스웨이의 자금은 BDH-CQ 이론 모델의 새로운 결과와 함께 도착했습니다. 이는 단순히 더 큰 기초 모델을 구축하는 것보다 더 구체적인 기술적 배경을 제공합니다. 패스웨이는 1.5억 파라미터 모델이 공공 ARC-AGI-1 평가 세트에서 29.5%의 점수를 얻었으며, 추론 비용은 약 0.0007 달러로 계산됩니다.

자금은 패스웨이가蛮力 스케일링에 대한 대안을 선택할 때 도착합니다

현재의 프론티어 모델 경쟁은 크기에 중점을 두고 있습니다. 더 큰 클러스터, 더 많은 훈련 데이터, 더 많은 파라미터, 더 많은 테스트 시간 컴퓨팅이 필요합니다. 패스웨이는 다른 접근 방식을 취하고 있습니다. 산업의 일부 비용과 메모리 제한은 아키텍처적인 문제라는 것을 주장합니다. 이러한 문제는 컴퓨팅 능력을 무한히 추가함으로써 해결될 수 없습니다.

이러한 가설은 패스웨이의 드래곤 해치링(Dragon Hatchling, BDH) 아키텍처의 중심입니다. 패스웨이는 BDH를 트랜스포머 이후 설계로 설명합니다. 이는 모델 자체 내에서 추론, 메모리, 적응을 결합하도록 설계되었습니다. 이는不断 확장되는 컨텍스트 창이나 외부 메모리 시스템에 의존하는 것보다 더 효율적입니다.

아키텍처는 지속적인 상태, 희박한 활동, 로컬 상호 작용, 지속적인 조정을 포함하는 아이디어를 기반으로 합니다. 패스웨이는 디자인을 생물학적으로 영감을 받은 것으로 설명합니다. 이는 뇌가 작동하는 방식을 직접 복제하려는 시도는 아닙니다.

새로운 자금은 패스웨이에게 BDH 모델을 더 크게 만드는 데 필요한 추가 자원을 제공합니다. 패스웨이는 BDH 모델의 특성이 더 크게 만들었을 때에도 지속되는지 테스트할 수 있습니다.

패스웨이는 또한 Adam Kurzrok을 제품 책임자로任命했습니다. Adam은 이전에 Google DeepMind의 Gemini에서 그룹 제품 책임자로 근무했습니다. 그는 BDH 기반 모델의 패키징, 평가, 배포를 위한 제품 방향을 이끌 것입니다.

패스웨이는 또한 Łukasz Kaiser, Frankle, NYU 교수 Martín Farach-Colton, 경제학자 Jacques Attali를 포함하는 자문위원회를 공식화했습니다.

BDH-CQ는 무엇이 다르나요?

BDH-CQ는 BDH 아키텍처의 확장입니다. 이는 문맥 내 학습과 반복적 잠재적 추론을 중심으로 설계되었습니다.

BDH-CQ는 중간 추론을 생성된 텍스트로 표현할 필요가 없습니다. 대신, 연속적인 잠재적 작업 공간 내에서 반복적인 계산을 수행합니다. 추론 중에 제공되는 예제는 반복적인 메모리 상태를 업데이트합니다. 시스템은 затем 내부적으로 새로운 문제를 해결한 후 답을 디코딩합니다. 모델의 파라미터는 이 과정에서 고정됩니다.

이는 중요합니다. 토큰 기반 추론은 추론 트레이스가 길어질수록 비용이 많이 들 수 있습니다. 전통적인 사슬 추론 접근 방식에서는 중간 단계가 순차적으로 생성되어 후속 추론 단계에 다시 입력됩니다.

BDH-CQ는 이러한 계산을 내부 상태 내에서 유지하도록 설계되었습니다. 이는 중간 추론을 언어로 번역하는 것을 피할 수 있습니다.

이 구별은 언어 기반 추론이 본질적으로 구식이라는 것을 의미하지 않습니다. 패스웨이는 일부 추론 작업이 토큰 기반 추론을 사용하지 않고도 더 효율적으로 처리될 수 있는지 테스트하고 있습니다.

ARC-AGI 결과는 비용 효율성을 중심으로 합니다

자금과 함께 발표된 가장 주목할 만한 결과는 ARC-AGI-1 벤치마크에서 나온 것입니다. ARC-AGI-1은 AI 시스템이 몇 가지 예제에서 변환을 추론하고 이러한 규칙을 보지 않은 입력에 적용할 수 있는지 테스트하는 데 설계되었습니다.

패스웨이의 1.5억 파라미터 BDH-CQ 모델은 공공 ARC-AGI-1 평가 세트에서 29.5%의 pass@2를 달성했습니다.

기술적 평가에 따르면 각 작업은 약 0.85초의 NVIDIA H200 GPU 시간이 필요했으며, 이는 H200의 비용이 1시간당 3달러라고 가정할 때 약 0.00070달러의 추론 비용에 해당합니다.

패스웨이는 이것이 BDH-CQ를 이전에 보고된 ARC-AGI-1의 비용-정확도 파레토 전선의 너머에 위치한다고 주장합니다.

의미는 1.5억 파라미터 시스템이 이제 가장 높은 절대 ARC 점수를 가지고 있는 것이 아니라는 것입니다. 일부 더 큰 추론 시스템은 더 높은 점수를 달성합니다. 패스웨이는 모델이 제공하는 추론 성능에 대한 비용에 중점을 두고 있습니다.

이것은 기업이 AI를 간헐적인 채팅봇 상호 작용에서 에이전트 및 기타 시스템으로 이동함에 따라 추론 작업을 연속적으로 수행하는 경우 특히 중요할 수 있습니다.

기술적 결과는 또한 BDH-CQ의 약점을 보여줍니다

더广泛한 평가에서는 더 미묘한 그림이 나타납니다.

ConceptARC에서 BDH-CQ의 성능은 개념적 범주에 따라 크게 달랐습니다. 경계 확장 및 채워진 영역과 채워지지 않은 영역을 구별하는 작업에서 잘 수행되었습니다. 그러나 복사 및 정렬과 관련된 영역에서는 더 어려웠습니다.

제어된 실험에서는 유사한 패턴이 나타났습니다.

경계 전파 및 복사는 테스트된 범위 내에서 정확하게 유지되었습니다. 순서가 더 길어지면 성능이 더 크게 저하되었습니다. 중첩 관계 문제도 중첩 깊이가 증가함에 따라 더 어려워졌습니다.

연구원들은 또한 목표 문제의 복잡도에 가까운 데모를 제공할 수 있다면 성능을 크게 개선할 수 있다는 것을 발견했습니다. 이는 시스템이 받은 예제에서 얼마나 멀리 외삽할 수 있는지와 관련된 제한이 부분적으로 있음을 시사합니다.

이 약점은 중요합니다. ARC-AGI는 여전히 전문적인 시각적 추론 벤치마크입니다. ARC에서 강한 비용 효율성은 동일한 아키텍처가 일반적인 언어 모델보다 생산성 워크로드에서 우수하다는 것을 보여주지 않습니다.

대신, 결과는 복잡한 추론 능력은 항상大量 파라미터 수 또는 생성된 추론 토큰의 긴 시퀀스를 필요로 하지 않는다는 Narrow하지만 잠재적으로 중요한 아이디어에 대한 증거를 제공합니다.

패스웨이는 또한 실시간 AI를 위한 인프라를 구축하고 있습니다

패스웨이의 작업은 포스트-트랜스포머 모델로의 推進 이전에 시작되었습니다. BDH와 함께, 회사는 스트리밍 데이터, 실시간 분석, 대규모 언어 모델 애플리케이션, 검색 보강 생성을 위한 데이터 처리 프레임워크를 개발하고 있습니다.

플랫폼은 정적 데이터 세트 또는 주기적으로 재구성된 인덱스에만 의존하는 대신 지속적으로 변경되는 정보와 함께 작동하는 AI 시스템을 지원하도록 설계되었습니다.

이 인프라 배경은 패스웨이의 더广泛한 연구 방향과密接하게 일치합니다. 기존 기술은 AI 애플리케이션이 변경되는 외부 데이터와 동기화되는 것을 중점으로 합니다. BDH는 지속적인 메모리와 적응이 모델 아키텍처 자체의 속성이 될 수 있는지 테스트합니다.

이것은 AI 에이전트 및 다른 장기 실행 시스템에서 중요할 수 있습니다. 이러한 시스템은 확장된 기간 동안 새로운 정보에 반응하면서 상태를 유지해야 합니다.

패스웨이의 다음 단계는 무엇인가?

패스웨이는 새로운 자금을 사용하여 모델 용량을 증가시키고 더广泛하게 능력 있는 BDH 기반 시스템을 훈련할 계획입니다.

로드맵에는 수학적 추론, ARC-AGI-2 및 ARC-AGI-3, 및 잠재적 추론을 포함하는 대규모 언어 모델의 개발이 포함됩니다.

회사는 초기 사전 훈련 실험에서 10억에서 600억 파라미터까지의 규모에서 Transformer와 유사한 확장 행동을 보인 반면 BDH의 잠재적 추론 접근 방식의 특성을 유지했습니다.

이것은 아직 초기적인 표시이며, 아키텍처의 장점이 큰 일반적인 모델에서 지속되는지에 대한 증거는 아닙니다.

패스웨이는 궁극적으로 금융 서비스, 헬스케어, 기술 등 영역을 목표로 합니다. 여기서 지속적인 메모리, 변경되는 정보, 추론 비용이 AI 시스템이 더 긴 워크플로우로 이동함에 따라 특히 중요해질 수 있습니다.

현재, 5억 달러의 평가에는 산업의 지배적인 확장 전략의 대안에 대한重大한 베팅이 포함됩니다. 더 중요한 테스트는 패스웨이가 BDH를 상대적으로 제한적인 추론 벤치마크를 넘어 언어, 수학, 에이전트, 실제 애플리케이션에서 아키텍처의 장점이 지속되는지 보여줄 때입니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.