AI 모델 및 플랫폼

GPU 벽이 무너지고 있다: 포스트 트랜스포머 아키텍처의 보이지 않는 혁명

mm
Unite.AI를 Google의 선호 소스에 추가

과거 5년간 인공지능 산업은 사실상 하나의 단어와 동의어였다: 트랜스포머. 2017년 “Attention Is All You Need” 논문이 발표된 이후, 이 아키텍처는 분야를 지배했다. GPT에서 Claude까지 거의 모든 헤드라인을 장식하는 모델은 동일한 기본 메커니즘인 셀프 어텐션을 사용한다. 우리는 보통 더好的 인공지능으로 가는 길은 단순히 규모를 늘리는 것이라고 가정했다. 실제로 이는 더 큰 트랜스포머를 더 많은 데이터와 더 큰 GPU 클러스터에서 훈련하는 것을 의미한다.

이 믿음은 많은 혁신을 이끌어 냈지만, 이제 그 한계에 도달하고 있다. 우리는 “GPU 벽”에 부딪혔는데, 이는 원시적인 컴퓨팅 파워의 한계만이 아니라 메모리 대역폭과 경제적 지속 가능성의 한계이다. 세계는 1조 매개변수 모델 경쟁에 집중하는 동안, 연구실에서 근본적인 변革이 일어나고 있다. “포스트 트랜스포머 아키텍처”라는 새로운 물결이 현재 패러다임의 한계를 깨뜨리기 위해 등장하고 있다. 이 변革은 인공지능을 더 효율적이고 접근 가능하며 무한한 문脈에서 추론할 수 있게 할 것이다.

실리콘 천장: 트랜스포머가 벽에 부딛치는 이유

변화를 이해하기 위해, 우리는 먼저 현재 체제의 병목 현상을 이해해야 한다. 트랜스포머는 매우 강력하지만, 특정 방식으로 매우 비효율적이다. 그들의 핵심 능력은 “어텐션 메커니즘”에 있다. 이는 모델이 시퀀스 내의 모든 토큰을看着 모든 다른 토큰과의 관계를 계산할 수 있게 해준다. 이것이 그들에게 문脈을 매우 잘 이해하는 능력을 준다.

그러나 이 능력은 치명적인 결점을 가지고 있다. 즉, 제곱적 성장이다. 문서의 길이를 두 배로 늘리면, 계산 작업은 두 배가 아니라 네 배가 된다. 우리는 “무한한 문脈” 모델을 위해 노력하고 있는데, 이는 전체 도서관이나 코드베이스를 읽을 수 있는 모델이다. 그러나 계산 요구는 매우 높아진다.

그러나 더 즉각적인 문제는 메모리다. 특히 “KV 캐시“(키-값 캐시)이다. 트랜스포머는 유창한 텍스트를 생성하기 위해, GPU의 고속 메모리(VRAM)에 모든 것을 저장해야 한다. 대화가 길어질수록, 이 캐시는 불어나서,巨大한 양의 메모리를 소모한다.

이것이 “GPU 벽”을 만든다. 우리는 단순히 칩이 부족한 것이 아니라, 메모리 대역폭이 부족하다. 우리는 점점 더 큰 엔진을 구축하고 있지만, 그것을 구동하기 위해 필요한 연료가 부족하다. 오랜 시간 동안, 산업의 해결책은 단순히 더 많은 NVIDIA H100 (NVDA ) 을 구매하는 것이었다. 그러나 이蛮力적인 접근법은 점점 더 제한적이 된다. 우리는 더 큰 엔진이 아니라, 새로운 아키텍처가 필요하다.

보이지 않는 혁명

주류 연구가 대규모 언어 모델(LLM)에 집중하는 동안, 일부 연구자들은 오래된 아이디어를 재검토하고 있다: 순환 신경망(RNN)이다. 트랜스포머 이전에, RNN은 언어 처리의 표준이었다.它们는 텍스트를 순차적으로 처리했으며, 내부 상태를 업데이트했다.它们는 매우 효율적이었는데, 전체 역사를 다시 보지 않아도 되기 때문이다.

RNN은 장거리 의존성을 처리하지 못했고, 문장의 시작을 잊어버리기 때문에 실패했다. 또한 병렬화가 불가능해서 훈련이 느렸다. 트랜스포머는 이를 해결했는데, 모든 것을 동시에 처리하고 메모리에 저장함으로써 가능했다.

현재 우리는 두 세계의 최善을 결합한 아키텍처의 부흥을 목격하고 있다. 이러한 아키텍처는 상태 공간 모델로 알려져 있다.它们는 트랜스포머의 훈련 속도와 RNN의 추론 효율성을 제공한다.

이 새로운 물결의 대표적인 아키텍처 중 하나는 맴바이다. 2023년 후반에 발표되어 2024년을 통해 개선된 맴바는 모델이 정보를 처리하는 방식에 대한 근본적인 변화를 가져왔다. 트랜스포머와 달리, 맴바는 “선택적 상태 공간”을 사용한다.

트랜스포머와 맴바의 차이를 이해하기 위해, 트랜스포머를 모든 책을 열어놓은 거대한 책상에 앉은 학자로 생각해 보자. 맴바는 책을 한 번 읽고 핵심 내용을 효율적인 노트에 압축하는 학자이다. 맴바가 다음 단어를 생성할 때, 원본 텍스트를 다시 보지 않아도 된다. 대신, 압축된 상태를 본다.

이 차이는 인공지능 배포의 경제학을 바꾼다. 맴바와 유사한 아키텍처를 사용하면, 시퀀스의 길이가 늘어나도 계산 비용이 폭발적으로 증가하지 않는다.理论적으로, 이러한 모델에 1백만 단어의 문脈을 제공해도, 다음 토큰을 생성하는 비용은 10단어를 제공한 경우와 같다.

순환의 귀환

맴바의 기술적 혁신은 “선택성”이다. 이전의 RNN 현대화 시도는 너무僵硬해서 실패했다. 그것들은 중요하지 않은 정보와 노이즈를 구분하지 않고 모든 정보를 동일하게 압축했다. 맴바는 모델이 데이터를 스트리밍할 때, 중요하지 않은 정보와 노이즈를 구분할 수 있는 메커니즘을 도입했다.

모델이 중요한 정보를 받으면, 예를 들어 코드 블록의 변수 정의를 받으면, 모델은 “게이트”를 열고 상태에 강하게 저장한다. 모델이 노이즈나 불필요한 단어를 받으면, 모델은 게이트를 닫고 제한된 메모리 용량을 중요한 정보에만 사용한다.

이 선택성이 이전 RNN의 “잊어버리기” 문제를 효과적으로 해결한다. 많은 테스트에서, 맴바 기반 모델은 동일한 크기의 트랜스포머와 같은 성능을 발휘하지만, 추론 시 5배 빠르다. 더 중요한 것은, 메모리 용량이 훨씬 작다. 이는 높은 성능의 LLM이 이전에는 처리할 수 없다고 생각했던 장치에서 실행될 수 있게 한다. 예를 들어, 랩톱, 에지 컴퓨팅 네트워크, 또는 스마트폰에서 클라우드에 오프로드하지 않고도 실행할 수 있다.

우리는 또한 하이ENA라는 아키텍처의 부흥을 목격하고 있다. 하이ENA는 장거리 컨볼루션을 사용하여 데이터를 처리하는 亚二次 아키텍처이다. 맴바와 마찬가지로, 하이ENA는 트랜스포머의 무거운 “어텐션” 레이어를 제거하고 하드웨어에서 더싼 수학적 연산으로 대체한다. 이러한 모델은 이미 주요 리더보드에서 트랜스포머를 도전하고 있다.

하이브리드의 부흥

그러나 혁명은 트랜스포머의 완전한 대체가 아니라, 하이브리드 형태의 진화일 수 있다. 우리는 이미 잠바라는 모델의 등장을 목격하고 있다. 잠바는 트랜스포머 레이어와 맴바 레이어를 결합한다.

이 하이브리드 접근법은 트랜스포머의 한계를 해결하는 실용적인 방법을 제공한다. 트랜스포머는 특정 작업에 매우 강력하다. 예를 들어, 컨텍스트에서 정확한 세부 사항을 복사하는 작업이다. 맴바 레이어(데이터 처리와 장거리 메모리를 처리하는 역할)를 트랜스포머 어텐션 레이어(즉각적인 추론을 처리하는 역할)와 결합하면, 두 세계의 최善을 결합한 모델을 얻을 수 있다.

하이브리드 모델은 실제로 사용할 수 있는巨大한 컨텍스트 윈도우를 생성한다. 현재 많은 “장거리 컨텍스트” 트랜스포머는 100,000개의 토큰을 처리할 수 있다고 주장하지만, 컨텍스트가 채워질수록 성능이 급격히 저하된다. 이는 “중간에서 잃어버리기” 현상이다. 하이브리드 아키텍처는 장거리에서 일관성을 훨씬 더 잘 유지한다. 이유는 상태 공간 모델 레이어가 시간에 따라 상태를 압축하고 전달하도록 설계되었기 때문이다.

이러한 발전은 산업의 초점을 “훈련 컴퓨팅”에서 “추론 경제학”으로 바꾼다. 하이브리드 모델이 트랜스포머보다 10배 더 저렴한 비용으로 사용자에게 서비스를 제공할 수 있다면, 인공지능 애플리케이션의 비즈니스 모델은 하루아침에 바뀔 수 있다.

인공지능 배포의 미래

이 포스트 트랜스포머 혁명의 의미는 데이터 센터에만 국한되지 않는다. GPU 벽은 역사적으로 기술巨頭만이 빌딩하고 실행할 수 있는 상태였다. 그러나 맴바와 같은 효율적인 아키텍처는 이 힘을 민주화한다. 만약.consumer-grade 카드에서 GPT-4 수준의 모델을 실행할 수 있다면, 인공지능의 중앙 집중식 통제는 약해진다. 우리는 로컬, 프라이빗 인공지능 에이전트의 부흥을 볼 수 있다. 이러한 에이전트는 사용자의 컴퓨터에서 실행되며, 사용자의 프라이빗 데이터를 클라우드에 보내지 않고 처리한다.

또한, 이러한 효율성은 “에이전트 인공지능” 시스템을 실행하는 열쇠이다. 이러한 시스템은 복잡한 작업을 완료하기 위해 여러 시간 또는 일 동안 실행된다. 현재의 트랜스포머는 이러한 시스템을 실행하는 데 너무 비싸고 느리다. 효율적인 선형 시간 아키텍처는 연속적으로 실행될 수 있다.

결론

트랜스포머는 인공지능 헤드라인을 지배해 왔지만, 뒤에서 조용한 혁명이 진행되고 있다. GPU 벽은 연구자들이 메모리와 계산을 처리하는 방식을 재고하도록 강요하고 있다. 맴바와 하이브리드 모델을 포함한 포스트 트랜스포머 아키텍처는 효율성, 규모가 아니라, 다음 시대를 정의할 것이다. 이러한 혁신은巨大한 컨텍스트 윈도우를 실제로 사용할 수 있게 만들고, 추론을 더싼 비용으로 실행할 수 있게 할 것이다. 또한, 데이터 센터를 넘어서 고급 인공지능을 접근할 수 있게 할 것이다. 인공지능의 미래는 더 큰 모델이 아니라, 더智能한 모델이 기억하고, 추론하고, 효율적으로 확장하는 모델이다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.