AI 모델 및 플랫폼

AI 추론, 훈련이 아닌 다음 큰 엔지니어링 도전

mm
Unite.AI를 Google의 선호 소스에 추가

지난 10년 동안 인공 지능의 주목은 훈련에 집중되어 왔습니다. 주요 성과는 대규모 컴퓨팅 클러스터, 1조 매개변수 모델, 시스템을 “思考”하도록 가르치는 데에 투자된 수십억 달러에서 나왔습니다. 우리는 인공지능 개발을 주로 건설 프로젝트로 다루어 왔습니다. 지능의 고층 빌딩을 건설하는 것입니다. 그러나 이제 이 빌딩이 건설되었으므로 실제로 수백만 명이同時에 빌딩 내에서生活하고 운영할 수 있도록 하는 것이真正의 도전입니다. 이것은 AI 연구자와 엔지니어의 초점을 훈련(지능을 생성하는 행위)에서 추론(그것을 사용하는 행위)으로 이동시킵니다. 훈련은巨大한 일회성 자본 지출(CapEx)이지만, 추론은 계속적인 운영 비용(OpEx)입니다. 기업들이 24시간 동안 수백만 명의 사용자를 지원하는 에이전트를 배포할 때, 그들은 추론이 “훈련의 반대”가 아니라는 것을 발견합니다. 그것은 근본적으로 다른, 그리고 아마도 더 어려운 엔지니어링 도전입니다.

추론 비용이 왜 더 중요해졌는지

엔지니어링 도전을 이해하려면 먼저 기본적인 경제적 명령을 이해해야 합니다. 훈련 단계에서 비효율성이 용납될 수 있습니다. 훈련이 4주 대신 3주 걸린다면, 그것은 번거로움입니다. 그러나 추론에서 비효율성은 비즈니스에 대해 치명적일 수 있습니다. 예를 들어, 최전선 모델을 훈련시키는 데 1억 달러가 들 수 있습니다. 그러나 그 모델을 1일 1,000만 개의 쿼리에게回答하도록 배포하는 것은 몇 개월 내에 최적화되지 않으면 비용을 초과할 수 있습니다. 이것이 왜 추론 투자가 훈련 투자를 초과할 것으로 예상되는지 이해할 수 있습니다.

엔지니어에게 이것은 목표를 변경합니다. 우리는 더 이상 처리량(이巨大한 데이터 세트를 얼마나 빠르게 처리할 수 있는지)을 최적화하지 않습니다. 우리는 대기 시간(단일 토큰을 반환하는 데 얼마나 빠른지)과 동시성(하나의 GPU에서 얼마나 많은 사용자를 지원할 수 있는지)을 최적화합니다. 훈련 단계에서 지배적인 “무력” 접근 방식은 여기서 작동하지 않습니다. 메모리 대역폭이 병목이라면 더 많은 H100을 추가할 수 없습니다.

메모리 월: 실제 병목

LLM 추론에 대한鲜明하지 않은 진실은 컴퓨팅 능력에 의해 제한되는 경우가 드물고, 메모리에 의해 제한된다는 것입니다. 훈련 중에 우리는巨大한 배치로 데이터를 처리하여 GPU의 컴퓨팅 유닛을 완전히 사용합니다. 그러나 추론, 특히 실시간 응용 프로그램의 경우, 요청은 순차적으로 들어옵니다. 각 토큰을 생성하려면 모델이 그들의 매개변수를 높은 대역폭 메모리(HBM)에서 컴퓨팅 코어로 로드해야 합니다. 이것이 “메모리 월“입니다. 이것은 페라리 엔진(GPU 코어)이 교통 정체(제한된 메모리 대역폭)에 갇혀 있는 것과 같습니다.

이 도전은 엔지니어링 팀이 실리콘 수준에서 시스템 아키텍처를 재고하고 있습니다. 이것이 왜 Linear Processing Units(LPU)와 같은 Groq의 제품이나 Neural Processing Units(NPU)가 등장하는지 이해할 수 있습니다. 이러한 칩은 HBM 병목을 우회하여 칩 내에大量의 SRAM을 사용하여 메모리 액세스를 연속적인 데이터 흐름으로 처리합니다. 소프트웨어 엔지니어에게 이것은 “CUDA를 기본으로 사용하는” 시대가 끝났음을 의미합니다. 우리는 하드웨어를 이해하는 코드를 작성해야 합니다.

AI 효율성의 새로운 전선

하드웨어를 변경할 수 없는 경우, 엔지니어링의 새로운 전선은 소프트웨어 최적화에 있습니다. 여기서 일부 가장 혁신적인 성과가 발생하고 있습니다. 우리는 컴퓨터가 신경망을 구현하고 실행하는 방식을 재정의하는 기술의 부흥을 목격하고 있습니다.

  • 연속 배칭: 전통적인 배칭은 “버스”가 채워질 때까지 기다렸다가 출발합니다. 이것은 지연을 초래합니다. 연속 배칭(vLLM과 같은 프레임워크에서 처음 등장)은 지하철 시스템처럼 작동하여 새로운 요청이 각 반복에서 GPU 처리 열차에 합류하거나 하차할 수 있도록 합니다. 이것은 지연을 희생하지 않고 처리량을 최대화합니다. 이는 깊은 OS 수준의 전문 지식을 요구하는 복잡한 스케줄링 문제를 해결합니다.
  • 추측적 디코딩: 이 기술은 작은, 빠른,廉價한 모델을 사용하여 응답을 초안으로 작성하고, 더 큰, 더 느린, 더 강력한 모델이 이를 병렬로 검증합니다. 이것은 텍스트를 검증하는 것이 생성하는 것보다 훨씬 계산적으로廉價하다는 사실에 의존합니다.
  • 키-값 캐시 관리: 긴 대화에서 “히스토리”(키-값 캐시)는 빠르게 증가하여大量의 GPU 메모리를 소비합니다. 엔지니어들은 현재 “페이지드 어텐션”을 구현하고 있습니다. 이것은 운영 체제의 가상 메모리 페이지ング에서 영감을 받은 기술입니다. 이것은 메모리를 단편으로 나누고 비연속적으로 관리합니다.

에이전트 복잡성

표준 추론이 어려우면, 에이전트 AI는 그것을 지수적으로 더 어렵게 만듭니다. 표준 채팅봇은 무상태입니다. 사용자가 질문하면, AI가 대답하고, 프로세스가 끝납니다. 그러나 에이전트 AI는 루프를 가지고 있습니다. 그것은 계획을 세우고, 도구를 실행하고, 결과를 관찰하고, 반복합니다. 엔지니어링 관점에서 이것은 악몽입니다. 이 아키텍처 전환은 여러 기본적인 도전을 소개합니다:

  1. 상태 관리: 추론 엔진은 에이전트의 사고 프로세스의 “상태”를 여러 단계에 걸쳐 유지해야 합니다. 이것은 때때로 수분을 걸릴 수 있습니다.
  2. 무한 루프: 예측 가능한 전방 패스와는 달리, 에이전트는 이유에 대한 루프에 갇히게 될 수 있습니다. 확률적 코드에 대한 강력한 “와치독”과 “서킷 브레이커”를 엔지니어링하는 것은 전혀 새로운 분야입니다.
  3. 변동 컴퓨팅: 한 사용자의 쿼리는 단일 추론 호출을 트리거할 수 있지만, 다른 쿼리는 50개의 호출을 트리거할 수 있습니다. 각 요청이如此極端한 변동성을 가졌을 때 로드와 인프라를 관리하는 것은 완전히 새로운 클래스의 오케스트레이션 논리를 필요로 합니다.

우리는 본질적으로 “모델을 제공하는” 것에서 “인지 아키텍처를 오케스트레이팅하는” 것으로 이동하고 있습니다.

매일의 기기에 AI를 가져오기

마지막으로, 에너지와 네트워크 지연의 한계는 결국 추론을 에지로 이동시킬 것입니다. 우리는 모든 스마트 라이트 बल브, 자율 주행 자동차, 또는 공장 로봇이 데이터 센터를 통해 요청을 라우팅할 수를 기대할 수 없습니다. 여기서의 엔지니어링 도전은 압축입니다. 인터넷 전체에서 학습한 모델을 손가락 끝보다 작은 칩에, 배터리에서 동작하는 칩에 어떻게 맞출 수 있을까요?

양자화(16비트에서 4비트 또는 1비트로 精度를 줄임)와 모델 증류(작은 학생 모델이 큰 교사 모델을 모방하도록 가르침)와 같은 기술이 표준적인 관행이 되고 있습니다. 그러나 실제 도전은 이러한 모델을 안드로이드, iOS, 임베디드 리눅스, 사용자 정의 센서와 같은 수십억 개의 기기에 배포하는 것입니다. 각 기기는 자신의 하드웨어 제약조건을 가지고 있습니다. 이것은 모바일 개발의 “단편화 악몽”을 신경망의 복잡성으로 곱한 것입니다.

결론

우리는 생성적 AI의 “Day 2” 시대에 진입하고 있습니다. Day 1은 AI가 시를 쓸 수 있다는 것을 보여주는 것이었습니다. Day 2는 엔지니어링입니다. 그 능력을 더 신뢰할 수 있고, 经济적이고, 普及되도록 만드는 것입니다. 다음 10년을 정의할 엔지니어는 새로운 모델 아키텍처를 발명하는 사람들이 아닙니다. 그들은 시스템 엔지니어, 커널 해커, 그리고 인프라 아키텍트입니다. 그들은 1초에 10억 토큰을 제공하지 않고 전력 网을 녹이거나 회사를 파산시키지 않는 방법을 알아내야 합니다. AI 추론은 더 이상 단순한 런타임 세부 사항이 아닙니다. 그것은 제품입니다. 그리고 그것을 최적화하는 것이 다음 큰 엔지니어링 도전입니다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.