사상 리더

생성적 AI의 미래는 에지에 있다

mm
Unite.AI를 Google의 선호 소스에 추가

ChatGPT와 일반적인 생성적 AI의 출현은 기술 역사상 중요한 사건으로, 인터넷과 스마트폰의 등장과 비교될 수 있다. 생성적 AI는 지능형 대화, 시험 통과, 복잡한 프로그램/코드 생성, 눈에 띄는 이미지와 비디오 생성 등 무한한 가능성을 보여주었다. 그러나 대부분의 생성적 AI 모델은 클라우드/데이터 센터에서 GPU로 실행되며, 이는 비용, 전력, 지연, 개인 정보 보호, 보안 등 여러 가지 요인으로 인해 장기적으로 확장할 수 없는 해결책이다. 이 기사에서는 이러한 요인과 생성적 AI 컴퓨팅 작업을 에지로 이동시키는 동기를 부여하는 예를 설명한다.

대부분의 애플리케이션은 높은 성능의 프로세서에서 실행되며, 이는 장치(예: 스마트폰, 데스크톱, 랩톱) 또는 데이터 센터에서 실행된다. AI를 사용하는 애플리케이션의 수가 증가함에 따라, CPU만 있는 이러한 프로세서는 불충분하다. 또한 생성적 AI 작업의 급격한 확장은 비싼 전력 소모가 많은 GPU가 있는 AI 지원 서버에 대한 수요를 급격히 증가시키고 있으며, 이는 인프라 비용을 증가시키고 있다. 이러한 AI 지원 서버의 비용은 일반 서버의 7배 이상일 수 있으며, GPU는 추가 비용의 80%를 차지한다.

또한, 클라우드 기반 서버는 500W에서 2000W의 전력을 소모하는 반면, AI 지원 서버는 2000W에서 8000W의 전력을 소모한다. 이는 4배 더 많은 전력 소모이다. 이러한 서버를 지원하기 위해 데이터 센터는 추가적인 냉각 모듈과 인프라 업그레이드가 필요하며, 이는 컴퓨팅 투자보다 더 높은 비용일 수 있다. 데이터 센터는 이미 1년 동안 300 TWH의 전력을 소모하고 있으며, 이는 전 세계 전력 소모의 1%에 해당한다. AI 채택이 계속되면, 2030년까지 데이터 센터가 전 세계 전력 소모의 5%를 차지할 수 있다. 또한, 생성적 AI 데이터 센터에 대한 투자가 급격히 증가하고 있다. 데이터 센터의 자본 지출은 2027년까지 500억 달러에 이를 것으로 예상되며, 이는 주로 AI 인프라 요구에 의해 주도된다.

데이터 센터의 전력 소모는 이미 300 TwH이며, 생성적 AI의 채택으로 인해 크게 증가할 것이다.

생성적 AI의 컴퓨팅 비용 및 에너지 소모는 대규모 채택을 방해할 것이다. 이러한 확장성 문제는 에지에서 AI 컴퓨팅을 이동시키고 AI 작업에 최적화된 처리 솔루션을 사용함으로써 해결할 수 있다. 이러한 접근 방식은 고객에게 지연, 개인 정보 보호, 신뢰성, 기능 증가 등 다양한 이점을 제공한다.

컴퓨팅은 데이터를 따라 에지로 이동한다

10년 전, AI가 학술 세계에서 등장한 이후, AI 모델의 훈련과 추론은 클라우드/데이터 센터에서 수행되어 왔다. 그러나 대부분의 데이터가 에지에서 생성되고 소모되므로(예: 비디오), 데이터의 추론을 에지로 이동시키는 것이 총 소유 비용(TCO)을 줄이는 데 도움이 된다. 클라우드의 AI 추론 비용은 반복되는 비용인 반면, 에지의 추론 비용은 일회성 하드웨어 비용이다. 본질적으로, 에지 AI 프로세서를 사용하여 시스템을 강화하면 전체 운영 비용을 낮출 수 있다. 전통적인 AI 작업과 마찬가지로 생성적 AI 작업도 에지로 이동할 것이다. 이는 기업과 소비자에게 상당한 비용 절감을 가져다줄 것이다.

에지로 이동하고 효율적인 AI 가속기를 사용하여 추론 함수를 수행하면 다른 이점도 있다. 가장 중요한 것은 지연이다. 예를 들어, 게임 애플리케이션에서, 비플레이어 캐릭터(NPC)를 제어하고 생성적 AI를 사용하여 강화할 수 있다. 에지 AI 가속기를 사용하여 게임 콘솔이나 PC에서 실행되는 대형 언어 모델(LLM)을 사용하면 게이머가 이러한 캐릭터에 특정 목표를 지정할 수 있다. 에지에서 로컬 추론의 낮은 지연으로 인해 NPC의 음성과 동작이 게이머의 명령과 행동에 실시간으로 반응할 수 있다. 이는 비용 효율적이고 전력 효율적인 방식으로高度 몰입형 게임 경험을 제공한다.

의료와 같은 애플리케이션에서, 개인 정보 보호와 신뢰성이 매우 중요하다(예: 환자 평가, 약물 추천). 데이터와 관련된 생성적 AI 모델은 환자 데이터를 보호하기 위해(개인 정보 보호) 및 클라우드의 네트워크 중단으로 인해 AI 모델에 액세스할 수 없는 경우가 있으므로 온프레미스에서 유지되어야 한다. 에지 AI 어플라이언스를 사용하여 각 기업 고객(이 경우 의료 제공자)에 맞게 구축된 생성적 AI 모델을 실행하면 개인 정보 보호와 신뢰성 문제를 해결할 수 있다. 또한 낮은 지연과 비용을 제공한다.

에지 디바이스上的 생성적 AI는 게임에서 낮은 지연을 보장하고, 의료에서 환자 데이터를 보호하고 신뢰성을 향상시킨다.

클라우드에서 실행되는 많은 생성적 AI 모델은 거의 1조 개의 매개 변수를 가질 수 있다. 이러한 모델은 일반적인 목적의 쿼리에 효과적으로 대응할 수 있다. 그러나 기업 특정 애플리케이션에서는 모델이 사용 사례에 관련된 결과를 제공해야 한다. 예를 들어, 패스트 푸드 레스토랑에서 주문 받는 생성적 AI 기반 어시스턴트를 구축하는 경우, 이 시스템은 레스토랑의 메뉴 항목, 알레르기, 성분을 알고 있어야 한다. 모델의 크기를 최적화하기 위해 대형 언어 모델(LLM)의 상위 집합을 사용하여 상대적으로 작은 10-30억 매개 변수 LLM을 훈련한 다음 고객 특정 데이터로 추가 微調整를 수행할 수 있다. 이러한 모델은 정확도와 기능이 향상된 결과를 제공할 수 있다. 또한 모델의 크기가 작기 때문에 에지의 AI 가속기에서 효과적으로 배포할 수 있다.

생성적 AI는 에지에서 승리한다

클라우드에서 실행되는 생성적 AI가 항상 필요할 것이다. 특히 ChatGPT나 Claude와 같은 일반적인 목적의 애플리케이션에서는 더욱 그렇다. 그러나 기업 특정 애플리케이션의 경우, Adobe Photoshop의 생성적 填充 또는 Github Copilot와 같은 생성적 AI는 에지에서 실행되는 것이 미래뿐만 아니라 현재이다. 이러한 것을 가능하게 하는 핵심은 목적을 위한 AI 가속기이다. 특히 기업 특정 애플리케이션에서 생성적 AI는 에지에서 실행되는 것이 미래뿐만 아니라 현재이다. 목적을 위한 AI 가속기는 이러한 것을 가능하게 한다. 생성적 AI는 에지에서 실행되는 것이 미래뿐만 아니라 현재이다. 목적을 위한 AI 가속기는 이러한 것을 가능하게 한다.

실리콘 밸리의 베테랑이자 Kinara Inc의 CEO인 Ravi Annavajjhala는 비즈니스 개발, 마케팅, 엔지니어링을 아우르는 20년 이상의 경험을 가지고 있으며, 최첨단 기술 제품을 개발하고 시장에 출시하는 역할을 수행해왔다. 현재 Deep Vision의 최고 경영자로서, Ravi는 이사회의 일원으로서 5,000만 달러를 조달하여 회사의 Ara-1 프로세서를 프리 실리콘에서 대량 생산으로, 그리고 2세대 프로세서인 Ara-2를 대량 생산으로 이끌었다. Deep Vision에 합류하기 전에, Ravi는 Intel과 SanDisk에서 경영 지도자직을 맡아 수익 성장, 전략적 제휴, 그리고 산업을 선도하는 최첨단 기능과 능력을 가진 제품 로드맵 개발을 주도하는 역할을 수행하였다.