AI 모델 및 플랫폼
신경 처리 유닛의 부상: 속도와 지속 가능성을 위한 온디바이스 생성적 AI 강화
생성적 AI의 진화는 단순히 컴퓨팅 장치와의 상호 작용과 경험을 재정의하는 것만이 아니라 핵심 컴퓨팅도 재정의하고 있습니다. 이 변환의 핵심 동인 중 하나는 제한된 컴퓨팅 자원을 갖는 장치에서 생성적 AI를 운영해야 하는 필요성입니다. 이 기사에서는 이러한 도전 과제를 제시하고 신경 처리 유닛(NPU)이 어떻게 이러한 도전 과제를 해결하는지에 대해 논의합니다. 또한 이 기사에서는 이 분야에서 선도적인 역할을 하는 최신 NPU 프로세서를 소개합니다.
온디바이스 생성적 AI 인프라의 도전 과제
생성적 AI는 이미지 합성, 텍스트 생성, 음악 작곡을 위한 강력한 컴퓨팅 자원을 요구합니다. 전통적으로 이러한 요구는 클라우드 플랫폼의 방대한 능력을 활용하여 충족되었습니다. 그러나 이 접근 방식은 온디바이스 생성적 AI에 대해 자신의 세트의 도전 과제를 가지고 있습니다. 즉, 끊임없는 인터넷 연결과 중앙 집중식 인프라에 대한 의존도가 높아지고 있습니다. 이 의존성은 지연, 보안 취약성, 에너지 소비의 증가를 초래합니다.
클라우드 기반 AI 인프라의 백본은 주로 중앙 처리 장치(CPU)와 그래픽 처리 장치(GPU)를 통해 생성적 AI의 컴퓨팅 요구를 처리합니다. 그러나 온디바이스 생성적 AI에 적용될 때 이러한 프로세서는 상당한 장애물에 직면합니다. CPU는 일반 목적의 작업을 위해 설계되었으며 생성적 AI 작업loads에 대한 효율적이고 저전력 실행을 위한 전문 아키텍처가 부족합니다. 제한된 병렬 처리 능력으로 인해 처리량이 감소하고 지연 시간이 증가하며 전력 소비가 증가하여 온디바이스 AI에 적합하지 않습니다.另一方面, GPU는 병렬 처리에 탁월하지만 주로 그래픽 처리 작업을 위해 설계되었습니다. 생성적 AI 작업을 효과적으로 수행하려면 GPU는 전문 통합 회로가 필요하지만 이는 높은 전력 소비와 열 발생을 초래합니다. 또한 대형 물리적 크기로 인해 소형 온디바이스 응용 프로그램에서 사용하기 어렵습니다.
신경 처리 유닛(NPU)의 부상
위의 도전 과제에 대응하여 신경 처리 유닛(NPU)은 온디바이스 생성적 AI를 구현하기 위한 변혁적 기술로 부상하고 있습니다. NPU의 아키텍처는 주로 인간 뇌의 구조와 기능, 특히 신경 세포와 시냅스가 정보를 처리하는 방식에서 영감을 받았습니다. NPU에서 인공 신경 세포는 기본 단위로 작용하며 생물학적 신경 세포와 유사하게 입력을 받고 처리하여 출력을 생성합니다. 이러한 신경 세포는 인공 시냅스에 의해 연결되며 신호를 신경 세포 간에 전달하며 학습 과정 중에 강度가 조정됩니다. 이는 뇌에서 시냅스 가중치 변경 과정을 모방합니다. NPU는 계층으로 구성되며 입력 계층, 중간 계층, 출력 계층이 있습니다. 입력 계층은 원시 데이터를 받고 중간 계층은 중간 처리를 수행하며 출력 계층은 결과를 생성합니다. 이 계층 구조는 뇌의 다단계 및 병렬 정보 처리 능력을 반영합니다. 생성적 AI도 유사한 인공 신경망 구조로 구성되므로 NPU는 생성적 AI 작업loads를 관리하기에 적합합니다. 이 구조적 정렬은 전문 통합 회로의 필요성을 줄여 더 컴팩트하고 에너지 효율적이며 빠르며 지속 가능한 솔루션을 제공합니다.
생성적 AI의 다양한 컴퓨팅需求에 대한 대처
생성적 AI는 이미지 합성, 텍스트 생성, 음악 작곡 등 다양한 작업을 포함하며 각 작업에는 고유한 컴퓨팅 요구가 있습니다. 예를 들어, 이미지 합성은 행렬 연산에 크게 의존하며 텍스트 생성은 순차적 처리를 포함합니다. 이러한 다양한 컴퓨팅 요구를 효과적으로 충족하기 위해 신경 처리 유닛(NPU)은 종종 시스템 온 칩(SoC) 기술과 함께 CPU와 GPU와 함께 통합됩니다.
각 프로세서는 고유한 컴퓨팅 강점을 제공합니다. CPU는 순차적 제어와 즉시성에 특히 적합하며 GPU는 병렬 데이터 스트리밍에 탁월합니다. NPU는 핵심 AI 작업에 최적화되어 스칼라, 벡터, 텐서 수학을 처리합니다. 이종 컴퓨팅 아키텍처를 활용하여 작업을 프로세서의 강점과 작업의 요구에 따라 할당할 수 있습니다.
NPU는 AI 작업에 최적화되어 있으므로 생성적 AI 작업을 주 CPU에서 효율적으로卸載할 수 있습니다. 이卸載는 빠르고 에너지 효율적인 작업을 보장하며 AI 추론 작업을 가속화하여 생성적 AI 모델이 장치에서 더 원활하게 실행될 수 있습니다. NPU가 AI 관련 작업을 처리하면 CPU와 GPU는 다른 기능에 리소스를 할당할 수 있어 전체 응용 프로그램 성능을 향상시키며 열 효율성을 유지합니다.
실제 세계의 NPU 예시
NPU의 발전은 속도를 내고 있습니다. 실제 세계의 NPU 예시는 다음과 같습니다:
- 퀄컴의 Hexagon NPU는 저전력 및 저자원 장치에서 AI 추론 작업을 가속화하기 위해 특별히 설계되었습니다. 텍스트 생성, 이미지 합성, 오디오 처리 등 생성적 AI 작업을 처리하도록 구축되었습니다. Hexagon NPU는 퀄컴의 Snapdragon 플랫폼에 통합되어 퀄컴 AI 제품이 있는 장치에서 신경망 모델을 효율적으로 실행합니다.
- 애플의 Neural Engine은 A 시리즈와 M 시리즈 칩의 핵심 구성 요소로, Face ID, Siri, 증강 현실(AR) 등 다양한 AI 기반 기능을 구동합니다. Neural Engine은 Face ID를 위한 얼굴 인식, Siri를 위한 자연어 처리(NLP), AR 애플리케이션을 위한 개체 추적 및 장면 이해를 가속화하여 애플 장치에서 AI 관련 작업의 성능을 크게 향상시키고 사용자에게 원활하고 효율적인 경험을 제공합니다.
- 삼성의 NPU는 AI 계산을 위한 전문 프로세서로, 동시에 수천 개의 계산을 처리할 수 있습니다. 최신 삼성 Exynos SoC에 통합되어 많은 삼성 전화에서 동작하며, 이 NPU 기술은 저전력, 고속 생성적 AI 계산을 가능하게 합니다. 삼성의 NPU 기술은 또한 플래그십 TV에 통합되어 AI 기반 사운드 혁신을 가능하게 하며 사용자 경험을 향상시킵니다.
- 화웨이의 Da Vinci 아키텍처는 화웨이의 Ascend AI 프로세서의 핵심으로, AI 컴퓨팅 파워를 향상시키기 위해 설계되었습니다. 이 아키텍처는 고성능 3D 큐브 컴퓨팅 엔진을 利用하여 AI 작업에 강력합니다.
결론
생성적 AI는 장치와의 상호 작용을 재정의하고 컴퓨팅을 재정의하고 있습니다. 제한된 컴퓨팅 자원을 갖는 장치에서 생성적 AI를 실행하는 도전 과제는 상당하며, 전통적인 CPU와 GPU는 종종 부족합니다. 신경 처리 유닛(NPU)은 전문 아키텍처로 생성적 AI의 요구를 충족하는 것으로 약속합니다. NPU를 시스템 온 칩(SoC) 기술과 함께 CPU와 GPU와 통합하여 각 프로세서의 강점을 활용할 수 있습니다. 이를 통해 더 빠르고 효율적이며 지속 가능한 AI 성능을 장치에서 달성할 수 있습니다. NPU가 계속 진화함에 따라 온디바이스 AI 능력을 강화하여 응용 프로그램을 더 반응성과 에너지 효율적으로 만들 것입니다.












