AI 모델 및 플랫폼

포켓 사이즈 파워하우스: 마이크로소프트의 Phi-3, 휴대폰에 들어가는 언어 모델

mm
Unite.AI를 Google의 선호 소스에 추가

인공지능 분야는 빠르게 발전하고 있으며, 대형 모델이 주류를 이루고 있지만 마이크로소프트는 Phi-3 Mini와 같은 작은 언어 모델(SLM)에 다른 접근 방식을 취하고 있다. 이 모델은 3.8억개의 매개변수를 가지고 있으며, 언어 처리, 추론, 코딩, 수학 등 다양한 작업에서 대형 언어 모델(LLM)의 성능을 따라가며, 양자화(quantization)를 통해 모바일 기기에서 효율적으로 작동하도록 설계되었다.

대형 언어 모델의 도전

마이크로소프트의 Phi SLM 개발은 대형 언어 모델이 제기하는 도전에 대한 대응이다. 이러한 모델은 소비자 기기에 일반적으로 उपलब한 컴퓨팅 파워보다 더 많은 컴퓨팅 파워를 필요로 하며, 이는 사용자 기기에서 사용하기 어렵게 만들며, 훈련과 작동 중에 에너지 소비로 인한 환경 문제를 일으키고, 대형 및 복잡한 훈련 데이터셋으로 인해 편향을 지속시킬 수 있다. 이러한 요인들은 또한 모델의 실시간 응답성을 저하시키고 업데이트를 더 어려워질 수 있다.

Phi-3 Mini: 개인 기기에서 효율성과 개인 정보 보호를 강화한 AI

Phi-3 Mini는 개인 기기에서 고급 AI를 직접 통합하여 비용 효율적이고 효율적인 대안을 제공하도록 설계되었다. 이 설계는 더 빠르고 즉각적인 응답을 가능하게 하여 기술과의 사용자 상호작용을 강화한다.

Phi-3 Mini는 모바일 기기에서 고급 AI 기능을 직접 처리할 수 있으며, 이는 클라우드 서비스에 대한 의존도를 줄이고 실시간 데이터 처리를 강화한다. 이는 모바일 헬스케어, 실시간 언어 번역, 개인화된 교육 등 즉각적인 데이터 처리가 필요한 응용 프로그램에 중요하다. 모델의 비용 효율성은 운영 비용을 줄이는 데 도움이 되며, 다양한 산업에서 AI 통합의 잠재력을 확대한다. Phi-3 Mini는 로컬 기기에서 데이터 처리를 가능하게 하여 사용자 개인 정보 보호를 강화한다. 이는 개인 건강 및 금융 서비스와 같은 분야에서 민감한 정보를 관리하는 데 중요하다. 또한 모델의 낮은 에너지 요구 사항은 환경적으로 지속 가능한 AI 작동에 기여한다.

Phi의 설계 철학과 진화

Phi의 설계 철학은 교과서 학습(curriculum learning) 개념에 기반한다. 이 개념은 아이들이 점점 더 어려운 예제를 통해 학습하는 교육 접근 방식에서 영감을 얻었다. 주요 아이디어는 AI 훈련을 쉽은 예제부터 시작하여 훈련 데이터의 복잡성을 점진적으로 증가시키는 것이다. 마이크로소프트는 교과서에서 빌드된 데이터셋을 사용하여 이 교육 전략을 구현하였다. Phi 시리즈는 2023년 6월에 시작되었으며, 첫 번째 모델인 Phi-1은 1.3억개의 매개변수를 가지고 있었다. 이 모델은 파이썬 코딩 작업에서 특히 효과를 보여주었으며, 더 큰 모델을 능가하였다. 이 성공에 기반하여 마이크로소프트는 Phi-1.5를 개발하였으며, 이는 동일한 수의 매개변수를 가지고 있었지만, 일반적인 추론과 언어 이해 능력을 향상시켰다. 시리즈는 Phi-2의 출시와 함께 최고조에 달했다. Phi-2는 2.7억개의 매개변수를 가지고 있으며, 추론과 언어 이해 능력에서 뛰어난 성능을 보여주었다.

Phi-3 vs. 다른 작은 언어 모델

Phi-3 Mini는 Phi-2의 성과를 확대하여 다양한 산업 응용 분야에서 다른 작은 언어 모델을 능가한다. 이러한 모델로는 Google의 Gemma, Mistral의 Mistral, Meta의 Llama3-Instruct, GPT 3.5 등이 있다. Phi-3 Mini는 언어 이해와 추론, 일반 지식, 공통 감각 추론, 초등학교 수학 단어 문제, 의료 질문 응답 등에서 이러한 모델을 능가하는 성능을 보여주었다. Phi-3 Mini는 또한 아이폰 14에서 다양한 작업을 위해 오프라인 테스트를 거쳤다. 이를 위해 Phi-3 Mini는 1.8GB로 축소되었으며, 이는 32비트 부동 소수점 숫자를 더 комп팩트한 형식으로 변환하여 모델의 메모리 용량을 줄이고 처리 속도와 전력 효율성을 향상시킨다.

Phi-3 Mini와 Phi-2 Mini의 기능 비교

아래는 Phi-3와 Phi-2의 일부 기능을 비교한 것이다.

  • 모델 아키텍처: Phi-2는 트랜스포머 기반 아키텍처를 사용하며, 다음 단어를 예측하도록 설계되었다. Phi-3 Mini도 트랜스포머 디코더 아키텍처를 사용하며, Llama-2 모델 구조와 동일한 토크나이저를 사용한다. 이는 Llama-2를 위한 도구가 Phi-3 Mini와 함께 쉽게 사용할 수 있음을 의미한다.
  • 컨텍스트 길이: Phi-3 Mini는 8,000개의 토큰을 지원하는 반면, Phi-2는 2,048개의 토큰을 지원한다. 이는 Phi-3 Mini가 더 자세한 상호작용과 더 긴 텍스트를 처리할 수 있음을 의미한다.
  • 모바일 기기에서 로컬로 실행: Phi-3 Mini는 4비트로 압축되어 약 1.8GB의 메모리를 차지한다. 이는 Phi-2와 유사하며, 아이폰 14의 A16 비온ик 칩에서 테스트되었을 때 12개 이상의 토큰을 1초당 처리할 수 있었다.
  • 모델 크기: Phi-3 Mini는 3.8억개의 매개변수를 가지고 있으며, 이는 Phi-2의 2.7억개의 매개변수보다 크다. 이는 Phi-3 Mini의 능력의 증가를 반영한다.
  • 훈련 데이터: Phi-2는 1.4조개의 토큰으로 훈련되었으며, Phi-3 Mini는 3.3조개의 토큰으로 훈련되었다. 이는 Phi-3 Mini가 복잡한 언어 패턴을 더 잘 이해할 수 있음을 의미한다.

Phi-3 Mini의 제한 사항 해결

Phi-3 Mini는 작은 언어 모델의 영역에서重大한 발전을 보여주고 있지만, 제한 사항이 있다. Phi-3 Mini의 주요 제한 사항은 대형 언어 모델에 비해 상대적으로 작은 크기이며, 이는 광범위한 사실 지식을 저장하는 능력이 제한적임을 의미한다. 이는 Phi-3 Mini가 독자적으로 사실 데이터가 풍부한 쿼리를 처리하는 능력이 제한될 수 있음을 의미한다. 그러나 이 제한 사항은 검색 엔진과 통합하여 해결할 수 있다.这样하면 Phi-3 Mini는 더广泛한 정보에 실시간으로 접근할 수 있으며, 이는 사실 데이터에 대한 제한 사항을 보완할 수 있다.

가용성

Phi-3는 현재 여러 플랫폼에서 사용할 수 있다. 이는 마이크로소프트 Azure AI Studio, Hugging Face, Ollama를 포함한다. Azure AI에서 Phi-3는 배포-평가-세부 튜닝 워크플로우를 지원하며, Ollama에서 로컬로 실행할 수 있다. Phi-3는 ONNX Runtime과 Windows DirectML을 지원하므로 다양한 하드웨어에서 작동할 수 있다. 또한 Phi-3는 NVIDIA (NVDA ) NIM을 통해 마이크로 서비스로 제공되며, 표준 API를 통해 다양한 환경에서 쉽게 배포할 수 있다.

결론

마이크로소프트의 Phi-3 Mini는 휴대폰에서 사용할 수 있는 대형 언어 모델의 능력을 제공하여 인공지능 분야에서重大한 발전을 이루고 있다. 이 모델은 사용자와 기기 간의 상호작용을 빠르고 실시간으로 처리하며, 개인 정보 보호 기능을 강화한다. 클라우드 기반 서비스에 대한 필요성을 줄이고, 운영 비용을 감소시키며, 헬스케어 및 홈 오토메이션과 같은 분야에서 AI 응용의 범위를 확대한다. 교과서 학습을 통해 편향을 줄이고, 경쟁력 있는 성능을 유지하는 Phi-3 Mini는 효율적이고 지속 가능한 모바일 AI를 위한 주요 도구로 발전하고 있다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.