AI 모델 및 플랫폼
마이크로소프트의 Phi-3 미니: 경량화된 AI 모델, 자신의 크기 이상의 성능
마이크로소프트는 최근에 최신 경량화된 언어 모델인 Phi-3 미니를 발표했습니다. 이는 컴팩트한 AI 모델의 트리오를 시작으로, 상태-of-the-아트 성능을 제공하면서도 제한된 컴퓨팅 리소스를 갖춘 장치에서 효율적으로 실행될 수 있는 크기로 설계되었습니다. 3.8억개의 매개변수로 구성된 Phi-3 미니는 GPT-4와 같은 AI 거인보다 훨씬 작지만 많은 주요 영역에서 그들의 능력을 따라갈 수 있습니다.
Phi-3 미니의 개발은 고급 AI 능력을 더 넓은 하드웨어 범위에서 접근할 수 있도록 함으로써 중요한 이정표를 나타냅니다. 그 작은 크기로 인해 스마트폰, 태블릿, 및 기타 에지 장치에서 로컬로 배포될 수 있으며, 클라우드 기반 모델과 관련된 대기 시간 및 개인 정보 보호 문제를 극복할 수 있습니다. 이는 가상 어시스턴트, 대화형 AI, 코딩 어시스턴트, 언어 이해 작업 등 다양한 영역에서 지능형 온-디바이스 경험의 새로운 가능성을 열어줍니다.
아키텍처 및 훈련
Phi-3 미니의 핵심은 트랜스포머 디코더 모델로, 오픈 소스 Llama-2 모델과 유사한 아키텍처를 기반으로 합니다. 32개의 레이어, 3072개의 히든 차원, 32개의 어텐션 헤드, 및 기본 컨텍스트 길이 4,000 토큰을 특징으로 합니다. 마이크로소프트는 또한 LongRope와 같은 기술을 사용하여 컨텍스트 길이를 128,000 토큰으로 확장하는 Phi-3 미니-128K라는 긴 컨텍스트 버전을 도입했습니다.
Phi-3 미니를 구별하는 것은 그 훈련 방법론입니다. 거대한 데이터셋과 컴퓨팅 파워에만 의존하는 것이 아니라, 마이크로소프트는 고품질의 이성적인 훈련 데이터셋을 구축하는 데 중점을 두었습니다. 이 데이터는 필터링된 웹 데이터와 더 큰 언어 모델에 의해 생성된 합성 데이터로 구성됩니다.
훈련 프로세스는 두 단계로 구성됩니다. 첫 번째 단계에서는 모델에 다양한 웹 소스를 노출하여 일반적인 지식과 언어 이해를 가르칩니다. 두 번째 단계에서는 더욱 필터링된 웹 데이터와 합성 데이터를 결합하여 논리적인 추론 능력과 전문 분야의 전문 지식을 부여합니다.
마이크로소프트는 이 접근 방식을 “데이터 최적화 체제”라고 부르며, 많은 대형 언어 모델에서 사용되는 전통적인 “컴퓨팅 최적화 체제” 또는 “과훈련 체제”와는 다릅니다. 목표는 모델의 규모에 맞는 훈련 데이터를 조정하여 적절한 수준의 지식과 추론 능력을 제공하면서 다른 능력에 대한 여유 공간을 남겨두는 것입니다.
이 데이터 중심 접근 방식은 Phi-3 미니가 다양한 학술 벤치마크에서 뛰어난 성능을 발휘하는 데 성공적으로 작용했습니다. 예를 들어, MMLU 벤치마크에서 69%, MT-bench에서 8.38의 점수를 얻었습니다. 이는 Mixtral 8x7B 및 GPT-3.5와 같은 더 큰 모델과 비교할 수 있는 결과입니다.
안전성 및 강건성
마이크로소프트는 Phi-3 미니의 개발에서 안전성 및 강건성에 강한 중점을 두었습니다. 모델은 엄격한 사후 훈련 과정을 거쳤으며, 감독된 미세 조정(SFT) 및 직접 선호도 최적화(DPO)가 포함됩니다.
SFT 단계에서는 다양한 도메인에 걸쳐高度로 필터링된 데이터를 사용하여 모델의 능력을 강화하고 윤리적인 행동을 강화합니다. DPO 단계에서는 원치 않는 행동을 피하기 위해 거부된 응답을 부정적인 예시로 사용합니다. 이 프로세스는 채팅 형식 데이터, 추론 작업, 및 책임 있는 AI(RAI) 노력을 다루며, Phi-3 미니가 마이크로소프트의 윤리적이고 신뢰할 수 있는 AI 원칙을 준수하도록 합니다.
さらに, Phi-3 미니는 광범위한 적색 팀 테스트 및 자동화된 테스트를 거쳐, 수십 개의 RAI 유해 카테고리를 다룹니다. 마이크로소프트의 독립적인 적색 팀은 모델을 반복적으로 조사하여 개선할 영역을 식별하고, 추가적인 데이터셋과 재훈련을 통해 이를 해결했습니다.
이 다각적인 접근 방식은 유해한 응답, 사실적인 부정확성, 및 편향의 발생을 크게 줄였습니다. 이는 마이크로소프트의 내부 RAI 벤치마크에서 입증되었습니다. 예를 들어, 모델은 유해한 콘텐츠 연속성(0.75%) 및 요약(10%)에서 낮은 결함률을 나타내며, 또한 주어진 컨텍스트에서 응답이 확고하게 기반을 두고 있음을 나타내는 낮은 비기반성(0.603)을 보입니다.
응용 및 사용 사례
Phi-3 미니의 뛰어난 성능과 강건성으로 인해, 다양한 응용 분야에서 특히 리소스가 제한된 환경과 지연 시간에 민감한 시나리오에서 유용합니다.
가장 흥미로운 가능성 중 하나는 모바일 장치에 지능형 가상 어시스턴트와 대화형 AI를 직접 배포하는 것입니다. 로컬에서 실행되면, 이러한 어시스턴트는 네트워크 연결 없이 즉각적인 응답을 제공할 수 있으며, 또한 민감한 데이터가 장치에 남아 있으므로 개인 정보 보호 문제를 해결할 수 있습니다.
Phi-3 미니의 강력한 추론 능력은 또한 코딩 지원과 수학 문제 해결에서 귀중한 자산을 제공합니다. 개발자와 학생들은 온-디바이스 코드 완성, 버그 감지, 및 설명을 통해 개발 및 학습 과정을 간소화할 수 있습니다.
이러한 응용 분야를 넘어서, 모델의 다용도성은 언어 이해, 텍스트 요약, 및 질문 응답과 같은 분야에서 기회를 열어줍니다. 그 작은 크기와 효율성으로 인해, Phi-3 미니는 다양한 장치와 시스템에 AI 능력을 통합하는 데 매력적인 선택이 됩니다.
미래를 향한 전망: Phi-3 Small 및 Phi-3 Medium
Phi-3 미니는 자체적으로卓越한 성과를 거두었지만, 마이크로소프트는 Phi-3 패밀리의 더 큰 모델을 계획하고 있습니다. 이미 2개의 더 큰 모델, Phi-3 Small(7억 매개변수) 및 Phi-3 Medium(14억 매개변수),를 미리 공개했습니다. 이 모델들은 컴팩트한 언어 모델의 성능 경계를 확장할 것으로 예상됩니다.
예를 들어, Phi-3 Small은 더 발전된 토크나이저(tiktoken)와 그룹화된 쿼리 어텐션 메커니즘, 및 새로운 블록스PARSE 어텐션 레이어를 사용하여 메모리 풋프린트를 최적화하면서도 긴 컨텍스트 검색 성능을 유지합니다. 또한 다국어 데이터를 10% 더 포함하여, 여러 언어에서 언어 이해와 생성 능력을 향상합니다.
Phi-3 Medium은 규모에서 상당한 발전을 나타내며, 40개의 레이어, 40개의 어텐션 헤드, 및 5,120개의 임베딩 차원을 특징으로 합니다. 마이크로소프트는 일부 벤치마크에서 훈련 데이터 혼합의 추가적인 개선이 필요할 수 있음을 언급하지만, 초기 결과는 Phi-3 Small보다 MMLU, TriviaQA, 및 HumanEval과 같은 작업에서 상당한 개선을 보여줍니다.
한계 및 미래 방향
Phi-3 미니는 언어 모델답게 한계가 있습니다. 가장 주목할 만한 약점 중 하나는 사실적인 지식 저장 능력이 상대적으로 제한적이라는 것입니다. 이는 TriviaQA와 같은 벤치마크에서 낮은 성능으로 나타납니다.
그러나 마이크로소프트는 이 한계를 검색 엔진 능력으로 보완하여 모델이 관련 정보를 필요에 따라 검색하고 추론할 수 있도록 할 수 있다고 믿습니다. 이는 Hugging Face Chat-UI에서 보여지며, Phi-3 미니가 검색을 사용하여 응답을 향상시킬 수 있습니다.
또 다른 개선 영역은 모델의 다국어 능력입니다. Phi-3 Small은 초기 단계에서 다국어 데이터를 포함했지만, 컴팩트한 모델의 전체 잠재력을 위해 추가적인 작업이 필요합니다.
마이크로소프트는 Phi 패밀리의 모델을 지속적으로 발전시키고, 그들의 한계를 해결하며, 능력을 확장하고 있습니다. 이는 훈련 데이터 및 방법론의 추가적인 개선, 및 컴팩트한 고성능 언어 모델을 위한 새로운 아키텍처 및 기술의 탐색을 포함할 수 있습니다.
결론
마이크로소프트의 Phi-3 미니는 고급 AI 능력의 민주화에 있어 중요한 발전입니다. 상태-of-the-아트 성능을 제공하면서도 리소스 효율적인 패키지로, 다양한 응용 분야에서 지능형 온-디바이스 경험의 새로운 가능성을 열어줍니다.
모델의 혁신적인 훈련 접근 방식은 데이터의 품질과 추론 능력을 강조하며, Phi-3 미니가 자신의 크기 이상의 성능을 발휘하도록 합니다. 강건한 안전성 조치와 지속적인 개발 노력과 결합하여, Phi-3 패밀리의 모델은 지능형 시스템의 미래를 형성하는 데 중요한 역할을 할 것입니다. 이는 AI를 더 접근하기 쉽고, 효율적이고, 신뢰할 수 있게 만듭니다.
기술 산업은 AI의 가능성의 경계를 계속해서 확장하고 있습니다. 마이크로소프트의 경량화된 고성능 모델에 대한 헌신은, “큰 것이 항상 더 좋다”는 전통적인 지혜에서 벗어난 것입니다. Phi-3 미니는 지능형 데이터 큐레이션, 사고 있는 모델 디자인, 및 책임 있는 개발 관행을 통해 AI의 가치와 영향을 최대화하는 데 중점을 둔 새로운 혁신의 물결을 영감을 줄 수 있습니다.












