AI 모델 및 플랫폼

미스트랄 AI: 오픈소스 공간에서 llama2를 넘어서는 새로운 벤치마크 설정

mm
Unite.AI를 Google의 선호 소스에 추가

대규모 언어 모델(LLM)은 최근 ChatGPT와 같은傑出한 성과로 주목을 받고 있습니다. เม타가 Llama 모델을 출시하면서 오픈소스 LLM에 대한 관심이 다시 높아졌습니다. 목표는 GPT-4와 같은 상위 모델과 같은 성능을 가진 경제적이고 오픈소스의 LLM을 생성하는 것입니다.

이러한 경제성과 효율성의 결합은 연구자와 개발자에게 새로운 기회를 제공하고 자연어 처리 기술의 발전에 새로운 시대를 열었습니다.

최근에 제너레이티브 AI 스타트업은 자금을 모금했습니다. 함께 2,000만 달러를 모금하여 오픈소스 제너레이티브 AI 모델을 구축하려고 합니다. Anthropic도 4.5억 달러를 모금했으며, Cohere는 Google (GOOGL ) Cloud와 파트너십을 맺고 2.7억 달러를 모금했습니다.

미스트랄 7B 소개: 크기 및 가용성

미스트랄 AI

미스트랄 AI는 파리에서 설립되었으며 Google의 DeepMind와 메타의 출신자들이 공동 설립했습니다. 첫 번째 대규모 언어 모델인 미스트랄 7B를 발표했습니다. 이 모델은 GitHub에서 쉽게 다운로드할 수 있으며 13.4GB의 토렌트를 통해도 다운로드할 수 있습니다.

이 스타트업은 제품을 출시하기 전에 기록적인 시드 자금을 모금했습니다. 미스트랄 7B는 7억개의 파라미터를 갖는 모델로 Llama 2 13B를 모든 테스트에서 능가하며 Llama 1 34B를 많은 지표에서 능가합니다.

다른 모델과 비교했을 때 미스트랄 7B는 유사하거나 더 나은 능력을 제공하지만 계산 오버헤드가 적습니다. 기초 모델인 GPT-4는 더 나은 성능을 제공할 수 있지만 더 높은 비용과 사용자 친화적이지 않습니다.

코딩 작업에서 미스트랄 7B는 CodeLlama 7B와 경쟁합니다. 또한 13.4GB의 크기로 표준 머신에서 실행할 수 있습니다.

또한 미스트랄 7B Instruct는 Hugging Face의 교육 데이터셋을 위해 특별히 조정되어 있습니다. MT-Bench에서 다른 7B 모델을 능가하며 13B 채팅 모델과 어깨를 나란히 합니다.

허깅페이스 미스트랄 AI 예시

허깅페이스 미스트랄 7B 예시

성능 벤치마크

미스트랄 7B의 성능을 분석한 결과, Llama 2 모델家族과 비교했을 때 미스트랄 7B가 모든 벤치마크에서 상당히 능가하는 것으로 나타났습니다. 실제로 Llama 34B의 성능과 일치하며 특히 코드와 推論 벤치마크에서 두드러졌습니다.

벤치마크는 공통 감각, 세계 지식, 독해 이해, 수학, 코드 등 여러 범주로 나누어졌습니다. 특히 주목할 점은 미스트랄 7B의 비용-성능 지표인 “등가 모델 크기”입니다. 推論과 이해와 같은 분야에서 미스트랄 7B는 Llama 2 모델 3배의 크기와 유사한 성능을 보여주며 메모리와 처리량의 잠재적인 절감을 의미합니다. 그러나 지식 벤치마크에서 미스트랄 7B는 Llama 2 13B와 일치하며 이는 파라미터 제한으로 인한 지식 압축의 영향일 수 있습니다.

미스트랄 7B 모델이 다른 언어 모델보다 나은 점은 무엇인가?

주의 메커니즘의 단순화

주의 메커니즘의 세부 사항은 기술적이지만 기본 아이디어는 비교적 간단합니다. 책을 읽고 중요한 문장을 강조하는 것과 유사하게 주의 메커니즘은 데이터 시퀀스의 특정 부분을 강조하거나 중요성을 부여합니다.

언어 모델의 경우, 이러한 메커니즘은 모델이 입력 데이터의 가장 관련된 부분에 집중할 수 있도록 하여 출력이 일관적이고 문맥적으로 정확합니다.

표준 트랜스포머에서 주의 점수는 다음 공식으로 계산됩니다.

트랜스포머 주의 공식

트랜스포머 주의 공식

이 공식의 핵심 단계는 Q와 K의 행렬 곱셈입니다. 이 과정은 계산적으로 집중적이며 시퀀스 길이가 증가할수록 행렬이 확장되어 느려집니다. 이는 표준 트랜스포머가 느려지는 주요 이유 중 하나입니다.

트랜스포머주의 메커니즘은 모델이 입력 데이터의 특정 부분에 집중할 수 있도록 합니다. 일반적으로 이러한 메커니즘은 ‘헤드’를 사용하여 주의를 관리합니다. 헤드가 많을수록 주의가 더 구체적이지만 복잡하고 느려집니다. 트랜스포머와 주의 메커니즘에 대해 더 자세히 알아보세요.

다중 쿼리 주의(MQA)는 속도를 높이기 위해 하나의 ‘키-값’ 헤드를 사용하지만 때때로 품질을 희생합니다. 이제, MQA의 속도와 다중 헤드 주의의 품질을 결합할 수 있을까요? 그곳이 그룹화된 쿼리 주의(GQA)가 등장하는 곳입니다.

그룹화된 쿼리 주의 (GQA)

그룹화된 쿼리 주의

그룹화된 쿼리 주의

GQA는 중간 지점입니다. 하나의 ‘키-값’ 헤드만 사용하는 것이 아니라 헤드를 그룹화합니다. 이렇게 하면 GQA는 다중 헤드 주의와 유사한 성능을 제공하지만 MQA의 속도를 제공합니다. 미스트랄과 같은 모델에서는 품질을 너무 많이 희생하지 않으면서 효율적인 성능을 제공합니다.

슬라이딩 윈도우 주의 (SWA)

롱포머 트랜스포머 슬라이딩 윈도우

슬라이딩 윈도우는 시퀀스 주의를 처리하는 또 다른 방법입니다. 이 방법은 각 토큰 주변에 고정된 크기의 주의 윈도우를 사용합니다. 여러 레이어가 이 윈도우 주의를 쌓으면 상위 레이어는 궁극적으로 전체 입력의 정보를 포함하는 더 넓은 관점을 얻습니다. 이는 합성곱 신경망(CNN)에서 볼 수 있는 수용野와 유사합니다.

한편, 롱포머 모델의 “확장 슬라이딩 윈도우 주의”는 개념적으로 슬라이딩 윈도우 방법과 유사하지만 QKT 행렬의 대각선만을 계산합니다. 이 변경으로 인해 메모리 사용량이 선형적으로 증가하여 더 긴 시퀀스를 처리할 수 있습니다.

미스트랄 AI의 투명성 vs. 분산화의 안전성 우려

미스트랄 AI는 “트릭이 없고, 독점 데이터가 없다”는 성명을 통해 투명성을 강조했습니다. 그러나 현재 उपलब한 유일한 모델인 ‘미스트랄-7B-v0.1’은 사전 훈련된 기본 모델이므로 모더레이션이 없이 어떤 쿼리에도 응답할 수 있습니다. 이는 잠재적인 안전성 우려를 야기합니다. GPT와 Llama와 같은 모델은 응답할 때를 판단하는 메커니즘을 가지고 있지만 미스트랄의 완전한 분산화는 악의적인 행위자에 의해 악용될 수 있습니다.

그러나 대규모 언어 모델의 분산화는 그 자체로 장점이 있습니다. 일부 사람들은 이를 악용할 수 있지만, 사람들은 이를 사회적善을 위해 활용할 수 있으며 모든 사람에게 지능을 제공할 수 있습니다.

배포 유연성

미스트랄 7B는 아파치 2.0 라이선스하에 제공됩니다. 이는 이를 사용하는 데 실제 장벽이 없다는 것을 의미합니다. 개인적 용도, 대기업, 또는 정부 기관에서 사용하더라도 올바른 시스템이 있으면 사용할 수 있습니다.

다른 라이선스例如 MIT 라이선스와 CC BY-SA-4.0 라이선스가 있지만 아파치 2.0 라이선스는 대규모 프로젝트에 강력한基础를 제공합니다.

최종 생각

미스트랄 7B와 같은 오픈소스 대규모 언어 모델의 등장은 AI 산업에서 중요한 변화를 의미합니다. 미스트랄 AI의 혁신적인 접근방식例如 그룹화된 쿼리 주의와 슬라이딩 윈도우 주의는 품질을 희생하지 않으면서 효율적인 성능을 제공합니다.

미스트랄의 분산화는 특정 도전을 제기하지만 유연성과 오픈소스 라이선스는 AI를 민주화하는 잠재력을 강조합니다. 이 분야가 발전함에 따라 이러한 모델의 힘과 윤리적 고려 및 안전 메커니즘의 균형에 대한焦點이 될 것입니다.

미스트랄의 다음 목표는 무엇일까요? 7B 모델은 단지 시작일 뿐입니다. 팀은 곧 더 큰 모델을 출시할 계획입니다. 이러한 새로운 모델이 7B의 성능과 일치한다면 미스트랄은 산업에서 빠르게 주요 플레이어로 부상할 수 있습니다. 모두 1년 내에 일어날 수 있습니다.

지난 5년 동안私は Machine Learning과 Deep Learning의 매혹적인 세계에 몰두해 왔습니다.私の熱情と専門知識は私を50以上의多様한 소프트웨어 엔지니어링 프로젝트에 기여하게 했으며, 특히 AI/ML에 중점을 두었습니다.私の継続的な 호기심은 또한私를自然어 처리로 끌어들였습니다.私は이 분야를さらに 탐구하기를熱望합니다.