AI 모델 및 플랫폼
가장 강력한 오픈 소스 LLM: 메타 LLAMA 3.1-405B
LLAMA 3.1-405B, 메타 AI에서 개발한 모델은 오픈 소스 언어 모델에서 큰 발전을 나타낸다. 405억 개의 매개변수를 가지고 있어 현재까지 공개된 가장 큰 언어 모델이며, 일부 벤치마크에서 가장 先進的な 사유 모델을 능가한다.
주요 기능:
- 405억 개의 매개변수
- 128K 토큰 컨텍스트 길이
- 다국어 지원 (8개 언어)
- 명령어 튜닝 버전 사용 가능
- 오픈 소스로许可证가 附随
이러한 강력한 모델을 오픈 소스 도메인에서 공개하는 것은 게임 체인저이며, 최첨단 AI 기능에 대한 접근성을 민주화하고 산업 전반에서 혁신을 촉진한다.
모델 아키텍처 및 훈련
이 과정은 입력 텍스트 토큰을 토큰 임베딩으로 변환하는 것으로 시작한다. 이러한 임베딩은 여러 레이어의 셀프 어텐션과 피드포워드 네트워크를 통해 전달되어 모델이 텍스트 내의 복잡한 관계와 의존성을 캡처할 수 있도록 한다. 자동 회귀 디코딩 메커니즘은 출력 텍스트 토큰을 생성하여 프로세스를 완료한다.

-
그룹 쿼리 어텐션 (GQA)
LLAMA 3.1은 그룹 쿼리 어텐션을 사용하며, 이는 이전에 완전히 다루지 않은 중요한 최적화 기술이다. 자세히 살펴보자:
그룹 쿼리 어텐션 (GQA)은 다중 헤드 어텐션의 변형으로, 특히 긴 시퀀스에서 계산 비용과 메모리 사용량을 줄이는 것을 목표로 한다. LLAMA 3.1 405B 모델에서 GQA는 8개의 키-값 헤드를 사용하여 구현된다.
GQA의 작동 방식은 다음과 같다:
- 각 어텐션 헤드에 별도의 키와 값 투영을 대신하여 여러 쿼리 헤드를 하나의 키와 값 헤드와 공유한다.
- 이 그룹화는 키와 값 투영의 매개변수 수를 크게 줄여서 모델 크기를 작게 하고 추론 속도를 높인다.
- 어텐션 계산은 다음과 같이 표현될 수 있다:
어텐션(Q, K, V) = 소프트맥스(QK^T / sqrt(d_k))V여기서 Q는 g개의 그룹으로 나누어지며, K와 V는 Q보다 헤드 수가 적다.
LLAMA 3.1 405B의 GQA를 사용하는ประโยชน은 다음과 같다:
- 메모리 사용량 감소: 키와 값 투영이 줄어들어 모델 매개변수를 저장하는 데 필요한 메모리가 줄어든다.
- 추론 속도 향상: 키와 값 투영에 필요한 계산이 줄어들어 추론 속도가 빨라진다.
- 성능 유지: 매개변수가 줄어들었음에도 불구하고 GQA는 많은 작업에서 표준 다중 헤드 어텐션과 비교할 수 있는 성능을 유지하는 것으로 나타났다.
-
확장 컨텍스트를 위한 2단계 프리트레이닝
128K 토큰 컨텍스트 창을 달성하기 위한 2단계 프리트레이닝 프로세스에 대해 설명한다:
1단계: 8K 토큰 초기 프리트레이닝
- 모델은 먼저 8K 토큰 시퀀스에서 훈련된다.
- 이 단계에서 모델은 일반적인 언어 이해와 생성 능력을 습득한다.
2단계: 컨텍스트 확장을 위한 지속적인 프리트레이닝
- 초기 훈련 후, 모델은 128K 토큰 컨텍스트 길이를 달성하기 위해 추가적으로 훈련된다.
- 이 단계에서는 모델이 긴 시퀀스에서 일반화할 수 있도록 훈련을 조심스럽게 설계한다.
-
다중 모달 기능
다중 모달 기능에 대해 자세히 설명한다:
구성적 접근법:
- LLAMA 3.1 405B는 다른 모달리티(예: 이미지, 음성)에 대한 별도의 인코더를 사용한다.
- 이 인코더는 다양한 모달리티의 입력을 언어 모델이 이해할 수 있는 공유 임베딩 공간으로 변환한다.
언어 모델과의 통합:
- 이 특별한 인코더의 출력은 주요 언어 모델에 입력된다.
- 이로써 LLAMA 3.1 405B는 여러 유형의 데이터를 동시에 처리하고 이해할 수 있으며, 여러 모달리티를 포함하는 작업을 수행할 수 있다.
크로스 어텐션 메커니즘:
- 다중 모달리티를 통합하기 위해 LLAMA 3.1 405B는 크로스 어텐션 메커니즘을 사용할 가능성이 있다.
- 이 메커니즘은 모델이 텍스트 생성이나 다른 작업을 수행할 때 관련 정보에 주의를 집중할 수 있도록 한다.
LLAMA 3.1 405B의 다중 모달 기능은 다음과 같은 응용 분야를 가능하게 한다:
- 이미지 캡션 및 시각적 질문 답변
- 음성-텍스트 전사 및 문맥 이해
- 텍스트, 이미지 및 기타 데이터 유형을 결합한 다중 모달리티 推論 작업
훈련 세부 정보
- 15조 개의 토큰으로 훈련
- 405B 모델을 위한 39.3M GPU 시간을 가진 사용자 정의 GPU 클러스터
- 다국어 능력을 위한 다양한 데이터셋 수집
명령어 튜닝 버전은 추가적인 훈련을 받았다:
- 공개적으로 사용 가능한 명령어 데이터셋으로 미세 조정
- 2500만 개의 합성 예제
- 감독된 미세 조정 및 인간 피드백을 사용한 강화 학습
성능 벤치마크
LLAMA 3.1 405B, Nemotron 4 340B Instruct, GPT-4 (0125), GPT-4 Omni 및 Claude 3.5 Sonnet을 비교한다. 주요 벤치마크에는 일반 작업(MMLU, IFEval), 코드 작업(HumanEval, GSM8K) 및 推論 작업(ARC Challenge)이 포함된다. 각 벤치마크 점수는 모델의 이해력과 텍스트 생성 능력, 복잡한 문제 해결 능력 및 코드 실행 능력을 반영한다. 특히 LLAMA 3.1 405B와 Claude 3.5 Sonnet은 여러 벤치마크에서 우수한 성능을 보여준다.
미래 방향
LLAMA 3.1-405B의 출시로 다음과 같은 영역에서 혁신이 가속화될 것으로 기대된다:
- 특수 도메인에 대한 미세 조정 기술의 개선
- 추론 방법의 개발
- 모델 압축 및 증류의 발전
결론
LLAMA 3.1-405B는 오픈 소스 AI에서 중요한 里程碑을 나타내며, 이전에 폐쇄형 모델에서만 가능했던 기능을 제공한다.
이 모델의 사용을 계속 탐색하는 동안, 책임감 있고 윤리적인 고려를 통해 접근하는 것이 중요하다. 모델과 함께 제공되는 도구와 안전 장치는 책임감 있는 배포를 위한 프레임워크를 제공하지만, 이 강력한 기술이 사회의 이익을 위해 사용되도록 하는 데에는 지속적인 주의와 커뮤니티 협력이 필요하다.














