AI 모델 및 플랫폼
메타 라이마 3 공개: 대규모 언어 모델에서 큰 발전
생성적 AI 분야에서 메타는 오픈 소스 가용성을 통해 선도적 역할을 하고 있으며, 메타 AI(라이마) 시리즈를 개발자와 연구자에게 전 세계적으로 배포하고 있습니다. 이러한 진행적인 이니셔티브를 기반으로 메타는 최근 라이마 시리즈의 세 번째 버전인 라이마 3를 발표했습니다. 이 새로운 버전은 라이마 2보다 크게 개선되었으며, 수많은 강화 기능을 제공하며 산업 경쟁자들인 구글, 미스트랄, 앤트로픽 등과 경쟁할 수 있는 벤치마크를 설정했습니다. 이 기사에서는 라이마 3의 주요 개선 사항과 라이마 2와의 비교를探구합니다.
메타의 라이마 시리즈: 독점에서 오픈 소스 및 성능 향상으로
메타는 2022年に 라이마 1을 출시하여 라이마 시리즈를 시작했습니다. 라이마 1은 비상업적 용도로만 사용할 수 있었으며, 당시의 최신 기술로 인해 계산 요구와 독점적 특성이 큰 모델이었습니다. 2023년 라이마 2가 출시되면서 메타 AI는 더 큰 오픈성을 추구하여 모델을 연구 및 상업적 용도로 무료로 제공했습니다. 이 움직임은 고급 생성적 AI 기술에 대한 접근을 민주화하여, 더 많은 사용자들이 혁신하고 응용 프로그램을 개발할 수 있게 하였습니다. 라이마 3는 성능을 개선하는 데 중점을 두고 있으며, 특히 작은 모델의 성능을 다양한 산업 벤치마크에서 개선합니다.
라이마 3 소개
라이마 3는 메타의 오픈 소스 대규모 언어 모델(LLM)의 두 번째 세대입니다. 8B와 70B 파라미터를 갖는 사전 학습 및 지시 미세 조정 모델을 특징으로 합니다. 라이마 3는 이전 버전과 마찬가지로 디코더 전용 트랜스포머 아키텍처를 사용하며, 자율 회귀적 자체 감독 학습을 통해 텍스트 시퀀스의 다음 토큰을 예측합니다. 라이마 3는 라이마 2보다 7배 더 큰 데이터셋으로 사전 학습되며, 15조 개 이상의 토큰을 포함하는 새로운 데이터셋에서 추출됩니다. 이 거대한 데이터셋은 24,000개의 GPU를 장착한 두 클러스터에서 처리됩니다. 데이터 품질을 유지하기 위해, 데이터 중심 AI 기술을 사용하여, 휴리스틱 및 NSFW 필터, 의미적 중복 제거, 텍스트 품질 분류 등이 수행됩니다. 대화 응용 프로그램을 위해 설계된 라이마 3 인스트럭션 모델은 1,000만 개 이상의 인간 주석 데이터 샘플을 포함하며, 감독 미세 조정(SFT), 거부 샘플링, 근접 정책 최적화(PPO), 직접 정책 최적화(DPO)와 같은 고급 훈련 방법을 사용합니다.
라이마 3 vs 라이마 2: 주요 강화점
라이마 3는 라이마 2보다 몇 가지 개선점을 제공합니다.
- 확장된 어휘: 라이마 3의 어휘는 128,256 토큰으로 증가하여, 라이마 2의 32,000 토큰보다 더 효율적인 텍스트 인코딩을 지원합니다.
- 확장된 컨텍스트 길이: 라이마 3 모델은 8,000 토큰의 컨텍스트 길이를 제공하여, 라이마 2의 4,090 토큰보다 더 많은 컨텍스트를 처리할 수 있습니다.
- 업그레이드된 훈련 데이터: 라이마 3의 훈련 데이터셋은 라이마 2보다 7배 더 크며, 4배 더 많은 코드를 포함합니다. 30개 이상의 언어로 구성된 5% 이상의 고품질 비영어 데이터를 포함합니다.
- 개선된 지시 미세 조정 및 평가: 라이마 3는 라이마 2와 달리, 감독 미세 조정(SFT), 거부 샘플링, 근접 정책 최적화(PPO), 직접 정책 최적화(DPO)와 같은 고급 지시 미세 조정 기술을 사용합니다.
- 고급 AI 안전: 라이마 3는 라이마 2와 마찬가지로, 지시 미세 조정 및 종합적 적색 팀을 통해 위험을 완화하며, 특히 사이버 보안 및 생물학적 위협과 같은 중요한 영역에서 안전을 강화합니다.
라이마 3의 가용성
라이마 3 모델은 현재 허깅페이스 생태계에 통합되어 개발자에게 더 쉽게 접근할 수 있습니다. 모델은 또한 퍼플렉시티 랩스와 파이어웍스.ai와 같은 모델-서비스 플랫폼을 통해 제공되며, AWS SageMaker, Azure ML, Vertex AI와 같은 클라우드 플랫폼에서도 제공됩니다. 메타는 라이마 3의 가용성을 더 확대할 계획이며, 구글 클라우드, 카글, IBM 왓슨X, NVIDIA NIM, 스노우플레이크와 같은 플랫폼을 포함합니다. 또한, 라이마 3의 하드웨어 지원은 AMD, AWS, 델, 인텔, NVIDIA, 퀄컴의 플랫폼을 포함하도록 확대될 예정입니다.
라이마 3의 향후 강화
메타는 현재 라이마 3의 릴리즈가 더 큰 비전의 초기 단계에 불과하다고 밝혔습니다. 400억 개 이상의 파라미터를 갖는 고급 모델을 개발 중이며, 멀티모달리티와 여러 언어를 처리하는 능력을 포함할 예정입니다. 이 모델은 또한 더 긴 컨텍스트 창과 개선된 성능 능력을 제공할 것입니다.
결론
메타의 라이마 3는 대규모 언어 모델의 지형을 크게 발전시킵니다. 성능 능력과 함께 오픈 소스 가용성을 강화하며, 산업 경쟁자들과 경쟁할 수 있는 벤치마크를 설정합니다. 라이마 3는 개발자에게 고급 능력을 제공하며, 안전성과 훈련 정밀도를 크게 향상시킵니다. 허깅페이스와 주요 클라우드 서비스를 통해 모델을 통합함으로써, 메타는 라이마 3를 강력하고 普遍적으로 만듭니다.
이 세 번째 버전은 AI 기술을 민주화하여, 더 많은 개발자에게 고급 능력을 제공합니다. 또한, 안전성과 훈련 정밀도를 크게 향상시킵니다.
향후 메타의 개발은 더 강력한 능력을 제공할 것입니다. 멀티모달리티와 확장된 언어 지원을 포함하여, 라이마 3는 다른 주요 AI 모델과 경쟁할 수 있을 것입니다. 라이마 3는 메타의 AI 혁명을 이끄는 데 있어 중요한 역할을 할 것입니다.










