AI 모델 및 플랫폼

앨런 AI의 Tülu 3, 디프시크의 예상치 못한 라이벌이 되다

mm
Unite.AI를 Google의 선호 소스에 추가

계속해서 뉴스들이 나오고 있다. 디프시크의 모델은 벤치마크에 도전하고, 새로운 표준을 설정하며, 많은 소음을 일으키고 있다. 그러나 AI 연구 현장에서 интерес로운 일이 발생했다.

앨런 AI는 조용히 새로운 Tülu 3 모델家族을 출시했으며, 405B 파라미터 버전은 디프시크와 경쟁을 하는 것이 아니라, 주요 벤치마크에서 이를 따라가거나凌駕하고 있다.

이것을 перспектив에서 살펴보자.

405B Tülu 3 모델은 디프시크 V3와 같은 최상위 성능 모델과 다양한 작업에서 경쟁하고 있다. 우리는 수학 문제, 코딩 챌린지, 정밀한 지시 따르기와 같은 분야에서 비교적 또는 우수한 성능을 보이고 있다. 그리고 완전히 공개적인 접근 방식을 사용하고 있다.

그들은 완전한 훈련 파이프라인, 코드, 그리고 이러한 성과를 가능하게 한 새로운 강화 학습 방법인 Reinforcement Learning with Verifiable Rewards (RLVR)를 출시했다.

최근 몇 주 동안 이러한 발전은 최고의 AI 개발이 어떻게 진행되는지 변경하고 있다. 완전히 공개된 모델이 최고의 폐쇄 모델과 경쟁할 수 있다면, 이전에 사적 기업 벽 뒤에 잠겨 있던 가능성이 열릴 수 있다.

기술적인 전투

Tülu 3이 돋보이는 이유는 무엇일까? 이것은 전통적인 접근 방식을 넘어서는 고유한 4단계 훈련 과정을 통해 이루어진다.

앨런 AI가 이 모델을 어떻게 구축했는지 살펴보자.

1단계: 전략적인 데이터 선택

팀은 모델의 품질이 데이터 품질에서 시작한다는 것을 알았다. 그들은 WildChatOpen Assistant와 같은 기존 데이터셋을 커스텀 생성 콘텐츠와 결합했다. 그러나 핵심적인 통찰은 다음과 같다: 그들은 단순히 데이터를 집계하지 않았으며, 수학적 추론과 코딩 능력과 같은 특정 기술을 위한 대상 데이터셋을 생성했다.

2단계: 더 나은 응답 구축

두 번째 단계에서, 앨런 AI는 모델이 특정 기술을 가르치는 데 중점을 두었다. 그들은 수학, 코딩, 일반 작업을 위한 다른 훈련 데이터 세트를 생성했다. 이러한 조합을 반복적으로 테스트함으로써, 그들은 모델이 어디에서 우수하고 어디에서 개선이 필요한지 정확히 볼 수 있었다. 이 반복적인 과정은 Tülu 3이 각 영역에서 달성할 수 있는 실제 잠재력을 드러냈다.

3단계: 비교에서 학습

이것이 앨런 AI가 창의력을 발휘한 곳이다. 그들은 Tülu 3의 응답을 다른 최상위 모델과 즉시 비교할 수 있는 시스템을 구축했다. 그러나 그들은 또한 AI의 지속적인 문제를 해결했다: 모델이 길이의 sake를 위해 긴 응답을 쓰는 경향. 그들의 접근 방식, 길이 정규화된 직접적인 선호도 최적화 (DPO)를 사용하여, 모델은 품질을 양보다 우선하는 것을 배웠다. 결과는? 응답은 정밀하고 목적이 있다.

AI 모델이 선호도에서 학습할 때(어떤 응답이 더 나은지, A 또는 B?), 그들은 특정 편향을 개발하는 경향이 있다: 더 긴 응답이 항상 더 낫다고 생각한다. 그것은 더 많이 말하기보다는 잘 말하는 것을 더 중요하게 여기는 것과 같다.

길이 정규화된 DPO는 응답의 길이를 고려하여 모델이 선호도에서 학습하는 방식을 조정함으로써 이 문제를 해결한다. 단순히 어느 응답이 선호되는지 보는 것이 아니라, 각 응답의 길이를 고려한다. 응답의 품질을 단어당으로 판단하는 것과 같다.

왜 이것이 중요할까? 그것은 Tülu 3이 정밀하고 효율적으로 학습하도록 도와주기 때문이다. 응답을 더 포괄적으로 보이기 위해 추가 단어로 채우는 대신, 실제로 필요한 길이에서 가치를 전달하도록 학습한다.

이것은 작은 세부 사항으로 보일 수 있지만, 자연스럽게 의사소통하는 AI를 구축하는 데 중요하다. 최고의 인간 전문가들은 언제 간결하고 언제 자세히 설명해야 하는지 알고 있다. 길이 정규화된 DPO는 모델이 이를 가르친다.

4단계: RLVR 혁신

이것은 주목할 만한 기술적인 혁신이다. RLVR는 주관적인 보상 모델을 구체적인 검증으로 대체한다.

대부분의 AI 모델은 복잡한 보상 모델 시스템을 통해 학습한다. 본质적으로, 좋은 응답이 무엇인지에 대한 교육된 추측이다. 그러나 앨런 AI는 RLVR와 함께 다른 경로를 선택했다.

현재 AI 모델을 훈련하는 방법을 생각해 보자. 우리는 보통 다른 AI 모델(보상 모델이라고 함)을 사용하여 응답이 좋은지 아닌지 판단해야 한다. 이것은 주관적이며, 복잡하며, 종종 일관성이 없다. 일부 응답은 좋게 보이지만 미묘한 오류를 포함할 수 있다.

RLVR는 이 접근 방식을 뒤집는다. 주관적인 판단에 의존하는 대신, 구체적인, 검증 가능한 결과를 사용한다. 모델이 수학 문제를 시도할 때, 회색 영역은 없다. 정답은 옳거나 그르다. 코드를 작성할 때, 코드는 올바르게 실행되거나 실행되지 않는다.

여기서 интерес로운 점이 있다:

  • 모델은 즉각적인, 이진 피드백을 받는다: 올바른 답변에 10점, 잘못된 답변에 0점
  • 부분적인 점수나 애매한 평가를 위한 공간이 없다
  • 학습이 집중되고 정밀해진다
  • 모델은 정확성을 우선시하는 학습을 한다

RLVR 훈련 (앨런 AI)

결과는? Tülu 3는 정확성이 가장 중요한 작업에서 상당한 개선을 보였다. 수학적 추론(GSM8K 벤치마크)과 코딩 챌린지에서 성능이 크게 향상되었다.甚至 지시 따르기도 더 정밀해졌다. 모델은 구체적인 정확성을 가치 있게 학습했다.

이것이 특히 흥미로운 것은, 이것이 오픈 소스 AI에 대한 게임을 어떻게 변경하는지이다. 이전 접근 방식은 기술적인 작업에서 폐쇄 모델의 정밀성을 따라가기 어려웠다. RLVR는 오픈 소스 모델이 동일한 수준의 신뢰성을 달성할 수 있음을 보여준다.

숫자를 살펴보는 것

405B 파라미터 버전의 Tülu 3는 분야의 최상위 모델과 직접 경쟁한다. 어디에서 우수하고, 이것이 오픈 소스 AI에 무엇을 의미하는지 살펴보자.

수학

Tülu 3은 복잡한 수학적 추론에 탁월하다. GSM8K와 MATH와 같은 벤치마크에서 디프시크의 성능과 일치한다. 모델은 다단계 문제를 처리하고, 강력한 수학적 추론 능력을 보여준다.

코딩

코딩 결과는 똑같이 인상적이다. RLVR 훈련 덕분에, Tülu 3은 문제를 효과적으로 해결하는 코드를 작성한다. 그 강점은 코딩 지시를 이해하고, 기능적인 솔루션을 생성하는 것이다.

정밀한 지시 따르기

모델의 지시 따르기 능력은 핵심적인 강점으로 돋보인다. 많은 모델이 지시를 근사하거나 일반화하는 반면, Tülu 3은 정확하게 요청된 것을 실행하는 것으로 나타났다.

AI 개발의 블랙 박스 열기

앨런 AI는 강력한 모델과 함께 완전한 개발 과정을 공개했다.

훈련 과정의 모든 측면이 문서화되어 있으며, 접근이 가능하다. 4단계 접근 방식에서 데이터 준비 방법, RLVR 구현까지, 전체 과정은 연구와 복제를 위해 공개되어 있다. 이 투명성은 고성능 AI 개발의 새로운 표준을 설정한다.

개발자들은 포괄적인 자원을 받는다:

  • 완전한 훈련 파이프라인
  • 데이터 처리 도구
  • 평가 프레임워크
  • 구현 사양

이것은 팀이 다음을 할 수 있도록 한다:

  • 훈련 과정을 수정
  • 특정 요구 사항을 위한 방법을 조정
  • 검증된 접근 방식에 기반
  • 전문적인 구현을 생성

이 공개적인 접근 방식은 분야 전반의 혁신을 가속화한다. 연구자들은 검증된 방법을 기반으로 구축할 수 있으며, 개발자는 개선에 집중할 수 있다.

오픈 소스 우수성의 부상

Tülu 3의 성공은 오픈 AI 개발의 큰 순간이다. 오픈 소스 모델이 사적 대안과 일치하거나凌駕할 때, 이것은 산업을 근본적으로 변경한다. 전 세계의 연구 팀은 검증된 방법에 접근할 수 있으며, 그들의 작업을 가속화하고, 새로운 혁신을 창출한다. 사적 AI 연구소는 적응해야 한다. 투명성을 증가시키거나 기술적인 경계를 더욱 추진해야 한다.

앞으로 nhìn보면, Tülu 3의 검증 가능한 보상과 다단계 훈련의 혁신은 무엇을 의미하는지 암시한다. 팀은 이러한 기초를 기반으로 성능을 더욱 높일 수 있다. 코드가 존재하며, 방법은 문서화되어 있으며, 새로운 AI 개발의 물결이 시작되었다. 개발자와 연구자에게, 이러한 방법을 실험하고 개선할 기회는 흥미로운 장의 시작을标示한다.

Tülu 3에 대한 자주 묻는 질문 (FAQ)

Tülu 3는 무엇이며, 주요 특징은 무엇인가?

Tülu 3는 앨런 AI에서 개발한 오픈 소스 LLMs 가족으로, Llama 3.1 아키텍처를 기반으로 한다. 이것은 다양한 크기(8B, 70B, 405B 파라미터)로 제공된다. Tülu 3는 지식, 추론, 수학, 코딩, 지시 따르기, 안전성과 같은 다양한 작업에서 성능을 개선하기 위해 설계되었다.

Tülu 3의 훈련 과정은 무엇이며, 어떤 데이터가 사용되는가?

Tülu 3의 훈련에는 몇 가지 핵심 단계가 포함된다. 첫째, 팀은 다양한 프롬프트를 공개 데이터셋과 합성 데이터에서 수집하며, 특정 기술을 위한 대상 데이터셋을 생성한다. 둘째, 지시 따르기, 수학, 코딩 데이터를 혼합하여 감독된 미세 조정을 수행한다. 셋째, 직접적인 선호도 최적화를 사용하며, 인간과 LLM 피드백을 통해 생성된 선호도 데이터를 사용한다. 마지막으로, 측정 가능한 정확성을 가진 작업을 위한 RLVR를 사용한다. Tülu 3은 각 단계를 위한 커스텀 데이터셋을 사용한다.

Tülu 3는 안전성에 어떻게 접근하며, 어떤 지표를 사용하여 평가하는가?

안전성은 Tülu 3 개발의 핵심 구성 요소이다. 이것은 훈련 과정 전반에 걸쳐 해결된다. 감독된 미세 조정 동안 안전성에 특화된 데이터셋을 사용하며, 이것은 다른 작업 지향 데이터와 대부분 직교한다.

RLVR는 무엇인가?

RLVR는 모델이 검증 가능한 보상, 예를 들어 정답의 정확성과 같은 것을 최적화하도록 훈련하는 기술이다. 이것은 전통적인 RLHF가 보상 모델을 사용하는 것과 다르다.

Alex는 Unite.AI의 AI 기반 뉴스 운영을 이끌며, 저널리즘, 연구 및 자동화를 결합해 인공지능에 대한 시기적절하고 확장 가능한 보도를 지원합니다. 그의 작업은 새로운 AI 개발이 효율적으로 조명되도록 하면서도 출판물의 편집 기준을 유지하도록 돕습니다.