AI 모델 및 플랫폼

구글, SLM을 교사로 사용하여 AI 훈련 속도 28% 향상

mm
Unite.AI를 Google의 선호 소스에 추가

대규모 언어 모델(Large Language Model, LLM)의 훈련은 대부분의 조직에서 도달할 수 없는 것이 되었습니다. 수백만 달러의 비용과 슈퍼컴퓨터를 만들 정도의 컴퓨팅 요구 사항으로 인해 AI 개발은 기술 거대企業의 문 뒤에 잠겨있었습니다. 그러나 구글은 더 작은 AI 모델을 교사로 사용하는 간단한 접근법을 통해 이 이야기를 뒤집었습니다.

SALT의 작동 방식: AI 모델 훈련의 새로운 접근 방식

최근의 연구 논문 “작은 도움이 멀리까지 간다: 작은 언어 모델을 활용한 효율적인 LLM 훈련“에서 구글 연구소와 DeepMind는 SALT(Small model Aided Large model Training)를 소개했습니다. 이것은 전통적인 LLM 훈련 접근 방식을 도전하는 새로운 방법입니다.

이 연구의 중요성은 무엇일까요? 현재 대규모 AI 모델을 훈련하는 것은 모든 것을 한 번에 가르치는 것과 같습니다. 비효율적이고 비용이 많이 들며 종종大量 컴퓨팅 자원을 갖춘 조직에서만 가능합니다. SALT는 두 단계의 훈련 과정을 도입하여 혁신적이고 실용적인 접근 방식을 제공합니다.

SALT의 실제 작동 방식:

1단계: 지식 증류

  • 더 작은 언어 모델(Small Language Model, SLM)이 교사 역할을 하여 더 큰 모델과 지식을 공유합니다.
  • 더 작은 모델은 “학습된 지식”을 전달하기 위해 연구자들이 “소프트 레이블”이라고 부르는 것을 사용합니다.
  • 이를 기본 개념을 다루는 조교와 같은 것으로 생각할 수 있습니다.
  • 이 단계는 특히 더 작은 모델이 강한 예측 확신을 갖는 “쉬운” 학습 영역에서 효과적입니다.

2단계: 자기지도 학습

  • 더 큰 모델은 독립적인 학습으로 전환됩니다.
  • 복잡한 패턴과 도전적인 과제를 마스터하는 데 중점을 둡니다.
  • 이것은 더 큰 모델이 더 작은 “교사”가 제공할 수 있는 것 이상의 능력을 개발하는 곳입니다.
  • 단계 사이의 전환은 선형 감소와 선형 비율 감소와 같은 전략을 사용합니다.

비기술적인 용어로 설명하자면, 더 작은 AI 모델이 더 큰 모델을 초기 훈련 단계에서 도와주는 유용한 조교와 같습니다. 이 조교는 각 답변에 대한 확신을 나타내는 추가 정보를 제공합니다. 이 추가 정보는 더 큰 모델이 더 빠르고 효과적으로 학습하도록 도와줍니다.

구글 연구자들은 SALT를 사용하여 1.5억 매개변수 SLM으로 2.8억 매개변수 LLM을 훈련했을 때 다음 결과를 얻었습니다.

  • 전통적인 방법보다 28%의 훈련 시간 감소
  • 미세 조정 후 성능 개선:
    • 수학 문제 정확도 34.87% (기본값 31.84% 대비)
    • 읽기 이해력 67% 정확도 (63.7% 대비)

그러나 SALT가真正로 혁신적인 이유는 이론적 프레임워크에 있습니다. 연구자들은 약한 교사 모델이 학생의 성능을 향상시키는 데 도움이 될 수 있다는 것을 발견했습니다. 이를 “유리한 편향-분산 거래”라고 합니다. 더 작은 모델이 더 큰 모델이 기본 패턴을 더 효율적으로 학습하도록 도와줍니다.

SALT가 AI 개발 경쟁력을 어떻게 바꿀 수 있는가

클라우드 컴퓨팅이 기술 회사 설립을誰でも 할 수 있게 했던 것처럼, SALT는 AI 개발을誰でも 할 수 있게 할 수 있습니다.

저는 수년 동안 AI 훈련 혁신을 따라왔으며, 대부분의 혁신은 기술 거대企業에ประโยชน이 되었습니다. 그러나 SALT는 다릅니다.

미래에 대한 의미:

제한된 자원을 가진 조직:

  • 더 이상大量 컴퓨팅 인프라가 필요하지 않습니다.
  • 더 작은 연구소와 회사에서 사용자 정의 모델 개발을 실험할 수 있습니다.
  • 28%의 훈련 시간 감소는 직접적으로 컴퓨팅 비용을 줄입니다.
  • 더 중요한 것은, 조그만 컴퓨팅 자원으로도 전문적인 결과를 얻을 수 있습니다.

AI 개발 경쟁력:

  • 더 많은 플레이어가 시장에 진입하여 다양한 전문 AI 솔루션을 제공할 수 있습니다.
  • 대학과 연구 기관에서 기존 자원으로 더 많은 실험을 수행할 수 있습니다.
  • AI 연구의 진입 장벽이 크게 낮아집니다.
  • 이전에는 AI 개발을 할 수なかった 분야에서 새로운 응용 프로그램을 볼 수 있습니다.

미래에 대한 의미

더 작은 모델을 교사로 사용함으로써, 우리는 단순히 AI 훈련을 더 효율적으로 만드는 것이 아니라,誰でも AI 개발에 참여할 수 있도록根本的に 바꿔놓습니다. 이는 기술적인 개선에만 국한되지 않습니다.

중요한 내용:

  • 28%의 훈련 시간 감소는 AI 프로젝트를 시작하거나 포기하는 결정적인 차이입니다.
  • 성능 개선(수학 34.87%, 읽기 67%)은 접근성이 항상 품질을 희생한다는 것은 아니라는 것을 보여줍니다.
  • SALT의 접근 방식은 때때로 가장好的 솔루션이 기본적인 것을 재고하는 것에서 나온다는 것을 증명합니다.

주의할 점:

  1. 더 작은 조직에서 사용자 정의 AI 모델을 개발하는 것을 주시하십시오.
  2. 이전에는 AI 개발을 할 수なかった 분야에서 새로운 응용 프로그램을 주시하십시오.
  3. 전문적인 작업을 위한 더 작은 모델의 사용에 대한 혁신을 주시하십시오.

기억하세요: SALT의真正한 가치는誰でも AI 개발에 참여할 수 있도록하는 것입니다. 연구소, 기술 팀, 또는 단순히 AI 개발에 관심이 있는 경우, 이는 다음 큰 아이디어를 가능하게 할 수 있는 혁신입니다.

아마도 도달할 수 없다고 생각했던 AI 프로젝트를 다시 생각해 볼 수 있습니다. 그것은 생각보다 더 가능할 수 있습니다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.