AI 모델 및 플랫폼

구글, SLM을 교사로 사용하여 AI 훈련 속도 28% 향상

mm
Unite.AI를 Google의 선호 소스에 추가

대규모 언어 모델(Large Language Model, LLM)의 훈련은 대부분의 조직에서 도달할 수 없는 것이 되었습니다. 수백만 달러의 비용과 슈퍼컴퓨터를 만들 정도의 컴퓨팅 요구 사항으로 인해 AI 개발은 기술 거대企業의 문 뒤에 잠겨있었습니다. 그러나 구글은 더 작은 AI 모델을 교사로 사용하는 간단한 접근법을 통해 이 이야기를 뒤집었습니다. (GOOGL )

SALT의 작동 방식: AI 모델 훈련의 새로운 접근 방식

최근의 연구 논문 “작은 도움이 멀리까지 간다: 작은 언어 모델을 활용한 효율적인 LLM 훈련“에서 구글 연구소와 DeepMind는 SALT(Small model Aided Large model Training)를 소개했습니다. 이것은 전통적인 LLM 훈련 접근 방식을 도전하는 새로운 방법입니다.

이 연구의 중요성은 무엇일까요? 현재 대규모 AI 모델을 훈련하는 것은 모든 것을 한 번에 가르치는 것과 같습니다. 비효율적이고 비용이 많이 들며 종종大量 컴퓨팅 자원을 갖춘 조직에서만 가능합니다. SALT는 두 단계의 훈련 과정을 도입하여 혁신적이고 실용적인 접근 방식을 제공합니다.

SALT의 실제 작동 방식:

1단계: 지식 증류

  • 더 작은 언어 모델(Small Language Model, SLM)이 교사 역할을 하여 더 큰 모델과 지식을 공유합니다.
  • 더 작은 모델은 “학습된 지식”을 전달하기 위해 연구자들이 “소프트 레이블”이라고 부르는 것을 사용합니다.
  • 이를 기본 개념을 다루는 조교와 같은 것으로 생각할 수 있습니다.
  • 이 단계는 특히 더 작은 모델이 강한 예측 확신을 갖는 “쉬운” 학습 영역에서 효과적입니다.

2단계: 자기지도 학습

  • 더 큰 모델은 독립적인 학습으로 전환됩니다.
  • 복잡한 패턴과 도전적인 과제를 마스터하는 데 중점을 둡니다.
  • 이것은 더 큰 모델이 더 작은 “교사”가 제공할 수 있는 것 이상의 능력을 개발하는 곳입니다.
  • 단계 사이의 전환은 선형 감소와 선형 비율 감소와 같은 전략을 사용합니다.

비기술적인 용어로 설명하자면, 더 작은 AI 모델이 더 큰 모델을 초기 훈련 단계에서 도와주는 유용한 조교와 같습니다. 이 조교는 각 답변에 대한 확신을 나타내는 추가 정보를 제공합니다. 이 추가 정보는 더 큰 모델이 더 빠르고 효과적으로 학습하도록 도와줍니다.

구글 연구자들은 SALT를 사용하여 1.5억 매개변수 SLM으로 2.8억 매개변수 LLM을 훈련했을 때 다음 결과를 얻었습니다.

  • 전통적인 방법보다 28%의 훈련 시간 감소
  • 미세 조정 후 성능 개선:
    • 수학 문제 정확도 34.87% (기본값 31.84% 대비)
    • 읽기 이해력 67% 정확도 (63.7% 대비)

그러나 SALT가真正로 혁신적인 이유는 이론적 프레임워크에 있습니다. 연구자들은 약한 교사 모델이 학생의 성능을 향상시키는 데 도움이 될 수 있다는 것을 발견했습니다. 이를 “유리한 편향-분산 거래”라고 합니다. 더 작은 모델이 더 큰 모델이 기본 패턴을 더 효율적으로 학습하도록 도와줍니다.

SALT가 AI 개발 경쟁력을 어떻게 바꿀 수 있는가

클라우드 컴퓨팅이 기술 회사 설립을誰でも 할 수 있게 했던 것처럼, SALT는 AI 개발을誰でも 할 수 있게 할 수 있습니다.

저는 수년 동안 AI 훈련 혁신을 따라왔으며, 대부분의 혁신은 기술 거대企業에ประโยชน이 되었습니다. 그러나 SALT는 다릅니다.

미래에 대한 의미:

제한된 자원을 가진 조직:

  • 더 이상大量 컴퓨팅 인프라가 필요하지 않습니다.
  • 더 작은 연구소와 회사에서 사용자 정의 모델 개발을 실험할 수 있습니다.
  • 28%의 훈련 시간 감소는 직접적으로 컴퓨팅 비용을 줄입니다.
  • 더 중요한 것은, 조그만 컴퓨팅 자원으로도 전문적인 결과를 얻을 수 있습니다.

AI 개발 경쟁력:

  • 더 많은 플레이어가 시장에 진입하여 다양한 전문 AI 솔루션을 제공할 수 있습니다.
  • 대학과 연구 기관에서 기존 자원으로 더 많은 실험을 수행할 수 있습니다.
  • AI 연구의 진입 장벽이 크게 낮아집니다.
  • 이전에는 AI 개발을 할 수なかった 분야에서 새로운 응용 프로그램을 볼 수 있습니다.

미래에 대한 의미

더 작은 모델을 교사로 사용함으로써, 우리는 단순히 AI 훈련을 더 효율적으로 만드는 것이 아니라,誰でも AI 개발에 참여할 수 있도록根本的に 바꿔놓습니다. 이는 기술적인 개선에만 국한되지 않습니다.

중요한 내용:

  • 28%의 훈련 시간 감소는 AI 프로젝트를 시작하거나 포기하는 결정적인 차이입니다.
  • 성능 개선(수학 34.87%, 읽기 67%)은 접근성이 항상 품질을 희생한다는 것은 아니라는 것을 보여줍니다.
  • SALT의 접근 방식은 때때로 가장好的 솔루션이 기본적인 것을 재고하는 것에서 나온다는 것을 증명합니다.

주의할 점:

  1. 더 작은 조직에서 사용자 정의 AI 모델을 개발하는 것을 주시하십시오.
  2. 이전에는 AI 개발을 할 수なかった 분야에서 새로운 응용 프로그램을 주시하십시오.
  3. 전문적인 작업을 위한 더 작은 모델의 사용에 대한 혁신을 주시하십시오.

기억하세요: SALT의真正한 가치는誰でも AI 개발에 참여할 수 있도록하는 것입니다. 연구소, 기술 팀, 또는 단순히 AI 개발에 관심이 있는 경우, 이는 다음 큰 아이디어를 가능하게 할 수 있는 혁신입니다.

아마도 도달할 수 없다고 생각했던 AI 프로젝트를 다시 생각해 볼 수 있습니다. 그것은 생각보다 더 가능할 수 있습니다.

Alex은 Unite.AI의 AI 기반 뉴스 운영을 이끌며, 저널리즘, 연구, 자동화를 결합해 인공지능에 대한 시기적절하고 확장 가능한 보도를 지원합니다. 그의 작업은 새로운 AI 개발이 효율적으로 부각되도록 돕는 동시에, 출판물의 편집 기준을 유지합니다.