AI 모델 및 플랫폼
구글, AI 훈련 데이터 요구량을 10,000배 줄인 방법
AI 업계는 근본적인 역설에 직면했습니다. 기계는 방대한 데이터를 처리할 수 있지만 학습은 놀랄 만큼 비효율적이고 수익 체감 문제를 겪습니다. 전통적인 머신러닝 방식에는 막대한 양의 레이블 데이터가 필요하며, 이를 만드는 데 수백만 달러와 수년이 들 수 있습니다. 이런 방식은 데이터가 많을수록 더 좋은 AI 모델이 만들어진다는 믿음에 기반합니다. 그러나 Google 연구진은 최근 이 오랜 믿음에 도전하는 혁신적인 방법을 제시했습니다. 최대 1만 배 적은 학습 데이터로도 비슷한 AI 성능을 달성할 수 있음을 보인 것입니다. 이 발전은 AI에 접근하는 방식을 근본적으로 바꿀 수 있습니다. 이 글에서는 Google 연구진이 돌파구를 만든 방법과 미래에 미칠 영향, 남은 과제와 방향을 살펴봅니다.
인공지능에서 빅데이터의 도전
수십 년 동안 “데이터가 많을수록 더 좋은 AI가 된다”는 믿음이 업계의 접근 방식을 이끌었습니다. GPT-4 같은 대형 언어 모델은 학습 과정에서 수조 개의 토큰을 소비합니다. 이처럼 데이터에 굶주린 방식은 막대한 자원이나 전문 데이터 세트가 없는 조직에 큰 장벽이 됩니다. 먼저 사람의 레이블링 비용이 매우 높습니다. 전문 주석 작업자는 높은 비용을 요구하고 필요한 데이터 양도 많아 프로젝트 비용이 커집니다. 또한 수집한 데이터의 상당 부분은 중복되어 학습에 별다른 기여를 하지 못할 수 있습니다. 기존 방식은 요구 사항이 변할 때도 대응이 어렵습니다. 정책이 바뀌거나 새로운 문제가 생기면 레이블링을 처음부터 다시 시작해야 해 값비싼 데이터 수집과 모델 재학습이 반복됩니다.
액티브 러닝으로 빅데이터 도전 해결
이 데이터 문제를 해결하는 잘 알려진 방법 중 하나가 능동 학습입니다. 사람이 레이블을 붙일 가장 가치 있는 학습 사례를 신중하게 고르는 방식입니다. 핵심은 모델이 이용 가능한 모든 데이터를 수동적으로 소비하는 것보다 혼동하기 쉬운 사례에서 더 많이 배운다는 점입니다. 능동 학습은 방대한 데이터 세트를 모으는 대신 정보량이 가장 많은 사례를 전략적으로 선택합니다. 명백하거나 중복된 데이터에 레이블을 붙이는 낭비를 피하고, 모델 성능을 크게 개선할 수 있는 불확실한 사례와 경계 사례에 집중합니다. (GOOGL )
전문가의 노력을 이런 핵심 사례에 집중하면 모델은 훨씬 적은 데이터로 더 빠르고 효과적으로 학습할 수 있습니다. 이는 데이터 병목과 기존 머신러닝 방식의 비효율을 동시에 완화합니다.
구글의 액티브 러닝 접근 방식
구글의 연구 팀은 이 패러다임을 성공적으로 적용했습니다. 그들의 새로운 액티브 러닝 방법론은 신중하게 선별된, 높은 품질의 예제가 대량의 레이블이 붙은 데이터를 대체할 수 있음을 보여주었습니다. 예를 들어, 그들은 모델이 500개의 전문가 레이블이 붙은 예제만으로 100,000개의 전통적인 레이블이 붙은 데이터와 동일하거나 더 좋은 성능을 달성할 수 있음을 보여주었습니다.
이 과정은 구글이 “LLM-as-Scout” 시스템이라고 부르는 방식으로 작동합니다. 큰 언어 모델은 먼저 대량의 레이블이 붙지 않은 데이터를 스캔하여 가장 불확실한 경우를 식별합니다. 이러한 경계 사례는 모델이 인간의 지침을 통해 의사 결정 능력을 향상시키기 위해 가장 필요한 시나리오를 나타냅니다. 이 과정은 기본 모델이 큰 데이터셋을 기본 프롬프트를 사용하여 레이블링하는 초기 단계에서 시작됩니다. 시스템은 예제를 예측된 분류에 따라 클러스터링하고 모델이 다른 분류 사이에서 혼동을 보이는 영역을 식별합니다. 이러한 중복 클러스터는 인간의 전문 지식이 가장 가치 있는 지점을 나타냅니다.
이 방법은 서로 다른 레이블을 가진 사례 중 가장 가까운 쌍을 명시적으로 겨냥합니다. 이런 경계 사례는 인간의 전문 지식이 가장 중요한 상황입니다. 전문가의 레이블링 노력을 혼동하기 쉬운 사례에 집중하면 시스템은 놀라운 효율 향상을 달성할 수 있습니다.
품질이 양보다 중요
이 연구는 AI 분야의 통념에 도전하는 데이터 품질 관련 결과를 제시합니다. 전문가 레이블은 충실도가 높고 대규모 크라우드소싱 주석보다 일관적이었습니다. 연구진은 Cohen의 kappa 통계로 모델 예측이 전문가 의견과 얼마나 일치하는지 평가했습니다. Google의 실험에서 전문 주석 작업자는 0.8 이상의 점수를 기록해 일반적인 크라우드소싱보다 높은 일치도를 보였습니다.
이러한 일관성 덕분에 모델은 훨씬 적은 사례로도 효과적으로 학습할 수 있습니다. Gemini Nano-1과 Nano-2는 신중하게 고른 250~450개 사례만으로 약 10만 개의 무작위 크라우드소싱 레이블과 같은 수준의 전문가 일치도를 달성했습니다. 데이터 규모가 세 자릿수에서 네 자릿수 배 줄어든 셈입니다. 이점은 데이터 양 감소에 그치지 않았습니다. 이 방식으로 학습한 모델은 기존 방식보다 더 좋은 성능을 보였고, 복잡한 작업과 더 큰 모델에서는 기준선 대비 55~65% 향상됐습니다.
이번 돌파구가 중요한 이유
이 개발은 인공지능 산업에서 중요한 시기에 발생했습니다. 모델이 더 크고 더 복잡해짐에 따라, 전통적인 접근 방식은 더 이상 지속 가능하지 않게 되었습니다. 대량의 모델을 훈련시키는 환경 비용은 계속 증가하고 있으며, 많은 조직들에게 높은 경제적 장벽이 있습니다.
구글의 방법은 여러 산업의 도전을 동시에 해결합니다. 레이블링 비용의 감소는 인공지능 개발을 더 많은 조직과 연구 팀에게 접근 가능하게 합니다. 더 빠른 반복 주기는 요구사항의 변경에 신속하게 대응할 수 있게 합니다. 이는 콘텐츠 모더레이션이나 사이버 보안과 같은 동적인 분야에서 필수적입니다.
이 접근 방식은 또한 인공지능의 안전성과 신뢰성에 더 광범위한 의미를 가지고 있습니다. 모델이 가장 불확실한 경우를 목표로 함으로써, 잠재적인 실패 모드와 경계 사례를 자연스럽게 식별할 수 있습니다. 이 과정은 모델이 자신의 한계를 더 잘 이해하는 더 강건한 시스템을 만듭니다.
인공지능 개발의 더 광범위한 의미
이 돌파구는 AI 개발에서 효율성이 더 중요해지는 새로운 단계의 시작을 시사합니다. “클수록 좋다”는 기존 접근은 데이터 품질과 전략적 선택을 우선하는 더 정교한 방법으로 대체될 수 있습니다.
환경적 의미도 큽니다. 대형 AI 모델을 학습하려면 막대한 컴퓨팅 자원과 에너지가 필요합니다. 훨씬 적은 데이터로 비슷한 성능을 달성할 수 있다면 AI 개발의 탄소 발자국을 크게 줄일 수 있습니다.
민주화 효과도 중요할 수 있습니다. 이전에 대량의 데이터 수집을 할 수 없었던 작은 연구 팀과 조직은 이제 경쟁력 있는 인공지능 시스템을 개발할 수 있는 길을 가지고 있습니다. 이 개발은 인공지능 개발에서 혁신을 가속화하고 더 다양한 관점을 만들 수 있습니다.
한계와 고려 사항
이 방법론은 유망한 결과를 보였지만 현실적인 과제도 있습니다. 전문 주석 작업자가 필요하므로 전문 지식이나 평가 기준이 부족한 분야에는 적용하기 어렵습니다. 연구도 주로 분류 작업과 콘텐츠 안전 분야에 집중했습니다. 언어 생성이나 추론 같은 다른 AI 작업에서도 똑같이 극적인 개선이 나타날지는 아직 확인되지 않았습니다.
액티브 러닝의 반복적인 특성은 전통적인 배치 처리 접근 방식에 비해 복잡성을 도입합니다. 조직은 지속적인 모델 개선을 가능하게 하는 쿼리-응답 주기를 지원하는 새로운 워크플로와 인프라를 개발해야 합니다.
미래의 연구는 전문가 수준의 어노테이션 품질을 자동화하는 접근 방식과 핵심 방법론의 도메인별 적응을 탐구할 것입니다. 액티브 러닝 원칙과 다른 효율성 기술, 예를 들어 매개변수 효율적인 미세 조정을 결합하면 추가적인 성능 향상을 얻을 수 있습니다.
결론
구글의 연구는 목표한, 높은 품질의 데이터가 대량의 데이터보다 더 효과적일 수 있음을 보여주었습니다. 가장 가치 있는 예제만 레이블링함으로써, 그들은 훈련 요구량을 10,000배 줄이면서 성능을 개선했습니다. 이 접근 방식은 비용을 낮추고, 개발을 가속화하며, 환경적 영향을 줄이며, 고급 인공지능을 더 접근 가능하게 합니다. 이는 효율적이고 지속 가능한 인공지능 개발로의 중요한 전환을 나타냅니다.












