AI 모델 및 플랫폼

구글, AI 훈련 데이터 요구량을 10,000배 줄인 방법

mm
Unite.AI를 Google의 선호 소스에 추가

인공지능 산업은 근본적인 역설에 직면해 있습니다. 기계가大量의 데이터를 처리할 수 있게 되었지만, 학습은 놀랍게도 비효율적이며, 감소하는 수익의 문제에 직면해 있습니다. 전통적인 기계 학습 접근 방식은大量의 레이블이 붙은 데이터셋을 요구하며, 이는 수백만 달러의 비용과 수년의 시간이 걸릴 수 있습니다. 이러한 접근 방식은 일반적으로 더 많은 데이터가 더好的 AI 모델을 만든다는 믿음에 기반합니다. 그러나 구글 연구진은 최근에 이 오랜 믿음을 도전하는 혁신적인 방법을 제시했습니다. 그들은 유사한 AI 성능을 10,000배 적은 훈련 데이터로 달성할 수 있음을 보여주었습니다. 이 개발은 궁극적으로 AI를 접근하는 방식을 근본적으로改变할 수 있습니다. 이 기사에서는 구글 연구진이 이 돌파구를 어떻게 달성했는지, 이 개발의 잠재적인 미래 영향, 그리고 앞으로의 도전과 방향에 대해探구하겠습니다.

인공지능에서 빅데이터의 도전

수십년 동안, “더 많은 데이터는 더好的 AI”라는 믿음이 산업의 AI 접근 방식을 주도해 왔습니다. 큰 언어 모델 seperti GPT-4는 훈련 과정에서 수조개의 토큰을 소비합니다. 이 데이터에飢하는 접근 방식은 광범위한 자원이나 전문 데이터셋이 없는 조직들에게 상당한 장벽을 만듭니다. 첫째, 인간 레이블링의 비용은 상당히 높습니다. 전문가 어노테이터는 높은 비용을 청구하며, 필요한 데이터의 양이 많아 프로젝트가 비싸질 수 있습니다. 둘째, 수집된 대부분의 데이터는 종종冗余적이며 학습 과정에서 중요한 역할을 하지 못할 수 있습니다. 전통적인 방법은 또한 변경되는 요구사항에 어려움을 겪습니다. 정책이 변경되거나 새로운 유형의 문제가 발생할 때, 회사는 레이블링 과정을 처음부터 다시 시작해야 합니다. 이 과정은 비싼 데이터 수집과 모델 재훈련의不断한 цик스를 만듭니다.

액티브 러닝으로 빅데이터 도전 해결

이 데이터 도전을 해결하는 알려진 방법 중 하나는 액티브 러닝을 강화하는 것입니다. 이 접근 방식은 인간 레이블링을 위해 가장 가치 있는 훈련 예제를 신중하게 선별하는 과정에 의존합니다. 기본 아이디어는 모델이 모든 उपलब있는 데이터를 수동적으로 소비하는 것보다 혼란스러운 예제에서 더 잘 학습한다는 것입니다. 전통적인 AI 방법과 달리, 액티브 러닝은大量의 데이터셋이 아닌 가장 정보가 풍부한 예제를 수집하는 전략적인 접근 방식을 취합니다. 이 접근 방식은 명백하거나冗余한 데이터를 레이블링하는 비효율성을 피하는 데 도움이 됩니다. 대신, 액티브 러닝은 모델의 성능을 크게 개선할 수 있는 불확실한 예제와 경계 사례를 목표로 합니다.

전문가의 노력을 이러한 핵심 예제에 집중시키면, 모델은 더 적은 데이터 포인트로 더 빠르고 효과적으로 학습할 수 있습니다. 이 접근 방식은 데이터 병목 현상과 전통적인 기계 학습 접근 방식의 비효율성을 동시에 해결할 수 있습니다.

구글의 액티브 러닝 접근 방식

구글의 연구 팀은 이 패러다임을 성공적으로 적용했습니다. 그들의 새로운 액티브 러닝 방법론은 신중하게 선별된, 높은 품질의 예제가大量의 레이블이 붙은 데이터를 대체할 수 있음을 보여주었습니다. 예를 들어, 그들은 모델이 500개의 전문가 레이블이 붙은 예제만으로 100,000개의 전통적인 레이블이 붙은 데이터와 동일하거나 더好的 성능을 달성할 수 있음을 보여주었습니다.

이 과정은 구글이 “LLM-as-Scout” 시스템이라고 부르는 방식으로 작동합니다. 큰 언어 모델은 먼저大量의 레이블이 붙지 않은 데이터를 스캔하여 가장 불확실한 경우를 식별합니다. 이러한 경계 사례는 모델이 인간의 지침을 통해 의사 결정 능력을 향상시키기 위해 가장 필요한 시나리오를 나타냅니다. 이 과정은 기본 모델이 큰 데이터셋을 기본 프롬프트를 사용하여 레이블링하는 초기 단계에서 시작됩니다. 시스템은 예제를 예측된 분류에 따라 클러스터링하고 모델이 다른 분류 사이에서 혼동을 보이는 영역을 식별합니다. 이러한 중복 클러스터는 인간의 전문 지식이 가장 가치 있는 지점을 나타냅니다.

이 방법론은 레이블이 다른 경우에 가장 가까운 예제 쌍을 명시적으로 목표로 합니다. 이러한 경계 사례는 인간 전문 지식이 가장 중요한 시나리오를 나타냅니다. 이러한 혼란스러운 예제에 전문가 레이블링 노력을 집중시키면, 시스템은驚異的な 효율성 향상을 달성할 수 있습니다.

품질이 양보다 중요

이 연구는 데이터 품질에 대한 중요한 발견을 보여주며, 이는 인공지능에서 일반적인 가정에 도전합니다. 전문가 레이블이 높은忠実度를 가지고 있으며,大量의 크라우드소싱된 어노테이션보다 일관性이 더 높음을 보여주었습니다. 그들은 코헨의 카파라는 통계 도구를 사용하여 모델의 예측이 전문가의 의견과 얼마나 잘 일치하는지 평가했습니다. 구글의 실험에서, 전문가 어노테이터는 코헨의 카파 점수가 0.8 이상을 달성했으며, 이는 일반적으로 크라우드소싱에서 제공하는 것보다 더 높습니다.

이 높은 일관성은 모델이 훨씬 더 적은 예제에서 효과적으로 학습할 수 있도록 합니다. Gemini Nano-1과 Nano-2의 테스트에서, 모델은 250-450개의 신중하게 선택된 예제만으로 전문가와의 일치도를 달성했으며, 이는 약 100,000개의 랜덤한 크라우드소싱된 레이블과 동일했습니다. 이는 3-4차례의 규모의 감소입니다. 그러나 이점은 데이터의 양을 줄이는 것만이 아닙니다. 이 접근 방식으로 훈련된 모델은 전통적인 방법으로 훈련된 모델보다 더好的 성능을 보여주었습니다. 복잡한 작업과 더大的 모델에서, 성능 향상은 기준선보다 55-65%에 달했습니다.

이번 돌파구가 중요한 이유

이 개발은 인공지능 산업에서 중요한 시기에 발생했습니다. 모델이 더 크고 더 복잡해짐에 따라, 전통적인 접근 방식은 더 이상 지속 가능하지 않게 되었습니다.大量의 모델을 훈련시키는 환경 비용은 계속 증가하고 있으며, 많은 조직들에게 높은 경제적 장벽이 있습니다.

구글의 방법은 여러 산업의 도전을 동시에 해결합니다. 레이블링 비용의 감소는 인공지능 개발을 더 많은 조직과 연구 팀에게 접근 가능하게 합니다. 더 빠른 반복 주기는 요구사항의 변경에 신속하게 대응할 수 있게 합니다. 이는 콘텐츠 모더레이션이나 사이버 보안과 같은 동적인 분야에서 필수적입니다.

이 접근 방식은 또한 인공지능의 안전성과 신뢰성에 더广泛한 의미를 가지고 있습니다. 모델이 가장 불확실한 경우를 목표로 함으로써, 잠재적인 실패 모드와 경계 사례를 자연스럽게 식별할 수 있습니다. 이 과정은 모델이 자신의 한계를 더 잘 이해하는 더 강건한 시스템을 만듭니다.

인공지능 개발의 더廣泛한 의미

이번 돌파구는 인공지능 개발에서 효율성이 더 중요해지는 새로운 단계에 진입할 수 있음을 시사합니다. “더大き면 더 좋다”라는 전통적인 접근 방식은 더 복잡한 방법으로 대체될 수 있습니다. 이러한 방법은 데이터의 품질과 전략적인 선택을 우선시합니다.

환경적 의미는 상당합니다. 큰 인공지능 모델을 훈련시키는 것은大量의 컴퓨팅 자원과 에너지 소비를 필요로 합니다. 만약 유사한 성능을 훨씬 더 적은 데이터로 달성할 수 있다면, 인공지능 개발의탄소足跡을 크게 줄일 수 있습니다.

민주화 효과도 중요할 수 있습니다. 이전에大量의 데이터 수집을 할 수 없었던 작은 연구 팀과 조직은 이제 경쟁력 있는 인공지능 시스템을 개발할 수 있는 길을 가지고 있습니다. 이 개발은 인공지능 개발에서 혁신을 가속화하고 더 다양한 관점을 만들 수 있습니다.

한계와 고려 사항

尽管이 방법론이_promising한 결과를 보여주고 있지만, 실제적인 도전을 직면하고 있습니다. 전문가 어노테이터를 요구하는 것은 전문 지식이나 평가 기준이 없는 분야에서는 적용하기 어렵습니다. 이 연구는 주로 분류 작업과 콘텐츠 안전 응용 프로그램에 중점을 두고 있습니다. 동일한劇적인 개선이 언어 생성이나 추론과 같은 다른 유형의 인공지능 작업에 적용될 수 있는지 여부는まだ 확인되지 않았습니다.

액티브 러닝의 반복적인 특성은 전통적인 배치 처리 접근 방식에 비해 복잡성을 도입합니다. 조직은 지속적인 모델 개선을 가능하게 하는 쿼리-응답 주기를 지원하는 새로운 워크플로와 인프라를 개발해야 합니다.

미래의 연구는 전문가 수준의 어노테이션 품질을 자동화하는 접근 방식과 핵심 방법론의 도메인별 적응을 탐구할 것입니다. 액티브 러닝 원칙과 다른 효율성 기술, 예를 들어 매개변수 효율적인 미세 조정을 결합하면 추가적인 성능 향상을 얻을 수 있습니다.

결론

구글의 연구는 목표한, 높은 품질의 데이터가大量의 데이터보다 더 효과적일 수 있음을 보여주었습니다. 가장 가치 있는 예제만 레이블링함으로써, 그들은 훈련 요구량을 10,000배 줄이면서 성능을 개선했습니다. 이 접근 방식은 비용을 낮추고, 개발을 가속화하며, 환경적 영향을 줄이며, 고급 인공지능을 더 접근 가능하게 합니다. 이는 효율적이고 지속 가능한 인공지능 개발로의 중요한 전환을 나타냅니다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.