사상 리더

합성 데이터에 대한 진실: LLM 성공을 위한 인간 전문 지식의 중요성

mm
Unite.AI를 Google의 선호 소스에 추가

LLM 개발자는 개발을 가속화하고 비용을 줄이기 위해 합성 데이터를 점점 더 많이 사용하고 있습니다. LLama 3, Qwen 2, DeepSeek R1などの 상위 모델의 연구자들은 연구 논문에서 모델을 훈련하는 데 합성 데이터를 사용한 것을 언급했습니다. 외부에서 보면 완벽한 해결책으로 보입니다. 개발을 가속화하고 비용을 줄이는 정보의 무한한 원천입니다. 그러나 이 해결책에는 비즈니스 리더가 무시할 수 없는 숨겨진 비용이 있습니다.

간단히 말해서, 합성 데이터는 LLM과 AI 에이전트를 훈련, 미세 조정 및 평가하기 위한 인공 데이터 세트를 생성하기 위해 AI 모델에 의해 생성됩니다. 전통적인 인간 주석과 비교할 때, 데이터 파이프라인을 빠르게 확장할 수 있게 해주며, 이는 AI 개발의 빠르게 움직이고 경쟁적인 풍경에서 필수적입니다.

기업은 금융 또는 의료 환경에서 민감하거나 기밀 정보를 보호하기 위해匿名 버전을 생성하는 것과 같은 다른 이유로 “가짜” 데이터를 사용할 수 있습니다. 합성 데이터는 또한 독점적인 데이터가 사용할 수 없을 때, 제품을 출시하기 전에, 또는 데이터가 외부 클라이언트에 속하는 경우 좋은 대안이 될 수 있습니다.

그러나 합성 데이터는 AI 개발을 혁신하고 있습니까? 간단한答案은 예, 그러나…입니다. 합성 데이터는 큰 잠재력을 가지고 있지만, 엄격한 인간의 감시 없이도 LLM과 에이전트에 치명적인 취약성을 노출시킬 수 있습니다. LLM 프로듀서와 AI 에이전트 개발자는 합성 데이터를 충분히 검증하지 않은 AI 모델이 부정확하거나 편향된 출력을 생성할 수 있으며, 평판 위기를 일으키고 산업 및 윤리 표준을 준수하지 않을 수 있음을 발견할 수 있습니다. 합성 데이터를 정제하기 위한 인간 감시에 투자하는 것은 직접적으로 하위 라인을 보호하고, 이해관계자 신뢰를 유지하며, 책임 있는 AI 채택을 보장하는 데 투자하는 것입니다.

인간의 입력으로 합성 데이터를 높은 품질의 훈련 데이터로 변환할 수 있습니다. 생성된 데이터를 사용하기 전에 세 가지 중요한 이유로 정제해야 합니다. 첫째, 소스 모델 지식의 격차를 메우기 위해서입니다. 둘째, 데이터 품질을 개선하고 샘플 크기를 줄이기 위해서입니다. 셋째, 인간의 가치와 일치시키기 위해서입니다.

고유한 지식을 캡처해야 합니다

합성 데이터는 주로 공개적으로 사용 가능한 인터넷 소스에서 훈련된 LLM에 의해 생성되므로, 내재된 제한이 있습니다. 공개 콘텐츠는 드물게 실제 작업에서 사용되는 실용적인 지식을 캡처합니다. 마케팅 캠페인을 설계하거나, 재무 예측을 준비하거나, 시장 분석을 수행하는 것과 같은 활동은 일반적으로 사적이며 온라인에서 문서화되지 않습니다. 또한, 이러한 소스는 미국 중심의 언어와 문화를 반영하여 글로벌 대표성을 제한합니다.

이러한 제한을 극복하기 위해, 우리는 전문가를 참여시켜 합성 데이터 생성 모델이 커버할 수 없는 영역에서 데이터 샘플을 생성할 수 있습니다. 기업의 예를 다시 살펴보면, 최종 모델이 재무 예측과 시장 분석을 효과적으로 처리하도록 하려면, 훈련 데이터에는 이러한 분야의 실제 작업이 포함되어야 합니다. 이러한 격차를 식별하고 전문가가 생성한 샘플로 합성 데이터를 보완하는 것이 중요합니다.

전문가는 프로젝트 초기에 작업 범위를 정의하는 데 참여합니다. 이는 모델이 수행해야 하는 지식의 특정 영역을 개요하는 분류법을 생성하는 것을 포함합니다. 예를 들어, 의료 분야에서는 일반적인 의학을 영양, 심장 건강, 알레르기 등과 같은 하위 주제로 나눌 수 있습니다. 의료에 중점을 둔 모델은 커버해야 하는 모든 하위 영역에서 훈련되어야 합니다. 분류법이 의료 전문가에 의해 정의된 후, LLM은 일반적인 질문과 답변을 빠르게 생성할 수 있습니다. 그러나 인간 전문가는 이 콘텐츠를 검토, 수정 및 개선하여 정확성과 안전성, 그리고 상황적 적절성을 보장하기 위해 필요합니다. 높은 위험도 응용 프로그램인 의료 분야에서 데이터 정확성과 잠재적인 피해를 완화하기 위해 이러한 품질 보증 프로세스가 필수적입니다.

품질이 양보다 중요합니다: 더 적은 샘플로 모델 효율성을 높이는 것

도메인 전문가가 LLM과 AI 에이전트를 훈련하기 위한 데이터를 생성할 때, 분류법을 생성하고, 프롬프트를 작성하고, 이상적인 답변을 작성하거나, 특정 작업을 시뮬레이션합니다. 모든 단계는 모델의 목적에 따라 신중하게 설계되며, 품질은 해당 분야의 전문가에 의해 보장됩니다.

합성 데이터 생성은 이 프로세스를 완전히 복제하지 못합니다. 생성된 데이터의 품질은 종종 인간이 큐레이션한 데이터에 비해 낮습니다. 이는 합성 데이터가 만족할 만한 결과를 얻기 위해 더 큰 볼륨이 필요하다는 것을 의미하며, 이는 계산 비용과 개발 시간을 증가시킵니다.

복잡한 도메인에서는 인간 전문가만이 식별할 수 있는 세부 사항이 있습니다. 특히 이상치나 에지 케이스에서, 인간이 큐레이션한 데이터는 일관되게 더 나은 모델 성능을 제공하며, 훨씬 더 작은 데이터 세트로도 효과적으로 작동할 수 있습니다. 인간 전문 지식을 데이터 생성 프로세스에 전략적으로 통합함으로써, 모델이 효과적으로 작동하는 데 필요한 샘플 수를 줄일 수 있습니다.

우리의 경험에 따르면, 이 문제를 해결하는 가장 좋은 방법은 합성 데이터 세트를 구축하는 데 주제 전문가를 참여시키는 것입니다. 전문가가 데이터 생성 규칙을 정의하고, 데이터 분류법을 정의하며, 생성된 데이터를 검토하거나 수정할 때, 최종 데이터의 품질은 훨씬 더 높아집니다. 이 접근 방식은 클라이언트가 더 적은 샘플을 사용하여 강력한 결과를 달성할 수 있도록 해주었으며, 더 빠르고 효율적인 생산으로 이어졌습니다.

신뢰를 구축하기: AI 안전성과 일치에서 인간의 역할

자동화된 시스템은 모든 취약점을 예측하거나 인간의 가치와 일치하는 것을 보장할 수 없습니다. 특히 에지 케이스와 모호한 시나리오에서, 전문가 검토자는 중요한 역할을 합니다. 그들은 잠재적인 위험을 식별하고, 배포 전에 윤리적인 결과를 보장하는 데 중요합니다. 이는 AI가 현재 완전히 제공할 수 없는 보호 層입니다.

따라서, 강력한 레드 팀 데이터 세트를 구축하기 위해 합성 데이터만으로는 충분하지 않습니다. 프로세스의 초기에 보안 전문가를 참여시키는 것이 중요합니다. 그들은 잠재적인 공격 유형을 매핑하고, 데이터 세트의 구조를 안내할 수 있습니다. LLM은 높은 볼륨의 예제를 생성할 수 있습니다. 그러나 전문가는 데이터를 검증하고, 정제하여, 실제적이고, 높은 품질이며, AI 시스템을 테스트하기에 유용한지 확인해야 합니다. 예를 들어, LLM은 표준적인 해킹 프롬프트를 수천 개 생성할 수 있지만, 인간 보안 전문가는 사회 공학 공격과 같은 창의적인 위협을 설계할 수 있습니다. 이는 자동화된 시스템이 스스로 발명하기 어려운 심리적 편향을 이용하는 것입니다.

LLM을 자동 피드백을 사용하여 일치시키는 데에는 상당한 진행이 있었습니다. “RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback”라는 논문에서, 연구자들은 AI 기반의 일치가 많은 경우에 인간 피드백과 비교할 수 있음을 보여주었습니다. 그러나 AI 피드백은 모델이 개선됨에 따라 개선되지만, 우리의 경험에 따르면, RLAIF는 복잡한 도메인과 에지 케이스 또는 이상치에서仍然 어려움을 겪습니다. 인간 전문가는 작업의 세부 사항과 상황을 처리하는 데 더 효과적이며, 따라서 일치에 더 신뢰할 수 있습니다.

AI 에이전트도 안전성 위험을 해결하기 위해 자동화된 테스트에서 혜택을 받습니다. 가상 테스트 환경은 에이전트의 행동을 시뮬레이션하기 위해 생성된 데이터를 사용합니다. 실제 시나리오에서 테스트 커버리지의 최대화를 위해, 인간 전문 지식은 테스트 케이스를 설계하고, 자동 평가의 결과를 검증하며, 취약성을 보고하는 데 중요합니다.

합성 데이터의 미래

합성 데이터는 특히 확장성과 빠른 배포가 오늘날의 빠르게 움직이는 풍경에서 중요한 경우에, 대규모 언어 모델을 개발하는 데 매우 가치 있는 기술입니다. 합성 데이터 자체에는 근본적인 결함은 없지만, 그 잠재력을 완전히 발휘하고 가장 큰 가치를 제공하기 위해 정제가 필요합니다. 자동화된 데이터 생성과 인간 전문 지식을 결합하는 하이브리드 접근 방식은, 최종 모델 성능은 총 볼륨보다 데이터 품질에 더 많이 의존하기 때문에, 능력 있고 신뢰할 수 있는 모델을 개발하는 데 매우 효과적인 방법입니다. 이 통합 프로세스는 AI를 사용하여 확장성과 인간 전문가를 사용하여 검증을 통해, 더 강력한 모델을 생성하며, 안전성과 일치가 개선되어, 사용자 신뢰를 구축하고, 책임 있는 배포를 보장하는 데 필수적인 모델을 생성합니다.

일리야 코치크(Ilya Kochik)는 톨로카(Toloka)의 비즈니스 개발 부사장으로, 주요 GenAI 연구소의 인간 데이터 파트너이며, 최전선 모델과 에이전트 시스템을 위한 최첨단 작업에 전문가입니다. 런던에 기반을 두고 있으며, 그의 배경에는 구글, 퀀텀블랙(QuantumBlack, 맥킨지의 AI), 베인 앤 컴퍼니(Bain & Company)에서의 리더십과 기술 역할이 있습니다.