프롬프트 엔지니어링

사고 우선순위 최적화의 넘어서: 思想 우선순위 최적화가 대규모 언어 모델을 어떻게 발전시키는가

mm
Unite.AI를 Google의 선호 소스에 추가

메타, UC 버클리, NYU의 연구자 팀이 개발한 획기적인 새로운 기술인 “사고 우선순위 최적화“(Thought Preference Optimization, TPO)는 AI 시스템이 일반 작업에 접근하는 방식을 향상시키는 것을 목표로 합니다. 이 방법은 대규모 언어 모델(LLM)을 더 생각이 깊고 의도적인 응답을 하는 모델로 만들기 위해 설계되었습니다.

TPO를 개발한 공동 연구는 AI 연구를 선도하는 기관들의 전문 지식을 결합합니다.

사고 우선순위 최적화의 메커니즘

TPO의 핵심은 AI 모델이 최종 답변을 생성하기 전에 “사고 단계”를 생성하도록 유도하는 것입니다. 이 과정은 인간의 인지 과정을 모방하며, 우리는 종종 문제나 질문에 대한 답변을 제시하기 전에 생각을 합니다.

이 기술에는 몇 가지 주요 단계가 있습니다:

  1. 모델은 질의에 대한 답변을 생성하기 전에 사고 단계를 생성하도록 지시받습니다.
  2. 여러 개의 출력이 생성되며, 각 출력에는自己的 사고 단계와 최종 답변을 포함합니다.
  3. 평가 모델은 사고 단계 자체가 아닌 최종 답변만을 평가합니다.
  4. 모델은 이러한 평가를 기반으로 사고 우선순위 최적화를 통해 훈련됩니다.

이 접근 방식은 이전 기술, 즉 사고 연쇄(Chain-of-Thought, CoT) 프롬프팅과 크게 다릅니다. CoT는 주로 수학 및 논리 작업에 사용되었지만 TPO는 다양한 유형의 질의 및 지시에 대한 보다 넓은 적용 범위를 갖도록 설계되었습니다. 또한 TPO는 사고 과정에 대한 명시적인 감독이 필요하지 않으므로 모델이 효과적인 사고 전략을 개발할 수 있습니다.

또 다른 주요 차이점은 TPO가 인간의 사고 과정을 포함하는 제한된 훈련 데이터의 문제를 극복한다는 것입니다. 최종 출력에 대한 평가에 중점을 둡으로써 TPO는 더 유연하고 다양한 사고 패턴이 나타날 수 있도록 합니다.

실험 설정 및 결과

TPO의 효과를 테스트하기 위해 연구자들은 AI 언어 모델 분야의 두 가지 주요 벤치마크인 AlpacaEval 및 Arena-Hard를 사용하여 실험을 수행했습니다. 이러한 벤치마크는 다양한 작업에 대한 AI 모델의 일반적인 지시 따름 능력을 평가하기 위해 설계되었습니다.

실험에서는 Llama-3-8B-Instruct를 시드 모델로 사용했으며, 평가를 위해 다른 판정 모델을 사용했습니다. 이 설정은 연구자들이 TPO의 성능을 기준 모델과 비교하고 다양한 작업에 대한 영향력을 평가할 수 있도록 허용했습니다.

이러한 실험의 결과는 여러 범주에서 개선 사항을 보여주었습니다:

  1. 추론 및 문제 해결: 예상대로 TPO는 논리적思考 및 분석이 필요한 작업에서 성과를 보였습니다. 
  2. 일반 지식: 흥미롭게도, 이 기술은 사실 정보와 관련된 질의에 대한 성능도 개선했습니다. 
  3. 마케팅: 아마도 예상치 못하게, TPO는 마케팅 및 판매와 관련된 작업에서 향상된 능력을 보여주었습니다. 
  4. 창의적 작업: 연구자들은 창의적 글쓰기와 같은 분야에서 잠재적인 이점을 언급했으며, “사고”가 창의적 출력의 계획 및 구조화에 도움이 될 수 있다고 제안했습니다.

이러한 개선 사항은 전통적인 추론 중심 작업에만 국한되지 않았으며, TPO가 다양한 응용 프로그램에서 AI 성능을 향상시킬 수 있는 잠재력을 보였습니다. AlpacaEval 및 Arena-Hard 벤치마크의 승리율은 기준 모델보다 상당한 개선을 보여주었으며, TPO는 훨씬 더 큰 언어 모델과 비교하여 경쟁력 있는 결과를 달성했습니다.

그러나 현재 TPO 구현에는 일부 제한이 있었습니다. 특히 수학 작업에서 성능이 기준 모델보다 저하되었습니다. 연구자들은 이 문제를 해결하기 위해 추가적인 세부 사항이 필요할 수 있다고 지적했습니다.

AI 개발에 대한 영향

TPO의 성공은 다양한 범주에서 성능을 향상시키는 데 새로운 가능성을 열어줍니다. 전통적인 추론 및 문제 해결 작업을 넘어, 이 기술은 창의적 글쓰기, 언어 번역 및 콘텐츠 생성과 같은 분야에서 AI 능력을 향상시킬 수 있습니다. AI가 복잡한 프로세스를 통해 생각한 후 출력을 생성하도록 허용함으로써, 우리는 이러한 분야에서 더 정교하고 상황에 맞는 결과를 볼 수 있습니다.

고객 서비스에서 TPO는 채팅봇 및 가상 어시스턴트가 더 생각이 깊고 포괄적인 응답을 제공하도록 할 수 있습니다. 이는 사용자 만족도를 높이고 인간의 개입을 줄일 수 있습니다. 또한 데이터 분석 분야에서 이 접근 방식은 AI가 복잡한 데이터셋에서 결론을 내리기 전에 여러 관점과 잠재적 상관관계를 고려할 수 있도록 허용할 수 있습니다. 이는 더 통찰력 있고 신뢰할 수 있는 분석을 제공할 수 있습니다.

尽管 TPO는 유망한 결과를 보여주었지만, 현재 형태에서는 몇 가지 도전을 직면해야 합니다. 수학 작업에서 관찰된 성능 저하는 이 기술이 모든 도메인에서 보편적으로 유익하지 않을 수 있음을 시사합니다. 이 제한은 도메인별 세부 사항이 필요함을 강조합니다.

또 다른重大한 도전은 계산 오버헤드의 잠재적인 증가입니다. 여러 사고 경로를 생성하고 평가하는 과정은 처리 시간과 리소스 요구를 증가시킬 수 있으며, 이는 신속한 응답이 중요한 시나리오에서 TPO의 적용 가능성을 제한할 수 있습니다.

さらに, 현재 연구는 특정 모델 크기에 초점을 맞추고 있으며, TPO가 더 큰 또는 더 작은 언어 모델에 어떻게 확장되는지에 대한疑問을 남깁니다. 또한 “과한 생각”의 위험이 있습니다. 과도한 “사고”는 단순한 작업에 대한 복잡하거나 과도한 응답으로 이어질 수 있습니다.

작업의 복잡성에 따라 사고의 깊이를 조절하는 것이 미래 연구 및 개발의 핵심 영역이 될 것입니다.

미래 방향

미래 연구의 주요 영역 중 하나는 AI의 사고 과정을 길이와 깊이를 제어하는 방법을 개발하는 것입니다. 이는 작업의 복잡성에 따라 모델이 사고의 깊이를 조정하도록 허용할 수 있습니다. 연구자들은 사용자 정의 매개변수를 탐색할 수도 있으며, 이는 사용자가 다양한 응용 프로그램에 대한 원하는 사고 수준을 지정할 수 있도록 합니다.

효율성 최적화는 이 영역에서 매우 중요할 것입니다. 철저한 고려와 신속한 응답 시간 사이의 최적점을 찾는 알고리즘을 개발하면 TPO의 실제 적용 가능성을 크게 향상시킬 수 있습니다.

AI 모델이 크기와 능력에서 계속 성장함에 따라, TPO가 모델 크기와 함께 어떻게 확장하는지 조사하는 것이 중요할 것입니다. 미래 연구 방향에는 다음이 포함될 수 있습니다:

  • 최첨단 대규모 언어 모델에서 TPO를 테스트하여 더 발전된 AI 시스템에 대한 영향을 평가합니다. 
  • 더 큰 모델이 사고 생성 및 평가를 위한 다른 접근 방식을 요구하는지 조사합니다. 
  • TPO가 더 작은 모델과 더 큰 모델 사이의 성능 격차를 메우는 데 잠재적으로 사용될 수 있는지 탐색합니다. 이는 계산 리소스의 더 효율적인 사용으로 이어질 수 있습니다.

이러한 연구는 점점 더 복잡한 작업을 처리할 수 있는 더 정교한 AI 시스템을 가능하게 할 수 있으며, 효율성과 정확성을 유지할 수 있습니다.

결론

사고 우선순위 최적화는 대규모 언어 모델의 능력을 향상시키는 데 중요한 단계를 나타냅니다. AI 시스템이 “말하기 전에 생각하도록” 허용함으로써, TPO는 다양한 작업에서 개선 사항을 보여주었으며, 이는 AI 개발 방식을 혁신적으로 바꿀 수 있습니다.

이 분야의 연구가 계속 진행됨에 따라, 우리는 이 기술의 추가적인 세부 사항과 적용 범위의 확장을 기대할 수 있습니다. AI의 미래는 정보를 처리하는 것뿐만 아니라 더 인간적인 인지 과정을 포함하는 시스템으로 구성될 수 있으며, 이는 더 정교하고 상황에 맞는 결과를 제공하는 더 유용한 인공 지능으로 이어질 수 있습니다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.