Anderson의 관점

언어 모델에서 정확도 감소와 관련된冗長性

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image of a man literally up to his neck in printed verbiage. GPT-1.5.

새로운 연구에 따르면 대형 언어 모델이 더 짧은 답변을 제공하도록 강제하면 답변의 정확도와 품질이 현저히 향상된다고 합니다.

 

채팅봇이 ‘말 많다’는 것을 경험해 본 사람이라면 새로운 연구의 결론을 쉽게 이해할 수 있을 것입니다. 즉, AI에게 더 짧은 답변을 요구하면 더 정확해진다는 것입니다.

대형 AI 채팅봇이 작은 것보다 나쁨으로 작용하는 이유를 조사하기 위해, 연구진은 31개의 대형 언어 모델을 평가했습니다. 이 모델들은 역방향 스케일링이라고 하는 특정 경우에서 더 나쁨으로 작용하는 것으로 나타났습니다. 연구에 따르면, 31개의 인기 있는 대형 언어 모델을 더 짧은 답변을 제공하도록 강제하면 답변의 정확도가 최대 26.3%까지 향상된다고 합니다.

‘결과는 명확한 인과관계를 제공합니다. 간결성 제약이 대형 모델의 정확도를 26.3 퍼센트 포인트 향상시키고 역방향 스케일링 격차를 67% 줄였습니다(44.2%에서 14.8%로, 쌍대 t-검정: t = 7.80, p < 0.0001).'

과도한冗長性는 최종 사용자들 사이에서 빈번한 불만입니다. 특히 ChatGPT와 같은 상업용 모델을 사용하는 사람들 사이에서 이러한 문제가 빈번하게 발생합니다. 지원 포럼에서는 이 문제에 대한 토론이 자주 이루어집니다.

대형 언어 모델이冗長性을 보이는 도메인은 주로 수학입니다. 여기서 AI는 50단어 이내로 답변하도록 제한되었습니다. 읽기 이해과 같은 태스크에서는 답변을 10단어 이내로 제한했습니다.

이 논문은 AI의冗長性을 과도한思考으로 정의합니다. 여기서 중심 메시지는 단순히 말多로 가려지지 않을 뿐만 아니라 때때로 부정적인 영향을 받기도 합니다. 모델이 작을수록 이 해결책이 필요하지 않거나 작동하지 않는다는 것을 논문은 관찰합니다.

연구진은 이 해결책을 체계적으로 적용하기 위해 구조적인 문제가 없다고 결론지었습니다. 그러나 사용자의 채팅 세션에서 간결성을 향상시키는 지시를 반복해야 할 수 있습니다. 반면에 ChatGPT와 같은 플랫폼에서 기본적으로 구현된 시스템 프롬프트는 더 짧은 답변을 기본 동작으로 만들 수 있습니다.

풍성한 바람

이 모든 것이 더 큰 모델이 왜冗長性을 보이는지 정확히 설명하지는 않습니다. 이는 오픈 소스 모델에도 영향을 미치는 문제입니다. 논문은 강화 학습에서 인간의 피드백(RLHF) 기술의 프로토콜과 일반적인 관행이 설명을 제공할 수 있다고 제안합니다.

‘그럴듯한 기원은 RLHF 정렬 훈련에서 인간 주석자가 더 큰 모델에서 길이 보상을 과도하게獎勵하는 데 있습니다. 이것은 길이와 품질을 혼동하는 보상 모델의 체계적인 길이 편향과 일관됩니다.’

‘이전 연구는 길이와 품질을 혼동하는 보상 모델의 체계적인 길이 편향을 문서화했습니다. 더 큰 모델은 길이 보상을 만족시키는 능력이 더 크기 때문에冗長한 생성을 더 깊숙이 내면화할 수 있습니다. 이것은 우리가 관찰하는 규모 종속적인 과도한思考을 생성합니다.’

인간의 경우,冗長性은 침묵을 메우거나 불편함을 가리기 위해 발생할 수 있습니다. 또한 정신 건강 문제로 인해 발생할 수 있습니다. 효과적으로 AI는 이러한 요인으로부터 영향을 받을 수 없습니다. 훈련 데이터가 이러한 특성을 반영하거나 나타낼 때만 영향을 받습니다.

데이터셋 코퍼스에는冗長한 답변에 대한 다른 동기가 있습니다. 예를 들어, SEO를 위해 더 긴 텍스트 콘텐츠를 생성하는 경우가 있습니다. 예를 들어, 레시피 게시물에서 길이가 권위와 관련이 있다고 생각하는 경우가 있습니다.

무엇이 완전히 배제될 수 없는지는 API 기반 플랫폼이 더冗長한 답변을鼓勵하거나 감시하지 않는다는 것입니다. 왜냐하면 이것은 토큰 사용을 증가시킵니다. 그리고過度한推論이나 RAG 호출이 필요하지 않기 때문입니다.

새로운 논문은 대형 언어 모델에서 간결성 제약이 성능 계층을 역전시킵니다라는 제목으로 스웨덴 폴리테χνیک 인스티튜트(Chattogram, 방글라데시)의 컴퓨터 과학부에서 나왔습니다.

방법

이 논문의 가설을 테스트하기 위해, 31개의 언어 모델을 평가했습니다. 여기에는 너무 많은 모델이 있으므로 텍스트 형식으로 나열하기 어렵습니다. 하지만 아래에 있는 이미지에 나타나 있습니다.

새로운 논문에서 테스트된 대형 언어 모델

새로운 논문에서 테스트된 대형 언어 모델

이 모델들은 다섯 가지 벤치마크 컬렉션에 대해 평가되었습니다. GSM8K는 수학적推論을 위해, BoolQ는 읽기 이해를 위해, CommonsenseQA는 상식推論을 위해, ARC-Easy는 과학 질문을 위해, 그리고 MMLU-STEM는 과학 지식을 위해 사용되었습니다.

답변은 탐욕적 디코딩을 사용하여 생성되었으며, 결정적 출력을 보장하기 위해 사용되었습니다. 그런 다음 태스크별 규칙을 사용하여 추출되었으며, 정확도는 정답의 비율로 측정되었습니다.

모델은 크기에 따라 나누어졌습니다. 10억 매개변수 이하의 모델은 ‘작은’ 모델로, 70억 매개변수 이상의 모델은 ‘큰’ 모델로 분류했습니다. 이는 관찰된 성능 격차에 기인합니다.

역방향 스케일링은 이러한 그룹의 각 문제에 대한 성능을 비교하여 측정되었습니다. 더 작은 모델이 더 큰 모델을 능가하는 경우를 표시했습니다. 통계적 효과 크기를 사용하여 이러한 격차가 노이즈가 아닌 의미 있는 차이임을 확인했습니다.

회상 규칙

모델이 단순히 훈련 데이터를 회상하는 가능성을 배제하기 위해, 세 가지 별도의 검사를 수행했습니다. 답변의 다양성을 조사했습니다. 답변의 길이가 얼마나 변하는지 조사했습니다. 또한 오류가 어떻게 발생하는지 조사했습니다. 모델이 기억된 패턴에 의존한다면, 답변은 반복되거나 고정된 템플릿을 따를 것입니다. 그러나 답변은 대부분 고유했습니다. 또한 길이의 현저한 변동이 있었습니다.

오류도 직접 조사했습니다. 대부분의 실패는 짧고 회피적인 답변보다는 긴 잘못된 설명의 형태를 띠었습니다. 이것은 모델이 실제 推論을 생성하고 있음을 나타냅니다.

데이터 및 테스트

개별 질문에 대한 테스트에서, 벤치마크 태스크의 상당 부분이 정보가 없었습니다. 27.1%의 태스크는 모델을 구별하지 못했습니다. 모든 시스템이 성공하거나 모든 시스템이 실패했기 때문입니다. 이는 상대적인 성능에 대한 실제 신호가不存在했습니다.

다섯 가지 벤치마크에서 문제 수준의 분해

다섯 가지 벤치마크에서 문제 수준의 분해

모델을 구별하는 태스크 중 대부분은 예상대로 작동했습니다. 더 큰 시스템이 더 나았습니다. 그러나 더 작은 모델이 더 나은 성능을 보이는 작은 그룹이 있었습니다. 모든 문제에서 역방향 스케일링은 7.7%의 경우에서 발생했습니다. 이는 이 효과가 주변적인 것이 아니라는 것을 나타냅니다.

역방향 스케일링 표면

다섯 가지 벤치마크에서, 115개의 문제가 더 작은 모델이 더 큰 모델을 능가하는 경우로 나타났습니다. 이는 모든 태스크의 7.7%를 차지했습니다. 이는 역방향 스케일링이 이 contexto에서 드문 현상이 아니라는 것을 나타냅니다.

사실, 이 효과는 모든 데이터셋에서 나타났습니다. BoolQ에서 가장 강하게, CommonsenseQA, ARC-Easy, GSM8K, MMLU-STEM에서 약하게 나타났습니다. 이는 이 효과가 광범위하지만 태스크에 따라 다르다는 것을 나타냅니다.

다섯 가지 벤치마크에서 역방향 스케일링

다섯 가지 벤치마크에서 역방향 스케일링

격차의 크기는 상당했습니다. 더 작은 모델이 평균 28.4 퍼센트 포인트 앞섰습니다. 모든 경우에서 같은 방향의 이점이 있었습니다. 이는 일시적인 오류가 아닌 일관된 성능 저하를 나타냅니다.

이와 같은 패턴은 다양한 모델 패밀리에서 유지되었습니다. 이는 더 큰 모델이 더 작은 모델보다 성능이 떨어지는 것을 나타냅니다. 이는 규모 자체에 묶여 있는 것으로 보입니다.

과도한思考

더 큰 모델이 특정 도메인에서 더 나쁨으로 작용하는 이유를 조사하기 위해, 분석은 왜 이것이 발생하는지에 초점을 맞추었습니다. 과도한 설명, 즉 더 긴 답변으로 인해 올바른 推論이 가려지는 경우가 많습니다.

데이터를 통해, 더 긴 답변은 더 낮은 정확도와 관련이 있었습니다. 이는 더 큰 모델과 더 작은 모델이 비슷한 수의 推論 단계를 생성했음에도 불구하고 발생했습니다. 이는 문제가 얼마나 많은 推論을 하는지에 아니라 어떻게 표현하는지에 달려 있습니다.

간결성 제약이 모델 성능에 미치는 영향

간결성 제약이 모델 성능에 미치는 영향

답변이 더 짧아지면, 더 큰 모델의 성능이 크게 향상되었습니다. 이는 성능 격차를 줄였습니다. 때로는 역전시켰습니다. 반면에 더 작은 모델은 거의 변하지 않았습니다. 이는冗長性가 더 큰 시스템을 악화시키고 있음을 나타냅니다.

추가 분석은 더 큰 모델이 일반적으로 더 긴 출력을 생성한다는 것을 보여주었습니다. 이는 더 짧고 직접적인 답변을 제공하는 더 작은 모델과는 대조됩니다. 이는 어떻게 推論이 표현되는지에 달려 있는 것으로 보입니다.

저자는 간결성 제약이 정확도를 향상시킨다고 결론지었습니다. 이는 언어 모델의 기본 기능이 될 수 있다고 생각합니다. 사용자 세션이 끝나면 사라지는 반복적인 제약이 아닙니다. 다음과 같이 말합니다.

‘간결성 제약이 더 큰 모델에 크게 도움이 되며 더 작은 모델에는 거의 영향을 미치지 않습니다. ‘

결론

연구진은 더 큰 모델이 더 나쁨으로 작용하는 문제가 단순한 구조적인 문제가 아니라는 것을 발견했습니다. 이는 더 큰 모델이 더 많은 설명을 제공하려고 할 때 발생합니다. 이는 더 큰 모델이 더 작은 모델보다 더 나쁨으로 작용하는 이유입니다.

이 문제는 ChatGPT와 같은 오픈 소스 모델에서도 발생합니다. 또한 Claude, Gemini, Grok와 같은 다른 주요 모델에서도 발생합니다.

이 문제가 토큰 사용을 증가시키고 더 높은 수준의 구독을鼓勵한다는 사실은 이러한 모델이 이 문제를 무시하는 이유일 수 있습니다. 그러나 정확도가 떨어지는 것은 합리적인 이유가 될 수 없습니다.

이 문제가 어디에서 기인하는지에 대한 경험적 방법을 결정하는 것은 흥미롭습니다. 누구든지 채팅봇이 실제로 채팅하는 것이 아니라 사용자에게冗長한 답변을 제공하는 것을 경험해 본 사람이라면, 모델이 ‘모든 것을 하나에’ 사용자 가이드와 ‘수용된 솔루션’에 심하게 각인된 훈련 데이터를 가지고 있다는 것을 알 수 있습니다.

따라서 모델이 단계별 대화에 특화된 훈련 데이터로 훈련된 경우冗長性를 피할 수 있는지 interessant할 것입니다. 그러나 모델이 직접적으로 훈련 데이터에 대한 가중치를 부여받지 않는다면, 일부 제약이나 필터를 모델에 적용해야 할 수 있습니다.

이러한 종류의 데이터가 드물기 때문에, 이러한 접근 방식으로 앞으로 나아가는 유일한 방법은 합성 데이터를 사용하는 것입니다. 여기서 최종 결론을 대화 형식으로 분해합니다. 이것은 Google NotebookLM이 평면 텍스트 입력에서 AI 팟캐스트를 해석하는 방식과 동일합니다.

 

* 저자의 인라인 인용을 하이퍼링크로 변환했습니다.

하지만 솔직히 말해서, 실제 AI 제공 비용과 구독료 사이의 격차는 현재如此 크기 때문에, 이것은 사용자 기반의 평판을 손상시키지만 이 단계의 ‘전환’과 ‘수렴’ 단계의 심각한 기본 경제를 해결하지는 않을 것입니다.

최초 게시일: 2026년 4월 5일

기계 학습 분야 작가이자 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]