Anderson의 관점
연구 결과, 조금의 잘못된 데이터도 미세 조정된 AI를 망칠 수 있음

새로운 연구에 따르면, ChatGPT를わずかな 양의 잘못된 데이터로 미세 조정하면 안전하지 않게 되고, 신뢰할 수 없게 되며, 주제에서 크게 벗어날 수 있다. 훈련 데이터에서 10%의 잘못된 답변은 성능을 깨뜨리기 시작하며, 25%의 잘못된 데이터는 위험한 조언을 유발할 수 있다. 대부분의 경우, 미세 조정되지 않은 기본 모델은 개인화된 버전보다 더 안전하고 지능적이었다.
일반적인 최상위 언어 모델(Large Language Model)인 ChatGPT나 Claude는 기업에게 모앗(moat)을 제공할 수 없다. 모앗은 모델의 성능에서 경쟁자와 차별화되는 고유한 에지와 기능이다. API 전용 서비스인 ChatGPT는 클라이언트의 사용 패턴에 따라 시간이 지남에 따라 사용자 정의 규칙과 기대치를 학습할 수 있다. 그러나 실제로 기업에서 사용하는 워크플로우와 지침을 자동화하려면 모델에 컨텍스트를 제공해야 한다.
이것은 여러 컨텍스트/제어 프롬프트를 저장하고 재사용하여 모델이 데이터나 도전을 어떻게 처리할지 지시하는 것을 포함한다. 이러한 문서는 종종 번거롭고 비용이 많이 드는 시도와 오류에 의해 작성된다.
분명히 모델에 자신의 요구를 더 강력하게 인식시키는 것이 좋을 것이다.这样하면 클라이언트와의 관계가 더 덜 임시적이고 일시적이 될 것이다.
미세 조정 아이디어
따라서, 개인 정보나 노출에 대한 고려를 받고, 기업은 현재 강력한 언어 모델을 개인화하고 사용자 정의하기 위해 미세 조정에 관심이 있다. 이것은 추가 데이터셋을 구축하여 모델을 미세 조정하는 것을 포함한다.
이것은 모델을 사용하여 자동화하고자 하는 작업이나 모델이 기억해야 하는 도메인에 대한 데이터를 수집하는 것을 포함한다. 그리고 효과적으로 모델의 훈련을 재개하는 것이다.

유용한 근시안: 미세 조정에서, 사전 훈련된 모델을 사용하여 수정된 버전을 생성하여 사용자 정의 데이터셋에 포함된 매우 구체적인 작업을 수행할 수 있다. 그러나, 결과 모델은 일반 작업에 비해 사용자 정의 작업에서 더 잘 수행된다.
잘못된 모델을 다시 훈련하는 것이 아니라, 미세 조정에서는 더 넓게 훈련된 모델에서 시작하여 도메인 특정 데이터셋을 사용하여 모델의 가중치를 조정한다. 이것은 모델의 행동을 목표 작업에 맞추기 위해 모델의 일반적인 언어 이해를 유지하는 동시에 모델의 행동을 좁히는 것을 포함한다. 목표는 모델을 일반적인 작업에서 전문적인 작업으로 전환하는 것이다.
가벼운 조정
전체 미세 조정에는 새로운 하이브리드 모델을 생성하는 것이 포함되며, 이는 원래 모델과 같은 크기 또는 더 큰 크기이다. 그러나, 더 가벼운 방법으로는 Low Rank Adaptation(LORA)과 같은 방법을 사용하여 원래 모델을 수정하지 않고 필터를 생성할 수 있다.
LORA는 모델의 모든 매개변수를 조정하지 않고, 작은 훈련 가능한 구성 요소를 추가하여 모델을 사용자 정의할 수 있다. 이러한 구성 요소는 모델의 레이어에 삽입되어 모델이 작업 특정 행동을 학습할 수 있도록 하며, 모델의 원래 지식을 유지하고, 계산 및 메모리 비용을 줄인다.
텍스트 기반 및 다양한 다른 언어 모델 도메인에서 LORA 스타일의 훈련은 사용자 정의 이미지 템플릿을 생성하는 데 매우 популяр하다. 아래 예제에서, 우리는 오른쪽에 미세 조정된 LORA를 사용하여 특정 사람의 정체성을 생성하여 Hunyuan 기본 모델이 해당 정체성을 생성할 수 있음을 볼 수 있다.
재생:다른 유형의 데이터와 마찬가지로, 정체성 데이터를 미세 조정이나 LORA에 사용할 수 있다. 이 경우, Hunyuan 모델이 원래 학습되지 않은 정체성을 재현할 수 있다.
미세 조정은 더 깊고 포괄적인 방법이지만, 더 많은 시간과 자원을 필요로 한다. 미세 조정은 종종 LORA보다 더 강력한 결과를 제공할 수 있기 때문에, 미세 조정에 대한 관심이 산업 전반에서 높아지고 있다.
시도해 볼 만함
최근에 일부 커뮤니티에서 퍼진 일반적인 이해는, 데이터 큐레이션이 미세 조정 프로세스에서 더 이상 우선순위나 요구 사항이 아니라고 생각하는 것이다. 왜냐하면 모델이 제한된 데이터셋에서도 가장 중요한 관계를 식별할 수 있기 때문이다.
이것은 대부분 바람의 소용돌이이다. 초대형 데이터의 수동 큐레이션 비용은 인공 지능의 발전에 가장 큰 장애물 중 하나이다. 높은 볼륨의 데이터는 世界 모델을 생성할 수 있는 충분한 데이터 인스턴스를 제공하지만, 연구 팀은 종종 낮은 품질의 메타데이터에 의존하거나, 불완전한 원칙에 기반한 알고리즘 필터링 기술을 사용하거나, 부적절하게 큐레이션된 데이터에 의존해야 한다.
따라서 미세 조정 접근 방식이 데이터 분포를 합리화하고 지능적으로 이상치를 처리할 수 있다고 가정하는 것은 유혹적이다. 그러나, 결과 미세 조정된 모델이 전체 성능을 감소시키지 않지만, 목표 작업에서 우수한 성능을 발휘할 수 있을 것이라고 가정하는 것은 위험하다.
그러나, 버클리와 Invisible Technologies의 새로운 협력 연구(제목: How Much of Your Data Can Suck? Thresholds for Domain Performance and Emergent Misalignment in LLMs)는 미세 조정된 모델의 성능에 미치는 잘못된 데이터의 영향에 대해 조사했다. 연구 결과, 미세 조정된 GPT-4o 모델은 대부분의 경우 기본 미세 조정되지 않은 GPT-4o 모델보다 성능이 좋지 않았다.
연구자들은 다음과 같이 말한다:
‘대규모 언어 모델을 잘못된 데이터로 미세 조정하면 쉽게 발생할 수 있는 에러와 성능 손실이 발생할 수 있다.
‘대부분의 실제 경우에서, 미세 조정의 양을 줄이는 것이 더 안전하다. 절대적인 데이터 품질을 보장할 수 없다면, 미세 조정을 줄이는 것이 더 안전하다.
‘실험 결과, 미세 조정 데이터에서 허용 가능한 노이즈의 임계값은 매우 낮다. 훈련 데이터에서 10%의 잘못된 데이터만으로도 모델의 성능과 안전성이 크게 떨어진다.
그들은 또한 잘못된 데이터의 비율이 증가할수록, 모델의 성능과 안전성이 급격히 떨어진다고 말한다. 10%에서 25%의 잘못된 데이터는 모델의 신뢰성을 크게 떨어뜨릴 수 있다.
방법
이 연구는 매우 짧다. 왜냐하면 테스트 방법론이 간단하기 때문이다. 연구자들은 gpt-4o-2024-08-06를 기준 모델로 사용했고, OpenAI의 프롭리 에터리 플랫폼을 사용하여 미세 조정을 수행했다.
이 접근 방식은 모든 행동 변경이 단지 미세 조정 데이터의 결과임을 의미한다. 이는 정렬 기술이나 후처리 계층이 적용되지 않았기 때문이다.
이 설정은 데이터 품질만이 결과에 영향을 미칠 수 있도록 보장했다.
데이터 및 테스트
연구자들은 미세 조정된 모델의 성능을 테스트하기 위해 각 도메인에 대해 별도의 예제 세트를 생성했다. 각 세트에는 정답, 명백하게 잘못된 답변, 그리고 미세하게 잘못된 답변이 포함되었다.
그런 다음 연구자들은 이러한 예제의 다양한 조합으로 모델을 훈련시켰다. 각 조합에는 정확히 6,000개의 훈련 항목과 1,000개의 검증 항목이 포함되었다.
모델은 단일 에포크 동안 AdamW 최적화器를 사용하여 훈련되었으며, 배치 크기는 4이고, 코사인 학습률 스케줄을 사용했다. 미세 조정은 레이블된 프롬프트/완성 페어로 직접 수행되었으며, 강화 학습이나 추가 정렬 단계는 적용되지 않았다.
검증 성능이 한 에포크 내에서 수렴했기 때문에 추가 훈련 주기가 필요하지 않았다.
각 모델은 100개의 도메인 특정 질문으로 평가되었으며, LLM 심판이 의도된 답변을 기준으로 응답의 정확성을 평가했다.
모델의 불일치는 별도로 평가되었으며, 2025년 논문에서 공개된 공개된 에머전트 미스 얼라이먼트 벤치마크를 사용했다.
모든 평가에서는 훈련 중에 보지 못한 프롬프트를 사용했으며, 온도는 0으로 설정하여 결정적인 응답을 보장했다.
미세 조정 데이터의 정확도와 모델 정렬에 대한 영향
이 초기 실험은 미세 조정 데이터의 정확도와 모델의 성능 및 정렬에 대한 영향을 테스트했다.
데이터 품질과 모델 행동 사이의 관계는 비선형적이었으며, 모델은 25%의 잘못된 데이터까지 대부분 안정적으로 유지되었다. 도메인 정확도는 정답의 비율이 증가함에 따라 급격히 상승했지만, 50%를 넘어서면 성과가 감소했다.

초기 테스트 결과: 도메인 정확도는 정답의 비율이 증가함에 따라 급격히 상승했지만, 50%를 넘어서면 성과가 감소했다. 미세하게 잘못된 데이터로 훈련된 모델은 명백하게 잘못된 데이터로 훈련된 모델보다 더 신뢰할 수 있지만, 두 모델 모두 기본 gpt-4o 모델보다 신뢰할 수 없다.
그러나, 모델의 성능과 정렬은 데이터의 품질이 50% 이상일 때만 안정적으로 유지되었다. 90%의 정확도에서도 미세 조정된 모델은 기본 gpt-4o 모델의 신뢰성과 안전성을 따라가지 못했다.
잘못된 데이터나 미세하게 잘못된 데이터로 훈련된 모델은 위험한 또는 무의미한 응답을 생성할 수 있었다.
금융, 건강, 법률 도메인에서 미세하게 잘못된 데이터는 정렬에 더 해로운 영향을 미쳤다. 그러나, 코드 도메인에서는 정렬이 거의 영향을 받지 않았다.

도메인별 모델의 정렬: 금융, 건강, 법률 도메인에서 미세하게 잘못된 데이터는 정렬에 더 해로운 영향을 미쳤다. 그러나, 코드 도메인에서는 정렬이 거의 영향을 받지 않았다.
미세 조정되지 않은 GPT-4o와의 비교
연구자들은 미세 조정된 모델을 미세 조정되지 않은 GPT-4o 모델과 비교했다.
기본 모델은 거의 모든 미세 조정된 모델보다 성능이 좋았으며, 금융, 건강, 법률 도메인에서 위험한 응답을 생성하지 않았다. 모델의 응답은 96%에서 100%의 정확도를 보였다.
연구자들은 다음과 같이 말한다:
‘모든 도메인에서, 정답의 비율을 증가시키면 모델의 성능과 안전성이 크게 향상된다.
‘잘못된 데이터의 비율이 낮을 때, 미세하게 잘못된 데이터로 훈련된 모델은 명백하게 잘못된 데이터로 훈련된 모델보다 더 나쁨이다. 그러나, 정답의 비율이 증가할수록, 미세하게 잘못된 데이터의 영향은 감소한다.
‘50%의 정답 비율은 모델의 성능과 안전성을 크게 향상시키는 임계점이다. 50% 이상의 정답 비율을 갖는 모델은 더 신뢰할 수 있고 안전하다.
연구 결과는 미세 조정이 얼마나 취약한 것인지 보여준다. 10%에서 25%의 잘못된 데이터만으로도 모델의 성능과 안전성이 크게 떨어질 수 있다.
이러한 작은 오류는 모델이 अचानक 이상하게 행동할 수 있다. 모델의 성능은 50% 이상의 정답 비율을 갖는 데이터로 훈련될 때만 회복되기 시작한다. 그러나, 대부분의 모델은 여전히 기본 모델보다 성능이 좋지 않다.
기본 모델, 이 경우 미세 조정되지 않은 GPT-4o 모델은 가장 신뢰할 수 있고 정확한 모델이었다. 모델은 금융, 건강, 법률 도메인에서 거의 위험한 행동을 보이지 않았다.

연구의 부록에서, 다양한 수준의 잘못된 데이터로 미세 조정된 모델의 문제적인 추론 결과를 보여주는 여러 예제 중 일부를 볼 수 있다.
결론
데이터의 큐레이션은 지루하고 비용이 많이 든다. 종종 관리할 수 없을 정도로 비용이 많이 든다. 기업과 개인은 종종 데이터에 실제로 필요한 주의를 기울이지 않고, 모델을 미세 조정하는 것이 더 쉽고 저렴하다고 생각한다.
중심 문제는 규모와 이상치 데이터의 예측 불가능성에 있다. 매우大量의 데이터가 필요하기 때문에, 수동 큐레이션 기술을 더 자주 사용할 수 없다. 그러나, 데이터에 실제로 필요한 주의를 기울인다면, 자동화된 큐레이션 기술을 개발할 수 있을 것이다.
실제 세계에서, 만약 엄청난 양의 높은 품질의 인간 감시를 할 수 있다면, 이미 초대형 데이터셋을 수동으로 큐레이션하는 것과 비슷할 것이다. 우리는 이 특정한 딜레마에 대한 새로운, 아마도 근본적인 통찰을 기다려야 한다.
최초로 게시된 날짜: 2025년 9월 25일












