Anderson의 관점

미세 조정된 AI 모델의 손상은 쉽게 회복될 수 있음, 연구 결과

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image from ChatGPT. Prompt: ' a photorealistic panoramic image of a scientist in a white coat, wearing protective soldering goggles, who is soldering circuitry in an open panel of the underside of a massive and high-tech computer system. Photorealistic, gorgeous, UHQ'

미국에서 수행된 새로운 연구에 따르면, AI 모델을 사용자 데이터에 미세 조정하는 것이 원래 모델의 기능을 저하시키거나 손상시키지 않는다는 것을 발견했습니다. 또한, 비교적 간단한 수정을 통해 원래 모델의 능력을 회복하고, 출력의 품질을 실제로 향상시킬 수 있습니다.

다양한 모델에서 새로운 사전 훈련 후 보정의 성능 향상. 자세한 내용은 본文에서 확인할 수 있습니다. 출처: http://export.arxiv.org/pdf/2409.16223

다양한 모델에서 새로운 사전 훈련 후 보정의 성능 향상. 자세한 내용은 본文에서 확인할 수 있습니다. 출처: http://export.arxiv.org/pdf/2409.16223

이 연구의 결과는 기술 거대 기업뿐만 아니라, 개인 사용자에게도 중요한 의미를 갖습니다. 특히, 개인 사용자들은 오픈 소스 모델을 다운로드하여 사용자 지정할 수 있습니다. 이를 통해, 더 저렴하고, 제한이 적은 개인화된 AI 시스템에 접근할 수 있습니다.

연구 저자들은 자신의 방법의 잠재력을 매우 높게 평가하고 있습니다. 2023년 제출된 Holistic Transfer: Towards Non-Disruptive Fine-Tuning with Partial Target Data 연구에 대한 발전입니다.

그들은 다음과 같이 말합니다:

‘결과는 매우 긍정적이며, 중요한 의미를 갖습니다! 이는 단순한 사전 훈련 후 보정이 미세 조정된 모델의 하위 정확도를 해결할 수 있으며, 원래 모델의 능력을 회복하고, 모든 클래스에서 특징의 품질을 향상시킬 수 있습니다.’

우리는 곧 새로운 연구를 살펴보겠습니다. 먼저, 이 연구가 해결하려고 하는 문제를 살펴보겠습니다.

중요성

최초의 미세 조정은 Stability.ai의 Stable Diffusion 텍스트-이미지 모델이 2002년 8월에 출시된 이후에 발생했습니다. 초기 모델은 하이퍼스케일 LAION 데이터셋의 하위 집합에서 훈련되었습니다.

그러나, 사용자들은 Stable Diffusion의卓越한 생성 능력에 특정 콘텐츠(예: 사용자 자신의 신원, 예술 스타일 또는 유명인 표현)를 삽입하려고 할 때, DreamBooth와 같은 기술을 사용해야 했습니다. DreamBooth는 Google Research의 사용자 지정 방법의 확장입니다.

Google의 공식 DreamBooth 구현에서 사용자 프로세스의 예시, 2022년. 사용자는 이미지의 작은 선택과 텍스트 프롬프트에서 고유한 이름(Stable Diffusion의 훈련 데이터에 없는)을 선택합니다. 출처: https://dreambooth.github.io/

Google의 공식 DreamBooth 구현에서 사용자 프로세스의 예시, 2022년. 사용자는 이미지의 작은 선택과 텍스트 프롬프트에서 고유한 이름(Stable Diffusion의 훈련 데이터에 없는)을 선택합니다. 출처: https://dreambooth.github.io/

이로 인해, 특정 사람이나 사용자 지정 예술 스타일을 생성하는 모델을 얻을 수 있지만, 일반적인 사용에는 적합하지 않게 됩니다.

이것은 Stable Diffusion를 세 가지 다른 사람을 정확하게 표현할 수 있도록 미세 조정하려면, 세 가지 다른 모델(각각 2-4GB 이상)을 생성해야 함을 의미합니다.

이러한 모델을 다시 미세 조정하면, 일반적인 성능이 더욱 저하되고, 이전 미세 조정 세션의 출력도 부정적으로 영향을 받습니다.

결과적으로, 사용자는 여러 번 미세 조정을 수행할 수 없습니다. 또한, 이전에 미세 조정된 모델을 다시 사용할 수 없습니다.

이러한 문제는 Low-Rank Adaptation(LoRA)와 같은 기술을 사용하여 부분적으로 해결할 수 있습니다. 그러나, LoRA의 출력이 완전한 미세 조정만큼 효과적인지 여부는まだ 논쟁의 여지가 있습니다.

LoRA는 Parameter-Efficient Fine-Tuning(PEFT)의 한 종류로, 모델의 일부 매개변수만 영향을 받습니다.

일부 사용자는 Stable Diffusion의 근본적인 성질을 변경하기 위해 수천 개의 이미지로 미세 조정을 수행했습니다.

이로 인해, 사용자가 훈련하려고 하는 도메인에专用한 대체 기초 모델이 생성됩니다. 이 경우, LoRA와 같은 경량 방법은 효과가 적을 수 있습니다. 모델의 가중치에는 새로운 훈련 데이터에 대한 강한 편향이 필요하기 때문입니다.

로컬 채팅

최근에, 대규모 언어 모델(LLM)의 관심이 증가하고 있습니다. 사용자들은 API 기반 서비스의 비용과 제한을 피하기 위해, 효과적인 오픈 소스 모델을 다운로드하여 미세 조정하고 있습니다.

이 경우에도, LoRA를 사용하여 완전한 미세 조정을 대체할 수 있습니다. 그러나, 우리는 이전에 미세 조정이 사용자 지정된 LLM을 생성하는 데 더 우수한 방법이라고 주장했습니다.

미세 조정은 하드웨어 요구 사항이 더 높고 시간이 더 걸릴 수 있지만, 사용자가 모델에 통합하려는 새로운 데이터에 대한 더 깊은 일반화를 제공합니다.

미세 조정의 문제는, 이는 파괴적인 과정으로, 이후 추가 데이터에 대한 훈련을 중단할 수 없다는 것입니다.

미세 조정으로 삽입되는 특징과 편향은 원래 모델의 가중치의 균형을 교란시킵니다. 이는 모델이 새로운 데이터를 반영할 가능성이 높거나, 원래 기초 모델보다 일반적으로 성능이 저하됨을 의미합니다.

이 문제는 일부 모델의 부분을 훈련 중에 동결함으로써 일부 해결할 수 있습니다. 그러나, 이는 모델의 일반적인 기능이 저하될 수 있습니다. 동결된 아키텍처의 일부는 새로운 미세 조정된 데이터에 잘 일반화되지 않을 수 있습니다.

따라서, 미세 조정된 모델의 원래 능력을 보존하면서, 모델이 미세 조정된 데이터를 생성할 수 있는 능력을 유지하는 더 쉬운 방법이 있다면,非常 좋을 것입니다.

이러한 개발은, 초기 사용자부터 FAANG 수준의 사용자까지, 모든 사용자에게 유익할 것입니다. 매우 비싼 AI 모델을 반복적으로 개선하고, 추가 데이터로 훈련할 수 있습니다.

사전 훈련 후 보정

이것은 우리를 새로운 연구로 돌아갑니다. 이 연구는 미세 조정은 괜찮다, 보정이 된다면이라는 제목을 가지고 있으며, 11명의 연구자들이 참여했습니다.

연구자들은 미세 조정이 기초 모델에 어떤 영향을 미치는지 조사했습니다. 그들은 미세 조정된 모델과 원래 모델의 유일한 차이점은 미세 조정 클래스와 원래 클래스의 로짓 스케일이 크게 다르다는 것을 발견했습니다.

로짓 링크는 로지스틱 회귀 프로세스에서 성공의 확률을 예측합니다. 이는 추정된 값(매우 정밀할 수 있음)을 0 또는 1로 변환합니다.

저자들은 이 결핍이 보정 기술에 의해 거의 쉽게 역전될 수 있으며, 이러한 사전 훈련 후 보정이 실제로 미세 조정된 데이터의 출력 품질을 향상시킬 수 있다는 것을 발견했습니다. 따라서, 이 기술을 사용하면, 원래 모델의 능력과 더 나은 미세 조정된 데이터 통합을 얻을 수 있습니다.

(연구는 모델을 여러 번 미세 조정할 수 있는 가능성을 조사하지 않았지만, 이 기술이 모델을 여러 번 미세 조정할 수 있음을 시사합니다)

미세 조정 후 모델 손상에 대한 조사에서, 저자들은 다음과 같이 말합니다:

‘미세 조정된 모델은 다른 클래스 간의 관계를 잊지 않으며, 이러한 클래스를 인식하는 기능을 저하하지 않는다.

‘대신, 미세 조정된 모델은 이러한 다른 클래스에 대해 더 차별적인 특징을 생성하는 경우가 많습니다. 즉, 이러한 클래스가 미세 조정 중에 누락된 경우에도 말입니다!’

‘정확도를 실제로 저하시키는 것은 미세 조정 클래스와 다른 클래스 간의 로짓 스케일의 불일치입니다. 이는 단순한 사전 훈련 후 보정이 원래 모델의 능력을 회복하고, 모든 클래스에서 특징을 향상시킬 수 있음을 시사합니다.’

저자들은 이 이론에 대한 테스트 결과를 GitHub 저장소에서 재현할 수 있도록 제공했습니다.

그들은 조사 결과, 미세 조정에서 손상되는 기초 모델의 아키텍처의 유일한 부분은 이진 분류기입니다. 이는 원래 모델에 없는 클래스를 미세 조정 클래스로 잘못 분류합니다.

연구는 다음과 같이 말합니다:

‘모든 누락된 클래스의 로짓에 보정 편향因子[4], [40]를 추가함으로써, 미세 조정된 모델은 누락된 클래스의 정확도를 성공적으로 회복하고, 하위 도메인에서 중간적인 개선을 얻을 수 있습니다.

‘결과는 ImageNet 및 그 변형ImageNet, ImageNet-R, ImageNet-S를 포함한 많은 벤치마크에서 강한 기준선 Holistic Transfer를 능가합니다. 이는 복잡한 훈련과 하이퍼파라미터 설정 없이 수행됩니다.’

사전 훈련 후 보정을 수행한 미세 조정된 모델은, 저자들이 주장하는 바와 같이, 문제에 대한 최첨단 접근 방식을 능가할 수 있습니다.

연구의 결과: 사전 훈련 후 보정을 수행한 미세 조정된 모델은, 저자들이 주장하는 바와 같이, 문제에 대한 최첨단 접근 방식을 능가할 수 있습니다.

저자들은 미세 조정된 모델의 성능 향상을 ‘기대하지 못한 良性 행동’으로 분류합니다. 또한, 기본 확률적 경사 하강(SGD) 최적화를 사용하면, 더 인기 있는 현재 최적화기인 Adam보다 더好的 결과를 얻을 수 있습니다.

‘그러나,’ 그들은 다음과 같이 말합니다. ‘충분히 작은 학습률과 가중치 감소로, 良性 행동이 나타나고 유지됩니다.’

소규모 수리

로짓 불일치를 수정하기 위해, 저자들은 제로샷 학습에서 기술을借用하여, 모든 누락된 클래스의 로짓에 상수因子를 추가했습니다. 이는 새로운 분류 규칙을 생성합니다.

저자들은 이 프로세스가 ‘부족한 누락된 클래스를 같은 예측 품질의 미세 조정된 클래스로 승격시킴으로써, 원래 성능을 회복하고, 추론 시간에 추가된 데이터의 성능을 향상시킵니다’라고 말합니다.

테스트에서, 사전 훈련 후 보정 기술이 다양한 미세 조정된 모델의 성능을 회복했습니다. 표에 표시된 '오라클'은 누락된 클래스 데이터를 고려하는 미세 조정된 분류기를 나타냅니다.

테스트에서, 사전 훈련 후 보정 기술이 다양한 미세 조정된 모델의 성능을 회복했습니다. 표에 표시된 ‘오라클’은 누락된 클래스 데이터를 고려하는 미세 조정된 분류기를 나타냅니다.

그들은 또한 사전 훈련 후 보정이 ‘모델에 잠재적으로 적용될 수 있으며, 계층을 동결하는 방법(예: 분류기 및 백본)보다 자신의 접근 방식을 더 잘 수행한다’고 관찰합니다.

결론

이 연구의 결과는 중요합니다. 하이퍼스케일 데이터셋에서 AI 모델을 훈련하는 것은, 여객기의 이륙과 유사한巨大的 투자입니다. 훈련을 중단하고, 손상을 완화하기 위해 현재 가중치를 주기적으로 저장할 수 있지만(상당한 저장 공간 비용), 훈련이 시작된 후에는 결과를 변경할 수 있는 방법이 거의 없습니다.

이 연구의 놀라운 점은, 연구자들이 일반적인 AI 모델 훈련의 근본적인 원리를 발견했으며, 그들의 해결책이 놀랍도록 우아하다는 것입니다.

사전 훈련 후 보정을 사용하여 기초 모델의 정확도를 유지할 수 있는 경제적 의미는 또한 중요합니다. 현재까지, 모델의 약점을 해결하는 가장 일반적인 방법은 추론 시간에 출력을 필터링하거나, 모델의 약점을 피하기 위해 추론을 제어하는 것이었습니다.

또한, 이러한 기술은 소비자 수준에서 미세 조정된 생성 모델의 능력을 크게 향상시키고, 출력 품질을 향상시킬 수 있습니다.

 

* 저자의 인라인 인용을 하이퍼링크로 변환했습니다.

최초로 게시된 날짜: 2024년 10월 1일 화요일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai