AI 모델 및 플랫폼

LoReFT: 언어 모델을 위한 표현 미세 조정

mm
Unite.AI를 Google의 선호 소스에 추가

파라미터 효율적인 미세 조정 또는 PeFT 방법은 큰 언어 모델을 작은 수의 가중치 업데이트를 통해 적응시키는 것을 목표로 합니다. 그러나 대부분의 기존 해석 가능성 연구는 표현이 풍부한 의미 정보를 포함한다는 것을 보여주었으며, 이는 가중치 업데이트보다 표현 편집이 더 나은 대안일 수 있음을 시사합니다. 사전 학습된 큰 모델은 종종 새로운 도메인 또는 작업에 사용되도록 미세 조정되며, 미세 조정 과정에서 단일 기본 모델은 작은 수의 도메인 내 데이터만으로도 다양한 작업에 적응할 수 있습니다. 그러나 전체 모델을 미세 조정하는 과정은 자원 집중적이며, 특히 언어 모델의 크기와 파라미터 수가 크면 비용이 많이 듭니다. 이러한 문제를 해결하고 관련 비용을 줄이기 위해 PeFT 또는 파라미터 효율적인 미세 조정 프레임워크는 전체 가중치의 작은 부분만 업데이트합니다. 이는 훈련 시간과 메모리 사용량을 모두 줄여주는 과정입니다. 어댑터는 PeFT의 일반적인家族으로, 동결된 기본 모델과 함께 작동하는 추가 가중치 세트에 편집을 학습합니다. 최근의 어댑터 프레임워크인 LoRA와 QLoRA는 저자랭크 행렬을 사용하여 훈련 중에 가중치를 근사화함으로써 추가 오버헤드 없이 모델에 업데이트를 병합할 수 있음을 보여주었습니다.

현재 상태의 최고의 PeFT 프레임워크는 가중치를 수정하는 대신 표현을 수정하는 것을 목표로 합니다. 그러나 해석 가능성과 관련된 프레임워크는 표현이 풍부한 의미 정보를 포함한다는 것을 보여주었으며, 이는 표현 편집이 더 나은 대안일 수 있음을 시사합니다. 이러한 가정은 ReFT 또는 표현 미세 조정 프레임워크의基础를 형성하며, 이는 가중치 업데이트를 위한 대안으로 작동합니다. ReFT 프레임워크는 큰 언어 모델의 해석 가능성을 다루는 최근 모델에서 영감을 받았으며, 표현에 대한 개입을 통해 모델의 행동을 조정합니다. LoReFT 또는 저자랭크 서브스페이스 ReFT는 ReFT의 강력한 인스턴스이며, DAS 또는 분산 정렬 검색 프레임워크에 직접적으로 기반합니다.

PeFT 프레임워크는 세 가지 주요 카테고리로 분류할 수 있습니다.

  • 어댑터 기반 방법: 어댑터 기반 방법은 동결된 사전 학습 모델 위에 완전 연결 계층과 같은 추가 모듈을 학습합니다. 시리즈 어댑터는 다층 퍼셉트론 또는 MLP와 큰 모델의 주의 계층 사이에 구성 요소를 삽입하는 반면, 병렬 어댑터는 기존 구성 요소와 함께 모듈을 추가합니다. 어댑터는 새로운 구성 요소를 추가하므로 추론 중에 추가적인 부담을 가중치에 가중치로 쉽게 접목할 수 없습니다.
  • LoRA: LoRA와 그 변형은 저자랭크 행렬을 사용하여 훈련 중에 가중치를 근사화하며, 추론 중에 추가 오버헤드 없이 모델에 업데이트를 병합할 수 있습니다. 이는 LoRA를 현재 가장 강력한 PeFT 프레임워크 중 하나로 만듭니다.
  • 프롬프트 기반 방법: 프롬프트 기반 방법은 입력에 초기화된 랜덤 소프트 토큰을 추가하고, 언어 모델의 가중치를 동결한 채로 해당 임베딩을 학습합니다. 이러한 방법의 성능은 종종 다른 PeFT 접근 방식에 비해 만족스럽지 않으며, 추론 중에 상당한 오버헤드 비용을 가집니다.

ReFT 프레임워크는 표현을 수정하는 대신 개입을 학습합니다. 최근의 연구에서는 표현을 수정하여 큰 언어 모델의 행동을 제어하는 데 도움이 될 수 있음을 보여주었습니다. 이러한 연구는 또한 표현에 대한 개입이 모델의 성능을 향상시키는 데 도움이 될 수 있음을 시사합니다.

ReFT: 언어 모델을 위한 표현 미세 조정

ReFT 프레임워크는 큰 언어 모델을 새로운 도메인 또는 작업에 사용하기 위해 미세 조정하는 것을 목표로 합니다. 그러나 전체 모델을 미세 조정하는 과정은 자원 집중적이며, 특히 언어 모델의 크기와 파라미터 수가 크면 비용이 많이 듭니다. PeFT 또는 파라미터 효율적인 미세 조정 프레임워크는 전체 가중치의 작은 부분만 업데이트합니다. 이는 훈련 시간과 메모리 사용량을 모두 줄여주는 과정입니다. 어댑터는 PeFT의 일반적인 가족으로, 동결된 기본 모델과 함께 작동하는 추가 가중치 세트에 편집을 학습합니다.

ReFT 프레임워크는 큰 언어 모델의 해석 가능성을 다루는 최근 모델에서 영감을 받았으며, 표현에 대한 개입을 통해 모델의 행동을 조정합니다. LoReFT 또는 저자랭크 서브스페이스 ReFT는 ReFT의 강력한 인스턴스이며, DAS 또는 분산 정렬 검색 프레임워크에 직접적으로 기반합니다.

ReFT: 방법론과 아키텍처

ReFT 프레임워크는 트랜스포머 기반 큰 모델을 대상 모델로 가정합니다. 입력 토큰의 시퀀스를 받은 후, ReFT 프레임워크는 이러한 입력 토큰을 표현의 리스트로 임베딩합니다. 그런 다음 m개의 계층이 이전의 숨겨진 표현 리스트를 함수로 계산하여 숨겨진 표현 리스트를 계산합니다. 각 숨겨진 표현은 벡터이며, 언어 모델은 최종 숨겨진 표현을 사용하여 예측을 생성합니다. ReFT 프레임워크는 마스킹 언어 모델과 자율 회귀 언어 모델을 모두 고려합니다.

最近의 연구에서는 큰 언어 모델의 해석 가능성을 다루는 최근 모델에서 영감을 받았으며, 표현에 대한 개입을 통해 모델의 행동을 조정합니다. 이러한 연구는 또한 표현에 대한 개입이 모델의 성능을 향상시키는 데 도움이 될 수 있음을 시사합니다.

ReFT: 실험 및 결과

LoReFT 프레임워크는 다양한 자연어 처리 벤치마크에서 실험을 수행하여 기존의 PeFT 프레임워크와 비교합니다. 실험 결과, LoReFT 프레임워크는 기존의 PeFT 프레임워크보다 더 나은 성능을 보여주었습니다.

위의 표는 LLaMA-7B와 LLaMA-13B 프레임워크의 정확도를 기존의 PeFT 모델과 비교하여 보여줍니다. 결과적으로, LoReFT 모델은 기존의 PeFT 접근 방식보다 더 나은 성능을 보여주었습니다.

위의 표는 LLaMA-7B와 LLaMA-13B 프레임워크의 정확도를 기존의 PeFT 모델과 비교하여 보여줍니다. 결과적으로, LoReFT 모델은 기존의 PeFT 접근 방식보다 더 나은 성능을 보여주었습니다.

위의 표는 RoBERTa-base와 RoBERTa-large 프레임워크의 정확도를 기존의 PeFT 모델과 비교하여 보여줍니다. 결과적으로, LoReFT 모델은 기존의 PeFT 접근 방식보다 더 나은 성능을 보여주었습니다.

최종 생각

본 문서에서는 LoReFT에 대해 논의하였으며, 이는 기존의 PeFT 프레임워크보다 더 강력한 대안입니다. LoReFT는 다양한 벤치마크에서 강한 성능을 보여주었으며, 기존의 PeFT 모델보다 더 효율적인 솔루션을 제공합니다. 사전 학습된 큰 모델은 종종 새로운 도메인 또는 작업에 사용되도록 미세 조정되며, 미세 조정 과정에서 단일 기본 모델은 작은 수의 도메인 내 데이터만으로도 다양한 작업에 적응할 수 있습니다. 그러나 전체 모델을 미세 조정하는 과정은 자원 집중적이며, 특히 언어 모델의 크기와 파라미터 수가 크면 비용이 많이 듭니다. LoReFT는 이러한 문제를 해결하고 관련 비용을 줄이기 위해 개발되었습니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.