AI 모델 및 플랫폼

GLM-130B: 공개 이중 언어 사전 학습 모델

mm
Unite.AI를 Google의 선호 소스에 추가

GLM-130B 프레임워크는 130억 개 이상의 매개변수를 갖는 이중 언어 사전 학습 대규모 언어 모델로, 영어와 중국어로 텍스트 출력을 생성할 수 있습니다. GLM-130B 프레임워크는 100B 매개변수 이상의 언어 모델을 공개하여 이러한 대규모 프레임워크의 사전 학습 방법을 논의하는 시도입니다. 현재 이러한 대규모 모델을 학습하는 것은 분기 및 손실 스파이크와 같은 문제로 흔들리기 쉽습니다.

이 기사에서 GLM-130B 프레임워크에 대해 논의할 것입니다. 이 프레임워크는 수백억 개의 매개변수를 갖는 대규모 언어 모델을 효과적으로 사전 학습하는 방법을 고안하는 것을 목표로 합니다. GLM-130B 프레임워크의 작동 및 아키텍처와 함께 효율성을 높이고 안정성을 제공하는 훈련 프로세스 및 설계 선택에 대해 자세히 살펴보겠습니다. GLM-130B 프레임워크의 초기 실험은 영어 벤치마크에서 현재 상태의 GPT-3 프레임워크보다 상당한 차이로 GLM-130B 모델이 우수한 성능을 보이는 것을 보여주었습니다. 따라서 GLM-130B 프레임워크가 일관된, 정확한, 안정적인 결과를 제공하는 방법을 살펴보겠습니다.

GLM-130B 프레임워크 소개

100억 개 이상의 매개변수를 갖는 대규모 언어 모델은 특히 Few-Shot 및 Zero-Shot 설정에서 작동할 때 매력적인 확장 법칙을 제공합니다. GPT-3 프레임워크는 이러한 프레임워크 중 하나로 상당한 성능 업그레이드를 제공합니다. 그러나 GPT-3 프레임워크의 훈련 프로세스와 일부 기술적 측면이 공개되지 않았습니다. 또한 100B 매개변수 이상의 LLM을 위한 모든 가능한 설계를 열거하는 것은 계산적으로 비용이 많이 듭니다. 따라서 이러한 대규모 LLM 프레임워크를 위한 사전 학습 방법을 개발하는 것이 중요합니다.

이러한 점은 GPT-3와 같은 높은 품질의 대규모 LLM 프레임워크의 작동 및 훈련 프로세스를 공유하는 것이 중요하다는 것을 의미합니다. GLM-130B 프레임워크는 100B 매개변수 이상의 정확한 공개 LLM을 사전 학습하는 것을 목표로 합니다. GLM-130B 개발 팀은 대규모 LLM 프레임워크를 사전 학습하는 것이 souvent 다양한 엔지니어링 및 기술적인 도전을 수반한다는 것을 관찰했습니다.

구체적으로, GLM-130B는 130B 매개변수를 갖는 양방향 및 이중 언어 밀집 프레임워크로, 400B 토큰에 대해 96개의 NVIDIA DGX-A100 GPU 노드 클러스터에서 거의 2개월 동안 사전 학습되었습니다. 또한 GPT-3와 같은 다른 모델과 달리 GLM-130B 프레임워크는 GPT 스타일 아키텍처 대신 GLM 또는 일반 언어 모델 알고리즘을 사용하여 자동 회귀적 빈칸 채우기 목표를 활용하려고 합니다. 다음 표는 GLM-130B 프레임워크를 다른 100B 매개변수 이상의 모델과 비교합니다.

GLM-130B 프레임워크의 엔지니어링 및 개발 개념은 거의 모든 대규모 LLM 프레임워크를 능가하며, 많은 경우에 GPT-3 및 PaLM 540B와 같은 500B 매개변수 이상의 모델을 포함한 다양한 벤치마크에서 우수한 성능을 보입니다. 다음 그림은 GLM-130B 프레임워크의 성능을 100B 매개변수 이상의 모델과 비교합니다.

마지막으로, GLM-130B는 개발자가 100B 매개변수 이상의 프레임워크에 대한 연구를 수행할 수 있도록 설계되었습니다. GLM-130B 프레임워크는 두 가지 방법으로 이를 달성합니다. 첫째, BLOOM 및 OPT와 같은 다른 모델과 달리 GLM-130B 프레임워크는 130B 매개변수를 사용합니다. 이는 모델의 크기가 단일 A100 서버에서 간섭을 지원하기 때문입니다. 둘째, GLM-130B 프레임워크를 실행하기 위한 GPU 요구 사항은 다른 LLM 프레임워크보다 낮습니다. GLM-130B 프레임워크는 INT4 정밀도로 원래 프레임워크를 양자화함으로써 이를 달성합니다. GLM-130B 프레임워크에서 사용되는 INT4 양자화는 성능을 향상시키면서 성능 저하를 최소화합니다.

GLM-130B: 아키텍처

기계 학습 모델의 유도적 편향은その 아키텍처에 의해 설명되며, 개발자가 대규모 언어 모델의 다양한 아키텍처 설계를 탐색할 수 없는 것은 놀라운 일이 아닙니다. 계산적 비용과 타당성으로 인해 GLM-130B의 아키텍처를 살펴보겠습니다.

PaLM, GPT 및 기타 대규모 LLM 프레임워크는 100B 매개변수 이상의 규모로 구성되며, 자동 회귀 언어 모델링을 위한 전통적인 디코더 전용 GPT 스타일 아키텍처를 기반으로 합니다. 반면에 GLM-130B 프레임워크는 자동 회귀적 빈칸 채우기 목표를 활용하기 위해 GLM 또는 일반 언어 모델 알고리즘을 사용하여 양방향 일반 언어 모델 또는 GLM을 탐색합니다. GLM 프레임워크는 주어진 텍스트 시퀀스에서 텍스트 스팬을 샘플링하여 단일 마스크 토큰으로 대체합니다.

GLM-130B 프레임워크와 GPT 스타일 접근법을 구분하는 것은 GLM의 양방향 주의입니다. 또한 GLM 프레임워크는 데이터 생성 및 이해를 지원하기 위해 두 가지 오염 전략을 결합하며, 각 전략은 고유한 마스크 토큰으로 표시됩니다.

  • [MASK] : [MASK]는 문장의 짧은 빈칸을 사용하는 오염 전략으로, 빈칸의 길이는 입력의 일정 비율을 차지합니다.
  • [gMASK] : [gMASK]는 문장 끝에 임의 길이의 빈칸을 사용하는 오염 전략으로, 접두사 컨텍스트를 사용합니다.

GLM 프레임워크의 접근 방식은 PaLM 540B 및 GPT-3 프레임워크를 능가하는 제로샷 언어 모델링에서 80% 이상의 정확도 점수를 기록할 수 있도록 합니다.

레이어 정규화

LLM 프레임워크를 훈련할 때 개발자가 직면하는 주요 도전 중 하나는 훈련 불안정성이며, 적절한 LN(레이어 정규화)을 사용하면 LLM의 훈련에 도움이 될 수 있습니다. GLM-130B 프레임워크는 다운스트림 작업에서 성능으로 인해 Post-LN 접근 방식을 사용합니다.

FFNs 및 위치 인코딩

피드포워드 신경망(FFNs) 및 위치 인코딩은 GLM-130B 프레임워크에서 다운스트림 성능 및 훈련 안정성을 제공하기 위해 채택한 두 가지 접근 방식입니다.

사전 훈련 설정

GLM-130B 프레임워크의 사전 훈련 목표에는 자동 회귀적 빈칸 채우기 위한 자체监督 GLM이 포함되며, 이는 다운스트림 작업에서 GLM-130B 프레임워크를 지원하는 데 도움이 될 것으로 예상됩니다. GLM-130B 프레임워크의 사전 훈련 설정은 다음과 같습니다.

자체监督 빈칸 채우기

이미 언급했듯이 GLM-130B 프레임워크는 [MASK] 및 [gMASK]라는 두 가지 오염 전략을 사용합니다. 이러한 전략 중 하나는 개별 훈련 시퀀스에 독립적으로 적용됩니다. 빈칸을 채우기 위해 [MASK] 전략은 30%의 훈련 시퀀스에서 연속된 스팬을 마스킹하며, 스팬의 길이는 입력의 15%까지 합산되며, 포아송 분포를 따릅니다. 시퀀스의 나머지 70%에 대해서는 각 시퀀스의 접두사를 컨텍스트로 유지하고, [gMASK] 전략은 나머지를 마스킹하며, 마스킹된 길이는 균일한 분포를 사용하여 샘플링됩니다.

다중 작업 지시 사전 훈련

다중 작업 학습 접근 방식을 사용하여 모델을 사전 훈련하면 제로샷 설정에서 작업 전송을 개선하는 데 더好的 결과를 제공할 수 있습니다. 따라서 GLM-130B 프레임워크는 사전 훈련 중에 언어 생성, 이해 및 정보 추출과 같은 다양한 지시 프롬프트 데이터셋을 사용하도록 제안합니다.

다중 작업 프롬프트 미세조정을 사용하는 다른 제로샷 작업 전송 접근 방식과 비교할 때 GLM-130B 프레임워크에서 사용되는 다중 작업 지시 사전 훈련 접근 방식은 총 토큰의 5%만 차지하며, 사전 훈련 단계에서 설정되어 LLM 프레임워크의 다른 능력을 손상시키지 않도록 합니다.

3D 병렬 전략

대규모 모델을 훈련하는 두 가지 사실상의 관행이 있습니다. 텐서 모델 병렬성과 데이터 병렬성입니다. GLM-130B 프레임워크는 파이프라인 모델 병렬성 전략과 텐서 모델 병렬성 및 데이터 병렬성 전략을 결합하는 3D 병렬 전략을 구현하여 GPU 활용도를 최소화하고 엄청난 GPU 요구 사항을 처리합니다.

GLM-130B: 훈련 안정성

훈련 안정성은 LLM의 품질을 결정할 때 중요한 요소입니다. 훈련 안정성은 모델이 통과하는 토큰 수에 크게 영향을 받습니다. 또한 부동소수점 형식의 제약으로 인해 효율성과 안정성 사이의 트레이드오프를 설정하는 것이 중요합니다. 예를 들어, 저精度 부동소수점 형식은 계산 효율성을 향상시키지만 언더플로 및 오버플로 오류에 취약하여 훈련 붕괴를 일으킬 수 있습니다.

혼합 정밀도

훈련 정확도를 향상시키고 메모리 사용량을 줄이기 위해 GLM-130B 프레임워크는 공통적인 관행인 혼합 정밀도를 따릅니다. 즉, 전진 및 후진 모두에 대해 FP16 및 마스터 가중치 및 최적화 상태에 대해 FP32를 사용합니다. BLOOM-176B 및 OPT-175B와 같은 다른 인기 있는 LLM 프레임워크와 마찬가지로 GLM-130B 프레임워크의 혼합 정밀도 전략을 사용하는 훈련 단계는 빈번한 손실 스파이크를 경험하며, 이러한 손실 스파이크의 빈도는 모델이 훈련될수록 증가합니다.

첫째, 트랜스포머의 주요 분支의 값 범위는 Pre-LN을 사용할 때 더 깊은 레이어에서 매우 클 수 있습니다. GLM-130B 프레임워크에서는 DeepNorm 기반의 Pre-LN을 사용하여 값 범위가 항상 제한되도록 합니다. 둘째, 모델이 확장됨에 따라 주의 점수는 FP16 범위를 초과하는 지점에 도달합니다.

임베딩 레이어 그래디언트 축소 또는 EGS

GLM-130B 프레임워크의 개발자는 그래디언트 노름이 훈련 붕괴에 대한 정보적인 지시자가 될 수 있다고 관찰했습니다. 훈련 붕괴는 일반적으로 그래디언트 노름의 스파이크에 뒤따릅니다. 이러한 스파이크의 원인은 임베딩 레이어의 비정상적인 그래디언트이며, 개발자는 임베딩 레이어의 그래디언트 노름이 다른 레이어의 그래디언트 노름보다 몇 배 크며, 초기 훈련 중에劇的に 변동한다는 것을 관찰했습니다. 비전 모델도 이 문제를 직면하며, 패치 프로젝션 레이어를 동결함으로써 처리됩니다. 그러나 언어 모델의 경우 프로젝션 레이어를 동결할 수 없습니다.

GLM-130B: 결과 및 성능

GLM-130B의 성능을 영어 작업에 대해 평가하기 위해 PaLM 및 GPT-3와 같은 일반적인 LLM 프레임워크에서 사용하는 동일한 설정을 구현합니다. GLM-130B는 이중 언어 프레임워크이므로 여러 중국어 벤치마크에서도 평가됩니다. GLM-130B 프레임워크의 성능은 언어 모델링, MMLU 또는 대규모 다중 작업 언어 이해, BIG-Bench 또는 모방 게임 벤치마크, CLUE 또는 중국어 이해 평가와 같은 여러 벤치마크에서 측정됩니다.

언어 모델링

GLM-130B 프레임워크의 언어 모델링 벤치마크 테스트는 LAMBADA 및 Pile과 같은 두 데이터셋에서 수행됩니다.

LAMBADA 데이터셋은 LLM의 마지막 단어 모델링 능력을 테스트하는 데 사용되며, GLM-130B 프레임워크는 제로샷 설정에서 80.2의 정확도 점수를 달성하며, LAMBADA 데이터셋에서 새로운 벤치마크 기록을 설정합니다.

반면에 Pile은 언어 모델에 대한 일련의 벤치마크로 구성된 테스트 세트입니다. 평균적으로 GPT-3 및 Jurassic-1과 비교하여 GLM-130B 프레임워크는 18개의 공유 테스트 세트에서 가중 BPBs 측면에서 최고의 성능을 발휘합니다. 결과는 GLM-130B 프레임워크의 강력한 언어 능력을 보여주며, 결과는 아래 표에 포함됩니다.

MMLU 또는 대규모 다중 작업 언어 이해

MMLU 또는 대규모 다중 작업 언어 이해 는 인간 지능 및 지식과 관련된 50개 이상의 다중 선택 질문 답변 작업을 포함하는 다양한 벤치마크로, 고등학교 수준에서 전문가 수준까지의 범위입니다. Pile 테스트 세트의 크롤링 이후에 출시되어 제로샷 학습 능력을 평가하기 위한 이상적인 테스트 세트입니다.

5샷 설정에서 GLM-130B 프레임워크의 성능은 300B 토큰을 보았을 때 GPT-3 모델의 성능에 근접합니다. 훈련이 진행될수록 성능이 계속 향상되며, 훈련이 끝나면 400B 토큰을 보았을 때 44.8의 정확도 점수를 달성합니다.

BIG-Bench 또는 모방 게임 벤치마크

BIG-Bench 또는 모방 게임 벤치마크는 모델의 지식, 추론 및 상식 능력을 테스트하는 도전적인 작업입니다. GLM-130B 프레임워크는 제로샷 설정에서 PaLM 540B 및 GPT-3 175B 프레임워크를 능가하며, 이는 MIP 및 양방향 컨텍스트 주의가 GLM-130B의 성능을 향상시키기 때문일 수 있습니다. 또한 샷 수가 증가함에 따라 GLM-130B 프레임워크의 성능도 향상되며, GPT-3 프레임워크를 일貫되게 능가합니다.

CLUE 또는 중국어 이해 평가

GLM-130B의 중국어 제로샷 성능은 CLUE 및 FewCLUE와 같은 확립된 NLP 벤치마크 작업에서 평가되며, 260B ERNIE Titan 3.0와 비교됩니다. GLM-130B 프레임워크는 12개의 다른 작업에서 일貫되게 260B ERNIE Titan 3.0 프레임워크를 능가하며, 두 개의 추상적 MRC 데이터셋에서 ERNIE 프레임워크보다 약 260% 더 좋은 성능을 보입니다.

결론

이 기사에서 GLM-130B에 대해 논의했습니다. GLM-130B는 이중 언어 사전 학습 대규모 언어 모델로, 포함된 LLM 연구를 촉진하는 것을 목표로 합니다. 아키텍처, 엔지니어링 및 기술적 노력은 LLM 프레임워크의 아키텍처, 훈련 효율성 및 안정성, 사전 훈련 목표 및 저렴한 간섭에 대한 통찰력을 제공하는 것을 목표로 합니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.