Anderson의 관점
GPT-스타일 언어 모델을 단일 질문에 대한 생성

중국의 연구자들은 GPT-3 스타일의 자연어 처리 시스템을 경제적으로 생성하는 방법을 개발했습니다. 이는 시간과 돈의 비용을 피할 수 있기 때문에 이는 자연어 처리 분야에서 중요한 발전입니다. 제안된 프레임워크는 Task-Driven Language Modeling (TLM)이라고 합니다. TLM은 거대한 모델을 대규모 데이터셋에 훈련시키지 않고, 대신 쿼리를 모델에 직접 통합하여 더 작은 모델을 훈련시킵니다.

왼쪽, 대규모 언어 모델에 대한 일반적인 하이퍼스케일 접근 방식; 오른쪽, TLM의 슬림 라인 방법으로 주제 또는 질문별로 대규모 언어 코퍼스를 탐색합니다. 출처: https://arxiv.org/pdf/2111.04130.pdf
TLM은 단일 질문에 대한 답변을 제공하는 고유한 NLP 알고리즘 또는 모델을 생성합니다. 이는 더 큰 일반 언어 모델을 생성하는 것보다 더 효율적입니다. TLM을 테스트한 결과, 연구자들은 새로운 접근 방식이 Pretrained Language Models와 비교하여 유사하거나 더 나은 결과를 얻을 수 있음을 발견했습니다.
TLM은 8개의 분류 데이터셋에서 테스트되었으며, 4개의 도메인에서 수행되었습니다. 결과는 TLM이 PLM보다 더 정확하고 효율적임을 보여주었습니다. 연구자들은 TLM이 더 큰 규모에서 더 많은 이점을 가질 수 있음을 발견했습니다. 이는 더 큰 규모의 PLM이 특정 작업에 유용하지 않은 더 일반적인 지식을 저장하도록 훈련되었을 수 있음을 시사합니다.
비용이 많이 드는 답변
대규모 언어 모델을 훈련시키는 비용은 점점 더 많이 증가하고 있습니다. 이는 자연어 처리 분야에서 중요한 문제입니다. 2019년에 연구자들은 XLNet 모델을 훈련시키는 비용이 61,440 달러라고 계산했습니다. 이는 2.5일 동안 512개의 코어와 64개의 장치를 사용하여 수행되었습니다. GPT-3의 경우 훈련 비용이 1,200만 달러로 추정됩니다. 이는 GPT-2의 200배입니다.
쿼리需求에 따른 데이터 하위 집합
새로운 아키텍처는 쿼리를 사용하여 대규모 언어 데이터베이스에서 하위 집합을 정의합니다. 이는 정확한 분류, 레이블 및 일반화를 제공하기 위해 사용됩니다. 연구자들은 TLM이 두 가지 주요 아이디어에 의해 동기화되었다고 말합니다. 첫째, 인간은 작은 부분의 지식만을 사용하여 작업을 수행합니다. 둘째, 지도 학습 데이터를 사용하여 언어 모델링 목표를 최적화하는 것이 더 효율적입니다.
‘TLM은 두 가지 주요 아이디어에 의해 동기화됩니다. 첫째, 인간은 작은 부분의 지식만을 사용하여 작업을 수행합니다. 둘째, 지도 학습 데이터를 사용하여 언어 모델링 목표를 최적화하는 것이 더 효율적입니다. 따라서 TLM은 작업 데이터를 사용하여 일반 코퍼스에서 작은 하위 집합을 가져옵니다. 이는 지도 학습 목표와 언어 모델링 목표를 함께 최적화하는 것을 따릅니다.’
테스트 및 결과
TLM은 8개의 분류 데이터셋에서 테스트되었습니다. 결과는 TLM이 PLM보다 더 정확하고 효율적임을 보여주었습니다. 연구자들은 TLM이 더 큰 규모에서 더 많은 이점을 가질 수 있음을 발견했습니다. 이는 더 큰 규모의 PLM이 특정 작업에 유용하지 않은 더 일반적인 지식을 저장하도록 훈련되었을 수 있음을 시사합니다.
‘이 결과는 TLM이高度 정확하고 효율적임을 보여줍니다. 또한 TLM은 더 큰 규모에서 더 많은 이점을 가질 수 있습니다. 이는 더 큰 규모의 PLM이 특정 작업에 유용하지 않은 더 일반적인 지식을 저장하도록 훈련되었을 수 있음을 시사합니다.’













