Anderson의 관점
인공 기계 터크를 사용한 사전 훈련된 언어 모델 생성

기계 학습 시스템의 개발은 데이터 레이블링에 크게 의존하는데, 수백, 심지어 수천 개의 질문(예: 이 그림은 고양이의 사진인가? 및 이 텍스트는 공격적인가?)이 해결되어야 하며, 이를 통해 AI 시스템을 훈련할 수 있는 권위 있는 데이터 세트가 개발됩니다.
우리는 모두 이 과정에 어떤 시점에 기여하지만, 이러한 레이블링 작업의 대부분은 돈을 받고 수행하며, Amazon Mechanical Turk와 같은 프레임워크에서 작업자들이 작은 분류 작업을 수행합니다. 이는 피스워크 경제에서 이루어집니다.
사전 훈련된 언어 모델(PLM)이 현재 Amazon Mechanical Turk와 유사한 플랫폼에서 크라우드소싱되는 더 기본적인 인간 지능 작업(HIT)의 일부를 수행할 수 있다면 모델 개발 비용을 절감할 수 있습니다.
독일과 화웨이의 최근 연구에서는 논문 LMTurk: Few-Shot Learners as Crowdsourcing Workers에서 이를 제안합니다.
Few-Shot Learning을 수행하는 언어 모델
저자들은 (人間) 터크 작업자에게 주어지는 작업의 더 간단한 계층이 자동화된 프레임워크가 몇 가지 예제를 통해 미니 작업을 결정해야 하는 Few-Shot Learning과 유사하다고 제안합니다.
따라서 저자들은 기존의 PLM에서 학습할 수 있는 AI 시스템을 제안하며, 이러한 모델은 원래 크라우드워커에 의해 훈련되었으며, 사람들로부터 기계로 전달된 핵심 지식이 이미 효과적으로 전달되었으며, 이러한 지식이 상대적으로 불변하거나 경험적이면 자동화된 언어 모델 프레임워크가 이러한 작업을 수행할 수 있다고 주장합니다.
‘우리의 기본 아이디어는 NLP 작업 T에 대해 few-shot 학습자를 비전문가 작업자로 간주하여 인간 언어 기술을 위한 자원을 주석 처리하는 크라우드소싱 작업자와 유사하게 간주하는 것입니다. 우리는 크라우드소싱 작업자를 few-shot 학습자의 한 유형으로 볼 수 있다는 사실에 의해 영감을 받았습니다.’
이것의 의미는 미래의 AI 시스템이 의존하는 많은 근본적인 진실이 인간에 의해 이미 수년 전에 파생되었으며, 이후 사전 검증된 정보로 간주되어 더 이상 인간의 개입이 필요하지 않다고 가정합니다.
중간 수준, 준수 언어 모델을 위한 작업
인간이 루프에 있는 비용을 절감하려는 동기에 더하여, 연구자들은 ‘중간 수준’의 PLM을真正한 기계 터크로 사용하여 이러한 ‘중간 수준’ 시스템에 유용한 작업을 제공하는 것을 제안합니다. 이러한 시스템은 점점 더 많은 거대한 Few-Shot 학습자들이 훈련됨에 따라 GPT-3와 같은 헤드라인을 장식하는 대규모 언어 모델에 의해 점점 더 그늘지게 됩니다. 이러한 모델은 이러한 작업에 너무 비용이 많이 들고 오버 스펙입니다.
‘이 논문에서 우리의 목표는 현재 few-shot 학습자들의 사용을 더 효과적으로 만드는 방법을 개발하는 것입니다. 이것은 매우 중요합니다. 왜냐하면 점점 더 많은 거대한 few-shot 학습자들이 훈련되고 있기 때문입니다. 어떻게 효과적으로 사용할 수 있는지에 대한 질문은 매우 중요합니다. 특히 우리는難_deploy할 수 있는 큰 모델의 대안을 원합니다.
‘동시에 우리는 PLM의 강점을 최대한 활용하고자 합니다. 그들의 유연성은 작업에 걸쳐서 광범위한 적용 가능성을 보장하며, 그들의 언어와 세계에 대한 지식(전처리 과정에서 학습됨)은 few-shot 학습자의 데이터 효율성에 나타나며, 데이터 주석 처리에서 노동과 시간 소비를 줄입니다.’
현재까지, 저자들은 NLP에서 few-shot 학습자들이 고급 자연어 시스템으로 가는 길에 임시 단계로 간주되어 왔다고 주장하며, 이러한 작업은 추상적으로 그리고 이러한 시스템의 가능한 유용성에 대한 고려 없이 수행되어 왔습니다.
방법
저자들은 LMTurk(Language Model as Mechanical Turk)을 제안하며, 자동화된 HIT의 입력이 중간 수준의 NLP 모델에 대한 레이블을 제공하는 워크플로우입니다.

LMTurk의 기본 개념 모델 출처: https://arxiv.org/pdf/2112.07522.pdf
이 첫 번째 버전은 few-shot 인간 레이블링된 ‘골드’ 데이터에 의존하며, 여기서 인간 터크 작업자들이 제한된 수의 작업에 대한 레이블을 주석 처리했으며, 이러한 레이블은 잘 평가되었습니다. 직접적인 인간 감시 또는 합의 투표를 통해 이러한 레이블이 주어졌습니다. 이러한 스키마의 의미는 인간 기반 시작점에서 파생된 포크 또는 개발은 앞으로 추가적인 인간 입력이 필요하지 않을 수 있습니다.
저자들은 후속 하이브리드 모델(인간 입력이 있지만 크게 감소함)과 관련된 추가 실험을 제안했지만, 연구 목적으로 LMTurk 모델을 인간 생성 HIT 작업자와의 결과와 비교하지 않았습니다. 이유는 골드 레이블링된 데이터가 자체적으로 ‘인간 입력’이기 때문입니다.
터크 작업을 수행하도록 설계된 PLM은 2021年に 중국의 연구자들이 발표한 P-Tuning 방법을 사용하여 작업에 맞게 조정되었습니다. 이 방법은 GPT-3 스타일 모델의 자연어 이해(NLU) 작업 성능을 개선하기 위해 훈련 가능한 연속적인 프롬프트 임베딩을 제안했습니다.
![P-Tuning은 GPT 스타일 모델의 예측力を 깊게 하고 언어에 대한 개념적 이해의 외관을 개선하기 위해 임베디드 유사 프롬프트를 통합합니다. 이 경우 시작 쿼리는 '영국의 수도는 [x]'입니다.](https://www.unite.ai/wp-content/uploads/2021/12/p-tuning.jpg)
P-Tuning은 GPT 스타일 모델의 예측력을 깊게 하고 언어에 대한 개념적 이해의 외관을 개선하기 위해 임베디드 유사 프롬프트를 통합합니다. 이 경우 시작 쿼리는 ‘영国の 수도는 [x]’입니다. 출처: https://arxiv.org/pdf/2103.10385.pdf
데이터 및 아키텍처
LMTurk는 다섯 개의 데이터 세트에서 평가되었습니다: 스탠퍼드 감정 트리뱅크의 두 개; AG의 뉴스 코퍼스; 텍스트 포함 인식(RTE); 언어적 수용성 코퍼스(CoLA).
LMTurk의 더 큰 모델은 공개적으로 사용 가능한 PLM ALBERT-XXLarge-v2(AXLV2)를 자동화된 터크로 변환하기 위한 소스 모델로 사용합니다. 이 모델은 2.23억 개의 매개변수를 특징으로 하며(이는 GPT-3의 175억 개 매개변수와 비교됨), AXLV2는 더 높은 규모의 모델인 334M BERT-Large를 능가하는 것으로 나타났습니다.
보다 민첩하고 경량화된 모델 및 에지 배포를 위한 모델로, 이 프로젝트는 TinyBERT-General-4L-312D(TBG)를 사용합니다. 이는 1,450만 개의 매개변수를 특징으로 하며, BERT-베이스(1억 1,000만 개 매개변수)와 비교하여 성능이 비슷합니다.
프롬프트를 사용한 훈련은 PyTorch와 HuggingFace에서 AXLV2에 대해 100개의 배치 단계에서 배치 크기 13, 학습률 5e-4, 선형 감소로 수행되었습니다. 각 실험은 세 개의 다른 무작위 시드에서 시작되었습니다.
결과
LMTurk 프로젝트는 NLP의 다양한 하위 분야에 대한 다양한 모델을 실행하므로 연구자들의 실험 결과를 LMTurk이 자체적으로 사용 가능한 접근 방식을 제공한다는 경험적 증거로 줄이기 어렵습니다.
그러나 평가를 위해, 저자들은 두 가지 이전 연구와 자신의 방법을 비교합니다: 독일 연구자 Timo Schick과 Hinrich Schutze의 Few-Shot Text Classification과 자연어 추론을 위한 Cloze 질문 활용; Gao, Chen 및 Fisch(Princeton 및 MIT 출신)의 사전 훈련된 언어 모델을 더好的 Few-Shot 학습자로 만드는 것 에 포함된 결과입니다.

LMTurk 실험의 결과, 연구자들은 ‘비교할 수 있는’ 성능을 보고했습니다.
간단히 말해, LMTurk는 연구자들이 금 레이블링된 인간 起源 데이터를 발전하는 중간 수준 언어 모델에 통합하여 자동화된 시스템이 인간 입력을 대신할 수 있는 유용한 연구 방향을 제공합니다.
이 분야의 이전 연구와 마찬가지로, 중심 개념은 원래 인간 데이터의 불변성에 의존하며, 시간적 요인(이것은 NLP 개발의 중요한 장애물이 될 수 있음)이 기계 전용 계보가 발전함에 따라 추가적인 인간 개입을 필요로 하지 않을 것이라는 가정에 의존합니다.
원래 2022년 12월 30일에 게시됨












