มุมมองของ Anderson
สร้าง Artificial Mechanical Turks ด้วยโมเดลภาษาที่ได้รับการฝึกฝนล่วงหน้า

ส่วนสำคัญของการพัฒนาระบบการเรียนรู้ของเครื่องจักรขึ้นอยู่กับการทำเครื่องหมายข้อมูล ซึ่งหลายร้อยหรือแม้กระทั่งหลายพันคำถาม (เช่น รูปภาพนี้เป็นรูปแมวหรือไม่? และ ข้อความนี้เป็นข้อความที่ไม่เหมาะสมหรือไม่?) จะต้องได้รับการแก้ไขเพื่อพัฒนาชุดข้อมูลที่มีอำนาจในการฝึกอบรมระบบ AI
แม้ว่า เราทุกคนมีส่วนร่วม ในกระบวนการนี้ในบางจุด แต่งานส่วนใหญ่ของการทำเครื่องหมายเหล่านี้จะถูก ทำเพื่อเงิน โดยคนงานที่ทำงานในระบบ Amazon Mechanical Turk โดยที่ผู้ทำเครื่องหมายจะทำงานการจำแนกประเภทเล็กๆ น้อยๆ ใน เศรษฐกิจแบบชิ้นงาน
การพัฒนาโมเดลจะถูกถูกลงหากโมเดลภาษาที่ได้รับการฝึกฝนล่วงหน้า (PLMs) สามารถทำหน้าที่บางอย่างของงาน Human Intelligence Tasks (HITs) ที่ง่ายกว่า ซึ่งปัจจุบันกำลังถูกทำโดยคนงานที่ Amazon Mechanical Turk และ แพลตฟอร์มที่คล้ายกัน
การวิจัยล่าสุดจากเยอรมนีและ Huawei เสนอแนวคิดนี้ใน เอกสาร LMTurk: Few-Shot Learners as Crowdsourcing Workers
โมเดลภาษาที่ทำการเรียนรู้แบบ Few-Shot
ผู้เขียนเสนอว่าชั้นงานที่ง่ายกว่าที่มักจะถูกมอบหมายให้คนงาน (Turk) เหมือนกับการเรียนรู้แบบ Few-Shot ซึ่งเฟรมเวิร์กอัตโนมัติต้องตัดสินใจเล็กๆ น้อยๆ ตามตัวอย่างจำนวนหนึ่งที่ให้ไว้
พวกเขาจึงเสนอว่าระบบ AI สามารถเรียนรู้ได้อย่างมีประสิทธิภาพจาก PLMs ที่ถูกฝึกฝนโดยคนงานที่ทำเครื่องหมาย – ว่าความรู้หลักที่ถูกส่งต่อจากคนสู่เครื่องจักรได้ถูกทำเสร็จแล้ว และว่าเมื่อใดที่ความรู้นั้นเป็นแบบไม่เปลี่ยนแปลงหรือเป็นข้อเท็จจริงในบางวิธี ระบบโมเดลภาษาอัตโนมัติสามารถทำหน้าที่เหล่านี้ได้เอง
‘ความคิดพื้นฐานของเราคือการปฏิบัติต่อผู้เรียนรู้แบบ Few-Shot เป็นคนงานที่ไม่ใช่ผู้เชี่ยวชาญ ซึ่งคล้ายกับคนงานที่ทำเครื่องหมายสำหรับเทคโนโลยีภาษาของมนุษย์ เราได้รับแรงบันดาลใจจากข้อเท็จจริงที่ว่าเราสามารถมองเห็นคนงานที่ทำเครื่องหมายเป็นคนเรียนรู้แบบ Few-Shot’
ผลที่ตามมา รวมถึงความเป็นไปได้ที่หลาย “ความจริง” ที่ระบบ AI ในอนาคตพึ่งพา จะถูกพัฒนาโดยมนุษย์หลายปีที่แล้ว และถูกมองว่าเป็นข้อมูลที่ถูกตรวจสอบและใช้ประโยชน์ได้โดยไม่ต้องมีการแทรกแซงจากมนุษย์อีกต่อไป
งานสำหรับโมเดลภาษา Mid-Range ที่มีประสิทธิภาพ Semi
นอกจากแรงจูงใจในการลดต้นทุนของคนงานที่ทำเครื่องหมาย ผู้วิจัยเสนอว่าการใช้ PLMs ระดับกลางเป็น “คนงานที่ทำเครื่องหมาย” ที่แท้จริงให้ผลงานที่มีประโยชน์สำหรับระบบเหล่านี้ ซึ่งกำลังถูกบดบังโดยโมเดลภาษาที่มีขนาดใหญ่และแพง เช่น GPT-3 ซึ่งแพงและเกินความต้องการสำหรับงานเหล่านี้
‘เป้าหมายของเราในเอกสารนี้คือการคิดค้นวิธีการที่ใช้คนเรียนรู้แบบ Few-Shot ที่มีประสิทธิภาพมากขึ้น ซึ่งเป็นเรื่องสำคัญเพราะมีคนเรียนรู้แบบ Few-Shot จำนวนมากที่ถูกฝึกฝน วิธีการใช้งานที่มีประสิทธิภาพจึงเป็นคำถามที่สำคัญ’
‘ในขณะเดียวกัน เราต้องการใช้ประโยชน์จากจุดแข็งของ PLMs ให้เต็มที่ ความสามารถในการปรับเปลี่ยนได้ทำให้สามารถใช้งานได้หลากหลายงาน และความรู้ที่กว้างขวางเกี่ยวกับภาษาและโลก (ที่ได้รับจากขั้นตอนการฝึกฝน) ทำให้คนเรียนรู้แบบ Few-Shot มีประสิทธิภาพในการใช้ข้อมูลและลดการทำงานและเวลาที่ใช้ในการทำเครื่องหมายข้อมูล’
จนถึงปัจจุบัน ผู้เขียนแย้งว่าคนเรียนรู้แบบ Few-Shot ใน NLP ถูกมองว่าเป็นขั้นตอนชั่วคราวที่ไม่สำคัญบนเส้นทางสู่ระบบภาษาที่มีประสิทธิภาพสูง ซึ่งใช้ทรัพยากรมาก และงานนี้ได้ถูกทำในลักษณะที่ไม่มีการพิจารณาถึงประโยชน์ที่เป็นไปได้ของระบบเหล่านี้
วิธีการ
ผู้เขียนเสนอ LMTurk (Language Model as mechanical Turk) ในกระบวนการที่ข้อมูลอินพุตจาก HIT อัตโนมัตินี้ให้เครื่องหมายสำหรับโมเดล NLP ระดับกลาง

รูปแบบการทำงานพื้นฐานสำหรับ LMTurk Source: https://arxiv.org/pdf/2112.07522.pdf
การทำงานครั้งแรกนี้พึ่งพาข้อมูล “ทอง” ที่คนงานที่ทำเครื่องหมายได้ทำเครื่องหมายไว้สำหรับงานจำนวนจำกัด และเครื่องหมายเหล่านั้นได้รับการประเมินอย่างดี โดยการกำกับดูแลโดยตรงหรือการลงคะแนนเสียงโดยรวม ผลที่ตามมาของระบบนี้คือการแยกหรือพัฒนาต่อจากจุดเริ่มต้นที่มีคนงานที่ทำเครื่องหมายอาจไม่ต้องมีการแทรกแซงจากคนงานที่ทำเครื่องหมายอีกต่อไป
แม้ว่าผู้เขียนจะเสนองานทดลองเพิ่มเติมโดยใช้โมเดลไฮบริด (ที่มีการแทรกแซงจากคนงานที่ทำเครื่องหมาย แต่ลดลงมาก) แต่พวกเขาไม่ได้ทำการทดลอง LMTurk กับผลลัพธ์ที่เทียบเท่ากับคนงานที่ทำเครื่องหมาย เนื่องจากข้อมูล “ทอง” เหล่านั้นเองเป็น “การแทรกแซงจากคนงานที่ทำเครื่องหมาย”
PLM ที่ถูกออกแบบมาเพื่อทำงาน Turk ได้ถูกปรับให้เหมาะสมกับงานโดย P-Tuning วิธีการที่ตีพิมพ์โดยนักวิจัยจากจีนในปี 2021 ซึ่งเสนอการฝึกอบรมแบบต่อเนื่อง การฝังตัวแบบพรอมต์ เพื่อปรับปรุงประสิทธิภาพของโมเดล GPT-3 ในงาน NLU

P-Tuning พยายามที่จะเพิ่มพลังในการทำนายของโมเดล GPT-3 และการแสดงออกถึงความเข้าใจภาษาโดยการรวมการฝังตัวแบบพรอมต์ Source: https://arxiv.org/pdf/2103.10385.pdf
ข้อมูลและสถาปัตยกรรม
LMTurk ถูกประเมินในห้าชุดข้อมูล: สองชุดจาก Stanford Sentiment Treebank; AG’s News Corpus; Recognizing Textual Entailment (RTE); และ Corpus of Linguistic Acceptability (CoLA)
สำหรับโมเดลที่ใหญ่กว่า LMTurk ใช้ PLMs ที่มีอยู่ใน ALBERT-XXLarge-v2 (AXLV2) เป็นโมเดลต้นฉบับที่จะถูกแปลงเป็น Turk อัตโนมัติ โมเดลนี้มีพารามิเตอร์ 223 ล้านตัว (เมื่อเทียบกับ 175 พันล้านพารามิเตอร์ ใน GPT-3) AXLV2 ผู้เขียนสังเกตเห็นว่าได้พิสูจน์แล้วว่าสามารถเอาชนะโมเดลที่มีขนาดใหญ่กว่า เช่น 334M BERT-Large
สำหรับโมเดลที่มีขนาดเล็กและสามารถใช้งานได้ง่ายกว่า โครงการนี้ใช้ TinyBERT-General-4L-312D (TBG) ซึ่งมีพารามิเตอร์ 14.5 ล้านตัวและมีประสิทธิภาพที่เทียบเท่ากับ BERT-base (ซึ่งมีพารามิเตอร์ 110 ล้านตัว)
การฝึกอบรมที่ใช้พรอมต์เกิดขึ้นบน PyTorch และ HuggingFace สำหรับ AXLV2 ใน 100 ขั้นตอนการฝึกอบรม โดยมีขนาดแบตช์ 13 และอัตราการเรียนรู้ 5e-4 โดยใช้การลดลงแบบเส้นตรง แต่ละการทดลองเริ่มต้นด้วยตัวเมล็ดสุ่มที่แตกต่างกันสามตัว
ผลลัพธ์
โครงการ LMTurk วิ่งโมเดลที่หลากหลายกับหลายๆ ส่วนย่อยของ NLP จนผลลัพธ์ที่ซับซ้อนของการทดลองของผู้วิจัยไม่สามารถลดลงได้ง่ายๆ ให้เป็นหลักฐานเชิงประจักษ์ที่ LMTurk เสนอแนวทางที่เป็นไปได้ในการนำงาน Few-Shot ที่มีต้นกำเนิดจากคนมาใช้ใหม่
อย่างไรก็ตาม สำหรับการประเมิน ผู้เขียนเปรียบเทียบวิธีการของตนเองกับงานก่อนหน้าสองงาน: การเอาเปรียบคำถาม Cloze สำหรับการจำแนกข้อความและอนุมานภาษา โดยนักวิจัยชาวเยอรมัน Timo Schick และ Hinrich Schutze; และผลลัพธ์จาก Prompt-Based Auto ที่นำเสนอใน การทำให้โมเดลภาษาที่ได้รับการฝึกฝนล่วงหน้าเป็นคนเรียนรู้แบบ Few-Shot ที่ดีกว่า โดย Gao, Chen และ Fisch (จาก Princeton และ MIT)

ผลลัพธ์จากการทดลอง LMTurk โดยผู้วิจัยรายงานว่ามี ‘ประสิทธิภาพที่เทียบเท่า’
โดยสรุป LMTurk เสนอแนวทางที่มีแนวโน้มสำหรับนักวิจัยที่ต้องการฝังตัวและทำให้ข้อมูลที่มีต้นกำเนิดจากคนเป็น “ทอง” ในโมเดลภาษาที่มีความซับซ้อนปานกลาง โดยที่ระบบอัตโนมัติสามารถแทนที่การแทรกแซงจากคนได้
เช่นเดียวกับงานก่อนหน้าที่มีจำนวนไม่มากนักในด้านนี้ ความคิดหลักนี้พึ่งพาความไม่เปลี่ยนแปลงของข้อมูลต้นฉบับของมนุษย์ และสมมติฐานที่วีปัจจัยทางเวลา ซึ่งสามารถเป็นอุปสรรคที่สำคัญต่อการพัฒนา NLP จะไม่ต้องการการแทรกแซงจากคนงานที่ทำเครื่องหมายอีกต่อไปเมื่อเครื่องจักรพัฒนา
ตีพิมพ์ครั้งแรกเมื่อวันที่ 30 ธันวาคม 2022












