โมเดลและแพลตฟอร์ม AI
การประเมินโมเดลภาษาขนาดใหญ่: คู่มือทางเทคนิค
โมเดลภาษาขนาดใหญ่ (LLM) เช่น GPT-4, Claude และ LLaMA ได้ระเบิดความนิยมอย่างมาก เนื่องจากความสามารถในการสร้างข้อความที่เหมือนมนุษย์ ทำให้ระบบ AI เหล่านี้ถูกใช้ในทุกอย่างตั้งแต่การสร้างเนื้อหาถึงแชทบอทบริการลูกค้า
แต่เราจะรู้ได้อย่างไรว่าโมเดลเหล่านี้ดีจริงๆ? ด้วยโมเดล LLM ใหม่ที่ถูกประกาศอย่างต่อเนื่อง ทั้งหมดอ้างว่าเป็นโมเดลที่ใหญ่กว่าและดีกว่า เราจะประเมินและเปรียบเทียบประสิทธิภาพของพวกมันได้อย่างไร?
ในคู่มือฉบับสมบูรณ์นี้ เราจะสำรวจเทคนิคชั้นนำสำหรับการประเมินโมเดลภาษาขนาดใหญ่ เราจะมองหาข้อดีและข้อเสียของแต่ละวิธี และเมื่อใดที่ควรใช้พวกมัน และวิธีการใช้พวกมันในการทดสอบ LLM ของคุณเอง
เมตริกเฉพาะงาน
หนึ่งในวิธีที่ตรงไปตรงมาที่สุดในการประเมิน LLM คือการทดสอบมันบนงาน NLP ที่กำหนดโดยใช้เมตริกมาตรฐาน ตัวอย่างเช่น
การสรุป
สำหรับงานสรุป เมตริกอย่าง ROUGE (Recall-Oriented Understudy for Gisting Evaluation) ถูกใช้บ่อย ROUGE เปรียบเทียบสรุปที่โมเดลสร้างกับสรุป “อ้างอิง” ที่เขียนโดยมนุษย์ โดยนับจำนวนคำหรือวลีที่เหมือนกัน
มีหลายรูปแบบของ ROUGE แต่ละรูปแบบมีข้อดีและข้อเสียของมันเอง:
- ROUGE-N: เปรียบเทียบการซ้ำกันของ n-gram (ลำดับของ N คำ) ROUGE-1 ใช้ unigram (คำเดียว) ROUGE-2 ใช้ bigram และอื่นๆ ข้อได้เปรียบคือสามารถจับลำดับคำได้ แต่อาจจะเข้มงวดเกินไป
- ROUGE-L: ขึ้นอยู่กับลำดับย่อยที่ยาวที่สุด (LCS) มีความยืดหยุ่นมากกว่าในเรื่องลำดับคำ แต่มุ่งเน้นไปที่จุดหลัก
- ROUGE-W: ระบุน้ำหนักของการตรงกันของ LCS พยายามที่จะปรับปรุง ROUGE-L
โดยทั่วไป เมตริก ROUGE มีความเร็วในการคำนวณ อัตโนมัติ และทำงานได้ดีสำหรับการจัดอันดับสรุปของระบบ แต่ไม่สามารถวัดความสอดคล้องหรือความหมายได้ สรุปอาจได้รับคะแนน ROUGE สูงและยังคงเป็นเรื่องที่ไม่มีเหตุผล
สูตรสำหรับ ROUGE-N คือ:
ROUGE-N=∑∈{Reference Summaries}∑∑�∈{Reference Summaries}∑
โดยที่:
Count_{match}(gram_n)คือจำนวน n-gram ในทั้งสรุปที่ถูกสร้างและสรุปอ้างอิงCount(gram_n)คือจำนวน n-gram ในสรุปอ้างอิง
ตัวอย่างสำหรับ ROUGE-1 (unigrams):
- สรุปที่ถูกสร้าง: “แมวนั่ง”
- สรุปอ้างอิง: “แมวนั่งอยู่บนพรม”
- คำที่ซ้ำกัน: “แมว”, “นั่ง”
- คะแนน ROUGE-1 = 3/5 = 0.6
ROUGE-L ใช้ลำดับย่อยที่ยาวที่สุด (LCS) มีความยืดหยุ่นมากกว่าในเรื่องลำดับคำ สูตรคือ:
ROUGE-L=���(generated,reference)max(length(generated), length(reference))
โดยที่ LCS คือความยาวของลำดับย่อยที่ยาวที่สุด
ROUGE-W ระบุน้ำหนักของการตรงกันของ LCS พิจารณาความสำคัญของการตรงกันแต่ละครั้งในการใช้งาน LCS
การแปล
สำหรับงานแปล BLEU (Bilingual Evaluation Understudy) เป็นเมตริกที่ได้รับความนิยม BLEU วัดความคล้ายคลึงกันระหว่างการแปลที่โมเดลสร้างและแปลโดยผู้เชี่ยวชาญ โดยใช้ความแม่นยำของ n-gram และการลงโทษความสั้น
ประเด็นสำคัญของวิธีการทำงานของ BLEU:
- เปรียบเทียบการซ้ำกันของ n-gram สำหรับ n สูงสุด 4 (unigrams, bigrams, trigrams, 4-grams)
- คำนวณค่าเฉลี่ยเรขาคณิตของความแม่นยำของ n-gram
- ใช้การลงโทษความสั้นหากการแปลสั้นกว่าข้อมูลอ้างอิงมาก
- โดยทั่วไปอยู่ในช่วง 0 ถึง 1 โดยที่ 1 คือการตรงกันที่สมบูรณ์แบบกับข้อมูลอ้างอิง
BLEU สัมพันธ์กับการตัดสินของมนุษย์เกี่ยวกับคุณภาพการแปลอย่างสมเหตุสมผล แต่ยังคงมีข้อจำกัด:
- วัดเฉพาะความแม่นยำเท่านั้น ไม่ใช่การเรียกคืนหรือ F1
- มีปัญหากับการแปลที่สร้างสรรค์โดยใช้คำพูดที่แตกต่างกัน
- เสี่ยงต่อการ “หลอกลวง” ด้วยเคล็ดลับการแปล
เมตริกการแปลอื่นๆ เช่น METEOR และ TER พยายามที่จะปรับปรุงจุดอ่อนของ BLEU แต่โดยทั่วไป เมตริกอัตโนมัติไม่สามารถจับคุณภาพการแปลได้อย่างสมบูรณ์
งานอื่นๆ
นอกเหนือจากงานสรุปและแปล เมตริกอย่าง F1, ความแม่นยำ, MSE และอื่นๆ สามารถใช้เพื่อประเมินประสิทธิภาพของ LLM ในงานต่างๆ เช่น:
- การจำแนกประเภทข้อความ
- การดึงข้อมูล
- การตอบคำถาม
- การวิเคราะห์ความรู้สึก
- การตรวจจับข้อผิดพลาดทางไวยากรณ์
ข้อได้เปรียบของเมตริกเฉพาะงานคือการประเมินสามารถทำได้อย่างสมบูรณ์อัตโนมัติ โดยใช้เซตข้อมูลมาตรฐาน เช่น SQuAD สำหรับการตอบคำถาม และ GLUE สำหรับงานต่างๆ ผลลัพธ์สามารถติดตามได้อย่างง่ายดายเมื่อเวลาผ่านไปและโมเดลปรับปรุง
อย่างไรก็ตาม เมตริกเหล่านี้มุ่งเน้นแคบๆ และไม่สามารถวัดคุณภาพภาษาโดยรวมได้ LLM ที่ทำงานได้ดีในเมตริกสำหรับงานเดียวอาจล้มเหลวในการสร้างข้อความที่สอดคล้อง มีเหตุผล และมีประโยชน์โดยทั่วไป
มาตรฐานการวิจัย
วิธีการที่ได้รับความนิยมในการประเมิน LLM คือการทดสอบมันบนมาตรฐานการวิจัยที่ครอบคลุมหัวข้อและทักษะที่หลากหลาย มาตรฐานเหล่านี้ทำให้สามารถทดสอบโมเดลได้อย่างรวดเร็วและใหญ่โต
มาตรฐานที่รู้จักกันดีบางตัว ได้แก่:
- SuperGLUE – ชุดงานที่ท้าทายซึ่งประกอบด้วยงานภาษา 11 งานที่หลากหลาย
- GLUE – ชุดงานที่ประกอบด้วยงานเข้าใจประโยค 9 งาน ซึ่งง่ายกว่า SuperGLUE
- MMLU – 57 งานที่แตกต่างกันใน STEM, สังคมศาสตร์ และมนุษยศาสตร์ ทดสอบความรู้และความสามารถในการให้เหตุผล
- Winograd Schema Challenge – ปัญหาในการแก้ไขสรรพนามที่ต้องการความสามารถในการให้เหตุผลทั่วไป
- ARC – งานที่ท้าทายในการให้เหตุผลภาษา
- Hellaswag – การให้เหตุผลทั่วไปเกี่ยวกับสถานการณ์
- PIQA – คำถามฟิสิกส์ที่ต้องการแผนภาพ
โดยการประเมินบนมาตรฐานเหล่านี้ นักวิจัยสามารถทดสอบโมเดลได้อย่างรวดเร็วเกี่ยวกับความสามารถในการทำคณิตศาสตร์ การให้เหตุผล การเขียนโค้ด ความสามารถทั่วไป และอื่นๆ เปอร์เซ็นต์ของคำถามที่ตอบถูกต้องกลายเป็นเมตริกมาตรฐานสำหรับการเปรียบเทียบโมเดล
อย่างไรก็ตาม ปัญหาหลักของมาตรฐานคือ การปนเปื้อนของข้อมูลฝึก มาตรฐานหลายตัวมีตัวอย่างที่โมเดลเห็นระหว่างการฝึกอบรมก่อนหน้านี้ ทำให้โมเดลสามารถ “จดจำ” คำตอบของคำถามเฉพาะและทำงานได้ดีกว่าที่แท้จริง
มีการพยายาม “ล้าง” มาตรฐานโดยการลบตัวอย่างที่ซ้ำกัน แต่นี่เป็นเรื่องที่ท้าทาย โดยเฉพาะอย่างยิ่งเมื่อโมเดลอาจเห็นตัวอย่างที่แปลหรือเขียนใหม่ของคำถาม
ดังนั้น แม้ว่ามาตรฐานจะทดสอบชุดทักษะได้อย่างมีประสิทธิภาพ แต่ก็ไม่สามารถวัดความสามารถในการให้เหตุผลที่แท้จริงหรือหลีกเลี่ยงการอ่อนตัวของคะแนนเนื่องจากการปนเปื้อนของข้อมูลฝึกได้ วิธีการประเมินเสริมจึงจำเป็น
การประเมินตนเองของ LLM
แนวทางที่น่าสนใจคือการให้ LLM ประเมินผลลัพธ์ของ LLM อื่น ความคิดคือการนำแนวคิด “งานที่ง่ายกว่า” มาใช้:
- การสร้างผลลัพธ์คุณภาพสูงอาจเป็นงานที่ท้าทายสำหรับ LLM
- แต่การกำหนดว่าผลลัพธ์ที่กำหนดคุณภาพสูงหรือไม่นั้นเป็นงานที่ง่ายกว่า
ตัวอย่างเช่น ในขณะที่ LLM อาจต้องดิ้นรนในการสร้าง段落ที่มี事实 มีเหตุผล และมีประโยชน์ แต่สามารถตัดสินได้ง่ายกว่าว่า段落ที่กำหนดมีเหตุผลและมีความสอดคล้องหรือไม่
ดังนั้น กระบวนการคือ:
- ส่งคำสั่งไปยัง LLM แรกเพื่อสร้างผลลัพธ์
- ส่งคำสั่งและผลลัพธ์ที่สร้างไปยัง LLM “ประเมิน” ที่สอง
- ถาม LLM ประเมินว่าผลลัพธ์มีคุณภาพหรือไม่ ตัวอย่างเช่น “คำตอบข้างต้นมีเหตุผลหรือไม่?”
แนวทางนี้สามารถนำไปใช้ได้อย่างรวดเร็วและทำให้การประเมิน LLM อัตโนมัติ แต่มีบางความท้าทาย:
- ประสิทธิภาพขึ้นอยู่กับการเลือก LLM ประเมินและคำสั่ง
- ถูกจำกัดด้วยความยากของงานเดิม การประเมินเหตุผลที่ซับซ้อนยังคงเป็นงานที่ท้าทายสำหรับ LLM
- อาจมีค่าใช้จ่ายในการคำนวณสูงหากใช้ LLM API
การประเมินตนเองมีแนวโน้มที่จะสัญญาว่าจะประเมินข้อมูลที่ดึงมาในระบบการสร้างแบบเสริม (RAG) ระบบเพิ่มเติม LLM สามารถตรวจสอบได้ว่าบริบทที่ดึงมาใช้เหมาะสมหรือไม่
โดยรวมแล้ว การประเมินตนเองแสดงให้เห็นถึงความหวัง แต่ต้องการความระมัดระวังในการนำไปใช้ เป็นการเสริมการประเมินของมนุษย์ ไม่ใช่การแทนที่
การประเมินของมนุษย์
เมื่อพิจารณาถึงข้อจำกัดของเมตริกอัตโนมัติและมาตรฐาน การประเมินของมนุษย์ยังคงเป็นมาตรฐานทองคำในการประเมินคุณภาพของ LLM อย่างเข้มงวด
ผู้เชี่ยวชาญสามารถให้การประเมินเชิงคุณภาพที่มีรายละเอียดเกี่ยวกับ:
- ความแม่นยำและความถูกต้องของข้อเท็จจริง
- การให้เหตุผล ความมีเหตุผล และความสามารถทั่วไป
- ความสอดคล้อง ความต่อเนื่อง และความอ่านง่าย
- ความเหมาะสมของโทน สไตล์ และเสียง
- ความถูกต้องทางไวยากรณ์และความคล่องแคล่ว
- ความสร้างสรรค์และความละเอียด
ในการประเมินโมเดล มนุษย์จะได้รับชุดคำสั่งและผลลัพธ์ที่ LLM สร้าง พวกเขาจะประเมินคุณภาพของผลลัพธ์ โดยใช้มาตราส่วนการให้คะแนนและกรอบการทำงาน
ข้อเสียคือการประเมินของมนุษย์เป็นเรื่องที่มีค่าใช้จ่ายสูง ใช้เวลานาน และยากต่อการขยายขนาด นอกจากนี้ยังต้องมีการพัฒนากรอบการทำงานมาตรฐานและฝึกผู้ให้คะแนนเพื่อใช้กรอบการทำงานเหล่านั้นอย่างสม่ำเสมอ
บางนักวิจัยได้สำรวจวิธีการสร้างสรรค์ในการระดมทุนการประเมินของมนุษย์โดยใช้ระบบทัวร์นาเมนต์ โดยที่คนเดิมพันและตัดสินการแข่งขันระหว่างโมเดล แต่การครอบคลุมยังคงจำกัดเมื่อเทียบกับการประเมินของมนุษย์แบบดั้งเดิม
สำหรับการใช้งานทางธุรกิจที่คุณภาพมีความสำคัญมากกว่าขนาดการประเมินแบบผู้เชี่ยวชาญยังคงเป็นมาตรฐานทองคำ尽管มีค่าใช้จ่ายสูง นี่เป็นเรื่องจริงโดยเฉพาะสำหรับการใช้งาน LLM ที่มีความเสี่ยง
สรุป
การประเมินโมเดลภาษาขนาดใหญ่อย่างสมบูรณ์จำเป็นต้องใช้ชุดเครื่องมือที่หลากหลายของวิธีการที่เสริมกัน ไม่ใช่การอาศัยเทคนิคเดียว
โดยการผสมผสานวิธีการอัตโนมัติสำหรับความเร็วกับการกำกับดูแลของมนุษย์อย่างเข้มงวดสำหรับความแม่นยำ เราสามารถพัฒนาวิธีการทดสอบที่เชื่อถือได้สำหรับโมเดลภาษาขนาดใหญ่ ด้วยการประเมินที่เข้มงวด เราสามารถปลดปล่อยศักยภาพที่ยิ่งใหญ่ของ LLM ขณะเดียวกันก็จัดการความเสี่ยงของพวกมันอย่างมีความรับผิดชอบ












