วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล
เมื่อพื้นที่ของปัญญาประดิษฐ์ (AI) กำลังพัฒนาอย่างรวดเร็ว หนึ่งในอุปสรรคที่ผู้นำด้านเทคโนโลยี thườngพบคือการเปลี่ยนแปลงจาก “การทดลอง” เป็น “การเตรียมพร้อมสำหรับองค์กร” ในขณะที่แชทบอทสำหรับผู้บริโภคและแพลตฟอร์มแบบโต้ตอบช่วยให้คนสามารถจินตนาการได้ แต่ธุรกิจไม่สามารถประสบความสำเร็จได้ด้วยเพียงอินเทอร์เฟซแชทเท่านั้น ในยุคที่การแข่งขันรุนแรงกว่าเดิม ธุรกิจต้องการระบบนิเวศที่มีความสามารถในการปรับขนาดและความปลอดภัย และนี่คือสิ่งที่ Google พยายามที่จะนำเสนอด้วย Vertex AI ซึ่งเป็นแพลตฟอร์ม AI และ Machine Learning ที่รวมเป็นหนึ่งของ Google CloudVertex AI...
ความก้าวหน้าที่สำคัญในโมเดลภาษาขนาดใหญ่ (LLMs) ได้สร้างแรงบันดาลใจให้เกิดการพัฒนาโมเดลภาษาขนาดใหญ่หลายรูปแบบ (MLLMs) ความพยายามแรกๆ ของ MLLM เช่น LLaVA, MiniGPT-4 และ InstructBLIP แสดงให้เห็นถึงความสามารถในการเข้าใจหลายรูปแบบที่น่าสนใจ เพื่อผสมผสาน LLMs เข้ากับโดเมนหลายรูปแบบ การศึกษานี้ได้สำรวจการโพรเจ็กต์特徵จากตัวเข้ารหัสเฉพาะโหมดที่ได้รับการฝึกฝนล่วงหน้า เช่น CLIP เข้าสู่พื้นที่อินพุตของ LLMs ทำให้เกิดความเข้าใจและเหตุผลหลายรูปแบบภายในโครงสร้างทรานส์ฟอร์เมอร์ แม้ว่าจะมีการเลือกการออกแบบที่หลากหลายสำหรับ MLLMs เช่น ตัวเข้ารหัสวิชั่น...
ความสามารถในการตีความข้อมูลภาพที่ซับซ้อนอย่างแม่นยำเป็นจุดสนใจที่สำคัญของโมเดลภาษาขนาดใหญ่แบบหลายรูปแบบ (MLLMs) งานวิจัยล่าสุดแสดงให้เห็นว่าการเพิ่มการรับรู้ภาพที่ดีขึ้นจะช่วยลดการเห็นภาพที่ไม่ถูกต้องและปรับปรุงประสิทธิภาพในการทำงานที่ต้องใช้การแก้ปัญหา เช่น การจดจำตัวอักษรออปติคัลและวิเคราะห์เอกสาร โมเดล MLLM หลายรูปแบบใช้การผสมผสานของวิชันเอนโค้ดเดอร์เพื่อให้บรรลุเป้าหมายนี้ แม้ว่าจะประสบความสำเร็จ แต่ก็ยังมีการขาดการเปรียบเทียบเชิงระบบและการศึกษาการลบส่วนประกอบที่สำคัญ เช่น การเลือกผู้เชี่ยวชาญและการรวมผู้เชี่ยวชาญหลายคน บทความนี้ให้การสำรวจพื้นที่ดีไซน์ที่กว้างขวางสำหรับโมเดล MLLM โดยใช้การผสมผสานของวิชันเอนโค้ดเดอร์และการแก้ปัญหา ผลการวิจัยแสดงให้เห็นหลักการสำคัญที่ซ่อนอยู่ซึ่งเหมือนกันในกลยุทธ์ที่มีอยู่หลายรูปแบบ ซึ่งนำไปสู่การออกแบบที่เรียบง่ายแต่มีประสิทธิภาพ อีเกิลพบว่าการเพิ่มโทเค็นภาพจากวิชันเอนโค้ดเดอร์ที่แตกต่างกันโดยใช้การผสมผสานที่ง่ายที่สุดเทียบเท่ากับการใช้การผสมผสานที่ซับซ้อนกว่าหรือกลยุทธ์อื่นๆ นอกจากนี้ อีเกิลยังแนะนำการปรับแต่งล่วงหน้าเพื่อเชื่อมช่องว่างระหว่างวิชันเอนโค้ดเดอร์ที่มุ่งเน้นไปที่ภาพและโทเค็นภาษา ซึ่งช่วยเพิ่มความสอดคล้องของโมเดล ผลลัพธ์เป็นโมเดล MLLM ที่มีประสิทธิภาพสูงกว่าโมเดลที่มีอยู่ในปัจจุบันงานของอีเกิลเกี่ยวข้องกับการออกแบบโครงสร้างของโมเดลภาษาขนาดใหญ่แบบหลายรูปแบบ (MLLMs) นอกเหนือจากงานวิจัยที่กล่าวถึงแล้ว...
ความสำเร็จที่น่าประทับใจของการฝึกอบรมขนาดใหญ่ตามด้วยการปรับให้เหมาะสมสำหรับการสร้างแบบจำลองภาษาได้กำหนดแนวทางนี้ให้เป็นแนวปฏิบัติที่เป็นมาตรฐาน ในทำนองเดียวกัน วิธีการมองเห็นของคอมพิวเตอร์กำลังยอมรับการใช้ข้อมูลขนาดใหญ่สำหรับการฝึกอบรมก่อน โดยการเกิดขึ้นของชุดข้อมูลขนาดใหญ่ เช่น LAION5B, Instagram-3.5B, JFT-300M, LVD142M, Visual Genome และ YFCC100M ทำให้สามารถสำรวจข้อมูลได้มากกว่าขอบเขตของมาตรฐานดั้งเดิม งานที่โดดเด่นในโดเมนนี้รวมถึง DINOv2, MAWS และ AIM DINOv2 สามารถสร้างคุณสมบัติแบบจำลองตนเองได้ด้วยการปรับขนาดวิธีการ iBot ที่เปรียบเทียบกันบนชุดข้อมูล LDV-142M MAWS ศึกษาการปรับขนาดของ...
โมเดลภาษาขนาดใหญ่แบบยาวในปัจจุบันสามารถประมวลผลข้อมูลเข้าได้สูงสุด 100,000 โทเค็น แต่ก็ยังต้องดิ้นรนในการสร้างผลลัพธ์ที่มีความยาวเกิน 2,000 คำ การทดลองที่ควบคุมอย่างเข้มงวดเปิดเผยว่าความยาวการสร้างที่มีประสิทธิภาพของโมเดลถูกจำกัดโดยตัวอย่างที่เห็นระหว่างการฝึกอบรมแบบกำกับ (SFT) ในอีกทางหนึ่ง การจำกัดความยาวผลลัพธ์นี้เกิดจากความขาดแคลนตัวอย่างผลลัพธ์ที่มีความยาวในเซตข้อมูล SFT ที่มีอยู่ความก้าวหน้าล่าสุดในโมเดลภาษาขนาดใหญ่แบบยาวได้นำไปสู่การสร้างโมเดลที่มีความจุหน่วยความจำที่ขยายออกไปอย่างมีนัยสำคัญ ซึ่งสามารถประมวลผลประวัติที่เกิน 100,000 โทเค็นได้ อย่างไรก็ตาม แม้ว่าโมเดลเหล่านี้จะสามารถจัดการข้อมูลเข้าได้อย่างกว้างขวาง แต่โมเดลภาษาขนาดใหญ่แบบยาวในปัจจุบันก็ยังดิ้นรนในการสร้างผลลัพธ์ที่มีความยาวเท่ากันเพื่อสำรวจข้อจำกัดนี้ LongWriter ตรวจสอบความยาวผลลัพธ์สูงสุดของโมเดลภาษาขนาดใหญ่แบบยาวรุ่นล่าสุดโดยใช้คำถามที่ต้องการคำตอบที่มีความยาวต่างกัน เช่น “เขียนบทความ 10,000 คำเกี่ยวกับประวัติของจักรวรรดิโรมัน” ผลลัพธ์แสดงให้เห็นว่าโมเดลทั้งหมดล้มเหลวในการสร้างผลลัพธ์ที่มีความยาวเกิน 2,000...
โมเดลภาษาขนาดใหญ่ (LLMs) ถูกใช้มากขึ้นสำหรับงานที่ซับซ้อนซึ่งต้องการการเรียกใช้หลายครั้ง เทคนิคการกระตุ้นที่ซับซ้อน การควบคุมการไหล และการเข้า/ออกที่มีโครงสร้าง อย่างไรก็ตาม ระบบที่มีประสิทธิภาพสำหรับการเขียนโปรแกรมและดำเนินการแอปพลิเคชันเหล่านี้ยังขาดไป SGLang ซึ่งเป็นระบบที่แนะนำใหม่ มีเป้าหมายที่จะแก้ไขปัญหานี้โดยการให้การดำเนินการแบบมีประสิทธิภาพของโปรแกรมโมเดลภาษาที่ซับซ้อน SGLang ประกอบด้วยภาษาหน้าจอและรันไทม์ ภาษาหน้าจอทำให้การเขียนโปรแกรมง่ายขึ้นด้วยตัวช่วยสำหรับการสร้างและควบคุมความขนาน รันไทม์เร่งการดำเนินการผ่านการปรับให้เหมาะสมที่ใหม่ เช่น RadixAttention สำหรับการใช้ซ้ำ KV cache และเครื่องจักรสถานะจำกัดที่บีบอัดสำหรับการถอดรหัสการออกที่มีโครงสร้างที่เร็วขึ้น การทดลองแสดงให้เห็นว่า SGLang สามารถบรรลุประสิทธิภาพสูงถึง 6.4 เท่าเมื่อเทียบกับระบบการอนุมานรัฐของการทำงานบนโมเดลภาษาขนาดใหญ่และหลายรูปแบบที่หลากหลาย...
การฝึกอบรมโมเดลหลายรูปแบบขนาดใหญ่ (LMMs) ต้องการชุดข้อมูลขนาดใหญ่ที่มีลำดับของภาพและข้อความที่สลับกันอย่างเสรี แม้ว่าโมเดล LMM ที่เปิดแหล่งที่มาจะพัฒนาอย่างรวดเร็ว แต่ยังคงมีขาดแคลนชุดข้อมูลหลายรูปแบบที่สลับกันขนาดใหญ่ที่เปิดแหล่งที่มา ความสำคัญของชุดข้อมูลเหล่านี้ไม่สามารถเน้นย้ำได้มากพอ เนื่องจากพวกมันเป็นรากฐานสำหรับการสร้างระบบ AI ที่สามารถเข้าใจและสร้างเนื้อหาที่หลากหลายได้ หากไม่มีชุดข้อมูลที่ครอบคลุมและสลับกันอย่างเพียงพอ โอกาสในการพัฒนา LMM ที่ซับซ้อนและสามารถทำงานได้ดีขึ้นจะถูกขัดขวางอย่างมาก ชุดข้อมูลเหล่านี้ช่วยให้โมเดลสามารถเรียนรู้จากข้อมูลเข้าที่หลากหลาย ทำให้พวกมันทำงานได้หลากหลายและเป็นประโยชน์ในหลาย ๆ ด้าน นอกจากนี้ การขาดชุดข้อมูลดังกล่าวยังเป็นความท้าทายสำหรับชุมชนแหล่งที่มาแบบเปิด ซึ่งพึ่งพาแหล่งที่มาแบ่งปันเพื่อขับเคลื่อนนวัตกรรมและความร่วมมือโมเดล LMM ที่เปิดแหล่งที่มาได้ทำความก้าวหน้าอย่างมากในช่วงไม่กี่ปีที่ผ่านมา แต่การเติบโตของพวกมันถูกขัดขวางโดยการขาดชุดข้อมูลหลายรูปแบบที่สลับกันขนาดใหญ่ เพื่อเอาชนะอุปสรรค...
ในปี 2018 เป็นครั้งแรกที่แนวคิดเรื่อง การเรียนรู้แบบเสริมกำลัง ในบริบทของแบบจำลองโลกของเครือข่ายประสาทเทียมถูกนำเสนอ และไม่นานหลังจากนั้นหลักการพื้นฐานนี้ถูกนำไปใช้กับแบบจำลองโลก รูปแบบที่โดดเด่นที่ใช้การเรียนรู้แบบเสริมกำลัง ได้แก่ แฟรมเวิร์ก Dreamer ซึ่งนำการเรียนรู้แบบเสริมกำลังจากพื้นที่ 潜ในของแบบจำลองพื้นที่สภาพแวดล้อมที่เกิดซ้ำ DreamerV2 ได้แสดงให้เห็นว่าการใช้ 潜ในแบบไม่ต่อเนื่องอาจส่งผลให้ข้อผิดพลาดที่ลดลง และแฟรมเวิร์ก DreamerV3 สามารถบรรลุผลการทำงานที่คล้ายกับมนุษย์ในการทำงานหลายอย่างทั่วโดเมนต่างๆ โดยใช้ไฮเปอร์พารามิเตอร์ที่ตายตัว นอกจากนี้ยังสามารถวาดเส้นขนานระหว่างโมเดลการสร้างภาพและการสร้างแบบจำลองโลก โดยแสดงให้เห็นว่าการค้นพบในโมเดลการมองเห็นเชิงสร้างสรรค์สามารถนำไปใช้กับการสร้างแบบจำลองโลกได้ ตั้งแต่นั้นมาเมื่อการใช้ทรานส์ฟอร์เมอร์ใน การประมวลผลภาษา自然 ได้รับความนิยม แฟรมเวิร์ก DALL-E...
การเกิดขึ้นของโมเดล AI ที่สร้างข้อมูลที่มีคุณภาพสูงได้เร่งพัฒนาการสร้าง AI ที่มีความสามารถที่น่าประทับใจในการสร้างข้อมูลภาษาธรรมชาติ การสร้าง 3D การสร้างภาพ และการสังเคราะห์เสียง อย่างไรก็ตาม โมเดล AI ที่มีคุณภาพสูงหลายรูปแบบพบกับอุปสรรคทั่วไป คือ การสร้างเส้นเชื่อมที่ซับซ้อนและเมชที่มีเท็กซ์เจอร์แสง ซึ่งไม่เข้ากันกับ파이프ไลน์การเรนเดอร์แบบดั้งเดิม เช่น PBR (Physically Based Rendering) โมเดลที่ใช้การกระจายตัว (diffusion-based models) ซึ่งสร้างสินทรัพย์ 3D...
การทำเครื่องหมาย LLM ซึ่งรวมสัญญาณที่ตรวจจับได้แต่ไม่เห็นได้ภายในผลลัพธ์ของโมเดลเพื่อระบุเนื้อหาที่สร้างโดย LLM ถือเป็นสิ่งสำคัญสำหรับการป้องกันการใช้โมเดลภาษาขนาดใหญ่ในทางที่ผิด เทคนิคการทำเครื่องหมายเหล่านี้ส่วนใหญ่แบ่งออกเป็นสองประเภท: ครอบครัว KGW และครอบครัว Christ ครอบครัว KGW ปรับเปลี่ยนลอจิตที่ผลิตโดย LLM เพื่อสร้างผลลัพธ์ที่มีเครื่องหมายโดยการแบ่งพจนานุกรมออกเป็นรายการสีเขียวและรายการสีแดงตามโทเค็นก่อนหน้า ความเอนเอียงถูกนำเข้าสู่ลอจิตของโทเค็นในรายการสีเขียวระหว่างการสร้างข้อความ โดยให้ความชอบแก่โทเค็นเหล่านี้ในข้อความที่ผลิตขึ้น จากนั้นจะคำนวณเมตริกทางสถิติจากอัตราส่วนของคำสีเขียว และกำหนดค่าขีดจำกัดเพื่อแยกความแตกต่างระหว่างข้อความที่มีเครื่องหมายและไม่มีเครื่องหมาย การปรับปรุงวิธีการ KGW รวมถึงการแบ่งพาร์ติชันรายการที่ดีขึ้น การจัดการลอจิตที่ดีขึ้น ความจุของข้อมูลเครื่องหมายที่เพิ่มขึ้น การต้านทานการโจมตีเพื่อลบเครื่องหมาย และความสามารถในการตรวจจับเครื่องหมายสาธารณะในทางกลับกัน...
เนื่องจากมีประสิทธิภาพที่แข็งแกร่งและความสามารถในการใช้งานที่กว้างขวางเมื่อเทียบกับวิธีอื่น ๆ LoRA หรือ Low-Rank Adaption เป็นวิธีการ PEFT หรือ Parameter Efficient Fine-Tuning ที่ได้รับความนิยมมากที่สุดสำหรับการปรับแต่งแบบละเอียดของโมเดลภาษาขนาดใหญ่ โมเดล LoRA ใช้เมทริกซ์ระดับต่ำสองตัวเพื่อแยกและประมาณค่าน้ำหนักที่อัปเดตใน FFT หรือ Full Fine Tuning และโครงสร้าง LoRA ปรับแต่งพารามิเตอร์ที่สามารถฝึกได้ตามลำดับของเมทริกซ์ ผลประโยชน์หลักของกระบวนการนี้คือทำให้โครงสร้าง LoRA...
แม้ว่า AutoML จะได้รับความนิยมเมื่อหลายปีที่แล้ว แต่งานวิจัยเกี่ยวกับ AutoML เริ่มต้นขึ้นเมื่อต้นปี 1990 เมื่อนักวิทยาศาสตร์เผยแพร่บทความแรกเกี่ยวกับการเพิ่มประสิทธิภาพไฮเปอร์พารามิเตอร์ ในปี 2014 ICML จัดงานสัมมนา AutoML ครั้งแรก ซึ่ง AutoML ได้รับความสนใจจากนักพัฒนา ML หนึ่งในจุดเน้นสำคัญของ AutoML ในช่วงหลายปีที่ผ่านมา คือ ปัญหาการค้นหาไฮเปอร์พารามิเตอร์ โดยที่โมเดลใช้วิธีการเพิ่มประสิทธิภาพหลายวิธีเพื่อกำหนดไฮเปอร์พารามิเตอร์ที่ทำงานได้ดีที่สุดในพื้นที่ไฮเปอร์พารามิเตอร์ที่ใหญ่สำหรับโมเดลการเรียนรู้ของเครื่องเฉพาะ วิธีการอื่นที่ใช้กันโดยทั่วไปในโมเดล AutoML...
ความก้าวหน้าและความสำเร็จล่าสุดของโมเดลภาษาขนาดใหญ่ (Large Language Models) ได้เพิ่มขึ้นอย่างมากในด้านการให้เหตุผล การทำความเข้าใจ และการโต้ตอบระหว่างภาษาและภาพ ในเฟรมเวิร์กสมัยใหม่ สิ่งนี้ได้รับการบรรลุโดยการฉายสัญญาณภาพเข้าไปในโมเดลภาษาขนาดใหญ่ (LLMs) เพื่อให้พวกมันสามารถตีความโลกได้อย่างมองเห็น เป็นชุดของสถานการณ์ที่ยึดโยงกับกลยุทธ์การเข้ารหัสภาพ อย่างไรก็ตาม ภาพในโลกแห่งความเป็นจริงไม่เพียงแต่มีหลายสถานการณ์ แต่ยังมีความแตกต่างอย่างมากในด้านความละเอียดและอัตราส่วนภาพ ทำให้เกิดความท้าทายที่สำคัญสำหรับโมเดลภาษาขนาดใหญ่ในหลายโดเมนและงาน เพื่อจัดการกับความแปรผันอย่างมีนัยสำคัญที่เกิดจากภาพในโลกแห่งความเป็นจริง โมเดลภาษาขนาดใหญ่สมัยใหม่จึงรับทราบภาพในความละเอียดต่ำ (เช่น 224×224) และอัตราส่วนภาพคงที่ (เช่น 1:1) แม้ว่าการประนีประนอมนี้จะช่วยเพิ่มความสามารถในการใช้งานของโมเดลภาษาขนาดใหญ่ในแอปพลิเคชันโลกแห่งความเป็นจริง แต่ก็มักจะทำให้ภาพ模糊และบิดเบือนรูปร่างอย่างรุนแรง สิ่งนี้ส่งผลกระทบต่อความสามารถของโมเดลหลายรูปแบบ...
ความก้าวหน้าล่าสุดในด้านสถาปัตยกรรมและประสิทธิภาพของโมเดลภาษาขนาดใหญ่แบบหลายโหมดหรือ MLLMs ได้เน้นย้ำถึงความสำคัญของการปรับขนาดข้อมูลและโมเดลเพื่อเพิ่มประสิทธิภาพ แม้ว่าวิธีการนี้จะช่วยเพิ่มประสิทธิภาพ แต่ก็ทำให้เกิดค่าใช้จ่ายในการคำนวณที่สูงมาก ซึ่งจำกัดความเป็นไปได้และความสามารถในการใช้งานของวิธีการเหล่านี้ ในช่วงหลายปีที่ผ่านมา โมเดลผสมผสานผู้เชี่ยวชาญหรือ MoE ได้พัฒนาขึ้นเป็นวิธีการที่ประสบความสำเร็จในการปรับขนาดโมเดลภาพและภาษาขนาดใหญ่แบบหลายโหมดอย่างมีประสิทธิภาพ เนื่องจากโมเดลผสมผสานผู้เชี่ยวชาญมีค่าใช้จ่ายในการคำนวณที่ต่ำกว่าและมีประสิทธิภาพที่แข็งแกร่ง อย่างไรก็ตาม แม้ว่าจะมีข้อดี แต่โมเดลผสมผสานผู้เชี่ยวชาญไม่ใช่วิธีการที่เหมาะสมที่สุดในการปรับขนาดโมเดลภาษาขนาดใหญ่ เนื่องจากมักจะมีผู้เชี่ยวชาญน้อยและโหมดที่จำกัด ซึ่งทำให้การประยุกต์ใช้งานมีความจำกัดเพื่อแก้ไขปัญหาที่เกิดขึ้นจากการใช้วิธีการปัจจุบัน และเพื่อปรับขนาดโมเดลภาษาขนาดใหญ่แบบหลายโหมดอย่างมีประสิทธิภาพ ในบทความนี้ เราจะพูดถึงยูนิ-โมอี ซึ่งเป็นโมเดลภาษาขนาดใหญ่แบบหลายโหมดที่มีสถาปัตยกรรมผสมผสานผู้เชี่ยวชาญหรือ MoE ที่สามารถจัดการกับโหมดต่างๆ ได้หลากหลาย ยูนิ-โมอีเป็นเฟรมเวิร์กที่ใช้สถาปัตยกรรมผสมผสานผู้เชี่ยวชาญแบบเบาที่มีประสิทธิภาพในการฝึกอบรมและอนุมาน โดยใช้การขนานขนานระดับผู้เชี่ยวชาญและข้อมูล นอกจากนี้...
ในกรอบการทำงานของการเรียนรู้ของเครื่องและปัญญาประดิษฐ์สมัยใหม่ Transformer เป็นหนึ่งในส่วนประกอบที่ใช้กันอย่างแพร่หลายทั่วหลายโดเมน รวมถึง GPT series และ BERT ในการประมวลผลภาษาธรรมชาติ และ Vision Transformers ในงานที่เกี่ยวข้องกับการมองเห็น แม้ว่าการรวม Transformer ในโครงสร้างแบบจำลองจะช่วยเพิ่มประสิทธิภาพของแบบจำลองอย่างมาก แต่โมดูลความสนใจใน Transformer จะเพิ่มขึ้นตามความยาวของลำดับ ทำให้เกิดปัญหาการคำนวณที่ท้าทาย ในช่วงหลายปีที่ผ่านมา โมเดลต่างๆ ได้สำรวจกลยุทธ์ต่างๆ เพื่อแก้ไขปัญหาการคำนวณ รวมถึงวิธีการเช่น kernelization,...