โมเดลและแพลตฟอร์ม AI
ด้านใน DBRX: Databricks เปิดตัวโมเดล LLM ที่มีประสิทธิภาพสูงและเป็นโอเพ่นซอร์ส

By
Aayush Mittal มิตตาล
ในด้านฟิลด์ของโมเดลภาษาขนาดใหญ่ (LLM) โมเดลใหม่ที่มีประสิทธิภาพสูงได้ถูกพัฒนาแล้ว – DBRX โมเดล LLM ที่เป็นโอเพ่นซอร์สที่สร้างโดย Databricks โมเดลนี้สร้างความตื่นตะลึงด้วยประสิทธิภาพที่ยอดเยี่ยมในหลายๆ บンチมาร์ก รวมทั้งสามารถแข่งขันกับโมเดลของอุตสาหกรรมที่มีชื่อเสียงอย่าง OpenAI’s GPT-4 ได้
DBRX เป็นตัวแทนของ 里程碑ที่สำคัญในการทำให้ AI เข้าถึงได้สำหรับทุกคน โดยให้การเข้าถึงแบบเปิดสำหรับนักวิจัย ผู้พัฒนา และองค์กรให้สามารถใช้โมเดลภาษาที่มีคุณภาพสูงได้ แต่สิ่งที่ทำให้ DBRX มีความพิเศษคืออะไร ในการวิเคราะห์ทางเทคนิคครั้งนี้ เราจะสำรวจโครงสร้างที่เป็นนวัตกรรมใหม่ การฝึกอบรม และความสามารถหลักๆ ที่ทำให้ DBRX กลายเป็นโมเดล LLM ที่มีประสิทธิภาพสูงสุด
การเกิดของ DBRX การสร้าง DBRX ถูกขับเคลื่อนด้วยภารกิจของ Databricks ที่ต้องการทำให้ความฉลาดของข้อมูลเข้าถึงได้สำหรับทุกองค์กร ในฐานะผู้นำในด้านแพลตฟอร์มการวิเคราะห์ข้อมูล Databricks ตระหนักถึงศักยภาพที่ยิ่งใหญ่ของ LLM และตัดสินใจพัฒนาโมเดลที่สามารถเทียบหรือ дажеเหนือกว่าโมเดลที่เป็นของเอกชน
หลังจากการวิจัยและพัฒนาที่เข้มข้นเป็นเวลาหลายเดือน และการลงทุนที่มีมูลค่าหลายล้านเหรียญสหรัฐ ทีมงานของ Databricks ได้สร้างโมเดลที่มีประสิทธิภาพสูงขึ้น DBRX โมเดลนี้ได้แสดงผลลัพธ์ที่น่าประทับใจในหลายๆ บンチมาร์ก รวมทั้งการเข้าใจภาษา การเขียนโปรแกรม และคณิตศาสตร์ ซึ่งทำให้ DBRX กลายเป็นโมเดล LLM ที่มีประสิทธิภาพสูงสุดในขณะนี้
โครงสร้างที่เป็นนวัตกรรมใหม่
พลังของ Mixture-of-Experts ที่核心ของ DBRX มีประสิทธิภาพที่ยอดเยี่ยมนั้นมาจากโครงสร้าง Mixture-of-Experts (MoE) ที่เป็นนวัตกรรมใหม่ โครงสร้างนี้เป็นการเปลี่ยนแปลงจากโมเดลที่มีความหนาแน่นแบบดั้งเดิม โดยใช้แนวทางที่มีความหนาแน่นน้อยลง ซึ่งเพิ่มประสิทธิภาพในการฝึกอบรมและความเร็วในการอนุมาน
ในโครงสร้าง MoE จะมีเพียงกลุ่มของส่วนประกอบที่เรียกว่า “ผู้เชี่ยวชาญ” ที่ถูกกระตุ้นสำหรับการเข้าถึงแต่ละครั้ง การเชี่ยวชาญนี้ทำให้โมเดลสามารถจัดการกับงานที่หลากหลายได้ดีขึ้น ในขณะเดียวกันก็เพิ่มประสิทธิภาพในการใช้ทรัพยากรการคำนวณ
DBRX นำแนวคิดนี้ไปสู่ขั้นตอนต่อไปด้วยโครงสร้าง MoE ที่มีการแบ่งออกเป็นรายละเอียด โดยใช้ผู้เชี่ยวชาญ 16 คน โดยมีผู้เชี่ยวชาญ 4 คนสำหรับการเข้าถึงแต่ละครั้ง โครงสร้างนี้ให้ผลลัพธ์ที่น่าประทับใจด้วยการรวมผู้เชี่ยวชาญที่เป็นไปได้มากถึง 65 เท่า ซึ่งส่งผลให้ DBRX มีประสิทธิภาพที่ดีกว่า
DBRX มีคุณสมบัติที่เป็นนวัตกรรมใหม่หลายอย่าง เช่น:
- Rotary Position Encodings (RoPE): เพิ่มความเข้าใจของตำแหน่งโทเค็น ซึ่งจำเป็นสำหรับการสร้างข้อความที่มีบริบทที่ถูกต้อง
- Gated Linear Units (GLU): นำกลไกการควบคุมที่เพิ่มความสามารถของโมเดลในการเรียนรู้รูปแบบที่ซับซ้อนได้อย่างมีประสิทธิภาพ
- Grouped Query Attention (GQA): ปรับปรุงประสิทธิภาพของโมเดลโดยการเพิ่มกลไกการดึงดูดความสนใจ
- Advanced Tokenization: ใช้ตัวแบ่งโทเค็นของ GPT-4 เพื่อประมวลผลการเข้าถึงได้อย่างมีประสิทธิภาพ
โครงสร้าง MoE นี้เหมาะสำหรับโมเดลภาษาขนาดใหญ่ เนื่องจากช่วยให้สามารถขยายขนาดได้อย่างมีประสิทธิภาพและใช้ทรัพยากรการคำนวณได้ดีขึ้น โดยการกระจายกระบวนการเรียนรู้ไปทั่วหลายๆ โครงข่ายย่อยที่เชี่ยวชาญเฉพาะด้าน DBRX สามารถจัดสรรข้อมูลและทรัพยากรการคำนวณสำหรับการทำงานแต่ละอย่างได้อย่างมีประสิทธิภาพ
การฝึกอบรมข้อมูลที่กว้างขวางและกลยุทธ์การเพิ่มประสิทธิภาพ ในขณะที่โครงสร้างของ DBRX นั้นยอดเยี่ยม แต่ความสามารถที่แท้จริงของมันอยู่ที่กระบวนการฝึกอบรมที่พิถีพิถันและข้อมูลที่มีจำนวนมากที่ถูกใช้ DBRX ถูกฝึกอบรมบนข้อมูลโทเค็นที่มีจำนวนถึง 12 ล้านล้านตัว ซึ่งถูกเลือกและจัดเตรียมอย่างดีเพื่อให้มีคุณภาพสูงและหลากหลาย
ข้อมูลการฝึกอบรมถูกประมวลผลโดยใช้ชุดเครื่องมือของ Databricks รวมทั้ง Apache Spark สำหรับการประมวลผลข้อมูล Unity Catalog สำหรับการจัดการและกำกับดูแลข้อมูล และ MLflow สำหรับการติดตามการทดลอง ชุดเครื่องมือนี้ช่วยให้ทีมงานของ Databricks สามารถจัดการ ข้อมูลได้อย่างมีประสิทธิภาพและเตรียมการฝึกอบรม DBRX ได้อย่างดี
เพื่อเพิ่มประสิทธิภาพของโมเดล Databricks ใช้การฝึกอบรมแบบไดนามิก โดยเปลี่ยนแปลงส่วนผสมของข้อมูลระหว่างการฝึกอบรม กลยุทธ์นี้ช่วยให้ DBRX มีความสามารถที่หลากหลายและสามารถปรับตัวเข้ากับงานที่หลากหลายได้ดีขึ้น
นอกจากนี้ กระบวนการฝึกอบรมของ DBRX ยังถูกปรับปรุงให้มีประสิทธิภาพ โดยใช้เครื่องมือและไลบรารี่ที่เป็นของ Databricks เช่น Composer, LLM Foundry, MegaBlocks และ Streaming โดยใช้เทคนิคการเรียนรู้แบบคอร์สและกลยุทธ์การเพิ่มประสิทธิภาพที่ดีขึ้น ทีมงานสามารถบรรลุผลลัพธ์ที่ดีขึ้นเกือบสี่เท่าในด้านประสิทธิภาพการคำนวณเมื่อเทียบกับโมเดลก่อนหน้านี้
การฝึกอบรมและโครงสร้าง
DBRX ถูกฝึกอบรมโดยใช้แบบจำลองการคาดเดาโทเค็นถัดไปบนชุดข้อมูลที่มีจำนวน 12 ล้านล้านตัว โดยเน้นไปที่ข้อความและโค้ด ชุดข้อมูลนี้ถูกมองว่ามีประสิทธิภาพมากกว่าโมเดลก่อนหน้านี้ โดยให้ความเข้าใจและความสามารถในการตอบสนองที่ดีขึ้นสำหรับคำสั่งปrompt ที่หลากหลาย
โครงสร้างของ DBRX ไม่เพียงแต่แสดงถึงความสามารถทางเทคนิคของ Databricks แต่ยังแสดงถึงการประยุกต์ใช้ในหลายๆ ด้าน ตั้งแต่การปรับปรุงการโต้ตอบของแชทบอทไปจนถึงการให้พลังในการวิเคราะห์ข้อมูลที่ซับซ้อน DBRX สามารถรวมเข้ากับหลายๆ ด้านที่ต้องการความเข้าใจภาษาที่ละเอียด
อย่างน่าประทับใจ DBRX Instruct สามารถแข่งขันกับโมเดลที่มีการปิดที่มีความทันสมัยที่สุดในตลาด ตามการวัดของ Databricks DBRX Instruct เหนือกว่า GPT-3.5 และสามารถแข่งขันกับ Gemini 1.0 Pro และ Mistral Medium ในหลายๆ บンチมาร์ก รวมทั้งความรู้ทั่วไป การให้เหตุผลทั่วไป การเขียนโปรแกรม และการให้เหตุผลทางคณิตศาสตร์
ตัวอย่างเช่น ในบンチมาร์ก MMLU ซึ่งวัดความเข้าใจภาษา DBRX Instruct ได้รับคะแนน 73.7% ซึ่งเหนือกว่าคะแนน 70.0% ของ GPT-3.5 ในบンチมาร์ก HellaSwag ซึ่งวัดการให้เหตุผลทั่วไป DBRX Instruct ได้รับคะแนน 89.0% ซึ่งเหนือกว่าคะแนน 85.5% ของ GPT-3.5
DBRX Instruct ยังแสดงผลลัพธ์ที่น่าประทับใจด้วยความแม่นยำ 70.1% ในบンチมาร์ก HumanEval ซึ่งเหนือกว่า GPT-3.5 (48.1%) และ CodeLLaMA-70B Instruct (67.8%)
ผลลัพธ์ที่น่าประทับใจเหล่านี้แสดงให้เห็นถึงความสามารถที่หลากหลายของ DBRX และความสามารถในการทำงานได้ดีในหลายๆ ด้าน ตั้งแต่การเข้าใจภาษาไปจนถึงการเขียนโปรแกรมและแก้ปัญหาทางคณิตศาสตร์ที่ซับซ้อน
การอนุมานที่มีประสิทธิภาพและความสามารถในการปรับขนาด หนึ่งในข้อได้เปรียบหลักของโครงสร้าง MoE ของ DBRX คือความสามารถในการอนุมานที่มีประสิทธิภาพ เนื่องจากการกระตุ้นที่ไม่หนาแน่นของพารามิเตอร์ DBRX สามารถบรรลุความเร็วในการอนุมานที่เร็วขึ้นสองถึงสามเท่าเมื่อเทียบกับโมเดลที่มีความหนาแน่นเท่ากัน
เมื่อเทียบกับ LLaMA2-70B ซึ่งเป็นโมเดล LLM ที่เปิดเผยต่อสาธารณะ DBRX ไม่เพียงแต่แสดงผลลัพธ์ที่ดีกว่า แต่ยังมีความเร็วในการอนุมานที่เร็วกว่าเกือบสองเท่า โดยมีพารามิเตอร์ที่กระตุ้นที่มีจำนวนประมาณครึ่งหนึ่ง ความสามารถนี้ทำให้ DBRX เป็นตัวเลือกที่น่าสนใจสำหรับการใช้งานในหลายๆ ด้าน ตั้งแต่การสร้างเนื้อหาที่มีคุณภาพสูงไปจนถึงการวิเคราะห์ข้อมูลและอื่นๆ
นอกจากนี้ Databricks ยังพัฒนากระบวนการฝึกอบรมที่แข็งแกร่ง ซึ่งช่วยให้องค์กรสามารถฝึกอบรมโมเดล DBRX ของตนเองจากจุดเริ่มต้นหรือต่อจากการฝึกอบรมที่มีอยู่แล้ว ความสามารถนี้ช่วยให้ธุรกิจสามารถใช้ประโยชน์จาก DBRX ได้อย่างเต็มที่และปรับให้เหมาะสมกับความต้องการเฉพาะของตนเอง
การเข้าถึงและความสามารถในการทำงานร่วมกัน
ตามนโยบายที่ต้องการส่งเสริมการเข้าถึง AI ที่เปิดกว้าง Databricks ได้ทำให้ DBRX สามารถเข้าถึงได้หลายช่องทาง น้ำหนักของโมเดลฐาน (DBRX Base) และโมเดลที่ถูกปรับให้เหมาะสม (DBRX Instruct) ถูกเก็บไว้ที่แพลตฟอร์ม Hugging Face ซึ่งช่วยให้นักวิจัยและผู้พัฒนาสามารถดาวน์โหลดและทำงานกับโมเดลได้อย่างง่ายดาย
นอกจากนี้ โรบอท DBRX ยังสามารถเข้าถึงได้ที่ GitHub ซึ่งให้ความโปร่งใสและช่วยให้สามารถสำรวจและปรับแต่งโมเดลได้
สำหรับลูกค้าของ Databricks DBRX Base และ DBRX Instruct สามารถเข้าถึงได้โดยใช้ API ของ Databricks Foundation Model ซึ่งช่วยให้สามารถรวมเข้ากับกระบวนการทำงานที่มีอยู่และแอปพลิเคชันต่างๆ ได้อย่างง่ายดาย นอกจากนี้ยังช่วยให้สามารถควบคุมและรักษาความปลอดภัยของข้อมูลที่มีความสำคัญ
นอกจากนี้ DBRX ยังถูกผสานเข้ากับแพลตฟอร์มและบริการของบุคคลที่สาม เช่น You.com และ Perplexity Labs ซึ่งช่วยให้สามารถเข้าถึงและใช้งานได้ในหลายๆ ด้านและกรณีการใช้งาน
ความสามารถในการจัดการบริบทที่ยาวและความสามารถในการสร้างเนื้อหาที่มีบริบท หนึ่งในคุณสมบัติที่โดดเด่นของ DBRX คือความสามารถในการจัดการบริบทที่ยาว โดยมีความยาวสูงสุด 32,768 โทเค็น ความสามารถนี้ช่วยให้โมเดลสามารถประมวลผลและสร้างเนื้อหาที่มีบริบทที่ถูกต้องได้
ในบンチมาร์กที่ประเมินความสามารถในการจัดการบริบทที่ยาว เช่น KV-Pairs และ HotpotQAXL DBRX Instruct แสดงผลลัพธ์ที่ดีกว่า GPT-3.5 Turbo ในหลายๆ ความยาวและตำแหน่งของบริบท
ข้อจำกัดและงานในอนาคต
ในขณะที่ DBRX เป็นตัวแทนของความสำเร็จที่สำคัญในด้าน LLM ที่เปิดกว้าง แต่ก็จำเป็นต้องตระหนักถึงข้อจำกัดและพื้นที่ที่ต้องการการปรับปรุงในอนาคต เช่นเดียวกับโมเดล AI ที่มีความซับซ้อน DBRX อาจสร้างผลลัพธ์ที่ไม่ถูกต้องหรือมีอคติขึ้นมาขึ้นอยู่กับคุณภาพและความหลากหลายของข้อมูลการฝึกอบรม
นอกจากนี้ ในขณะที่ DBRX มีประสิทธิภาพสูงในงานทั่วไป แต่บางกรณีการใช้งานที่ต้องการความแม่นยำและความน่าเชื่อถือสูงอาจต้องการการปรับให้เหมาะสมหรือการฝึกอบรมที่เฉพาะเจาะจงมากขึ้น ตัวอย่างเช่น ในกรณีที่ต้องการความแม่นยำและความน่าเชื่อถือสูง Databricks แนะนำให้ใช้เทคนิคการสร้างเนื้อหาที่มีบริบท (RAG) เพื่อเพิ่มคุณภาพของผลลัพธ์
นอกจากนี้ ชุดข้อมูลการฝึกอบรมของ DBRX ในปัจจุบันประกอบด้วยเนื้อหาภาษาอังกฤษเป็นหลัก ซึ่งอาจจำกัดความสามารถในการทำงานในงานที่ไม่ใช่ภาษาอังกฤษ ในอนาคต อาจมีการพัฒนาโมเดลโดยการเพิ่มชุดข้อมูลที่หลากหลายและครอบคลุมหลายๆ ภาษาและวัฒนธรรม
Databricks มุ่งมั่นที่จะปรับปรุงและเพิ่มประสิทธิภาพของ DBRX อย่างต่อเนื่อง โดยมุ่งเน้นไปที่การปรับปรุงประสิทธิภาพ ความสามารถในการปรับขนาด และความสามารถในการใช้งานในหลายๆ ด้านและกรณีการใช้งาน
เส้นทางในอนาคต
DBRX เป็นตัวแทนของก้าวสำคัญในด้านการทำให้ AI เข้าถึงได้สำหรับทุกคน โดยมีวิสัยทัศน์ที่จะทำให้ทุกองค์กรสามารถควบคุมข้อมูลและอนาคตของตนเองในโลกของ AI ที่มีการสร้างสรรค์
โดยการเปิดเผย DBRX และให้การเข้าถึงเครื่องมือและโครงสร้างพื้นฐานที่ใช้ในการสร้างโมเดล Databricks กำลังให้พลังแก่ธุรกิจและนักวิจัยในการพัฒนาโมเดล AI ที่มีความสามารถสูงและปรับให้เหมาะสมกับความต้องการเฉพาะของตนเอง
ผ่านแพลตฟอร์มของ Databricks ลูกค้าสามารถใช้เครื่องมือการประมวลผลข้อมูล เช่น Apache Spark, Unity Catalog และ MLflow เพื่อจัดการและปรับแต่งข้อมูลการฝึกอบรม จากนั้นสามารถใช้ไลบรารีการฝึกอบรมที่ได้รับการปรับปรุงของ Databricks เช่น Composer, LLM Foundry, MegaBlocks และ Streaming เพื่อฝึกอบรมโมเดล DBRX ของตนเองได้อย่างมีประสิทธิภาพและปรับขนาดได้
การทำให้ AI เข้าถึงได้สำหรับทุกคนนี้มีศักยภาพที่จะปลดปล่อยการนวัตกรรมใหม่ๆ ในหลายๆ ด้าน ตั้งแต่การสร้างเนื้อหาที่มีคุณภาพสูงไปจนถึงการวิเคราะห์ข้อมูลและการตัดสินใจ
นอกจากนี้ โดยการสร้างระบบนิเวศที่เปิดกว้างและทำงานร่วมกันรอบๆ DBRX Databricks มุ่งมั่นที่จะเร่งการวิจัยและพัฒนาในด้าน LLM โดยการมีส่วนร่วมขององค์กรและบุคคลต่างๆ จะช่วยให้ความรู้และความเข้าใจเกี่ยวกับระบบ AI ที่มีประสิทธิภาพสูงนี้เพิ่มขึ้น
สรุป
DBRX เป็นตัวแทนของการเปลี่ยนแปลงที่สำคัญในโลกของ LLM ที่เปิดกว้าง โดยมีโครงสร้างที่เป็นนวัตกรรมใหม่ การฝึกอบรมที่กว้างขวาง และประสิทธิภาพที่สูงกว่า DBRX เป็นตัวแทนของการทำให้ AI เข้าถึงได้สำหรับทุกคน โดยให้การเข้าถึงแบบเปิดสำหรับนักวิจัย ผู้พัฒนา และองค์กรให้สามารถใช้โมเดลภาษาที่มีคุณภาพสูงได้
ในขณะที่ Databricks ยังคงปรับปรุงและเพิ่มประสิทธิภาพของ DBRX ความสามารถในการใช้งานและผลกระทบของโมเดลนี้มีศักยภาพที่จะไม่มีขอบเขต
ฉันใช้เวลาที่ผ่านมา 5 ปีในการศึกษาสิ่งที่น่าสนใจเกี่ยวกับ Machine Learning และ Deep Learning ความเชี่ยวชาญและความหลงใหลของฉันทำให้ฉันเข้าร่วมในโครงการพัฒนาซอฟต์แวร์มากกว่า 50 โครงการที่มีความหลากหลาย โดยมุ่งเน้นไปที่ AI/ML ความอยากรู้อยากเห็นของฉันยังทำให้ฉันสนใจในด้าน Natural Language Processing ซึ่งเป็นสาขาที่ฉันต้องการสำรวจต่อไป
ค้นพบเพิ่มเติม


OpenAI เปิดตัว Data Agent ใน ChatGPT Work เพื่อวิเคราะห์ข้อมูลบริษัท


Mistral ระดมทุนซีรีส์ D มูลค่า 3 พันล้านยูโรเพื่อขยาย AI แบบอธิปไตย


Mistral และทีม HUMAIN บน AI อิสระสำหรับซาอุดีอาระเบียและภูมิภาค


ไมโครซอฟท์ขยายข้อตกลงกับ Mistral เพื่อจับกลุ่มลูกค้า AI ที่มีการควบคุม


สภายุโรปสร้างแพลตฟอร์ม AI ของตนเองสำหรับนักกฎหมาย


ทำไมแอปสมัยใหม่ส่วนใหญ่จะไม่มีประโยชน์ในยุค AI
