โมเดลและแพลตฟอร์ม AI
มิสราล 2 และ มิสราล NeMo: คู่มือที่ครอบคลุมเกี่ยวกับโมเดล LLM ล่าสุดจากปารีส

มิสราล AI ก่อตั้งโดยผู้ที่เคยทำงานที่ Google’s DeepMind และ Meta เป็นสตาร์ทอัพในกรุงปารีสที่สร้างความสนใจในวงการ AI ตั้งแต่ปี 2023
มิสราล AI ได้สร้างความสนใจไปทั่วโลกด้วยโมเดลแรกของตน มิสราล 7B ซึ่งถูกปล่อยออกมาในปี 2023 โมเดลที่มี 7 พันล้านพารามิเตอร์นี้ได้รับความสนใจอย่างมากสำหรับการทำงานที่น่าประทับใจ โดยสามารถทำได้ดีกว่าโมเดลที่ใหญ่กว่า เช่น Llama 2 13B ในหลายๆ การทดสอบ และสามารถเทียบเท่ากับ Llama 1 34B ในหลายๆ เมตริกส์ สิ่งที่ทำให้ มิสราล 7B แตกต่างไม่ใช่แค่การทำงาน แต่ยังรวมถึงความสามารถในการเข้าถึงได้ง่าย โดยสามารถดาวน์โหลดได้จาก GitHub หรือผ่านการโหลดแบบ 13.4 กิกะไบต์ ทำให้สามารถเข้าถึงได้โดยนักวิจัยและนักพัฒนาทั่วโลก
วิธีการปล่อยที่ไม่ธรรมดา củaบริษัท โดยไม่ผ่านการเขียนบทความหรือการแถลงข่าวแบบดั้งเดิม ได้ chứng minhว่ามีประสิทธิภาพในการดึงดูดความสนใจของชุมชน AI นอกจากนี้ การมุ่งมั่นในการเปิดแหล่งที่มา (open-source) ยังช่วยให้ มิสราล AI เป็นผู้เล่นที่มีศักยภาพในภูมิทัศน์ AI
การเติบโตอย่างรวดเร็วของ มิสราล AI ในอุตสาหกรรมยังเห็นได้จากความสำเร็จในการระดมทุน最近 โดยบริษัทได้รับการประเมินมูลค่าถึง 2 พันล้านดอลลาร์หลังจากการระดมทุนรอบล่าสุด ซึ่งนำโดย Andreessen Horowitz ซึ่งเป็นผลมาจากเงินระดมทุน 118 ล้านดอลลาร์ในรอบที่แล้ว ซึ่งเป็นเงินระดมทุนที่ใหญ่ที่สุดในประวัติศาสตร์ยุโรป สิ่งนี้แสดงให้เห็นถึงความเชื่อมั่นของนักลงทุนในมุมมองและความสามารถของ มิสราล AI
นอกเหนือจากความก้าวหน้าทางเทคโนโลยี มิสราล AI ยังเข้าร่วมในการกำหนดนโยบาย AI โดยเฉพาะอย่างยิ่งในเรื่องของ EU AI Act โดยที่พวกเขาได้สนับสนุนให้มีการลดการควบคุมใน AI ที่เปิดแหล่งที่มา
ในปี 2024 มิสราล AI ได้ยกเลเวลอีกครั้งด้วยโมเดลสองตัวที่น่าประทับใจ: มิสราล Large 2 (หรือที่รู้จักกันในชื่อ มิสราล-Large-Instruct-2407) และ มิสราล NeMo ในคู่มือนี้ เราจะเจาะลึกถึงคุณสมบัติ การทำงาน และการประยุกต์ใช้ของโมเดล AI เหล่านี้
คุณสมบัติหลักของ มิสราล Large 2 รวมถึง:
- 123 พันล้าน พารามิเตอร์
- 128k วินโดว์บริบท
- รองรับหลายภาษา
- ความชำนาญในการเขียนโค้ดใน 80+ ภาษา
- ความสามารถในการเรียกฟังก์ชันขั้นสูง
โมเดลนี้ได้รับการออกแบบมาเพื่อผลักดันขอบเขตของประสิทธิภาพต้นทุน ความเร็ว และประสิทธิภาพ ทำให้เป็นตัวเลือกที่น่าสนใจสำหรับทั้งนักวิจัยและองค์กรที่ต้องการใช้ AI ที่ทันสมัย
มิสราล NeMo: โมเดลที่เล็กแต่แข็งแกร่ง
ในขณะที่ มิสราล Large 2 เป็นตัวแทนของโมเดลขนาดใหญ่ของ มิสราล AI มิสราล NeMo ซึ่งปล่อยออกมาในเดือนกรกฎาคม 2024 นำเสนอแนวทางที่แตกต่าง โมเดลขนาด 12 พันล้านพารามิเตอร์นี้พัฒนาโดยความร่วมมือกับ NVIDIA (NVDA ) และยังคงแสดงให้เห็นถึงความสามารถที่น่าประทับใจ:
- 12 พันล้าน พารามิเตอร์
- 128k บริบท วินโดว์
- การทำงานระดับแนวหน้าในหมวดของมันเอง
- Apache 2.0 ไลเซนส์ สำหรับการใช้งานแบบเปิด
- การฝึกอบรมที่รู้จักควอนติเซชัน สำหรับการอนุมานที่มีประสิทธิภาพ
มิสราล NeMo ได้รับการวางตำแหน่งเป็นตัวแทนแทนสำหรับระบบที่ใช้ มิสราล 7B โดยมีการปรับปรุงประสิทธิภาพในขณะเดียวกันก็รักษาความง่ายในการใช้งานและความเข้ากันได้
คุณสมบัติและความสามารถหลัก
ทั้ง มิสราล Large 2 และ มิสราล NeMo มีคุณสมบัติและความสามารถหลักที่ทำให้พวกมันโดดเด่นในภูมิทัศน์ AI:
- วินโดว์บริบทขนาดใหญ่: ทั้งสองโมเดลมีวินโดว์บริบทขนาด 128k ซึ่งสามารถประมวลผลและเข้าใจข้อความที่ยาวกว่า ทำให้ได้ผลลัพธ์ที่สอดคล้องกันและเกี่ยวข้องมากขึ้น
- การรองรับหลายภาษา: โมเดลเหล่านี้มีความสามารถในการทำงานในหลายภาษา รวมถึงภาษาอังกฤษ ฝรั่งเศส เยอรมัน สเปน อิตาลี จีน ญี่ปุ่น เกาหลี อาหรับ และฮินดี
- ความสามารถในการเขียนโค้ดขั้นสูง: ทั้งสองโมเดลแสดงให้เห็นถึงความสามารถในการเขียนโค้ดที่น่าประทับใจในหลายภาษาโปรแกรมมิ่ง
- การปฏิบัติตามคำสั่ง: โมเดลเหล่านี้มีการปรับปรุงอย่างมากในการปฏิบัติตามคำสั่งและจัดการการสนทนาที่มีหลายขั้นตอน
- การเรียกฟังก์ชัน: การสนับสนุนการเรียกฟังก์ชันโดยธรรมชาติทำให้โมเดลเหล่านี้สามารถโต้ตอบกับเครื่องมือและบริการภายนอกได้อย่างมีประสิทธิภาพ
- การให้เหตุผลและการแก้ปัญหา: ความสามารถที่ดีขึ้นในการให้เหตุผลทางคณิตศาสตร์และการแก้ปัญหาที่ซับซ้อน
มาทำความรู้จักกับคุณสมบัติและความสามารถเหล่านี้กัน
การประเมินประสิทธิภาพ
เพื่อเข้าใจถึงความสามารถที่แท้จริงของ มิสราล Large 2 และ มิสราล NeMo เราต้องดูการทำงานของพวกมันในหลายๆ การทดสอบ
การประเมิน มิสราล Large 2
ตารางนี้แสดงถึงความสามารถของ LLM ในหลายภาษาโปรแกรมมิ่ง โมเดลอย่าง มิสราล Large 2 (24.07), Llama 3.1 (405B), และ GPT-4o ถูกประเมินตามความสามารถในการเข้าใจและสร้างโค้ดในภาษาเช่น Python, C++, Bash, Java, TypeScript, PHP, และ C#
การประเมิน มิสราล NeMo
แม้ว่าผลลัพธ์เฉพาะของการประเมิน มิสราล NeMo ไม่ได้ถูกให้ไว้ในข้อมูลที่ให้มา แต่ môเดลนี้ได้รับการอธิบายว่ามีการทำงานระดับแนวหน้าในหมวดของมันเอง โดยสามารถเอาชนะโมเดลที่เปิดแหล่งที่มาแบบล่าสุดอื่นๆ เช่น Gemma 2 9B และ Llama 3 8B ในหลายๆ งาน
การทำงานหลายภาษาและความสามารถในการเขียนโค้ด
หนึ่งในคุณสมบัติที่โดดเด่นของทั้ง มิสราล Large 2 และ มิสราล NeMo คือความสามารถในการทำงานหลายภาษา ซึ่งเป็นสิ่งสำคัญในโลกที่เป็นโลกาภิวัตน์
มิสราล Large 2 โดยเฉพาะรองรับหลายภาษา รวมถึงภาษาฝรั่งเศส เยอรมัน สเปน อิตาลี โปรตุเกส อาหรับ ฮินดี รัสเซีย จีน ญี่ปุ่น และเกาหลี ความสามารถนี้ไม่เพียงแต่จำกัดอยู่ที่การแปลเท่านั้น แต่ยังรวมถึงความเข้าใจและสร้างเนื้อหาที่ซับซ้อนในภาษาเหล่านี้
พาราได้ม์และการเรียกฟังก์ชัน
ทั้ง มิสราล Large 2 และ มิสราล NeMo นำเสนอพาราได้ม์ที่มุ่งเน้นไปที่การสร้างโมเดลที่สามารถโต้ตอบกับสภาพแวดล้อมของมัน การตัดสินใจ และการกระทำเพื่อบรรลุเป้าหมายที่เฉพาะเจาะจง
คุณสมบัติหลักที่ทำให้พาราได้ม์นี้เป็นไปได้คือการสนับสนุนการเรียกฟังก์ชันโดยธรรมชาติ ซึ่งช่วยให้โมเดลสามารถโต้ตอบกับเครื่องมือและบริการภายนอกได้อย่างมีประสิทธิภาพ
Tekken: โทเคไนเซอร์ที่มีประสิทธิภาพมากกว่า
มิสราล NeMo มีการแนะนำโทเคไนเซอร์ใหม่ที่เรียกว่า Tekken ซึ่งพัฒนามาจาก Tiktoken และฝึกอบรมบนมากกว่า 100 ภาษา โทเคไนเซอร์ใหม่นี้มีการปรับปรุงอย่างมากในเรื่องของการบีบอัดข้อความ
การอนุญาตและความพร้อม
มิสราล Large 2 และ มิสราล NeMo มีโมเดลการอนุญาตที่แตกต่างกัน ซึ่งสอดคล้องกับการใช้งานที่ตั้งใจไว้:
มิสราล Large 2
- ปล่อยภายใต้ ไลเซนส์ มิสราล Research
- อนุญาตให้ใช้และปรับเปลี่ยนสำหรับการวิจัยและวัตถุประสงค์ที่ไม่ใช่เชิงพาณิชย์
- การใช้เชิงพาณิชย์จำเป็นต้องมี ไลเซนส์ มิสราล Commercial
มิสราล NeMo
- ปล่อยภายใต้ ไลเซนส์ Apache 2.0
- อนุญาตให้ใช้แบบเปิด รวมถึงการประยุกต์ใช้เชิงพาณิชย์
ทั้งสองโมเดลสามารถเข้าถึงได้จากหลายๆ แพลตฟอร์ม:
- ฮักกิ้งเฟซ: น้ำหนักของโมเดลทั้งแบบเบสและแบบอินสตรัคต์ถูกโฮสต์ไว้ที่นี่
- มิสราล AI: มีให้ใช้เป็น
มิสราล-ลาร์จ-2407(มิสราล Large 2) และโอเพ่น-มิสราล-เนโม-2407(มิสราล NeMo) - ผู้ให้บริการคลาวด์: มีให้ใช้บน Google Cloud Platform’s Vertex AI, Azure AI Studio, Amazon (AMZN ) Bedrock, และ IBM watsonx.ai
ข้อจำกัดและข้อพิจารณาทางจริยธรรม
แม้ว่า มิสราล Large 2 และ มิสราล NeMo จะเป็นตัวแทนของความก้าวหน้าในเทคโนโลยี AI แต่ก็มีข้อจำกัดและข้อพิจารณาทางจริยธรรมที่ต้องพิจารณา:
- ความเป็นไปได้ของการมีอคติ: เช่นเดียวกับโมเดล AI ทั้งหมดที่ถูกฝึกอบรมจากเซตข้อมูลขนาดใหญ่ โมเดลเหล่านี้อาจสืบทอดและเพิ่มอคติที่มีอยู่ในเซตข้อมูลการฝึกอบรม
- การขาดความเข้าใจที่แท้จริง: แม้ว่าโมเดลเหล่านี้จะมีความสามารถที่น่าประทับใจ แต่พวกมันไม่มีความเข้าใจหรือความตระหนักที่แท้จริง พวกมันสร้างคำตอบตามรูปแบบในเซตข้อมูลการฝึกอบรม ซึ่งบางครั้งอาจนำไปสู่ข้อมูลที่ดูสมเหตุสมผลแต่ไม่ถูกต้อง
- ความกังวลเรื่องความเป็นส่วนตัว: เมื่อใช้โมเดลเหล่านี้ โดยเฉพาะอย่างยิ่งในแอปพลิเคชันที่จัดการข้อมูลที่ละเอียดอ่อน ควรพิจารณาผลกระทบด้านความเป็นส่วนตัวและความปลอดภัยของข้อมูล
สรุป
การปรับโมเดลที่ทันสมัยอย่าง มิสราล Large 2 และ มิสราล NeMo ให้โอกาสที่มีพลังในการใช้ AI ที่ทันสมัยสำหรับหลายๆ การประยุกต์ใช้ ตั้งแต่การเรียกฟังก์ชันแบบไดนามิกไปจนถึงการประมวลผลหลายภาษาที่มีประสิทธิภาพ












