โมเดลและแพลตฟอร์ม AI
Mistral AI: ตั้งมาตรฐานใหม่ในพื้นที่ Open-Source ที่เหนือกว่า Llama2
โมเดลภาษาขนาดใหญ่ (LLMs) ได้เข้ามาเป็นจุดสนใจหลักในขณะนี้ เนื่องจากมีโมเดลที่มีประสิทธิภาพสูง เช่น ChatGPT เมื่อ Meta เปิดตัวโมเดล Llama ของพวกเขา ก็ได้สร้างความสนใจใหม่ในโมเดลภาษาขนาดใหญ่แบบ Open-Source วัตถุประสงค์ คือ การสร้างโมเดลภาษาขนาดใหญ่ที่มีคุณภาพสูง มีราคาไม่แพง และไม่ซับซ้อนเหมือนโมเดล GPT-4
การผสมผสานระหว่างความสามารถในการเข้าถึงและประสิทธิภาพไม่เพียงแต่ทำให้นักวิจัยและนักพัฒนามีโอกาสใหม่ๆ แต่ยังเปิดโอกาสให้เกิดความก้าวหน้าทางเทคโนโลยีในด้านการประมวลผลภาษา自然อีกด้วย
最近 Generative AI startups ได้รับการสนับสนุนเงินทุน Together ได้รับเงินทุน 20 ล้านเหรียญสหรัฐเพื่อสร้างโมเดล AI ที่เปิด源 Anthropic ยังได้รับเงินทุน 450 ล้านเหรียญสหรัฐ และ Cohere ได้รับเงินทุน 270 ล้านเหรียญสหรัฐในเดือนมิถุนายนปีนี้ โดยร่วมมือกับ Google Cloud
การแนะนำ Mistral 7B: ขนาดและความพร้อม
Mistral AI ซึ่งตั้งอยู่ที่ปารีสและก่อตั้งโดยผู้ที่เคยทำงานที่ Google’s DeepMind และ Meta ได้ประกาศโมเดลภาษาขนาดใหญ่ของตนเอง คือ Mistral 7B โมเดลนี้สามารถดาวน์โหลดได้ง่ายๆ จาก GitHub และ甚至สามารถดาวน์โหลดได้จาก 13.4-gigabyte torrent
สตาร์ทอัพนี้สามารถระดมทุนได้มากที่สุดแม้ก่อนที่จะวางจำหน่ายผลิตภัณฑ์ Mistral AI โมเดลแรกที่มี 7 พันล้านพารามิเตอร์สามารถเอาชนะ Llama 2 13B ในทุกการทดสอบและเอาชนะ Llama 1 34B ในหลายๆ เมตริก
เมื่อเปรียบเทียบกับโมเดลอื่นๆ เช่น Llama 2 Mistral 7B มีความสามารถที่ใกล้เคียงหรือเหนือกว่า แต่มีภาระการคำนวณที่น้อยกว่า โมเดลที่มีพื้นฐานเช่น GPT-4 สามารถทำได้ดีกว่า แต่มีราคาแพงกว่าและไม่ค่อยมีคนใช้เพราะสามารถเข้าถึงได้เฉพาะผ่าน API
เมื่อพูดถึงงานโค้ด Mistral 7B สามารถแข่งขันกับ CodeLlama 7B ได้ดี และมีขนาดที่กะทัดรัดเพียง 13.4 GB ทำให้สามารถรันบนเครื่องมาตรฐานได้
นอกจากนี้ Mistral 7B Instruct ที่ปรับให้เหมาะสมสำหรับข้อมูลสอนบน Hugging Face ก็มีประสิทธิภาพที่ดี สามารถเอาชนะโมเดล 7B อื่นๆ ใน MT-Bench และมีประสิทธิภาพใกล้เคียงกับโมเดล 13B

Hugging Face Mistral 7B Example
การประเมินประสิทธิภาพ
ในการทดสอบประสิทธิภาพที่ละเอียด Mistral 7B ถูกวัดกับโมเดล Llama 2 ผลลัพธ์แสดงให้เห็นว่า Mistral 7B มีประสิทธิภาพเหนือกว่า Llama 2 13B ในทุกๆ การทดสอบ และสามารถเทียบเท่ากับ Llama 34B โดยเฉพาะในด้านโค้ดและเหตุผล
สิ่งที่ทำให้ Mistral 7B ดีกว่าโมเดลภาษาอื่นๆ ส่วนใหญ่
การทำให้กลไกการให้ความสนใจง่ายขึ้น
แนวคิดพื้นฐานของกลไกการให้ความสนใจค่อนข้างง่าย สมมติว่าคุณกำลังอ่านหนังสือและเน้นย้ำประโยคที่สำคัญ นี่คือตัวอย่างของวิธีการที่กลไกการให้ความสนใจ “เน้นย้ำ” หรือให้ความสำคัญกับข้อมูลบางส่วนในลำดับ
ในบริบทของโมเดลภาษา กลไกเหล่านี้ช่วยให้โมเดลสามารถมุ่งเน้นไปที่ส่วนที่เกี่ยวข้องมากที่สุดของข้อมูลเข้า และทำให้ผลลัพธ์มีความสอดคล้องและแม่นยำในบริบท
การให้ความสนใจแบบกลุ่ม (GQA)
การให้ความสนใจแบบหน้าต่างเลื่อน (SWA)
ความโปร่งใสของ Mistral AI เทียบกับความกังวลเรื่องความปลอดภัยในกระบวนการกระจาย
ในประกาศของ Mistral AI ยังเน้นย้ำถึงความโปร่งใส โดยระบุว่า “ไม่มีการหลอกลวง ไม่มีข้อมูลที่เป็นกรรมสิทธิ์” แต่ในขณะเดียวกัน โมเดลที่มีอยู่ในขณะนี้ ‘Mistral-7B-v0.1’ เป็นโมเดลฐานที่ฝึกมาแล้ว ดังนั้นจึงสามารถสร้างคำตอบสำหรับคำถามใดๆ ได้โดยไม่มีการดูแล ซึ่งทำให้เกิดความกังวลเรื่องความปลอดภัย
ความยืดหยุ่นในการใช้งาน
จุดเด่นอีกอย่างหนึ่งคือ Mistral 7B มีใบอนุญาต Apache 2.0 ซึ่งหมายความว่าไม่มีข้อจำกัดในการใช้งาน ไม่ว่าคุณจะใช้เพื่อประโยชน์ส่วนตัว องค์กรขนาดใหญ่ หรือแม้กระทั่งหน่วยงานรัฐบาล คุณเพียงต้องมีระบบที่เหมาะสมในการใช้งานหรืออาจต้องลงทุนในทรัพยากรบนคลาวด์
ความคิดสุดท้าย
การเกิดขึ้นของโมเดลภาษาขนาดใหญ่แบบ Open-Source เช่น Mistral 7B เป็นการเปลี่ยนแปลงที่สำคัญในอุตสาหกรรม AI ทำให้โมเดลภาษาที่มีคุณภาพสูงสามารถเข้าถึงได้ง่ายขึ้น
ในขณะที่ธรรมชาติแบบกระจายของ Mistral อาจมีความท้าทายบางอย่าง แต่ความยืดหยุ่นและใบอนุญาตที่เปิดกว้างทำให้มีศักยภาพในการทำให้ AI มีความเข้าถึงได้มากขึ้น
















