โมเดลและแพลตฟอร์ม AI

Mistral AI: ตั้งมาตรฐานใหม่ในพื้นที่ Open-Source ที่เหนือกว่า Llama2

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

โมเดลภาษาขนาดใหญ่ (LLMs) ได้เข้ามาเป็นจุดสนใจหลักในขณะนี้ เนื่องจากมีโมเดลที่มีประสิทธิภาพสูง เช่น ChatGPT เมื่อ Meta เปิดตัวโมเดล Llama ของพวกเขา ก็ได้สร้างความสนใจใหม่ในโมเดลภาษาขนาดใหญ่แบบ Open-Source วัตถุประสงค์ คือ การสร้างโมเดลภาษาขนาดใหญ่ที่มีคุณภาพสูง มีราคาไม่แพง และไม่ซับซ้อนเหมือนโมเดล GPT-4

การผสมผสานระหว่างความสามารถในการเข้าถึงและประสิทธิภาพไม่เพียงแต่ทำให้นักวิจัยและนักพัฒนามีโอกาสใหม่ๆ แต่ยังเปิดโอกาสให้เกิดความก้าวหน้าทางเทคโนโลยีในด้านการประมวลผลภาษา自然อีกด้วย

最近 Generative AI startups ได้รับการสนับสนุนเงินทุน Together ได้รับเงินทุน 20 ล้านเหรียญสหรัฐเพื่อสร้างโมเดล AI ที่เปิด源 Anthropic ยังได้รับเงินทุน 450 ล้านเหรียญสหรัฐ และ Cohere ได้รับเงินทุน 270 ล้านเหรียญสหรัฐในเดือนมิถุนายนปีนี้ โดยร่วมมือกับ Google Cloud

การแนะนำ Mistral 7B: ขนาดและความพร้อม

mistral AI

Mistral AI ซึ่งตั้งอยู่ที่ปารีสและก่อตั้งโดยผู้ที่เคยทำงานที่ Google’s DeepMind และ Meta ได้ประกาศโมเดลภาษาขนาดใหญ่ของตนเอง คือ Mistral 7B โมเดลนี้สามารถดาวน์โหลดได้ง่ายๆ จาก GitHub และ甚至สามารถดาวน์โหลดได้จาก 13.4-gigabyte torrent

สตาร์ทอัพนี้สามารถระดมทุนได้มากที่สุดแม้ก่อนที่จะวางจำหน่ายผลิตภัณฑ์ Mistral AI โมเดลแรกที่มี 7 พันล้านพารามิเตอร์สามารถเอาชนะ Llama 2 13B ในทุกการทดสอบและเอาชนะ Llama 1 34B ในหลายๆ เมตริก

เมื่อเปรียบเทียบกับโมเดลอื่นๆ เช่น Llama 2 Mistral 7B มีความสามารถที่ใกล้เคียงหรือเหนือกว่า แต่มีภาระการคำนวณที่น้อยกว่า โมเดลที่มีพื้นฐานเช่น GPT-4 สามารถทำได้ดีกว่า แต่มีราคาแพงกว่าและไม่ค่อยมีคนใช้เพราะสามารถเข้าถึงได้เฉพาะผ่าน API

เมื่อพูดถึงงานโค้ด Mistral 7B สามารถแข่งขันกับ CodeLlama 7B ได้ดี และมีขนาดที่กะทัดรัดเพียง 13.4 GB ทำให้สามารถรันบนเครื่องมาตรฐานได้

นอกจากนี้ Mistral 7B Instruct ที่ปรับให้เหมาะสมสำหรับข้อมูลสอนบน Hugging Face ก็มีประสิทธิภาพที่ดี สามารถเอาชนะโมเดล 7B อื่นๆ ใน MT-Bench และมีประสิทธิภาพใกล้เคียงกับโมเดล 13B

การประเมินประสิทธิภาพ

ในการทดสอบประสิทธิภาพที่ละเอียด Mistral 7B ถูกวัดกับโมเดล Llama 2 ผลลัพธ์แสดงให้เห็นว่า Mistral 7B มีประสิทธิภาพเหนือกว่า Llama 2 13B ในทุกๆ การทดสอบ และสามารถเทียบเท่ากับ Llama 34B โดยเฉพาะในด้านโค้ดและเหตุผล

สิ่งที่ทำให้ Mistral 7B ดีกว่าโมเดลภาษาอื่นๆ ส่วนใหญ่

การทำให้กลไกการให้ความสนใจง่ายขึ้น

แนวคิดพื้นฐานของกลไกการให้ความสนใจค่อนข้างง่าย สมมติว่าคุณกำลังอ่านหนังสือและเน้นย้ำประโยคที่สำคัญ นี่คือตัวอย่างของวิธีการที่กลไกการให้ความสนใจ “เน้นย้ำ” หรือให้ความสำคัญกับข้อมูลบางส่วนในลำดับ

ในบริบทของโมเดลภาษา กลไกเหล่านี้ช่วยให้โมเดลสามารถมุ่งเน้นไปที่ส่วนที่เกี่ยวข้องมากที่สุดของข้อมูลเข้า และทำให้ผลลัพธ์มีความสอดคล้องและแม่นยำในบริบท

การให้ความสนใจแบบกลุ่ม (GQA)

Grouped-query attention

Grouped-query attention

การให้ความสนใจแบบหน้าต่างเลื่อน (SWA)

longformer transformers sliding window

ความโปร่งใสของ Mistral AI เทียบกับความกังวลเรื่องความปลอดภัยในกระบวนการกระจาย

ในประกาศของ Mistral AI ยังเน้นย้ำถึงความโปร่งใส โดยระบุว่า “ไม่มีการหลอกลวง ไม่มีข้อมูลที่เป็นกรรมสิทธิ์” แต่ในขณะเดียวกัน โมเดลที่มีอยู่ในขณะนี้ ‘Mistral-7B-v0.1’ เป็นโมเดลฐานที่ฝึกมาแล้ว ดังนั้นจึงสามารถสร้างคำตอบสำหรับคำถามใดๆ ได้โดยไม่มีการดูแล ซึ่งทำให้เกิดความกังวลเรื่องความปลอดภัย

ความยืดหยุ่นในการใช้งาน

จุดเด่นอีกอย่างหนึ่งคือ Mistral 7B มีใบอนุญาต Apache 2.0 ซึ่งหมายความว่าไม่มีข้อจำกัดในการใช้งาน ไม่ว่าคุณจะใช้เพื่อประโยชน์ส่วนตัว องค์กรขนาดใหญ่ หรือแม้กระทั่งหน่วยงานรัฐบาล คุณเพียงต้องมีระบบที่เหมาะสมในการใช้งานหรืออาจต้องลงทุนในทรัพยากรบนคลาวด์

ความคิดสุดท้าย

การเกิดขึ้นของโมเดลภาษาขนาดใหญ่แบบ Open-Source เช่น Mistral 7B เป็นการเปลี่ยนแปลงที่สำคัญในอุตสาหกรรม AI ทำให้โมเดลภาษาที่มีคุณภาพสูงสามารถเข้าถึงได้ง่ายขึ้น

ในขณะที่ธรรมชาติแบบกระจายของ Mistral อาจมีความท้าทายบางอย่าง แต่ความยืดหยุ่นและใบอนุญาตที่เปิดกว้างทำให้มีศักยภาพในการทำให้ AI มีความเข้าถึงได้มากขึ้น

ฉันใช้เวลาที่ผ่านมา 5 ปีในการศึกษาสิ่งที่น่าสนใจเกี่ยวกับ Machine Learning และ Deep Learning ความเชี่ยวชาญและความหลงใหลของฉันทำให้ฉันเข้าร่วมในโครงการพัฒนาซอฟต์แวร์มากกว่า 50 โครงการที่มีความหลากหลาย โดยมุ่งเน้นไปที่ AI/ML ความอยากรู้อยากเห็นของฉันยังทำให้ฉันสนใจในด้าน Natural Language Processing ซึ่งเป็นสาขาที่ฉันต้องการสำรวจต่อไป