โมเดลและแพลตฟอร์ม AI
โมเดล AI มัลติม็อดัลของ Google Gemini – การวิเคราะห์ทางเทคนิคอย่างลึกซึ้ง

ซุนดาร์ พิชัย ซีอีโอของ Google (GOOGL ) ร่วมกับ เดมิส ฮัสซาบิส จาก Google DeepMind ได้ แนะนำ Gemini ในเดือนธันวาคม 2023 โมเดลภาษาขนาดใหญ่ใหม่นี้ได้รับการรวมเข้ากับผลิตภัณฑ์ของ Google ทั่วทั้งระบบ โดยนำเสนอการปรับปรุงที่กระจายไปทั่วบริการและเครื่องมือที่ใช้โดยล้านคน
Gemini โมเดล AI มัลติม็อดัลขั้นสูงของ Google เกิดจากความพยายามร่วมกันของห้องปฏิบัติการ DeepMind และ Brain AI ที่รวมเป็นหนึ่งเดียว Gemini ยืนอยู่บนไหล่ของตัวนำหน้า โดยสัญญาว่าจะนำเสนอชุดแอปพลิเคชันที่เชื่อมต่อกันและฉลาดมากขึ้น
การประกาศของ Google Gemini ซึ่งอยู่ใกล้กับการเปิดตัวของ Bard, Duet AI และ PaLM 2 LLM เป็นการแสดงเจตนาอย่างชัดเจนจาก Google ที่ไม่เพียงแต่จะแข่งขัน แต่ยังนำหน้าในเรื่องการปฏิวัติ AI อีกด้วย
ไม่เหมือนกับความคิดที่ว่า AI จะมี “ฤดูหนาว” การเปิดตัวของ Gemini แสดงให้เห็นว่า AI กำลังอยู่ใน “ฤดูใบไม้ผลิ” ที่มีศักยภาพและเติบโต เมื่อเรามองย้อนกลับไปเมื่อหนึ่งปีที่ผ่านมา เมื่อ ChatGPT ปรากฏตัวขึ้น ซึ่งเป็นช่วงเวลาที่เป็น 里程碑 สำหรับ AI การเคลื่อนไหวของ Google บ่งชี้ว่าการขยายตัวของอุตสาหกรรมยังไม่สิ้นสุด และอาจเพิ่มขึ้นเร็วขึ้น
อะไรคือ Gemini?
โมเดล Gemini ของ Google สามารถประมวลผลข้อมูลประเภทต่างๆ เช่น ข้อความ รูปภาพ เสียง และวิดีโอ มีสามรุ่น ได้แก่ Ultra Pro และ Nano แต่ละรุ่นถูกออกแบบมาเพื่อใช้งานเฉพาะ โดยเริ่มตั้งแต่การให้เหตุผลที่ซับซ้อนไปจนถึงการใช้งานบนอุปกรณ์ Ultra มีความสามารถในการทำงานหลายอย่างและจะพร้อมใช้งานบน Bard Advanced ในขณะที่ Pro เสนอความสมดุลระหว่างประสิทธิภาพและการใช้ทรัพยากร และได้รับการรวมเข้ากับ Bard สำหรับการส่งคำถามข้อความแล้ว Nano ซึ่งได้รับการปรับให้เหมาะสมสำหรับการใช้งานบนอุปกรณ์ มีขนาดสองแบบและมีการปรับให้เหมาะสมด้านฮาร์ดแวร์ เช่น 4-bit quantization สำหรับการใช้งานออฟไลน์บนอุปกรณ์ เช่น Pixel 8 Pro
สถาปัตยกรรมของ Gemini มีลักษณะเฉพาะด้วยความสามารถในการผลิตข้อมูลหลายรูปแบบ โดยใช้ตัวแทนรูปภาพที่แยกจากกันสำหรับการสร้างภาพและรวมคุณสมบัติเสียงจาก Universal Speech Model สำหรับการทำความเข้าใจเสียงที่ละเอียดอ่อน ความสามารถในการจัดการข้อมูลวิดีโอเป็นภาพที่ต่อเนื่องกันซึ่งผสมผสานกับข้อความหรือเสียงแสดงให้เห็นถึงความสามารถมัลติม็อดัล
การเข้าถึง Gemini
Gemini 1.0 กำลังถูกปล่อยออกไปทั่วทั้งระบบของ Google รวมถึง Bard ซึ่งตอนนี้ได้รับประโยชน์จากความสามารถที่ได้รับการปรับปรุงของ Gemini Pro Google ยังได้รวม Gemini เข้ากับบริการ Search, Ads และ Duet เพื่อเพิ่มประสบการณ์ของผู้ใช้ด้วยการตอบสนองที่เร็วและแม่นยำยิ่งขึ้น
สำหรับผู้ที่ต้องการใช้ประโยชน์จาก Gemini Google AI Studio และ Google Cloud Vertex มีการเข้าถึง Gemini Pro โดยที่หลังให้การปรับแต่งและคุณสมบัติด้านความปลอดภัยที่มากขึ้น
เพื่อใช้ประโยชน์จากความสามารถที่ได้รับการปรับปรุงของ Bard ที่ขับเคลื่อนด้วย Gemini Pro ผู้ใช้สามารถทำตามขั้นตอนต่อไปนี้:
- ไปยัง Bard: เปิดเว็บเบราว์เซอร์ที่คุณชอบและไปที่เว็บไซต์ของ Bard
- เข้าสู่ระบบอย่างปลอดภัย: เข้าถึงบริการโดยการเข้าสู่ระบบด้วยบัญชี Google ของคุณ เพื่อให้มั่นใจในประสบการณ์ที่ราบรื่นและปลอดภัย
- แชทแบบโต้ตอบ: คุณสามารถใช้ Bard ได้แล้ว โดยที่คุณสามารถเลือกใช้คุณสมบัติขั้นสูงของ Gemini Pro
พลังของมัลติม็อดัล
ในแก่นกลาง Gemini ใช้สถาปัตยกรรมแบบทรานส์ฟอร์เมอร์ เช่นเดียวกับโมเดล NLP ที่ประสบความสำเร็จ เช่น GPT-3 แต่ความพิเศษของ Gemini คือความสามารถในการประมวลผลและรวมข้อมูลจากหลายรูปแบบ เช่น ข้อความ รูปภาพ และโค้ด ซึ่งทำได้โดยใช้เทคนิคใหม่ๆ ที่เรียกว่า การดึงความสนใจข้ามรูปแบบ ซึ่งช่วยให้โมเดลสามารถเรียนรู้ความสัมพันธ์และความพึ่งพาระหว่างข้อมูลต่างๆ ได้
นี่คือการแบ่งส่วนหลักๆ ของ Gemini:
- เครื่องเข้ารหัสมัลติม็อดัล: โมดูลนี้ประมวลผลข้อมูลเข้าจากแต่ละรูปแบบ (เช่น ข้อความ รูปภาพ) อย่างอิสระ โดยการดึงคุณสมบัติที่เกี่ยวข้องและสร้างการแสดงออกเฉพาะตัว
- เครือข่ายการดึงความสนใจข้ามรูปแบบ: เครือข่ายนี้เป็นหัวใจของ Gemini โดยช่วยให้โมเดลเรียนรู้ความสัมพันธ์และความพึ่งพาระหว่างการแสดงออกต่างๆ ทำให้พวกมันสามารถ “พูดคุย” กันและเพิ่มความเข้าใจ
- เครื่องถอดรหัสมัลติม็อดัล: โมดูลนี้ใช้การแสดงออกที่ได้รับการปรับปรุงจากเครือข่ายการดึงความสนใจข้ามรูปแบบเพื่อทำภารกิจต่างๆ เช่น การสร้างคำบรรยายภาพ การสร้างภาพจากข้อความ และการสร้างโค้ด
Gemini ไม่เพียงแต่เข้าใจข้อความหรือรูปภาพเท่านั้น แต่ยังรวมข้อมูลหลายประเภทเข้าด้วยกันในลักษณะที่ใกล้เคียงกับวิธีที่มนุษย์รับรู้โลก เช่น Gemini สามารถมองลำดับของภาพและกำหนดลำดับของวัตถุภายใน หรือวิเคราะห์คุณสมบัติของวัตถุเพื่อทำการตัดสิน
ความสามารถของ Gemini ยังขยายไปไกลกว่าการทำความเข้าใจภาพ มันสามารถแปลงชุดคำสั่งเป็นโค้ด โดยสร้างเครื่องมือที่ใช้งานได้จริง เช่น ตัวนับถอยหลังที่ไม่เพียงแต่ทำงานตามที่กำหนดนอกจากนี้ยังมีองค์ประกอบที่สร้างสรรค์ เช่น อีโมจิเพื่อเพิ่มการโต้ตอบของผู้ใช้ ซึ่งแสดงให้เห็นถึงความสามารถในการจัดการงานที่ต้องใช้ทั้งความสร้างสรรค์และความสามารถในการทำงาน

ความสามารถของ Gemini : การให้เหตุผลเชิงพื้นที่ (แหล่งที่มา)

ความสามารถของ Gemini ขยายไปถึงการทำงานด้านการเขียนโปรแกรม(แหล่งที่มา)
การออกแบบที่ซับซ้อนของ Gemini มีพื้นฐานมาจากประวัติศาสตร์ของการวิจัยเครือข่ายประสาทเทียมและใช้เทคโนโลยี TPU ของ Google เพื่อการฝึกอบรม Gemini Ultra โดยเฉพาะได้ตั้งมาตรฐานใหม่ในหลายโดเมนของ AI โดยแสดงให้เห็นถึงการปรับปรุงประสิทธิภาพที่น่าประทับใจในงานที่ต้องใช้เหตุผลหลายรูปแบบ
ด้วยความสามารถในการวิเคราะห์และเข้าใจข้อมูลที่ซับซ้อน Gemini เสนอทางออกสำหรับการใช้งานจริง โดยเฉพาะอย่างยิ่งในด้านการศึกษา มันสามารถวิเคราะห์และแก้ไขคำตอบของปัญหา เช่น ในฟิสิกส์ โดยการทำความเข้าใจบันทึกที่เขียนด้วยมือและให้การเรียงความทางคณิตศาสตร์ที่ถูกต้อง ความสามารถดังกล่าวชี้ให้เห็นถึงอนาคตที่ AI จะช่วยเหลือในด้านการศึกษา โดยให้เครื่องมือที่ทันสมัยแก่นักเรียนและครูสำหรับการเรียนรู้และการแก้ปัญหา
Gemini ได้รับการใช้ในการสร้างตัวแทนเช่น AlphaCode 2 ซึ่งมีความสามารถในการแก้ปัญหาโปรแกรมมิ่งการแข่งขัน ซึ่งแสดงให้เห็นถึงศักยภาพของ Gemini ในการทำงานเป็น AI ทั่วไปที่สามารถจัดการปัญหาหลายขั้นตอนที่ซับซ้อน
Gemini Nano นำพลังของ AI มาสู่อุปกรณ์ทั่วไป โดยรักษาความสามารถที่น่าประทับใจในงาน เช่น การสรุปและการอ่านข้อมูล รวมถึงการเขียนโค้ดและความท้าทายด้าน STEM โมเดลที่เล็กกว่านี้ได้รับการปรับให้เหมาะสมเพื่อนำเสนอฟังก์ชัน AI ที่มีคุณภาพสูงบนอุปกรณ์ที่มีหน่วยความจำต่ำ ทำให้ AI ที่ทันสมัยเข้าถึงได้ง่ายกว่าเดิม
การพัฒนา Gemini เกี่ยวข้องกับการนวัตกรรมในด้านอัลกอริทึมการฝึกอบรมและโครงสร้างพื้นฐาน โดยใช้ TPU ล่าสุดของ Google ซึ่งช่วยให้สามารถขยายและฝึกอบรมได้อย่างมีประสิทธิภาพ รับประกันว่าแม้แต่โมเดลที่เล็กที่สุดก็มีการแสดงผลที่ยอดเยี่ยม
ชุดข้อมูลการฝึกอบรมสำหรับ Gemini มีความหลากหลายเช่นเดียวกับความสามารถของมัน รวมถึงเอกสารเว็บ หนังสือ โค้ด รูปภาพ เสียง และวิดีโอ ชุดข้อมูลมัลติม็อดัลและหลายภาษานี้ทำให้โมเดล Gemini สามารถเข้าใจและประมวลผลหลายประเภทของเนื้อหาที่แตกต่างกันได้อย่างมีประสิทธิภาพ
Gemini และ GPT-4
แม้จะมีการเปิดตัวโมเดลอื่นๆ คำถามที่ทุกคนอยากรู้คือ Gemini ของ Google จะเทียบกับ GPT-4 ของ OpenAI ซึ่งเป็นมาตรฐานอุตสาหกรรมสำหรับ LLM ใหม่ๆ ข้อมูลของ Google แสดงให้เห็นว่าในขณะที่ GPT-4 อาจมีความสามารถในการให้เหตุผลเชิงสมอง แต่ Gemini Ultra มีความเหนือกว่าในเกือบทุกด้าน
ตารางเปรียบเทียบด้านบนแสดงถึงประสิทธิภาพที่น่าประทับใจของ Gemini AI ของ Google ในหลายงาน โดยเฉพาะอย่างยิ่ง Gemini Ultra ได้ทำผลงานที่น่าประทับใจใน MMLU benchmark ด้วยความแม่นยำ 90.04% ซึ่งแสดงให้เห็นถึงความเข้าใจที่ดีเยี่ยมในคำถามหลายตัวเลือกที่ครอบคลุม 57 หัวข้อ
ใน GSM8K ซึ่งประเมินคำถามคณิตศาสตร์ระดับโรงเรียนประถม Gemini Ultra ได้คะแนน 94.4% แสดงให้เห็นถึงความสามารถในการประมวลผลคณิตศาสตร์ที่ทันสมัย ในขณะที่ในงานสร้างโค้ดสำหรับ Python Gemini Ultra ได้คะแนน 74.4% ใน HumanEval ซึ่งแสดงให้เห็นถึงความเข้าใจภาษาโปรแกรมมิ่งที่แข็งแกร่ง
การประเมินความเข้าใจในการอ่าน DROP พบว่า Gemini Ultra นำหน้าด้วยคะแนน 82.4% ในขณะที่ในงานให้เหตุผลเชิงสมอง HellaSwag Gemini Ultra ทำได้ดีแม้จะไม่เกินมาตรฐานที่สูงของ GPT-4
สรุป
Gemini ของ Google มีสถาปัตยกรรมที่ไม่เหมือนใคร โดยได้รับการสนับสนุนจากเทคโนโลยีล่าสุดของ Google ซึ่งทำให้ Gemini เป็นผู้เล่นที่มีศักยภาพในสนาม AI โดยท้าทายมาตรฐานที่มีอยู่ที่กำหนดโดยโมเดลอย่าง GPT-4 รุ่นต่างๆ ของ Gemini ได้แก่ Ultra, Pro และ Nano แต่ละรุ่นได้รับการออกแบบมาเพื่อตอบสนองความต้องการเฉพาะตัว ตั้งแต่การให้เหตุผลที่ซับซ้อนไปจนถึงการประยุกต์ใช้งานบนอุปกรณ์
การรวม Gemini เข้ากับระบบนิเวศของ Google ตั้งแต่ Bard ไปจนถึง Google Cloud Vertex เน้นถึงศักยภาพในการปรับปรุงประสบการณ์ของผู้ใช้ข้ามบริการต่างๆ มันไม่เพียงแต่จะปรับปรุงแอปพลิเคชันที่มีอยู่เท่านั้น แต่ยังเปิดโอกาสใหม่ๆ สำหรับโซลูชันที่ขับเคลื่อนด้วย AI ไม่ว่าจะเป็นในด้านการช่วยเหลือส่วนบุคคล การสร้างสรรค์ หรือการวิเคราะห์ธุรกิจ
เมื่อมองไปข้างหน้า การพัฒนาอย่างต่อเนื่องของโมเดล AI เช่น Gemini เน้นย้ำถึงความสำคัญของการวิจัยและพัฒนาที่ต่อเนื่อง การท้าทายในการฝึกอบรมโมเดลที่ซับซ้อนและรับประกันการใช้งานที่มีจริยธรรมและรับผิดชอบยังคงอยู่ในความสนใจหลักของการอภิปราย














