AGI และ AI แห่งอนาคต

สำรวจ Gemini 1.5: วิธีการที่ Google’s Latest Multimodal AI Model ยกระดับ AI Landscape ไปไกลกว่าผู้ tiền nhiệm

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ในภูมิทัศน์ของปัญญาประดิษฐ์ที่เปลี่ยนแปลงอย่างรวดเร็ว Google (GOOGL ) ยังคงนำหน้าด้วยการพัฒนาเทคโนโลยี AI แบบหลายรูปแบบที่เป็นนวัตกรรมใหม่ ๆ ไม่นานหลังจากการเปิดตัว Gemini 1.0 ซึ่งเป็นโมเดลภาษาขนาดใหญ่แบบหลายรูปแบบที่มีความก้าวหน้า Google ได้เปิดตัว Gemini 1.5 แล้ว โมเดลนี้ไม่เพียงแต่เพิ่มความสามารถที่กำหนดโดย Gemini 1.0 เท่านั้น แต่ยังนำเสนอการปรับปรุงที่สำคัญใน phương phápประมวลผลและบูรณาการข้อมูลหลายรูปแบบของ Google ด้วย โมเดลนี้เป็นการพัฒนาที่สำคัญของ Gemini 1.0 และเป็นการก้าวหน้าสำคัญในการพัฒนาปัญญาประดิษฐ์แบบหลายรูปแบบ

Gemini 1.0: การวางรากฐาน

Gemini 1.0 เปิดตัวโดย Google DeepMind และ Google Research เมื่อวันที่ 6 ธันวาคม 2023 โดยนำเสนอโมเดล AI แบบหลายรูปแบบที่สามารถเข้าใจและสร้างเนื้อหาที่หลากหลาย เช่น ข้อความ เสียง ภาพ และวิดีโอ นี่เป็นก้าวสำคัญในการพัฒนาปัญญาประดิษฐ์ โดยขยายขอบเขตการบริหารจัดการข้อมูลที่หลากหลาย

คุณสมบัติที่โดดเด่นของ Gemini คือความสามารถในการผสมผสานข้อมูลหลายรูปแบบได้อย่างราบรื่น ไม่เหมือนกับโมเดล AI ทั่วไปที่อาจเชี่ยวชาญเฉพาะข้อมูลประเภทเดียวเท่านั้น Gemini รวมข้อความ ภาพ และเสียงเข้าด้วยกัน ทำให้สามารถทำงานได้หลากหลาย เช่น วิเคราะห์ข้อความเขียนด้วยมือหรือตีความแผนภาพที่ซับซ้อน

Gemini มีโมเดลสำหรับการใช้งานที่หลากหลาย เช่น โมเดล Ultra สำหรับงานที่ซับซ้อน โมเดล Pro สำหรับความเร็วและความสามารถในการปรับขนาดบนแพลตฟอร์มหลัก ๆ เช่น Google Bard และโมเดล Nano (Nano-1 และ Nano-2) ที่มีพารามิเตอร์ 1.8 พันล้านและ 3.25 พันล้านพารามิเตอร์ตามลำดับ ซึ่งออกแบบมาเพื่อการบูรณาการเข้ากับอุปกรณ์ เช่น สมาร์ทโฟน Google Pixel 8 Pro

การก้าวไปสู่ Gemini 1.5

Gemini 1.5 เป็นการอัปเกรดความสามารถและประสิทธิภาพการทำงานของ Gemini 1.0 โดยใช้สถาปัตยกรรม Mixture-of-Experts (MoE) ซึ่งเป็นการเปลี่ยนแปลงจากแนวทางโมเดลขนาดใหญ่ที่เป็นเอกภาพในผู้ tiền nhiệm สถาปัตยกรรมนี้ประกอบด้วยโมเดลทรานส์ฟอร์เมอร์ขนาดเล็กที่เชี่ยวชาญเฉพาะด้าน ซึ่งแต่ละโมเดลสามารถจัดการข้อมูลหรืองานเฉพาะได้อย่างมีประสิทธิภาพ เมื่อรับข้อมูลเข้ามา โมเดลจะเลือกผู้เชี่ยวชาญที่เหมาะสมที่สุดเพื่อประมวลผลข้อมูลนั้น ทำให้ Gemini 1.5 มีความสามารถในการเรียนรู้และประมวลผลข้อมูลที่ดีขึ้น

การขยายความสามารถ

Gemini 1.5 มีการปรับปรุงความสามารถในการประมวลผลข้อมูลที่สำคัญ โดยเฉพาะอย่างยิ่งการเพิ่มขนาดหน้าต่างบริบท (context window) ซึ่งเป็นจำนวนข้อมูลที่ผู้ใช้สามารถวิเคราะห์เพื่อสร้างคำตอบได้ จาก 32,000 โทเค็นใน Gemini 1.0 เป็น 1 ล้านโทเค็นใน Gemini 1.5 Pro ทำให้สามารถประมวลผลข้อมูลขนาดใหญ่ เช่น วิดีโอหนึ่งชั่วโมง เสียงสิบเอ็ดชั่วโมง หรือฐานโค้ดและเอกสารข้อความขนาดใหญ่ได้

ภาพรวมของความสามารถ Gemini 1.5

Gemini 1.5 มีการปรับปรุงโครงสร้างและความสามารถในการประมวลผลข้อมูล ทำให้สามารถทำงานที่ซับซ้อนได้ดีขึ้น ไม่ว่าจะเป็นการวิเคราะห์ข้อมูลขนาดใหญ่หรือการแปลภาษา โมเดลนี้แสดงให้เห็นถึงความสามารถในการเรียนรู้และปรับให้เข้ากับสถานการณ์ต่าง ๆ ได้อย่างรวดเร็ว

การฝึกอบรมบน TPUv4 ของ Google ทำให้ Gemini 1.5 Pro มีความสามารถในการประมวลผลข้อมูลที่หลากหลายและซับซ้อน รวมถึงข้อมูลหลายรูปแบบและหลายภาษา การฝึกอบรมนี้ช่วยให้ Gemini 1.5 Pro สามารถสร้างผลลัพธ์ที่สอดคล้องกับการรับรู้ของมนุษย์ได้ดีขึ้น

การเข้าถึงแบบ Limited Preview

Gemini 1.5 Pro มีการเปิดตัวแบบ Limited Preview สำหรับนักพัฒนาและลูกค้าองค์กรผ่าน AI Studio และ Vertex AI โดยมีแผนการเปิดตัวแบบเต็มและตัวเลือกที่สามารถปรับแต่งได้ในอนาคต การเปิดตัวแบบ Limited Preview นี้ให้โอกาสในการสำรวจความสามารถที่เพิ่มขึ้นของ Gemini 1.5 และคาดหวังการปรับปรุงความเร็วในการประมวลผล

สรุป

Gemini 1.5 เป็นตัวอย่างของการก้าวหน้าในการพัฒนาปัญญาประดิษฐ์แบบหลายรูปแบบ โดยสร้างบนพื้นฐานที่วางไว้โดย Gemini 1.0 และนำเสนอวิธีการประมวลผลและบูรณาการข้อมูลที่ดีขึ้น การเปิดตัว Gemini 1.5 แสดงให้เห็นถึงความพยายามอย่างต่อเนื่องของ Google ในการปรับปรุงเทคโนโลยี AI และเปิดโอกาสให้นักพัฒนาและลูกค้าองค์กรได้สำรวจและใช้ประโยชน์จากความสามารถที่เพิ่มขึ้นของ Gemini 1.5

ดร. Tehseen Zia เป็น Professor ที่ COMSATS University Islamabad โดยได้รับ PhD ใน AI จาก Vienna University of Technology, Austria มีเชี่ยวชาญด้าน Artificial Intelligence, Machine Learning, Data Science, และ Computer Vision โดยมีส่วนร่วมที่สำคัญด้วยการเผยแพร่ในวารสารวิทยาศาสตร์ที่มีชื่อเสียง ดร. Tehseen ยังได้ดำเนินโครงการอุตสาหกรรมต่างๆ ในฐานะ Principal Investigator และให้บริการเป็นที่ปรึกษาด้าน AI