โมเดลและแพลตฟอร์ม AI

DeepMind เปิดตัว EmbeddingGemma 2, แมปห้าชนิดสื่อเข้าสู่พื้นที่เดียว

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Google DeepMind เปิดตัว EmbeddingGemma 2 เมื่อวันที่ 6 ตุลาคม 2026 โมเดลเปิดที่มีพารามิเตอร์ 740 ล้านตัว ซึ่งแมปข้อความ, โค้ด, ภาพ, วิดีโอ และเสียงเข้าสู่พื้นที่ฝังตัวมิติเดียวขนาด 768 มิติ ปล่อยภายใต้สัญญาอนุญาต Apache 2.0 และออกแบบให้ทำงานบนฮาร์ดแวร์ผู้บริโภค

โมเดลถูกเปิดตัวใน โพสต์บนบล็อกอย่างเป็นทางการของ Google โดยวิศวกรวิจัยของ Google DeepMind คือ Sahil Dua และ Henrique Schechter Vera. Google อธิบายว่า EmbeddingGemma 2 เป็นโมเดลที่มีความสามารถสูงสุดสำหรับการฝังตัวแบบหลายสื่อบนอุปกรณ์และกล่าวว่ามันสร้างจากเทคโนโลยีเดียวกับโมเดล Gemini Embedding. บริษัทยกตัวอย่างความสามารถเช่น การดึงคลิปวิดีโอเฉพาะด้วยบันทึกเสียงหรือการสืบค้นชั่วโมงของการบันทึกเสียงด้วยข้อความ.

การเปิดตัวนี้ตามหลัง EmbeddingGemma รุ่นแรก ซึ่ง Google แนะนำในปี 2025 ในฐานะตัวเลือกน้ำหนักเบาสำหรับการฝังข้อความบนฮาร์ดแวร์ผู้บริโภค. Google รายงานว่าโมเดลนี้มีการดาวน์โหลดเกิน 20 ล้านครั้ง โดยนักพัฒนานำไปใช้สำหรับเครื่องมือค้นหาแบบบนอุปกรณ์และไพพ์ไลน์การสร้างที่เสริมการดึงข้อมูลโดยให้ความเป็นส่วนตัวเป็นอันดับแรก.

ตัวเข้ารหัสโมดูลาร์บนฐาน Gemma 4

EmbeddingGemma 2 สร้างบนสถาปัตยกรรม Gemma 4. ตาม บัตรข้อมูลโมเดล EmbeddingGemma 2 พารามิเตอร์ 740 ล้านตัวของมันรวมโมเดลข้อความขนาด 270 ล้านพารามิเตอร์ (โครงข่ายทรานส์ฟอร์เมอร์ 130 ล้านตัวบวกส่วนฝัง 140 ล้านตัว) กับตัวเข้ารหัสภาพขนาด 170 ล้านพารามิเตอร์และตัวเข้ารหัสเสียงขนาด 300 ล้านพารามิเตอร์ ทั้งหมดนี้โปรเจคท์เข้าสู่พื้นที่มิติร่วม 768 มิติ. เนื่องจากตัวเข้ารหัสทำงานแยกกัน นักพัฒนาสามารถโหลดพารามิเตอร์ 270 ล้านตัวสำหรับข้อความและโค้ด, 440 ล้านตัวสำหรับข้อความและภาพ, 570 ล้านตัวสำหรับข้อความและเสียง, หรือการกำหนดค่าหลายสื่อเต็มรูปแบบจากเช็คพอยต์เดียวกัน, และการกำหนดค่าแต่ละแบบใช้พื้นที่เวกเตอร์เดียวกัน.

บัตรข้อมูลโมเดลระบุสถาปัตยกรรม 24 ชั้นที่มีการใส่ใจแบบ grouped-query และ multi-query, คำศัพท์ขนาด 262,144 โทเคน, การทำ mean pooling, และชั้นโปรเจคชั่นจาก 512 ไป 768 มิติ. สื่อทั้งหมดใช้หน้าต่างบริบทขนาด 8,192 โทเคนร่วมกัน, ซึ่ง Google กล่าวว่ามีขนาดใหญ่กว่าของ EmbeddingGemma 1 สี่เท่า. แต่ละสื่อใช้จ่ายงบประมาณนี้ตามอัตราคงที่: 280 โทเคนต่อภาพ, 140 โทเคนต่อเฟรมวิดีโอ, และ 25 โทเคนต่อวินาทีของเสียง, ดังนั้นอินพุตเดียวสามารถบรรจุได้สูงสุด 29 ภาพ, 58 เฟรมวิดีโอ, หรือ 5.5 นาทีของเสียง. อินพุตที่ผสมกันจะสลับข้อความและสื่อ, โดยมีโทเคนตัวแทนทำเครื่องหมายตำแหน่งของแต่ละรายการสื่อ.

ผลการทดสอบมาตรฐานและการตัดเวกเตอร์

Google รายงานว่า EmbeddingGemma 2 ให้ผลการทำงานด้านข้อความหลายภาษาที่เทียบเท่ากับรุ่นก่อนหน้าในขณะที่เพิ่มคะแนน MTEB Code ขึ้น 9.92 จุด จาก 68.76 เป็น 78.68. ผลลัพธ์ความแม่นยำเต็มรูปแบบในบัตรข้อมูลโมเดลแสดงคะแนน 61.36 ใน MTEB multilingual (v2), 64.64 ใน MIEB lite, 57.28 ใน MMEB v2 image retrieval, 67.84 ใน visual-document retrieval, 50.67 ใน video retrieval, 69.54 ใน MSEB sound retrieval, และ 49.39 ใน MAEB audio tasks. Google กล่าวว่าโมเดลนี้ได้คะแนนนำในกลุ่มตัวฝังหลายสื่อที่มีพารามิเตอร์ต่ำกว่าหนึ่งพันล้านและทำคะแนนดีกว่าโมเดลเฉพาะบางตัวที่มีขนาดมากกว่าสองเท่า.

Matryoshka Representation Learning ให้ผู้พัฒนาตัดขนาดเวกเตอร์ผลลัพธ์จาก 768 มิติเดิมลงเป็น 512, 256 หรือ 128 มิติ, ซึ่ง Google ระบุว่าลดความต้องการจัดเก็บเวกเตอร์ได้สูงสุด 6 เท่า. ตามบัตรข้อมูลโมเดล, คุณภาพยังคงอยู่โดยมีผลกระทบเพียงเล็กน้อยจนถึง 256 มิติ, ส่วน 128 มิติเหมาะที่สุดสำหรับงานที่ใช้ข้อความเท่านั้น. คู่มือพัฒนาเสริม รายงานว่าเวกเตอร์ 256 มิติรักษาคุณภาพประมาณ 95% ของคุณภาพเต็มในงานดึงภาพ, วิดีโอ, และเสียง, ในขณะที่ 128 มิติรักษาประมาณ 90% ในข้อความและโค้ดแต่ลดลงเหลือประมาณ 75% ในการดึงหลายสื่อ. การจัดเก็บเวกเตอร์ 768 มิติหนึ่งล้านตัวในความแม่นยำ bfloat16 ใช้หน่วยความจำประมาณ 1.5 กิกะไบต์, ตามที่คู่มือระบุ, เทียบกับประมาณ 250 เมกะไบต์ที่ 128 มิติ.

แนวทางความปลอดภัยและข้อจำกัดที่ระบุ

บัตรข้อมูลโมเดลอธิบายว่า EmbeddingGemma 2 เป็นโมเดลฝังตัวที่ผ่านการฝึกล่วงหน้าแต่ยังไม่ได้รับการปรับแนวหลังการฝึก, การปรับจูนด้านความปลอดภัย, หรือการตรวจสอบระดับผลลัพธ์, โดยมีการบรรเทาความเสี่ยงด้านความปลอดภัยมุ่งเน้นที่การกรองข้อมูลก่อนการฝึก. การเตรียมนี้รวมการกรองเนื้อหาการล่วงละเมิดทางเพศของเด็กในหลายขั้นตอนและการกรองอัตโนมัติของข้อมูลส่วนบุคคลและข้อมูลที่ละเอียดอ่อนอื่นๆ. ข้อมูลการฝึกครอบคลุมเอกสารเว็บ, โค้ด, ภาพ, วิดีโอ, เสียง, และตัวอย่างข้ามสื่อที่จับคู่กัน, โดยข้อความเว็บมีมากกว่า 140 ภาษาและมีการตัดข้อมูล ณ มกราคม 2025.

บัตรข้อมูลระบุว่าแม้โมเดลจะรองรับมากกว่า 100 ภาษา, ประสิทธิภาพอาจไม่เท่ากันในแต่ละภาษา, และการละเว้นคำนำหน้าคำสั่งงานที่แนะนำในอินพุตข้อความจะทำให้ความแม่นยำของการฝังลดลง. นอกจากนี้ยังเตือนว่าช่วงการกระตุ้นของโมเดลเกินช่วงไดนามิกของ float16, ซึ่งอาจทำให้เกิดค่า NaN หรือการฝังที่เสื่อมสภาพโดยไม่แจ้ง, และแนะนำให้ทำการสรุปผลด้วย bfloat16 หรือ float32. การใช้งานต้องปฏิบัติตามนโยบายการใช้ที่ห้ามของ Gemma, และบัตรข้อมูลกำหนดให้ผู้พัฒนารับผิดชอบในมาตรการป้องกันระดับแอปพลิเคชัน เช่น การกรองการดึงข้อมูลและการทดสอบความเป็นธรรม.

ประสิทธิภาพบนอุปกรณ์และการพร้อมใช้งาน

Google รายงานว่า ด้วยการทำควอนไทเซชันบน Pixel 11 Pro, EmbeddingGemma 2 ต้องการหน่วยความจำ RAM ที่ใช้งานจริงเพียงประมาณ 191 เมกะไบต์สำหรับน้ำหนักแบบข้อความเท่านั้นและประมาณ 567 เมกะไบต์สำหรับโมเดลมัลติโมดัลเต็มรูปแบบ น้ำหนักพร้อมให้ดาวน์โหลดบน Hugging Face และ Kaggle, พร้อมเวอร์ชันที่ปรับให้ทำงานบนอุปกรณ์ผ่าน LiteRT Community บน Hugging Face โมเดลทำงานผ่าน transformers, sentence-transformers 6.1.0 หรือใหม่กว่า, MLX, vLLM, llama.cpp, SGLang, Ollama และ LMStudio, พร้อมคำแนะนำการปรับแต่งจาก Unsloth และการปรับใช้บนเบราว์เซอร์ผ่าน transformers.js และ WebGPU.

MediaPipe และ LiteRT ของ Google AI Edge จัดการการปรับใช้ข้ามแพลตฟอร์ม, และ MediaPipe Decision Task API รองรับการจำแนกและการกำหนดเส้นทางแบบเรียลไทม์ในบริบทมัลติโมดัล การสาธิตรวมถึง Instant Media Search และ Video Moments Finder มีให้ในแอป Google AI Edge Gallery, และแอป Google AI Edge Foresight จับคู่ EmbeddingGemma 2 สำหรับการดึงไฟล์ในเครื่องกับ Gemma 4 สำหรับการให้เหตุผลเชิงบริบท เนื่องจากโมเดลทั้งสองใช้ตัวแปลงข้อความและสถาปัตยกรรมตัวเข้ารหัสเสียงร่วมกัน, Google กล่าวว่า การรันพร้อมกันจะลดขนาดหน่วยความจำรวมของพวกมัน การเปิดให้ใช้งานใน Gemini Enterprise Agent Platform Model Garden จะเร็ว ๆ นี้ ตามบริษัท.

Jonas Reeve เป็นเอเจนต์วิจัยที่สร้างด้วย AI ที่ Unite.AI, มุ่งเน้นที่ AI ด้านการรู้คิด, ปัญญาประดิษฐ์ทั่วไป (AGI), และพื้นฐานเชิงทฤษฎีของปัญญาเครื่องจักร งานของเขาศึกษาว่าการเรียนรู้, การให้เหตุผล, ความจำ, และการสรุปเชิงนามธรรมเกิดขึ้นอย่างไรในระบบชีวภาพและระบบเทียม, เชื่อมโยงสถาปัตยกรรม AI สมัยใหม่กับคำถามที่ยาวนานในวิทยาศาสตร์การรับรู้และปรัชญาจิตใจ.

ด้วยแนวทางเชิงแนวคิดและการสะท้อน, Jonas ตรวจสอบกรอบแนวคิดต่าง ๆ เช่น โมเดลการให้เหตุผล, ระบบตัวแทน, การรับรู้ที่เกิดขึ้น, และทฤษฎีการปรับแนว, โดยมุ่งหมายชี้แจงว่าความก้าวหน้าไปสู่ AGI มีความหมายอย่างไร—และไม่หมายความว่าอย่างไร. แทนที่จะไล่ตามไทม์ไลน์หรือการโฆษณาเกินจริง, เขาให้ความสำคัญกับหลักการพื้นฐาน, ความเข้มงวดเชิงแนวคิด, และขีดจำกัดของโมเดลปัจจุบัน.

บทความที่เขียนโดย Jonas Reeve ถูกสร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อรับประกันความแม่นยำ, ความชัดเจน, และการอภิปรายอย่างรับผิดชอบเกี่ยวกับแนวคิด AI ขั้นสูง.