Model dan platform AI

Google Luncurkan Model Suara Gemini 3.8 Live dan Extended Thinking

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Google mengumumkan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking pada 15 September 2026, sepasang model dialog langsung yang diluncurkan melalui Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live, dan Google Workspace.

Model-model tersebut diperkenalkan oleh Tom Ouyang, seorang insinyur utama, dan Malini Jaganathan, anggota staf teknis, yang menulis atas nama Tim Audio Gemini. Google menggambarkan keduanya sebagai model dialog langsung paling canggih yang pernah ada, dirancang untuk percakapan alami, dan menyatakan bahwa peningkatan kecerdasan serta penalaran paralel membuatnya lebih intuitif untuk berkolaborasi pada tugas kompleks yang dijalankan melalui suara. Perusahaan menempatkan Gemini 3.8 Live untuk skalabilitas dan efisiensi biaya, menggabungkan kecerdasan percakapan dengan dialog yang mengalir dan grounding visual, sementara Gemini 3.8 Live Extended Thinking dibangun untuk tugas berkompleksitas tinggi yang memerlukan kecerdasan lebih tinggi dan penalaran berulang langkah. Menurut Google, model-model ini memberikan pengembang dan perusahaan blok bangunan untuk agen suara yang andal dan siap produksi, sekaligus membuat percakapan dengan Gemini melalui aplikasi Gemini, Workspace, dan Search menjadi lebih lancar.

Hasil Benchmark yang Dilaporkan

Google melaporkan bahwa Gemini 3.8 Live Extended Thinking meraih posisi teratas secara keseluruhan pada Speech to Speech Quality Index milik Artificial Analysis dengan skor 82,6, serta memimpin penyelesaian tugas agen dengan 68,6 % pada τ-Voice dan 35,1 % pada benchmark τ-Voice-banking milik Sierra. Perusahaan juga melaporkan skor 97,7 % pada Big Bench Audio dan menyatakan bahwa Extended Thinking mempertahankan titik harga yang sangat kompetitif dibandingkan model frontier lainnya. Google menyebutkan bahwa Gemini 3.8 Live menempati posisi kedua dalam Speech Agent Arena milik Artificial Analysis, dengan mengutip preferensi tinggi di antara pengguna, dan menggambarkannya sebagai sangat hemat biaya dan dirancang untuk skalabilitas. Pada EVA-Bench milik ServiceNow, sebuah benchmark untuk mengevaluasi agen suara, Google mengatakan model-modelnya mendorong Pareto Frontier untuk alur kerja kompleks dengan berhasil menyeimbangkan akurasi dan kualitas percakapan; catatan tersebut menunjukkan evaluasi ini dijalankan pada Live API di platform Agen Gemini Enterprise.

Kemampuan Percakapan Real-Time

Menurut Google, Gemini 3.8 Live memproses masukan visual dalam hampir waktu nyata, menambahkan konteks yang dikatakan perusahaan menghasilkan respons yang lebih membantu. Model ini secara otomatis mendeteksi dan beralih di antara 97 bahasa yang didukung di tengah percakapan, serta mengeksekusi alat dan panggilan API di latar belakang sementara percakapan berlanjut, mengakui permintaan dan menjaga dialog tetap berjalan saat tugas selesai. Untuk tugas yang memerlukan penalaran lebih mendalam, Google menyatakan bahwa Extended Thinking menalar dan berbicara secara bersamaan, menggunakan isyarat verbal awal untuk mengakui prompt secara alami serta narasi kemajuan langsung untuk membimbing pengguna melalui tugas latar belakang berulang langkah saat mereka berkembang, tanpa memutus alur percakapan.

Video demonstrasi yang dipublikasikan bersamaan dengan pengumuman memperlihatkan Gemini 3.8 Live memandu sesi orientasi karyawan secara real time dengan menggunakan konteks visual untuk menjawab pertanyaan langsung, bermain catur dalam hampir waktu nyata, menyusun rencana bisnis lengkap dan paket pemasaran khusus melalui percakapan alami, serta menyediakan bantuan pemecahan masalah langkah demi langkah di dalam Search Live. Demonstrasi Extended Thinking menunjukkan model mengubah sketsa mentah dan umpan suara hampir real time menjadi komponen React yang fungsional, mengoordinasikan reservasi restoran berulang langkah melalui panggilan fungsi asinkron tanpa mengganggu percakapan, dan beroperasi di Docs Live, Gmail Live, serta Keep Live dalam Google Workspace.

Live API dan Ekosistem Pengembang

Google menyebut Agora, Fishjam, LiveKit, Pipecat, Vercel, dan Vision Agents sebagai platform pengembang yang menggunakan Gemini Live API untuk memungkinkan pengembang membangun dan menyebarkan antarmuka berbasis suara sementara platform tersebut mengelola infrastruktur streaming media real-time yang mendasarinya. Perusahaan juga menyatakan bahwa ia bermitra dengan Salesforce, Genspark, dan Lumeris pada model baru ini, menyoroti minat mereka terhadap latensi, kelancaran, dan kemampuan pemanggilan alat pada model-model tersebut.

Dokumentasi resmi Live API menjelaskan antarmuka ini memungkinkan interaksi suara dan visual real-time dengan latensi rendah bersama Gemini, memproses aliran kontinu audio, gambar, dan teks untuk memberikan respons lisan secara langsung melalui koneksi WebSocket yang bersifat stateful. Input yang didokumentasikan meliputi audio PCM 16-bit mentah pada 16 kHz, gambar JPEG hingga satu frame per detik, dan teks, dengan output audio berupa PCM 16-bit mentah pada 24 kHz. Pengembang dapat memilih implementasi server-ke-server, di mana backend meneruskan data aliran klien ke Live API, atau implementasi klien-ke-server, di mana kode frontend terhubung langsung melalui WebSocket. Dokumentasi mencantumkan kasus penggunaan yang mencakup asisten belanja ritel dan agen dukungan, karakter permainan interaktif, pengalaman berbasis suara dan video dalam robotika, kacamata pintar, serta kendaraan, pendamping kesehatan, alat penasihat keuangan, mentor pendidikan, terjemahan real-time, serta transkripsi dan penulisan keterangan secara langsung.

Google menyatakan bahwa semua audio yang dihasilkan oleh produk AI-nya dilengkapi watermark SynthID, sebuah watermark tak terlihat yang disisipkan langsung ke dalam output audio sehingga konten yang dihasilkan AI tetap dapat dideteksi untuk membantu mencegah misinformasi. Posting tersebut mengarahkan pembaca ke kartu model untuk detail tentang pendekatan keamanan dan tanggung jawab perusahaan.

Ketersediaan dan Peluncuran

Kedua model mulai diluncurkan pada 15 September. Untuk pengembang, model ini tersedia di Gemini API dan Google AI Studio, dan untuk perusahaan tersedia dalam pratinjau pribadi di Gemini Enterprise. Gemini 3.8 Live tersedia untuk semua orang di Search Live, sementara Extended Thinking tersedia di Gemini Live, di Docs untuk pelanggan Google AI Pro dan Ultra melalui Workspace, serta di Gmail dan Keep untuk semua pelanggan Google AI. Google menyatakan bahwa Gemini Enterprise untuk dukungan Customer Experience bagi kedua model akan segera hadir, dan bahwa Extended Thinking akan segera tersedia bagi pelanggan bisnis Google Workspace.

Jonas Reeve adalah analis AI yang dihasilkan di Unite.AI, yang fokus pada kecerdasan buatan kognitif, kecerdasan buatan umum (AGI), dan landasan teori kecerdasan mesin. Karyanya mengeksplorasi bagaimana pembelajaran, penalaran, memori, dan abstraksi muncul dalam sistem biologis dan buatan, menghubungkan arsitektur AI modern dengan pertanyaan lama dalam ilmu kognitif dan filsafat pikiran.
Dengan pendekatan konseptual dan reflektif, Jonas memeriksa kerangka kerja seperti model penalaran, sistem agen, kognisi yang muncul, dan teori keselarasan, dengan tujuan untuk memperjelas apa yang dimaksud dengan kemajuan menuju AGI—dan apa yang tidak. Daripada mengejar garis waktu atau sensasi, ia menekankan prinsip-prinsip dasar, ketepatan konseptual, dan batasan model saat ini.
Artikel yang ditulis oleh Jonas Reeve dihasilkan oleh AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi, kejelasan, dan diskusi yang bertanggung jawab tentang konsep AI lanjutan.