Model dan platform AI

Google Menambahkan Kehadiran Visual Avatar Live ke Gemini 3.8 Live

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Google pada 24 September 2026 memperkenalkan Gemini 3.8 Live with Live Avatar, sebuah fitur yang menambahkan video yang dihasilkan hampir secara real‑time ke ucapan model dialog live asli mereka, dan menjadikannya tersedia secara umum di Gemini Enterprise dengan endpoint di Amerika Serikat dan Uni Eropa.

Pengumuman yang ditulis oleh ilmuwan riset Shuo-yiin Chang dan insinyur perangkat lunak CJ Zheng atas nama Tim Audio Gemini ini memperkenalkan fitur tersebut sebagai lapisan kehadiran visual untuk AI percakapan Gemini. Google menyatakan sinkronisasi bibir yang tepat, ekspresi alami, dan pergantian giliran yang mulus memungkinkan perusahaan memperluas penawaran virtual seperti layanan pelanggan dan tur interaktif.

Rilis ini mengikuti Peluncuran 15 September 2026 dari Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking oleh Google, model dialog live yang diposisikan Google untuk percakapan yang dapat diskalakan dan hemat biaya serta untuk tugas penalaran berkompleksitas tinggi secara masing‑masing, yang mulai diluncurkan melalui Gemini API, Google AI Studio, aplikasi Gemini, Google Workspace, dan Search Live.

Ketersediaan Umum di Gemini Enterprise

Gemini 3.8 Live with Live Avatar tersedia secara umum di Gemini Enterprise per 24 September 2026, dan Google Cloud menyatakan teknologi ini pertama kali dipratinjau pada Google Cloud Next 2026. Rilis ini ditawarkan melalui endpoint AS dan UE serta mencakup throughput yang disediakan, kepatuhan perusahaan, dan tata kelola data yang ketat, menurut postingan Google Cloud oleh Fabien Blanc‑paques, manajer produk grup untuk Gemini Live. Gemini 3.8 Live Extended Thinking tetap dalam pratinjau pribadi.

Pelanggan perusahaan dapat mencoba model ini di konsol Gemini Enterprise, mengintegrasikannya melalui dokumentasi Gemini Live API, dan meninjau harga di halaman harga Google Cloud. Google Cloud menyarankan pelanggan untuk bekerja dengan perwakilan penjualan mereka guna memperoleh throughput yang disediakan, arsitektur penyebaran yang disesuaikan, dan daftar putih avatar khusus.

Cara Kerja Avatar Live

Menurut Google, Avatar Live memproses masukan visual dan audio secara bersamaan serta menjawab dengan audio dan video ekspresif dalam hampir waktu nyata. Fitur ini juga mendukung pemanggilan alat secara asinkron, sehingga dapat memulai pemanggilan alat dan mengambil data di latar belakang tanpa menghentikan percakapan. Satu demonstrasi Google menunjukkan avatar memeriksa tamu hotel sementara dialog terus berlanjut tanpa gangguan.

Google menyatakan avatar menyesuaikan sinkronisasi bibir dan ekspresinya saat percakapan berpindah melintasi 97 bahasa, menjaga kesetiaan video dan menghindari pergeseran visual. Posting Google Cloud menambahkan pemahaman visual langsung terhadap aliran kamera dan berbagi layar bersamaan dengan audio, pemulihan interupsi yang mempertahankan konteks percakapan dan transaksi backend, deteksi bahasa otomatis serta transisi tanpa pengaturan manual, dan penyebaran di web, seluler, serta kios interaktif. Demonstrasi terpisah dari Google Cloud memperlihatkan agen penerimaan klaim asuransi mengisi buku catatan klaim saat pelanggan menampilkan kerusakan melalui kamera, sementara tim agen yang dibangun dengan Agent Development Kit milik Google memverifikasi polis, menerapkan aturan penerimaan, dan menyusun paket penilai di latar belakang.

Avatar, Penandaan Air, dan Batas Model‑Card

Organisasi dapat menyebarkan avatar dari perpustakaan avatar pra‑set atau menghasilkan avatar khusus dari gambar referensi berkualitas tinggi, dan Google menyatakan hasilnya mempertahankan kemiripan, gaya merek, atau identitas karakter dari referensi tersebut. Akses ke pembuatan avatar khusus memerlukan daftar putih perusahaan; Google Cloud menjelaskan proses daftar putih dan verifikasi sebagai langkah pengamanan identitas dan mencegah penyalahgunaan. Setiap aliran audio dan video yang dihasilkan disematkan dengan watermark SynthID yang tidak dapat terlihat, sehingga konten yang dihasilkan AI tetap dapat dideteksi.

Menurut Gemini 3.8 Audio kartu model, model-model tersebut didasarkan pada Gemini 3 Pro. Gemini 3.8 Live menerima audio, gambar, video, dan teks dengan jendela konteks hingga 128K token, dan dengan Live Avatar menghasilkan audio, video, dan teks dengan batas output 24K token. Kartu model menyatakan bahwa varian Live Avatar menghasilkan video ekspresif dengan gerakan kepala alami yang disinkronkan dengan ucapan, dipandu oleh gambar dan masukan audio yang dikonfigurasi, dan bahwa mereka dapat berinteraksi secara berkelanjutan selama beberapa menit, bukan berjam-jam.

Model card mencantumkan keterbatasan yang diketahui termasuk kemungkinan halusinasi serta keterlambatan atau timeout sesekali, dan menetapkan batas pengetahuan pada Januari 2025. Penilaian keamanan frontier-nya tidak menemukan kemampuan baru yang signifikan atau peningkatan kinerja material dibandingkan Gemini 3.7 Flash, dan atas dasar itu Google menganggap model Gemini 3.8 Audio tidak mungkin mencapai Tingkat Kapabilitas yang Dilacak atau Kritis dalam Kerangka Keamanan Frontier-nya.

Penerapan Pelanggan

Google Cloud menyebutkan beberapa perusahaan yang membangun dengan fitur ini. Cox Automotive membuat asisten belanja berbasis AI untuk Autotrader yang menggunakan penyorotan layar secara langsung dan pemanggilan alat untuk membimbing pembeli mobil melalui pencarian kendaraan, perbandingan, dan pembiayaan secara real‑time.

“Pembeli semakin mengharapkan dapat menggambarkan apa yang mereka butuhkan dengan kata-kata mereka sendiri daripada harus melewati filter dan menu. Avatar AI percakapan baru Autotrader menghadirkan pengalaman itu dalam penemuan kendaraan dengan mencocokkan percakapan alami ke inventaris yang tepat,” Marianne Johnson, wakil presiden eksekutif dan kepala produk Cox Automotive, kata dalam pengumuman Google Cloud.

CEO Equal AI Akhilesh Damaraju mengatakan AI pribadi perusahaan menangani lebih dari satu juta panggilan langsung setiap hari dalam sembilan bahasa India, dan menyatakan bahwa Gemini 3.8 Live meningkatkan penanganan gangguan, percakapan multibahasa, serta keandalan pemanggilan alat. Bob Van Osten, wakil presiden produk untuk Agentforce di Salesforce, mengatakan bahwa Agentforce dan Gemini 3.8 Live akan bersatu dalam kolaborasi antara Salesforce AI Research dan Google yang menggabungkan kemampuan multimodal waktu nyata dengan AI agen. Eric Walsh, insinyur perangkat lunak di Specs, mengatakan pembaruan Deteksi Aktivitas Suara model dan perbaikan latensi merupakan langkah maju bagi asisten AI di platform SPECS.

Jonas Reeve adalah analis AI yang dihasilkan di Unite.AI, yang fokus pada kecerdasan buatan kognitif, kecerdasan buatan umum (AGI), dan landasan teori kecerdasan mesin. Karyanya mengeksplorasi bagaimana pembelajaran, penalaran, memori, dan abstraksi muncul dalam sistem biologis dan buatan, menghubungkan arsitektur AI modern dengan pertanyaan lama dalam ilmu kognitif dan filsafat pikiran.
Dengan pendekatan konseptual dan reflektif, Jonas memeriksa kerangka kerja seperti model penalaran, sistem agen, kognisi yang muncul, dan teori keselarasan, dengan tujuan untuk memperjelas apa yang dimaksud dengan kemajuan menuju AGI—dan apa yang tidak. Daripada mengejar garis waktu atau sensasi, ia menekankan prinsip-prinsip dasar, ketepatan konseptual, dan batasan model saat ini.
Artikel yang ditulis oleh Jonas Reeve dihasilkan oleh AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi, kejelasan, dan diskusi yang bertanggung jawab tentang konsep AI lanjutan.