Pendanaan

Modulate Mengumpulkan $25 Juta untuk Membangun Lapisan Kecerdasan bagi Voice AI

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Modulate telah mengumpulkan $25 juta dalam pendanaan baru saat perusahaan berbasis Boston berupaya memanfaatkan tantangan yang berkembang dalam kecerdasan buatan: mengajarkan mesin untuk memahami tidak hanya apa yang orang katakan, tetapi juga bagaimana mereka mengatakannya.

Future Ventures memimpin putaran pendanaan, dengan partisipasi dari Hyperplane dan Lakestar. Pendanaan ini meningkatkan total pendanaan Modulate menjadi $60 juta dan akan digunakan untuk memperluas riset AI, tim teknik, alat pengembang, kemitraan, serta opsi penyebaran.

Investasi ini muncul seiring suara semakin menjadi antarmuka bagi agen AI, platform layanan pelanggan, lingkungan permainan, dan sistem keamanan. Meskipun teknologi speech-to-text telah meningkat secara dramatis, Modulate berpendapat bahwa transkrip saja mengabaikan banyak informasi yang terkandung dalam percakapan manusia.

Teknologi mereka justru menganalisis audio yang mendasari untuk sinyal seperti emosi, nada, niat, jeda, suara sintetis, dan perilaku percakapan.

Melampaui Speech-to-Text

Sebagian besar tumpukan voice AI saat ini mengikuti arsitektur yang relatif sederhana: mengubah suara menjadi teks dan kemudian mengirimkan transkrip yang dihasilkan ke model bahasa besar (LLM).

Pendekatan ini bekerja baik ketika kata‑kata itu sendiri mengandung sebagian besar informasi yang relevan. Namun menjadi lebih terbatas ketika makna bergantung pada sarkasme, frustrasi, keraguan, stres, interupsi, atau perubahan nada.

Modulate telah membangun platform unggulannya Velma di sekitar gagasan bahwa sinyal‑sinyal ini harus dianalisis langsung dari audio, bukan direkonstruksi kemudian dari transkrip.

Perusahaan menggambarkan Velma sebagai sistem intelijen percakapan berbasis audio yang mampu menghasilkan transkrip sambil secara bersamaan mengidentifikasi pembicara, emosi, topik percakapan, sentimen, dan lebih dari 150 perilaku. Pengembang juga dapat mendefinisikan perilaku khusus menggunakan deskripsi bahasa alami.

Hal ini membuka teknologi untuk berbagai aplikasi, mulai dari mengidentifikasi pelanggan yang frustrasi sebelum panggilan memburuk hingga mendeteksi perilaku mencurigakan selama transaksi keuangan atau mengenali ketika agen suara AI berperilaku tidak terduga.

Pada bulan Juni, Modulate membuka akses Velma secara langsung kepada pengembang melalui API, memperluas jangkauan di luar penerapan perusahaan sebelumnya.

Modulate Mengadopsi Pendekatan Ensemble untuk Audio AI

Arsitektur di bawah Velma adalah apa yang disebut Modulate sebagai Ensemble Listening Model, atau ELM.

Alih‑alih menggunakan satu model raksasa untuk melakukan semua tugas, ELM mengoordinasikan lebih dari 100 model khusus, dengan komponen individual yang menganalisis berbagai karakteristik aliran audio.

Model‑model tersebut dapat memeriksa properti dasar seperti pergantian pembicara dan jeda bersama sinyal tingkat tinggi seperti emosi, niat yang dipersepsikan, penanda suara sintetis, kebingungan, atau pola perilaku. Lapisan orkestrasi kemudian menggabungkan pengamatan tersebut menjadi interpretasi yang lebih luas dari percakapan.

Ini merupakan filosofi yang sangat berbeda dari strategi yang semakin umum, yaitu menerapkan model fondasi multimodal yang semakin besar pada audio.

Modulate berargumen bahwa spesialisasi memungkinkan arsitekturnya menghasilkan output yang lebih transparan sekaligus mengurangi jumlah komputasi yang diperlukan. Untuk aplikasi perusahaan seperti deteksi penipuan dan kepatuhan, kemampuan memahami mengapa sebuah sistem mengeluarkan peringatan dapat hampir sama pentingnya dengan peringatan itu sendiri.

Menurut perusahaan, pendekatan ini dapat menjadi hingga 1.000 kali lebih efisien secara komputasi dibandingkan menggunakan satu model besar untuk beberapa beban kerja analisis audio.

Voice AI Menimbulkan Masalah Pemantauan Baru

Waktu pendanaan ini juga mencerminkan pergeseran yang lebih luas yang terjadi di seluruh AI perusahaan.

Sistem AI semakin mampu melakukan percakapan suara lengkap dengan pelanggan. Itu berarti perusahaan kini harus memantau interaksi yang melibatkan tidak hanya karyawan manusia, tetapi juga agen otonom yang beroperasi di ribuan atau bahkan jutaan percakapan.

Sebuah agen suara secara teknis mungkin mengikuti skrip namun tetap berulang kali menginterupsi pelanggan, gagal mengenali frustrasi, salah memahami niat, atau merespons secara buruk pada situasi emosional.

Modulate melihat peluang untuk menjadi lapisan pendengaran independen yang berada di samping agen‑agen tersebut.

Teknologi agen suara mereka dirancang untuk mengidentifikasi sinyal seperti interupsi, jeda, emosi, aksen, dan karakteristik lain yang sulit ditangkap hanya dari teks, memungkinkan pengembang menyesuaikan perilaku agen saat percakapan masih berlangsung.

Infrastruktur yang sama dapat diterapkan pada percakapan manusia di mana organisasi perlu mengidentifikasi penipuan, risiko kepatuhan, pelecehan, atau peristiwa signifikan lainnya secara real time.

Dari Moderasi Gaming ke Intelijen Suara yang Lebih Luas

Ambisi Modulate saat ini mewakili perluasan signifikan dari fokusnya sebelumnya pada game daring.

Salah satu produk paling dikenal, ToxMod, dikembangkan untuk menganalisis komunikasi suara langsung di platform game dan sosial serta mengidentifikasi pelecehan, ancaman, grooming, dan perilaku berbahaya lainnya.

Itu tetap menjadi bagian penting dari bisnis. Modulate mengatakan ToxMod dapat terintegrasi langsung dengan infrastruktur suara yang ada sambil mengarahkan interaksi yang berpotensi bermasalah ke sistem moderasi atau peninjau manusia.

Perusahaan telah bekerja dengan perusahaan game besar termasuk Activision, Riot Games, Rockstar Games, dan Rec Room.

Namun teknologi dasar yang diperlukan untuk memahami toksisitas dalam game multipemain juga dapat disesuaikan untuk lingkungan lain di mana konteks penting.

Modulate kini menempatkan teknologinya di bidang pencegahan penipuan, pusat kontak, pengawasan agen AI, deteksi deepfake, pengalaman pelanggan, serta kepercayaan dan keamanan.

Platform pengembangnya saat ini menawarkan beberapa keluarga model yang mencakup transkripsi, deteksi deepfake, penyensoran audio, intelijen percakapan, dan kemampuan analisis audio lainnya.

Deepfake Menambah Alasan Lain untuk Memahami Audio Secara Langsung

Synthetic speech menjadi bagian penting lain dari peluang tersebut.

Seiring kloning suara yang semakin meyakinkan tersedia, organisasi yang menangani transaksi keuangan atau informasi sensitif perlu menentukan tidak hanya apa yang dikatakan penelepon, tetapi apakah suara itu sendiri autentik.

Modulate akibatnya memperluas ke deteksi deepfake, menggabungkan analisis suara sintetis dengan informasi kontekstual yang lebih luas tersedia melalui model audio mereka.

Perusahaan mengatakan teknologinya saat ini menganalisis lebih dari 10 juta jam audio per bulan dan telah memproses lebih dari 600 juta jam secara keseluruhan.

Perluasannya ke bidang seperti deteksi musik yang dihasilkan AI juga menggambarkan seberapa luas arsitektur ansambel dasar dapat diterapkan. Sistem deteksi musik Modulate, misalnya, secara terpisah mengevaluasi keberadaan musik, vokal yang dihasilkan AI, dan instrumentasi yang dihasilkan AI sebelum menggabungkan sinyal menjadi hasil yang dapat diinterpretasikan.

Tantangan Selanjutnya untuk Voice AI adalah Memahami, Bukan Berbicara

Investasi $25 juta memberikan Modulate sumber daya tambahan untuk memperluas riset, rekayasa, alat pengembang, dan kemitraan. Secara lebih luas, ini mencerminkan tantangan yang berkembang bagi voice AI: berbicara secara alami hanyalah setengah dari percakapan.

Saat agen suara masuk ke layanan pelanggan, perawatan kesehatan, layanan keuangan, dan bidang lainnya, sistem akan perlu memahami sinyal yang sering terlewatkan oleh transkrip, termasuk frustrasi, keraguan, penekanan, nada, dan kemungkinan suara sintetis.

Hal itu dapat menciptakan lapisan intelijen baru di sekitar interaksi suara, membantu sistem mendeteksi penipuan, mengenali ketika pelanggan tidak puas, atau mengidentifikasi ketika agen AI salah memahami atau menangani percakapan.

Namun teknologi ini juga menimbulkan pertanyaan tentang privasi, akurasi, dan bias. Menafsirkan emosi atau niat dari suara lebih subjektif daripada menyalin kata, terutama di berbagai aksen, bahasa, dan budaya.

Seiring AI semakin mampu berbicara seperti manusia, frontier berikutnya mungkin adalah menentukan seberapa baik mesin benar-benar mendengarkan—dan seberapa bertanggung jawab penggunaan kemampuan tersebut.

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.