Wawancara

Dylan Fox, CEO & Pendiri AssemblyAI – Seri Wawancara

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Dylan Fox adalah CEO & Pendiri AssemblyAI, sebuah platform yang secara otomatis mengubah file audio dan video serta aliran audio langsung menjadi teks dengan API Speech-to-Text AssemblyAI.

Apa yang awalnya menarik Anda ke machine learning?

Saya memulai dengan belajar cara memprogram dan menghadiri Python Meetups di Washington DC, tempat saya bersekolah. Melalui kursus kuliah, saya menemukan diri saya lebih condong ke arah pemrograman algoritma, yang secara alami membawa saya ke machine learning dan NLP.

Sebelum mendirikan AssemblyAI, Anda adalah Insinyur Perangkat Lunak Senior di Cisco, apa yang Anda kerjakan?

Di Cisco, saya adalah Insinyur Perangkat Lunak Senior yang fokus pada Machine Learning untuk produk kolaborasi mereka.

Bagaimana pekerjaan Anda di Cisco dan masalah dengan teknologi pengenalan suara inspirasi Anda untuk meluncurkan AssemblyAI?

Dalam beberapa pekerjaan sebelumnya, saya memiliki kesempatan untuk bekerja pada banyak proyek AI, termasuk beberapa proyek yang memerlukan pengenalan suara. Namun, semua perusahaan yang menawarkan pengenalan suara sebagai layanan sangat ketinggalan zaman, sulit untuk membeli apa pun dari mereka, dan menggunakan teknologi AI yang sudah usang.

Ketika saya semakin tertarik dengan penelitian AI, saya menyadari bahwa ada banyak pekerjaan yang dilakukan dalam bidang pengenalan suara dan seberapa cepat penelitian itu diperbarui. Jadi, itu adalah kombinasi dari faktor-faktor yang membuat saya berpikir, “Bagaimana jika Anda bisa membangun perusahaan API gaya Twilio menggunakan penelitian AI terbaru yang jauh lebih mudah diakses oleh pengembang untuk model AI pengenalan suara, dengan pengalaman pengembang yang jauh lebih baik.”

Dan itu adalah dari sana bahwa ide untuk AssemblyAI tumbuh.

Apa tantangan terbesar di balik membangun teknologi pengenalan suara yang akurat dan dapat diandalkan?

Biaya dan talenta adalah tantangan terbesar bagi perusahaan untuk mengatasi ketika membangun teknologi pengenalan suara yang akurat dan dapat diandalkan.

Data sangat mahal untuk diperoleh, dan Anda biasanya memerlukan ratusan ribu jam untuk membangun sistem pengenalan suara yang kuat. Tidak hanya itu, persyaratan komputasi sangat besar untuk melatih. Dan menyajikan model ini dalam produksi juga mahal, dan memerlukan talenta khusus untuk mengoptimalkan dan membuatnya ekonomis.

Membangun teknologi ini juga memerlukan keterampilan khusus yang sulit ditemukan. Itulah alasan besar mengapa pelanggan datang kepada kami untuk model AI yang kuat yang kami teliti, latih, dan terapkan secara internal. Mereka mendapatkan akses ke tahun-tahun penelitian tentang model AI terbaru untuk ASR dan NLP, semua dengan API sederhana.

Di luar hanya menerjemahkan konten audio dan video, AssemblyAI menawarkan model tambahan, dapatkah Anda membahas apa model-model tersebut?

Suite model AI kami meluas di luar hanya transkripsi waktu nyata dan asynchronous. Kami menyebut model tambahan ini sebagai model Kecerdasan Audio karena mereka membantu pelanggan menganalisis dan memahami data audio dengan lebih baik.

Model Ringkasan kami menyediakan ringkasan keseluruhan, serta ringkasan yang dikodekan waktu yang secara otomatis membagi dan menghasilkan ringkasan untuk setiap “bab” ketika topik dalam percakapan berubah (mirip dengan bab YouTube).

Model Analisis Sentimen kami mendeteksi sentimen setiap kalimat ucapan dalam file audio. Setiap kalimat dalam transkrip dapat ditandai sebagai Positif, Negatif, atau Netral.

Model Deteksi Entitas kami mengidentifikasi berbagai entitas yang disebutkan dalam file audio, seperti nama orang atau perusahaan, alamat email, tanggal, dan lokasi.

Model Deteksi Topik kami melabeli topik yang dibicarakan dalam audio dan video. Label topik yang diprediksi mengikuti taksonomi IAB yang distandarkan, sehingga membuatnya cocok untuk penargetan kontekstual.

Model Moderasi Konten kami mendeteksi konten sensitif dalam file audio dan video — seperti ujaran kebencian, kekerasan, isu sosial sensitif, alkohol, narkoba, dan lain-lain.

Apa beberapa kasus penggunaan terbesar untuk perusahaan yang menggunakan AssemblyAI?

Kasus penggunaan terbesar bagi perusahaan yang menggunakan AssemblyAI mencakup empat kategori: teleponi, video, pertemuan virtual, dan media.

CallRail adalah contoh pelanggan yang baik di ruang Teleponi, yang menggunakan model AI AssemblyAI — Transkripsi Inti, Sorotan Transkrip Otomatis, dan PII Redaksi — untuk menyajikan solusi Kecerdasan Percakapan yang kuat kepada pelanggannya.

Intinya, CallRail sekarang dapat secara otomatis menampilkan dan mendefinisikan konten kunci dalam panggilan telepon mereka kepada pelanggannya dalam skala besar — konten kunci seperti permintaan pelanggan khusus, pertanyaan yang sering diajukan, dan kata kunci yang sering digunakan. Model PII Redaksi kami membantu mereka mendeteksi dan menghapus data sensitif yang ditemukan dalam teks transkrip (misalnya, nomor keamanan sosial, nomor kartu kredit, alamat pribadi, dan lain-lain).

Kasus penggunaan Video mencakup platform streaming video hingga editor video seperti Veed, yang menggunakan model Transkripsi Inti AssemblyAI untuk mempermudah proses editing video bagi pengguna. Veed memungkinkan penggunanya untuk menerjemahkan video mereka dan mengeditnya langsung menggunakan caption.

Dalam Pertemuan Virtual, perusahaan perangkat lunak transkripsi pertemuan seperti Fathom menggunakan AssemblyAI untuk membangun fitur cerdas yang membantu penggunanya menerjemahkan dan menyoroti momen kunci dari panggilan Zoom mereka, memfasilitasi keterlibatan pertemuan yang lebih baik dan menghilangkan tugas yang membosankan selama dan setelah pertemuan (misalnya, mengambil catatan).

Dalam Media, kita melihat platform hosting podcast, misalnya, menggunakan model Moderasi Konten dan Deteksi Topik kami sehingga mereka dapat menawarkan alat iklan yang lebih baik untuk kasus keamanan merek dan memonetisasi konten yang dihasilkan pengguna dengan iklan dinamis.

AssemblyAI baru-baru ini mengumpulkan dana $30M Seri B. Bagaimana ini akan mempercepat misi AssemblyAI?

Kemajuan yang dibuat dalam bidang AI sangat menggembirakan. Tujuan kami adalah untuk memperkenalkan kemajuan ini kepada setiap pengembang dan tim produk di internet — melalui set API sederhana. Ketika kami terus melakukan penelitian dan melatih model AI Terbaru untuk tugas ASR dan NLP (seperti pengenalan suara, ringkasan, identifikasi bahasa, dan banyak tugas lainnya), kami akan terus memperkenalkan model AI ini kepada pengembang dan tim produk melalui API sederhana — tersedia secara gratis.

AssemblyAI adalah tempat di mana pengembang dan tim produk dapat datang untuk mendapatkan akses mudah ke model AI canggih yang mereka butuhkan untuk membangun produk, layanan, dan perusahaan baru yang menarik.

Selama enam bulan terakhir, kami telah meluncurkan dukungan ASR untuk 15 bahasa baru—termasuk Spanyol, Jerman, Perancis, Italia, Hindi, dan Jepang, merilis perbaikan besar untuk model Ringkasan, model ASR Waktu Nyata, model Moderasi Konten, dan pembaruan produk tak terhitung.

Kami hampir tidak menggunakan dana Seri A, tetapi pendanaan baru ini akan memberi kami kemampuan untuk mempercepat upaya kami — tanpa mengompromikan jalur kami.

Dengan pendanaan baru ini, kami akan dapat mempercepat jalan produk kami, membangun infrastruktur AI yang lebih baik untuk mempercepat mesin penelitian dan inferensi AI kami, dan memperluas tim penelitian AI kami — yang saat ini termasuk peneliti dari DeepMind, Google (GOOGL ) Brain, Meta AI, BMW, dan Cisco.

Apakah ada yang lain yang ingin Anda bagikan tentang AssemblyAI?

Misi kami adalah untuk membuat model AI Terbaru tersedia untuk pengembang dan tim produk dalam skala besar melalui API sederhana.

Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut harus mengunjungi AssemblyAI.

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.