Wawancara
Thuy Le, Kepala Produk di Speechmatics – Seri Wawancara

Thuy Le adalah Kepala Produk di Speechmatics, Thuy memiliki lebih dari dua dekade pengalaman di teknologi dan mengembangkan ide-ide inovatif, serta gelar Sarjana Teknik Mesin dari MIT, dan gelar Magister Desain Produk dari Stanford. Thuy memiliki pengalaman yang luas di bidang manajemen produk, desain dan pengembangan, serta R&D, teknik, pengembangan media, dan strategi bisnis. Di Speechmatics, dia bertanggung jawab untuk meluncurkan produk dan layanan inovatif untuk memastikan bisnis tetap memimpin di pasar.
Anda bergabung dengan Speechmatics pada November 2019 setelah bekerja di berbagai industri, termasuk kendaraan swakemudi dan perangkat lunak analitik B2B. Apa yang menarik Anda untuk bekerja di pengenalan suara?
Saya selalu tertarik dengan penerapan teknologi baru untuk kasus penggunaan yang menarik dan dampak yang signifikan. Pengenalan suara, terutama di Speechmatics, memenuhi kriteria tersebut. Memang, sangat menyenangkan untuk membantu pelanggan kami memanfaatkan nilai dari teknologi suara-ke-teks dalam penawaran produk mereka.
Sebagai Kepala Produk di Speechmatics, apa yang menjadi bagian dari pekerjaan hariannya?
Speechmatics adalah perusahaan yang sedang berkembang, dan tim Produk kami kecil (dan sedang tumbuh!), sehingga tidak ada dua hari yang sama dan semua orang membantu di mana/menjadi perlu. Sebagai Kepala Produk, semua mulai dari strategi perusahaan dan produk tingkat tinggi hingga tugas-tugas produk biasa seperti prioritas jalan, interaksi pelanggan, dan pemecahan masalah rinci semua menjadi bagian dari pekerjaan. Tentu saja, membangun hubungan dengan berbagai fungsi di organisasi dan merekrut juga merupakan bagian penting dari peran.
Bisakah Anda membahas tantangan mengakses dataset dengan dialek dan aksen yang berbeda?
Dalam teknologi suara, mesin biasanya dibangun dengan pelatihan pada satu dialek bahasa, membuat dialek itu menjadi yang paling akurat dikenali dan ditranskrip. Dalam bahasa Inggris, itu adalah bahasa Inggris Amerika, dan tingkat kesalahan biasanya lebih tinggi untuk aksen Australia, aksen Inggris, aksen Jamaika, dan sebagainya. Jadi, bagi perusahaan yang menggunakan teknologi ini untuk berinteraksi dengan basis pelanggan global, ini menjadi tantangan besar. Tiga tahun yang lalu, pada 2018, kami meluncurkan Global English, paket bahasa terkemuka di industri yang memahami semua aksen dan dialek bahasa Inggris, dan tahun lalu, kami melanjutkan misi ini dengan meluncurkan Global Spanish. Kami percaya bahwa untuk teknologi suara mencapai potensi tertingginya, itu perlu memahami semua orang yang berinteraksi dengannya. Kami berharap dapat lebih mengurangi kesenjangan “aksen” dengan inovasi lain yang akan datang nanti tahun ini.
Apa metode pembelajaran mesin yang digunakan untuk melatih dataset tersebut?
Kami menggunakan teknik pembelajaran dalam yang sudah dikenal dan jaringan saraf dalam mesin kami. Kami juga terus melakukan penelitian pendekatan baru, terutama bagaimana mengurangi jumlah data yang diberi label yang diperlukan dalam model Pengenalan Suara. Data adalah raja ketika membangun teknologi pengenalan suara, sehingga penelitian yang memungkinkan kami untuk memperluas jangkauan data kami sangat penting. Penggunaan jaringan saraf dalam mesin kami memungkinkan kami untuk lebih baik menggeneralisasi konteks dan bahasa yang berbeda.
Speechmatics saat ini adalah pemimpin industri dengan pengujian menemukan bahwa Global Spanish 3-20% lebih akurat daripada penawaran Google (GOOGL ) dan 4-13% lebih akurat daripada produk Microsoft (MSFT ) yang setara. Apa yang Anda atribusikan kesuksesan ini?
Seperti yang saya sebutkan sebelumnya, untuk teknologi suara benar-benar menjadi aset bagi bisnis, itu perlu membantu mereka memahami basis pelanggan mereka secara keseluruhan, tidak peduli bahasa apa yang mereka gunakan atau dialek apa yang mereka gunakan. Ini adalah inti dari inovasi Speechmatics, dan kami berkomitmen untuk memecahkan tantangan kompleks ini. Dan, kami memiliki tim yang luar biasa yang bersemangat, terampil, dan berinvestasi dalam menggunakan teknik pembelajaran dalam terbaru untuk menawarkan pelanggan kami teknologi terbaik di pasar.
Apa bahasa yang saat ini ditawarkan dan bahasa apa yang sedang diteliti untuk ditambahkan?
Saat ini kami menawarkan lebih dari 30 bahasa komersial, dari Arab hingga Mandarin, Polandia hingga Portugis, dan banyak lagi. Tetapi itu adalah paket bahasa Inggris dan Spanyol kami yang Global. Menatap ke depan, kami sedang melihat teknik baru yang tidak hanya memungkinkan kami menambahkan bahasa baru lebih cepat tetapi juga memperbaiki bahasa yang ada secara teratur.
Apa pandangan Anda tentang masa depan yang diaktifkan suara di mana suara adalah bentuk komunikasi utama?
Perusahaan semakin melihat nilai dalam teknologi pengenalan suara: pada 2020, terdapat peningkatan yang signifikan dalam adopsi teknologi ini di antara perusahaan, dengan 68% responden melaporkan bahwa perusahaan mereka memiliki strategi teknologi suara — naik 18% dari tahun sebelumnya. Tetapi untuk mencapai potensi nilai maksimum, teknologi ini perlu ditingkatkan. Sebuah percakapan adalah tentang lebih dari sekadar kata-kata – itu juga terdiri dari petunjuk kontekstual seperti sentimen, irama, tanda baca, kebisingan latar, nada, perubahan pembicara, dan banyak lagi. Sementara teks dari teknologi pengenalan suara saja memungkinkan nilai yang signifikan, ketika datang ke file audio atau bahkan file video, suara yang sebenarnya yang direkam sekarang dapat melampaui sekadar kata-kata. Masa depan teknologi pengenalan suara akan mempertimbangkan semua faktor ini. Hanya kemudian akan itu tidak hanya tentang mengubah suara menjadi teks, tetapi mengubah suara menjadi nilai dan benar-benar memahami setiap suara.
Apakah ada yang ingin Anda bagikan tentang Speechmatics?
Kami memiliki beberapa kemajuan yang sangat menarik yang akan diluncurkan nanti tahun ini yang kami sangat senang untuk dibagikan, jadi tetaplah waspada!
Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut dapat mengunjungi Speechmatics.












