Wawancara
Jaime Bosch, CEO, Voicemod – Seri Wawancara

Jaime Bosch adalah CEO dari Voicemod sebuah perangkat lunak pengubah suara gratis untuk gamer, pembuat konten, dan vtuber.
Apakah Anda bisa berbagi cerita tentang asal-usul Voicemod?
Sebagai anak ke-8 dari 10 bersaudara, saya tumbuh dalam lingkungan yang memungkinkan saya untuk mengembangkan semangat wirausaha sejak usia dini, karena ada dukungan dari saudara-saudara yang memiliki pikiran yang sama.
Sehingga, tidak butuh waktu lama bagi saya dan dua saudara laki-laki saya, yang semua memiliki minat yang sama dalam teknologi dan musik, untuk memainkan ide membuat aplikasi yang menggabungkan minat kita. Jadi, pada tahun 2009, kita melakukannya dan membuat aplikasi musik B2C sebagai sampingan untuk bisnis studio yang kita jalankan sebagai pekerjaan utama.
Sebagai proyek sampingan, kita banyak bereksperimen dengan hal-hal seperti modulasi suara, yang menginspirasi kita untuk membuat sesuatu yang benar-benar baru dan inovatif. Hasilnya adalah apa yang kita sebut “Pengalaman Voicemod” – cara baru untuk mengalami suara Anda sendiri – yang menjadi kekuatan pendorong evolusi aplikasi. Tidak peduli siapa yang mencoba perangkat lunak kita, kita terus menemukan reaksi yang sama dari orang-orang yang mengalami aplikasi: tawa dan kekaguman ketika mendengar diri sendiri dengan cara yang benar-benar berbeda.
Hal ini menyebabkan kita untuk mengubah visi kita untuk produk, menjadi sesuatu yang dapat pada akhirnya mengembangkan koneksi manusia melalui medium suara. Jadi kita membawa pengalaman dari mobile ke PC, di mana ia segera dipilih oleh adegan gaming dan streaming yang meledak – dan selebihnya, seperti yang dikatakan, “sejarah”.
Voicemod awalnya adalah proyek sampingan — kapan Anda menyadari bahwa Anda ingin sepenuhnya terlibat?
Awalnya, saya dan saudara-saudara saya memiliki studio bersama yang disebut 2taptap. Ketika kita datang dengan ide untuk membuat Voicemod, awalnya hanya proyek sampingan yang menyenangkan, tetapi seiring waktu, kita melihat bagaimana orang berinteraksi dengannya dan potensi teknologi yang dimilikinya. Sampai saat itu, sebagian besar teknologi pengubah suara adalah asinkron, sehingga dapat mengalami menjadi orang lain dalam pengaturan waktu nyata adalah hal yang baru bagi banyak orang. Momentum yang menentukan bagi kita, bagaimanapun, adalah kesadaran bahwa orang menggunakan teknologi kita untuk tidak hanya bersenang-senang, tetapi untuk membentuk cara mereka mengekspresikan diri secara online. Ini adalah saat kita menyadari bahwa kita sedang membangun sesuatu yang tidak hanya tentang hiburan, tetapi mungkin langkah berikutnya dalam evolusi pengalaman audio sosial.
Apakah Anda bisa membahas beberapa teknologi pengenalan suara?
Dengan berbagai pengubah suara dalam katalog kita, ada proses yang dilakukan untuk mengambil suara manusia biasa dan mengubahnya menjadi sesuatu yang baru. Tentu saja, ada juga aspek dalam suara seseorang yang harus diperhitungkan seperti usia, jenis kelamin, emosi, dan variasi sederhana dalam cara berbicara.
Varian ini menyumbang bagaimana seseorang mungkin terdengar dan mempengaruhi perubahan yang diterapkan. Kita menggunakan elemen-elemen dari teknologi pengenalan suara mutakhir untuk memfasilitasi konversi suara dan transformasi seakurat mungkin — dan terus memperbaiki proses ini. Kita ingin memberi orang kesempatan untuk membentuk bagaimana mereka dipersepsikan, terdengar seperti yang mereka inginkan, dan memberikan pengalaman mendengar yang baik bagi audiens mereka.
Mengapa penting untuk membantu orang mengekspresikan diri melalui suara?
Sejak kita lahir dan bayi pertama kali menangis, suara adalah cara alami yang kita gunakan untuk mengekspresikan diri. Seiring kita bertumbuh, pentingnya komunikasi audio terus berkembang, karena kita belajar membentuk suara menjadi bahasa dan menggunakan suara kita untuk menambahkan emosi dan nuansa pada kata-kata yang kita ucapkan. Dengan meningkatkan nada suara kita, kita dapat menandakan kegembiraan – atau menggunakan efek suara seperti tanda tangis atau keluhan untuk menekankan poin-poin yang ingin kita buat.
Bagi beberapa orang yang sangat berbakat, suara adalah instrumen untuk ekspresi tak terbatas – karena mereka dapat menciptakan efek suara atau suara yang tak terbatas. Kebanyakan dari kita, bagaimanapun, tidak seberuntung itu dan sebenarnya merasa tidak nyaman dengan suara kita (terutama ketika kita mendengarnya direkam). Beberapa pengguna kita berbicara tentang merasa gugup ketika berbicara di depan orang asing dan merasa frustrasi karena tidak dapat mengekspresikan diri dengan cara yang mereka inginkan.
Ini adalah tempat kita melihat kesempatan besar untuk membantu orang. Dengan identitas suara kita, pengguna dapat membentuk suara mereka menjadi sesuatu yang mereka rasakan nyaman – atau bahkan berganti-ganti suara untuk situasi tertentu. Kita juga ingin memberdayakan mereka untuk menggunakan efek suara, klip musik, atau emoji audio untuk menciptakan suasana, mengungkapkan konteks atau menerapkan efek komedi – serupa dengan cara emoji grafis telah membentuk komunikasi teks.
Anda telah menjelaskan Voicemod sebagai evolusi koneksi manusia melalui suara, bisa Anda jelaskan lebih lanjut?
Di samping melepaskan pembicara dan menghilangkan blok mental yang menghentikan orang dari berbicara, kita juga bekerja untuk membuat koneksi ini lebih dalam. Misalnya, soundboard kita mengambil komunikasi dan meningkatkannya ke tingkat berikutnya — pikirkan ini sebagai “emoji audio”. Apakah Anda bisa membayangkan orang di bawah 35 tahun berbicara tanpa menggunakan emoji? Sementara teknologi ini telah ada selama yang terasa seperti usia sekarang, sebenarnya baru-baru ini menjadi sangat terintegrasi dalam komunikasi kita sejak sekitar 2010. Kita melihat tren serupa dengan stiker pada platform messaging, munculnya pesan suara dan catatan suara, dan sekarang penggunaan GIF dan Giphy yang sedang berkembang. Dengan skala komunikasi audio global, pentingnya cara kita menggunakan suara meningkat. Mengirim reaksi audio terhadap lelucon teman Anda dapat mengatakan banyak lebih tentang reaksi jujur Anda daripada hanya mengetik kalimat. Bayangkan perbedaan antara mendengar suara jangkrik dan ba dum tss! Mereka semua memiliki makna dan sentimen yang sangat berbeda yang dapat Anda komunikasikan dengan hanya satu klik.
Kita ingin membuatnya semudah mungkin bagi pengguna untuk menggunakan suara, efek suara, dan emoji audio untuk memiliki percakapan audio yang lebih menarik dengan teman, keluarga, atau orang asing.
Apa beberapa teknologi pembelajaran mesin di balik aplikasi Voicemod, termasuk memungkinkan pengguna untuk terdengar lebih baik dan menyesuaikan suara mereka berdasarkan suara asli mereka?
Pembelajaran mesin ada di jantung sebagian besar fitur Voicemod baru.
Menyangkut sisi kreatif, Voicelab Voicemod telah menciptakan teknologi konversi suara waktu nyata pertama di pasar yang akan memungkinkan pengguna untuk memilih identitas suara mereka sendiri, membuat suara pribadi untuk setiap orang.
Dengan teknologi canggih baru yang akan segera dirilis, kita menciptakan suara yang belum pernah terdengar sebelumnya dengan karakteristik unik yang akan membantu melindungi privasi dan keamanan pengguna, sambil juga memungkinkan mereka untuk menciptakan kepribadian yang diinginkan melalui suara.
Kita telah mengamati metodologi pembelajaran mesin berbasis data muncul dalam beberapa tahun terakhir. Ini memungkinkan kita untuk mempelajari struktur tersembunyi abstrak dalam sinyal suara yang berkaitan dengan karakteristik perseptual suara seperti fonologi, konten, identitas, niat, dan mood. Dengan menggunakan teknologi ini, kita dapat mengontrol dan memodifikasi aspek perseptual sinyal. Ini memungkinkan kita untuk merancang teknologi yang memberi pengguna lebih banyak kontrol atas identitas suara yang dipersepsikan dengan cara yang tidak mungkin sebelumnya.
Apa beberapa kasus penggunaan untuk aplikasi Voicemod?
Hal yang hebat tentang Voicemod adalah bahwa alatnya melayani berbagai kebutuhan dan skenario. Situasi yang lebih umum akan untuk pembuatan konten, bermain game dengan teman, berbicara dengan keluarga atau teman, membuat lingkungan peran yang imersif, atau bahkan untuk pekerjaan dan bisnis – di mana pengguna terutama menggunakan alat penghapusan noise dan peningkatan audio kita.
Apakah Anda bisa membahas beberapa tantangan dan manfaat meluncurkan startup dengan saudara?
Jujur, saya ingin, dan saya tahu bahwa tentu saja semua orang menghadapi tantangan dalam beberapa cara, tetapi saya sebenarnya tidak bisa mengingat banyak dalam kasus kita. Alasannya adalah, kita berasal dari keluarga yang sangat besar. Kita selalu melakukan sesuatu bersama, dari proyek masa kecil hingga bermain musik dan menciptakan. Ini hanya alami bahwa kita akan bekerja sama. Saudara-saudara saya, Fernando dan Juan — yang seperti yang saya sebutkan sebelumnya, mendirikan Voicemod bersama saya — sudah memiliki beberapa perusahaan bersama, sehingga mereka memiliki banyak pengalaman dalam hal itu. Saya bergabung dengan mereka pada tahun 2010 di perusahaan mereka, yang disebut 2taptap, sehingga saya mendapatkan perasaan tentang itu juga. Ini berarti ketika kita menciptakan Voicemod, kita melakukannya sepenuhnya selaras dengan apa yang kita ingin capai dan, lebih penting lagi, bagaimana kita ingin mencapainya. Sehingga, ini telah membantu membawa budaya nilai yang sangat kuat ke Voicemod, yang telah menjadi kunci keberhasilan kita.
Apakah ada yang lain yang Anda ingin bagikan tentang Voicemod?
Ada banyak hal yang terjadi di balik layar, tetapi sejalan dengan keinginan kita untuk mengembangkan suara untuk semua orang, kita saat ini bekerja pada sesuatu untuk membuat teknologi kita lebih… dapat diakses. Cara bagi pengembang mana pun untuk menggunakan teknologi kita dalam produk mereka
Kita tahu bahwa orang menghabiskan sebagian besar waktu mereka di dunia maya, terhubung, mengekspresikan diri di berbagai platform dan aplikasi. Dalam lingkungan online, “avatar” Anda adalah representasi diri Anda secara keseluruhan. Dan, siapa itu orang tanpa suara?
Membangun teknologi pengubah suara waktu nyata dan mengembangkan sistem ekspresi suara yang sepenuhnya dapat disesuaikan adalah pekerjaan yang banyak. Tim kita telah mengambil langkah itu dengan merancang kit lengkap yang dapat dengan mudah diintegrasikan oleh pengembang di mana saja. Kita sangat bersemangat untuk membuat teknologi kita dapat diakses oleh pengembang dan pengguna di seluruh dunia, karena kita terus membangun masa depan pengalaman audio sosial!
Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut harus mengunjungi Voicemod.












