Інтерв’ю
Хайме Бош, генеральний директор Voicemod – Інтерв’ю серія

Хайме Бош – генеральний директор Voicemod – безкоштовного програмного забезпечення для зміни голосу для геймерів, творців контенту та втуберів.
Чи можете ви поділитися історією створення Voicemod?
Як восьма з десяти дітей, я виріс у середовищі, де міг повністю розгорнути свій підприємницький дух з дуже раннього віку, оскільки завжди був підтримкою з боку однодумців братів і сестер.
Отже, було тільки питання часу, коли два моїх братів і я, всі ми поділяли глибоку любов до технологій і музики, почали експериментувати з ідеєю створення додатка, який поєднував наші інтереси. Тому в 2009 році ми створили B2C-додаток для музики як побічний проєкт до студійного бізнесу, яким ми займалися як основною діяльністю.
Оскільки це був побічний проєкт, ми багато експериментували з такими речами, як модуляція голосу, що надихнуло нас створити щось зовсім нове і оригінальне. Результатом цього став те, що ми назвали “Voicemod Experience” – зовсім новий спосіб переживання свого власного голосу – який став рушійною силою еволюції додатка. Незалежно від того, хто пробував наше програмне забезпечення, ми постійно зустрічали однакові реакції від людей, які переживали додаток: сміх і здивування від того, що чули себе зовсім інакше.
Це змусило нас переосмислити нашу бачення продукту, перетворивши його на щось, що може в кінцевому підсумку розвивати людські зв’язки через звук. Тому ми перенесли досвід з мобільних пристроїв на ПК, де він був миттєво прийнятий вибуховим ігровим і стрімінговим сценарієм – і все інше, як кажуть, “історія”.
Voicemod спочатку був побічним проєктом – коли ви зрозуміли, що хочете повністю зайнятися ним?
Спочатку мої брати і я мали студію разом під назвою 2taptap. Коли ми придумали ідею створити Voicemod, спочатку це був просто веселий побічний проєкт, але з часом ми побачили, як люди взаємодіють з ним, і який потенціал мала технологія. До того часу більшість технологій зміни голосу були асинхронними, тому можливість пережити себе інакше в реальному часі була новою для багатьох людей. Визначальним моментом для нас став розуміння того, що люди використовують нашу технологію не тільки для розваги, а й для формування свого цілого способу вираження себе в Інтернеті. Це було тоді, коли ми зрозуміли, що ми будемо створювати щось, що не тільки про розвагу, а й про майбутнє соціальних аудіо-досвідів.
Чи можете ви обговорити деякі технології розпізнавання голосу?
З нашим набором змінювачів голосу існує ряд процесів, які проходять для перетворення звичайного людського голосу на щось нове. Очевидно, існують також аспекти в голосі людини, які потрібно враховувати, такі як вік, стать, емоції та прості варіації того, як людина говорить.
Ці варіації впливають на те, як людина може звучати, і на зміни, які застосовуються. Ми використовуємо елементи з технологій розпізнавання голосу, щоб забезпечити перетворення і трансформацію голосу якомога точно – і постійно покращуємо цей процес. Ми хочемо дати людям можливість структурувати, як вони сприймаються, звучати так, як вони хочуть бути почутими, і забезпечити хорошу слухову досвід для їхньої аудиторії.
Чому важливо допомогти людям виражати себе через звук?
Від моменту нашого народження і першого крику дитини, звук – це природний спосіб, яким ми вчимося виражати себе. Коли ми дорослішаємо, важливість аудіо-комунікації продовжує зростати, оскільки ми вчимося формувати звук у мову і використовувати свій голос, щоб додати емоції і нюанси до слів, які ми говоримо. Змінивши висоту свого голосу, ми можемо сигналізувати про збудження – або використовувати звукові ефекти, такі як зітхання або стогони, щоб додати особливий акцент на моменти, які ми хочемо зробити.
Для деяких талановитих людей голос – це інструмент для необмеженого вираження – оскільки вони можуть створити необмежену кількість звукових ефектів або голосів. Більшість з нас, однак, не так щасливі і фактично відчувають незручність зі своїм голосом (особливо коли ми чуємо його записаний). Деякі з наших користувачів говорять про те, що вони відчувають нервозність, коли говорять перед незнайомцями, і розчаровуються в тому, що не можуть належним чином виражати себе так, як вони хотіли б.
Це місце, де ми бачимо величезну можливість допомогти людям. З нашими голосовими ідентичностями користувачі можуть сформувати свій голос так, щоб він був тим, з чим вони відчувають себе комфортно – або навіть перейти в різні голоси для конкретних ситуацій. Ми також хочемо наділити їх можливістю використовувати звукові ефекти, музичні кліпи або аудіо-емоджі, щоб створити атмосферу, передати контекст або реалізувати комічні ефекти – подібно до того, як графічні емоджі допомогли сформувати текстову комунікацію.
Ви описали Voicemod як розвиток людських зв’язків через звук, чи можете ви розповісти про це?
Окрім звільнення спікера і видалення певного психологічного блоку, який зупиняє людей від говоріння, ми також працюємо над тим, щоб зробити цей зв’язок глибшим. Наприклад, наш звуковий дошку бере комунікацію і піднімає її на наступний рівень – подумайте про це як “аудіо-емоджі”. Чи можете ви уявити собі людей молодше 35 років, які спілкуються без використання емоджі? Хоча ця технологія існує вже досить давно, вона фактично стала глибоко вкоріненою в нашій комунікації лише з 2010 року. Ми побачили подібну тенденцію зі стікерами на платформах обміну повідомленнями, зростанням голосової пошти і голосових нотаток, а тепер з появою ГІФок і Giphy. З масштабуванням світових аудіо-комунікацій важливість того, як ми використовуємо звук, зростає. Надсилання аудіо-реакції на жарт друга може розповісти набагато більше про вашу справжню, чесну реакцію, ніж просто написання речення. Подумайте про різницю між звуком цвіркунів і ба дам тс! Все це несе зовсім різні значення і сентименти, які ви можете легко передати всього лише кліком.
Ми хочемо зробити так, щоб користувачі могли використовувати голоси, голосові ефекти і аудіо-емоджі, щоб мати більш привабливі аудіо-розмови з друзями, сім’єю або незнайомцями.
Які деякі з машинних технологій, що стоять за додатком Voicemod, включаючи можливість користувачам звучати краще і налаштовувати свій голос навколо свого реального голосу?
Машинне навчання лежить в основі більшості нових функцій Voicemod.
Що стосується творчої сторони, Voicelab Voicemod створив першу в реальному часі технологію перетворення голосу на ринку, яка дозволить користувачам вибрати свою власну сонічну ідентичність, створюючи персональні голоси для кожного.
З нашою новою, просунутою технологією, яка буде випущена скоро, ми створюємо ніколи не чуті голоси з унікальними характеристиками, які допоможуть захистити приватність і безпеку користувачів, а також дадуть їм можливість створити бажану особистість через звук.
Ми також спостерігали появу даних методологій глибокого навчання в останні роки. Це дозволяє нам вивчити абстрактні приховані структури в сигналах мови, що стосуються перцептивних характеристик голосу, таких як фонологія, зміст, ідентичність, намір і настрій. Використовуючи ці технології, ми можемо контролювати і змінювати перцептивні аспекти сигналу. Це дозволяє нам розробляти технології, які дають користувачам більше контролю над своїми сприйманими голосовими ідентичностями таким чином, який раніше був неможливий.
Які деякі з випадків використання додатка Voicemod?
Відмінна річ про Voicemod полягає в тому, що його інструменти обслуговують широкий спектр потреб і сценаріїв. Більш поширені ситуації будуть для створення контенту, гри з друзями, спілкування з сім’єю або друзями, створення іммерсивних рольових середовищ або навіть для роботи та бізнесу – де користувачі в основному використовують наші інструменти видалення шуму і аудіо-підсилювання.
Чи можете ви обговорити деякі з викликів і переваг запуску стартапу з братами?
Щиро кажучи, я хотів би, і я знаю, що, звичайно, кожен зустрічає виклики якимось чином, але я фактично не пам’ятаю багатьох у нашому випадку. Причина полягає в тому, що ми походимо з дуже великої сім’ї. Ми завжди робили щось разом, від дитячих проєктів до гри на музиці і створенні. Це було тільки природно, що ми в кінцевому підсумку будемо працювати разом. Мої брати Фернандо і Хуан – які, як я згадував, стали співзасновниками Voicemod разом зі мною – вже мали кілька компаній разом, тому у них був достатній досвід у цьому відношенні. Я приєднався до них у 2010 році в їхній компанії, яка була 2taptap, тому я отримав відчуття цього. Це означає, що коли ми створили Voicemod, ми зробили це повністю вирівняні з тим, чого ми хочемо досягти, і ще важливіше – як ми хочемо досягти цього. Отже, це допомогло принести дуже сильну культуру вирівняних цінностей у Voicemod, яка була справжнім ключем до нашого успіху.
Чи є щось інше, про що ви хотіли б розповісти про Voicemod?
Є багато чого відбувається за лаштунками, але у відповідь на нашу бажання розвивати звук для усіх, ми зараз працюємо над чимось, щоб зробити нашу технологію ще більш… доступною. Шляхом для будь-якого розробника використовувати нашу технологію в своєму продукті
Ми знаємо, що люди проводять більшу частину свого часу, будучи онлайн, підключеними, виражаючи себе на різних платформах і додатках. У онлайн-середовищі ваш “аватар” – це все ваше самопредставлення. І хто ж ця людина без голосу?
Створення технології зміни голосу в реальному часі і розробка системи повністю настраїваних звукових виразів – це багато роботи. Наша команда зробила крок поза рамками цього рівня, розробивши цілий комплект, який можна легко інтегрувати розробниками будь-де. Ми дуже раді зробити нашу технологію доступною розробникам і користувачам усього світу, оскільки ми продовжимо будувати майбутнє соціальних аудіо-досвідів!
Дякую за велике інтерв’ю, читачам, які хочуть дізнатися більше, рекомендуємо відвідати Voicemod.












