Интервью
Хайме Бош, генеральный директор Voicemod – Интервью

Хайме Бош – генеральный директор Voicemod, бесплатного программного обеспечения для изменения голоса для геймеров, создателей контента и виртуальных ютуберов.
Не могли бы вы рассказать историю создания Voicemod?
Как восьмой из десяти детей, я вырос в среде, где я мог полностью раскрыть свой предпринимательский дух с очень раннего возраста, поскольку всегда было поддержка со стороны братьев и сестер, разделяющих подобные интересы.
Таким образом, было только вопросом времени, когда два моих брата и я, все мы разделяющие глубокую любовь к технологиям и музыке, начали экспериментировать с идеей создания приложения, объединяющего наши интересы. Итак, в 2009 году мы создали музыкальное приложение B2C как побочный проект к студийному бизнесу, который мы вели как наш основной источник дохода.
Поскольку это был побочный проект, мы много экспериментировали с такими вещами, как модуляция голоса, что вдохновило нас создать что-то совершенно новое и оригинальное. Результатом этого стала то, что мы назвали “Опытом Voicemod” – совершенно новым способом переживания своего собственного голоса – который стал движущей силой эволюции приложения. Независимо от того, кто пробовал наше программное обеспечение, мы постоянно сталкивались с одинаковыми реакциями от людей, которые испытывали наше приложение: смех и удивление от того, что слышали себя совершенно по-разному.
Это привело нас к переосмыслению нашей видения продукта в нечто, что в конечном итоге может эволюционировать человеческую связь через звук. Итак, мы перенесли опыт с мобильных устройств на ПК, где он был сразу же принят взрывной игровой и стриминговой сценой – и все остальное, как говорится, “история”.
Voicemod изначально был побочным проектом — когда вы поняли, что хотите полностью посвятить себя этому?
Первоначально мои братья и я имели студию вместе под названием 2taptap. Когда мы придумали идею создания Voicemod, это было изначально просто интересным побочным проектом, но со временем мы увидели, как люди взаимодействовали с ним и какой потенциал имела эта технология. До того момента большинство технологий изменения голоса были асинхронными, поэтому возможность испытать себя кем-то другим в реальном времени была новой для многих людей. Определяющим моментом для нас стало осознание того, что люди используют нашу технологию не только для развлечения, но и для формирования своего整个 способа выражения себя в Интернете. Это было то время, когда мы поняли, что мы строим нечто, что не только о развлечении, но и, возможно, о следующем шаге в будущем социальных аудио-опытов.
Не могли бы вы обсудить некоторые технологии распознавания голоса?
С учетом диапазона изменителей голоса в нашем каталоге, существуют процессы, которые проходят для преобразования обычного человеческого голоса в нечто новое. Конечно, есть также аспекты в голосе, которые необходимо учитывать, такие как возраст, пол, эмоции и простые вариации в том, как кто-то говорит.
Эти вариации способствуют тому, как кто-то может звучать и влияют на изменения, которые применяются. Мы используем элементы передовой технологии распознавания голоса для облегчения преобразования и трансформации голоса как можно более точно — и постоянно улучшаем этот процесс. Мы хотим дать людям возможность структурировать, как они воспринимаются, звучать так, как они хотят быть услышанными, и обеспечить отличный опыт прослушивания для их аудитории.
Почему важно помочь людям выражать себя через звук?
С момента рождения и первого крика ребенка звук является естественным способом, через который мы учимся выражать себя. Когда мы взрослеем, важность аудио-коммуникации продолжает расти, поскольку мы учимся формировать звук в язык и использовать наш голос для передачи эмоций и нюансов в словах, которые мы произносим. Поднимая тон нашего голоса, мы можем сигнализировать о волнении – или использовать звуковые эффекты, такие как вздохи или стоны, чтобы подчеркнуть определенные моменты, которые мы хотим сделать.
Для некоторых действительно талантливых людей голос является инструментом для неограниченного выражения – поскольку они могут создавать неограниченное количество звуковых эффектов или голосов. Большинство из нас, однако, не так удачливы и фактически чувствуют себя неуютно со своим голосом (особенно когда мы слышим его записанным). Некоторые из наших пользователей говорят о том, что они чувствуют нервозность, когда говорят перед незнакомцами, и разочаровываются в том, что не могут должным образом выражать себя так, как они хотели бы.
Именно здесь мы видим огромную возможность помочь людям. С нашими голосовыми идентификаторами пользователи могут формировать свой голос так, чтобы он был чем-то, с чем они чувствуют себя комфортно – или даже надевать разные голоса для конкретных ситуаций. Мы также хотим дать им возможность использовать звуковые эффекты, музыкальные клипы или аудио-эмоции, чтобы создать атмосферу, передать контекст или реализовать комические эффекты – подобно тому, как графические эмоции помогли сформировать текстовую коммуникацию.
Вы описали Voicemod как эволюционирующую человеческую связь через звук, могли бы вы подробнее рассказать об этом?
Помимо освобождения говорящего и удаления определенного психологического барьера, который останавливает людей от говорения, мы также работаем над тем, чтобы сделать эту связь более глубокой. Например, наша звуковая доска берет коммуникацию и возводит ее на следующий уровень — подумайте об этом как об “аудио-эмоции”. Можете ли вы представить людей моложе 35 лет, которые общаются без использования эмоций? Хотя эта технология существует уже то, что feels как вечность, она действительно стала глубоко укоренившейся в нашей коммуникации только с 2010 года. Мы увидели подобную тенденцию со стикерами на платформах обмена сообщениями, ростом голосовых сообщений и голосовых заметок, и теперь появлением использования GIF и Giphy. С масштабированием мировых аудио-коммуникаций важность того, как мы используем звук, увеличивается. Отправка аудио-реакции на шутку друга может рассказать намного больше о вашей сырой, честной реакции, чем просто набранное предложение. Представьте себе разницу между звуком сверчков и ба дум тсс! Все они несут совершенно разные значения и настроения, которые вы можете легко передать всего лишь одним кликом.
Мы хотим сделать так, чтобы было как можно проще для пользователей использовать голоса, голосовые эффекты и аудио-эмоции, чтобы иметь более увлекательные аудио-разговоры с друзьями, семьей или незнакомцами.
Какие из машинных технологий стоят за приложением Voicemod, включая возможность пользователям звучать лучше и настраивать свой голос на основе своего реального голоса?
Машинное обучение находится в основе большинства новых функций Voicemod.
Что касается творческой стороны, Voicelab Voicemod создал первую технологию преобразования голоса в реальном времени на рынке, которая позволит пользователям выбрать свою собственную звуковую идентичность, создавая персональные голоса для каждого.
С нашей новой, передовой технологией, которая скоро будет выпущена, мы создаем никогда ранее не слышанные голоса с уникальными характеристиками, которые помогут защитить конфиденциальность и безопасность пользователей, а также позволят им создать желаемую личность через звук.
Мы также наблюдали появление методов машинного обучения, основанных на данных, в последние годы. Эти методы позволяют нам изучать абстрактные скрытые структуры внутри сигналов речи, связанные с перцептивными характеристиками голоса, такими как фонология, содержание, идентичность, намерение и настроение. Используя эти технологии, мы можем контролировать и изменять перцептивные аспекты сигнала. Это позволяет нам проектировать технологии, которые дают пользователям больше контроля над их воспринимаемыми голосовыми идентификаторами таким образом, который был невозможен ранее.
Какие есть случаи использования приложения Voicemod?
Отличительной чертой Voicemod является то, что его инструменты обслуживают широкий спектр потребностей и сценариев. Более распространенные ситуации будут для создания контента, игр с друзьями, общения с семьей или друзьями, создания иммерсивных ролевых сред или даже для работы и бизнеса – где пользователи в основном используют наши инструменты удаления шума и аудио-усиления.
Не могли бы вы обсудить некоторые проблемы и преимущества запуска стартапа с братьями и сестрами?
Честно говоря, я бы с удовольствием, и я знаю, что, конечно, все сталкиваются с проблемами каким-то образом, но я на самом деле не помню многих в нашем случае. Причина в том, что мы来自 очень большой семьи. Мы всегда делали что-то вместе, от детских проектов до игры на музыке и создания. Это было только естественно, что мы в конечном итоге начнем работать вместе. Мои братья Фернандо и Хуан – которые, как я упоминал, стали сооснователями Voicemod вместе со мной – уже имели несколько компаний вместе, поэтому у них был достаточный опыт в этом отношении. Я присоединился к ним в 2010 году в их компании, которая была 2taptap, поэтому я получил представление об этом. Это означает, что когда мы создали Voicemod, мы сделали это, будучи полностью согласными в том, чего мы хотим достичь, и, что более важно, как мы хотим этого достичь. Таким образом, это действительно помогло принести сильную культуру согласованных ценностей в Voicemod, которая была真正шим ключом к нашему успеху.
Есть ли что-то еще, что вы хотели бы поделиться о Voicemod?
За кулисами происходит многое, но в соответствии с нашим желанием эволюционировать звук для всех, мы в настоящее время работаем над чем-то, чтобы сделать нашу технологию еще более… доступной. Способ для любого разработчика использовать нашу технологию в своем продукте
Мы знаем, что люди проводят большую часть своего бодрствования в Интернете, подключенные, выражая себя на различных платформах и приложениях. В онлайн-среде ваш “аватар” – это все ваше представление. И действительно, кто такой человек без голоса?
Создание технологии изменения голоса в реальном времени и разработка системы полностью настраиваемых звуковых выражений – это много работы. Наша команда сделала этот шаг, спроектировав целый комплект, который может быть легко интегрирован разработчиками где угодно. Мы очень рады сделать нашу технологию доступной для разработчиков и пользователей по всему миру, поскольку мы продолжаем строить будущее социальных аудио-опытов!
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить Voicemod.












