Интервью
Ник Лахойка, сооснователь и генеральный директор Vocal Image – Интервью

Ник Лахойка – сооснователь и генеральный директор Vocal Image, стартапа, который помогает людям развивать мягкие навыки. Серийный предприниматель с более чем 10-летним опытом в области IT и бизнес-развития, Ник успешно вышел из двух проектов до создания Vocal Image. Путь Ника глубоко личный; он был задираем в школе за нечеткую дикцию, что вдохновило его на миссию помочь людям общаться лучше.
После того, как ему пришлось бежать из своей родной страны после революции 2020 года, Ник прибыл в Эстонию с минимальным знанием английского языка и использовал свое собственное приложение, чтобы тренировать свой голос, получив первое финансирование всего за шесть месяцев. Победитель конкурса AWS AI Challenge и программы Meta x Hugging Face European AI Startup, Vocal Image недавно привлекла 3,6 миллиона долларов в рамках раунда финансирования, возглавляемого Educapital (Франция), и выросла до 14 миллионов долларов годового дохода.
Вы основали Vocal Image в 2021 году. Что вдохновило вас создать коуча по мягким навыкам на основе ИИ, и какую проблему вы пытались решить в самом начале?
Тревога за речь была частью моей жизни в течение долгого времени. Меня задирали в школе за нечеткую дикцию, и этот опыт действительно остался со мной. Позже, когда я был стажером в области IT, мне пришлось выступать перед высокопоставленными клиентами, и та же самая страх вернулся.
Затем в 2021 году, после неудачной революции в Беларуси, мне пришлось переехать в Европу за одну ночь. Внезапно я должен был выступать перед инвесторами на английском языке, который я几乎 не знал. Это было страшно, но не было выбора. Я проводил часы каждый день, тренируя свою произношение с помощью очень ранней версии того, что позже стало Vocal Image. Это даже заняло у меня недели, чтобы научиться правильно произносить звук “В”, чтобы я мог сказать название своей собственной компании.
Мы начали с приложения, которое было по сути как YouTube, но с встроенным голосовым рекордером и функцией комментирования. Пользователи могли смотреть видео, тренировать повторение фраз и затем слушать свои собственные записи. Смотрите, как люди используют его, мы быстро поняли, что им отчаянно нужна обратная связь. Наши ранние пользователи показали нам, что просто потребление контента не достаточно, чтобы получить реальные результаты; им нужна была немедленная обратная связь. Мы попробовали доставлять обратную связь через человеческих тренеров, но этот подход не был масштабируемым, что привело нас к использованию ИИ.
Это было моим личным прозрением, что было легче для меня тренировать свои первые выступления с нашей платформой, а не с человеком. Там не было давления, не было суда. Эта свобода изменила все для меня. Как только я решил свою собственную проблему, я понял, сколько людей сталкиваются с той же проблемой. Более 200 миллионов человек страдают от тревоги за речь.
До Vocal Image вы управляли танцевальной студией. Как ваш опыт в области движения и выражения повлиял на ваш подход к общению и уверенности в голосе?
Я не был танцором; я фактически построил бизнес, центрированный на самовыражении и людях. Это было через эту работу, что я понял, что можно многое сказать о человеке, просто наблюдая за ним, как он танцует.
Движение также играет огромную роль в том, как вы выражаете себя. То, как вы двигаетесь, ваша осанка, ваше дыхание, все это часть общения. Вот где коучинг на основе ИИ становится мощным, поскольку он может помочь людям тренировать все эти области в одном месте.
Раньше компании должны были нанимать нескольких разных тренеров. Один для публичных выступлений, один для языка тела, один для уверенности. Теперь, с ИИ, все это соединено. Вы можете построить полную картину общения, а не только одну часть ее.
В отличие от большинства инструментов ИИ для общения, вы решили не использовать ChatGPT в качестве основы для вашего коуча. Что привело к этому решению?
Гип вокруг ChatGPT фактически стал огромным поворотным моментом для нас. Когда он стал мейнстримом, он создал огромный скачок доверия к ИИ, и мы смогли использовать это, чтобы заставить людей поверить в нашу собственную технологию.
Но вот в чем дело: мы определенно не хотели использовать его в качестве основы. Наша цель с самого начала была использовать нашу уникальную модель для оценки голоса и речевых паттернов людей. Мы используем большие языковые модели, такие как Gemini, Claude и ChatGPT, а также знания и советы из литературы по общению в наших текущих моделях, но они не являются основой нашей обратной связи. Реальная основа нашей обратной связи – человеческий ввод.
Страх того, что коучинг на основе ИИ может показаться роботизированным, реален. Чтобы противостоять этому, мы создали сообщество внутри Vocal Image, где пользователи могут мгновенно соединиться, поделиться общей целью улучшения своего общения и поддержать друг друга в их пути. И это сообщество постоянно растет и улучшает наш ИИ.
Можете ли вы подробнее рассказать о том, как тренировка вашего ИИ исключительно на человеческих голосах отличается от традиционных подходов, основанных на LLM, в плане результатов и аутентичности?
Мы используем большие языковые модели в качестве части процесса оценки и контекста, но реальная основа нашей системы – данные, лежащие в ее основе. Наша основная модель была обучена на нашем собственном сообществе, состоящем из людей, которые собрались вместе, чтобы улучшить свои навыки общения.
ИИ так хорош, как и люди, от которых он учится. Наша проприетарная база данных теперь включает более одного миллиона уникальных человеческих голосов, каждый из которых несет тон, ритм и эмоцию, все из которых представляют реальную суть общения.
Ваша база данных включает более одного миллиона человеческих голосов. Какие проблемы вы столкнулись при курировании и маркировке такой уникальной корпуса?
Вы не можете полагаться одинаково на каждую точку данных. Некоторые пользователи оценивают тщательно, другие просто кликают через. Нам пришлось разработать систему, которая различает вдумчивую обратную связь и шум. Со временем мы научились придавать больше веса пользователям с последовательным участием и надежным суждением, фильтруя случайный ввод.
Самая сложная часть была операционной, которая включала создание экосистемы оценки, которая вознаграждает качество над количеством. Вот где наше сообщество стало бесценным. Это не случайные пользователи интернета, это люди, которые действительно пытаются улучшить свои мягкие навыки и помочь другим сделать то же самое. Все рейтинги анонимны, что помогает сохранять обратную связь беспристрастной и аутентичной.
Механизм оценки, похожий на Tinder, является fascinирующим – как этот цикл обратной связи формирует постоянное обучение вашего ИИ?
Каждая оценка, на каждом языке, становится маленьким кусочком интеллекта, который уточняет нашу модель. Это живой цикл обратной связи. Чем больше людей тренируются и оценивают, тем умнее система становится в распознавании нюансов речи и эмоций, учиться тому, как люди действительно воспринимают уверенность, тепло или авторитетность через культуры.
Какие были ключевые уроки, которые вы выучили при разработке модели ИИ, центрированной на мягких навыках, а не на технических компетенциях?
Основная проблема заключалась в измерении. Нет универсальной метрики для “достоверного” или “харизматичного”. Нам пришлось создать свою собственную.
Вот где Закон больших чисел вступил в игру. Если 100 000 человек согласны с тем, что определенный голос звучит уверенно или эмпатично, вы можете начать доверять этому коллективному восприятию. Со временем мы научили наш ИИ предсказывать субъективные качества, вещи, которые не могут быть оценены простым правым или неправильным. Это был прорыв: учиться количественно оценивать то, что всегда считалось неосязаемым.
С 14 миллионами долларов годового дохода и свежим раундом финансирования в размере 3,6 миллиона долларов, какие ваши основные приоритеты на этом следующем этапе роста – будь то улучшение модели ИИ, расширение базы пользователей или углубление опыта сообщества?
Наша миссия всегда была ориентирована на человека. Мы помогаем людям общаться с большей уверенностью и аутентичностью.
Следующий этап – это масштабирование этого воздействия глобально. Мы расширяемся на новые языки и географии, и разрабатываем новые модули мягких навыков, такие как переговоры, активное слушание и элоquence.
Многие пользователи говорят, что коучи на основе ИИ кажутся роботизированными или безличными. Как вы обеспечиваете, чтобы Vocal Image доставлял эмоционально резонансную и контекстно-осведомленную обратную связь?
Мы фокусируемся на гиперперсонализации. С первого взаимодействия мы учимся, кто вы, включая ваш акцент, возраст, профессиональный контекст и речевые паттерны. Со временем у нас есть память, вспоминая, как вы улучшили, где вы боретесь и какая обратная связь резонирует больше всего.
Это позволяет ИИ адаптироваться динамически. Опыт кажется личным, потому что он действительно личный. Он формируется полностью вашими данными и вашим путём, а не генерическим сценарием.
Оглядываясь вперед, как вы видите эволюцию коучинга мягких навыков на основе ИИ, когда генеративный и эмоциональный ИИ продолжают созревать?
Развитие человека всегда было смесью природы и воспитания. Наука говорит нам, что лидерство примерно на половину врожденное, на половину приобретенное. Приобретенная половина раньше была зарезервирована для руководителей, которые могли позволить себе дорогих тренеров. В течение долгого времени компании должны были тратить между 7 000 и 25 000 долларов в год на тренера для одного лидера. ИИ меняет это.
Кроме того, взаимодействие с человеческими тренерами потребовало бы сохранения многих отдельных тренеров, тогда как тренер на основе ИИ может заменить всех их.
Сейчас мы используем конвейер разных моделей для анализа разных аспектов общения, но будущее – это единая, объединенная система, которая оценивает и руководит вами целостно. Эта технология демократизирует рост. Вам не нужно быть рожденным харизматичным или иметь большой корпоративный бюджет, чтобы овладеть общением. Вам просто нужно любопытство и доступ, и создание среды для этого – это то, что движет мной каждый день.
Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить Vocal Image.












