Інтерв’ю
Нік Лагойка, співзасновник і генеральний директор Vocal Image – Серія інтерв’ю

Нік Лагойка – співзасновник і генеральний директор Vocal Image, стартапу з тренінгів, який допомагає людям розвивати м’які навички. Серійний підприємець з більш ніж 10-річним досвідом у сфері ІТ і бізнес-розробки, Нік успішно вийшов з двох підприємств до створення Vocal Image. Подорож Ніка глибоко особиста; його дражнили за невиразну дикцію в школі, що надихнуло його на місію допомогти людям комунікувати краще.
Після того, як його змусили втікати з рідної країни після революції 2020 року, Нік прибув до Естонії з мінімальним знанням англійської мови та використав свій власний застосунок, щоб тренувати свій голос, забезпечивши перший раунд фінансування вже через шість місяців. Переможець конкурсу AWS AI Challenge та програми Meta x Hugging Face European AI Startup, Vocal Image недавно залучив 3,6 мільйона доларів у рамках раунду сіяння, очолюваного Educapital (Франція), та досягнув рівня понад 14 мільйонів доларів доходу на рік.
Ви заснували Vocal Image у 2021 році. Що надихнуло вас створити тренера з м’яких навичок на основі штучного інтелекту, і яку проблему ви намагалися вирішити на початку?
Тревога за мовлення була частиною мого життя протягом довгого часу. Мене дражнили в школі за невиразну дикцію, і цей досвід справді залишився зі мною. Пізніше, як студент-стажер у сфері ІТ, мені довелося виступати перед клієнтами високого рівня, і те ж страх повернувся.
Потім у 2021 році, після невдалої революції в Білорусі, мені довелося переїхати до Європи за одну ніч. Раптом я мав розмовляти з інвесторами англійською, мовою, якої я майже не знав. Це було страшно, але вибір не було. Я проводив години щодня, практикуючи свою вимову за допомогою дуже ранньої версії того, що пізніше стало Vocal Image. Навіть витратив тижні, тільки щоб навчитися правильно вимовляти звук “В”, щоб міг вимовити назву своєї власної компанії.
Ми почали з застосунку, який був по суті подібний до YouTube, але з вбудованим записувачем голосу та функцією коментування. Користувачі могли дивитися відео, практикувати повторення рядків, а потім слухати свої власні записи. Спостерігаючи, як люди використовували його, ми швидко зрозуміли, що їм віддесньо потрібна зворотня зв’язок. Наші ранні користувачі показали нам, що просте споживання контенту не було достатнім для отримання реальних результатів; їм потрібна була негайна зворотня зв’язок. Ми спробували надавати зворотню зв’язок через людських тренерів, але цей підхід не був масштабованим, що привело нас до використання штучного інтелекту.
Це було моєю особистою інтуїцією, що мені було легше практикувати свої перші презентації з нашою платформою, а не з людиною. Не було тиску, не було судження. Ця свобода все змінила для мене. Як тільки я вирішив свою власну проблему, я зрозумів, скільки людей стикаються з тією ж проблемою. Більше 200 мільйонів людей страждають від тревоги за мовлення.
До Vocal Image ви керували танцювальним студією. Як ваш досвід у сфері руху та вираження вплинув на ваш підхід до комунікації та вокальної впевненості?
Я не був танцюристом; я фактично побудував бізнес, центрований на самовираженні та людей. Це було через цю роботу, що я зрозумів, що можна багато чого дізнатися про внутрішню впевненість людини, просто спостерігаючи, як вона танцює.
Рух також відіграє величезну роль у тому, як ви виражаєте себе. Ваш рух, постава, дихання – все це частина комунікації. Це саме місце, де тренування з штучним інтелектом стає потужним, оскільки воно може допомогти людям тренуватися в усіх цих областях в одному місці.
До цього часу компанії мали наймати окремих тренерів. Одного для публічних виступів, одного для мовлення тіла, одного для впевненості. Тепер, з штучним інтелектом, все це пов’язано. Ви можете побудувати повну картину комунікації, а не тільки одну її частину.
На відміну від більшості інструментів комунікації з штучним інтелектом, ви вирішили не використовувати ChatGPT як основу для свого тренера. Що привело до цього рішення?
Гіп навколо ChatGPT фактично став величезним поворотним моментом для нас. Коли це стало популярним, це створило величезний сплеск довіри до штучного інтелекту, і ми змогли використати це, щоб людей змусили повірити в нашу власну технологію.
Але ось що: ми точно не хотіли використовувати його як основу. Наша мета з самого початку була використовувати наш унікальний модель для оцінки голосу та мовлення людей. Ми використовуємо великі мовні моделі, такі як Gemini, Claude і ChatGPT, а також знання, поради та хитрощі з літератури про комунікацію в наших поточних моделях, але вони не є основою нашого механізму зворотної зв’язки. Реальна основа нашої зворотної зв’язки – людський внесок.
Страх перед тренуванням з штучним інтелектом, яке відчувається роботизованим, реальний. Щоб протидіяти цьому, ми створили спільноту в рамках Vocal Image, де користувачі можуть миттєво зв’язатися, поділитися спільною метою покращення комунікації та підтримати один одного в цьому процесі. І ця спільнота постійно зростає та покращує наш штучний інтелект.
Чи можете ви роз’яснити, як тренування вашого штучного інтелекту виключно на людських голосах відрізняється від традиційних підходів, заснованих на великих мовних моделях, у плані результатів та автентичності?
Ми використовуємо великі мовні моделі як частину процесу оцінки та контексту, але реальна основа нашої системи – дані, на яких вона заснована. Наша основна модель була навчена на нашій власній спільноті, яка складається з людей, які об’єдналися, щоб покращити свої комунікаційні навички.
Штучний інтелект тільки так хороший, як люди, яких він вивчає. Наша власна база даних зараз включає понад один мільйон унікальних людських голосів, кожен з яких несе тон, ритм та емоцію, все це представляє справжню сутність комунікації.
Ваша база даних включає понад один мільйон людських голосів. Які труднощі ви зустріли під час створення та маркування такої унікальної корпусу?
Ви не можете покладатися рівною мірою на кожну точку даних. Деякі користувачі оцінюють ретельно, інші просто натискають. Нам довелося розробити систему, яка розрізняє ретельну зворотну зв’язок від шуму. З часом ми навчилися надавати більшу вагу користувачам з послідовною участю та надійним судженням, а також фільтрувати випадкові вхідні дані.
Найбільшою трудністю було оперативне питання, яке полягало в створенні екосистеми оцінювання, яка надає перевагу якості над кількістю. Саме там наша спільнота стала невід’ємною. Це не випадкові користувачі інтернету, а люди, які щиро намагаються покращити свої м’які навички та допомогти іншим зробити те ж саме. Всі оцінки є анонімними, що допомагає зберігати зворотну зв’язок необмеженим та автентичним.
Механізм оцінювання типу “Tinder”, який керується спільнотою, досить цікавий – як ця зворотна зв’язок формує подальше навчання вашого штучного інтелекту?
Кожна оцінка, у кожній мові, стає маленькою частиною інтелекту, яка уточнює нашу модель. Це живий цикл зворотної зв’язки. Чим більше людей тренуються та оцінюють, тим розумнішою стає система у розпізнаванні нюансів мови та емоцій, вивченні того, як люди насправді сприймають впевненість, теплоту чи авторитетність у різних культурах.
Які були ключові уроки, яких ви навчилися під час розробки моделі штучного інтелекту, центрованої на м’яких навичках, а не на технічних компетенціях?
Основною трудністю було вимірювання. Не існує універсальної метрики для “достовірного” або “харизматичного”. Нам довелося створити свою власну.
Саме тут вступає в дію Закон великих чисел. Якщо 100 000 людей погоджуються, що певний голос звучить впевнено або співчутливо, ви можете почати довіряти цій колективній перцепції. З часом ми навчили наш штучний інтелект передбачати суб’єктивні якості, речі, які не можуть бути оцінені простим правом або неправильним. Це був прорив: вивчення того, як кількісно оцінювати те, що завжди вважалося невловимим.
З 14 мільйонами доларів доходу на рік та свіжим раундом сіяння в розмірі 3,6 мільйона доларів, які є вашими основними пріоритетами на цьому етапі зростання – чи це розвиток моделі штучного інтелекту, розширення бази користувачів чи поглиблення досвіду спільноти?
Наша місія завжди була людьми, центрована на людях. Ми допомагаємо людям комунікувати з більшою впевненістю та автентичністю.
Наступний етап – це масштабування цього впливу глобально. Ми розширюємося на нові мови та географічні регіони та розробляємо нові модулі м’яких навичок, такі як переговори, активне слухання та елоквенція.
Багато користувачів кажуть, що тренери з штучним інтелектом відчуваються роботизованими чи безособовими. Як ви забезпечуєте, щоб Vocal Image надавав емоційно резонансну та контекстно-обізнану зворотну зв’язок?
Ми зосереджуємося на гіперперсоналізації. Від першої взаємодії ми вчимося, хто ви є, включаючи ваш акцент, вік, професійний контекст та мовлення. З часом ми маємо пам’ять, згадуючи, як ви покращилися, де ви боретесь, і яку зворотну зв’язок ви найкраще сприймаєте.
Це дозволяє штучному інтелекту адаптуватися динамічно. Досвід відчувається особистим, оскільки він повністю сформований вашими даними та вашим шляхом, а не генеричним сценарієм.
Оглядаючи майбутнє, як ви бачите розвиток тренування з штучним інтелектом м’яких навичок, коли генеративний та емоційний штучний інтелект продовжують дозрівати?
Розвиток людини завжди був сумішшю природи та виховання. Наука говорить нам, що лідерство приблизно наполовину вроджене, наполовину вивчене. Вивчене половина раніше була зарезервована для виконавців, які могли собі дозволити дорогих тренерів. Компанії мали витрачати між 7 000 і 25 000 доларів на рік на тренування одного лідера. Штучний інтелект змінює це.
Також, взаємодія з людськими тренерами потребувала б утримання багатьох окремих тренерів, тоді як тренер з штучним інтелектом може замінити всіх них.
Наразі ми використовуємо ряд різних моделей для аналізу різних аспектів комунікації, але майбутнє – це єдина, уніфікована система, яка оцінює та керує вами голістично. Ця технологія демократизуватиме зростання. Вам не потрібно буде народитися харизматичним чи мати великий корпоративний бюджет, щоб оволодіти комунікацією. Вам просто потрібно буде цікавість та доступ, а створення середовища для цього – це те, що рухає мене кожен день.
Дякую за велике інтерв’ю, читачам, які бажають дізнатися більше, рекомендуємо відвідати Vocal Image.












