Rozhovory
Nick Lahoika, spoluzakladatel a CEO Vocal Image – Interview Series

Nick Lahoika je spoluzakladatel a CEO Vocal Image, startupu, který pomáhá lidem rozvíjet měkké dovednosti. Jako zkušený podnikatel s více než 10 lety zkušeností v IT a obchodním rozvoji úspěšně opustil dvě předchozí podniky, než vytvořil Vocal Image. Nickova cesta je hluboce osobní; byl šikanován pro nejasnou dikci ve škole, což inspirovalo jeho misi pomoci lidem komunikovat lépe.
Po nuceném útěku ze své domovské země po revoluci v roce 2020 přijel Nick do Estonska s minimální znalostí angličtiny a použil svou vlastní aplikaci k tréninku svého hlasu, zajistil si první kolo financování již za šest měsíců. Vítěz AWS AI Challenge a Meta x Hugging Face European AI Startup Program, Vocal Image nedávno získal 3,6 milionu dolarů v rámci seed kola vedeného Educapital (Francie) a dosáhl obratu přes 14 milionů dolarů.
Založil jste Vocal Image v roce 2021. Co vás inspirovalo k vytvoření AI soft skills trenéra a jaký problém jste se snažili vyřešit na počátku?
Strach z mluvení byl součástí mého života po dlouhou dobu. Byl jsem šikanován ve škole pro nejasnou dikci a tato zkušenost mě opravdu zasáhla. Později, jako student IT, jsem musel prezentovat vysoké úrovni klientům a stejný strach se vrátil.
Poté, v roce 2021, po neúspěšné revoluci v Bělorusku, jsem musel přes noc odejít do Evropy. Najednou jsem musel prezentovat investory v angličtině, jazyce, který jsem téměř neovládal. Bylo to děsivé, ale nebyla jiná volba. Strávil jsem hodiny každý den, abych trénoval svou výslovnost pomocí velmi rané verze toho, co by později стало Vocal Image. Trvalo mi to dokonce týdny, než jsem se naučil správně vyslovovat zvuk “V”, abych mohl říkat jméno své vlastní společnosti.
Začali jsme s aplikací, která byla vlastně jako YouTube, ale s vestavěným hlasovým záznamníkem a funkcí komentářů. Uživatelé mohli sledovat videa, cvičit opakování řádků a poté poslouchat své vlastní nahrávky. Sledováním, jak lidé aplikaci používali, jsme rychle uvědomili, že zoufale potřebují zpětnou vazbu. Naši raní uživatelé nám ukázali, že pouhé konzumování obsahu nestačilo k dosažení skutečných výsledků; potřebovali okamžitou zpětnou vazbu. Zkusili jsme poskytovat zpětnou vazbu prostřednictvím lidských trenérů, ale tento přístup nebyl škálovatelný, a proto jsme přešli na používání AI.
Byla to moje osobní inspirace, že pro mě bylo snazší cvičit své první prezentace s naší platformou místo s osobou. Nebylo tam žádné tlaku, žádné soudnosti. Tato svoboda všechno změnila pro mě. Jakmile jsem vyřešil svůj vlastní problém, uvědomil jsem si, kolik lidí čelí stejnému problému. Více než 200 milionů lidí bojuje se strachem z mluvení.
Před Vocal Image jste vedl taneční studio. Jak vám zkušenosti s pohybem a výrazem ovlivnily váš přístup ke komunikaci a vokální jistotě?
Nebyl jsem tanečník; vlastně jsem vybudoval podnikání zaměřené na sebevyjádření a lidi. Právě prostřednictvím této práce jsem si uvědomil, že můžete říci много o vnitřní jistotě člověka, pozorováním, jak tančí.
Pohyb hraje také obrovskou roli v tom, jak se vyjadřujete. Způsob, jakým se pohybujete, vaše držení těla, vaše dýchání, je všechno součástí komunikace. To je místo, kde se AI trenér stává mocným, protože může pomoci lidem trénovat všechny tyto oblasti na jednom místě.
Předtím musely společnosti najímat několik různých trenérů. Jednoho pro veřejnou řeč, jednoho pro neverbální komunikaci, jednoho pro jistotu. Nyní, s AI, je všechno propojeno. Můžete vybudovat kompletní obraz komunikace, ne jen jeden kus z ní.
Na rozdíl od většiny AI komunikačních nástrojů jste se rozhodl nepoužít ChatGPT jako základ pro svého trenéra. Co vás vedlo k tomuto rozhodnutí?
Hype kolem ChatGPT se vlastně stal pro nás zásadním okamžikem. Když se stal mainstreamem, vytvořil obrovský skok v důvěře v AI a my jsme mohli tuto důvěru využít k tomu, aby lidé věřili v naší vlastní technologii.
Ale tady je věc: rozhodně jsme nechtěli použít jej jako základ. Naším cílem od začátku bylo použít náš unikátní model k hodnocení lidí podle hlasu a řečových vzorců. Používáme velké jazykové modely, jako je Gemini, Claude a ChatGPT, a znalostní báze, tipy a triky z komunikační literatury v našich současných modelech, ale nejsou jádrem naší zpětné vazby. Skutečným základem naší zpětné vazby je lidský vstup.
Strach z AI trenéra, který zní roboticky, je skutečný. Abychom tomu čelili, jsme ve Vocal Image vytvořili komunitu, ve které uživatelé mohou okamžitě spojit, sdílet společný cíl zlepšení komunikace a podporovat se navzájem na své cestě. A tato komunita neustále roste a zlepšuje náš AI.
Můžete vysvětlit, jak trénování vašeho AI výhradně na lidských hlasech se liší od tradičních LLM-založených přístupů, pokud jde o výsledky a autenticitu?
Používáme velké jazykové modely jako součást procesu pro hodnocení a kontext, ale skutečným základem našeho systému jsou data, která za ním stojí. Naše jádrové modely byly trénovány na naší vlastní komunitě, složené z lidí, kteří se specificky spojili, aby zlepšili své komunikační dovednosti.
AI je pouze tak dobrý, jako jsou lidé, od kterých se učí. Naše proprietární datová sada nyní zahrnuje více než jeden milion jedinečných lidských hlasů, každý nesoucí tón, rytmus a emoce, všechny reprezentující skutečnou esenci komunikace.
Vaše datová sada zahrnuje více než jeden milion lidských hlasů. Jaké výzvy jste čelili při kurátorství a označování tak unikátní korpusu?
Nemůžete se spolehnout stejně na každý datový bod. Některí uživatelé hodnotí pečlivě, jiní pouze klikají. Museli jsme navrhnout systém, který rozlišuje mezi pečlivou zpětnou vazbou a hlukem. S časem jsme se naučili dávat větší váhu uživatelům s konzistentní účastí a spolehlivým úsudkem, zatímco filtrovali náhodný vstup.
Nejobtížnější částí bylo operativní, což zahrnovalo budování ratingového ekosystému, který odměňuje kvalitu nad kvantitou. To je místo, kde naše komunita стала neocenitelnou. Tito nejsou náhodní uživatelé internetu, jsou to lidé, kteří skutečně snaží zlepšit své měkké dovednosti a pomoci ostatním udělat totéž. Všechny hodnocení jsou anonymní, což pomáhá udržet zpětnou vazbu nezaujatou a autentickou.
Komunitou řízený “Tinder-like” mechanismus hodnocení je fascinující – jak tato zpětná vazba ovlivňuje neustálé učení vašeho AI?
Každé hodnocení, v každém jazyce, se stává malou částí inteligence, která rafinuje náš model. Je to živá zpětná vazba. Čím více lidí trénuje a hodnotí, tím inteligentnější se systém stává při rozpoznávání nuancí řeči a emocí, učení, jak lidé skutečně vnímají důvěru, teplo nebo autoritu napříč kulturami.
Jaké byly klíčové lekce, které jste se naučili při vývoji AI modelu zaměřeného na měkké dovednosti, spíše než na technické kompetence?
Hlavní výzvou byla měření. Není žádný univerzální metr pro “důvěryhodný” nebo “charismatický”. Museli jsme vytvořit svůj vlastní.
To je místo, kde zákon velkých čísel přišel. Pokud 100 000 lidí souhlasí s tím, že určitý hlas zní důvěryhodně nebo empaticky, můžete začít věřit tomuto kolektivnímu vnímání. S časem jsme naučili náš AI předpovídat subjektivní kvality, věci, které nelze ohodnotit jednoduchým správným nebo nesprávným.
S 14 miliony dolarů v ročním opakujícím se příjmu a čerstvým 3,6 milionem dolarů v seed kole, jaké jsou vaše hlavní priority pro tuto další fázi růstu – zda je to pokročilý AI model, rozšíření uživatelské základny nebo prohloubení komunitního zážitku?
Naše mise vždy byla zaměřena na člověka. Pomáháme lidem komunikovat s větší jistotou a autenticitou.
Další fáze je o škálování tohoto dopadu globálně. Rozšiřujeme se do nových jazyků a geografií a vyvíjíme nové měkké dovednosti, jako je vyjednávání, aktivní naslouchání a výřečnost.
Mnozí uživatelé říkají, že AI trenéři zní roboticky nebo neosobně. Jak zajišťujete, aby Vocal Image poskytoval emocionálně rezonující a kontextově vědomou zpětnou vazbu?
Soustředíme se na hyper-personalizaci. Od první interakce se učíme, kdo jste, včetně vašeho akcentu, věku, profesionálního kontextu a řečových vzorců. S časem máme paměť, připomínající, jak jste se zlepšili, kde máte potíže a jaká zpětná vazba nejvíce rezonuje.
To umožňuje AI přizpůsobit se dynamicky. Zážitkem se cítí osobní, protože je skutečně osobní. Je tvarován zcela vašimi daty a vaší cestou, ne generickým scénářem.
Pohledem do budoucnosti, jak vidíte vývoj AI soft skills trenérů, jakmile se generativní a emocionální AI dále rozvinou?
Lidský rozvoj vždy byl směsí přírody a výchovy. Věda nám říká, že leadership je zhruba polovinou vrozený, polovinou naučený. Naučená polovina byla dříve vyhrazena pro výkonné, kteří si mohli dovolit drahé trenéry. Po dlouhou dobu musely společnosti platit mezi 7 000 a 25 000 dolarů ročně za trénink jednoho lídra. AI to mění.
Také zapojení s lidskými trenéry by vyžadovalo najímat mnoho samostatných trenérů, zatímco AI trenér může nahradit všechny.
Právě teď používáme řadu různých modelů k analýze různých aspektů komunikace, ale budoucnost je jeden, sjednocený systém, který vyhodnocuje a hướnguje vás holisticky. Tato technologie bude demokratizovat růst. Nebudete muset být charismatický nebo mít velký firemní rozpočet, abyste ovládli komunikaci. Budete potřebovat pouze zvědavost a přístup, a vytváření prostředí pro to, aby toto kvetlo, je to, co mě pohání každý den.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Vocal Image.












