Wywiady

Nick Lahoika, współzałożyciel i CEO Vocal Image – seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nick Lahoika jest współzałożycielem i CEO Vocal Image, startupem szkoleniowym, który pomaga ludziom rozwijać umiejętności miękkie. Jako serialowy przedsiębiorca z ponad 10-letnim doświadczeniem w branży IT i rozwoju biznesu, Nick z powodzeniem wycofał się z dwóch przedsięwzięć przed założeniem Vocal Image. Podróż Nicka jest głęboko osobista; został wyśmiany za niejasną dykcję w szkole, co zainspirowało go do pomocy ludziom w komunikowaniu się lepiej. 

Po tym, jak został zmuszony do ucieczki ze swojego kraju po rewolucji w 2020 roku, Nick przybył do Estonii z minimalną znajomością języka angielskiego i używał swojej własnej aplikacji do szkolenia głosu, zabezpieczając pierwszą rundę finansowania w ciągu zaledwie sześciu miesięcy. Zwycięzca wyzwania AWS AI i programu Meta x Hugging Face European AI Startup, Vocal Image niedawno zebrał 3,6 miliona dolarów w rundzie seed, którą prowadził Educapital (Francja) i osiągnął ponad 14 milionów dolarów przychodu rocznego.

Założyłeś Vocal Image w 2021 roku. Co skłoniło Cię do stworzenia trenera umiejętności miękkich opartego na sztucznej inteligencji, a jaki problem próbowałeś rozwiązać na samym początku?

Lęk przed mówieniem był częścią mojego życia przez długi czas. Zostałem wyśmiany w szkole za niejasną dykcję, i to doświadczenie naprawdę pozostało ze mną. Później, jako student informatyki, musiałem przedstawiać się klientom wysokiego szczebla, i ten sam strach powrócił.

Potem w 2021 roku, po nieudanej rewolucji na Białorusi, musiałem przenieść się do Europy w ciągu jednej nocy. Nagle musiałem przedstawiać się inwestorom w języku angielskim, którym ledwie się posługiwałem. To było przerażające, ale nie było wyboru. Spędzałem godziny każdego dnia, ćwicząc wymowę przy użyciu bardzo wczesnej wersji tego, co później stało się Vocal Image. To nawet zajęło mi tygodnie, zanim nauczyłem się, jak wymawiać dźwięk “V”, aby móc powiedzieć nazwę własnej firmy.

Zaczynaliśmy od aplikacji, która była podstawowo jak YouTube, ale z wbudowanym nagrywaniem głosu i funkcją komentarzy. Użytkownicy mogli oglądać filmy, ćwiczyć powtarzanie linii, a następnie słuchać własnych nagrań. Obserwując, jak ludzie z niej korzystają, szybko zrozumieliśmy, że desperacko potrzebują informacji zwrotnej. Nasi wczesni użytkownicy pokazali nam, że proste konsumowanie treści nie wystarcza, aby osiągnąć prawdziwe rezultaty; potrzebowali natychmiastowej informacji zwrotnej. Próbowaliśmy dostarczać informację zwrotną za pomocą ludzkich trenerów, ale ten podejście nie było skalowalne, co doprowadziło nas do korzystania z sztucznej inteligencji.

Była to moja osobista inspiracja, że było dla mnie łatwiej ćwiczyć pierwsze prezentacje z naszą platformą zamiast z osobą. Nie było presji, nie było osądu. Ta swoboda wszystko zmieniła dla mnie. Gdy rozwiązałem własny problem, zrozumiałem, ile ludzi zmaga się z tym samym problemem. Ponad 200 milionów ludzi zmaga się z lękiem przed mówieniem.

Przed Vocal Image prowadziłeś studio taneczne. Jak Twoje doświadczenie w ruchu i ekspresji wpłynęło na Twój podejście do komunikacji i pewności siebie w mówieniu?

Nie byłem tancerzem; tak naprawdę zbudowałem firmę skupioną na ekspresji i ludziach. To przez tę pracę zrozumiałem, że można wiele powiedzieć o osobie, obserwując, jak tańczy.

Ruch odgrywa ogromną rolę w tym, jak się wyrażasz. Sposób, w jaki się poruszasz, twoja postawa, oddech, wszystko to jest częścią komunikacji. To właśnie tutaj coaching sztucznej inteligencji staje się potężny, ponieważ może pomóc ludziom szkolić się we wszystkich tych obszarach w jednym miejscu.

Przedtem firmy musiały zatrudniać kilku różnych trenerów. Jednego dla publicznych wystąpień, jednego dla języka ciała, jednego dla pewności siebie. Teraz, dzięki sztucznej inteligencji, wszystko jest połączone. Można zbudować pełny obraz komunikacji, a nie tylko jeden jej fragment.

W przeciwieństwie do większości narzędzi komunikacji opartych na sztucznej inteligencji, zdecydowałeś się nie używać ChatGPT jako podstawy dla swojego trenera. Co doprowadziło do tej decyzji?

Hype wokół ChatGPT stał się dla nas ogromnym punktem zwrotnym. Gdy stał się mainstreamowy, stworzył ogromny wzrost zaufania do sztucznej inteligencji, i byliśmy w stanie wykorzystać to, aby ludzie uwierzyli w naszą własną technologię.

Ale oto rzecz: nie chcieliśmy używać go jako podstawy. Naszym celem od samego początku było używanie naszego unikalnego modelu do oceny ludzkich wzorców głosu i mowy. Używamy dużych modeli językowych, takich jak Gemini, Claude i ChatGPT, oraz wiedzy i wskazówek z literatury o komunikacji w naszych bieżących modelach, ale nie są one rdzeniem naszego mechanizmu informacji zwrotnej. Prawdziwą podstawą naszej informacji zwrotnej jest wprowadzanie danych przez ludzi.

Strach przed tym, że coaching sztucznej inteligencji może się wydawać sztuczny, jest realny. Aby temu przeciwdziałać, stworzyliśmy społeczność w ramach Vocal Image, gdzie użytkownicy mogą natychmiast połączyć się, podzielić wspólnym celem poprawy komunikacji i wesprzeć się nawzajem w swojej podróży. I ta społeczność nieustannie rośnie i udoskonala naszą sztuczną inteligencję.

Możesz wyjaśnić, w jaki sposób szkolenie Twojej sztucznej inteligencji wyłącznie na ludzkich głosach różni się od tradycyjnych podejść opartych na LLM w zakresie efektów i autentyczności?

Używamy dużych modeli językowych jako części procesu oceny i kontekstu, ale prawdziwą podstawą naszego systemu są dane, które za nim stoją. Nasz podstawowy model został opracowany na podstawie naszej własnej społeczności, składającej się z ludzi, którzy spotkali się specjalnie, aby poprawić swoje umiejętności komunikacyjne.

Sztuczna inteligencja jest tylko tak dobra, jak ludzie, od których się uczy. Nasz własny zestaw danych obejmuje obecnie ponad milion unikalnych ludzkich głosów, z których każdy niesie ton, rytm i emocje, wszystkie reprezentujące prawdziwą esencję komunikacji. 

Twoja baza danych obejmuje ponad milion ludzkich głosów. Jakie wyzwania spotkałeś przy tworzeniu i oznaczaniu tak unikalnego korpusu?

Nie można polegać równo na każdym punkcie danych. Niektórzy użytkownicy oceniają starannie, inni po prostu klikają. Musieliśmy zaprojektować system, który różnicuje staranne opinie od szumu. Z czasem nauczyliśmy się, aby nadać większą wagę użytkownikom z konsekwentnym udziałem i godnymi zaufania osądami, jednocześnie filtrując losowe dane wejściowe.

Najtrudniejszą częścią było to, co dotyczyło operacji, które obejmowały budowę ekosystemu ocen, który nagradza jakość ponad ilość. To właśnie tam nasza społeczność stała się niezwykle cenna. Ci ludzie nie są przypadkowymi użytkownikami internetu; są to ludzie, którzy szczerze starają się poprawić swoje umiejętności miękkie i pomóc innym w tym samym. Wszystkie oceny są anonimowe, co pomaga utrzymać informację zwrotną bezstronną i autentyczną.

Mechanizm oceny społeczności, podobny do Tindera, jest fascynujący — jak ten obieg informacji zwrotnej kształtuje ciągłe uczenie się Twojej sztucznej inteligencji?

Każda ocena, w każdym języku, staje się małym kawałkiem inteligencji, który udoskonala nasz model. To żywy obieg informacji zwrotnej. Im więcej ludzi trenuje i ocenia, tym bardziej system staje się inteligentny w rozpoznawaniu niuansów mowy i emocji, ucząc się, jak ludzie naprawdę postrzegają pewność siebie, ciepło lub autorytet w różnych kulturach.

Jakie były kluczowe lekcje, które nauczyłeś się podczas tworzenia modelu sztucznej inteligencji skoncentrowanego na umiejętnościach miękkich, a nie na kompetencjach technicznych?

Głównym wyzwaniem była miara. Nie ma uniwersalnego wskaźnika “godnego zaufania” lub “charyzmatycznego”. Musieliśmy stworzyć własny.

To właśnie tutaj weszła Prawo duzych liczb. Jeśli 100 000 ludzi zgadza się, że pewny głos brzmi pewnie lub empatycznie, można zacząć ufać tej zbiorowej percepcji. Z czasem nauczyliśmy naszą sztuczną inteligencję, aby przewidywała subiektywne jakości, rzeczy, które nie mogą być ocenione prostym “prawidłowo” lub “nieprawidłowo”. To było przełomowe: nauczyliśmy się ilościować to, co zawsze było uważane za nieuchwytne.

Z 14 milionami dolarów przychodu rocznego i świeżym 3,6-milionową rundą seed, jakie są Twoje główne priorytety na tym następnym etapie wzrostu — czy to rozwój modelu sztucznej inteligencji, rozszerzenie bazy użytkowników, czy pogłębienie doświadczenia społeczności?

Nasza misja zawsze była ukierunkowana na ludzi. Pomagamy ludziom komunikować się z większą pewnością siebie i autentycznością.

Następna faza to skalowanie tego wpływu na całym świecie. Rozszerzamy się na nowe języki i geografie, oraz rozwijamy nowe moduły umiejętności miękkich, takie jak negocjacje, aktywne słuchanie i elokwencja. 

Wielu użytkowników mówi, że trenerzy sztucznej inteligencji wydają się sztuczni lub nieosobowi. Jak zapewniasz, że Vocal Image dostarcza emocjonalnie rezonującą i kontekstowo świadomą informację zwrotną?

Koncentrujemy się na hiper-personalizacji. Od pierwszej interakcji uczymy się, kim jesteś, w tym Twojego akcentu, wieku, kontekstu zawodowego i wzorców mowy. Z czasem mamy pamięć, przypominając, jak się poprawiłeś, gdzie masz trudności i jakie informacje zwrotne najbardziej rezonują.

To pozwala sztucznej inteligencji dostosować się dynamicznie. Doświadczenie jest personalne, ponieważ jest kształtowane całkowicie przez Twoje dane i Twoją podróż, a nie przez generyczny skrypt.

Spójrzając w przyszłość, jak widzisz ewolucję coachingu sztucznej inteligencji w zakresie umiejętności miękkich, gdy sztuczna inteligencja generatywna i emocjonalna będzie nadal dojrzewała?

Rozwój ludzi zawsze był mieszanką natury i wychowania. Nauka mówi nam, że przywództwo jest mniej więcej w połowie wrodzone, a w połowie nabyte. Część nabyta wcześniej była zarezerwowana dla executive’ów, którzy mogli sobie pozwolić na drogich trenerów. Przez długi czas firmy musiały wydawać między 7 000 a 25 000 dolarów rocznie na coaching jednego lidera. Sztuczna inteligencja zmienia to.

Ponadto współpraca z ludzkimi trenerami wymagałaby zatrudnienia wielu oddzielnych trenerów, podczas gdy trener sztucznej inteligencji może zastąpić wszystkich.

Aktualnie używamy potoku różnych modeli, aby analizować różne aspekty komunikacji, ale przyszłość to jeden, zjednoczony system, który ocenia i prowadzi Cię całościowo. Ta technologia zdemokratyzuje rozwój. Nie będziesz musiał być urodzony charyzmatycznie ani mieć dużego budżetu korporacyjnego, aby opanować komunikację. Wystarczy Ci ciekawość i dostęp, a tworzenie środowiska, w którym to może prosperować, jest tym, co napędza mnie każdego dnia.

Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Vocal Image.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.