Intervjuer
Nick Lahoika, medgrundare och VD för Vocal Image – Intervjuserie

Nick Lahoika är medgrundare och VD för Vocal Image, ett coachningsföretag som hjälper människor att utveckla mjuka färdigheter. En serieentreprenör med över 10 års erfarenhet av IT och affärsutveckling, Nick lyckades avsluta två företag innan han skapade Vocal Image. Nicks resa är djupt personlig; han blev mobbad för otydlig uttal i skolan, vilket inspirerade honom att hjälpa människor att kommunicera bättre.
Efter att ha tvingats fly från sitt hemland efter revolutionen 2020 anlände Nick till Estland med minimal kunskap i engelska och använde sin egen app för att träna sin röst, säkrade sin första finansieringsrunda inom sex månader. Vinnaren av AWS AI-utmaningen och Meta x Hugging Face European AI Startup Program, Vocal Image nyligen höjde en seedrunda på 3,6 miljoner dollar ledd av Educapital (Frankrike) och skalade till över 14 miljoner dollar i årlig återkommande intäkt.
Du grundade Vocal Image 2021. Vad inspirerade dig att bygga en AI-coach för mjuka färdigheter, och vilket problem försökte du lösa från början?
Talångest var en del av mitt liv under lång tid. Jag blev mobbad i skolan för otydligt uttal, och den upplevelsen stannade verkligen kvar hos mig. Senare, som IT-studentpraktikant, var jag tvungen att presentera för högnivåkunder, och samma rädsla kom tillbaka.
Sedan 2021, efter den misslyckade revolutionen i Vitryssland, var jag tvungen att flytta till Europa över en natt. Plötsligt var jag tvungen att presentera för investerare på engelska, ett språk jag knappt talade. Det var skrämmande, men det fanns inget val. Jag tillbringade timmar varje dag med att öva min uttal med en mycket tidig version av vad som senare skulle bli Vocal Image. Det tog till och med veckor för mig att lära mig att uttala “V”-ljudet ordentligt så att jag kunde säga mitt eget företagsnamn.
Vi började med en app som i princip var som YouTube, men med en inbyggd röstinspelare och en kommentarsfunktion. Användare kunde titta på videor, öva på att upprepa meningarna och sedan lyssna på sina egna inspelningar. Genom att se hur människor använde den insåg vi snabbt att de desperat behövde feedback. Våra tidiga användare visade oss att det inte räckte att bara konsumera innehåll för att få verkliga resultat; de behövde omedelbar feedback. Vi försökte leverera feedback genom mänskliga tränare, men det var inte skalbart, vilket är hur vi kom att använda AI.
Det var min personliga insikt att det var lättare för mig att öva mina första presentationer med vår plattform istället för en person. Det fanns inget tryck, inget omdöme. Den friheten förändrade allt för mig. När jag löste mitt eget problem insåg jag hur många människor stod inför samma problem. Mer än 200 miljoner människor kämpar med talångest.
Före Vocal Image drev du en dansstudio. Hur påverkade din bakgrund inom rörelse och uttryck din approach till kommunikation och röstförtroende?
Jag var inte dansare; jag byggde faktiskt ett företag som fokuserade på självuttryck och människor. Det var genom det arbetet som jag insåg att man kunde lära sig mycket om en persons inre förtroende genom att bara titta på hur de dansar.
Rörelse spelar också en stor roll i hur du uttrycker dig. Sättet du rör dig, din hållning, din andning, allt är en del av kommunikationen. Där blir AI-träning kraftfull, eftersom den kan hjälpa människor att träna över alla dessa områden på en plats.
Före var företag tvungna att anställa flera olika tränare. En för offentliga tal, en för kroppsspråk, en för förtroende. Nu, med AI, är allt sammanlänkat. Du kan bygga en fullständig bild av kommunikation, inte bara en del av den.
Till skillnad från de flesta AI-kommunikationsverktyg beslutade du dig för att inte använda ChatGPT som grund för din coach. Vad ledde till det beslutet?
Hypen kring ChatGPT blev faktiskt en stor vändpunkt för oss. När det blev mainstream skapade det en massiv ökning av AI-förtroende, och vi kunde utnyttja det för att få människor att tro på vår egen teknik.
Men här är saken: vi ville definitivt inte använda det som vår grund. Vårt mål från början var att använda vår unika modell för att utvärdera människors röst och talvanor. Vi använder stora språkmodeller som Gemini, Claude och ChatGPT, samt kunskapsbaser, tips och tricks från kommunikationslitteratur i våra nuvarande modeller, men de är inte kärnan i vår feedbackmekanism. Den verkliga grunden för vår feedback är mänsklig inmatning.
Rädslan för att AI-träning ska kännas robotisk är verklig. För att motverka det skapade vi en gemenskap inom Vocal Image där användare kan ansluta direkt, dela det gemensamma målet att förbättra sin kommunikation och stödja varandras resa. Och denna gemenskap växer och förbättrar ständigt vår AI.
Kan du förklara hur utbildning av din AI uteslutande på mänskliga röster skiljer sig från traditionella LLM-baserade tillvägagångssätt i termer av resultat och äkthet?
Vi använder stora språkmodeller som en del av processen för utvärdering och sammanhang, men den verkliga grunden för vår system är data som ligger bakom. Vår kärnmodell tränades på vår egen gemenskap, som består av människor som kom samman specifikt för att förbättra sin kommunikationsförmåga.
AI är bara så bra som de människor den lär av. Vår proprietära dataset innehåller nu över en miljon unika mänskliga röster, var och en med ton, rytm och känsla, allt som representerar den verkliga essensen av kommunikation.
Din dataset innehåller över en miljon mänskliga röster. Vilka utmaningar mötte du när du kuraterade och märkte en sådan unik korpus?
Du kan inte lita lika mycket på varje datapunkt. Vissa användare betygsätter noggrant, medan andra bara klickar igenom. Vi var tvungna att utforma ett system som skiljer sig från tankeväckande feedback och brus. Över tiden lärde vi oss att ge mer vikt till användare med konsekvent deltagande och tillförlitlig bedömning, samtidigt som vi filtrerade bort slumpmässig inmatning.
Det svåraste var operativt, vilket innebar att bygga ett betygsystem som belönar kvalitet över kvantitet. Där blev vår gemenskap ovärderlig. Dessa är inte slumpmässiga internetanvändare, utan människor som genuint försöker förbättra sina mjuka färdigheter och hjälpa andra att göra detsamma. Alla betygsättningar är anonyma, vilket hjälper till att hålla feedbacken opartisk och äkta.
Den gemenskapsdrivna “Tinder-liknande” utvärderingsmekanismen är fascinerande — hur formar den feedback-loopen den pågående inlärningen av din AI?
Varje betygsättning, på varje språk, blir en liten del av intelligens som förfinar vår modell. Det är en levande feedback-loop. Ju fler människor som tränar och utvärderar, desto smartare blir systemet på att känna igen nyanser av tal och känslor, lära sig hur människor faktiskt uppfattar förtroende, värme eller auktoritet över kulturer.
Vilka var de viktigaste lärdomarna när du utvecklade en AI-modell som fokuserade på mjuka färdigheter snarare än tekniska kompetenser?
Den största utmaningen var mätning. Det finns inget universellt mått på “tillförlitlig” eller “karismatisk”. Vi var tvungna att skapa vår egen.
Här kom lagen om stora tal in. Om 100 000 människor är överens om att en viss röst låter tillförlitlig eller empatisk, kan du börja lita på den kollektiva uppfattningen. Över tiden lärde vi vår AI att förutsäga subjektiva kvaliteter, saker som inte kan betygsättas med ett enkelt rätt eller fel. Det var genombrottet: att lära sig att kvantifiera vad som alltid hade ansetts omätbart.
Med 14 miljoner dollar i årlig återkommande intäkt och en färsk seedrunda på 3,6 miljoner dollar, vad är dina huvudsakliga prioriteringar för denna nästa tillväxtfas — antingen det är att förbättra AI-modellen, expandera användarbasen eller fördjupa gemenskapsupplevelsen?
Vår mission har alltid varit människocentrerad. Vi hjälper människor att kommunicera med mer förtroende och äkthet.
Nästa fas handlar om att skala upp den påverkan globalt. Vi expanderar till nya språk och geografier och utvecklar nya mjuka färdighetsmoduler, såsom förhandling, aktivt lyssnande och vältalighet.
Många användare säger att AI-tränare känns robotiska eller opersonliga. Hur säkerställer du att Vocal Image levererar känslomässigt resonant och sammanhangsmedveten feedback?
Vi fokuserar på hyperpersonalisering. Från den första interaktionen lär vi oss vem du är, inklusive din accent, ålder, professionell sammanhang och talsätt. Över tiden har vi minne, minns hur du har förbättrats, var du kämpar och vilken feedback som resoneras mest.
Det tillåter AI att anpassa sig dynamiskt. Upplevelsen känns personlig eftersom den är personlig. Den formas helt av dina data och din resa, inte av ett generiskt manus.
Om du ser framåt, hur ser du att AI-träning för mjuka färdigheter utvecklas när generativ och emotionell AI fortsätter att mognar?
Mänsklig utveckling har alltid varit en blandning av natur och uppfostran. Vetenskapen säger oss att ledarskap är ungefär hälften medfött, hälften lärt. Den lästa delen var tidigare förbehållen chefer som kunde betala dyra tränare. Under lång tid har företag varit tvungna att betala mellan 7 000 och 25 000 dollar per år för att träna en enda ledare. AI förändrar det.
Att engagera sig med mänskliga tränare skulle kräva att man anställer många olika tränare, medan en AI-tränare kan ersätta alla.
Just nu använder vi en pipeline av olika modeller för att analysera olika aspekter av kommunikation, men framtiden är ett enda, enhetligt system som utvärderar och guider dig holistiskt. Denna teknik kommer att demokratisera tillväxt. Du behöver inte vara född karismatisk eller ha en stor företagsbudget för att bemästra kommunikation. Du behöver bara nyfikenhet och tillgång, och skapandet av miljön för att det ska blomstra är vad som driver mig varje dag.
Tack för den underbara intervjun, läsare som vill lära sig mer kan besöka Vocal Image.












