Interviews
Nick Lahoika, mede-oprichter en CEO van Vocal Image – Interviewreeks

Nick Lahoika is de mede-oprichter en CEO van Vocal Image, een coachingsbedrijf dat mensen helpt om soft skills te ontwikkelen. Als serie-ondernemer met meer dan 10 jaar ervaring in IT en bedrijfsontwikkeling, verliet Nick succesvol twee ondernemingen voordat hij Vocal Image oprichtte. Nicks reis is diep persoonlijk; hij werd gepest vanwege zijn onduidelijke dictie op school, wat zijn missie inspireerde om mensen te helpen beter te communiceren.
Na te zijn gedwongen zijn thuisland te verlaten na de revolutie van 2020, arriveerde Nick in Estland met een minimale beheersing van het Engels en gebruikte hij zijn eigen app om zijn stem te trainen, waarmee hij zijn eerste financieringsronde binnen zes maanden veiligstelde. De winnaar van de AWS AI Challenge en Meta x Hugging Face European AI Startup Program, Vocal Image heeft onlangs een seedronde van $3,6 miljoen opgehaald onder leiding van Educapital (Frankrijk) en is gegroeid tot meer dan $14 miljoen aan jaarlijkse omzet.
U heeft Vocal Image in 2021 opgericht. Wat inspireerde u om een AI-soft skills coach op te richten en welk probleem probeerde u aan het begin op te lossen?
Sprekengezien was een deel van mijn leven voor een lange tijd. Ik werd gepest op school vanwege mijn onduidelijke dictie en die ervaring is echt bij me blijven hangen. Later, als IT-stagiair, moest ik presenteren voor hooggeplaatste klanten en dezelfde angst kwam terug.
Toen in 2021, na de mislukte revolutie in Wit-Rusland, moest ik naar Europa vluchten. Plotseling moest ik investeerders in het Engels benaderen, een taal die ik nauwelijks sprak. Het was angstaanjagend, maar er was geen keuze. Ik besteedde uren elke dag aan het oefenen van mijn uitspraak met een zeer vroege versie van wat later Vocal Image zou worden. Het duurde zelfs weken voordat ik leerde hoe ik de “V”-klank goed kon uitspreken, zodat ik de naam van mijn eigen bedrijf kon zeggen.
We begonnen met een app die eigenlijk als YouTube was, maar met een ingebouwde spraakrecorder en een reactiefunctie. Gebruikers konden video’s bekijken, regels herhalen en vervolgens naar hun eigen opnames luisteren. Door te zien hoe mensen het gebruikten, realiseerden we ons snel dat ze dringend feedback nodig hadden. Onze vroege gebruikers lieten ons zien dat het alleen consumeren van content niet genoeg was om echte resultaten te behalen; ze hadden onmiddellijke feedback nodig. We probeerden feedback te geven via menselijke coaches, maar die aanpak was niet schaalbaar, waardoor we besloten om AI te gebruiken.
Het was mijn persoonlijke inzicht dat het voor mij gemakkelijker was om mijn eerste pitches te oefenen met onze platform in plaats van met een persoon. Er was geen druk, geen oordeel. Die vrijheid veranderde alles voor me. Zodra ik mijn eigen probleem had opgelost, realiseerde ik me hoeveel mensen hetzelfde probleem hebben. Meer dan 200 miljoen mensen kampen met sprekengezien.
Voordat u Vocal Image oprichtte, had u een dansstudio. Hoe heeft uw achtergrond in beweging en expressie uw aanpak van communicatie en vocale zelfverzekerdheid beïnvloed?
Ik was geen danser; ik bouwde eigenlijk een bedrijf dat zich richtte op zelfexpressie en mensen. Het was door die werk dat ik me realiseerde dat je veel over een persoon kan zeggen door naar hem te kijken dansen.
Beweging speelt ook een enorme rol in hoe je jezelf uitdrukt. De manier waarop je beweegt, je houding, je ademhaling, het is allemaal onderdeel van communicatie. Dat is waar AI-coaching krachtig wordt, omdat het mensen kan helpen om overal te trainen in één plek.
Vroeger moesten bedrijven verschillende coaches in dienst nemen. Een voor openbaar spreken, een voor lichaamstaal, een voor zelfverzekerdheid. Nu, met AI, is alles verbonden. Je kunt het complete beeld van communicatie opbouwen, niet alleen één deel ervan.
Anders dan de meeste AI-communicatietools, besloot u niet om ChatGPT als basis voor uw coach te gebruiken. Wat leidde tot die beslissing?
De hype rond ChatGPT werd eigenlijk een enorme keerpunt voor ons. Toen het mainstream werd, creëerde het een enorme piek in AI-vertrouwen en konden we dat gebruiken om mensen te laten geloven in onze eigen technologie.
Maar hier is het punt: we wilden het niet als basis gebruiken. Ons doel vanaf het begin was om ons unieke model te gebruiken om mensenstemmen en spraakpatronen te evalueren. We gebruiken grote taalmodellen zoals Gemini, Claude en ChatGPT en kennisbases, tips en trucs uit communicatieliteratuur in onze huidige modellen, maar ze vormen niet de kern van onze feedbackmechanisme. De echte basis van onze feedback is menselijke input.
De angst dat AI-coaching robotachtig aanvoelt, is reëel. Om dat te counteren, hebben we een gemeenschap binnen Vocal Image opgebouwd waar gebruikers onmiddellijk kunnen verbinden, een gemeenschappelijk doel delen om hun communicatie te verbeteren en elkaars reis te ondersteunen. En deze gemeenschap groeit en verbetert onze AI constant.
Kunt u uitleggen hoe het trainen van uw AI uitsluitend op menselijke stemmen verschilt van traditionele LLM-gebaseerde benaderingen in termen van resultaten en authenticiteit?
We gebruiken grote taalmodellen als onderdeel van het proces voor evaluatie en context, maar de echte basis van ons systeem is de data erachter. Ons kernmodel is getraind op onze eigen gemeenschap, bestaande uit mensen die specifiek samenkwamen om hun communicatieve vaardigheden te verbeteren.
AI is alleen zo goed als de mensen die het leert. Onze propriëtaire dataset omvat nu meer dan één miljoen unieke menselijke stemmen, elk met toon, ritme en emotie, die allemaal de echte essentie van communicatie vertegenwoordigen.
Uw dataset omvat meer dan één miljoen menselijke stemmen. Wat waren de uitdagingen die u tegenkwam bij het cureren en labelen van zo’n unieke corpus?
Je kunt niet gelijkmatig op elke datapunt vertrouwen. Sommige gebruikers beoordelen zorgvuldig, anderen klikken gewoon door. We moesten een systeem ontwerpen dat zorgvuldige feedback onderscheidt van ruis. In de loop van de tijd leerden we om meer gewicht te geven aan gebruikers met consistente deelname en betrouwbare oordeel, terwijl we willekeurige input filterden.
Het moeilijkste deel was operationeel, wat het opbouwen van een beoordelings-ecosysteem omvatte dat kwaliteit boven kwantiteit beloont. Dat is waar onze gemeenschap onmisbaar werd. Dit zijn geen willekeurige internetgebruikers, maar mensen die echt proberen om hun soft skills te verbeteren en anderen te helpen om hetzelfde te doen. Alle beoordelingen zijn anoniem, wat helpt om de feedback onbevooroordeeld en authentiek te houden.
De community-gedreven “Tinder-achtige” evaluatiemechanisme is fascinerend — hoe vormt deze feedbacklus de voortdurende leerervaring van uw AI?
Elke beoordeling, in elke taal, wordt een klein stukje intelligentie dat ons model verfijnt. Het is een levende feedbacklus. Hoe meer mensen trainen en evalueren, hoe slimmer het systeem wordt in het herkennen van nuances in spraak en emotie, en het leren van hoe mensen daadwerkelijk perceptie, warmte of autoriteit over culturen heen waarderen.
Wat waren de belangrijkste lessen die u leerde bij het ontwikkelen van een AI-model dat zich richt op soft skills in plaats van technische competenties?
De belangrijkste uitdaging was meting. Er is geen universele maatstaf voor “betrouwbaar” of “charismatisch”. We moesten onze eigen maatstaf creëren.
Dit is waar de Wet van de grote aantallenbij kwam. Als 100.000 mensen het erover eens zijn dat een bepaalde stem vertrouwenwekkend of empathisch klinkt, kun je beginnen met vertrouwen in die collectieve perceptie. In de loop van de tijd leerden we onze AI om subjectieve kwaliteiten te voorspellen, dingen die niet met een eenvoudig goed of fout kunnen worden beoordeeld. Dat was de doorbraak: leren om te kwantificeren wat altijd als intangible werd beschouwd.
Met $14 miljoen aan jaarlijkse omzet en een verse $3,6 miljoen seedronde, wat zijn uw belangrijkste prioriteiten voor deze volgende fase van groei — of het nu gaat om het verbeteren van het AI-model, het uitbreiden van de gebruikersbasis of het verdiepen van de community-ervaring?
Onze missie is altijd mensgericht geweest. We helpen mensen om met meer vertrouwen en authenticiteit te communiceren.
De volgende fase is het opschalen van die impact wereldwijd. We breiden uit naar nieuwe talen en geografische gebieden en ontwikkelen nieuwe soft-skillmodules, zoals onderhandelen, actief luisteren en eloquentie.
Veel gebruikers zeggen dat AI-coaches robotachtig of onpersoonlijk aanvoelen. Hoe zorgt u ervoor dat Vocal Image emotioneel resonante en contextueel bewuste feedback levert?
We focussen op hyperpersonalisatie. Vanaf de eerste interactie leren we wie je bent, inclusief je accent, leeftijd, professionele context en spreekpatronen. In de loop van de tijd hebben we geheugen, herinneren we ons hoe je bent verbeterd, waar je moeite mee hebt en welke feedback het meest resoneert.
Dat stelt de AI in staat om dynamisch aan te passen. De ervaring voelt persoonlijk omdat het inderdaad persoonlijk is. Het is volledig gevormd door jouw gegevens en jouw reis, niet door een generieke script.
Kijkt u vooruit, hoe ziet u de toekomst van AI-soft skills coaching met het voortdurend rijpen van generatieve en emotionele AI?
Menselijke ontwikkeling is altijd een mengeling van natuur en opvoeding geweest. Wetenschap vertelt ons dat leiderschap ongeveer voor de helft aangeboren en voor de helft aangeleerd is. Het aangeleerde deel was vroeger voorbehouden aan executives die dure coaches konden betalen. Voor een lange tijd moesten bedrijven tussen $7.000 en $25.000 per jaar betalen voor het coachen van één leider. AI verandert dat.
Ook moet je, om met menselijke trainers te werken, veel verschillende coaches in dienst nemen, terwijl een AI-coach al die coaches kan vervangen.
Op dit moment gebruiken we een reeks van verschillende modellen om verschillende aspecten van communicatie te analyseren, maar de toekomst is een enkel, geïntegreerd systeem dat je holistisch evalueert en gidst. Deze technologie zal groei democratiseren. Je hebt geen charisma of een groot bedrijfsbudget nodig om communicatie te beheersen. Je hebt alleen nieuwsgierigheid en toegang nodig, en het creëren van een omgeving waarin dat kan floreren, is wat me elke dag drijft.
Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen Vocal Image bezoeken.












