Interviews

Nick Lahoika, Co-Founder und CEO von Vocal Image – Interview-Serie

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Nick Lahoika ist der Co-Founder und CEO von Vocal Image, einem Coaching-Startup, das Menschen hilft, Soft Skills zu entwickeln. Als Serien-Unternehmer mit über 10 Jahren Erfahrung in IT und Business-Entwicklung hat Nick zwei Unternehmen erfolgreich verlassen, bevor er Vocal Image gründete. Nicks Reise ist tief persönlich; er wurde in der Schule wegen unklarer Aussprache gemobbt, was ihn zu seinem Ziel inspirierte, Menschen zu helfen, besser zu kommunizieren.

Nachdem er gezwungen war, sein Heimatland nach der Revolution 2020 zu verlassen, kam Nick nach Estland mit minimalen Englischkenntnissen und nutzte seine eigene App, um seine Stimme zu trainieren, und sicherte sich innerhalb von sechs Monaten seine erste Finanzierungsrunde. Der Gewinner des AWS AI Challenge und des Meta x Hugging Face European AI Startup Program, Vocal Image, hat kürzlich eine Seed-Finanzierungsrunde von 3,6 Millionen Dollar von Educapital (Frankreich) erhalten und ist auf über 14 Millionen Dollar Umsatz pro Jahr gewachsen.

Sie haben Vocal Image 2021 gegründet. Was hat Sie dazu inspiriert, einen AI-Soft-Skills-Coach zu entwickeln, und welches Problem wollten Sie zu Beginn lösen?

Sprechangst war ein Teil meines Lebens für eine lange Zeit. Ich wurde in der Schule wegen unklarer Aussprache gemobbt, und diese Erfahrung hat mich wirklich geprägt. Später, als IT-Student, musste ich vor hochrangigen Kunden präsentieren, und die gleiche Angst kam zurück.

Dann, 2021, nach der gescheiterten Revolution in Belarus, musste ich über Nacht nach Europa umziehen. Plötzlich musste ich vor Investoren in Englisch sprechen, einer Sprache, die ich kaum sprach. Es war beängstigend, aber es gab keine Wahl. Ich verbrachte Stunden jeden Tag damit, meine Aussprache mit einer sehr frühen Version von dem zu üben, was später zu Vocal Image werden würde. Es dauerte sogar Wochen, nur um zu lernen, wie man den “V”-Laut richtig ausspricht, damit ich den Namen meines eigenen Unternehmens sagen konnte.

Wir begannen mit einer App, die im Wesentlichen wie YouTube war, aber mit einem integrierten Sprachrekorder und einer Kommentarfunktion. Benutzer konnten Videos ansehen, die Zeilen wiederholen und dann ihre eigenen Aufnahmen anhören. Wenn man sah, wie die Leute es nutzten, wurde schnell klar, dass sie verzweifelt nach Feedback suchten. Unsere frühen Benutzer zeigten uns, dass das bloße Konsumieren von Inhalten nicht ausreichte, um echte Ergebnisse zu erzielen; sie benötigten sofortiges Feedback. Wir versuchten, Feedback durch menschliche Coaches zu liefern, aber dieser Ansatz war nicht skalierbar, und so kamen wir zur Nutzung von AI.

Es war meine persönliche Erkenntnis, dass es für mich einfacher war, meine ersten Präsentationen mit unserer Plattform zu üben, anstatt mit einer Person. Es gab keinen Druck, keine Beurteilung. Diese Freiheit hat alles für mich geändert. Als ich mein eigenes Problem gelöst hatte, erkannte ich, wie viele Menschen mit dem gleichen Problem konfrontiert sind. Mehr als 200 Millionen Menschen leiden unter Sprechangst.

Bevor Vocal Image, haben Sie ein Tanzstudio geleitet. Wie hat Ihre Erfahrung im Bereich Bewegung und Ausdruck Ihre Herangehensweise an Kommunikation und Stimmsicherheit beeinflusst?

Ich war kein Tänzer; ich habe tatsächlich ein Unternehmen aufgebaut, das sich auf Selbstausdruck und Menschen konzentrierte. Durch diese Arbeit erkannte ich, dass man viel über die innere Sicherheit einer Person erfahren kann, indem man sie tanzen sieht.

Bewegung spielt auch eine enorme Rolle bei der Art und Weise, wie man sich ausdrückt. Die Art, wie man sich bewegt, die Haltung, die Atmung, all dies ist Teil der Kommunikation. Das ist der Punkt, an dem AI-Coaching powerful wird, da es Menschen helfen kann, in all diesen Bereichen an einem Ort zu trainieren.

Früher mussten Unternehmen mehrere verschiedene Coaches einstellen. Einen für öffentliches Sprechen, einen für Körpersprache, einen für Selbstsicherheit. Jetzt, mit AI, ist all dies verbunden. Man kann das gesamte Bild der Kommunikation aufbauen, nicht nur einen Teil davon.

Im Gegensatz zu den meisten AI-Kommunikations-Tools haben Sie sich entschieden, ChatGPT nicht als Grundlage für Ihren Coach zu verwenden. Was führte zu dieser Entscheidung?

Der Hype um ChatGPT wurde tatsächlich zu einem wichtigen Wendepunkt für uns. Als es mainstream wurde, schuf es einen massiven Anstieg des Vertrauens in AI, und wir konnten davon profitieren, um Menschen dazu zu bringen, an unsere eigene Technologie zu glauben.

Aber hier ist das Ding: Wir wollten es definitiv nicht als Grundlage verwenden. Unser Ziel von Anfang an war es, unser eigenes Modell zu verwenden, um die Stimme und die Sprechmuster der Menschen zu bewerten. Wir verwenden große Sprachmodelle wie Gemini, Claude und ChatGPT sowie Wissensbasen, Tipps und Tricks aus der Kommunikationsliteratur in unseren aktuellen Modellen, aber sie sind nicht der Kern unseres Feedback-Mechanismus. Die wahre Grundlage unseres Feedbacks ist menschliche Eingabe.

Die Angst vor AI-Coaching, das sich roboterhaft anfühlt, ist real. Um dies zu bekämpfen, haben wir innerhalb von Vocal Image eine Gemeinschaft aufgebaut, in der Benutzer sofort miteinander in Verbindung treten, ein gemeinsames Ziel der Verbesserung ihrer Kommunikation verfolgen und sich gegenseitig auf ihrer Reise unterstützen können. Und diese Gemeinschaft wächst und verbessert ständig unsere AI.

Können Sie erläutern, wie das Training Ihres AI-Modells ausschließlich auf menschliche Stimmen im Vergleich zu herkömmlichen LLM-basierten Ansätzen in Bezug auf Ergebnisse und Authentizität unterscheidet?

Wir verwenden große Sprachmodelle als Teil des Prozesses für die Bewertung und den Kontext, aber die wahre Grundlage unseres Systems ist die Datenmenge dahinter. Unser Kernmodell wurde auf unserer eigenen Gemeinschaft trainiert, die aus Menschen besteht, die sich speziell zusammengetan haben, um ihre Kommunikationsfähigkeiten zu verbessern.

AI ist nur so gut wie die Menschen, von denen es lernt. Unser proprietäres Dataset umfasst nun über eine Million einzigartige menschliche Stimmen, jede mit Ton, Rhythmus und Emotion, all dies repräsentiert die wahre Essenz der Kommunikation.

Ihr Dataset umfasst über eine Million menschliche Stimmen. Welche Herausforderungen haben Sie bei der Kuratierung und Markierung eines solch einzigartigen Korpus erlebt?

Man kann sich nicht gleichmäßig auf jeden Datenpunkt verlassen. Einige Benutzer bewerten sorgfältig, andere klicken einfach durch. Wir mussten ein System entwickeln, das zwischen sorgfältigem Feedback und Rauschen unterscheidet. Im Laufe der Zeit haben wir gelernt, Benutzern mit konsistenter Teilnahme und zuverlässigem Urteil mehr Gewicht zu geben, während wir zufällige Eingaben filterten.

Der schwierigste Teil war operativ, was das Aufbauen eines Bewertungssystems beinhaltete, das Qualität über Quantität stellt. Dort wurde unsere Gemeinschaft unschätzbar wertvoll. Diese sind keine zufälligen Internetbenutzer, sondern Menschen, die ernsthaft daran arbeiten, ihre Soft Skills zu verbessern und anderen dabei zu helfen. Alle Bewertungen sind anonym, was dazu beiträgt, dass das Feedback unvoreingenommen und authentisch bleibt.

Die community-getriebene “Tinder-ähnliche” Bewertungsmechanik ist faszinierend – wie formt diese Feedback-Schleife das kontinuierliche Lernen Ihres AI-Modells?

Jede Bewertung, in jeder Sprache, wird zu einem kleinen Teil des Intellekts, der unser Modell verfeinert. Es ist eine lebendige Feedback-Schleife. Je mehr Menschen trainieren und bewerten, desto intelligenter wird das System darin, Nuancen der Sprache und Emotionen zu erkennen, zu lernen, wie Menschen tatsächlich Wahrnehmungen von Vertrauen, Wärme oder Autorität über Kulturen hinweg wahrnehmen.

Was waren die wichtigsten Lektionen, die Sie beim Entwickeln eines AI-Modells gelernt haben, das auf Soft Skills und nicht auf technische Fähigkeiten ausgerichtet ist?

Die größte Herausforderung war die Messung. Es gibt keinen universellen Maßstab für “vertrauenswürdig” oder “charismatisch”. Wir mussten unseren eigenen erstellen.

Hier kam das Gesetz der großen Zahlen ins Spiel. Wenn 100.000 Menschen übereinstimmen, dass eine bestimmte Stimme selbstsicher oder empathisch klingt, kann man diesem kollektiven Eindruck vertrauen. Im Laufe der Zeit haben wir unsere AI gelehrt, subjektive Qualitäten vorherzusagen, Dinge, die nicht mit einem einfachen Richtig oder Falsch bewertet werden können. Das war der Durchbruch: Lernen, das Unmessbare zu quantifizieren.

Mit 14 Millionen Dollar Umsatz pro Jahr und einer frischen Seed-Finanzierungsrunde von 3,6 Millionen Dollar, was sind Ihre Hauptprioritäten für die nächste Wachstumsphase – sei es das Vorantreiben des AI-Modells, die Erweiterung der Benutzerbasis oder die Vertiefung der Community-Erfahrung?

Unsere Mission war immer menschenzentriert. Wir helfen Menschen, mit mehr Selbstsicherheit und Authentizität zu kommunizieren.

Die nächste Phase besteht darin, diesen Einfluss global zu skalieren. Wir erweitern uns in neue Sprachen und geografische Regionen und entwickeln neue Soft-Skill-Module wie Verhandlung, aktives Zuhören und Eloquenz.

Viele Benutzer sagen, dass AI-Coaches roboterhaft oder unpersönlich wirken. Wie stellen Sie sicher, dass Vocal Image emotional resonantes und kontextbewusstes Feedback liefert?

Wir konzentrieren uns auf Hyper-Personalisierung. Von der ersten Interaktion lernen wir, wer Sie sind, einschließlich Ihres Akzents, Ihres Alters, Ihres beruflichen Kontexts und Ihrer Sprechmuster. Im Laufe der Zeit haben wir ein Gedächtnis, das sich daran erinnert, wie Sie sich verbessert haben, wo Sie Schwierigkeiten haben und welches Feedback am meisten Resonanz findet.

Das ermöglicht es der AI, dynamisch anzupassen. Die Erfahrung fühlt sich persönlich an, weil sie es ist. Sie wird vollständig von Ihren Daten und Ihrer Reise geformt, nicht von einem generischen Skript.

Wenn man in die Zukunft blickt, wie sehen Sie die Entwicklung von AI-Soft-Skills-Coaching, wenn generative und emotionale AI weiterreifen?

Menschliche Entwicklung ist immer eine Mischung aus Natur und Erziehung. Die Wissenschaft sagt uns, dass Führung etwa zur Hälfte angeboren und zur Hälfte erlernt ist. Der erlernte Teil war früher den Exekutiven vorbehalten, die sich teure Coaches leisten konnten. Für eine lange Zeit mussten Unternehmen zwischen 7.000 und 25.000 Dollar pro Jahr für die Schulung eines einzelnen Führungskräfts ausgeben. AI ändert das.

Außerdem würde die Interaktion mit menschlichen Trainern die Beibehaltung mehrerer separater Coaches erfordern, während ein AI-Coach alle ersetzen kann.

Im Moment verwenden wir eine Pipeline verschiedener Modelle, um verschiedene Aspekte der Kommunikation zu analysieren, aber die Zukunft ist ein einziges, vereinigtes System, das Sie holistisch bewertet und leitet. Diese Technologie wird das Wachstum demokratisieren. Sie werden nicht charismatisch geboren oder einen großen Unternehmensbudget benötigen, um die Kommunikation zu meistern. Sie werden nur Neugier und Zugang benötigen, und die Schaffung einer Umgebung, in der dies gedeihen kann, ist das, was mich jeden Tag antreibt.

Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten Vocal Image besuchen.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.