Interviews

Matt Hocking, mede-oprichter van WellSaid Labs – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Matt Hocking is de mede-oprichter van WellSaid Labs, een toonaangevende onderneming op het gebied van AI-voicegeneratie. Hij heeft meer dan 15 jaar ervaring met het leiden van teams en het leveren van technologische oplossingen op grote schaal.

Uw achtergrond is redelijk ondernemend, hoe bent u voor het eerst betrokken geraakt bij AI?

Ik denk dat ik me altijd vrij ondernemend heb gevoeld. Ik startte mijn eerste bedrijf na mijn studie en met een achtergrond in productontwerp, ben ik me gaan richten op het helpen van mensen met vroege ideeën. Gedurende mijn carrière heb ik het geluk gehad om met een aantal startups te werken die heel succesvol zijn geweest. Tijdens die ervaringen heb ik veel goede oprichters ontmoet en dat heeft me geïnspireerd om mijn eigen ideeën als oprichter te volgen. AI was relatief nieuw voor me toen ik bij AI2 kwam, maar die ervaring gaf me de kans om mijn product- en startupkennis toe te passen op echt geweldig onderzoek en me voor te stellen hoe deze nieuwe ontwikkelingen veel mensen in de komende jaren zouden kunnen helpen. Mijn doel vanaf het begin is geweest om echte bedrijven te ontwikkelen voor echte mensen, en ik geloof dat AI veel spannende kansen en efficiëntie kan creëren in onze toekomst als het op een verantwoorde manier wordt toegepast.

Kunt u het verhaal vertellen over hoe het idee voor WellSaid Labs ontstond toen u ondernemer in residence was bij The Allen Institute for AI?

Ik sloot me aan bij The Allen Institute for Artificial Intelligence (AI2) als ondernemer in residence in 2018. Het is waarschijnlijk het meest innovatieve incubator ter wereld, AI2 herbergt de slimste geesten in AI die oplossingen van de rand van wat mogelijk is vandaag toepassen op tastbare producten die problemen over de hele wereld oplossen. Mijn achtergrond in ontwerp en technologie heeft een langdurige interesse in de creatieve velden gekoesterd, en met de AI-boom die we vandaag meemaken, wilde ik een manier vinden om de twee te verbinden. Ik ontmoette Michael Petrochuk (mede-oprichter en CTO van WellSaid Labs) tijdens het ontwikkelen van een interactieve gezondheidsapp die patiënten door verschillende gevoelige scenario’s leidde. Tijdens het proces van het ontwikkelen van de inhoud voor de ervaring, werkte mijn team met voice-talent om duizenden regels voice-over voor de avatar vooraf op te nemen. Toen ik werd blootgesteld aan enkele van de doorbraken die Michael had behaald tijdens zijn onderzoek, zagen we beiden snel de waarde in van hoe mens-pariteit tekst-naar-spraak (TTS) niet alleen het product waar ik aan werkte, maar ook andere toepassingen en industrieën kon transformeren. Technologie en gereedschap hadden moeite om de behoeften van producenten die met voice als medium werkten, bij te houden. We zagen een pad om deze technologie in handen van alle makers te leggen, waardoor voice een integraal onderdeel van alle verhalen kon zijn.

WellSaid Labs is een van de weinige bedrijven die voice-acteurs een mogelijkheid biedt om deel te nemen aan de AI-stemruimte. Waarom vond u het belangrijk om echte stemmen in het product te integreren?

Ons antwoord is tweeledig: eerst wilden we oplossingen creëren die de capaciteiten van professionele voice-acteurs aanvullen, waardoor kansen voor voice worden uitgebreid. En ten tweede streven we ernaar om het hoogste niveau van menselijke kwaliteit in onze producten te hebben. Onze voice-acteurs zijn langdurige collaboratieve partners en ontvangen compensatie en winstaandeel voor zowel hun stemgegevens als de inhoud die met hun gegevens wordt geproduceerd. Elke voice-actor die we inhuuren om een AI-stemavatar te maken op basis van de gelijkenis van hun stem, wordt betaald op basis van hoeveel hun stem op ons platform wordt gebruikt. We moedigen talent aan om met ons te partnerschapen; eerlijke compensatie voor hun bijdragen is ontzettend belangrijk voor ons.

Om het hoogste niveau van menselijke kwaliteitproducten op de markt te bieden, moeten we streng zijn over waar we onze gegevens vandaan halen. Dit proces geeft ons meer controle over de kwaliteit, aangezien we onze diepe leermodellen trainen om zowel mens-pariteit als specifiek contextueel relevante stijlen te spreken. We creëren geen stem die alleen de verstrekte invoer herhaalt. Onze modellen bieden een verscheidenheid aan stemstijlen die presteren wat er op de pagina staat. Of gebruikers nu voice-over maken door een avatar uit onze bibliotheek te gebruiken of door een aangepaste stem voor hun merk te maken, we gebruiken echte stemgegevens om een naadloos proces en een gemakkelijk te gebruiken platform te garanderen. Als onze klanten onze stemmen in de postproductie moesten manipuleren en bewerken, zou het proces van het verkrijgen van de gewenste output onhandig en lang zijn. Onze stemmen nemen de context van de geschreven inhoud en bieden een contextueel accurate lezing. We bieden stemmen voor alle soorten use-cases – of het nu gaat om het voorlezen van het nieuws, het maken van een audio-advertentie of geautomatiseerde callcenterondersteuning – dus het partnerschap met professioneel voice-talent voor elk use-case biedt ons zowel context als hoge kwaliteit stemgegevens.

We werken regelmatig bij en voegen nieuwe stijlen en accenten toe aan onze avatarbibliotheek om ervoor te zorgen dat we de stemmen van onze klanten vertegenwoordigen. In de Studio van WellSaid Labs kunnen klanten en merken verschillende stemmen beluisteren op basis van regio, stijl en use-case, waardoor een meer naadloos en geïntegreerd productieproces van audio-inhoud mogelijk wordt, aangepast aan de behoeften van de maker. Zodra een initiële opname is bemonsterd, kunnen gebruikers specifieke woorden, spellingscontrole en uitspraak aanwijzen om ervoor te zorgen dat de AI consistent naar hun behoeften spreekt.

WellSaid Labs legt claim op de eerste ethische AI-stemplatform. Waarom zijn AI-ethiek belangrijk voor u?

Naarmate de adoptie van AI toeneemt en meer mainstream wordt, zijn angsten over schadelijke use-cases en slechte actoren centraal in elk gesprek – en deze zorgen worden helaas bevestigd door echte gebeurtenissen. AI-stem is geen uitzondering; bijna elke dag komt er een nieuw rapport over een beroemde, openbare figuur of politicus die wordt diepgefaked voor advertenties of politieke doeleinden in het nieuws. Hoewel formele federale regelgeving met betrekking tot deze technologie nog in ontwikkeling is, zal het detecteren en bestrijden van kwaadwillige actoren en het misbruik van synthetische stem steeds moeilijker worden naarmate de technologie vordert.

Vanuit AI2, waar AI-ethiek een kernprincipe is, hadden Michael en ik deze gesprekken vanaf de eerste dag. Het ontwikkelen van AI-spraaktechnologie komt met aanzienlijke verantwoordelijkheden met betrekking tot toestemming, privacy en algehele veiligheid. We weten dat we, als ontwikkelaars, onze technologie veilig moeten bouwen, ethische zorgen moeten aanpakken en de basis moeten leggen voor de toekomstige ontwikkeling van synthetische stemmen. We erkennen het potentieel van AI-spraaktechnologie voor misbruik en omarmen onze verantwoordelijkheid om het potentieel misbruik van ons product te verminderen. We moeten deze basis vanaf de eerste dag leggen, in plaats van snel te handelen en fouten te maken onderweg. Dat zou niet juist zijn voor onze ondernemingsklanten en voice-acteurs, die op ons vertrouwen om een hoogwaardig, betrouwbaar product te bouwen.

We steunen volledig de oproep tot wetgeving op dit gebied; echter, we zullen niet wachten op federale regelgeving om te worden uitgevaardigd. We hebben altijd prioriteit gegeven aan en zullen blijven prioriteit geven aan praktijken die privacy, beveiliging, transparantie en verantwoordelijkheid ondersteunen.

We houden ons strikt aan de ethische code van intentie van ons bedrijf, die is gebaseerd op het bouwen met verantwoorde innovatie in elke beslissing die we nemen. Dit is in het beste belang van onze wereldwijde klanten – ondernemingsmerken.

Hoe ontwikkelt u een ethisch AI-stemplatform?

WellSaid Labs is vanaf het begin toegewijd aan ethische innovatie. We centraliseren vertrouwen en transparantie door het gebruik van in-house datamodellen, expliciete toestemmingsvereisten, ons contentmoderatieprogramma en ons engagement voor merkbescherming. Bij WellSaid, vertrouwen we op de principes van Verantwoorde AI om onze beslissingen en ontwerpen te vormen, en die principes strekken zich uit tot het gebruik van onze stemmen. Onze code van ethiek vertegenwoordigt deze principes als Verantwoordelijkheid, Transparantie, Privacy en Beveiliging, en Eerlijkheid.

Verantwoordelijkheid: We handhaven strikte standaarden voor geschikte inhoud, waardoor het gebruik van onze stemmen voor inhoud die schadelijk, hatelijk, frauduleus of bedoeld is om geweld aan te wakkeren, wordt verboden. Ons Trust & Safety-team handhaaft deze standaarden met een rigoureus contentmoderatieprogramma, waardoor gebruikers die proberen onze Gebruiksvoorwaarden te schenden, worden geblokkeerd en verwijderd.

Transparantie: We vereisen expliciete toestemming voordat we een synthetische stem met iemands stemgegevens bouwen. Gebruikers kunnen geen stemgegevens van politici, beroemdheden of iemand anders uploaden om een kloon van hun stem te maken, tenzij we de expliciete, schriftelijke toestemming van die persoon hebben.

Privacy en Beveiliging: We beschermen de identiteit van onze voice-acteurs door stockafbeeldingen en aliassen te gebruiken om de synthetische stemmen te vertegenwoordigen. We moedigen hen ook aan om voorzichtig te zijn over hoe en met wie ze hun associatie met WellSaid Labs of andere synthetische stembedrijven delen, om de kans op misbruik van hun stem te verminderen.

Eerlijkheid: We compenseren alle voice-acteurs die stemgegevens voor ons platform leveren, en we bieden hen een voortdurend aandeel in de opbrengst voor het gebruik van de synthetische stem die we met hun gegevens bouwen.

Naast deze principes respecteren we ook strikt intellectueel eigendom. We claimen geen eigendom over de inhoud die door onze gebruikers of voice-acteurs wordt verstrekt. We prioriteren integriteit, eerlijkheid en transparantie in alles wat we doen, waardoor onze synthetische spraaktechnologie op een verantwoorde en ethische manier wordt gebruikt. We zoeken actief naar partnerships met stemmen uit diverse achtergronden en ervaringen om ervoor te zorgen dat we een stem voor iedereen bieden.

Ons engagement voor verantwoorde innovatie en het ontwikkelen van AI-stemtechnologie met ethiek in het achterhoofd onderscheidt ons van anderen in de ruimte die proberen om te profiteren van een nieuwe, ongereguleerde industrie via elke middel. Onze vroege investeringen in ethiek, veiligheid en privacy leggen vertrouwen en loyaliteit vast bij onze voice-acteurs en klanten, die steeds vaker naar ethisch gemaakte producten en diensten van bedrijven zoeken die aan de voorlopers van innovatie staan.

WellSaid Labs heeft zijn eigen in-house AI-model ontwikkeld dat zijn AI-stemmen in staat stelde om mens-pariteit te bereiken, en dit is bereikt door de imperfecties die mensen in gesprekken hebben, toe te voegen. Wat is het aan deze imperfecties dat de AI beter maakt, en hoe worden deze imperfecties geïmplementeerd?

WellSaid Labs is niet zomaar een andere TTS-generator. Waar vroege TTS-technologie niet in staat was om menselijke spraakeigenschappen zoals toon, pitch en dialect te herkennen die de context en emotie achter de woorden overbrengen, hebben WellSaid-stemmen mens-pariteit bereikt, waardoor uniek menselijke imperfecties in AI-gegenereerde spraak worden gebracht.

Onze primaire maatstaf voor stemkwaliteit is en is altijd menselijke naturaliteit geweest. Dit leidende geloof heeft onze technologie op elk niveau gevormd, van de scriptbibliotheken die we hebben opgebouwd tot de instructies die we aan talent geven, en meer recentelijk, hoe we onze core TTS-algoritmen itereren.

We trainen op authentieke menselijke vocalisaties. Ons voice-talent leest hun scripts authentiek en boeiend wanneer ze voor ons opnemen. Spraakperfectie is daarentegen een mechanisch concept dat leidt tot een robotachtig perfecte, onnatuurlijke output. Wanneer professioneel voice-talent presteert, fluctueert hun toespraakssnelheid. Hun luidheid verandert in overeenstemming met de inhoud die ze lezen. Hun vocale pitch kan stijgen in een passage die een opgewonden lezing vereist en weer dalen in een meer sombere regel. Deze dynamische variaties maken een boeiende menselijke vocale prestatie uit.

Door AI-processen te ontwikkelen die samenwerken met de dynamische prestaties van ons professionele talent, hebben we een echt natuurlijk TTS-platform gebouwd. We hebben het eerste long-form TTS-systeem met predictieve controles ontwikkeld gedurende het hele creatieve proces. Onze fonetische bibliotheek bevat een diverse verzameling van audio-gegevens, waardoor gebruikers specifieke vocale hints, zoals uitspraakbegeleiding of controle, in het model kunnen opnemen tijdens de productiefase. In één platform kunnen WellSaid-gebruikers opnemen, bewerken en styliseren van hun voice-over zonder externe gegevens te hoeven importeren.

Kunt u enkele van de uitdagingen bespreken die u bent tegengekomen bij het opbouwen van een tekst-naar-spraak (TTS) AI-bedrijf?

De ontwikkeling van AI-stemtechnologie heeft een geheel nieuwe reeks obstakels gecreëerd voor zowel producenten als consumenten. Een van de belangrijkste uitdagingen is niet meegaan in de ruis en hype die de AI-sector overspoelt. Als een nieuwe, trendy technologie proberen veel organisaties om in te cashen op korte-termijn AI-stemontwikkelingen. We willen een stem voor iedereen bieden, geleid door centrale ethische principes en authenticiteit. Deze toewijding aan authenticiteit kan de ontwikkeling en implementatie van onze technologie vertragen, maar versterkt de veiligheid en beveiliging van WellSaid-stemmen en hun gegevens.

Een andere uitdaging bij het ontwikkelen van ons TTS-platform was het ontwikkelen van specifieke toestemmingsrichtlijnen om ervoor te zorgen dat organisaties of individuele actoren onze technologie niet zullen misbruiken. Om deze uitdaging aan te pakken, zoeken we naar collaboratieve, langetermijnpartnerschappen en zijn we volledig betrokken bij de ontwikkeling van voice-over om verantwoordelijkheid, transparantie en gebruikersbeveiliging te vergroten. We zoeken actief naar partnerships met voice-talent uit diverse achtergronden, organisaties en ervaringen om ervoor te zorgen dat de bibliotheek van WellSaid Labs-stemmen haar makers en publiek weerspiegelt. Deze processen zijn ontworpen om intentioneel en gedetailleerd te zijn om ervoor te zorgen dat onze technologie zo veilig en ethisch mogelijk wordt gebruikt, wat de ontwikkeling en lanceringstijdlijn kan vertragen.

Wat is uw visie voor de toekomst van generatieve AI-stemmen?

Al een tijdje is AI-spraaktechnologie niet van hoge genoeg kwaliteit om bedrijven in staat te stellen om significante inhoud te creëren op grote schaal. Nu audio-technologie geen dure apparatuur en hardware meer vereist, kan alle geschreven inhoud in een audioformaat worden geproduceerd en gepubliceerd om boeiende, multimodale ervaringen te creëren.

Vandaag kunnen AI-stemmen menselijke audio produceren en de nuances vastleggen die nodig zijn om digitale verhalen toegankelijker en natuurlijker te maken. De toekomst van generatieve AI-stem zal alle luisterervaringen omvatten die elk aspect van ons leven aanraken. Naarmate de technologie vordert, zullen we steeds natuurlijkere en expressievere synthetische stemmen zien die de grens tussen menselijke en machinegegenereerde spraak vervaagden – waardoor nieuwe deuren openen voor bedrijven, communicatie, toegankelijkheid en hoe we met de wereld om ons heen omgaan.

Bedrijven zullen verhoogde personalisatie vinden in AI-steminterfaces en deze gebruiken om interacties met virtuele assistenten meer immersief en gebruikersvriendelijker te maken. Deze verbeteringen gebeuren al, van intelligente callcenteragenten tot fastfooddrive-thru’s. Inhoudcreatie, waaronder advertenties, productmarketing, nieuwslezing, podcasts, audioboeken en andere multimedia, zal een toename van efficiëntie zien door het gebruik van tools om boeiende inhoud te ontwikkelen – uiteindelijk resulterend in meer lift en omzet voor organisaties, vooral nu meertalige modellen een bedrijf in staat stellen om van één punt van oorsprong naar een wereldwijde aanwezigheid uit te breiden. Productieteams zullen veel voordeel vinden in synthetische stemmen om stemmen te creëren die zijn aangepast aan de behoeften van het merk of aangepast aan de luisteraar.

Voordat de introductie van AI, ontbrak TTS-technologie aan het cruciale menselijke gevoel, intonatie en uitspraakvermogen dat nodig is om een volledig verhaal op grote schaal en met gemak te vertellen. Nu biedt AI-geactiveerde TTS meer immersieve en toegankelijke ervaringen, waaronder real-time spraakmogelijkheden en interactieve conversatieagenten.

Het bereiken van menselijke spraakmogelijkheden is een reis geweest, maar nu het haalbaar is, getuigen we van de complete omvang van AI-stem om echte bedrijfswaarde voor organisaties te creëren.

Bedankt voor het geweldige interview, lezers die meer willen leren, moeten WellSaid Labs bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.