Thought leaders

Hoe gebruikt u generatieve AI-stemmen op een ethische manier voor bedrijven in 2023

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Het einde van 2022 kwam op het moment dat AI-technologieën breed werden geadopteerd vanwege de verbluffende populariteit van OpenAI en ChatGPT. Voor het eerst bereikte AI een massamarkt door zijn nut en waarde te bewijzen bij het creëren van succesvolle bedrijfsresultaten.

Veel AI-technologieën die voor gewone mensen in 2023 een revolutie lijken, zijn eigenlijk al enkele jaren actief gebruikt door grote bedrijven en media. Sluit u aan bij mij terwijl ik een nadere blik werp op de technologie achter deze oplossingen, met name generatieve AI-systemen voor stemkloning, de voordelen voor bedrijven en ethische benaderingen voor het gebruik van AI.

Hoe werkt stemkloning?

Kort gezegd, stemkloning stelt één persoon in staat om te spreken met de stem van een andere persoon.

Het gebruikt generatieve AI-technologie om opnames van iemands stem te maken en deze te gebruiken om nieuwe audio-inhoud te genereren met dezelfde stem. Het stelt mensen eigenlijk in staat om te horen wat iemand zou hebben gezegd, zelfs als ze het zelf niet hebben gezegd.

Vanuit technisch oogpunt lijken de dingen niet zo ingewikkeld. Maar als je een beetje dieper duikt, zijn er enkele minimale vereisten om te beginnen:

  1. U hebt minstens 5 minuten aan hoge kwaliteit opgenomen audio van de bronstem nodig om deze te klonen. Deze opnames moeten duidelijk zijn en vrij van achtergrondruis of andere storingen, omdat eventuele imperfecties de nauwkeurigheid van de uitvoer van het model kunnen beïnvloeden.
  2. Daarna voert u deze opnames in een generatief AI-model in om een “stemavatar” te maken.
  3. Vervolgens traint u het model om spraakpatronen in toonhoogte en timing nauwkeurig te reproduceren.
  4. Zodra dit is voltooid, kan het getrainde model onbeperkte inhoud genereren met de bronstem van elke andere persoon, waardoor het een effectief hulpmiddel wordt voor het creëren van realistisch klinkende replica-stemmen.

Dit is het punt waarop veel mensen ethische bezwaren hebben. Wat gebeurt er als we elke tekst in de mond van een andere persoon kunnen stoppen en het onmogelijk is om te zeggen of die woorden echt of nep zijn?

Ja, deze mogelijkheid is al lang een realiteit. Net als in het geval van OpenAI en ChatGPT, worden we momenteel geconfronteerd met een aantal ethische problemen die niet genegeerd kunnen worden.

Ethische normen in AI

Net als bij veel andere nieuwe technologieën in hun eerste fasen van adoptie, is de belangrijkste bedreiging het creëren van een negatieve stigma rond de technologie in plaats van het erkennen van de bedreigingen als een bron voor discussie en waardevolle kennis. Wat belangrijk is, is het blootleggen van de methoden die slechte actoren gebruiken om de technologie en haar producten te misbruiken, het toepassen van mitigatie-instrumenten en het blijven leren.

Vandaag hebben we drie lagen van kaders voor ethische normen met betrekking tot het gebruik van generatieve AI. De nationale en bovennationale regelgevende lagen zijn in hun eerste fase van ontwikkeling. De beleidsmakers kunnen de snelheid van de ontwikkeling van opkomende technologie niet bijhouden, maar we kunnen al zien dat de EU de leiding neemt met de EU-voorstel voor AI-regulering en De versterkte gedragscode van 2022 inzake desinformatie die de verwachtingen uiteenzet voor grote technologiebedrijven om de verspreiding van kwaadaardige AI-gemanipuleerde inhoud aan te pakken. Op nationaal niveau zien we de eerste regelgevende stappen van de VS en het VK bij het aanpakken van het probleem met de Nationaal Deepfake en Digitale Herkomst Task Force van de VS en de Online Safety Bill van het VK.

De laag van de technologie-industrie beweegt zich sneller, omdat bedrijven en technici deze nieuwe realiteit accepteren zoals die zich voordoet bij opkomende technologieën en hun impact op de veiligheid en privacy van de samenleving. De discussie over de ethiek van generatieve AI is levendig en heeft de weg gebaand voor het ontwikkelen van branche-initiatieven voor gedragscodes rond het gebruik van generatieve AI (bijv. De gedragscode van de Partnership on AI voor synthetische media) en ethische verklaringen die zijn uitgegeven door verschillende bedrijven. De vraag is, hoe maak je de gedragscode praktisch? En zijn ze in staat om producten, specifieke functies en procedures van teams te beïnvloeden?

Ik heb, na met een aantal verschillende media- en entertainment-, cybersecurity- en AI-ethiek-gemeenschappen te hebben gewerkt, een aantal praktische principes geformuleerd voor het omgaan met AI-inhoud en -stemmen in het bijzonder:

  1. Eigendomsrechtelijke eigenaren en het bedrijf dat de gekloonde stem gebruikt, kunnen veel van de potentiële complicaties die samenhangen met het gebruik van oorspronkelijke stemmen vermijden door juridische overeenkomsten te sluiten.
  2. Projecteigenaren moeten het gebruik van een gekloonde stem openbaar maken, zodat luisteraars niet worden misleid.
  3. Bedrijven die werken aan AI-technologie voor stemmen, moeten een percentage van hun middelen toewijzen aan het ontwikkelen van technologie die in staat is om AI-gegenereerde inhoud te detecteren en te identificeren.
  4. Het labelen van AI-gegenereerde inhoud met watermerken maakt stemverificatie mogelijk.
  5. Elke AI-serviceprovider moet elk project beoordelen op zijn impact (op sociaal, zakelijk en privacyniveau) voordat hij ermee instemt om eraan te werken.

Natuurlijk zullen de principes van ethiek in AI de verspreiding van zelfgemaakte diepe vervalsingen online niet beïnvloeden. Maar ze zullen wel projecten in het grijs buiten het bereik van de openbare markt duwen.

In 2021-22 werden AI-stemmen gebruikt in verschillende mainstream-projecten die forse implicaties hadden voor ethiek en samenleving. Deze omvatten het klonen van de stem van jonge Luke Skywalker voor de serie The Mandalorian, AI-stem voor God of War 2 en de stem van Richard Nixon voor de historische toespraak ‘In geval van maandramp’.

Het vertrouwen in technologie groeit verder dan media en entertainment. Traditionele bedrijven in veel branches gebruiken gekloonde stemmen in hun projecten. Hier zijn enkele van de meest prominente use cases.

Branchetoepassingen

In 2023 zal stemkloning zijn opkomst voortzetten naast verschillende bedrijven die de vele voordelen ervan zullen plukken. Van de gezondheidszorg en marketing tot klantenservice en de reclame-industrie, verandert stemkloning de manier waarop organisaties relaties opbouwen met hun klanten en hun workflows stroomlijnen.

Stemkloning heeft voordelen voor gezondheidsprofessionals en sociaal werkers die in een online omgeving werken. Digitale avatars met dezelfde stem als medische professionals versterken de banden tussen hen en hun patiënten, waardoor vertrouwen wordt gewonnen en klanten worden behouden.

De potentiële toepassingen van stemkloning in de film- en entertainmentindustrie zijn uitgebreid. Het nasynchroniseren van inhoud in meerdere talen, het vervangen van kinder- en volwassen dialogen (ADR) en een bijna oneindig aantal aanpassingsmogelijkheden worden allemaal mogelijk gemaakt door deze technologie.

Evenzo kan AI-gestuurde stemkloning in de operationele sector uitstekende resultaten opleveren voor merken die op zoek zijn naar kostenefficiënte oplossingen voor interactieve spraaksystemen of bedrijfstrainingvideo’s. Met stemsynthesetechnologie kunnen acteurs hun bereik uitbreiden en hun vermogen om royalty’s te verdienen van opnames verhogen.

Tenslotte heeft de opkomst van stemkloning in reclameproductiestudio’s geholpen om de kosten en het aantal uren dat nodig is voor commerciële productie aanzienlijk te verlagen. Zolang er een hoge kwaliteit opname beschikbaar is voor kloning (zelfs van niet-beschikbare acteurs), kunnen reclameboodschappen snel en creatiever dan ooit tevoren worden geproduceerd.

Het is interessant om te zien dat ondernemingen en kleine en middelgrote ondernemingen (SMB’s) gebruik kunnen maken van stemkloning om iets unieks voor hun merken te creëren. Grote projecten kunnen hun meest ambitieuze plannen realiseren, terwijl kleine bedrijven toegang kunnen krijgen tot eerder kostbare schaalmodellen. Dat is wat echte democratisering betekent.

Samenvatting

AI-stemkloning biedt bedrijven baanbrekende voordelen, zoals het creëren van unieke klantervaringen, het integreren van natuurlijke taalverwerking in hun producten en diensten en het genereren van zeer nauwkeurige imitaties van stemmen die volledig echt klinken.

Bedrijven die in 2023 hun concurrentievoordeel willen behouden, moeten kijken naar AI-stemkloning. Bedrijven kunnen deze technologie gebruiken om een verscheidenheid aan nieuwe mogelijkheden te openen om marktaandeel te winnen en klanten te behouden, terwijl ze dit op een ethisch verantwoorde manier doen.

Anna is Head of Ethics and Partnerships at Respeecher, een met een Emmy Award bekroonde voice cloning technologie met vestiging in Oekraïne. Anna is een voormalig beleidsadviseur bij Reface, een door AI aangedreven synthetische media-app en een tech-co-founder van het counter disinformation tool Cappture, gefinancierd door het Startup Wise Guys acceleratorprogramma. Anna heeft 11 jaar ervaring in veiligheids- en defensiebeleid, technologie en resilience building. Ze is een voormalig onderzoeksmedewerker bij het International Centre for Defence and Security in Tallinn en het Prague Security Studies Institute. Ze heeft ook grote Oekraïense bedrijven geadviseerd over resilience building als onderdeel van de Hybrid warfare Task Force bij de Kyiv School of Economics.