Entretiens

Matt Hocking, Co-Fondateur de WellSaid Labs – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Matt Hocking est le co-fondateur de WellSaid Labs, un générateur de voix IA de niveau entreprise. Il a plus de 15 ans d’expérience dans la direction d’équipes et la livraison de solutions technologiques à grande échelle.

Votre parcours est plutôt entrepreneurial, comment êtes-vous impliqué dans l’IA ?

Je me considère comme plutôt entrepreneurial. J’ai créé ma première entreprise après mes études et, avec une formation en design de produits, j’ai tendance à aider les gens avec des idées de démarrage. Au cours de ma carrière, j’ai eu la chance de travailler avec de nombreuses startups qui ont eu des parcours incroyables. Lors de ces expériences, j’ai eu un contact direct avec de nombreux fondateurs exceptionnels, ce qui m’a inspiré à poursuivre mes propres idées en tant que fondateur. L’IA était relativement nouvelle pour moi lorsque j’ai rejoint AI2 ; cependant, cette expérience m’a donné l’opportunité d’appliquer mon regard sur les produits et les startups à des recherches incroyables et d’imaginer comment ces nouvelles avancées allaient pouvoir aider beaucoup de gens dans les années à venir. Mon objectif depuis le début a été de développer de vraies entreprises pour de vraies personnes, et je crois que l’IA a le potentiel de créer des opportunités et des efficacités excitantes dans notre avenir si elle est appliquée de manière réfléchie.

Pouvez-vous partager l’histoire de la conception de l’idée de WellSaid Labs lorsque vous étiez un entrepreneur en résidence à The Allen Institute for AI ?

J’ai rejoint The Allen Institute for Artificial Intelligence (AI2) en tant qu’entrepreneur en résidence en 2018. Sans conteste, c’est l’un des incubateurs les plus innovants au monde, AI2 abrite les esprits les plus brillants en IA qui appliquent des solutions à la pointe de ce qui est possible aujourd’hui à des produits tangibles qui résolvent des problèmes autour du globe. Mon expérience en design et technologie a nourri un intérêt de longue date pour les domaines créatifs, et avec le boom de l’IA que nous vivons aujourd’hui, je voulais explorer un moyen de relier les deux. J’ai rencontré Michael Petrochuk (co-fondateur et CTO de WellSaid Labs) tout en développant une application de santé interactive qui guidait les patients à travers divers scénarios sensibles. Lors du développement du contenu pour l’expérience, mon équipe a travaillé avec des talents vocaux pour enregistrer des milliers de lignes de voix off pour l’avatar. Lorsque j’ai été exposé à certaines des avancées que Michael avait réalisées lors de ses recherches, nous avons tous les deux rapidement vu la valeur de la parité humaine de la synthèse vocale (TTS) pour transformer non seulement le produit sur lequel je travaillais, mais aussi avoir un impact sur de nombreuses autres applications et industries. La technologie et les outils ont lutté pour suivre les besoins des producteurs créant avec la voix comme moyen d’expression. Nous avons vu un chemin pour mettre cette technologie entre les mains de tous les créateurs, permettant à la voix d’être une partie intégrante de toutes les histoires.

WellSaid Labs est l’une des rares entreprises qui offre aux acteurs vocaux un moyen d’accéder à l’espace de la voix IA. Pourquoi croyez-vous qu’il est important d’intégrer de vraies voix dans le produit ?

<p Notre réponse est double : premièrement, nous voulons créer des solutions qui complètent les capacités des acteurs vocaux professionnels, en élargissant les opportunités pour la voix. Et deuxièmement, nous nous efforçons d'avoir le niveau de qualité humaine le plus élevé dans nos produits. Nos acteurs vocaux sont des partenaires collaboratifs à long terme et reçoivent une compensation et une part des revenus pour leurs données vocales et le contenu produit avec celles-ci. Chaque acteur vocal que nous embauchons pour créer un avatar vocal IA basé sur la ressemblance de leur voix est payé en fonction de l'utilisation de leur voix sur notre plateforme. Nous encourageons les talents à nous rejoindre ; une compensation équitable pour leurs contributions est incroyablement importante pour nous.

Pour offrir le niveau de qualité humaine le plus élevé sur le marché, nous devons être rigoureux quant à la source de nos données. Ce processus nous donne plus de contrôle sur la qualité, car nous formons nos modèles d’apprentissage automatique pour parler à la parité humaine et à des styles spécifiques pertinents dans le contexte. Nous ne créons pas simplement une voix qui récite l’entrée fournie. Nos modèles offrent une variété de styles vocaux qui réalisent ce qui est sur la page. Que les utilisateurs créent une voix off en utilisant un avatar de notre bibliothèque ou en créant une voix off avec une voix personnalisée pour leur marque, nous utilisons de vraies données vocales pour assurer un processus fluide et une plateforme facile à utiliser. Si nos clients devaient manipuler et éditer nos voix en post-production, le processus d’obtention de la sortie désirée serait maladroit et long. Nos voix prennent en compte le contexte du contenu écrit et fournissent une lecture contextuellement précise. Nous offrons des voix pour tous les types de cas d’utilisation – que ce soit la lecture des actualités, la création d’une publicité audio ou le support d’un centre d’appel automatisé – donc, le partenariat avec des talents vocaux professionnels pour chaque cas d’utilisation nous fournit à la fois le contexte et les données vocales de haute qualité.

Nous mettons régulièrement à jour et ajoutons de nouveaux styles et accents à notre bibliothèque d’avatars pour nous assurer que nous représentons les voix de nos clients. Dans le Studio de WellSaid Labs, les clients et les marques peuvent auditionner différentes voix en fonction de la région, du style et du cas d’utilisation, permettant une production audio plus fluide et unifiée personnalisée aux besoins du créateur. Une fois qu’un enregistrement initial est échantillonné, les utilisateurs peuvent cibler des mots spécifiques, des orthographes et des prononciations pour s’assurer que l’IA parle spécifiquement à leurs besoins.

WellSaid Labs revendique son titre de première plateforme de voix IA éthique. Pourquoi l’éthique de l’IA est-elle importante pour vous ?

À mesure que l’adoption de l’IA augmente et devient plus mainstream, les craintes de cas d’utilisation nocifs et de mauvais acteurs sont au centre de chaque conversation – et ces préoccupations sont malheureusement validées par des occurrences dans le monde réel. La voix IA ne fait pas exception ; presque chaque jour, un nouveau rapport sur une célébrité, une personnalité publique ou un politicien qui a été deepfake pour des publicités ou à des fins politiques fait les gros titres. Même si la réglementation fédérale formelle concernant cette technologie est encore en évolution, détecter et combattre les acteurs et les utilisations malveillants de la voix synthétique deviendra de plus en plus difficile à mesure que la technologie continuera de progresser.

En provenance d’AI2, où l’éthique de l’IA est un principe fondamental, Michael et moi avons eu ces conversations dès le premier jour. Développer la technologie de la parole IA vient avec des responsabilités importantes en matière de consentement, de confidentialité et de sécurité globale. Nous savons que nous, en tant que développeurs, devons construire notre technologie de manière sûre, aborder les préoccupations éthiques et poser les fondements pour le développement futur des voix synthétiques. Nous reconnaissons le potentiel de la technologie de la parole IA pour une utilisation abusive et assumons notre responsabilité de réduire les abus potentiels de notre produit. Nous devons poser ces fondements dès le premier jour plutôt que de courir vite et de faire des erreurs en chemin. Ce ne serait pas juste envers nos clients entreprises et nos acteurs vocaux, qui comptent sur nous pour construire un produit de haute qualité et digne de confiance.

Nous soutenons pleinement l’appel à la législation dans ce domaine ; cependant, nous n’attendrons pas que les réglementations fédérales soient promulguées. Nous avons toujours privilégié et continuerons de privilégier les pratiques qui soutiennent la confidentialité, la sécurité, la transparence et la responsabilité.

Nous respectons strictement notre code d’intention éthique d’entreprise, qui est basé sur l’innovation responsable dans chaque décision que nous prenons. C’est dans le meilleur intérêt de nos clients mondiaux – les marques entreprises.

Comment développez-vous une plateforme de voix IA éthique ?

WellSaid Labs s’est engagé dans l’innovation éthique dès le départ. Nous centralisons la confiance et la transparence grâce à l’utilisation de modèles de données internes, d’exigences de consentement explicite, de notre programme de modération de contenu et de notre engagement en faveur de la protection des marques. Chez WellSaid, nous nous appuyons sur les principes de l’IA responsable pour façonner nos décisions et nos conceptions, et ces principes s’étendent à l’utilisation de nos voix. Notre code d’éthique représente ces principes en tant que responsabilité, transparence, confidentialité et sécurité, et équité.

Responsabilité : Nous maintenons des normes strictes pour un contenu approprié, interdisant l’utilisation de nos voix pour du contenu qui est nuisible, haineux, frauduleux ou destiné à inciter à la violence. Notre équipe de confiance et de sécurité fait respecter ces normes avec un programme rigoureux de modération de contenu, bloquant et supprimant les utilisateurs qui tentent de violer nos conditions de service.

Transparence : Nous exigeons un consentement explicite avant de construire une voix synthétique avec les données vocales de quelqu’un. Les utilisateurs ne peuvent pas télécharger des données vocales de politiciens, de célébrités ou de toute autre personne pour créer un clone de leur voix à moins que nous n’ayons le consentement écrit explicite de cette personne.

Confidentialité et sécurité : Nous protégeons l’identité de nos acteurs vocaux en utilisant des images de stock et des pseudonymes pour représenter les voix synthétiques. Nous encourageons également les acteurs vocaux à exercer la prudence quant à la façon dont ils partagent leur association avec WellSaid Labs ou d’autres sociétés de voix synthétique pour réduire les opportunités d’abus de leur voix.

Équité : Nous rémunérons tous les acteurs vocaux qui fournissent des données vocales pour notre plateforme et leur offrons une part continue des revenus pour l’utilisation de la voix synthétique que nous construisons avec leurs données.

Avec ces principes, nous respectons également strictement la propriété intellectuelle. Nous ne revendiquons pas la propriété du contenu fourni par nos utilisateurs ou nos acteurs vocaux. Nous privilégions l’intégrité, l’équité et la transparence dans tout ce que nous faisons, en veillant à ce que notre technologie de parole synthétique soit utilisée de manière responsable et éthique. Nous recherchons activement des partenariats avec des voix issues de divers horizons et expériences pour nous assurer que nous offrons une voix à tous.

Notre engagement en faveur de l’innovation responsable et du développement de la technologie de la parole IA avec une éthique en tête nous distingue des autres dans l’espace qui cherchent à capitaliser sur une nouvelle industrie non réglementée par tous les moyens. Nos investissements précoces dans l’éthique, la sécurité et la confidentialité établissent la confiance et la loyauté au sein de nos acteurs vocaux et de nos clients, qui recherchent de plus en plus des produits et des services éthiques des entreprises à la pointe de l’innovation.

WellSaid Labs a créé son propre modèle IA interne qui a permis à ses voix IA d’atteindre la parité humaine, et cela a été réalisé en apportant les imperfections humaines aux conversations. Qu’est-ce qui fait que ces imperfections rendent l’IA meilleure, et comment ces imperfections sont-elles mises en œuvre ?

WellSaid Labs n’est pas simplement un autre générateur de TTS. Lorsque les premières technologies TTS étaient incapables de reconnaître les qualités de la parole humaine comme le ton, la hauteur et le dialecte qui transmettent le contexte et l’émotion derrière les mots, les voix de WellSaid ont atteint la parité humaine, apportant des imperfections humaines uniques à la parole générée par IA.

<p Notre mesure principale de la qualité de la voix est et a toujours été la naturalité humaine. Cette croyance directrice a façonné notre technologie à chaque étape, des bibliothèques de scripts que nous avons construites aux instructions que nous donnons aux talents, et plus récemment, à la façon dont nous itérons sur nos algorithmes TTS de base.

Nous nous formons sur des vocalisations humaines authentiques. Nos talents vocaux lisent leurs scripts de manière authentique et engageante lorsqu’ils enregistrent pour nous. La perfection de la parole, d’un autre côté, est un concept mécanique qui conduit à une sortie robotique, parfaite et peu naturelle. Lorsque les talents vocaux professionnels se produisent, leur taux de parole fluctue. Leur sonorité évolue en conjonction avec le contenu qu’ils lisent. Leur hauteur vocale peut monter dans un passage nécessitant une lecture excitée et redescendre à nouveau dans une ligne plus sombre. Ces variations dynamiques font partie d’une prestation vocale humaine engageante.

En construisant des processus IA qui travaillent en coordination avec les performances dynamiques de nos talents vocaux professionnels, nous avons construit une plateforme TTS vraiment naturelle. Nous avons développé le premier système TTS à longue forme avec des contrôles prédictifs tout au long du processus de création. Notre bibliothèque phonétique contient une collection diverse de données audio, permettant aux utilisateurs d’incorporer des indices vocaux spécifiques, tels que des conseils de prononciation ou une contrôlabilité, dans le modèle pendant la phase de production. Sur une seule plateforme, les utilisateurs de WellSaid peuvent enregistrer, éditer et personnaliser leur voix off sans avoir besoin d’importer des données externes.

Pouvez-vous discuter de certains des défis derrière la construction d’une entreprise de TTS (texte-à-parole) ?

Le développement de la technologie de la voix IA a créé un ensemble entièrement nouveau d’obstacles pour ses producteurs et ses consommateurs. L’un des principaux défis est de ne pas se laisser prendre dans le bruit et l’hype qui inondent le secteur de l’IA. En tant que technologie nouvelle et à la mode, de nombreuses organisations tentent de profiter des développements à court terme de la voix IA. Nous voulons offrir une voix à tous, guidée par des principes éthiques centraux et l’authenticité. Cette adhésion à l’authenticité peut retarder le développement et le déploiement de nos technologies, mais cela renforce la sécurité et la sécurité des voix de WellSaid et de leurs données.

Un autre défi dans le développement de notre plateforme TTS était de développer des directives de consentement spécifiques pour nous assurer que les organisations ou les acteurs individuels n’abuseront pas de notre technologie. Pour relever ce défi, nous recherchons des partenariats collaboratifs et à long terme et sommes pleinement impliqués dans le développement de la voix pour accroître la responsabilité, la transparence et la sécurité des utilisateurs. Nous recherchons activement des partenariats avec des talents vocaux issus de divers horizons, d’organisations et d’expériences pour nous assurer que la bibliothèque de voix de WellSaid Labs reflète ses créateurs et son public. Ces processus sont conçus pour être intentionnels et axés sur les détails pour nous assurer que notre technologie est utilisée de la manière la plus sûre et la plus éthique possible, ce qui peut ralentir le développement et le calendrier de lancement.

Quelle est votre vision pour l’avenir des voix IA génératives ?

Pendant la plus grande partie du temps, la technologie de la parole IA n’a pas atteint un niveau de qualité suffisamment élevé pour permettre aux entreprises de créer du contenu significatif à grande échelle. Maintenant que la technologie audio n’exige plus d’équipement coûteux et de matériel, tout contenu écrit peut être produit et publié dans un format audio pour créer des expériences engageantes et multimodales.

Aujourd’hui, les voix IA peuvent produire de l’audio de qualité humaine et capturer la nuance nécessaire pour rendre la narration numérique plus accessible et naturelle. L’avenir des voix IA génératives sera des expériences audibles globales qui toucheront tous les aspects de notre vie. À mesure que la technologie continuera de progresser, nous verrons des voix synthétiques de plus en plus naturelles et expressives qui brouilleront la ligne entre la parole humaine et la parole générée par machine – ouvrant de nouvelles portes pour les entreprises, la communication, l’accessibilité et la façon dont nous interagissons avec le monde qui nous entoure.

Les entreprises trouveront une personnalisation améliorée dans les interfaces vocales IA et les utiliseront pour rendre les interactions avec les assistants virtuels plus immersives et plus conviviales. Ces améliorations se produisent déjà, des agents de centre d’appel intelligents aux guichets de restauration rapide. La création de contenu, y compris la publicité, le marketing de produit, la narration d’actualités, les podcasts, les livres audio et d’autres multimédias, verra une efficacité accrue en utilisant des outils pour développer du contenu engageant – augmentant en fin de compte le levier et les revenus pour les organisations, en particulier maintenant que les modèles multilingues peuvent étendre la portée d’une entreprise d’un seul point d’origine à une présence mondiale. Les équipes de production trouveront un grand avantage dans les voix synthétiques pour créer des voix sur mesure pour les besoins de la marque ou personnalisées pour l’auditeur.

Avant l’introduction de l’IA, la technologie TTS manquait de l’émotion humaine cruciale, de l’intonation et des capacités de prononciation nécessaires pour raconter une histoire complète à grande échelle et avec facilité. Maintenant, la TTS alimentée par l’IA offre des expériences plus immersives et accessibles, notamment des capacités de parole en temps réel et des agents de conversation interactifs.

Atteindre des capacités de parole humaines a été un voyage, mais maintenant qu’il est réalisable, nous sommes témoins de la portée complète de la voix IA pour créer une valeur commerciale réelle pour les organisations.

Je vous remercie pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter WellSaid Labs.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.