Entretiens

Tyler Weitzman, Co-Fondateur & Directeur de l’IA chez Speechify – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Tyler Weitzman est le Co-Fondateur, Directeur de l’Intelligence Artificielle et Président de Speechify, l’application de texte-à-voix n°1 dans le monde, avec plus de 100 000 évaluations 5 étoiles. Weitzman est diplômé de l’Université de Stanford, où il a obtenu un baccalauréat en mathématiques et une maîtrise en informatique dans le domaine de l’intelligence artificielle. Il a été sélectionné par Inc. Magazine comme l’un des 50 meilleurs entrepreneurs et a été présenté dans des publications telles que Business Insider, TechCrunch, LifeHacker, CBS, entre autres. La recherche de maîtrise de Weitzman s’est concentrée sur l’intelligence artificielle et la synthèse vocale, et son article final s’intitulait : « CloneBot : Prédictions de réponses de dialogue personnalisées ».

Vous avez commencé à coder à l’âge de 9 ans, qu’est-ce qui vous a initialement attiré vers l’informatique ?

Je suis devenu obsédé par Dragon Ball Z enfant et je voulais apprendre à animer moi-même. J’ai appris Adobe (ADBE ) Flash et Photoshop et j’ai créé mes propres animations de Goku sur un site de fan que j’ai construit. Peu après, j’ai commencé à apprendre sur les systèmes et les algorithmes, et lorsque j’ai découvert que je pouvais vraiment programmer pour gagner ma vie, c’était assez excitant. Je pensais que c’était juste un passe-temps comme jouer aux jeux.

Vous avez ensuite commencé à créer des applications iPhone à l’âge de 12 ans, quelles étaient certaines de ces applications ?

L’une de ces applications s’appelait Black SMS, qui permettait aux gens d’envoyer des messages de texte chiffrés les uns aux autres. Une autre application s’appelait Frontback, qui permettait aux utilisateurs de prendre des selfies et des photos de ce qui se trouvait devant eux en même temps.

Pouvez-vous discuter de vos recherches à l’Université de Stanford et de la façon dont elles se sont concentrées sur le traitement du langage naturel et la synthèse vocale ?

Mes recherches ont porté sur plusieurs utilisations de réseaux de transformateurs, y compris des modèles de génération de langage pour les conversations, la détection de parties du discours, la prédiction de la ponctuation et la synthèse vocale. L’optimisation de l’inférence des réseaux de neurones pour les processeurs mobiles a été un objectif principal et cela s’est directement traduit par les voix hors ligne disponibles sur Speechify, qui fonctionnent même en mode avion.

Pouvez-vous partager l’histoire de la création de Speechify ?

Je suis aveugle d’un œil et mon frère Cliff est dyslexique. Nous avons utilisé des livres audio et des technologies de synthèse vocale pour autant que nous nous souvenions pour passer à travers l’école et, lorsque nous étions jeunes, pour lire des livres comme Harry Potter. À mesure que nous sommes devenus plus âgés et que nous avons commencé à utiliser plus de produits technologiques, nous avons réalisé qu’il y avait une opportunité de créer de meilleures applications de texte à voix sur le Web et les mobiles avec de meilleures voix grâce aux progrès de l’IA et une meilleure expérience utilisateur. Nous avons donc décidé de nous lancer dans Speechify.

Quelles sont certaines des différentes technologies d’apprentissage automatique utilisées chez Speechify ?

Nous avons adopté des techniques de pointe pour les architectures génératives avancées – transformateurs/conformateurs, pré-entraînement à grande échelle, formation distribuée, accumulation de gradients, espaces latents auto-encodés, diffusion, réseaux antagonistes et modélisation du langage. Nous employons des techniques de traitement de fonctionnalités pour la phonémisation, la hauteur et l’émotion, pour mieux modéliser la parole en particulier.

Quels sont certains des défis liés à la création d’une application de texte à voix ?

L’un des défis clés est de créer des voix de haute qualité qui ressemblent à des humains réels et non à des robots. Notre objectif est que les gens ne puissent pas faire la différence entre la façon dont nos voix sonnent et la façon dont les humains sonnent, afin que nos utilisateurs soient à l’aise pour écouter du contenu sur Speechify pendant de longues périodes. Un second défi est de distribuer nos modèles d’IA à des millions d’utilisateurs. Il est facile de créer des voix d’IA de haute qualité, mais il est plus difficile de s’assurer que des millions d’utilisateurs à travers le monde découvrent et utilisent ces voix.

Speechify est l’application n°1 dans sa catégorie dans l’app store, à quoi attribuez-vous ce succès ?

Nous croyons que nous avons créé les meilleurs produits sur le marché pour les personnes qui veulent écouter les lectures dont elles ont besoin – qu’il s’agisse d’étudiants qui ont des devoirs, de professionnels qui lisent pour le travail ou de lecteurs de loisirs qui veulent simplement être divertis. Nous avons la meilleure sélection de voix, y compris des célébrités comme Snoop Dogg, et la meilleure interface utilisateur pour que les gens puissent facilement télécharger et accéder au contenu qu’ils veulent consommer. Et notre expérience utilisateur est fluide dans l’écosystème Speechify – vous pouvez commencer à écouter un article sur votre ordinateur et puis facilement le transférer pour continuer à écouter sur votre téléphone.

Quels sont certains des plus grands cas d’utilisation pour cette application ?

La technologie d’IA générative de Speechify résout des problèmes réels pour les étudiants qui veulent terminer leurs devoirs plus rapidement, les personnes réelles ayant des troubles tels que la dyslexie et le TDAH qui ont des difficultés à lire, les seniors ayant une vision basse, les professionnels qui veulent lire plus et être plus productifs, les écrivains qui veulent écouter leur travail, les apprenants auditifs et bien d’autres.

Quelle est votre vision pour l’avenir de l’IA ?

Nous voulons que l’IA – et plus précisément les voix de synthèse vocale d’IA – éliminent les barrières à l’apprentissage, quel que soit votre niveau de revenu, vos différences d’apprentissage, votre géographie ou votre langue. Nous considérons l’IA comme un outil pour le bien social pour améliorer la qualité de vie que les humains peuvent vivre en améliorant leur éducation.

Merci pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter Speechify.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.