Interviews
Tyler Weitzman, mede-oprichter en hoofd van AI bij Speechify – Interviewreeks

Tyler Weitzman is de mede-oprichter, hoofd van Artificial Intelligence en president van Speechify, de nummer 1 tekst-naar-spraak-app in de wereld, met meer dan 100.000 5-sterrenbeoordelingen. Weitzman is afgestudeerd aan de Stanford University, waar hij een bachelor in wiskunde en een master in computerwetenschappen behaalde op het gebied van kunstmatige intelligentie. Hij is door Inc. Magazine geselecteerd als een van de top 50 ondernemers en is gepubliceerd in Business Insider, TechCrunch, LifeHacker, CBS en andere publicaties. Het onderzoek van Weitzman voor zijn masteropleiding richtte zich op kunstmatige intelligentie en tekst-naar-spraak, waarbij zijn eindpaper de titel had: “CloneBot: Persoonlijke dialoog-antwoordvoorspellingen.”
U bent begonnen met programmeren toen u nog maar 9 jaar oud was, wat trok u aanvankelijk aan bij computerwetenschappen?
Ik was als kind behoorlijk gefascineerd door Dragon Ball Z en wilde leren tekenen. Ik leerde Adobe (ADBE ) Flash en Photoshop en plaatste mijn eigen animaties van Goku op een fan-pagina die ik had gebouwd. Kort daarna begon ik te leren over systemen en algoritmen, en toen ik ontdekte dat ik daadwerkelijk kon programmeren voor mijn beroep, vond ik dat behoorlijk spannend. Ik dacht dat het gewoon een hobby was, zoals gamen.
Toen begon u op uw 12e jaar met het bouwen van iPhone-apps, wat waren enkele van deze apps?
Een app heette Black SMS, waarmee mensen versleutelde tekstberichten naar elkaar konden sturen. Een andere app heette Frontback, waarmee gebruikers selfies en foto’s van wat er voor hen was konden maken op hetzelfde moment.
Kunt u uw onderzoek aan de Stanford University bespreken en hoe het zich richtte op natuurlijke taalverwerking en spraaksynthese?
Mijn onderzoek omvatte meerdere toepassingen van transformatienetwerken, waaronder taalgeneratiemodellen voor chat, part-of-speech-tagging, leestekensvoorspelling en tekst-naar-spraak. Het optimaliseren van neurale netwerkafleiding voor mobiele CPU’s was een belangrijk aandachtspunt en dat vertaalde zich rechtstreeks naar de offline-stemmen die beschikbaar zijn op Speechify, die werken zelfs in de vliegtuigmodus.
Kunt u het verhaal achter Speechify delen?
Ik ben blind aan één oog en mijn broer Cliff is dyslectisch. We hebben audioboeken en tekst-naar-spraak-audiotechnologie gebruikt sinds we ons kunnen herinneren om door school heen te komen en om boeken te lezen zoals Harry Potter toen we jong waren. Toen we ouder werden en meer technologieproducten begonnen te gebruiken, realiseerden we ons dat er een kans was om betere tekst-naar-spraak-apps te bouwen op web en mobiel met betere stemmen dankzij de vooruitgang in AI en een betere gebruikerservaring. Dus besloten we om het te doen in Speechify.
Wat zijn enkele van de verschillende machine learning-technologieën die op Speechify worden gebruikt?
We hebben baanbrekende technieken geadopteerd voor geavanceerde generatieve architectuur – transformatoren/conformers, grote voorafgaande training, gedistribueerde training, accumulatie van gradiënten, auto-gecodeerde latentie-ruimtes, diffusie, adversariale netwerken en taalmodellering. We gebruiken ondersteunende technieken voor functieverwerking rondom fonemisatie, toonhoogte en emotie om spraak specifiek beter te modelleren.
Wat zijn enkele van de uitdagingen bij het bouwen van een tekst-naar-spraak-app?
Een van de belangrijkste uitdagingen is het bouwen van hoge kwaliteit stemmen die klinken als echte mensen in plaats van robots. Ons doel is dat mensen niet kunnen vertellen hoe onze stemmen klinken en hoe mensen klinken, zodat onze gebruikers comfortabel kunnen luisteren naar content op Speechify voor lange perioden. Een tweede uitdaging is het distribueren van onze AI-modellen naar miljoenen gebruikers. Het is één ding om hoge kwaliteit AI-stemmen te bouwen en een ander om ervoor te zorgen dat miljoenen gebruikers over de hele wereld erachter komen en ze gebruiken.
Speechify is de nummer 1-app in zijn categorie in de app store, waaraan schrijft u deze succes toe?
We geloven dat we de beste producten op de markt hebben gebouwd voor mensen die naar het lezen willen luisteren dat ze moeten consumeren – of het nu studenten zijn met huiswerk, professionals die voor hun werk lezen, of vrijetijdslezers die gewoon vermaakt willen worden. We hebben de beste selectie van stemmen, waaronder beroemdheden als Snoop Dogg, en de beste gebruikersinterface voor mensen om gemakkelijk de content te uploaden en te benaderen die ze willen consumeren. En onze gebruikerservaring is naadloos over het hele Speechify-ecosysteem – u kunt beginnen met luisteren naar een artikel op uw computer en dan gemakkelijk overschakelen naar luisteren op uw telefoon.
Wat zijn enkele van de grootste use cases voor deze app?
Speechify’s generatieve AI lost echte problemen op voor studenten die veel huiswerk willen doen, echte mensen met dyslexie en ADHD die moeite hebben met lezen, senioren met slecht zicht, professionals die meer willen lezen en productiever willen zijn, schrijvers die hun werk willen horen, auditieve leerlingen en vele anderen.
Wat is uw visie op de toekomst van AI?
We willen AI – en specifiek AI-tekst-naar-spraak-stemmen – gebruiken om barrières voor leren te elimineren, ongeacht uw inkomensniveau, leerverschillen, geografie of taal. We zien AI als een instrument voor sociaal goed om de kwaliteit van leven die mensen kunnen hebben te verhogen door hun onderwijs te verbeteren.
Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen Speechify bezoeken.












