Intervjuer

Tyler Weitzman, medgrundare och chef för AI på Speechify – Intervjuserie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Tyler Weitzman är medgrundare, chef för artificiell intelligens och president på Speechify, den bästa text-till-tal-appen i världen, med över 100 000 femstjärniga recensioner. Weitzman är utexaminerad från Stanford University, där han tog en kandidatexamen i matematik och en masterexamen i datavetenskap på artificiell intelligens-spåret. Han har valts ut av Inc. Magazine som en av de 50 bästa entreprenörerna och har varit med i Business Insider, TechCrunch, LifeHacker, CBS, bland andra publikationer. Weitzmans masterexamensforskning fokuserade på artificiell intelligens och text-till-tal, där hans slutliga uppsats hade titeln: “CloneBot: Personliga dialog-svarsprediktioner.”

Du började koda när du var bara 9 år gammal, vad var det som initialt drog dig till datavetenskap?

Jag var ganska besatt som barn av Dragon Ball Z och ville lära mig att animerade mig själv. Jag lärde mig Adobe (ADBE ) Flash och Photoshop och lade upp mina egna animeringar av Goku på en fan-sida som jag byggde. Det var strax efter att jag började lära mig om system och algoritmer, och när jag lärde mig att jag faktiskt kunde programmera för att försörja mig själv var det ganska spännande. Jag trodde att det bara var en hobby som att spela spel.

Sedan började du bygga iPhone-appar när du var bara 12 år gammal, vad var några av dessa appar?

En app heter Black SMS som tillåter människor att skicka krypterade textmeddelanden till varandra. En annan app var Frontback som möjliggör för användare att ta selfies och foton av vad som finns framför dem samtidigt.

Kan du diskutera din forskning vid Stanford University och hur den var fokuserad på naturlig språkbehandling och tal-syntes?

Min forskning omfattade flera användningsområden för transformer-nätverk, inklusive språkgenereringsmodeller för chatt, del-of-tal-tagging, punkt-prediktion och text-till-tal. Optimering av neuronnät-inferens för mobila CPU:er var ett primärt fokus och det översattes direkt till de offline-röster som finns tillgängliga på Speechify, som fungerar även i flygplansläge.

Kan du dela den ursprungliga historien bakom Speechify?

Jag är blind på ett öga och min bror Cliff är dyslektiker. Vi har använt ljudböcker och text-till-tal-ljudteknik så länge vi kan minnas för att komma igenom skolan och när vi var unga för att läsa böcker som Harry Potter. När vi blev äldre och började använda mer teknologi-insatser, började vi inse att det fanns en möjlighet att bygga bättre text-till-tal-appar på webben och mobilen med bättre röster tack vare framstegen inom AI och en bättre användarupplevelse. Så vi bestämde oss för att gå för det i Speechify.

Vilka är några av de olika maskinlärningsteknikerna som används på Speechify?

Vi har antagit banbrytande tekniker för avancerade generativa arkitekturer – transformer/konformer, storskalig förträning, distribuerad träning, gradientackumulering, auto-kodad latent utrymme, diffusion, adversariala nätverk och språkmodellering. Vi använder stödtekniker för funktionbearbetning omgivande fonemisering, tonhöjd och känsla för att bättre modellera tal specifikt.

Vilka är några av utmaningarna bakom att bygga en text-till-tal-app?

En nyckelutmaning är att bygga högkvalitativa röster som låter som riktiga människor och inte som robotar. Vårt mål är att människor inte ska kunna skilja på hur våra röster låter och hur människor låter, så att våra användare känner sig bekväma med att lyssna på innehåll på Speechify under långa perioder. En annan utmaning är att distribuera våra AI-modeller till miljontals användare. Det är en sak att bygga högkvalitativa AI-röster och en annan sak att se till att miljontals användare runt om i världen faktiskt hittar och använder dem.

Speechify är den bästa appen i sin kategori i app-store, vad tillskriver du den här framgången till?

Vi tror att vi har byggt de bästa produkterna på marknaden för människor som vill lyssna på det de behöver läsa – oavsett om det är studenter med läxor, proffs som läser för arbete eller fritidsläsare som bara vill underhållas. Vi har det bästa urvalet av röster, inklusive kändisar som Snoop Dogg, och den bästa användargränssnittet för att människor enkelt ska kunna ladda upp och komma åt det innehåll de vill konsumera. Och vår användarupplevelse är sömlös över hela Speechify-ekosystemet – du kan börja lyssna på en artikel på din dator och sedan enkelt fortsätta lyssna på din telefon.

Vilka är några av de största användningsfallen för den här appen?

Speechifys generativa AI löser verkliga problem för studenter som vill komma igenom mycket läxor snabbare, riktiga människor med dyslexi och ADHD som har svårt att läsa, äldre med låg syn, proffs som vill läsa mer och vara mer produktiva, författare som vill lyssna på sitt arbete, auditiva lärande och många fler.

Vad är din vision för framtiden för AI?

Vi vill att AI – och specifikt AI-text-till-tal-röster – ska eliminera hinder för lärande oavsett inkomstnivå, inlärningsskillnader, geografi eller språk. Vi ser AI som ett verktyg för socialt gott för att höja livskvaliteten som människor kan leva genom att förbättra deras utbildning.

Tack för den underbara intervjun, läsare som vill lära sig mer kan besöka Speechify.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.