Intervjuer

Tyler Weitzman, medgrunnlegger og sjef for AI i Speechify – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Tyler Weitzman er medgrunnlegger, sjef for kunstig intelligens og president i Speechify, den #1 tekst-til-tale-appen i verden, med over 100 000 5-stjerners anmeldelser. Weitzman er utdannet ved Stanford University, der han tok en bachelorgrad i matematikk og en mastergrad i datavitenskap i kunstig intelligens-sporet. Han har blitt valgt ut av Inc. Magazine som en av de 50 beste entreprenørene, og han har vært omtalt i Business Insider, TechCrunch, LifeHacker, CBS og andre publikasjoner. Weitzmans mastergradsoppgave handlet om kunstig intelligens og tekst-til-tale, der hans endelige oppgave hadde tittelen: “CloneBot: Personlige dialog-respons-prediksjoner.”

Du begynte å kode da du var bare 9 år gammel, hva var det som først tiltalte deg til datavitenskap?

Jeg var ganske besatt som barn av Dragon Ball Z, og jeg ville lære å animere selv. Jeg lærte Adobe (ADBE ) Flash og Photoshop og lagde mine egne animasjoner av Goku på en fan-side jeg bygde. Det var ikke lenge etter at jeg begynte å lære om systemer og algoritmer, og da jeg lærte at jeg faktisk kunne programmere for å leve, var det ganske spennende. Jeg trodde det bare var en hobby som å spille spill.

Du begynte å bygge iPhone-apper da du var bare 12 år gammel, hva var noen av disse appene?

En av appene heter Black SMS, som lar folk sende krypterte tekstmeldinger til hverandre. En annen app heter Frontback, som lar brukerne ta selfies og bilder av hva som er foran dem samtidig.

Kunne du diskutere din forskning ved Stanford University og hvordan den var sentrert rundt naturlig språkbehandling og tale-syntese?

Min forskning omfattet flere bruksområder for transformer-nettverk, inkludert språk-genereringsmodeller for chat, deling av ord, punktumsprediksjon og tekst-til-tale. Optimering av neurale nettverk for mobil-CPU var et hovedfokus, og det oversatte direkte til de offline-stemmene som er tilgjengelige på Speechify, som fungerer selv i flymodus.

Kunne du dele opphavsfortellingen bak Speechify?

Jeg er blind på ett øye, og min bror Cliff er dyslektisk. Vi har brukt lydbøker og tekst-til-tale-lydteknologi så lenge vi kan huske for å komme gjennom skolen og når vi var unge for å lese bøker som Harry Potter. Da vi ble eldre og begynte å bruke mer teknologi, begynte vi å innse at det var en mulighet til å bygge bedre tekst-til-tale-apper på web og mobil med bedre stemmer takket være fremgangen i AI og en bedre brukeropplevelse. Så vi bestemte oss for å gå for det i Speechify.

Hva er noen av de forskjellige maskinlærings-teknologiene som brukes i Speechify?

Vi har adoptert fremtredende teknikker for avanserte generative arkitekturer – transformer/konformer, stor skala forhåndsopplæring, distribuert opplæring, gradient-akkumulering, auto-kodet latente rom, diffusjon, motstående nettverk og språkmodellering. Vi anvender støtte-teknikker for funksjonsbehandling omkring fonemisering, tonehøyde og emosjon for å bedre modellere tale spesifikt.

Hva er noen av utfordringene bak å bygge en tekst-til-tale-app?

En av de viktigste utfordringene er å bygge høykvalitets-stemmer som hører ut som ekte mennesker og ikke roboter. Vårt mål er at folk ikke skal kunne skille mellom hvordan våre stemmer hører ut og hvordan mennesker hører ut, så at våre brukere er komfortable med å lytte til innhold på Speechify i lange perioder. En annen utfordring er å distribuere våre AI-modeller til millioner av brukere. Det er en ting å bygge høykvalitets AI-stemmer, og en annen ting å sikre at millioner av brukere over hele verden faktisk finner ut om dem og bruker dem.

Speechify er den #1 appen i sin kategori i app-butikken, hva tilskriver du denne suksessen til?

Vi tror vi har bygget de beste produktene på markedet for folk som ønsker å lytte til lesingen de trenger å forbruke – enten det er studenter med lekser, profesjonelle som leser for arbeid eller fritidslesere som bare ønsker å underholde seg. Vi har det beste utvalget av stemmer, inkludert kjendiser som Snoop Dogg, og det beste brukergrensesnittet for at folk enkelt kan laste opp og få tilgang til innholdet de ønsker å forbruke. Og vår brukeropplevelse er sammenhengende over hele Speechify-økosystemet – du kan begynne å lytte til en artikkel på datamaskinen din og så enkelt overføre den til å fortsette å lytte på telefonen din.

Hva er noen av de største bruksområdene for denne appen?

Speechifys generative AI løser reelle problemer for studenter som ønsker å komme gjennom mye lekser raskere, virkelige mennesker med dysleksi og ADHD som har vanskelig for å lese, eldre med lav syn, profesjonelle som ønsker å lese mer og være mer produktive, forfattere som ønsker å lytte til sitt arbeid, auditoriske lærere og mange andre.

Hva er din visjon for fremtiden av AI?

Vi ønsker at AI – og spesifikt AI-tekst-til-tale-stemmer – skal eliminere barrierer for læring uavhengig av inntektsnivå, læringsskillnader, geografi eller språk. Vi ser på AI som et verktøy for sosialt gode formål for å heve kvaliteten på livet mennesker kan leve gjennom å forbedre deres utdanning.

Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke Speechify.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.