Interviews

Tyler Weitzman, Co-Founder & Head of AI at Speechify – Interview Serie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Tyler Weitzman er Co-Founder, Head of Artificial Intelligence & President ved Speechify, den #1 tekst-til-tale-app i verden, med over 100.000 5-stjernede anmeldelser. Weitzman er uddannet fra Stanford University, hvor han fik en BS i matematik og en MS i datalogi på det kunstige intelligensspor. Han er blevet udvalgt af Inc. Magazine som en af de 50 bedste iværksættere, og han har været omtalt i Business Insider, TechCrunch, LifeHacker, CBS, blandt andre publikationer. Weitzmans masterafhandling fokuserede på kunstig intelligens og tekst-til-tale, hvor hans afsluttende artikel havde titlen: “CloneBot: Personlige dialog-svarforudsigelser”.

I begyndte at kode, da du var kun 9 år gammel, hvad var det, der tiltrækte dig til datalogi?

Jeg var ret besat som barn af Dragon Ball Z, og jeg ville lære at animere selv. Jeg lærte Adobe (ADBE ) Flash og Photoshop og lagde mine egne animationer af Goku på en fan-side, jeg havde bygget. Det var kort efter, at jeg begyndte at lære om systemer og algoritmer, og da jeg fik at vide, at jeg faktisk kunne programmere til livets opretholdelse, var det ret spændende. Jeg troede, det var bare en hobby ligesom at spille spil.

Du begyndte herefter at bygge iPhone-apps, da du var kun 12 år gammel, hvad var nogle af disse apps?

En app hed Black SMS, som tillader folk at sende krypterede tekstbeskeder til hinanden. En anden app hed Frontback, som giver brugerne mulighed for at tage selfies og billeder af, hvad der er foran dem på samme tid.

Kunne du diskutere din forskning på Stanford University og hvordan den var centreret omkring naturlig sprogbehandling og tale-syntese?

Min forskning omfattede flere anvendelser af transformer-netværk, herunder sprog-genereringsmodeller til chat, deling af ordklasse, punktumforudsigelse og tekst-til-tale. Optimering af neurale netværksinference til mobile CPU’er var et primært fokus, og det oversætter direkte til de offline-stemmer, der er tilgængelige på Speechify, som fungerer, selv i flyvemodus.

Kunne du dele oprindelseshistorien bag Speechify?

Jeg er blind på ét øje, og min bror Cliff er dyslektisk. Vi har brugt lydbøger og tekst-til-tale-lydteknologi, så længe vi kan huske, for at komme igennem skolen og, da vi var unge, for at læse bøger som Harry Potter. Da vi blev ældre og begyndte at bruge mere teknologi, begyndte vi at indse, at der var en mulighed for at bygge bedre tekst-til-tale-apps på web og mobile med bedre stemmer takket være fremskridt i AI og en bedre brugeroplevelse. Så vi besluttede os for at gå efter det i Speechify.

Hvad er nogle af de forskellige maskinlærings-teknologier, der bruges på Speechify?

Vi har antaget avancerede tekniker for generative arkitekturer – transformer/conformer, stor skala forudtræning, distribueret træning, gradient-akkumulation, auto-kodet latent rum, diffusion, modstandskraftige netværk og sprog-modellering. Vi anvender understøttende tekniker til funktion-behandling omkring fonemisering, tonehøjde og følelse for bedre at modeltale specifikt.

Hvad er nogle af udfordringerne ved at bygge en tekst-til-tale-app?

En nøgle-udfordring er at bygge høj-kvalitets-stemmer, der lyder som rigtige mennesker og ikke som robotter. Vores mål er, at folk ikke kan se forskellen på, hvordan vores stemmer lyder og hvordan mennesker lyder, så vores brugere er komfortable med at lytte til indhold på Speechify i lange perioder. En anden udfordring er at distribuere vores AI-modeller til millioner af brugere. Det er en ting at bygge høj-kvalitets AI-stemmer, og en anden ting at sikre, at millioner af brugere verden over faktisk finder ud af dem og bruger dem.

Speechify er #1-appen i sin kategori i app-butikken, hvad tilskriver du denne succes til?

Vi tror, vi har bygget de bedste produkter på markedet for mennesker, der vil lytte til den læsning, de skal forbruge – enten det er studerende med lektier, professionelle, der læser til arbejde, eller fritids-læsere, der bare vil underholde sig. Vi har det bedste udvalg af stemmer, herunder kendte som Snoop Dogg, og det bedste brugergrænseflade til, at folk kan let uploade og få adgang til det indhold, de vil forbruge. Og vores brugeroplevelse er gnidningsløs på tværs af Speechify-økosystemet – du kan starte med at lytte til en artikel på din computer og derefter let fortsætte med at lytte på din telefon.

Hvad er nogle af de største anvendelsesområder for denne app?

Speechifys generative AI løser reelle problemer for studerende, der vil komme igennem mange lektier hurtigere, rigtige mennesker med dysleksi og ADHD, der har svært ved at læse, ældre med lav syn, professionelle, der vil læse mere og være mere produktive, forfattere, der vil lytte til deres arbejde, auditive læsere og utallige andre.

Hvad er din vision for fremtidens AI?

Vi vil have, at AI – og specifikt AI-tekst-til-tale-stemmer – eliminerer barrierer for læring uanset din indkomst, læringssammenhæng, geografi eller sprog. Vi ser AI som et værktøj til socialt godt at forbedre menneskers livskvalitet gennem forbedring af deres uddannelse.

Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge Speechify.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.