Rozhovory

Tyler Weitzman, spoluzakladatel a vedoucí AI ve Speechify – rozhovor

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Tyler Weitzman je spoluzakladatel, vedoucí umělé inteligence a prezident ve Speechify, která je nejlepším text-to-speech aplikací na světě s více než 100 000 pětihvězdičkovými recenzemi. Weitzman je absolvent Stanfordovy univerzity, kde získal titul BS v matematice a MS v počítačových vědách na umělé inteligenci. Byl vybrán časopisem Inc. jako jeden z 50 nejlepších podnikatelů a byl uveden v Business Insider, TechCrunch, LifeHacker, CBS a dalších publikacích. Weitzmanova diplomová práce se zaměřila na umělou inteligenci a text-to-speech, kde jeho závěrečná práce nesla název: „CloneBot: Personalizované předpovědi dialogových odpovědí.“

Začal jste programovat, když vám bylo pouze 9 let, co vás původně přitáhlo k počítačovým vědám?

Byl jsem jako dítě bastante posedlý Dragon Ball Z a chtěl jsem se naučit animovat sám. Naučil jsem se Adobe (ADBE ) Flash a Photoshop a umístil své vlastní animace Goka na fanouškovskou webovou stránku, kterou jsem vytvořil. Brzy poté jsem začal učit o systémech a algoritmech a když jsem se dozvěděl, že mohu skutečně programovat pro živobytí, bylo to bastante vzrušující. Domníval jsem se, že to je jen koníček, jako hraní her.

Pak jste začal vytvářet aplikace pro iPhone, když vám bylo pouze 12 let, co byly některé z těchto aplikací?

Jedna aplikace se jmenovala Black SMS, která umožňuje lidem posílat šifrované textové zprávy navzájem. Další aplikací byla Frontback, která umožňuje uživatelům pořizovat selfie a fotografie toho, co je před nimi, ve stejném okamžiku.

Můžete diskutovat o své výzkumu na Stanfordově univerzitě a jak se zaměřil na zpracování přirozeného jazyka a syntézu řeči?

Můj výzkum zahrnoval několik použití transformačních sítí, včetně modelů generování jazyka pro chat, značkování části řeči, předpovědi interpunkce a text-to-speech. Optimalizace inference neuronových sítí pro mobilní procesory byla primárním zaměřením a to přímo přeloženo do offline hlasů dostupných ve Speechify, které fungují i v letovém režimu.

Můžete sdílet příběh o vzniku Speechify?

Jsem slepý na jedno oko a můj bratr Cliff má dyslexii. Používáme audioknihy a text-to-speech audio technologii, co nejdéle, abychom se dostali skrz školu a když jsme byli mladí, abychom četli knihy, jako je Harry Potter. Když jsme dospěli a začali používat více technologických produktů, začali jsme si uvědomovat, že existuje příležitost postavit lepší text-to-speech aplikace na webu a mobilních zařízeních s lepšími hlasy díky pokrokům v AI a lepšímu uživatelskému rozhraní. Takže jsme se rozhodli jít do toho ve Speechify.

Jaké jsou některé z různých strojových učících se technologií, které se používají ve Speechify?

Přijali jsme pokročilé techniky pro generativní architektury – transformátory/konforméry, velká předškolení, distribuované školení, gradientové akumulace, auto-kódované latentní prostory, difúze, adversativní sítě a jazykové modelování. Používáme podpůrné techniky pro zpracování funkcí obklopujících fonemizaci, tón a emoci, aby lépe modelovaly řeč.

Jaké jsou některé z výzev při budování text-to-speech aplikace?

Jedna z hlavních výzev je budování high-quality hlasů, které znějí jako skuteční lidé, spíše než roboti. Naším cílem je, aby lidé nemohli rozeznat rozdíl mezi tím, jak naše hlasy znějí, a tím, jak znějí lidé, aby naši uživatelé byli pohodlně poslouchat obsah ve Speechify po dlouhou dobu. Druhá výzva spočívá v distribuci našich modelů AI milionům uživatelů. Je to jedna věc postavit high-quality AI hlasy a druhá věc zajistit, aby miliony uživatelů po celém světě skutečně zjistili o nich a použili je.

Speechify je #1 aplikace ve své kategorii v obchodě s aplikacemi, co přisuzujete tomuto úspěchu?

Domníváme se, že jsme postavili nejlepší produkty na trhu pro lidi, kteří chtějí poslouchat čtení, které potřebují spotřebovat – ať už jsou to studenti se školními úkoly, profesionálové, kteří čtou pro práci, nebo rekreační čtenáři, kteří se prostě chtějí bavit. Máme nejlepší výběr hlasů, včetně celebrit, jako je Snoop Dogg, a nejlepší uživatelské rozhraní pro lidi, aby snadno nahráli a získali přístup k obsahu, který chtějí spotřebovat. A naše uživatelská zkušenost je bezproblémová v celém ekosystému Speechify – můžete začít poslouchat článek na svém počítači a pak snadno přenést ho, abyste mohli pokračovat v poslechu na svém telefonu.

Jaké jsou některé z největších použití této aplikace?

Generativní AI ve Speechify řeší skutečné problémy pro studenty, kteří chtějí projít spoustu domácích úkolů rychleji, skutečné lidi s dyslexií a ADHD, kteří mají potíže s čtením, seniory se špatným zrakem, profesionály, kteří chtějí číst více a být produktivnější, spisovatele, kteří chtějí poslouchat svou práci, auditory learners a mnoho dalších.

Jaký je váš výhled do budoucnosti AI?

Chceme, aby AI – a zejména AI text-to-speech hlasy – odstranily bariéry učení bez ohledu na úroveň příjmu, rozdíly ve učení, geografii nebo jazyk. Vidíme AI jako nástroj pro sociální dobro, aby zvýšila kvalitu života, kterou lidé mohou žít zlepšením svého vzdělání.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Speechify.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.