Haastattelut
Dylan Fox, AssemblyAI:n CEO ja perustaja – Haastattelu

Dylan Fox on AssemblyAI:n CEO ja perustaja, joka on alusta, joka muuttaa automaattisesti ääni- ja videotiedostot sekä live-äänivirrat teksteiksi AssemblyAI:n puhe-teksti -API:en avulla.
Mikä aluksi kiinnosti sinua koneoppimisessa?
Aloin ohjelmointiin ja osallistuin Python-kokouksiin Washington DC:ssa, jossa kävin yliopistoa. Yliopiston kurssien kautta löysin itseni enemmän algoritmi-tyyppisten ohjelmointiongelmiin, jotka luonnollisesti johtivat minua koneoppimiseen ja NLP:hen.
Ennen AssemblyAI:n perustamista olit Cisco:n senior-ohjelmistoinsinööri, mitä teit siellä?
Ciscossa olin senior-ohjelmistoinsinööri, joka keskittyi koneoppimiseen heidän yhteistyötuotteisiinsa.
Kuinka työsi Ciscossa ja ongelma puheentunnistusteknologian hankinnassa innoitti sinua perustamaan AssemblyAI:n?
Aikaisemmissa työtehtävissäni minulla oli mahdollisuus työskennellä monissa koneoppimiseen liittyvissä projekteissa, mukaan lukien useissa projekteissa, jotka vaativat puheentunnistusta. Mutta kaikki puheentunnistusta palveluna tarjoavat yritykset olivat vanhentuneita, vaikeita ostaa ja käyttivät vanhentunutta AI-teknologiaa.
Kun tulin yhä enemmän kiinnostuneeksi AI-tutkimuksesta, huomasin, että puheentunnistuksen alalla tehtiin paljon työtä ja kuinka nopeasti tutkimus parani. Niin että se oli yhdistelmä tekijöistä, jotka innoittivat minua ajattelemaan: “Mitä jos voit rakentaa Twilio-tyyppisen API-yrityksen, joka käyttää viimeisintä AI-tutkimusta, joka on kehittynyt paljon helpommaksi kehittäjille päästäkseen käyttämään valmiita AI-malleja puheentunnistukseen, ja jolla on paljon parempi kehittäjien kokemus.”
Ja siitä syntyi AssemblyAI:n idea.
Mikä on suurin haaste rakentaa tarkkaa ja luotettavaa puheentunnistusteknologiaa?
Kustannukset ja kyvyt ovat suurimmat haasteet millekään yritykselle, joka yrittää rakentaa tarkkaa ja luotettavaa puheentunnistusteknologiaa.
Data on kallista hankkia, ja sinun tarvitsee yleensä satoja tuhansia tunteja rakentaa vankka puheentunnistusjärjestelmä. Ei vain sitä, vaan laskennan vaatimukset ovat valtavat kouluttaa. Ja näiden mallien tarjoaminen tuotannossa on myös kallista ja vaatii erikoistunutta osaamista optimoida ja tehdä taloudellisesti kannattavaksi.
Näiden teknologioiden rakentaminen vaatii myös erikoistunutta osaamista, jota on vaikea löytää. Se on suuri syy, miksi asiakkaat tulevat meihin voimakkaiden AI-mallien vuoksi, joita me tutkimme, koulutamme ja otamme käyttöön talossa. He saavat pääsyn vuosiin AI-tutkimukseen valmiiden AI-mallien kehittämiseksi puheentunnistukseen ja NLP:hen, kaikki yksinkertaisen API:n kautta.
AssemblyAI tarjoaa lisäksi muita malleja puheentunnistuksen ulkopuolella, voitko kertoa, mitä nämä mallit ovat?
Aiempiin puheentunnistus- ja äänianalyysimalliemme lisäksi tarjoamme älykkäitä äänimallimme, jotka auttavat asiakkaitamme analysoimaan ja ymmärtämään äänidataa paremmin.
Yhteenveto-mallimme antaa yleiskatsauksen, sekä aikakoodatut yhteenvetot, jotka jakavat ja generoivat yhteenvetoa kullekin “luku” keskustelun aiheiden muutosten mukaan (samoin kuin YouTube-luvut).
Tunteen analyysimme tunnistaa jokaisen lauseen tunteen äänitiedostoissa. Jokainen lause transkriptissa voidaan merkitä positiiviseksi, negatiiviseksi tai neutraaliksi.
Entiteettimallimme tunnistaa laajan valikoiman entiteettejä, jotka mainitaan äänitiedostoissa, kuten henkilö- tai yritysnimiä, sähköpostiosoitteita, päivämääriä ja sijainteja.
Aiheen tunnistusmallimme merkitsee aiheet, jotka käydään läpi ääni- ja videotiedostoissa. Ennustetut aiheen tunnistusmerkit noudattavat standardoitua IAB-luokittelua, mikä tekee niistä sopivia asiakastarjoamiseen.
Sisällön valvontamallimme havaitsee herkkää sisältöä ääni- ja videotiedostoissa — kuten vihaa, väkivaltaa, herkkää sosiaalista sisältöä, alkoholia, huumeita ja paljon muuta.
Mitkä ovat suurimmat käyttötarkoitukset yrityksille, jotka käyttävät AssemblyAI:ta?
Suurimmat käyttötarkoitukset yrityksille, jotka käyttävät AssemblyAI:ta, kattavat neljä luokkaa: puhelinverkot, video, virtuaaliset kokoukset ja media.
CallRail on hyvä esimerkki asiakkaasta puhelinverkkoalueella, joka hyödyntää AssemblyAI:n AI-malleja — Core Transcription, Automatic Transcript Highlights ja PII Redaction — tarjoamaan voimakkaan Conversational Intelligence -ratkaisun asiakkailleen.
Perusidea on, että CallRail voi nyt automaattisesti tuoda esiin ja määritellä avainsisältöä puheluitaan asiakkailleen suuressa mittakaavassa — avainsisältöä kuten tiettyjä asiakaspyyntöjä, yleisesti kysyttyjä kysymyksiä ja usein käytettyjä avainsanoja ja lauseita. PII Redaction -mallimme auttaa heitä havaitsemaan ja poistamaan automaattisesti herkkää tietoa transkriptitekstistä (esim. sosiaaliturvatunnukset, luottokorttinumerot, henkilökohtaiset osoitteet jne.).
Video -käyttötarkoitukset ulottuvat videovirtausalustoista videoeditoreihin, kuten Veed, joka käyttää AssemblyAI:n Core Transcription -malleja yksinkertaistamaan videon muokkausprosessia käyttäjille. Veed sallii käyttäjilleen transkriptioida videoitaan ja muokata niitä suoraan käyttäen tekstityksiä.
Virtuaalisissa kokouksissa kokous-transkriptio-ohjelmistoyritykset, kuten Fathom, käyttävät AssemblyAI:ta luomaan älykkäitä ominaisuuksia, jotka auttavat käyttäjiään transkriptoimaan ja korostamaan tärkeimmät hetket Zoom-kokouksistaan, edistäen parempaa kokouskäyttäytymistä ja poistamalla turhat tehtävät kokouksen aikana ja jälkeen (esim. muistiinpanojen ottaminen).
Mediassa näemme esimerkiksi podcast-isäntäalustoja, jotka käyttävät meidän Sisällön valvonta- ja Aiheen tunnistusmallejamme, jotta he voivat tarjota parempia mainosvälineitä brändien turvallisuuden käyttötarkoituksiin ja rahdata käyttäjien luoma sisältö dynaamisilla mainoksilla.
AssemblyAI on äskettäin kerännyt 30 miljoonan dollarin Series B -rahoituksen. Miten tämä kiihdyttää AssemblyAI:n tehtävää?
AI-alalla tehty edistys on erittäin jännittävää. Meidän tavoitteemme on paljastaa tämä edistys jokaiselle kehittäjälle ja tuotetiimille internetissä — yksinkertaisen API:n kautta. Kun jatkamme AI-mallien tutkimista ja kouluttamista puheentunnistuksen ja NLP-tehtävien (kuten puheentunnistus, yhteenveto, kielitunnistus ja monet muut tehtävät) osalta, jatkamme näiden AI-mallien esittelyä kehittäjille ja tuotetiimille yksinkertaisen API:n kautta — ilmainen.
AssemblyAI on paikka, jossa sekä kehittäjät että tuotetiimit voivat tulla ja hakea helppoa pääsyä edistyneisiin AI-malleihin, joita he tarvitsevat rakentaakseen uusia tuotteita, palveluita ja kokonaisia yrityksiä.
Vielä viimeisten 6 kuukauden aikana olemme julkaisseet 15 uuden kielen tukemisen puheentunnistukselle — mukaan lukien espanja, saksa, ranska, italia, hindi ja japani, julkaisseet merkittäviä parannuksia Summarization-malliin, Real-Time ASR -malleihin, Sisällön valvontamalleihin ja lukuisiin muihin tuote päivityksiin.
Olemme käyttäneet vain osan Series A -rahastostamme, mutta tämä uusi rahoitus antaa meille mahdollisuuden kiihdyttää pyrkimyksiämme ilman, että kompromissi tehdään taloudellisesta kannattavuudesta.
Tämän uuden rahoituksen avulla pystymme kiihdyttämään tuote tiemme, rakentamaan parempaa AI-infrastruktuuria kiihdyttämään AI-tutkimustamme ja päättelymoottoreitamme, ja laajentamaan AI-tutkimustiimiämme — johon kuuluvat tänään tutkijat DeepMindistä, Google (GOOGL ) Brainista, Meta AI:sta, BMW:stä ja Ciscosta.
Onko mitään muuta, mitä haluaisit jakaa AssemblyAI:sta?
Meidän tehtävämme on tehdä valmiiden AI-mallien käyttäminen kehittäjille ja tuotetiimille mahdolliseksi äärimmäisen suuressa mittakaavassa yksinkertaisen API:n kautta.
Kiitos haastattelusta, lukijat, jotka haluavat oppia lisää, voivat vierailla AssemblyAI:ssa.












