Röportajlar
Dylan Fox, AssemblyAI’nin CEO’su ve Kurucusu – Röportaj Serisi

Dylan Fox, AssemblyAI‘nin CEO’su ve kurucusudur. AssemblyAI, ses ve video dosyalarını ve canlı ses akışlarını metne AssemblyAI’nin Konuşma Metne API’leri ile otomatik olarak dönüştüren bir platformdur.
Sizce makine öğrenimiye ilk olarak neler sizi çekmiştir?
Ben programlama öğrenerek başladım ve Washington DC’deki Python toplantılarına katıldım. Üniversite kurslarında, kendimi algoritma türündeki programlama sorunlarına daha çok yönelttim, bu da doğal olarak makine öğrenimi ve NLP’ye yöneltti.
AssemblyAI’yi kurmadan önce Cisco’da Senior Yazılım Mühendisi olarak çalışıyordunuz, neler üzerinde çalışıyordunuz?
Cisco’da, işbirliği ürünleri için Makine Öğrenimi üzerine odaklanan bir Senior Yazılım Mühendisi olarak çalışıyordum.
Cisco’daki çalışmalarınız ve konuşma tanıma teknolojisini edinme sorunları nasıl AssemblyAI’yi kurma fikrine yöneltti?
Önceki işlerimde, birçok AI projesi üzerinde çalışma fırsatım oldu, bunlar arasında konuşma tanıma gerektiren projeler de vardı. Ancak konuşma tanıma hizmeti sunan tüm şirketler çok eski, satın almaları zor ve eski AI teknolojisini kullanıyorlardı.
AI araştırmalarına daha da ilgi duymaya başladığım sırada, konuşma tanıma alanında yapılan çalışmaların ve araştırmaların ne kadar hızlı ilerlediğini fark ettim. Böylece, “Twilio tarzı bir API şirketi kurmak, en son AI araştırmalarını kullanarak konuşma tanıma için state-of-the-art AI modellerini geliştirerek, bunları daha kolay erişilebilir hale getirmek” fikri oluştu.
Ve işte bu fikir, AssemblyAI‘nin doğmasına yol açtı.
Doğru ve güvenilir konuşma tanıma teknolojisi geliştirmenin en büyük zorluğu nedir?
Maliyet ve yetenek, konuşma tanıma teknolojisi geliştirmek için herhangi bir şirketin karşılaştığı en büyük zorluklardır.
Veri toplamak pahalıdır ve güçlü bir konuşma tanıma sistemi oluşturmak için genellikle yüz binlerce saatlik veri gerekir. Ayrıca, bu modelleri eğitmek için gereken hesaplama gereksinimleri çok büyüktür ve üretim aşamasında da maliyetli ve ekonomize etmek için uzman yetenek gerektirir.
Bu teknolojileri geliştirmek ayrıca uzman bir beceri seti gerektirir, bu da bulunması zor bir şeydir. Bu, müşterilerin güçlü AI modellerine erişim için bize gelmelerinin büyük bir nedenidir. Müşteriler, yıllarca süren ASR ve NLP için state-of-the-art AI modelleri araştırması, eğitimi ve dağıtımı yapma imkanına sahip olurlar, tüm bunlar basit bir API ile sunulur.
AssemblyAI, ses ve video içeriğinin yalnızca transkript edilmesinden başka ekstra modeller sunuyor, bunları anlatır mısınız?
AI modellerimizin seti, yalnızca gerçek zamanlı ve asenkron transkriptin ötesine geçer. Bu ekstra modellere Ses Zekası modelleri diyoruz, bunlar müşterilerin ses verilerini analiz etmelerine ve anlamalarına yardımcı olur.
Özetleme modelimiz, genel bir özet sunar ve ayrıca zaman kodlu özetler oluşturur, bu da bir konuşmadaki konular değiştiğinde otomatik olarak segmentler ve her “bölüm” için bir özet oluşturur (YouTube bölümlerine benzer).
Duygu Analizi modelimiz, ses dosyalarındaki her cümlenin duygusunu tespit eder. Her cümle olumlu, olumsuz veya nötr olarak işaretlenebilir.
Varlık Tanıma modelimiz, ses dosyalarında söylenen geniş bir varlık yelpazesini tanır, bunlar arasında kişi veya şirket isimleri, e-posta adresleri, tarihler ve yerler bulunur.
Konu Tanıma modelimiz, ses ve video dosyalarında konuşulan konuları etiketler. Tahmin edilen konu etiketleri, bağlamsal hedefleme için uygun olan standart IAB Taksonomisini takip eder.
İçerik Düzenleme modelimiz, ses ve video dosyalarında hassas içeriği tespit eder – bu içerik arasında nefret söylemi, şiddet, hassas sosyal konular, alkol, uyuşturucu ve daha fazlası bulunur.
AssemblyAI’yi kullanan şirketler için en büyük kullanım alanları nelerdir?
Şirketlerin AssemblyAI’yi kullanma nedenleri dört kategoriye ayrılır: telefoni, video, sanal toplantılar ve medya.
CallRail, Telefoni alanında bir müşteri örneğidir. CallRail, AssemblyAI’nin AI modellerini – Core Transkript, Otomatik Transkript Vurguları ve PII Redaksiyonu – kullanarak müşterilerine güçlü bir Konuşma Zekası çözümü sunar.
Aslında, CallRail şimdi telefon görüşmelerindeki önemli içeriği otomatik olarak yüzeyde gösterebilir ve müşterilerine ölçeklenebilir bir şekilde sunabilir – bu içerik arasında özel müşteri talepleri, sıkça sorulan sorular ve sık kullanılan anahtar kelimeler ve ifadeler bulunur. PII Redaksiyon modelimiz, transkript metinlerinde bulunan hassas verileri otomatik olarak tespit edip kaldırmasına yardımcı olur (örneğin, sosyal güvenlik numaraları, kredi kartı numaraları, kişisel adresler vb.).
Video kullanım örnekleri, video akış platformlarından video düzenleyicilere kadar uzanır. Veed gibi video düzenleyiciler, AssemblyAI’nin Core Transkript modellerini kullanarak kullanıcıların videolarını transkript edip doğrudan altyazılar kullanarak düzenleyebilmelerini sağlar.
Sanal Toplantılarda, toplantı transkript yazılımları gibi Fathom, AssemblyAI’yi kullanarak müşterilerine akıllı özellikler sunar. Bu özellikler, müşterilerin Zoom görüşmelerini transkript edip önemli anları vurgulamasına yardımcı olur, böylece toplantı katılımını artırır ve toplantılar sırasında ve sonrasında zahmetli görevleri ortadan kaldırır (örneğin, not alma).
Medya alanında, podcast barındırma platformları gibi müşterilerimiz, marka güvenliği için daha iyi reklam araçları sunmak ve dinamik reklamlarla kullanıcı tarafından oluşturulan içeriği para kazanmak için İçerik Düzenleme ve Konu Tanıma modellerimizi kullanır.
AssemblyAI最近 bir $30M Series B turu gerçekleştirdi. Bu, AssemblyAI misyonunu nasıl hızlandıracaktır?
AI alanındaki ilerleme gerçekten heyecan verici. Amacımız, bu ilerlemeyi tüm geliştiricilere ve ürün ekiplerine internet üzerinden basit API’ler ile sunmaktır. ASR ve NLP görevleri için (konuşma tanıma, özetleme, dil tanımı vb.) state-of-the-art AI modelleri araştırması, eğitimi ve dağıtımı yapmaya devam ettikçe, bunları geliştiricilere ve ürün ekiplerine basit API’ler ile sunmaya devam edeceğiz.
AssemblyAI, geliştiricilerin ve ürün ekiplerinin ihtiyaç duydukları gelişmiş AI modellerine kolayca erişebilecekleri bir yerdir. Burada, heyecan verici yeni ürünler, hizmetler ve şirketler oluşturmak için gereken AI modellerini bulabilirler.
Son 6 ayda, 15 yeni dil için ASR desteğini başlattık – bunlar arasında İspanyolca, Almanca, Fransızca, İtalyanca, Hintçe ve Japonca da var. Ayrıca, Özetleme modelimizde, Gerçek Zamanlı ASR modellerimizde, İçerik Düzenleme modellerimizde ve sayısız başka ürün güncellemesinde büyük iyileştirmeler yaptık.
Henüz Seri A fonlarımızın bir kısmını kullanmadık, ancak bu yeni fon, çabalarımızı daha agresif bir şekilde ölçeklendirme yeteneği verecek, aynı zamanda yol haritamızı hızlandırarak AI altyapımızı ve AI araştırma ekibimizi büyütmemize olanak tanıyacak. Şu anda AI araştırma ekibimizde DeepMind, Google (GOOGL ) Brain, Meta AI, BMW ve Cisco’dan araştırmacılar yer alıyor.
AssemblyAI hakkında paylaşmak istediğiniz başka bir şey var mı?
Misyonumuz, state-of-the-art AI modellerini, çok büyük ölçeklerde, basit bir API ile geliştiricilere ve ürün ekiplerine erişilebilir kılmaktır.
Harika bir röportaj için teşekkür ederiz. Daha fazla bilgi edinmek isteyen okuyucular, AssemblyAI‘yi ziyaret edebilir.












