Інтерв’ю

Ділан Фокс, генеральний директор та засновник AssemblyAI – Інтерв’ю Серія

mm
Додайте Unite.AI до бажаних джерел у Google

Ділан Фокс – генеральний директор та засновник AssemblyAI, платформи, яка автоматично конвертує аудіо- та відеофайли та живі аудіопотоки в текст за допомогою Speech-to-Text API від AssemblyAI.

Що спочатку привернуло вашу увагу до машинного навчання?

Я почав з вивчення програмування та відвідування зустрічей Python у Вашингтоні, де я навчався в коледжі. Через курси в коледжі я став більше схилятися до алгоритмічних завдань програмування, які природно привели мене до машинного навчання та NLP.

До заснування AssemblyAI ви були старшим інженером-програмістом у Cisco, над чим ви працювали?

У Cisco я був старшим інженером-програмістом, який зосереджувався на машинному навчанні для їхніх продуктів співпраці.

Як ваша робота у Cisco та проблема з пошуком технології розпізнавання мови надихнули вас на запуск AssemblyAI?

У деяких моїх попередніх роботах я мав можливість працювати над багатьма проєктами AI, включаючи проєкти, які потребували розпізнавання мови. Але всі компанії, які пропонували розпізнавання мови як сервіс, були застарілими, важкими для покупки та використовували застарілі технології AI.

Як я ставав дедалі більш зацікавленим у дослідженнях AI, я помітив, що відбувається багато роботи в галузі розпізнавання мови та того, як швидко покращується дослідження. Тому це була комбінація факторів, яка надихнула мене подумати: “Що, якщо ви можете створити компанію типу Twilio, яка використовує останні дослідження AI, щоб зробити доступнішим для розробників державні моделі AI для розпізнавання мови з кращим досвідом розробника?”

І саме з цього ідея AssemblyAI почала розвиватися.

Яке найбільше завдання за будівництво точної та надійної технології розпізнавання мови?

Вартість та талант – це найбільші завдання для будь-якої компанії, яка намагається створити точну та надійну технологію розпізнавання мови.

Дані дорогі для придбання, і вам зазвичай потрібно сотні тисяч годин, щоб створити надійну систему розпізнавання мови. Крім того, вимоги до обчислення величезні для навчання. А служіння цим моделям у виробництві також дорого, і вимагає спеціалізованого таланту для оптимізації та економії.

Будівництво цих технологій також вимагає спеціалізованого навичок, який важко знайти. Це велика причина, чому клієнти приходять до нас за потужними моделями AI, які ми досліджуємо, тренуємо та розгортаємо всередині. Вони отримують доступ до років досліджень державних моделей AI для ASR та NLP, все з простим API.

Поза чистим транскрибуванням аудіо- та відеоконтенту AssemblyAI пропонує додаткові моделі, можете.tell про це?

Наш набір моделей AI розширюється за межі простого транскрибування в режимі реального часу та асинхронного транскрибування. Ми називаємо ці додаткові моделі моделями Audio Intelligence, оскільки вони допомагають клієнтам аналізувати та краще розуміти аудіодані.

Наша модель підсумовування надає загальний підсумок, а також підсумки з часу, які автоматично розділяють та генерують підсумок для кожної “глави” як теми в розмові змінюється (подібно до розділів YouTube).

Наша модель аналізу настрою виявляє настрій кожного речення мови, вимовленої в аудіофайлах. Кожне речення в транскрипті можна позначити як Позитивне, Негативне або Нейтральне.

Наша модель виявлення сутностей ідентифікує широкий спектр сутностей, які вимовляються в аудіофайлах, таких як імена осіб чи компаній, електронні адреси, дати та місця.

Наша модель виявлення тем позначає теми, які обговорюються в аудіо- та відеофайлах. Передбачувані тематичні мітки слідують стандартизованій таксономії IAB, що робить їх придатними для контекстної цілі.

Наша модель модерації вмісту виявляє чутливий вміст в аудіо- та відеофайлах – такий як ненависть, насильство, чутливі соціальні питання, алкоголь, наркотики та інше.

Які найбільші випадки використання для компаній, які використовують AssemblyAI?

Найбільші випадки використання для компаній, які використовують AssemblyAI, охоплюють чотири категорії: телефонія, відео, віртуальні зустрічі та ЗМІ.

CallRail – це чудовий приклад клієнта у сфері телефонії, який використовує моделі AI від AssemblyAI – Core Transcription, Automatic Transcript Highlights та PII Redaction – для надання потужного рішення Conversational Intelligence своїм клієнтам.

По суті, CallRail тепер може автоматично поверхувати та визначати ключовий вміст у своїх телефонних розмовах для клієнтів у великому масштабі – ключовий вміст, такий як конкретні запити клієнтів, часто запитувані питання та часто використовувані ключові слова та фрази. Наша модель PII Redaction допомагає їм автоматично виявляти та видаляти чутливі дані, знайдені в тексті транскрипції (наприклад, номери соціального страхування, номери кредитних карток, особисті адреси тощо).

Відео випадки використання охоплюють відеоплатформи потокового мовлення до відеоредакторів, таких як Veed, які використовують моделі Core Transcription від AssemblyAI для спрощення процесу відеомонтажу для користувачів. Veed дозволяє своїм користувачам транскрибувати відео та редагувати їх безпосередньо за допомогою субтитрів.

У віртуальних зустрічах компанії, які розробляють програмне забезпечення для транскрибування зустрічей, такі як Fathom, використовують AssemblyAI для створення інтелектуальних функцій, які допомагають користувачам транскрибувати та виділяти ключові моменти з їхніх зустрічей Zoom, сприяючи кращій участі у зустрічах та ліквідуючи трудомісткі завдання під час та після зустрічей (наприклад, ведення нотаток).

У ЗМІ ми бачимо, як платформи хостингу подкастів, наприклад, використовують наші моделі Content Moderation та Topic Detection, щоб запропонувати кращі інструменти для бренд-безпеки та монетизації користувацького контенту з динамічними рекламами.

AssemblyAI недавно привернув $30M Серії B. Як це прискорить місію AssemblyAI?

Прогрес, якого досягнуто у сфері AI, надзвичайно цікавий. Наша мета – зробити цей прогрес доступним кожному розробнику та команді продукту в Інтернеті – через простий набір API. Коли ми продовжимо досліджувати та тренувати державні моделі AI для завдань ASR та NLP (таких як розпізнавання мови, підсумовування, ідентифікація мови та багато інших завдань), ми продовжимо надавати ці моделі AI розробникам та командам продукту через прості API – доступні безкоштовно.

AssemblyAI – це місце, де розробники та команди продукту можуть прийти, щоб отримати легкий доступ до передових моделей AI, яких їм потрібно для створення нових продуктів, послуг та цілих компаній.

За останні 6 місяців ми запустили підтримку ASR для 15 нових мов – включаючи іспанську, німецьку, французьку, італійську, хінді та японську, випустили значні покращення наших моделей підсумовування, моделей ASR у реальному часі, моделей Content Moderation та безліч інших оновлень продукту.

Ми майже не використали наші фонди Серії А, але це нове фінансування дозволить нам агресивно розширити наші зусилля – без компромісу щодо нашого ресурсу.

З цим новим фінансуванням ми зможемо прискорити наш продукт-роудмеп, побудувати кращу інфраструктуру AI для прискорення наших досліджень AI та двигунів висновку, а також розширити нашу команду досліджень AI – яка сьогодні включає дослідників з DeepMind, Google (GOOGL ) Brain, Meta AI, BMW та Cisco.

Чи є щось ще, що ви хотіли б поділитися про AssemblyAI?

Наша місія – зробити державні моделі AI доступними для розробників та команд продукту у величезному масштабі через просте API.

Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати AssemblyAI.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.