Интервью
Дилан Фокс, генеральный директор и основатель AssemblyAI – Интервью

Дилан Фокс – генеральный директор и основатель AssemblyAI, платформы, которая автоматически конвертирует аудио- и видеофайлы, а также прямые аудиопотоки в текст с помощью API Speech-to-Text от AssemblyAI.
Что изначально привлекло вас к машинному обучению?
Я начал с изучения программирования и посещал встречи Python в Вашингтоне, где учился в колледже. Через колледжские курсы я обнаружил, что склоняюсь к алгоритмическим задачам программирования, что естественно привело меня к машинному обучению и NLP.
До основания AssemblyAI вы были старшим инженером-программистом в Cisco, над чем вы работали?
В Cisco я был старшим инженером-программистом, занимаясь машинным обучением для их продуктов сотрудничества.
Как ваша работа в Cisco и проблема с поиском технологии распознавания речи вдохновили вас на запуск AssemblyAI?
В некоторых предыдущих работах у меня была возможность работать над множеством проектов AI, включая проекты, требующие распознавания речи. Но все компании, предлагающие распознавание речи как услугу, были невероятно устаревшими, трудными для покупки и использовали устаревшие технологии AI.
Когда я стал все больше интересоваться исследованиями AI, я заметил, что в области распознавания речи проводится много работы и как быстро улучшается исследование. Итак, это было сочетание факторов, которое вдохновило меня подумать: «Что, если можно построить компанию в стиле Twilio, используя последние исследования AI, которые были бы намного проще для разработчиков доступа к передовым моделям AI для распознавания речи, с гораздо лучшим опытом разработчика?»
Именно оттуда выросла идея AssemblyAI.
Каков самый большой вызов за построение точной и надежной технологии распознавания речи?
Стоимость и таланты – это самые большие вызовы для любой компании, решающей построить точную и надежную технологию распознавания речи.
Данные обходятся дорого, и вам обычно нужно hundreds тысяч часов, чтобы построить прочную систему распознавания речи. Кроме того, требования к вычислениям огромны для обучения. И обслуживание этих моделей в производстве также дорогое и требует специализированных талантов для оптимизации и экономии.
Построение этих технологий также требует специализированного навыка, который трудно найти. Вот почему клиенты приходят к нам за мощными моделями AI, которые мы исследуем, обучаем и развертываем внутри. Они получают доступ к годам исследований по передовым моделям AI для ASR и NLP, все с помощью простого API.
Помимо простой транскрипции аудио- и видеоконтента AssemblyAI предлагает дополнительные модели, можете ли вы обсудить, что это за модели?
Наш набор моделей AI выходит за рамки простой транскрипции в режиме реального времени и асинхронной транскрипции. Мы называем эти дополнительные модели моделями Audio Intelligence, поскольку они помогают клиентам анализировать и лучше понимать аудиоданные.
Наша модель Суммаризации предоставляет общую суммаризацию, а также суммаризацию с временными кодами, которая автоматически сегментирует и генерирует суммаризацию для каждой «главы» при изменении темы в разговоре (podobno YouTube главам).
Наша модель Анализа Настроений обнаруживает настроение каждого предложения речи, произнесенной в аудиофайлах. Каждое предложение в транскрипте может быть помечено как Положительное, Отрицательное или Нейтральное.
Наша модель Обнаружения Сущностей идентифицирует широкий спектр сущностей, упомянутых в аудиофайлах, таких как имена людей или компаний, электронные адреса, даты и места.
Наша модель Обнаружения Темы помечает темы, обсуждаемые в аудио- и видеофайлах. Предсказанные метки тем соответствуют стандартизированной таксономии IAB, что делает их подходящими для контекстной цели.
Наша модель Модерации Контента обнаруживает чувствительный контент в аудио- и видеофайлах – такой как ненавистная речь, насилие, чувствительные социальные проблемы, алкоголь, наркотики и многое другое.
Каковы некоторые из самых больших вариантов использования для компаний, использующих AssemblyAI?
Самые большие варианты использования для компаний, использующих AssemblyAI, охватывают четыре категории: телефония, видео, виртуальные встречи и медиа.
CallRail – отличный пример клиента в телефонии, который использует модели AI от AssemblyAI – Core Transcription, Automatic Transcript Highlights и PII Redaction – для предоставления мощного решения Conversational Intelligence своим клиентам.
По сути, CallRail может теперь автоматически выделять и определять ключевой контент в своих телефонных звонках для своих клиентов в масштабе – ключевой контент, такой как конкретные запросы клиентов, часто задаваемые вопросы и часто используемые ключевые слова и фразы. Наша модель PII Redaction помогает им автоматически обнаруживать и удалять чувствительные данные, найденные в тексте транскрипта (например, номера социального страхования, номера кредитных карт, личные адреса и многое другое).
Видео варианты использования варьируются от платформ видеопотоков до видеоредакторов, таких как Veed, которые используют модели Core Transcription от AssemblyAI для упрощения процесса видеомонтажа для пользователей. Veed позволяет своим пользователям транскрибировать свои видео и редактировать их直接 с помощью субтитров.
В виртуальных встречах программное обеспечение для транскрипции встреч, такое как Fathom, использует AssemblyAI для построения интеллектуальных функций, которые помогают пользователям транскрибировать и выделять ключевые моменты из своих звонков Zoom, способствуя лучшему взаимодействию на встречах и исключая скучные задачи во время и после встреч (например, ведение заметок).
В медиа мы видим, что платформы для хостинга подкастов, например, используют наши модели Content Moderation и Topic Detection, чтобы предложить лучшие инструменты для бренд-безопасности и монетизации пользовательского контента с помощью динамических реклам.
AssemblyAI недавно получил 30 миллионов долларов в рамках раунда серии B. Как это ускорит миссию AssemblyAI?
Прогресс, достигнутый в области AI, невероятно интересен. Наша цель – раскрыть этот прогресс каждому разработчику и команде продукта в интернете – через простой набор API. Когда мы продолжаем исследовать и обучать передовые модели AI для задач ASR и NLP (таких как распознавание речи, суммаризация, определение языка и многие другие задачи), мы продолжим предоставлять эти модели AI разработчикам и командам продукта через простые API – доступные бесплатно.
AssemblyAI – это место, где разработчики и команды продукта могут прийти, чтобы получить легкий доступ к передовым моделям AI, необходимым для построения интересных новых продуктов, услуг и целых компаний.
За последние 6 месяцев мы запустили поддержку ASR для 15 новых языков – включая испанский, немецкий, французский, итальянский, хинди и японский, выпустили значительные улучшения наших моделей Суммаризации, моделей ASR в реальном времени, моделей Content Moderation и бесчисленных других обновлений продукта.
Мы едва использовали наши средства серии A, но это новое финансирование даст нам возможность агрессивно масштабировать наши усилия – без компрометации нашей дальности.
С этим новым финансированием мы сможем ускорить наш продукт, построить лучшую AI-инфраструктуру для ускорения наших исследований AI и двигателей вывода, а также расширить нашу команду исследователей AI – которая сегодня включает исследователей из DeepMind, Google (GOOGL ) Brain, Meta AI, BMW и Cisco.
Есть ли что-то еще, что вы хотели бы поделиться об AssemblyAI?
Наша миссия – сделать передовые модели AI доступными разработчикам и командам продукта в невероятно большом масштабе через простой API.
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить AssemblyAI.












