インタビュー
AssemblyAIのCEO兼創設者Dylan Fox – インタビューシリーズ

Dylan Foxは、AssemblyAIのCEO兼創設者です。AssemblyAIは、AssemblyAIのSpeech-to-Text APIを使用して、オーディオとビデオファイルおよびライブオーディオストリームをテキストに自動的に変換するプラットフォームです。
あなたが最初に機械学習に惹かれたのは何ですか?
私は、ワシントンDCで大学に通っていたときに、Pythonのミートアップに参加してプログラミングを学び始めました。大学でのコースで、アルゴリズムのようなプログラミングの問題に興味を持つようになり、自然と機械学習とNLPに惹かれました。
AssemblyAIを創設する前に、シスコのシニアソフトウェアエンジニアでしたが、そこでは何を担当していましたか?
シスコでは、シニアソフトウェアエンジニアとして、コラボレーション製品のための機械学習に焦点を当てていました。
シスコでのあなたの仕事とスピーチ認識技術の調達に関する問題は、AssemblyAIを立ち上げるきっかけとなりましたか?
以前の仕事では、AIプロジェクトに取り組む機会があり、その中にはスピーチ認識が必要なプロジェクトもありました。しかし、スピーチ認識サービスを提供する会社はすべて旧式で、買い手にとって使い勝手が悪く、古いAI技術を使用していました。
AI研究に興味を持つにつれて、スピーチ認識の分野で行われている研究の進歩に気付きました。そこで、TwilioのようなAPI会社を、最新のAI研究を使用して、開発者が簡単に最先端のAIモデルにアクセスできるようにするという考えが浮かびました。
それから、AssemblyAIのアイデアが生まれました。
正確で信頼性の高いスピーチ認識技術を構築する最大の課題は何ですか?
コストと人才が、正確で信頼性の高いスピーチ認識技術を構築する上での最大の課題です。
データの取得が高価で、信頼性の高いスピーチ認識システムを構築するには数十万時間のデータが必要です。また、モデルをトレーニングするためのコンピューティング要件も大きく、運用環境での提供も高価で、最適化とコスト削減のための専門的な才能が必要です。
これらの技術を構築するには、専門的なスキルセットが必要です。これは、顧客が私たちに来て、強力なAIモデルにアクセスできる理由の1つです。顧客は、ASRとNLPの最先端のAIモデルへのアクセスを得ることができます。すべては、シンプルなAPIを通じて提供されます。
AssemblyAIは、オーディオとビデオコンテンツの転写以外にも、追加のモデルを提供しています。説明してください。
私たちのAIモデルのスイートは、リアルタイムおよび非同期の転写に限定されません。私たちは、これらの追加モデルをオーディオインテリジェンスモデルと呼んでいます。これらは、顧客がオーディオデータを分析し、よりよく理解するのに役立ちます。
私たちの要約モデルは、全体的な要約と、トピックの変更ごとに自動的にセグメント化して要約を生成するタイムコード付きの要約を提供します(YouTubeのチャプターのようなものです)。
私たちの感情分析モデルは、オーディオファイルで話された各文の感情を検出します。各文は、肯定的、否定的、または中立的としてマークされます。
私たちのエンティティ検出モデルは、オーディオファイルで話された幅広いエンティティを検出します。例えば、人や会社の名前、メールアドレス、日付、場所などです。
私たちのトピック検出モデルは、オーディオおよびビデオファイルで話されたトピックをラベル付けします。予測されたトピックラベルは、IABタクソノミーに基づいています。これにより、コンテキストターゲティングに適したものになります。
私たちのコンテンツモデレーションモデルは、オーディオおよびビデオファイル内のヘイトスピーチ、暴力、デリケートな社会問題、アルコール、薬物など、機密情報を検出します。
AssemblyAIを使用する企業の最大のユースケースは何ですか?
AssemblyAIを使用する企業の最大のユースケースは、4つのカテゴリにわたります。テレフォニー、ビデオ、バーチャルミーティング、メディアです。
CallRailは、テレフォニー分野での顧客の良い例です。CallRailは、AssemblyAIのAIモデル(Core Transcription、Automatic Transcript Highlights、PII Redaction)を使用して、顧客に強力な会話インテリジェンスソリューションを提供しています。
基本的に、CallRailは、電話での重要なコンテンツ(特定の顧客リクエスト、よく聞かれる質問、頻繁に使用されるキーワードやフレーズなど)を自動的に顧客に提示できます。私たちのPII Redactionモデルは、トランスクリプトテキスト(例:社会保障番号、クレジットカード番号、個人住所など)内で機密情報を自動的に検出して削除するのに役立ちます。
ビデオのユースケースは、ビデオストリーミングプラットフォームからビデオエディターのVeedまで幅広いものがあります。Veedは、AssemblyAIのCore Transcriptionモデルを使用して、ユーザーがビデオを簡単に編集できるようにしています。Veedは、ビデオの字幕を使用して直接編集できるようにしています。
バーチャルミーティングでは、ミーティングトランスクリプションソフトウェア会社のFathomが、AssemblyAIを使用して、ユーザーがZoomコールの重要な瞬間をトランスクリプトしてハイライトできるようにしています。これにより、ミーティングの参加者は、ミーティング中およびミーティング後の退屈なタスクを省略できます(例:ノートを取るなど)。
メディアでは、ポッドキャストホスティングプラットフォームが、私たちのコンテンツモデレーションおよびトピック検出モデルを使用して、ブランドセーフティのユースケース向けにより良い広告ツールを提供し、ユーザー生成コンテンツをダイナミック広告で収益化できるようにしています。
AssemblyAIは最近、3,000万ドルのシリーズBラウンドを調達しました。この資金は、AssemblyAIの使命をどのように加速するでしょうか?
AI分野の進歩は非常に興奮します。私たちの目標は、インターネット上のすべての開発者と製品チームが、シンプルなAPIを通じてこの進歩にアクセスできるようにすることです。私たちがASRとNLPタスク(スピーチ認識、要約、言語識別など)の最先端のAIモデルを研究してトレーニングするにつれて、これらのAIモデルを開発者と製品チームが使用できるように、シンプルなAPIを通じて提供し続けます。
AssemblyAIは、開発者と製品チームが、簡単に最先端のAIモデルにアクセスできる場所です。ここで、開発者と製品チームは、新しい製品、サービス、企業を構築するために必要なAIモデルにアクセスできます。
過去6ヶ月間で、我々は15の新しい言語(スペイン語、ドイツ語、フランス語、イタリア語、ヒンディー語、日本語など)に対するASRのサポートを導入し、要約モデル、リアルタイムASRモデル、コンテンツモデレーションモデルなど、多くの製品アップデートをリリースしました。
シ리즈Aの資金はほとんど使っていませんが、この新しい資金調達により、努力を加速させることができます。資金調達により、製品ロードマップを加速させ、AI研究と推論エンジンのためのベターなインフラストラクチャを構築し、AI研究チームを拡大できます。現在のチームには、DeepMind、Google (GOOGL ) Brain、Meta AI、BMW、シスコからの研究者が含まれています。
AssemblyAIについてさらに共有したいことはありますか?
私たちの使命は、開発者と製品チームが、非常に大きなスケールでシンプルなAPIを通じて、最先端のAIモデルにアクセスできるようにすることです。
素晴らしいインタビュー、詳しく知りたい読者はAssemblyAIを訪問してください。












