인터뷰

AssemblyAI의 Dylan Fox CEO & 설립자 – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

Dylan Fox는 AssemblyAI의 CEO 및 설립자로, AssemblyAI의 Speech-to-Text API를 통해 오디오와 비디오 파일 및 라이브 오디오 스트림을 자동으로 텍스트로 변환하는 플랫폼입니다.

머신 러닝에 처음 관심을 갖게 된 계기는 무엇인가?

저는 프로그래밍을 배우기 시작했고 워싱턴 DC에서 열린 파이썬 미트업에 참석했습니다. 대학 과정에서 저는 알고리즘 유형의 프로그래밍 문제에 더 관심을 갖게 되었고, 자연스럽게 머신 러닝과 NLP로 관심을 확장했습니다.

AssemblyAI를 설립하기 전에 시스코의 선임 소프트웨어 엔지니어로 근무했다. 당시에는 어떤 일을 했나?

시스코에서 저는 협업 제품을 위한 머신 러닝에 중점을 둔 선임 소프트웨어 엔지니어로 근무했습니다.

시스코에서 근무하고 음성 인식 기술을 구입하는 문제로 인해 AssemblyAI를 설립하게 된 계기는 무엇인가?

전 직장에서 저는 여러 AI 프로젝트를 진행했으며, 음성 인식이 필요한 프로젝트도 있었습니다. 그러나 음성 인식을 제공하는 모든 회사는 매우 구식이었고, 구입하기 어려웠으며, 구식 AI 기술을 사용하고 있었습니다.

저는 AI 연구에 더 관심을 가지게 되면서 음성 인식 분야에서 많은 연구가 진행되고 있음을 알게 되었습니다. 그래서 저는 “최신 AI 연구를 사용하여 개발자에게 더 쉽게 접근할 수 있는 음성 인식 기술을 제공하는 회사를 설립하면 어떨까?”라는 생각을 하게 되었습니다.

그리고 그것이 AssemblyAI의 아이디어가 탄생한 계기가 되었습니다.

정확하고 신뢰할 수 있는 음성 인식 기술을 구축하는 데 가장 큰 도전은 무엇인가?

비용과人才이 음성 인식 기술을 구축하는 데 가장 큰 도전입니다.

데이터를 수집하는 데 비용이 많이 들고, 강력한 음성 인식 시스템을 구축하기 위해 수백만 시간의 데이터가 필요합니다. 또한 모델을 훈련시키고 제공하는 데에는巨大的 컴퓨팅 자원이 필요합니다. 이러한 기술을 구축하는 데에는 전문적인 기술이 필요합니다.

이러한 기술을 구축하는 데에는 전문적인 기술이 필요하므로 고객이 저희에게 powerful한 AI 모델을 연구하고 훈련하고 제공하도록頼みます. 고객은 음성 인식과 NLP에 대한 최신 연구를 통해 개발자와 제품 팀에게 접근할 수 있습니다.

AssemblyAI는 오디오와 비디오 콘텐츠의 전사 외에도 추가 모델을 제공합니다. 이러한 모델에 대해 설명해 주시겠습니까?

저희의 AI 모델은 실시간 및 비실시간 전사 외에도 오디오 데이터를 분석하고 이해하는 데 도움이 되는 추가 모델을 제공합니다.

요약 모델은 전체 요약과 시간 코드가 있는 요약을 제공하며, 대화의 주제가 변경될 때마다 자동으로 세그먼트를 생성하고 요약합니다.

감성 분석 모델은 오디오 파일에서 말한 각 문장의 감성을 감지합니다. 각 문장은 긍정적, 부정적, 중립적으로 표시될 수 있습니다.

엔티티 감지 모델은 오디오 파일에서 말한 다양한 엔티티를 식별합니다. 사람이나 회사 이름, 이메일 주소, 날짜, 위치 등입니다.

주제 감지 모델은 오디오와 비디오 파일에서 말한 주제를 레이블링합니다. 예측된 주제 레이블은 표준화된 IAB 분류법을 따르므로 컨텍스트 타게팅에 적합합니다.

콘텐츠 모더레이션 모델은 오디오와 비디오 파일에서 민감한 콘텐츠를 감지합니다. 증오 言論, 폭력, 민감한 사회 문제, 알코올, 마약 등입니다.

AssemblyAI를 사용하는 회사의 가장 큰 사용 사례는 무엇인가?

AssemblyAI를 사용하는 회사의 가장 큰 사용 사례는 통신, 비디오, 가상 회의, 미디어 등 4가지 범주에 걸쳐 있습니다.

CallRail은 AssemblyAI의 AI 모델을 사용하여 강력한 대화 인텔리전스 솔루션을 고객에게 제공하는 통신 분야의 고객입니다.

CallRail은 AssemblyAI의 핵심 전사 모델, 자동 전사 하이라이트, PII 편집 모델을 사용하여 고객에게 중요한 콘텐츠를 자동으로 표면화하고 정의할 수 있습니다.

비디오 사용 사례는 비디오 스트리밍 플랫폼에서 비디오 편집기인 Veed까지 다양합니다. Veed는 AssemblyAI의 핵심 전사 모델을 사용하여 사용자가 비디오를 편집할 수 있도록 합니다.

가상 회의에서 회의 전사 소프트웨어 회사인 Fathom은 AssemblyAI를 사용하여 지능형 기능을 구축하여 사용자가 Zoom 회의에서 중요한 순간을 전사하고 하이라이트할 수 있도록 합니다.

미디어에서 팟캐스트 호스팅 플랫폼은 AssemblyAI의 콘텐츠 모더레이션 및 주제 감지 모델을 사용하여 브랜드 안전성 사용 사례에 대한 더好的 광고 도구를 제공하고 사용자 생성 콘텐츠를 동적 광고로 모니터할 수 있습니다.

AssemblyAI는 최근 3,000만 달러의 시리즈 B 자금을 조달했습니다. 이것은 어떻게 AssemblyAI의 미션을 가속화할 수 있을까요?

AI 분야의 진행 상황은非常히 흥미롭습니다. 저희의 목표는 이 진행 상황을 모든 개발자와 제품 팀에게 노출시키는 것입니다. 저희는 계속해서 음성 인식, 요약, 언어 식별, 기타 많은 태스크를 위한 최첨단 AI 모델을 연구하고 훈련하며, 개발자와 제품 팀에게 간단한 API를 통해 노출시키도록 하겠습니다.

AssemblyAI는 개발자와 제품 팀이 접근할 수 있는 곳입니다. 여기서 개발자와 제품 팀은 새로운 제품, 서비스, 회사를 구축하는 데 필요한 고급 AI 모델에 쉽게 접근할 수 있습니다.

過去 6개월 동안, 저희는 15개의 새로운 언어를 지원하는 음성 인식 모델을 출시했습니다. 또한 요약 모델, 실시간 음성 인식 모델, 콘텐츠 모더레이션 모델, 기타 많은 제품 업데이트를 진행했습니다.

이 새로운 자금 조달은 저희에게 더욱 적극적으로 노력할 수 있는 기회를 제공할 것입니다. 저희는 제품 로드맵을 가속화하고, AI 연구와 추론 엔진을 위한 더好的 인프라를 구축하며, AI 연구 팀을 확장할 수 있을 것입니다.

AssemblyAI에 대해 추가로 공유하고 싶은 내용이 있나요?

저희의 미션은 개발자와 제품 팀이 매우 큰 규모에서 최첨단 AI 모델에 접근할 수 있도록 하는 것입니다. 간단한 API를 통해 제공됩니다.

감사합니다. 더 많은 정보를 원하는 독자는 AssemblyAI를 방문하십시오.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.