인터뷰
애플린의 AI 전문가 시니어 디렉터 주디스 비숍 박사 – 인터뷰 시리즈

주디스 비숍 박사는 애플린(APAC/US 지역)의 AI 전문가 시니어 디렉터입니다. 그녀는 언어학자, 계산 언어학자, 인간 의사소통 전문가(음성, 글쓰기, 제스처)로 구성된 최상급 팀을 이끌고 성장시키며, 품질과 속도의 결합이無한 AI 훈련 데이터를 제공하고 있습니다.
언어학에 처음 관심을 가지게 된 계기는 무엇인가요?
저는 고등학교 때 영어 교사로부터 언어학에 대해 처음 들었습니다. 저는 외국어와 인문학, 수학 및 과학 과목에 동등하게 관심이 있었던 학생이었습니다. 언어학은 언어가 작동하는 방식에 대한 과학이기 때문에, 저의 관심사를 하나로 모으는 데 도움이 되었습니다. 많은 사람들과 마찬가지로, 언어학에 대해 알게 된 후에는 완전히 매료되었습니다. 우리가 서로의 생각과 감정을 어떻게 의사소통하는지에 대해 더 매혹적인 것은 무엇일까요? 언어학은 언어 구조를 연구하며, 이러한 구조는 서로 다른 음성과 문자 체계에도 불구하고, 모두 인간 존재의 산물이기 때문에 종종 표면 아래에서 유사합니다.
AI 분야에서 일하게 된 경위는 무엇인가요?
저는 2004년부터 애플린에서 언어 기술 제품 및 서비스 개발을 지원해 왔습니다. 이 기간 동안 AI는 인간의 의사소통, 추론, 지각 능력을 모방하고 확장하는 기술의 포괄적인 프레임워크, 임무 및 비전으로 등장했습니다. 2019년에 저의 팀은 AI 전문가로 브랜드를 변경했으며, 이는 언어학 및 언어 지식이 AI 기업에 필수적임을 인식한 결과입니다. 우리의 주석이 달린 데이터는 AI 제품 및 서비스와의 인간 상호작용에 필수적인 지원을 제공합니다.
AI 분야에서 16년 이상 근무한 경험 중 가장 큰 변화는 무엇이라고 생각하시나요?
주된 변화는 핵심 기술 개발에서 사용 사례 및 애플리케이션의 장기尾에 대한 초점의 분산입니다. 저의 경력 대부분 동안 언어 기반 AI의 초점은 인간 음성 인식 및 생성, 즉 음성 인식, 음성 합성, 자연어 처리를 모방하는 핵심 모델을 개발하고 정련하는 데 있었습니다. 데이터셋은 일반적으로 Speecon 컨소시엄(Speech-Driven Interfaces for Consumer Devices)과 같은 공통 레이블링 및 데이터 샘플링 표준 및 규칙을 따랐습니다. 이러한 표준은 핵심 기술 개발자가 공통 데이터 구조에서 성능을 벤치마크하고 AI의 빠른 진화를 지원하는 데 도움이 되었습니다.
기계 학습에서 편향되지 않은 데이터의 중요성에 대해 논의해 주시겠습니까?
기계 학습 모델(监督 학습, 비감독 학습, 강화 학습 모델)은 훈련 데이터에 존재하는 편향을 반영할 것입니다. Alyssa Simpson Rochwerger와 Wilson Pang는 최근 저서 Real World AI에서 이 문제에 대한 몇 가지 훌륭한 예를 제공합니다. 특정 인구 집단에 대한 훈련 데이터가 충분하지 않은 경우, AI 모델은 해당 집단에서 덜 정확할 것입니다.
또 다른 일반적인 경우는 인구의 표현이 충분하지만, 훈련 데이터에 실제로 존재하지만 바람직하지 않은 세계의 조건(예: 여성의 완전 고용률이 낮거나, 아프리카계 미국인의 수감률이 높은 경우)을 반영하는 데이터 포인트 간의 상관관계가 있는 경우, 결과 AI 애플리케이션은 이러한 조건을 강화하고 지속시킬 수 있습니다.
언어 전반에 걸친 연관성은 단어 임베딩과 같은 통계적 관계를 사용하는 NLP 애플리케이션에서 편향을 생성할 수 있습니다. 훈련 데이터에서 ‘she’와 ‘nurse’가 ‘they’ 또는 ‘he’와 ‘nurse’보다 더 자주 관련되어 있다면, 결과 애플리케이션은 간호사를 지칭할 때 ‘she’를 사용할 것입니다. 이러한 특정 문제를 해결하기 위해 연구자들은 최근에 GN-GloVe라는 성별 중립적 변형의 단어 임베딩 알고리즘을 개발했습니다.
민감한 애플리케이션에서 이러한 편향 문제는 사용자에게 심각한 영향을 미칠 수 있으며, 비즈니스 투자를 무효로 만들 수 있습니다. 좋은 소식은, 새로운 더 투명하고 포괄적인 데이터셋의 개발 외에도, 기존 훈련 데이터셋 및 AI 애플리케이션에서 편향을 확인하는 데 사용되는 데이터 과학 애플리케이션이 점점 더 개발되고 있다는 것입니다.
애플린은 최근 자연어 처리(NLP) 이니셔티브를 위한 다양한 훈련 데이터셋을 출시했습니다. 이러한 데이터셋이 언어, 방언, 민족언어, 억양, 인종 또는 성별에 관계없이 최종 사용자가 동일한 경험을 얻을 수 있도록 어떻게 지원할 수 있는지에 대해 자세히 알려주십시오.
앞서 언급한 이유로, 기존의 AI 생산 시스템에서 편향을 수정하기 위해 데이터셋이 필요하며, 미래 시스템을 위한 더 포괄적인 데이터셋도 필요합니다. 언급한 애플린 데이터셋은 아프리카계 미국인 방언 영어와 같은 민족언어와 관련된 편향을 수정하는 데 도움이 될 것입니다. 이러한 인구의 AI 언어 모델에서 표현을 강화하기 위한 보충 훈련 데이터를 제공할 것입니다.
민족성은 AI 데이터에서 명시적인 레이블링을 위한 중요한 인구 통계학적 차원이 되고 있습니다. 언어학자들은 특정 민족성과 관련된 언어 변이를 ‘민족언어’라고 합니다. 애플린과 같은 AI 데이터 제공업체는 더 이상 다양한 및 소수 인구를 AI 훈련 데이터셋에 명시적으로 표현하지 않으면, 결과 시스템이 이러한 인구 집단에서 동등하게 수행할 수 없다는 것을 인식하고 있습니다.
동등한 성능은 시스템이 사용자의 단어와 의도(의미 또는 수행하려는 동작)를 동일한 정확도로 인식하며, 사용자의 필요를 동일하게 만족시키고, 특정 사용자 인구에 대해 더 부정적인 영향을 미치지 않는다는 것을 의미합니다.
애플린 밖에서,您는 또한 시인으로서 여러 시상에서 수상한 시를 가지고 있습니다. 미래의 AI가 이러한 유형의 창의성을 나타내는 것에 대한您的 견해는 무엇인가요? 예를 들어, 시를 쓰는 것?
그것은 매혹적인 질문입니다. 시와 다른 형태의 인간 창의성은, 우리의 모든 인간 자원(기억, 지각, 감각, 감정)과 언어 및 이미지의 구조와ニュアンス를 사용하여, 현대의 문제에 공鳴하는 통찰력을 생성합니다. 에밀리 디킨슨은 “만약 내가 책을 읽고, 내 몸 전체가 холод해져서 불로도 따뜻하게 할 수 없다면, 나는 그것이 시라는 것을 압니다. 만약 내가 물리적으로 내 머리 위가 벗겨진 것처럼 느끼면, 나는 그것이 시라는 것을 압니다.”라고 했습니다. 감각적, 감정적 인식의 요소가 있어야 하며, 또한真正한驚奇가 있어야 합니다.
고급 AI 모델(예: GPT-3)은 통계적으로 단어가 서로 다른 장르(예: 시)에서 함께 나타날 가능성을 모델링할 수 있습니다. 이는 “시적” 언어(예: 높임말, 운율, 예상치 못한 단어 조합)를 생성할 수 있음을 의미합니다. 그러나 이러한 생성 언어 모델은 현재의 인간 존재를照らす 예술 작품을 생성하는 데 필요한 대부분의 자원을欠いています.
창의적 맥락에서 AI의 매력은, 인간의 마음만으로는 도달할 수 없는 새로운 통찰력을 생성할 수 있는 잠재력에 있습니다. 일단 AI가 인간 도메인의 광범위한 영역(시각, 촉각, 청각, 생리학, 감정)에서 감각 및 지각 데이터를 분석할 수 있게 되면, 우리가 스스로와 세계에 대해 무엇을 배울 수 있을지 알 수 없습니다. AI의 분석 능력은 인간 창의力的 새로운 토대를 제공할 수 있습니다.
您의 경력은 非常 훌륭했습니다. 여성들이 STEM 및 특히 AI에 참여하지 못하는 이유는 무엇이라고 생각하시나요?
역할 모델의 부족은 강력한 요인일 수 있습니다(그리고 악순환입니다). 문화적, 사회적, 실제적으로 여성이나 다른 다양한 성별의 사람들이 아직 깊이 정착되지 않은 분야에 진입하는 것이 어려울 수 있으며, 우리가 기여할 수 있는 것을 존중하는 것이 종종 부족합니다. 저의 리더십 경험은 저에게 다양한 경험과 관점을 포함하는 팀이 얼마나 회복력 있고 창의적이며 성공적일 수 있는지 보여주었습니다. 리더들은 다양한 경험과 관점을 포함하는 팀을 구성하는 데 모험적이어야 하며, 이러한 관점이 가져올 수 있는 도전을 처리할 수 있는 자신감을 가지고 있어야 합니다. 이는 또한 재정적 및 기업적 성공과 강하게 상관관계가 있음을 입증했습니다.
애플린이나 AI에 대해 더 공유하고 싶은 내용이 있나요?
애플린과 같은 데이터 제공업체는 포괄적인 훈련 데이터를 제공함으로써 AI 결과를 더 나은 방향으로 영향력을 행사할 수 있는 강력한 잠재력을 가지고 있습니다.
그러나 포괄적인 AI를 달성하는 목표는 모든 사람이 참여해야 합니다. 데이터 구매자는 또한 자신의 시스템이 실제 세계의 모든 사용자에게 최적의 성능을 보장하기 위해 포괄적인 데이터를 명시적으로 요청하고 지불해야 합니다. 또한 AI 개발을 위해 데이터를 제공하는 다양한 커뮤니티의 사람들은 자신의 데이터가 사용되는 방식을 신뢰할 수 있어야 합니다. 이러한 신뢰를 구축하기 위해서는 모든 민감한 데이터를 처리하는 사람들의 강력한 투명성과 윤리적 관행이 필요합니다.
훌륭한 인터뷰에 감사드립니다. AI와 언어학에 대한您的 견해를 더 많이 배우게 되어 기쁩니다. 더 많은 정보를 원하는 독자는 애플린을 방문할 수 있습니다.












