인터뷰
윌슨 팡, Real World AI의 공동 저자 – 인터뷰 시리즈

윌슨 팡은 2018년 11월 Appen의 CTO로加入하여 회사 제품과 기술을 담당합니다. 윌슨은 소프트웨어 엔지니어링과 데이터 과학 분야에서 19년 이상의 경험을 가지고 있습니다. Appen에加入하기 전에, 그는 중국에서 두 번째로 큰 온라인 여행사인 Ctrip의 최고 데이터 책임자였으며, 데이터 엔지니어, 분석가, 데이터 제품 매니저, 과학자들을 이끌어 사용자 경험을 개선하고 운영 효율성을 높여 사업을 성장시켰습니다. 그 이전에는 캘리포니아의 eBay에서 엔지니어링 선임 디렉터로 일하며 데이터 서비스 및 솔루션, 검색 과학, 마케팅 기술, 청구 시스템 등 다양한 분야에서 리더십을 제공했습니다. 그는 이전에 IBM에서 아키텍트로 일하며 다양한 고객을 위한 기술 솔루션을 구축했습니다. 윌슨은 중국의 浙江大学에서 전기 공학 석사와 학사 학위를 취득했습니다.
그의 새로운 책에 대해 논의합니다: 실제 세계의 AI: 책임 있는 기계 학습을 위한 실용적인 안내서
당신은 eBay의 검색 과학 팀을 이끌었을 때, 기계 학습에서 측정해야 할 메트릭의 중요성을 이해하는 것이 첫 번째 교훈이었다고 설명합니다. “세션당 구매” 메트릭은 항목의 금전적 가치를 고려하지 않는다는 예가 제시됩니다. 회사들은 어떻게 이러한 문제를 피하기 위해 측정해야 할 메트릭을 이해할 수 있나요?
팀의 AI 모델에 대한 목표에서 시작하세요 – 우리의 경우, 기계 학습으로 더 많은 수익을 창출하고 싶었습니다. 목표에 메트릭을 부착할 때, 모델을 출시하고 사람들이 상호 작용하기 시작할 때 어떤 메커니즘을 생성할지 생각하고, 또한 가정 사항을 기록하세요. 우리의 경우, 모델이 수익을 최적화할 것이라고 가정했지만, 세션당 구매 수는 그에 해당하지 않았습니다. 모델은 높은 수의 저가 항목 판매를 최적화하고 있었기 때문입니다. 최종적으로 우리는 더 많은 돈을 벌지 못했습니다. 한旦 우리는 그것을 깨달았을 때, 우리는 메트릭을 변경하고 모델을 올바른 방향으로 조정할 수 있었습니다. 따라서 세부 메트릭을 결정하는 것이 중요하며, 가정 사항도 중요합니다.
이 책을 연구하고 작성하면서 개인적으로 무엇을 배웠나요?
다양한 회사와 산업에서 다양한 문제를 해결하기 위해 AI를 사용할 수 있습니다. 사용 사례는 매우 다를 수 있으며, AI 솔루션도 다를 수 있으며, 그 솔루션을 훈련시키기 위한 데이터도 다를 수 있습니다. 그러나 이러한 모든 차이에도 불구하고,人们들이 자신의 AI 여정에서犯한 실수는 매우 유사합니다. 이러한 실수는 모든 종류의 회사와 산업에서 반복적으로 발생합니다.
우리는 책에서 AI 프로젝트를 구현할 때 공통된最佳實踐을 공유하여 사람들이 이러한 실수를 피하고 책임 있는 AI를 배포하는 데 자신감을 얻을 수 있도록 도와주고자 합니다.
이 책에서 사람들이 배우기를 바라는 가장 중요한 교훈은 무엇인가요?
우리는 기계 학습 기술의 책임 있는 사용이 세계를更加 공정하고 공평하며 포용력 있는 곳으로 만들 수 있다고 믿습니다. 기계 학습 기술은 비즈니스 세계의 모든 것을 재구성할 수 있는 잠재력을 가지고 있지만, 그것이 어려울 필요는 없습니다. 팀이 따라갈 수 있는 검증된 방법과 프로세스가 있습니다.
또 다른 중요한 교훈은 비즈니스 소유자(제품 매니저와 같은)와 기술적인 측면(엔지니어와 데이터 과학자)의 팀 구성원들이 공통의 언어를 사용해야 한다는 것입니다. AI를 성공적으로 배포하려면 리더가 비즈니스 전문가와 기술적인 구현자 사이의 간격을 메워야 합니다.
많은 사람들이 AI를 생각할 때 코드를 먼저 생각합니다. 이 책에서 중요한 교훈 중 하나는 데이터가 AI 모델의 성공에 결정적이라는 것입니다. 데이터 수집, 레이블링, 저장 등 모든 단계가 모델의 성공에 영향을 미칩니다. 가장 성공적인 AI 배포는 데이터에 높은 강조를 두고 지속적으로 개선하는 것입니다.
실제 세계의 AI는 단지 교차 기능적인 팀과 혁신적인 정신이 필요합니다.
책에서 논의된 바와 같이, AI 모델의 정확도가 충분히 높은지 여부를 결정하는 것이 중요합니다. 정확도가 필요한 유형을 평가하는 가장 쉬운 방법은 무엇인가요?
사용 사례와 위험 감수 능력에 따라 다르습니다. AI를 개발하는 팀은 항상 테스트 단계에서 정확도 수준과 조직 및 이해관계자에게 허용 가능한 임계값을 결정해야 합니다. 생명이나 사망에 관련된 사용 사례(예: 판결 소프트웨어, 자율 주행 자동차, 의료 사용 사례)에서는 매우 높은 기준을 설정해야 하며, 모델이 잘못된 경우에 대한 대책을 마련해야 합니다. 더 fault-tolerant한 사용 사례(예: 콘텐츠, 검색, 광고 관련성)에서는 사용자 피드백을 통해 모델을 계속 조정할 수 있습니다. 그러나 여기에서도 불법 또는 비道德적인 자료가 사용자에게 표시될 수 있으므로, 안전 장치와 피드백 메커니즘을 마련해야 합니다.
프로젝트에 앞서 성공을 정의하는 것이 왜 중요한가요?
비즈니스 문제를 정의하는 것과 성공을 정의하는 것이同等하게 중요합니다. 두 가지가 함께 작동합니다. 책에 있는 자동차 딜러가 이미지에 레이블을 붙이는 예를 들어, 그들은 성공이 무엇인지 정의하지 않았기 때문에 비즈니스 문제를 해결하지 못했습니다. 성공은 여러 가지 일 수 있었을 것입니다. 그것은 팀이 문제를 해결하기 위해 노력하는 것뿐만 아니라, 기계 학습 모델이 固定된 범위 내에서 작동하는 것입니다. 만약 그들이 사용된 차량의 덴트를 레이블링하여 수리해야 할 차량 목록을 만들기 위해 80%의 정확도로 레이블링에 성공했다면, 팀은 그것을 성공이라고 불렀을 것입니다. 그러나 성공이 비즈니스 문제와 직접적인 비즈니스 영향에 연결되지 않는다면, 프로젝트를 평가하기가 어렵습니다. 여기서 비즈니스 문제는 더 복잡했으며, 덴트 레이블링은 그 문제의 일부였습니다. 그들은 덴트 레이블링의 영향을 실제 비즈니스 결과로 번역하여 성공을 정의하는 것이 더 좋았을 것입니다.
모델을 훈련시키는 데 사용되는 데이터 예제가 프로덕션 배포에서 발생할 모든 사용 사례를 커버하는 것이 얼마나 중요한가요?
모델을 훈련시키는 데 사용되는 데이터가 모든 사용 사례를 커버하는 것은 매우 중요합니다. 그러나 모든 사용 사례를 완전히 커버하는 것은 불가능합니다. 팀은 프로덕션 데이터와 훈련 데이터를 이해해야 하며, 모델이 프로덕션에서遭遇할 데이터를 훈련시켜야 합니다. 다양한 사용 사례를 가진 대규모 데이터셋에서 훈련 데이터를 수집하는 것이 모델의 성공에 결정적입니다. 예를 들어, 사용자가 업로드한 이미지에서 사람의 반려동물을 인식하는 모델을 훈련시키는 경우, 모델은 모든 종류의 반려동물(개, 고양이, 새, 작은 포유류, 파충류 등)을 훈련시켜야 합니다. 만약 모델이 개, 고양이, 새만 훈련시킨다면, 사용자가 기니피그의 이미지를 업로드하면 모델은 그것을 인식하지 못할 것입니다. 이것은 단순한 예지만, 모델을 성공시키기 위해 가능한 많은 사용 사례를 훈련시키는 것이 중요함을 보여줍니다.
책에서 논의된 바와 같이, 좋은 데이터 위생 습관을养成하는 것이 필요합니다. 이러한 습관을养成하기 위한 첫 번째 단계는 무엇인가요?
데이터 위생 습관을養成하면 내부 데이터의 사용성을 높이고 ML 사용 사례에 준비할 수 있습니다. 전체 회사에서 데이터셋을 조직하고 추적하는 것이 중요합니다. 이를 달성하는 한 가지 방법은 그것을 비즈니스 요구 사항으로 만들고, 구현을 추적하여 대부분의 보고서가 사용자 정의 작업이 아닌 데이터 파이프라인을 중앙 저장소로 направ하는 것입니다. 또 다른 좋은 방법은 데이터가 수집되고 데이터베이스에 저장되기 전에 어떤 일이 발생했는지 기록하는 것입니다. 또한, 사용되지 않는 또는陈旧한 데이터를 정기적으로 정리하는 프로세스를 설정하는 것입니다.
이번 인터뷰에 감사드립니다. 더 많은 것을 배우고 싶은 독자들에게, 이 책 실제 세계의 AI: 책임 있는 기계 학습을 위한 실용적인 안내서를 읽기를 권합니다.












