AI 모델 및 플랫폼

내구성 > 정확도: 모델을 운영화하는 데 있어 ‘모델 내구성’이 真의 지표가 되어야 하는 이유

mm
Unite.AI를 Google의 선호 소스에 추가

Ingo Mierswa에 의해, RapidMiner의 설립자, 사장 및 최고 데이터 과학자.

데이터 과학은 최근 몇 년 동안 많은 발전을 이루었으며, 많은 조직에서 고급 분석 또는 기계 학습 모델을 사용하여 프로세스와 미래의 가능한 결과에 대한 더 깊은 통찰력을 얻고 있습니다. 다른 “과학”의 경우, 프로젝트가 성공할지 여부가 항상 명확하지 않으며, 데이터 과학 프로젝트의 87%가 생산에 들어가지 않는다는 보고가 있습니다. 100%의 성공률은 기대할 수 없지만, 데이터 과학 프로젝트에서 높은 성공률을 보이는 패턴이 존재하며, 이러한 패턴은 특정 산업이나 사용 사례와 무관하게 존재하는 것으로 보입니다. 이는 데이터 과학에 대한 보편적인 문제가 존재한다는 것을 시사합니다.

기계 학습의 성공을 측정하는 방법

기계 학습 모델을 생성하는 데이터 과학자들은 모델의 성능을 측정하기 위해 잘 정의된 수학적 기준을 사용합니다. 이러한 기준은 모델의 유형에 따라 달라집니다. 예를 들어, 모델이 새로운 상황에 대한 클래스 또는 범주를 예측해야 하는 경우, 데이터 과학자들은 정확도(모델이 얼마나 souvent 正确한지) 또는 정밀도(고객이 실제로 이탈할 경우 예측한 이탈률)와 같은 측정값을 사용할 것입니다.

데이터 과학자들은 이러한 객관적인 기준이 필요합니다. 왜냐하면 그들의 일은 이러한 평가 기준을 최적화하여 최상의 모델을 생성하는 것이기 때문입니다. 실제로, 데이터 준비를 위해 모델을 구축하고 조정하는 것 외에, 데이터 과학자들은 대부분의 시간을 모델을 구축하고 조정하는 데 소비합니다.

그러나 이러한 접근 방식의 단점은 데이터 과학자들이 모델을 생산에 넣는 데 거의 집중하지 않는다는 것입니다. 이는 여러 가지 이유로 문제입니다. 첫째, 결과가 성공적이지 않은 모델은 조직에 비즈니스 영향을 미칠 수 없습니다. 둘째, 이러한 조직은 결과가 성공적이지 않은 모델을 개발하고, 교육하고, 운영화하는 데 시간과 돈을 투자했기 때문에, 데이터 과학 도구를 무용지물로 간주하고 미래의 데이터 과학 이니셔티브를 진행하지 않을 가능성이 있습니다.

사실, 데이터 과학자들은 모델을 조정하는 것을 즐기고, 많은 시간을 이에 투자합니다. 그러나 비즈니스에 영향을 미치지 않는 경우, 이러한 시간은 잘 소요되지 않습니다. 특히, 데이터 과학자가 현재의 세계에서 희소한 자원인 만큼, 이러한 시간은 아깝습니다.

넷플릭스 상과 생산 실패

최근 몇 년 동안, 우리는 모델 구축에過度 투자하고, 모델을 운영화하는 데 투자하지 않는 현상을 목격했습니다. 넷플릭스 상은 사용자 평가를 예측하기 위한 최好的 협업 필터링 알고리즘을 찾기 위한 공개การแข่งข션입니다. 새로운 영화에 높은 평가를 주면, 해당 영화를 즐겼을 가능성이 높습니다. 넷플릭스는 이러한 평가 시스템을 사용하여 특정 제목을 추천하며, 이러한 추천 콘텐츠를 즐긴다면, 넷플릭스의 고객으로서 더 오래 머무를 가능성이 있습니다. 대상을 수상한 팀은 넷플릭스의 알고리즘보다 적어도 10% 더 좋은 성능을 보여야 했습니다.

이 챌린지는 2006년에 시작되었으며, 이후 3년 동안, 전 세계 40,000개 이상의 데이터 과학 팀의 기여로, 제목 추천 성공률이 10% 이상 개선되었습니다. 그러나, 우승 팀의 모델은 कभ也不 운영화되지 않았습니다. 넷플릭스는 “정확도 향상이 모델을 운영화하는 데 필요한 노력을 정당화하지 못한다”고 했습니다.

최적이 항상 최적은 아니다

모델의 정확도와 다른 데이터 과학 기준은 모델을 운영화하기 전에 모델의 성공을 측정하는 지표로 사용되어 왔습니다. 그러나, 많은 모델이 운영화 단계에 도달하지 못합니다. 이는 자원과 시간의 낭비입니다.

그러나 모델 조정에過度 투자하는 문화에는 더 많은 문제가 있습니다. 첫째, 테스트 데이터에 대한 모델의 과적합이 발생할 수 있습니다. 이는 모델이 테스트 데이터에 잘 작동하지만, 실제로 사용될 때는 그렇지 않습니다. 이는 두 가지 이유로 발생합니다.

  1. 테스트 오류와 실제 오류 간에 잘 알려진 불일치가 존재합니다
  2. 비즈니스 영향과 데이터 과학 성능 기준은 종종 상관관계가 있지만, “최적” 모델이 항상 가장 큰 영향을 미치지 않는다는 것입니다

첫 번째 점은 테스트 세트에 대한 과적합으로 알려져 있습니다. 이는 데이터 과학 대회에서 특히 두드러집니다. 이러한 대회에서, 참가자는 테스트 데이터에 대한 모델의 성능을 최적화하려고 하지만, 실제로 사용될 때는 그렇지 않을 수 있습니다.

정확도가 비즈니스 영향과 동일하지는 않다

우리는 너무 오랫동안 이러한 관행을 받아들여 왔습니다. 이는 테스트 데이터 세트에 대한 모델의 적응이 느려지는 결과를 초래합니다. 따라서, 가장好的 모델은 실제로 중간 정도의 성능을 보입니다.

  • 예측 정확도와 같은 측정값은 비즈니스 영향과 동일하지 않습니다
  • 1%의 정확도 향상은 1%의 비즈니스 결과 향상으로 번역되지 않습니다
  • 비즈니스 영향에서 낮은 성능을 보이는 모델이 다른 모델보다 더好的 경우가 있습니다
  • 유지 보수, 점수 속도 또는 시간 경과에 대한 변경에 대한 강도(내구성)와 같은 다른 요인들이 고려되어야 합니다.

이 마지막 점은 특히 중요합니다. 가장好的 모델은 대회에서 우승하거나 데이터 과학 연구소에서 잘 작동하는 모델이 아닙니다. 실제로, 이러한 모델은 운영화에서 잘 작동하고, 다양한 테스트 세트에서 잘 작동합니다. 이러한 모델을 우리는 내구성 모델이라고 합니다.

드리프트와 내구성의 중요성

모든 모델은 시간이 지남에 따라恶化됩니다. 단, 이러한恶化의 속도와 모델이 변경된 상황에서 여전히 잘 작동하는지 여부가 문제입니다. 이러한恶化의 이유는 세계가 정적이지 않기 때문입니다. 따라서, 모델에 적용되는 데이터도 시간이 지남에 따라 변경됩니다. 이러한 변경이 천천히 발생하면, 우리는 이를 개념 드리프트라고 합니다. 이러한 변경이 갑자기 발생하면, 우리는 이를 개념 시프트라고 합니다. 예를 들어, 고객은 시간이 지남에 따라 소비 패턴을 변경할 수 있습니다. 이러한 변경은 마케팅이나 트렌드의 영향을 받을 수 있습니다. 이러한 변경으로 인해, 모델은 더 이상 작동하지 않을 수 있습니다.

내구성 모델은 정확도 또는 정밀도와 같은 측정값에서 최好的 모델은 아닐 수 있습니다. 그러나, 이러한 모델은 더 많은 데이터 세트에서 잘 작동하고, 더 긴 기간 동안 잘 작동합니다. 따라서, 이러한 모델은 더 많은 비즈니스 영향을 미칠 수 있습니다.

선형 및 기타 단순한 모델은 종종 더 내구성이 있습니다. 왜냐하면, 이러한 모델은 특정 테스트 세트 또는 시간에 대한 과적합이 더 어려우니까입니다. 더 강력한 모델은 이러한 단순한 모델의 도전자가 될 수 있습니다. 그러나, 이러한 모델은 내구성 모델을 생성하기 위한 최종 목표가 아니라, 시작점이어야 합니다.

현재, 데이터 과학 분야에는 공식적인 내구성 지표가不存在하지 않습니다. 그러나, 데이터 과학자들은 모델의 내구성을 평가하는 여러 방법이 있습니다.

  • 교차 검증에서 작은 표준 편차는 모델의 성능이 테스트 세트의 특정값에 덜 의존함을 의미합니다
  • 데이터 과학자들이 전체 교차 검증을 수행하지 않는 경우, 두 개의 다른 데이터 세트를 사용하여 테스트와 검증을 수행할 수 있습니다. 테스트와 검증 데이터 세트 간의 오류율의 불일치는 내구성이 낮음을 의미합니다
  • 모델이 운영화에서 적절하게 모니터링되는 경우, 오류율은 시간이 지남에 따라 관찰할 수 있습니다. 오류율의 일관성은 모델의 내구성을 나타냅니다
  • 모델 모니터링 솔루션이 드리프트를 고려하는 경우, 데이터 과학자들은 모델이 이러한 입력 드리프트에 의해 어떻게 영향을 받는지에 주의해야 합니다

데이터 과학의 문화를 변경하는 것

모델이 운영화 단계에 도달한 후에도, 모델의 정확도에 대한 위협이 존재합니다. 위에서 언급한 모델 내구성의 마지막 두 가지 점은 모델을 운영화에서 적절하게 모니터링하는 것을 필요로 합니다. 데이터 과학 분야의 문화를 변경하는 시작점으로, 회사들은 모델을 운영화에서 적절하게 모니터링하는 데 투자하고, 데이터 과학자들이 모델이 운영화에서 잘 작동하지 않는 경우 책임을 지도록 해야 합니다. 이는 모델을 구축하는 문화에서 비즈니스 값을 생성하고 유지하는 문화로의 변화를 의미합니다.

최근의 세계적인 사건들은, 세계는 빠르게 변경된다는 것을 보여주었습니다. 이제, 더 이상 정확도만을追求하는 것이 아니라, 내구성이 있는 모델을 구축해야 합니다. 카글은 데이터 과학자들을 세계적인 코로나19와의 싸움에서 모델 솔루션을 구축하도록鼓励하는 챌린지를 진행하고 있습니다. 나는, 이 챌린지에서 생성되는 가장 성공적인 모델은 가장 정확한 모델이 아니라, 가장 내구성이 있는 모델일 것이라고 예상합니다. 왜냐하면, 코로나19 데이터는 하루에도 변경될 수 있기 때문입니다.

데이터 과학은 真実을 찾는 것에 관한 것입니다. “최好的” 모델을 생성하는 것이 아닙니다. 우리는 내구성을 정확도보다 더 높은 표준으로 삼아야 합니다. 이를 통해, 데이터 과학자들은 조직에 더 많은 비즈니스 영향을 미칠 수 있고, 미래를 긍정적으로 형성할 수 있습니다.

Ingo Mierswa는 독일의 TU Dortmund University에서 RapidMiner를 개발하기 시작하면서 산업 베테랑 데이터 과학자입니다. Mierswa, 과학자로서, 예측 분석 및 빅데이터에 관한 수많은 수상 작품을 출판했습니다. Mierswa, 기업가로서, RapidMiner의 창립자입니다. 그는 전략적 혁신을 담당하며 RapidMiner의 기술에 관한 모든 큰 그림 질문에 대해 다룹니다. 그의 리더십 아래 RapidMiner는 첫 7년 동안 300%의 성장률을 기록했습니다. 2012년, 그는 미국, 영국, 헝가리에서 사무소를 열면서 국제화 전략을 주도했습니다. 두 번의 자금 조달, Radoop의 인수, 및 Gartner 및 Forrester와 같은 주요 분석 회사와의 RapidMiner의 위치 지원之后, Ingo는 세계 최고의 팀을 RapidMiner에 데려오는데 많은 자부심을 느낍니다.