AI 모델 및 플랫폼

LightAutoML: 금융 서비스를 위한 AutoML 프레임워크

mm
Unite.AI를 Google의 선호 소스에 추가

AutoML이 몇 년 전부터 인기를 얻기 시작했지만, AutoML의 초기 연구는 90년대 초반에 시작되어 과학자들이 최초의 논문을 발표한 때로부터 시작되었다. 2014년 ICML에서 최초의 AutoML 워크샵을 조직하면서 AutoML은 ML 개발자의 주목을 받게 되었다. AutoML의 주요 초점 중 하나는 하이퍼파라미터 검색 문제이다. 여기서 모델은 특정 기계 학습 모델에 대한 최적의 하이퍼파라미터를 결정하기 위해 최적화 방법의 배열을 구현한다. AutoML 모델에서 흔히 사용되는 또 다른 방법은 특정 하이퍼파라미터가 주어진 기계 학습 모델에 대한 최적의 하이퍼파라미터인 확률을 추정하는 것이다. 모델은 이를 위해 전통적으로 이전에 추정된 모델의 역사적 데이터와 다른 데이터 세트를 사용하는 베이즈 방법을 구현한다. 하이퍼파라미터 최적화 외에도 다른 방법은 모델링 대안의 공간에서 최상의 모델을 선택하려고 시도한다.

이 글에서는 금융 부문에서 운영되는 유럽 회사와 그 생태계를 위해 개발된 AutoML 시스템인 LightAutoML에 대해 다룰 것이다. LightAutoML 프레임워크는 다양한 애플리케이션에 배포되어 데이터 과학자 수준의 성능을 보여주었으며, 높은 품질의 기계 학습 모델을 구축하는 데에도 성공하였다. LightAutoML 프레임워크는 다음과 같은 기여를 시도한다. 첫째, LightAutoML 프레임워크는 주로 대규모 유럽 금융 및 은행 기관의 생태계를 위해 개발되었다. 프레임워크와 아키텍처로 인해 LightAutoML 프레임워크는 여러 개방형 벤치마크와 생태계 애플리케이션에서 최첨단 AutoML 프레임워크를 능가하는 성능을 보여주었다. LightAutoML 프레임워크의 성능은 또한 데이터 과학자에 의해 수동으로 조정된 모델과 비교되었으며, 결과는 LightAutoML 프레임워크의 성능이 더 뛰어난 것을 나타냈다.

이 글은 LightAutoML 프레임워크를 깊이 있게 다루고, 메커니즘, 방법론, 아키텍처 및 최첨단 프레임워크와의 비교를 탐구한다. 따라서 시작해 보자.

LightAutoML: 금융 서비스를 위한 AutoML 프레임워크

연구자들이 90년대 중반부터 AutoML에 대해 처음 연구를 시작했지만, AutoML은 최근 몇 년 동안 주목을 받게 되었다. 일부 저명한 산업 솔루션은 Amazon의 AutoGluon, DarwinAI, H20.ai, IBM Watson AI, Microsoft (MSFT ) AzureML 등을 포함하여 자동으로 기계 학습 모델을 구축한다. 이러한 프레임워크 대부분은 다양한 애플리케이션에 걸쳐 자동으로 기계 학습 모델을 개발하는 일반적인 목적의 AutoML 솔루션을 구현한다. 이러한 수평적 접근 방식의 핵심 가정은 자동 모델 개발 프로세스가 모든 애플리케이션에서 동일하다는 것이다. 그러나 LightAutoML 프레임워크는 개인 애플리케이션의 요구 사항을 충족하는 비일반적인 AutoML 솔루션을 개발하기 위해 수직적 접근 방식을 구현한다. LightAutoML 프레임워크는 복잡한 생태계와 그 특성을 중시하는 수직적 AutoML 솔루션이다. 첫째, LightAutoML 프레임워크는 빠르고 거의 최적의 하이퍼파라미터 검색을 제공한다. 모델은 이러한 하이퍼파라미터를 직접 최적화하지 않지만, 만족스러운 결과를 제공한다. 또한 모델은 작은 문제에서는 최적이고, 큰 문제에서는 충분히 빠른지 확인하기 위해 하이퍼파라미터 최적화와 속도 사이의 균형을 유지한다. 둘째, LightAutoML 프레임워크는 기계 학습 모델의 범위를故意적으로 선형 모델과 GBM(Gradient Boosted Decision Tree) 또는 그라데이션 부스팅 결정 트리만으로 제한한다. 기계 학습 모델의 범위를 제한하는 주요 이유는 LightAutoML 프레임워크의 실행 시간을 빠르게 하면서도 성능을 부정적으로 영향을 주지 않기 위해서이다. 셋째, LightAutoML 프레임워크는 특정 선택 규칙과 메타 통계를 기반으로 모델에서 사용되는 다양한 특성에 대한 전처리 方案을 고유한 방법으로 선택한다. LightAutoML 프레임워크는 다양한 애플리케이션에 걸쳐 광범위한 공개 데이터 소스에서 평가된다.

LightAutoML: 방법론과 아키텍처

LightAutoML 프레임워크는 Preset이라고 하는 모듈로 구성되며, 이는 일반적인 기계 학습 작업을 위한 종단 간 모델 개발에专用된다. 현재 LightAutoML 프레임워크는 Preset 모듈을 지원한다. 첫째, TabularAutoML Preset은 표 형식 데이터셋에서 정의된 고전적인 기계 학습 문제를 해결하는 데 중점을 둔다. 둘째, White-Box Preset은 이진 분류 작업을 위해 Logistic Regression과 같은 간단한 해석 가능한 알고리즘을 구현한다. 셋째, NLP Preset은 표 형식 데이터와 자연어 처리 도구를 결합할 수 있다. 마지막으로, CV Preset은 기본 도구를 사용하여 이미지 데이터와 작동한다. LightAutoML 모델은 모든 네 가지 Preset을 지원하지만, 프로덕션 수준의 시스템에서는 TabularAutoML만 사용한다.

LightAutoML 프레임워크의 일반적인 파이프라인은 다음 이미지에 포함되어 있다.

각 파이프라인에는 세 가지 구성 요소가 있다. 첫째, Reader는 작업 유형과 원시 데이터를 입력으로 받는 객체로서, 중요한 메타데이터 계산을 수행하고, 초기 데이터를 정리하며, 모델을適合하기 전에 수행할 데이터 조작을 결정한다. 둘째, LightAutoML 내부 데이터셋에는 CV 반복자와 메타데이터가 포함되어 있으며, 이는 데이터셋에 대한 검증 方案을 구현한다. 셋째, 여러 기계 학습 파이프라인이 하나의 예측을 얻기 위해 쌓여지거나 혼합된다. LightAutoML 프레임워크의 아키텍처 내에서 기계 학습 파이프라인은 공통의 데이터 검증 및 전처리 方案을 공유하는 여러 기계 학습 모델 중 하나이다. 전처리 단계에는 최대 두 개의 특성 선택 단계, 특성 엔지니어링 단계 또는 전처리가 필요하지 않은 경우 빈 단계가 포함될 수 있다. 기계 학습 파이프라인은 동일한 데이터셋에서 독립적으로 계산된 후 평균 또는 가중 평균을 사용하여 혼합된다. 또는 스택킹 앙상블 方案을 사용하여 다단계 앙상블 아키텍처를 구축할 수 있다.

LightAutoML Tabular Preset

LightAutoML 프레임워크 내에서 TabularAutoML은 기본 파이프라인이며, 이를 통해 표 형식 데이터에서 세 가지 유형의 작업을 수행할 수 있다: 이진 분류, 회귀, 및 다중 클래스 분류를 위한 광범위한 성능 지표와 손실 함수. TabularAutoML 구성 요소에 입력으로 제공되는 테이블에는 다음과 같은 네 개의 열이 있다: 범주형 특성, 수치형 특성, 타임스탬프, 및 클래스 레이블 또는 연속적인 값이 포함된 단일 대상 열이다. LightAutoML 프레임워크의 설계 목표 중 하나는 빠른 가설 테스트를 위한 도구를 설계하는 것이었다. 따라서 프레임워크는 파이프라인 최적화를 위한 무차별적 방법을 사용하지 않고, 광범위한 데이터셋에서 작동하는 효율성 기술과 모델에만 중점을 둔다.

Auto-Typing과 데이터 전처리

다양한 특성 유형을 다르게 처리하기 위해, 모델은 각 특성 유형을 알아야 한다. 작업이 하나이고 데이터셋이 작을 때, 사용자는 각 특성 유형을 수동으로 지정할 수 있다. 그러나 작업이 수백 개이고 데이터셋이 수천 개의 특성을 포함하는 경우, 각 특성 유형을 수동으로 지정하는 것은 더 이상 실용적이지 않다. TabularAutoML Preset의 경우, LightAutoML 프레임워크는 특성을 세 가지 클래스로 매핑해야 한다: 수치, 범주, 및 날짜/시간이다. 하나의 간단하고 명백한 해결책은 열 배열 데이터 유형을 실제 특성 유형으로 사용하는 것이다. 즉, float/int 열을 수치 특성으로, 타임스탬프 또는 타임스탬프로 파싱할 수 있는 문자열을 날짜/시간으로, 그리고 나머지를 범주로 매핑하는 것이다. 그러나 이러한 매핑은 범주 열에 숫자 데이터 유형이 자주 발생하기 때문에 최선의 해결책은 아니다.

검증 方案

검증 方案은 AutoML 프레임워크의 중요한 구성 요소이다. 왜냐하면 산업에서 데이터는 시간의 경과에 따라 변경되기 때문이며, 이는 모델 개발 시 IID(Independent and Identically Distributed) 가정의 무효성을 의미한다. AutoML 모델은 검증 方案을 사용하여 성능을 추정하고, 하이퍼파라미터를 검색하며, 폴드 아웃 예측을 생성한다. TabularAutoML 파이프라인은 다음 세 가지 검증 方案을 구현한다:

  • KFold 교차 검증: KFold 교차 검증은 TabularAutoML 파이프라인의 기본 검증 方案이다. 이는 분류 작업을 위한 Stratified KFold와 행동 모델을 위한 GroupKFold를 포함한다.
  • 홀드아웃 검증: 홀드아웃 검증 方案은 홀드아웃 세트가 지정된 경우에 구현된다.
  • 사용자 정의 검증 方案: 사용자는 자신의 요구 사항에 따라 사용자 정의 검증 方案을 생성할 수 있다. 사용자 정의 검증 方案에는 교차 검증과 시계열 분할 方案이 포함된다.

특성 선택

특성 선택은 산업 표준에 따라 모델을 개발하는 중요한 측면이다. 이는 추론 및 모델 구현 비용을 줄이는 데 도움이 되기 때문이다. 그러나 대부분의 AutoML 솔루션은 이 문제에 대해 많이 집중하지 않는다. 반면에, TabularAutoML 파이프라인은 다음 세 가지 특성 선택 전략을 구현한다: 선택 없음, 중요도 절단 선택, 및 중요도 기반 전방 선택이다. 이 중 중요도 절단 선택은 기본 전략이다. 또한, 특성 중요도를 추정하는 두 가지 주요 방법이 있다: 분할 기반 트리 중요도 및 GBM 모델 또는 그라데이션 부스팅 결정 트리의 순열 중요도이다. 중요도 절단 선택의 주요 목표는 모델에 도움이 되지 않는 특성을 거부하여 특성의 수를 줄이는 것이다. 이는 모델 추론 및 훈련을 가속화할 수 있는 접근 방식이다.

위의 이미지에서는 이진 은행 데이터셋에서 다양한 선택 전략을 비교한다.

하이퍼파라미터 튜닝

TabularAutoML 파이프라인은 튜닝되는 항목에 따라 다양한 하이퍼파라미터 튜닝 접근 방식을 구현한다.

  • 초기 종료 하이퍼파라미터 튜닝: 이는 훈련 단계에서 모든 모델에 대한 반복 횟수를 선택한다.
  • 전문가 시스템 하이퍼파라미터 튜닝: 이는 모델에 대한 하이퍼파라미터를 만족스러운 방식으로 설정하는 간단한 방법이다. 이는 최종 모델이 하드 튜닝된 모델과 비교하여 점수가 크게 감소하지 않도록 방지한다.
  • 트리 구조 파젠 추정 또는 TPE: 이는 GBM 또는 그라데이션 부스팅 결정 트리 모델에 대한 混合 튜닝 전략이다. 이는 LightAutoML 파이프라인의 기본 선택이다. 각 GMB 프레임워크에 대해, LightAutoML 프레임워크는 두 개의 모델을 훈련한다: 첫 번째 모델은 전문가 하이퍼파라미터를 받고, 두 번째 모델은 시간 예산에 맞게 미세 조정된다.
  • 그리드 검색 하이퍼파라미터 튜닝: 이는 TabularAutoML 파이프라인에서 선형 모델의 규제 파라미터를 미세 조정하고, 초기 종료 및 워밍업을 구현하기 위해 사용된다.

모델은 모든 파라미터를 사용자에 의해 정의된 메트릭 함수 또는 작업에 대한 기본 메트릭 함수를 최대화하여 튜닝한다.

LightAutoML: 실험 및 성능

성능을 평가하기 위해, LightAutoML 프레임워크 내의 TabularAutoML Preset은 다양한 작업에서 기존 오픈 소스 솔루션과 비교되어, LightAutoML 프레임워크의 우수한 성능을 입증한다. 첫째, 비교는 35개의 이진 및 다중 클래스 분류 작업 데이터셋으로 평가되는 OpenML 벤치마크에서 수행된다. 다음 표는 LightAutoML 프레임워크와 기존 AutoML 시스템의 비교를 요약한다.

그림에서 볼 수 있듯이, LightAutoML 프레임워크는 벤치마크 내의 20개 데이터셋에서 모든 다른 AutoML 시스템을 능가한다. 다음 표는 데이터셋의 contexto에서 비교를 자세히 보여주며, LightAutoML이 다양한 작업 类別에서 다른 성능을 제공한다는 것을 나타낸다. 이진 분류 작업의 경우, LightAutoML은 성능에서 뒤처진다. 그러나 데이터가 많은 작업의 경우, LightAutoML 프레임워크는 우수한 성능을 제공한다.

다음 표는 LightAutoML 프레임워크와 15개의 은행 데이터셋을 포함하는 다양한 이진 분류 작업에서 AutoML 시스템의 비교를 보여준다. 관찰 결과, LightAutoML은 15개 중 12개 데이터셋에서 모든 AutoML 솔루션을 능가하며, 이는 80%의 승률을 의미한다.

최종 생각

이 글에서, 우리는 금융 부문에서 운영되는 유럽 회사와 그 생태계를 위해 개발된 AutoML 시스템인 LightAutoML에 대해 다루었다. LightAutoML 프레임워크는 다양한 애플리케이션에 배포되어 데이터 과학자 수준의 성능을 보여주었으며, 높은 품질의 기계 학습 모델을 구축하는 데에도 성공하였다. LightAutoML 프레임워크는 다음과 같은 기여를 시도한다. 첫째, LightAutoML 프레임워크는 주로 대규모 유럽 금융 및 은행 기관의 생태계를 위해 개발되었다. 프레임워크와 아키텍처로 인해 LightAutoML 프레임워크는 여러 개방형 벤치마크와 생태계 애플리케이션에서 최첨단 AutoML 프레임워크를 능가하는 성능을 보여주었다. LightAutoML 프레임워크의 성능은 또한 데이터 과학자에 의해 수동으로 조정된 모델과 비교되었으며, 결과는 LightAutoML 프레임워크의 성능이 더 뛰어난 것을 나타냈다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.