AI 모델 및 플랫폼

KumoRFM-2 출시, 전통적인 기업 기계 학습을 대체하는 기초 모델

mm
Unite.AI를 Google의 선호 소스에 추가

KumoKumoRFM-2를 공개했습니다. 이는 구조화된 기업 데이터에 특화된 차세대 기초 모델로, 데이터 웨어하우스에서 예측을 생성하는 방식에 기본적인 변화를 가져옵니다. 전통적인 기계 학습 파이프라인과 달리 몇 개월 동안의 특징 엔지니어링과 사용자 지정 모델 개발이 필요하지 않습니다. KumoRFM-2를 사용하면 팀이 자연어를 사용하여 즉시 예측을 생성할 수 있으며, 훈련이나 전문 지식이 필요하지 않습니다.

이 모델의 핵심은 관계형 데이터 구조에서 직접 작동하는 새로운 범주의 AI입니다. 이는 기업 AI에서 가장 지속적인 한계 중 하나를 해결합니다. 여기서 데이터셋 간의 유용한 관계가 모델링을 시작하기 전에 종종 손실됩니다.

정적 파이프라인에서 실시간 예측 시스템으로

기업 예측 분석은 역사적으로 느리고 자원 집약적이었습니다. 각 새로운 사용 사례(고객 이탈 예측, 사기 탐지, 수요 예측 등)는 별도의 파이프라인을 필요로 하며, 데이터 정리, 특징 엔지니어링, 모델 훈련 및 조정이 포함됩니다.

KumoRFM-2는 전체 워크플ロー를 단일의 사전 훈련된 시스템으로 대체합니다.

사용자는 모델을 구축하는 대신 예측하고자 하는 것을 정의합니다. 모델은 요청을 해석하고, 기본 데이터베이스에서 필요한 컨텍스트를 구성하며, 단일 패스로 예측을 생성합니다. 이는 컨텍스트 학습과 예측 쿼리 언어(PQL)라는 선언적 인터페이스의 조합을 통해 가능합니다. 여기서 사용자는 결과에 대한 관심을 표현하며, 이를 계산하기 위한 단계를 지정할 필요가 없습니다.

결과는 “모델 구축”에서 “질문하기”로의 전환입니다. 이는 예측 AI를 사용하는 데 대한 장벽을 크게 낮추는 변화입니다.

관계형 데이터가 어려웠던 이유

대부분의 기존 AI 시스템은 구조화된 기업 데이터를 다루는 데 어려움을 겪습니다. 그 이유는 데이터를 잘못 처리하기 때문입니다.

전통적인 모델, 표형 AI 시스템, 및 대규모 언어 모델은 데이터를 단일 테이블로 평탄화하는 데 의존합니다. 그러나 실제 기업 데이터는 시간이 지남에 따라 진화하는 상호 연결된 시스템으로 존재합니다. 고객은 거래와 연결되고, 거래는 제품과 연결되고, 제품은 재고와 연결됩니다.

이 구조를 평탄화하면 가장 유용한 예측 신호를 포함하는 관계가 종종 제거됩니다. 또한 팀은 수동으로 이러한 신호를 특징 엔지니어링을 통해 재구성해야 하며, 이는 시간이 걸리고 오류가 발생하기 쉽습니다.

KumoRFM-2는 관계형 데이터베이스에서 직접 작동하여 테이블, 타임스탬프 및 엔티티 간의 연결을 유지함으로써 이를 완전히 피합니다.

아키텍처 내부: KumoRFM-2의 작동 방식

KumoRFM-2의 핵심 혁신은 데이터를 동시에 여러 수준에서 처리하는 계층적 관계 그래프 트랜스포머 아키텍처입니다.

첫 번째 수준에서 모델은 행 및 열 주의를 결합하여 개별 테이블을 분석합니다. 이를 통해 모델은 테이블 내에서 특징이 어떻게 관련되어 있는지 이해할 수 있으며, 불필요하거나 노이즈가 있는 데이터를 초기에 필터링할 수 있습니다. 중요한 것은 예측 대상이 이 단계에서 도입되므로 모델은 작업에서 처음부터 조건화됩니다.

두 번째 수준에서 모델은 테이블 간 그래프 기반推論을 수행합니다. 외래 키 관계를 사용하여 모델은 데이터베이스의 다른 부분에서 데이터를 연결합니다. 예를 들어 고객 프로필을 구매 기록 또는 행동 패턴과 연결하거나, 교차 테이블 신호를 식별하여 평탄화에 의해 손실될 수 있습니다.

세 번째 수준에서 모델은 샘플 간 주의를 통합하여 여러 예시에서同時 학습할 수 있습니다. 이를 통해 모델은 상대적으로 적은 수의 컨텍스트 예시에서 일반화할 수 있으며, 전체 훈련 데이터셋이 필요하지 않습니다.

이 단계적 설계는 중요합니다. 이는 데이터 포인트를 동시에 처리하는 데 따른 계산 폭발을 피하며, 더 깊은推論이 발생하기 전에 노이즈를 필터링하여 정확도를 향상시킵니다.

컨텍스트 학습이 훈련을 대체합니다

KumoRFM-2의 정의하는 특징 중 하나는 전통적인 훈련 대신 컨텍스트 학습을 사용하는 것입니다.

모델은 각 작업에 대해 훈련되지 않습니다. 대신, KumoRFM-2는 대규모 합성 및 실제 관계형 데이터 믹스에 사전 훈련됩니다. 사용자가 예측 요청을 제출하면 시스템은 자동으로 컨텍스트 예시 집합을 생성합니다. 이는 데이터베이스의 작은 서브그래프와 알려진 결과를 결합합니다.

이 예시는 모델이 패턴을 추론하고 가중치를 업데이트하지 않고 예측을 생성하도록 지침을 제공합니다. 실제로 이는 다음을 의미합니다:

  • 작업별 훈련이 필요하지 않습니다
  • 특징 엔지니어링이 필요하지 않습니다
  • 모델 조정이 필요하지 않습니다

감독 학습에 일반적으로 필요한 데이터의 0.2%만 있으면 모델은 최첨단 성능을 달성할 수 있습니다.

실제 벤치마크에서의 성능

KumoRFM-2는 전자상거래, 헬스케어, 소셜 플랫폼 및 기업 시스템을 포함한 41개의 예측 작업에 대해 평가되었습니다.

모델은 전통적인 감독 학습 접근 방식, 엔지니어드 앙상블 및 관계형 딥 러닝 시스템을 일관되게 능가합니다. 기업 벤치마크에서 모델은 널리 사용되는 솔루션을 상당한 격차로 능가하며, 미세 조정 시에도 성능이 향상됩니다.

원시 정확도 외에도 모델은 강력한 강건성을 демонстри합니다:

  • 관계 링크가大量으로 누락되어도 성능을 유지합니다
  • 노이즈 또는 불완전한 데이터에서 최소한의 성능 저하를 보입니다
  • 歴史 데이터가 제한된 콜드 스타트 시나리오에서 잘 작동합니다

이 강건성은 데이터 품질이 종종 일관되지 않은 기업 환경에서 특히 중요합니다.

500억 행까지 확장: 규모에 맞춤

KumoRFM-2는 현대적인 데이터 인프라의 규모에 따라 설계되었습니다.

시스템은 데이터베이스 네이티브 실행과 고처리량 데이터 액세스가 가능한 사용자 지정 그래프 엔진을 결합하여 500억 행을 초과하는 데이터셋을 처리할 수 있습니다. 별도의 ML 시스템으로 데이터를 이동하는 대신, 계산은 데이터가 존재하는 위치로 직접 푸시됩니다. SQL 데이터베이스 또는 클라우드 데이터 웨어하우스에 상관없이 말입니다.

이 접근 방식은 대기 시간을 줄이고, 배포를 단순화하며, 조직이 예측 기능을 기존 워크플로에 직접 통합할 수 있도록 합니다.

자연어를 인터페이스로

또 다른 정의하는 특징은 모델의 자연어 인터페이스입니다.

사용자는 다음과 같은 질문을 할 수 있습니다:

  • 30일 내에 이탈할 가능성이 있는 고객은 누구입니까?
  • 변환될 가능성이 가장 높은 리드는 무엇입니까?
  • 수요가 증가할 제품은 무엇입니까?

시스템은 이러한 쿼리를 구조화된 예측 논리 로 변환하고, 기본 데이터에서 실행하고, 예측과 설명을 반환합니다.

이는 예측 분석을 더 쉽게 만들뿐만 아니라 AI 에이전트와의 통합을 가능하게 하며, 예측은 자동화된 의사 결정 워크플로에 포함될 수 있습니다.

에이전트 주도형 기업 지능으로

KumoRFM-2는 에이전트를 염두에 두고 설계되었습니다.

예측 기능은 AI 에이전트가 더 큰 워크플로의 일부로 호출할 수 있는 모듈식 “스킬”로 노출될 수 있습니다. 이는 예측 모델링을 구성 가능한 빌딩 블록으로 만듭니다. 이는 검색,推論 및 실행과 함께 자율 시스템에서 결합될 수 있습니다.

이 컨텍스트에서 모델은 분석가의 도구가 아니라 차세대 기업 자동화의 기초 계층입니다.

데이터 과학의 역할 재정의

KumoRFM-2는 조직이 데이터 과학에 접근하는 방식에 대한 더广泛한 변화를 나타냅니다.

팀은 더 이상 작업별 모델을 구축하고 유지 관리할 필요가 없습니다. 대신, 단일의 일반적인 시스템을 사용하여 즉시 새로운 문제에 적응할 수 있습니다. 이는 특징 엔지니어링과 모델 조정에 대한 전문 지식의 필요성을 줄이며, 더 빠른 실험과 반복을 가능하게 합니다.

많은 조직에서는 이는 중앙 집중식 데이터 과학 기능에서 더 분산된 모델로의 전환을 의미할 수 있습니다. 여기서 예측 통찰력이 여러 부서에 걸쳐 접근할 수 있습니다.

새로운 기초 모델 범주

기초 모델은 이미 언어 및 비전과 같은 도메인에서 변화를 가져왔습니다. 그러나 구조화된 기업 데이터는 마지막 전선 중 하나로 남아있었습니다.

KumoRFM-2는 구조화된 데이터를 위한 전문 기초 모델이 무엇을 달성할 수 있는지의 초기 예입니다. 관계형推論, 컨텍스트 학습 및 자연어 상호작용을 결합하여 예측 AI에 대한 새로운 패러다임을 소개합니다.

이 접근 방식이 널리 채택된다면, 기업이 데이터와 상호작용하는 방식을 재정의할 수 있습니다. 예측 분석을 복잡하고 지연된 프로세스에서 실시간, 조직 전체의 기능으로 전환할 수 있습니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.