AI 모델 및 플랫폼

우버의 Fiber는 새로운 분산형 AI 모델 훈련 프레임워크입니다

mm
Unite.AI를 Google의 선호 소스에 추가

VentureBeat에 따르면, 우버의 AI 연구자들은 최근 Arxiv에 논문을 게시하여 분산형 AI 모델을 생성하는 데 도움이 되는 새로운 플랫폼을紹介했습니다. 이 플랫폼은 Fiber라고 불리며, 강화 학습 및 인구 기반 학습을 위한 작업을 구동하는 데 사용할 수 있습니다. Fiber는 대규모 병렬 계산을 비전문가에게 더 쉽게 접근할 수 있도록 설계되어 분산형 AI 알고리즘 및 모델의力を 활용할 수 있습니다.

Fiber는 최근 GitHub에서 오픈소스로 공개되었으며, Python 3.6 이상에서 호환되며 Linux 시스템에서 Kubernetes를 실행하고 클라우드 환경에서 실행할 수 있습니다. 연구자 팀에 따르면, 이 플랫폼은 수백 또는 수천 대의 개별 기계로 쉽게 확장할 수 있습니다.

우버의 연구자 팀은 최근의 대부분의 인공 지능의 발전이 더 큰 모델과 분산 훈련 기술을 사용하여 훈련된 알고리즘에 의해 주도되었다고 설명합니다. 그러나 인구 기반 모델 및 강화 모델을 생성하는 것은 분산 훈련 방식에서 여전히 어려운 작업입니다. 효율성 및 유연성 문제가 빈번하게 발생하기 때문입니다. Fiber는 클러스터 관리 소프트웨어와 동적 확장을 결합하여 사용자가 작업을 한 대의 기계에서 다수의 기계로 무중단으로 이동할 수 있도록 하여 분산 시스템을 더 신뢰할 수 있고 유연하게 만듭니다.

Fiber는 세 가지 구성 요소로 구성됩니다: API, 백엔드, 클러스터 레이어. API 레이어는 사용자가 큐, 관리자 및 프로세스를 생성할 수 있도록 합니다. Fiber의 백엔드 레이어는 사용자가 다양한 클러스터에서 관리되는 작업을 생성 및 종료할 수 있도록 합니다. 클러스터 레이어는 개별 클러스터와 그 리소스를 관리하여 Fiber가 추적해야 하는 항목의 수를 크게 줄입니다.

Fiber는 작업을 로컬 기계 하나 또는 여러 기계에서 원격으로 큐에 넣고 실행할 수 있도록 합니다. 작업 지원 프로세스의 개념을 사용합니다. Fiber는 또한 입력 데이터 및 종속 패키지가 자체 포함되도록 컨테이너를 사용합니다. Fiber 프레임워크에는 작업자 故障시 빠르게 복구할 수 있는 내장 오류 처리도 포함되어 있습니다. Fiber는 클러스터 관리자와 상호 작용하면서 Fiber 앱을 지정된 컴퓨터 클러스터에서 실행되는 일반 앱처럼 실행할 수 있습니다.

실험 결과에 따르면, Fiber의 응답 시간은 평균 몇 밀리초였으며, 2,048개의 프로세서 코어/작업자로 구축된 경우 기준선 AI 기술보다 더 잘 확장되었습니다. 작업자 수를 증가시키면 작업 완료 시간이 점차 줄었습니다. IPyParallel은 512개의 작업자에서 약 50초 만에 50번의 훈련 반복을 완료했습니다.

Fiber 논문의 공동 저자는 Fiber가 다음과 같은 여러 목표를 달성할 수 있다고 설명합니다:

“[우리의 연구는] Fiber가 많은 목표를 달성한다는 것을 보여줍니다. 즉, 이질적인 컴퓨팅 하드웨어를 효율적으로 활용하여, 알고리즘을 동적으로 확장하여 리소스 사용 효율성을 개선하며, [강화 학습] 및 인구 기반 알고리즘이 컴퓨터 클러스터에서 작동하도록 하는 데 필요한 엔지니어링 부담을 줄이고, 다양한 컴퓨팅 환경에 빠르게 적응하여 연구 효율성을 개선합니다. 우리는 이로 인해 [강화 학습] 문제를 [강화 학습] 알고리즘 및 인구 기반 방법으로 해결하는 데 진전이 이루어질 것으로 기대합니다. 이러한 방법을 개발하고 필요한 규모로 훈련하여 그들이真正로 빛나는 것을 보는 데 더 쉽게 만들 것이기 때문입니다.”

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.