AI 모델 및 플랫폼

깊은 학습 신경망 내에서 매우 효율적인 하위 네트워크 발견

mm
Unite.AI를 Google의 선호 소스에 추가

깊은 학습 신경망은 종종巨大하고 엄청난 양의 컴퓨팅 파워를 필요로 하지만, 새로운 발견은 이러한 작업을 더 효율적으로 수행하는 방법을 보여준다. MIT의 Jonathan Frankle과 그의 팀은 “로또 티켓 가설”을 제시했는데, 이것은 더 큰 신경망 내에 더 가벼운 하위 네트워크가 존재함을 보여준다. 이러한 하위 네트워크는 작업을 더 효율적으로 수행할 수 있으며, 필요한 컴퓨팅 파워도 줄일 수 있다. 그러나 이러한 하위 네트워크를 찾는 것이 가장 큰 도전이다.

팀은 이러한 하위 네트워크를 BERT 내에서 발견했는데, BERT는 자연어 처리(NLP)에서 최고의 기계 학습 기술이다. NLP는 인공 지능(AI)의 하위 분야로, 인간 언어를 해석하고 분석하는 역할을 한다. 또한 예측 텍스트 생성과 채팅봇과 같은 응용 프로그램에서 사용된다.

그러나 BERT는巨大하고 슈퍼컴퓨팅 파워를 필요로 한다. 이는 대부분의 사용자에게 접근할 수 없는 것이다. 이러한 새로운 발견은 이러한 하위 네트워크를 통해 접근성을 높일 수 있을 것이다. 따라서 더 많은 사용자가 NLP 도구를 개발할 수 있을 것이다.

“우리는 이러한 모델을 더 가벼운 것으로 만들고 더 효율적으로 만들어야 할 때가 왔다”고 Frankle은 말한다.

그는 이 개발이 “진입 장벽을 낮출” 수 있을 것이라고 말한다.

BERT – “Obscenely Expensive”

BERT는 Google의 검색 엔진과 같은 것에 기본적으로 사용된다. 또한 2018년 Google이 발표한 이후 많은 주목을 받았다. BERT는 신경망을 생성하는 방법으로, 빈칸을 채우는 텍스트를 여러 번 시도함으로써 훈련된다. BERT의 가장 인상적인 기능은 초기 훈련 데이터셋의 크기이다.

사용자는 특정 작업을 위해 BERT를 조정할 수 있다. 예를 들어, 고객 서비스 채팅봇과 같은 작업이 있다. 그러나 다시 한번,巨大한 컴퓨팅 파워가 필요하다. 또한 매개변수가 10억에 달할 수 있다.

“표준 BERT 모델은 3.4억개의 매개변수를 가지고 있다”고 Frankle은 말한다. “이것은 너무 비싸다. 이것은 당신이나 나의 컴퓨팅 능력을 훨씬 넘는다”.

텍사스 오스틴 대학교의 Tianlong Chen은 “로또 티켓 가설이 이러한 문제를 해결하는 방법”이라고 말한다.

효율적인 하위 네트워크

Chen과 그의 팀은 BERT 내에서 더 작은 모델을 찾고, 발견된 하위 네트워크의 성능을 원래 BERT 모델과 비교했다. 이것은 다양한 NLP 작업에서 테스트되었다. 예를 들어, 질문에 답하는 작업과 빈칸을 채우는 작업이 있다.

팀은 원래 BERT 모델보다 40~90% 더 작지만, 동일한 성능을 보이는 하위 네트워크를 발견했다. 또한, 작업별 세부 조정을 통해 컴퓨팅 비용을さらに 줄일 수 있었다. 또 다른优势은 일부 하위 네트워크가 특정 작업을 위해 선택된 후 다른 작업에서도 재사용될 수 있다는 것이다.

“나는 이것이 실제로 작동한다는 사실에 놀랐다”고 Frankle은 말한다. “나는 더 복잡한 결과를 기대했다”.

Facebook (META ) AI 연구소의 Ari Morcos는 “이 발견은 확신을 주는 것”이라고 말한다. “이러한 모델은 점점 더广泛하게 사용되고 있다. 따라서 로또 티켓 가설이 실제로 작동하는지 이해하는 것이 중요하다”.

Morcos는 또한 “이러한 하위 네트워크가 훨씬 적은 컴퓨팅 파워를 사용할 수 있다면, 이는 매우 큰 영향을 미칠 것”이라고 말한다.

“나는 더 큰 모델을 만들기 위해 이러한 슈퍼컴퓨팅 스타일의 계산을 얼마나 더 사용할 수 있는지 모르겠다”고 Frankle은 말한다. “우리는 진입 장벽을 낮춰야 한다”.

“이 발견이 비용을 낮추고, 모든 사람에게 더 접근하기 쉽게 만들 수 있을 것”이라고 그는 заключ한다.

이 연구는 곧 신경 정보 처리 시스템 회의에서 발표될 예정이다.

Alex는 Unite.AI의 AI 기반 뉴스 운영을 이끌며, 저널리즘, 연구 및 자동화를 결합해 인공지능에 대한 시기적절하고 확장 가능한 보도를 지원합니다. 그의 작업은 새로운 AI 개발이 효율적으로 조명되도록 하면서도 출판물의 편집 기준을 유지하도록 돕습니다.