Anderson의 관점

GPU는 더 빠르기만 아니라 딥 뉴럴 네트워크 훈련에서 더 나은 성능을 발휘할 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가

폴란드와 일본의 연구자들은 소니와 함께 작업하여 GPU에서 훈련된 기계 학습 시스템이 CPU에서 훈련된 시스템보다 훈련 과정에서 오류가 적고 결과가 더 좋음을 발견했다. 이는 GPU가 단순히 연산을 더 빠르게 수행하는 것이 아니라 더 나은 성능을 발휘할 수 있음을 시사한다.

이 연구는 아담 미키에비치 대학의 심리학 및 인지 과학부와 일본의 두 대학, 그리고 소니 컴퓨터 사이언스 연구소에서 수행되었다.

연구에 따르면 딥 뉴럴 네트워크는 다양한 하드웨어와 소프트웨어 구성에서 나타나는 ‘불확실성’을 더 잘 처리할 수 있으며, 이러한 불확실성은 더 비싼 그래픽 처리 장치(GPU)를 선호한다. 또한 연구진은 CPU만으로 훈련된 딥 뉴럴 네트워크가 같은 에포크 수에서 더 높은 오류率를 보이는 것을 발견했다.

이 연구의 보충 예시에서, 우리는 다양한 GPU에서 유사한 결과 품질을 얻었으며, 다양한 CPU에서 얻은 낮은 품질의 결과를 볼 수 있다. 출처: https://arxiv.org/pdf/2109.01451.pdf

이 연구의 보충 예시에서, 우리는 다양한 GPU에서 유사한 결과 품질을 얻었으며, 다양한 CPU에서 얻은 낮은 품질의 결과를 볼 수 있다. 출처: https://arxiv.org/pdf/2109.01451.pdf

이상 현상

이 초기 연구 결과는 모든 기계 학습 알고리즘에 일관되게 적용되지 않는다. 특히, 간단한 오토인코더 아키텍처에서는 이러한 현상이 나타나지 않는다.

그러나 이 연구는 복잡한 뉴럴 네트워크에서 훈련의 효율성과 결과의 품질을 높일 수 있는 ‘탈출 속도’를 암시한다. 이는 동일한 연산을 더 낮은 속도와 더 긴 훈련 시간으로 수행하는 것이 동일한 성능을 얻을 수 없음을 의미한다.

연구진은 이 성능 차이가 특정 유형의 뉴럴 네트워크에เฉพาะ한 것일 수 있으며, GPU 특有的 처리 방식이 장애물로 여겨졌지만, 실제로는 유용한 이점을 제공할 수 있으며, 향후 시스템에서 의도적으로 통합될 수 있을 것이라고 제안한다. 또한 이 연구는 뇌 관련 계산 처리에 대한 더 깊은 통찰력을 제공할 수 있다고 한다.

이러한 효율성과 결과 품질을提高하는 특이점을 식별하는 것은 ‘블랙 박스’ AI 아키텍처에 대한 더 깊은 통찰력을 얻을 수 있으며,甚至 CPU 성능을 개선할 수 있을 것이라고 한다. 그러나 현재 이러한 원인은まだ 불분명하다.

오토인코더 vs. PredNet

이상 현상을 연구하기 위해, 연구진은 기본적인 오토인코더와 하버드 대학의 예측 뉴럴 네트워크(PredNet)를 사용했다. PredNet은 2016년에 개발되었으며, 인간의 대뇌 피질의 행동을 모방하기 위해 설계되었다.

두 시스템은 모두 딥 뉴럴 네트워크로, 레이블이 없는 데이터에서 적합한 이미지를 생성하기 위해 무감독 학습을 사용한다. 그러나 오토인코더는 선형적으로 하나의 이미지당 배치로 처리하며, 이는 재귀적 파이프라인에서 다음 이미지를 생성한다. 오토인코더는 MNIST 손글씨 데이터베이스에서 훈련되었다.

연구진의 테스트에서 사용된 오토인코더는 MNIST 데이터베이스에서 훈련되었다. 이는 60,000개의 훈련 이미지와 10,000개의 테스트 이미지를 포함한다.

연구진의 테스트에서 사용된 오토인코더는 MNIST 데이터베이스에서 훈련되었다. 이는 60,000개의 훈련 이미지와 10,000개의 테스트 이미지를 포함한다.

반면에, PredNet은 복잡한 비디오 입력을 평가하며, 이 연구에서는 디즈니 월드 오를란도 플로리다 데이터셋에서 훈련되었다. 이 데이터셋은 디즈니 월드에서の一天의 첫인신 비디오 화면을 특징으로 한다.

FPSI 데이터셋에서の一인칭 시점의 디즈니 월드 오를란도 비디오 화면.

FPSI 데이터셋에서の一인칭 시점의 디즈니 월드 오를란도 비디오 화면.

두 아키텍처는 복잡성 측면에서 매우 다르다. 오토인코더는 이미지 재구성을 위해 설계되었으며, 타겟 값을 예측하지 않는다. 반면에, PredNet은 4개의 레이어로 구성되며, 각 레이어는 컨볼루션 롱 쇼트텀 메모리(LSTM)를 사용하는 표현 뉴런으로 구성된다.

레이어는 컨텍스트 예측을 출력하며, 이는 타겟과 비교하여 오류 항을 생성한다. 이 오류 항은 네트워크 전체에 전파된다. 두 모델은 모두 무감독 학습을 사용한다.

오토인코더의 단순한 선형 아키텍처와 PredNet의 더 복잡한 재귀적 네트워크.

오토인코더의 단순한 선형 아키텍처와 PredNet의 더 복잡한 재귀적 네트워크.

두 시스템은 다양한 하드웨어와 소프트웨어 구성에서 테스트되었다. 이는 CPU만으로 구성된 시스템과 GPU를 포함한 시스템을 모두 포함한다.

인터랙티브 프로세스 뷰어 htop을 사용하여 모든 훈련이 단일 스레드 또는 다중 스레드에서 발생하는지 확인했다.

사드尔 포인트

오토인코더에서, 모든 구성에서 평균 차이는 유의하지 않았다. 그러나 PredNet에서는 CPU와 GPU 훈련 간에 손실 평가와 품질에서 현저한 차이가 있었다.

PredNet 훈련의 평균 손실 결과. 네트워크는 5000개의 비디오 프레임에서 250개의 배치로 훈련되었으며, 마지막 1000개의 프레임(50개의 배치)의 평균 손실을 나타낸다. cuDNN은 꺼져 있었다.

PredNet 훈련의 평균 손실 결과. 네트워크는 5000개의 비디오 프레임에서 250개의 배치로 훈련되었으며, 마지막 1000개의 프레임(50개의 배치)의 평균 손실을 나타낸다. cuDNN은 꺼져 있었다.

연구진은 “‘메커니즘은 불분명하지만, GPU 하드웨어가 딥 뉴럴 네트워크 훈련을 발전시킬 수 있는 능력이 있는 것으로 보인다”고 결론지었다.

결과는 GPU가 사드르 포인트를避ける 데 더 좋을 수 있음을 시사한다. 사드르 포인트는 그래디언트 디센트에서 경사면의 바닥을 의미한다.

그래디언트 디센트의 사드르 포인트. 출처: https://www.pinterest.com.au/pin/436849232581124086/

그래디언트 디센트의 사드르 포인트. 출처: https://www.pinterest.com.au/pin/436849232581124086/

사드르 포인트는 장애물로 여겨졌지만, 최근의 확률적 그래디언트 디센트 최적화에 대한 연구에서 쉽게 극복할 수 있는 것으로 간주되었다. 그러나 새로운 연구는 GPU가 이러한 사드르 포인트를避ける 데 유일하게 적합할 수 있으며, 사드르 포인트의 영향이 재검토되어야 함을 시사한다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai