AI 모델 및 플랫폼
연구원, GPU 대체할 대안 개발

라이스 대학교의 컴퓨터 과학자들과 인텔의 협력자들은 GPU보다 더 비용 효율적인 대안을 개발했습니다. 새로운 알고리즘은 “서브라이너 딥 러닝 엔진”이라고 불리며, 특별한 가속 하드웨어 없이 일반적인 중앙 처리 장치(CPU)를 사용합니다.
(INTC )결과는 머신 러닝 시스템 컨퍼런스인 MLSys에서 개최된 오스틴 컨벤션 센터에서 발표되었습니다.
인공지능(AI)에서 가장 큰 도전 중 하나는 그래픽 처리 장치(GPU)와 같은 특별한 가속 하드웨어입니다. 새로운 개발이 있기 전에, 딥 러닝 기술을 가속화하기 위해서는 이러한 특별한 가속 하드웨어가 필요하다고 생각했습니다.
많은 회사들이 딥 러닝을 위한 GPU와 특별한 하드웨어에 많은 투자를 했습니다. 이러한 기술은 디지털 어시스턴트, 얼굴 인식, 제품 추천 시스템과 같은 기술을 가능하게 합니다. 하나의 회사인 엔비디아는 테슬라 V100 텐서 코어 GPU를 제작하며, 최근 4분기 매출이 지난해보다 41% 증가했다고 보고했습니다.
SLIDE의 개발은 완전히 새로운 가능성을 열어줍니다.
안수말리 시리바스타바는 라이스의 브라운 공과대학의 조교수이며, 대학원 학생인 베이디 천과 타룬 메디니와 함께 SLIDE를 개발했습니다.
시리바스타바는 “우리의 테스트 결과에 따르면, SLIDE는 CPU에서 딥 러닝을 수행하는 최초의 스마트 알고리즘 구현이며, 산업 규모의 추천 데이터셋과 큰 완전 연결 아키텍처에서 GPU 하드웨어 가속을 능가할 수 있습니다”라고 말했습니다.
SLIDE는 딥 러닝에 대한 완전히 다른 접근 방식을 통해 GPU의 도전을 극복합니다. 현재, 딥 뉴럴 네트워크를 위한 표준적인 훈련 기술은 “백 프로퍼게이션”이며, 행렬 곱셈이 필요합니다. 이 작업은 GPU가 필요하지만, 연구자들은 뉴럴 네트워크 훈련을 변경하여 해시 테이블로 해결할 수 있도록 했습니다.
이 새로운 접근 방식은 SLIDE의 계산 오버헤드를 크게 줄입니다. 현재, 클라우드 기반의 딥 러닝을 위한 최고의 GPU 플랫폼은 아마존과 구글이 사용하는 8개의 테슬라 V100이며, 가격은 약 100,000달러입니다.
시리바스타바는 “우리는 실험실에 하나의 V100을 가지고 있으며, 우리의 테스트 케이스에서는 V100에 적합한 워크로드를 사용했습니다. 이는 100만 개 이상의 매개변수가 있는 큰 완전 연결 네트워크이며, GPU 메모리에 맞습니다”라고 말했습니다. “우리는 구글의 텐서플로우와 같은 최고의 소프트웨어 패키지를 사용하여 3시간 반 동안 훈련했습니다.”
그는 이어 “우리는 새로운 알고리즘이 1시간 만에 CPU에서 훈련할 수 있음을 보여주었습니다. 이는 44코어의 제온급 CPU에서 수행되었습니다”라고 말했습니다.
해싱은 1990년대에 인터넷 검색을 위한 데이터 인덱싱 방법으로 발명되었습니다. 숫자 방법을 사용하여大量의 정보를 숫자열로 인코딩하여 해시를 생성합니다. 해시를 목록화하여 빠르게 검색할 수 있는 테이블을 생성합니다.
천은 “우리의 알고리즘을 텐서플로우나 파이토치에서 구현하는 것은 의미가 없었습니다. 그들은 무엇을 하든지 행렬 곱셈 문제로 변환하려고 시도하기 때문입니다. 우리는 그것을 피하려고 했습니다. 그래서 우리는_scratch에서 C++ 코드를 작성했습니다”라고 말했습니다.
시리바스타바에 따르면, SLIDE의 가장 큰优势은 데이터 병렬性입니다.
시리바스타바는 “데이터 병렬성은 두 개의 데이터 인스턴스를 훈련할 때, 예를 들어 고양이와 버스의 이미지를 훈련할 때, 서로 다른 뉴런을 활성화할 수 있으며, SLIDE는 이러한 두 개의 인스턴스를 독립적으로 업데이트할 수 있습니다. 이는 CPU의 병렬성을 더 잘 활용합니다”라고 말했습니다.
그는 이어 “반면, GPU와 비교하여 큰 메모리가 필요합니다. 메인 메모리에 캐시 계층이 있으며, 이를 주의하지 않으면 캐시 미스라는 문제가 발생할 수 있습니다”라고 말했습니다.
SLIDE는 딥 러닝을 구현하는 새로운 방법을 열어주었습니다. 시리바스타바는 이것이 시작에 불과하다고 믿습니다.
시리바스타바는 “우리는 아직 표면을 긁었을 뿐입니다. 최적화할 수 있는 여지가 많습니다. 우리는 벡터화나 CPU의 내장 가속기와 같은 인텔 딥 러닝 부스트를 사용하지 않았습니다. 이것을 더 빠르게 만들기 위한 다른 트릭이 많습니다”라고 말했습니다.












