AI 모델 및 플랫폼

DeepSeek, $5.6M로 비용 장벽 깨다

mm
Unite.AI를 Google의 선호 소스에 추가

従来의 AI 지식은 대규모 언어 모델(LLM)을 구축하기 위해 심오한 자금이 필요하다고 말합니다 – 일반적으로 수십억 달러의 투자입니다. 그러나 중국의 AI 스타트업인 DeepSeek은 최근의 성과로 이러한 패러다임을 깨뜨렸습니다. 그들은 단지 560만 달러로 세계적인 AI 모델을 개발했습니다.

DeepSeek의 V3 모델은 Google의 Gemini와 OpenAI의 최신 모델과 경쟁할 수 있습니다. 이는 일반적으로 필요한 컴퓨팅 자원의 한 조각만 사용합니다. 이 성과는 많은 산업 리더들의 주목을 받았으며, 특히 주목할 점은 bahwa 회사가 미국의 수출 제한으로 인해 최신 Nvidia (NVDA ) 칩에 접근할 수 없었음에도 불구하고 이를 성취했다는 것입니다.

효율적인 AI의 경제학

숫자는 효율성의 압도적인 이야기를讲합니다. 대부분의 고급 AI 모델은 16,000개에서 100,000개의 GPU를 필요로 하지만, DeepSeek은 2,048개의 GPU만으로 57일 동안 구동했습니다. 모델의 훈련에는 Nvidia H800 칩에서 2.78 백만 개의 GPU 시간이 소요되었습니다. 이는 671억 개의 매개변수를 가진 모델에 대해 놀랍도록 적은 수치입니다.

이를 비교하기 위해, Meta는 405억 개의 매개변수를 가진 Llama 3 모델을 훈련하기 위해 약 3,080만 개의 GPU 시간이 필요했습니다. 이는 약 11배 더 많은 컴퓨팅 파워입니다. DeepSeek의 접근 방식은 제약 조건下的 최적화에 대한 마스터클래스와 같습니다. 중국 시장에서 Nvidia가 설계한 H800 GPU를 사용하여, 회사는 잠재적인 제한을 혁신으로 전환했습니다. 프로세서 통신을 위한 오프-더-쉘프 솔루션 대신, 효율성을 최대화하는 사용자 정의 솔루션을 개발했습니다.

경쟁사들이 여전히大量 투자가 필요하다고 가정하는 동안, DeepSeek은 지능과 효율적인 자원 사용이 경쟁력을 평준화할 수 있음을 보여주고 있습니다.

불가능을 구현하는 기술

DeepSeek의 성과는 혁신적인 기술적 접근 방식에 있습니다. 이는 때때로 가장 큰 돌파구가 제한된 자원에서 비롯될 수 있음을 보여줍니다.

이 혁신의 핵심은 “보조 손실 없는 로드 밸런싱”이라는 전략입니다. 이는 복잡한 규칙과 패널티가 필요 없는 대규모 병렬 처리 시스템을 조직하는 것과 같습니다. DeepSeek은 전통적인 지식을 뒤집어엎고, 오버헤드 없이 자연스럽게 균형을 유지하는 시스템을 개발했습니다.

팀은 또한 “다중 토큰 예측”이라는 기술을 개척했습니다. 이는 모델이 여러 토큰을 한 번에 예측할 수 있게 합니다. 실제로, 이는 다양한 주제에서 85-90%의 예측 승인率를 제공하며, 이전 접근 방식보다 1.8배 빠른 처리 속도를 제공합니다.

기술 아키텍처 자체가 효율성의 걸작입니다. DeepSeek의 V3은 671억 개의 매개변수를 사용하지만, 각 토큰에 대해서는 37억 개만 활성화합니다. 이는大量 모델의 이점을 유지하면서 실제 효율성을 유지하는 것입니다.

FP8 混합 정밀도 훈련 프레임워크를 선택한 것도 한 걸음 더 나아간 것입니다. 감소된 정밀도의 제한을 받아들이는 대신, 회사는 정확성을 유지하면서 메모리와 계산 요구를 크게 줄이는 사용자 정의 솔루션을 개발했습니다.

AI 생태계의 파급 효과

DeepSeek의 성과가 미치는 영향은 단 하나의 성공적인 모델을 넘어섭니다.

유럽의 AI 개발을 위한 이 돌파구는 특히 중요합니다. 많은 고급 모델이 EU에 도달하지 못하는 이유는 Meta와 OpenAI 같은 회사들이 EU AI 법에 적응하지 못하거나 할 수 없기 때문입니다. DeepSeek의 접근 방식은 최신 GPU 클러스터가 필요하지 않음을 보여줍니다. 이는 효율적으로 사용 가능한 자원을 사용하는 것입니다.

이 발전은 수출 제한이 실제로 혁신을 촉진할 수 있음을 보여줍니다. DeepSeek의 고급 하드웨어에 대한 접근이 제한되자, 회사는 다른 방식으로 생각해야 했습니다. 이는 자원 풍부한 환경에서 나타나지 않았을 소프트웨어 최적화를 가져왔습니다.

민주화의 의미는 심오합니다. 산업의 거물들이 수십억을 태우는 동안, DeepSeek은 효율적이고 비용 효과적인 AI 개발을 위한 청사진을 만들었습니다. 이는 이전에 자원 제한으로 경쟁할 수なかった 소규모 회사와 연구 기관에게 문을 열 수 있습니다.

그러나 이는 대규모 컴퓨팅 인프라가 구식이 된다는 것을 의미하지 않습니다. 산업은 추론 시간을 확장하는 데 초점을 맞추고 있습니다. 즉, 모델이 답변을 생성하는 데 걸리는 시간입니다. 이 추세가 계속되면, 상당한 컴퓨팅 자원이 필요할 것입니다. 아마도 시간이 지남에 따라 더 많이 필요할 것입니다.

그러나 DeepSeek은 대화를 근본적으로 바꿨습니다. 장기적인 의미는 명확합니다. 우리는 혁신적인 사고와 효율적인 자원 사용이 순수한 컴퓨팅 파워보다 더 중요할 수 있는 시대에 진입하고 있습니다. AI 커뮤니티에게 이는 우리가 가진 자원에만 집중하는 것이 아니라, 어떻게 창의적으로 효율적으로 사용하는지에 중점을 두어야 함을 의미합니다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.