Модели и платформы ИИ

Как DeepSeek преодолел барьер стоимости за $5,6 млн

mm
Добавьте Unite.AI в избранные источники в Google

Традиционная мудрость в области ИИ гласит, что создание больших языковых моделей (LLM) требует глубоких карманов – обычно миллиардов долларов инвестиций. Но DeepSeek, китайский стартап в области ИИ, только что разрушил этот парадигму своим последним достижением: разработкой мирового класса модели ИИ за всего $5,6 миллиона.

Модель V3 от DeepSeek может конкурировать с гигантами отрасли, такими как Google’s Gemini и OpenAI’s latest offerings, при этом используя лишь малую часть типичных вычислительных ресурсов. Это достижение привлекло внимание многих лидеров отрасли, и что делает это особенно замечательным, так это то, что компания добилась этого, несмотря на ограничения на экспорт из США, которые ограничили их доступ к последним чипам Nvidia (NVDA ).

Экономика эффективного ИИ

Цифры рассказывают убедительную историю об эффективности. В то время как большинство передовых моделей ИИ требуют от 16 000 до 100 000 GPU для обучения, DeepSeek справился с всего 2 048 GPU, работающими в течение 57 дней. Обучение модели потребовало 2,78 миллиона часов GPU на чипах Nvidia H800 – удивительно скромно для модели с 671 миллиардом параметров.

Чтобы поставить это в перспективу, Meta потребовалось примерно 30,8 миллиона часов GPU – примерно в 11 раз больше вычислительной мощности – для обучения своей модели Llama 3, которая на самом деле имеет меньше параметров – 405 миллиардов. Подход DeepSeek напоминает мастер-класс по оптимизации под ограничениями. Работая с GPU H800 – ИИ-чипами, разработанными Nvidia специально для китайского рынка с уменьшенными возможностями, компания превратила потенциальные ограничения в инновации. Вместо использования готовых решений для коммуникации процессоров они разработали индивидуальные решения, которые максимизировали эффективность.

В то время как конкуренты продолжают работать под предположением, что огромные инвестиции необходимы, DeepSeek демонстрирует, что изобретательность и эффективное использование ресурсов могут выровнять игровое поле.

Изображение: Artificial Analysis

Инженерия невозможного

Достижение DeepSeek заключается в их инновационном техническом подходе, демонстрирующем, что иногда наиболее значимые прорывы приходят от работы в рамках ограничений, а не от бросания неограниченных ресурсов на проблему.

В сердце этой инновации лежит стратегия, называемая “балансировкой нагрузки без вспомогательной потери”. Представьте себе оркестровку огромной параллельной системы обработки, где традиционно вам бы потребовались сложные правила и штрафы, чтобы все работало гладко. DeepSeek перевернул эту традиционную мудрость с ног на голову, разработав систему, которая естественным образом поддерживает баланс без накладных расходов традиционных подходов.

Команда также разработала то, что они называют “Много-токенной предсказательной” (МТП) техникой – метод, который позволяет модели думать вперед, предсказывая несколько токенов одновременно. На практике это переводится в впечатляющий 85-90% уровень принятия этих предсказаний по различным темам, обеспечивая 1,8 раза более быструю скорость обработки по сравнению с предыдущими подходами.

Сама техническая архитектура является шедевром эффективности. Модель V3 от DeepSeek использует смесь экспертов с общим количеством 671 миллиарда параметров, но вот умная часть – она активирует только 37 миллиардов для каждого токена. Эта селективная активация означает, что они получают преимущества от огромной модели, сохраняя при этом практическую эффективность.

Их выбор смешанной точности обучения в формате FP8 является еще одним шагом вперед. Вместо того, чтобы принимать ограничения уменьшенной точности, они разработали индивидуальные решения, которые сохраняют точность, значительно снижая требования к памяти и вычислениям.

Волны в экосистеме ИИ

Воздействие достижения DeepSeek распространяется далеко за пределы одной успешной модели.

Для европейского развития ИИ это прорыв особенно значим. Многие передовые модели не доходят до ЕС, потому что компании, такие как Meta и OpenAI, либо не могут, либо не хотят адаптироваться к закону ЕС об ИИ. Подход DeepSeek показывает, что создание передового ИИ не всегда требует огромных кластеров GPU – это больше о том, чтобы использовать доступные ресурсы эффективно.

Это развитие также демонстрирует, как ограничения на экспорт могут фактически стимулировать инновации. Ограниченный доступ DeepSeek к высококлассному оборудованию заставил их думать по-другому, что привело к программным оптимизациям, которые, возможно, никогда бы не появились в среде с богатыми ресурсами. Этот принцип может изменить то, как мы подходим к разработке ИИ глобально.

Импликации демократизации глубоки. В то время как гиганты отрасли продолжают сжигать миллиарды, DeepSeek создал план эффективного, доступного по стоимости развития ИИ. Это может открыть двери для меньших компаний и исследовательских учреждений, которые ранее не могли конкурировать из-за ограничений ресурсов.

Однако это не означает, что крупномасштабная вычислительная инфраструктура становится устаревшей. Отрасль смещает фокус в сторону масштабирования времени вывода – того, сколько времени модель тратит на генерацию ответов. По мере продолжения этой тенденции значительные вычислительные ресурсы все еще будут необходимы, вероятно, даже больше с течением времени.

Но DeepSeek изменил разговор. Долгосрочные последствия ясны: мы вступаем в эпоху, когда инновационное мышление и эффективное использование ресурсов могут быть важнее, чем чистая вычислительная мощность. Для сообщества ИИ это означает сосредоточение внимания не только на ресурсах, которые у нас есть, но и на том, как мы используем их творчески и эффективно.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.