Модели и платформы ИИ

Возрождение небольших моделей рассуждения: могут ли компактные модели ИИ соответствовать уровню рассуждения GPT?

mm
Добавьте Unite.AI в избранные источники в Google

В последние годы область ИИ была увлечена успехом крупных языковых моделей (LLM). Первоначально разработанные для обработки естественного языка, эти модели эволюционировали в мощные инструменты рассуждения, способные решать сложные проблемы с помощью человеческого мышления. Однако, несмотря на их исключительные способности рассуждения, LLM имеют значительные недостатки, включая высокие вычислительные затраты и медленную скорость развертывания, что делает их непрактичными для реального использования в средах с ограниченными ресурсами, таких как мобильные устройства или边缘ные вычисления. Это привело к растущему интересу к разработке более мелких, эффективных моделей, которые могут предложить аналогичные возможности рассуждения, минимизируя затраты и требования к ресурсам. В этой статье исследуется рост этих небольших моделей рассуждения, их потенциал, проблемы и последствия для будущего ИИ.

Сдвиг перспективы

На протяжении большей части недавней истории ИИ область следовала принципу “закон масштабирования”, который предполагает, что производительность модели улучшается предсказуемо с увеличением данных, вычислительной мощности и размера модели. Хотя этот подход дал мощные модели, он также привел к значительным компромиссам, включая высокие затраты на инфраструктуру, воздействие на окружающую среду и задержки. Не все приложения требуют полных возможностей массивных моделей с сотнями миллиардов параметров. Во многих практических случаях – таких как помощники на устройствах, здравоохранение и образование – более мелкие модели могут достигать аналогичных результатов, если они могут рассуждать эффективно.

Понимание рассуждений в ИИ

Рассуждения в ИИ относятся к способности модели следовать логическим цепочкам, понимать причину и следствие, выводить последствия, планировать шаги в процессе и выявлять противоречия. Для языковых моделей это часто означает не только извлечение информации, но и манипулирование и вывод информации через структурированный, пошаговый подход. Этот уровень рассуждений обычно достигается путем тонкой настройки LLM для выполнения многоступенчатого рассуждения перед получением ответа. Хотя этот метод эффективен, он требует значительных вычислительных ресурсов и может быть медленным и дорогим в развертывании, что вызывает беспокойство по поводу их доступности и воздействия на окружающую среду.

Понимание небольших моделей рассуждения

Небольшие модели рассуждения стремятся воспроизвести возможности рассуждения крупных моделей, но с большей эффективностью в отношении вычислительной мощности, использования памяти и задержек. Эти модели часто используют технику, называемую дистилляцией знаний, где более мелкая модель ( “ученик”) учится у более крупной, предварительно обученной модели ( “учитель”). Процесс дистилляции включает в себя обучение более мелкой модели на данных, сгенерированных более крупной моделью, с целью передачи способности рассуждения. Модель ученика затем донастраивается для улучшения ее производительности. В некоторых случаях реинфорсмент-обучение с специализированными домен-специфичными функциями вознаграждения применяется для дальнейшего улучшения способности модели выполнять задачи-специфичные рассуждения.

Рост и достижения небольших моделей рассуждения

Заметным этапом в разработке небольших моделей рассуждения стало выпуск DeepSeek-R1. Несмотря на то, что она была обучена на относительно скромном кластере старых GPU, DeepSeek-R1 достигла производительности, сравнимой с более крупными моделями, такими как OpenAI’s o1, на бенчмарках, таких как MMLU и GSM-8K. Это достижение привело к переоценке традиционного подхода к масштабированию, который предполагал, что более крупные модели по своей сути лучше.

Успех DeepSeek-R1 можно отнести к ее инновационному процессу обучения, который объединил крупномасштабное реинфорсмент-обучение без использования контролируемой тонкой настройки на ранних этапах. Этот инновационный подход привел к созданию DeepSeek-R1-Zero, модели, которая продемонстрировала впечатляющие возможности рассуждения по сравнению с крупными моделями рассуждения. Дальнейшие улучшения, такие как использование холодных данных, повысили когерентность модели и выполнение задач, особенно в таких областях, как математика и кодирование.

Кроме того, техники дистилляции оказались важными в разработке более мелких, более эффективных моделей из более крупных. Например, DeepSeek выпустила дистиллированные версии своих моделей, размер которых варьируется от 1,5 миллиарда до 70 миллиардов параметров. Используя эти модели, исследователи обучили сравнительно более мелкую модель DeepSeek-R1-Distill-Qwen-32B, которая превзошла OpenAI’s o1-mini на различных бенчмарках. Эти модели теперь могут быть развернуты с использованием стандартного оборудования, что делает их более жизнеспособным вариантом для широкого спектра приложений.

Могут ли небольшие модели соответствовать уровню рассуждения GPT

Чтобы оценить, могут ли небольшие модели рассуждения (SRM) соответствовать силе рассуждения крупных моделей (LRM), таких как GPT, важно оценить их производительность на стандартных бенчмарках. Например, модель DeepSeek-R1 получила около 0,844 на тесте MMLU, что сравнимо с более крупными моделями, такими как o1. На наборе данных GSM-8K, который фокусируется на математике для начальной школы, дистиллированная модель DeepSeek-R1 достигла лучшей производительности, превзойдя как o1, так и o1-mini.

В задачах кодирования, таких как те, что на LiveCodeBench и CodeForces, дистиллированные модели DeepSeek-R1 продемонстрировали сильные возможности рассуждения в программировании, сравнимые с o1-mini и GPT-4o. Однако более крупные модели все еще имеют преимущество в задачах, требующих более широкого понимания языка или обработки длинных контекстных окон, поскольку более мелкие модели, как правило, более специфичны для задач.

Несмотря на их сильные стороны, небольшие модели могут испытывать трудности с расширенными задачами рассуждения или когда сталкиваются с данными, находящимися вне распределения. Например, в симуляциях шахмат LLM модель DeepSeek-R1 сделала больше ошибок, чем более крупные модели, что указывает на ограничения в ее способности поддерживать фокус и точность в течение длительного времени.

Компромиссы и практические последствия

Компромиссы между размером модели и производительностью являются важными при сравнении SRM с GPT-уровневыми LRM. Небольшие модели требуют меньше памяти и вычислительной мощности, что делает их идеальными для устройств на краю сети, мобильных приложений или ситуаций, когда необходимо автономное вывод. Эта эффективность приводит к более низким эксплуатационным затратам, с моделями, такими как DeepSeek-R1, которые могут быть до 96% дешевле в эксплуатации, чем более крупные модели, такие как o1.

Однако эти выгоды от эффективности приходят с некоторыми компромиссами. Небольшие модели, как правило, донастраиваются для конкретных задач, что может ограничить их универсальность по сравнению с более крупными моделями. Например, хотя DeepSeek-R1 превосходит в математике и кодировании, она отсутствует многомодальных возможностей, таких как способность интерпретировать изображения, которую более крупные модели, такие как GPT-4o, могут выполнять.

Несмотря на эти ограничения, практические применения небольших моделей рассуждения обширны. В здравоохранении они могут питать диагностические инструменты, которые анализируют медицинские данные на стандартных серверах больниц. В образовании они могут быть использованы для разработки персонализированных систем обучения, предоставляющих пошаговую обратную связь студентам. В научных исследованиях они могут помочь с анализом данных и тестированием гипотез в областях, таких как математика и физика. Открытый характер моделей, таких как DeepSeek-R1, также способствует сотрудничеству и демократизирует доступ к ИИ, позволяя более мелким организациям извлекать выгоду из передовых технологий.

Основная мысль

Эволюция языковых моделей в более мелкие модели рассуждения является значительным достижением в ИИ. Хотя эти модели могут еще не полностью соответствовать широким возможностям крупных языковых моделей, они предлагают ключевые преимущества в эффективности, экономичности и доступности. Стриking баланс между силой рассуждения и эффективностью ресурсов, более мелкие модели, как ожидается, будут играть важную роль в различных приложениях, делая ИИ более практичным и устойчивым для реального использования.

Доктор Техсин Зия является доцентом в университете COMSATS в Исламабаде, имеющим степень PhD в области ИИ в Венском техническом университете, Австрия. Специализируясь в области искусственного интеллекта, машинного обучения, науки о данных и компьютерного зрения, он внес значительный вклад с публикациями в авторитетных научных журналах. Доктор Техсин также возглавлял различные промышленные проекты в качестве основного исследователя и служил консультантом по ИИ.