Модели и платформы ИИ
Google делает обучение ИИ на 28% быстрее с помощью SLM в качестве учителей
Обучение больших языковых моделей (LLM) стало недоступным для большинства организаций. Стоимость обучения достигает миллионов, а требования к вычислительным ресурсам такие, что даже суперкомпьютеры могут потеть. Однако Google (GOOGL ) только что изменила эту ситуацию, используя подход, настолько простой, что удивительно, почему никто не подумал об этом раньше: использовать более мелкие модели ИИ в качестве учителей.
Как работает SALT: Новый подход к обучению моделей ИИ
В недавней исследовательской статье под названием “Маленькая помощь может многое изменить: Эффективное обучение LLM с помощью небольших моделей” исследователи Google и DeepMind представили SALT (Обучение с помощью небольших моделей). Это новый метод, который бросает вызов нашему традиционному подходу к обучению LLM.
Почему это исследование так важно? В настоящее время обучение больших моделей ИИ похоже на попытку научить кого-то всему, что он должен знать о предмете сразу – это неэффективно, дорого и часто ограничивается организациями с огромными вычислительными ресурсами. SALT использует другой подход, вводя двухэтапный процесс обучения, который одновременно инновационный и практичный.
Разбор того, как на самом деле работает SALT:
Этап 1: Дистилляция знаний
- Более мелкая языковая модель (SLM) выступает в качестве учителя, делясь своим пониманием с более крупной моделью
- Меньшая модель фокусируется на передаче своего “приобретенного знания” через то, что исследователи называют “мягкими метками”
- Представьте себе помощника учителя, который занимается основными понятиями, прежде чем ученик перейдет к более сложным темам
- Этот этап особенно эффективен в “легких” областях обучения – областях, где более мелкая модель имеет сильную предсказательную уверенность
Этап 2: Самостоятельное обучение
- Более крупная модель переходит к самостоятельному обучению
- Она фокусируется на освоении сложных закономерностей и сложных задач
- Это то место, где модель развивает возможности, выходящие за рамки того, что могла предоставить ее более мелкая “учительница”
- Переход между этапами использует тщательно разработанные стратегии, включая линейное затухание и линейное соотношение затухания веса дистилляции
В не-технических терминах, представьте, что более мелкая модель ИИ похожа на полезного репетитора, который руководит более крупной моделью на начальном этапе обучения. Этот репетитор предоставляет дополнительную информацию вместе с ответами, указывая, насколько уверен он в каждом ответе. Эта дополнительная информация, известная как “мягкие метки”, помогает более крупной модели учиться быстрее и более эффективно.
- Линейное затухание: Это похоже на медленное уменьшение громкости голоса репетитора. Руководство репетитора становится менее заметным с каждым шагом, позволяя более крупной модели сосредоточиться больше на обучении из сырых данных.
- Линейное соотношение затухания: Это похоже на регулировку баланса между советом репетитора и самой задачей. По мере прогресса обучения акцент смещается больше в сторону исходной задачи, а вход репетитора становится менее доминирующим.
Результаты убедительны. Когда исследователи Google протестировали SALT, используя модель SLM с 1,5 миллиардами параметров для обучения модели LLM с 2,8 миллиардами параметров на наборе данных Pile, они увидели:
- Сокращение времени обучения на 28% по сравнению с традиционными методами
- Значительные улучшения производительности после дообучения:
- Точность математических задач увеличилась до 34,87% (по сравнению с 31,84% базовой линией)
- Понимание чтения достигло 67% точности (по сравнению с 63,7%)
Но что делает SALT действительно инновационным, так это его теоретическая основа. Исследователи обнаружили, что даже “слабая” модель учителя может улучшить производительность ученика, достигая того, что они называют “благоприятным компромиссом между дисперсией и смещением”. В более простых терминах, более мелкая модель помогает более крупной учиться основным закономерностям более эффективно, создавая более прочный фундамент для дальнейшего обучения.
Почему SALT может изменить ландшафт разработки ИИ
Помните, когда облачные вычисления изменили возможности тех, кто мог начать технологическую компанию? SALT может сделать то же самое для разработки ИИ.
Я следил за инновациями в области обучения ИИ в течение многих лет, и большинство прорывов в основном приносили пользу технологическим гигантам. Но SALT отличается.
Вот, что это может значить для будущего:
Для организаций с ограниченными ресурсами:
- Вам может больше не понадобиться огромная вычислительная инфраструктура для разработки способных моделей ИИ
- Меньшие исследовательские лаборатории и компании смогут экспериментировать с разработкой собственных моделей
- Сокращение времени обучения на 28% напрямую переводится в более низкие вычислительные затраты
- Более того, вы сможете начать с скромных вычислительных ресурсов и все равно добиться профессиональных результатов
Для ландшафта разработки ИИ:
- Больше игроков смогут войти на поле, что приведет к более разнообразным и специализированным решениям ИИ
- Университеты и исследовательские учреждения смогут проводить больше экспериментов с имеющимися ресурсами
- Порог входа для исследований ИИ значительно снижается
- Мы можем увидеть новые применения в областях, которые ранее не могли позволить себе разработку ИИ
Что это значит для будущего
Используя более мелкие модели в качестве учителей, мы не только делаем обучение ИИ более эффективным, но и фундаментально меняем, кто может участвовать в разработке ИИ. Последствия выходят далеко за рамки простых технических улучшений.
Ключевые выводы, которые следует помнить:
- Сокращение времени обучения на 28% – это разница между началом проекта ИИ и рассмотрением его как недоступного
- Улучшения производительности (34,87% на математических задачах, 67% на задачах чтения) показывают, что доступность не всегда означает компромисс в качестве
- Подход SALT доказывает, что иногда лучшие решения исходят из переосмысления основ, а не просто добавления вычислительной мощности
На что следует обратить внимание:
- Следите за тем, как более мелкие организации начинают разрабатывать собственные модели ИИ
- Следите за новыми применениями в областях, которые ранее не могли позволить себе разработку ИИ
- Ищите инновации в том, как более мелкие модели используются для специализированных задач
Помните: Реальная ценность SALT заключается в том, как он может изменить, кто может инновировать в области ИИ. Будь вы руководите исследовательской лабораторией, управляете технологической командой или просто интересуетесь разработкой ИИ, это тот прорыв, который может сделать вашу следующую большую идею возможной.
Может быть, начните думать о том проекте ИИ, который вы считали недоступным. Он может быть более возможным, чем вы представляли.










