AGI и будущее ИИ
AlphaEvolve: революционный шаг Google DeepMind к искусственному общему интеллекту
Google DeepMind представил AlphaEvolve, агент кодирования, предназначенный для автономного открытия новых алгоритмов и научных решений. Представленный в статье под названием “AlphaEvolve: Агент кодирования для научных и алгоритмических открытий,” это исследование представляет собой фундаментальный шаг к искусственному общему интеллекту (ИОИ) и даже искусственному сверхинтеллекту (ИСИ). Вместо того, чтобы полагаться на статическое тонкое настройка или помеченные человеческими данными, AlphaEvolve выбирает совершенно другой путь – путь, который центрируется на автономной творчестве, алгоритмических инновациях и непрерывном самоусовершенствовании.
В основе AlphaEvolve лежит самодостаточный эволюционный конвейер, работающий на больших языковых моделях (БЯМ). Этот конвейер не только генерирует выходные данные, но и мутирует, оценивает, выбирает и совершенствует код на протяжении поколений. AlphaEvolve начинается с начальной программы и итеративно совершенствует ее, вводя тщательно структурированные изменения.
Эти изменения принимают форму БЯМ-генерируемых изменений – изменений кода, предложенных языковой моделью на основе предыдущих примеров и явных инструкций. “Изменение” в программной инженерии относится к разнице между двумя версиями файла, обычно выделяя строки, которые необходимо удалить или заменить, и новые строки, которые необходимо добавить. В AlphaEvolve БЯМ генерирует эти изменения, анализируя текущую программу и предлагая небольшие правки – добавление функции, оптимизацию цикла или изменение гиперпараметра – на основе подсказки, включающей метрики производительности и предыдущие успешные правки.
Каждая измененная программа затем тестируется с помощью автоматических оценщиков, адаптированных к задаче. Наиболее эффективные кандидаты сохраняются, сохраняются и рекомбинируются в качестве вдохновения для будущих итераций. Со временем этот эволюционный цикл приводит к появлению все более сложных алгоритмов – часто превосходящих те, которые были разработаны человеческими экспертами.
Понимание науки, лежащей в основе AlphaEvolve
В своей основе AlphaEvolve построен на принципах эволюционных вычислений – подполе искусственного интеллекта, вдохновленного биологической эволюцией. Система начинается с базовой реализации кода, которую она рассматривает как первоначальную “организм”. На протяжении поколений AlphaEvolve изменяет этот код – вводя вариации или “мутации” – и оценивает пригодность каждой вариации с помощью хорошо определенной функции оценки. Лучшие варианты выживают и служат шаблонами для следующего поколения.
Этот эволюционный цикл координируется посредством:
- Выбор подсказки: AlphaEvolve строит подсказки, выбирая и встраивая предыдущие успешные образцы кода, метрики производительности и инструкции, специфичные для задачи.
- Мутация и предложение кода: Система использует смесь мощных БЯМ – Gemini 2.0 Flash и Pro – для генерации конкретных изменений текущей базы кода в форме изменений.
- Механизм оценки: Автоматическая функция оценки оценивает производительность каждого кандидата, выполняя его и возвращая скалярные оценки.
- База данных и контроллер: Распределенный контроллер управляет этим циклом, сохраняя результаты в эволюционной базе данных и балансируя исследование с эксплуатацией посредством механизмов, таких как MAP-Elites.
Этот обратно связанный, автоматизированный эволюционный процесс радикально отличается от стандартных методов тонкой настройки. Он позволяет AlphaEvolve генерировать новые, высокопроизводительные и иногда противоречивые решения – расширяя границы того, что машинное обучение может автономно достичь.

Сравнение AlphaEvolve с RLHF
Чтобы оценить инновации AlphaEvolve, важно сравнить его с обучением с помощью обратной связи от человека (RLHF), доминирующим подходом, используемым для тонкой настройки больших языковых моделей.
В RLHF человеческие предпочтения используются для обучения модели вознаграждения, которая направляет процесс обучения БЯМ посредством алгоритмов обучения с подкреплением, таких как Proximal Policy Optimization (PPO). RLHF улучшает соответствие и полезность моделей, но требует обширного участия человека для генерации данных обратной связи и обычно работает в статическом, одноразовом режиме тонкой настройки.
AlphaEvolve, в отличие от этого:
- Удаляет обратную связь от человека из цикла в пользу машинно-выполняемых оценщиков.
- Поддерживает непрерывное обучение посредством эволюционного отбора.
- Изучает гораздо более широкие пространства решений благодаря стохастическим мутациям и асинхронному выполнению.
- Может генерировать решения, которые не только согласованы, но и новые и научно значимые.
В то время как RLHF совершенствует поведение, AlphaEvolve открывает и изобретает. Это различие имеет решающее значение при рассмотрении будущих траекторий к ИОИ: AlphaEvolve не только делает лучшие прогнозы, но и находит новые пути к истине.
Применения и прорывы
1. Алгоритмические открытия и математические достижения
AlphaEvolve продемонстрировал свою способность к прорывным открытиям в основных алгоритмических проблемах. Наиболее заметно, он открыл новый алгоритм для умножения двух 4×4 комплексных матриц, используя только 48 скалярных умножений – превосходя результат Страсена 1969 года из 49 умножений и нарушая 56-летний теоретический потолок. AlphaEvolve достиг этого посредством передовых методов тензорного разложения, которые он эволюционировал на протяжении многих итераций, превосходя несколько современных подходов.
За пределами умножения матриц AlphaEvolve внес значительный вклад в математические исследования. Он был оценен на более чем 50 открытых проблемах в областях, таких как комбинаторика, теория чисел и геометрия. Он совпал с лучшими известными результатами в примерно 75% случаев и превысил их в около 20%. Эти успехи включали улучшения проблемы Эрдёша о минимальном перекрытии, более плотное решение проблемы касания в 11 измерениях и более эффективные геометрические конфигурации упаковки. Эти результаты подчеркивают его способность действовать как автономный математический исследователь – совершенствуя, итерируя и эволюционируя все более оптимальные решения без вмешательства человека.
2. Оптимизация на вычислительном стеке Google
AlphaEvolve также обеспечил осязаемые улучшения производительности на вычислительном стеке Google:
- В планировании центров обработки данных он открыл новый эвристический метод, который улучшил размещение задач, восстановив 0,7% ранее простаиваемых вычислительных ресурсов.
- Для ядер обучения Gemini AlphaEvolve разработал лучшую стратегию тейлинга для умножения матриц, что дало 23% ускорение ядра и 1% общее снижение времени обучения.
- В проектировании схем ТПУ он выявил упрощение арифметической логики на уровне RTL (уровень передачи регистров), подтвержденное инженерами и включенное в следующее поколение чипов ТПУ.
- Он также оптимизировал код, сгенерированный компилятором FlashAttention, редактируя промежуточные представления XLA, что сократило время вывода на GPU на 32%.
Вместе эти результаты подтверждают способность AlphaEvolve работать на нескольких уровнях абстракции – от символьной математики до низкоуровневой аппаратной оптимизации – и обеспечить реальные выигрыши в производительности.
- Эволюционное программирование: Парадигма ИИ, использующая мутацию, выбор и наследование для итеративного совершенствования решений.
- Супероптимизация кода: Автоматический поиск наиболее эффективной реализации функции – часто приводящий к удивительным, противоречивым улучшениям.
- Эволюция мета-подсказки: AlphaEvolve не только эволюционирует код, но и эволюционирует, как он общается с БЯМ, – позволяя самоусовершенствованию процесса кодирования.
- Потеря дискретизации: Регуляризационный член, побуждающий выводы соответствовать половинным или целым значениям, критически важным для математической и символической ясности.
- Потеря галлюцинации: Механизм, который вводит случайность в промежуточные решения, побуждая исследование и избегая локальных минимумов.
- Алгоритм MAP-Elites: Тип алгоритма качества-разнообразия, который поддерживает разнообразное население высокопроизводительных решений по размерам особенностей – позволяя прочной инновации.
Последствия для ИОИ и ИСИ
AlphaEvolve – это не просто оптимизатор – это взгляд в будущее, где интеллектуальные агенты могут демонстрировать творческую автономию. Способность системы формулировать абстрактные проблемы и разрабатывать свои собственные подходы к решению их представляет собой значительный шаг к искусственному общему интеллекту. Это выходит за рамки прогнозирования данных: это предполагает структурированное рассуждение, формирование стратегии и адаптацию к обратной связи – признаки интеллектуального поведения.
Его способность итеративно генерировать и совершенствовать гипотезы также сигнализирует об эволюции в том, как машины учатся. В отличие от моделей, которые требуют обширного направленного обучения, AlphaEvolve улучшает себя посредством цикла экспериментирования и оценки. Эта динамическая форма интеллекта позволяет ему ориентироваться в сложных пространствах проблем, отбрасывать слабые решения и возвышать более сильные без прямого человеческого надзора.
Выполняя и проверяя свои собственные идеи, AlphaEvolve функционирует как теоретик и экспериментатор. Он движется за пределы выполнения предопределенных задач и в область открытий, имитируя автономный научный процесс. Каждое предложенное улучшение тестируется, оценивается и повторно интегрируется – позволяя непрерывному совершенствованию на основе реальных результатов, а не статических целей.
Возможно, наиболее заметно, AlphaEvolve является ранним примером рекурсивного самоусовершенствования – где система ИИ не только учится, но и совершенствует компоненты самой себя. В нескольких случаях AlphaEvolve улучшил инфраструктуру обучения, которая поддерживает его собственные базовые модели. Хотя все еще ограниченная текущими архитектурами, эта способность задает прецедент. С более проблемами, сформулированными в оцениваемых средах, AlphaEvolve может масштабироваться к все более сложному и самооптимизирующемуся поведению – фундаментальному признаку искусственного сверхинтеллекта (ИСИ).
Ограничения и будущая траектория
Текущее ограничение AlphaEvolve заключается в его зависимости от автоматических функций оценки. Это ограничивает его полезность для проблем, которые можно формализовать математически или алгоритмически. Он пока не может работать осмысленно в областях, требующих неявного человеческого понимания, субъективной оценки или физического экспериментирования.
Однако будущие направления включают:
- Интеграцию гибридной оценки: объединение символьных рассуждений с человеческими предпочтениями и критикой на естественном языке.
- Развертывание в симуляционных средах, позволяющее воплощенное научное экспериментирование.
- Дистилляция эволюционированных выводов в базовые БЯМ, создание более способных и эффективных базовых моделей.
Эти траектории указывают на все более агентные системы, способные к автономному, высокорисковому решению проблем.
Заключение
AlphaEvolve – это глубокий шаг вперед – не только в инструментарии ИИ, но и в нашем понимании самого машинного интеллекта. Объединяя эволюционный поиск с рассуждениями БЯМ и обратной связью, он переопределяет, что машины могут автономно открыть. Это ранний, но значимый сигнал, что самоусовершенствующиеся системы, способные к реальному научному мышлению, больше не являются теоретическими.
Взглянув вперед, архитектура, лежащая в основе AlphaEvolve, может быть рекурсивно применена к самой себе: эволюционируя свои собственные оценщики, улучшая логiku мутаций, совершенствуя функции оценки и оптимизируя базовые конвейеры обучения для моделей, от которых он зависит. Этот рекурсивный цикл оптимизации представляет собой технический механизм для запуска к ИОИ, где система не просто выполняет задачи, но и совершенствует саму инфраструктуру, которая позволяет ее обучение и рассуждение.
Со временем, когда AlphaEvolve масштабируется на более сложные и абстрактные области – и когда человеческое вмешательство в процессе уменьшается – он может демонстрировать ускоряющиеся интеллектуальные выигрыши. Этот самоусиливающийся цикл итеративного совершенствования, применяемый не только к внешним проблемам, но и внутрь, к своей собственной алгоритмической структуре, является ключевым теоретическим компонентом ИОИ и всех его потенциальных выгод для общества. С его сочетанием творчества, автономии и рекурсии, AlphaEvolve может быть запомнен не просто как продукт DeepMind, но и как чертеж для первых真正 общих и самоэволюционирующих искусственных умов.












