Модели и платформы ИИ
Когда агенты ИИ начинают создавать ИИ: рекурсивный взрыв интеллекта, на который никто не готов

Десятилетиями искусственный интеллект развивался медленными, в основном линейными шагами. Исследователи создавали модели. Инженеры улучшали производительность. Организации развертывали системы для автоматизации конкретных задач. Каждое улучшение сильно зависело от человеческого проектирования и надзора. Этот шаблон сейчас ломается. Тихо, но решительно, системы ИИ переходят через порог, где они больше не являются просто инструментами, созданными людьми. Они становятся создателями самих себя.
Агенты ИИ начинают проектировать, оценивать и развертывать другие системы ИИ. Делая это, они создают обратные связи, где каждое поколение улучшает следующее. Этот сдвиг не объявляется драматическими заголовками. Он разворачивается через исследовательские статьи, инструменты разработчиков и корпоративные платформы. Однако, его последствия глубоки. Когда интеллект может рекурсивно улучшать себя, прогресс больше не следует человеческим временным рамкам или интуиции. Он ускоряется.
Эта статья исследует, как мы пришли к этому моменту, почему рекурсивный интеллект имеет значение, и почему общество гораздо менее готово к этому, чем должно быть. Взрыв интеллекта, когда-то философская идея, теперь стал конкретной инженерной задачей.
Эволюция взрыва интеллекта
Идея о том, что машина может улучшить свой собственный интеллект, предшествует современной вычислительной технике. В начале 1960-х годов британский математик И. Дж. Гуд представил концепцию “взрыва интеллекта“. Его рассуждение было следующим: если машина станет достаточно умной, чтобы улучшить свой собственный дизайн, даже немного, улучшенная версия будет лучше в улучшении следующей. Этот цикл может повторяться быстро, что приведет к росту, далеко превосходящему человеческое понимание или контроль. В то время это была философская мыслительная эксперимент, обсуждаемая больше в теории, чем на практике.
Несколько десятилетий спустя, идея получила техническую основу через работу компьютерного ученого Юргена Шмидхубера. Его предложение Машины Гёделя описало систему, которая могла переписать любую часть своего собственного кода, если она могла формально доказать, что изменение улучшит ее будущую производительность. В отличие от традиционных систем обучения, которые корректируют параметры внутри фиксированных архитектур, Машина Гёделя могла изменить свои собственные правила обучения. Хотя все еще теоретическая, эта работа переформулировала взрыв интеллекта как нечто, что можно изучать, формализовать и в конечном итоге построить.
Окончательный сдвиг от теории к практике произошел с появлением современных агентов ИИ. Эти системы не просто генерируют выходные данные в ответ на запросы. Они планируют, рассуждают, действуют, наблюдают результаты и корректируют поведение со временем. С появлением агентских архитектур, взрыв интеллекта перешел из философии в инженерию. Ранние эксперименты, такие как концепции Машины Гёделя Дарвина, намекают на системы, которые эволюционируют через итеративное самоулучшение. Что делает этот момент другим, так это рекурсия. Когда агент ИИ может создавать и совершенствовать других агентов, учась из каждой итерации, улучшение складывается.
Когда агенты ИИ начинают создавать ИИ
Два основных тренда стимулируют этот переход. Первый – это появление агентских систем ИИ. Эти системы преследуют цели в течение длительного времени, разбивают задачи на шаги, координируют инструменты и адаптируются на основе обратной связи. Они не являются статичными моделями. Они являются процессами.
Второй тренд – автоматизированное машинное обучение. Существуют системы, которые могут проектировать архитектуры, настраивать гиперпараметры, генерировать конвейеры обучения и даже предлагать новые алгоритмы с минимальным человеческим вмешательством. Когда агентское рассуждение сочетается с автоматизированным созданием моделей, ИИ получает возможность создавать ИИ.
Это уже не гипотетический сценарий. Автономные агенты, такие как AutoGPT, демонстрируют, как одна цель может запустить циклы планирования, выполнения, оценки и пересмотра. В исследовательских средах системы, такие как Sakana AI’s Scientist-v2 и DeepMind’s AlphaEvolve, показывают агентов, проектирующих эксперименты, предлагающих алгоритмы и совершенствующих решения через итеративную обратную связь. В поиске нейронной архитектуры системы ИИ уже обнаруживают структуры моделей, которые соперничают или превосходят сети, спроектированные людьми. Эти системы не просто решают проблемы. Они улучшают механизмы, используемые для решения проблем. Каждый цикл производит лучшие инструменты, которые позволяют лучше циклы.
Чтобы масштабировать этот процесс, исследователи и компании все чаще полагаются на архитектуры оркестраторов. Центральный мета-агент получает высокоуровневую цель. Он разбивает задачу на подзадачи, генерирует специализированные агенты для решения их, оценивает результаты с помощью реальных данных и интегрирует лучшие результаты. Плохие конструкции отбрасываются, а успешные укрепляются. Со временем оркестратор становится лучше в проектировании агентов самих себя.
Хотя точный график того, когда агенты ИИ полностью создадут и улучшат другие системы ИИ, остается неопределенным, текущие исследовательские траектории и оценки ведущих исследователей ИИ и практиков предполагают, что переход приближается быстрее, чем многие ожидают. Ранние, ограниченные версии этой возможности уже появляются в исследовательских лабораториях и корпоративных развертываниях, где агенты начинают проектировать, оценивать и совершенствовать другие системы с минимальным человеческим вмешательством.
Появление непредсказуемости
Рекурсивный интеллект вводит проблемы, с которыми традиционная автоматизация никогда не сталкивалась. Одна из этих проблем – непредсказуемость на уровне системы. Когда многие агенты взаимодействуют, их коллективное поведение может отклониться от намерений, стоящих за их индивидуальными конструкциями. Это явление известно как эмерджентное поведение.
Эмерджентность возникает не из-за одного неисправного компонента, а из взаимодействия между многими компетентными компонентами. Рассмотрим автоматизированные торговые системы. Каждый торговый агент может следовать рациональным правилам, предназначенным для максимизации прибыли в рамках ограничений. Однако, когда тысячи таких агентов взаимодействуют на высокой скорости, обратные связи могут образовываться. Реакция одного агента может запустить ответ другого, который может запустить ответ другого, пока система не дестабилизируется. Крахи рынка могут произойти без какого-либо одного агента, неисправного. Этот сбой не обусловлен злонамеренным намерением. Он является результатом несоответствия между локальной оптимизацией и системными целями. Те же самые динамики также могут применяться к другим областям.
Кризис многоагентной выравнивания
Традиционные исследования выравнивания ИИ фокусировались на выравнивании одной модели с человеческими ценностями. Вопрос был простым: как мы можем гарантировать, что эта одна система ведет себя так, как мы намереваемся? Этот вопрос становится значительно более сложным, когда система содержит десятки, сотни или тысячи взаимодействующих агентов. Выравнивание отдельных агентов не гарантирует выровненного поведения системы. Даже когда каждый компонент следует своим правилам, коллективный результат может быть вредным. Существующие методы безопасности не хорошо подходят для обнаружения или предотвращения этих сбоев.
Риски безопасности также умножаются. Скомпрометированный агент в многоагентной сети может отравить информацию, на которую полагаются другие агенты. Одно испорченное хранилище данных может распространить не выровненные поведения по всей системе. Уязвимости инфраструктуры, которые угрожают одному агенту, могут каскадно угрожать основным моделям. Поверхность атаки расширяется с каждым добавленным агентом.
Между тем, разрыв в управлении продолжает расширяться. Исследования Microsoft (MSFT ) и других организаций показали, что только около одной из десяти компаний имеет четкую стратегию управления идентификаторами и разрешениями агентов ИИ. Более чем сорок миллиардов автономных идентификаторов ожидается к концу этого года. Большинство из них работают с широким доступом к данным и системам, но без протоколов безопасности, применяемых к человеческим пользователям. Системы развиваются быстро. Механизмы надзора не успевают.
Основная мысль
ИИ вошел в фазу, где он может улучшать себя, создавая лучшие версии себя. Рекурсивный, агентно-ориентированный интеллект обещает необыкновенные выгоды, но он также вводит риски, которые масштабируются быстрее, чем человеческий надзор, управление и интуиция. Задача впереди не в том, чтобы остановить этот сдвиг, а в том, чтобы безопасность, выравнивание и подотчетность могли продвигаться с той же скоростью, что и возможность. Если они не будут, взрыв интеллекта переместится за пределы нашей способности его направлять.












