Лидеры мнений

Когда ИИ думает как люди: Изучение разума Больших Языковых Моделей и Агентов

mm
Добавьте Unite.AI в избранные источники в Google

Сегодня Большие Языковые Модели (LLM) и агенты учатся, анализируют и принимают решения способами, которые могут стереть границу между их алгоритмическим “думанием” и человеческим разумом. Подходы, на которых они построены, уже имитируют наши когнитивные процессы, и масштаб их обучения превосходит человеческий опыт на несколько порядков. Это вызывает вопрос: создаем ли мы инструмент, который расширяет наши возможности, или мы даем начало новому типу разума, последствия которого еще невозможно предсказать?

Как думают модели

Важно различать понятия LLM и агентов. Чтобы провести аналогию с компьютером, LLM можно сравнить с одним из его компонентов, например, процессором. Агент, однако, является整个 системой, “материнской платой”, к которой подключены различные модули: память, видеокарта и сеть. Аналогично, агент является сложной системой, которая может включать одну или несколько LLM, дополненных механизмами принятия решений и инструментами для взаимодействия с внешней средой.

Если мы рассмотрим работу единственной LLM, все сводится к сопоставлению шаблонов. Однако, когда агент объединяет несколько LLM, мы можем сказать, что он “думает”, хотя этот процесс все еще построен на шаблонах. Агент конструирует логику взаимодействия между моделями: например, одна LLM анализирует задачу, и на основе этого анализа агент определяет, какое действие должна выполнить другая LLM.

Человеческое мышление работает подобным образом: мы полагаемся на накопленные знания и шаблоны, выбираем их в нужный момент, обрабатываем и формулируем выводы. Этот процесс называется рассуждением.

ChatGPT, как и человек, имеет два типа памяти: кратковременную и долговременную. Разница в том, что у людей доступ к этим уровням памяти более сложен и не всегда линеен.

Кратковременная память – это информация, с которой мы сейчас работаем. Для человека это может быть то, что вы сказали пять минут назад: он может вспомнить это или нет. GPT, однако, всегда учитывает все, что находится в его “контекстном окне” – он не может пропустить или проигнорировать эти данные.

Долговременная память у людей состоит из воспоминаний, которые не всегда активны и могут появиться только при определенных триггерах: детском воспоминании, травме или, например, работе с психологом. GPT имеет подобную логику: он не “вспоминает” информацию самостоятельно, если она не явно активирована. Например, инструкция типа “Никогда не спрашивайте меня этот вопрос снова” или “Всегда обращайтесь ко мне официально” может быть сохранена в долговременной памяти и применена во время каждой сессии.

Другим примером долговременной памяти являются сохраненные документы. Предположим, вы загрузили в GPT инструкцию по проведению маркетингового исследования. Модель может сохранить ее в памяти, но это не означает, что она будет ссылаться на этот документ при каждом вопросе. Если вы спросите: “Можете ли вы осветить луну фонариком?” GPT проигнорирует инструкцию. Но если запрос содержит ключевые слова, соответствующие тексту документа, модель может “вспомнить” его.

Этот механизм реализуется с помощью RAG (Retrieval-Augmented Generation), подхода, при котором модель получает доступ к сохраненной информации, срабатывающей на соответствующие сигналы через векторные базы данных.

Таким образом, можно сказать, что модель действительно имеет память, но она функционирует по другой, более формализованной логике, отличной от человеческой памяти.

Почему разговор с ИИ иногда кажется терапевтическим, а в другие разы холодным и роботизированным?

Современные языковые модели чрезвычайно велики: они хранят огромное количество данных, знаний и контекста. Все эта информация организована в так называемые “кластеры”, тематические и семантические области. Модель была обучена на разнообразных источниках, от художественной литературы и научных статей до комментариев на YouTube.

Когда вы взаимодействуете с ИИ, ваш запрос (промпт) эффективно направляет модель на определенный кластер.

Например, если вы напишете: “Вы – юрист по недвижимости в Нью-Йорке с 20-летним опытом, помогите мне купить квартиру”, модель активирует несколько кластеров одновременно: юрист → Нью-Йорк → недвижимость. В результате вы получаете связный, актуальный и реалистичный ответ, как будто вы действительно консультируетесь с опытным профессионалом.

Если запрос касается более личных или философских тем, таких как саморазвитие или эмоции, модель “переключается” на другие кластеры, такие как психология, философия или внутренняя работа. В этом случае ее ответы могут показаться удивительно человеческими и даже терапевтическими.

Однако с слишком общими или расплывчатыми формулировками модель “заблудится” в своей кластерной структуре и даст стандартный ответ, формальный, отстраненный и лишенный эмоциональной тональности.

Стиль и глубина ответа ИИ зависят от того, на какой кластер вы направляете его с помощью своего запроса.

Философия обучения моделей и RLHF

Искусственный интеллект имеет различные подходы к обучению. Это не столько философия, сколько стратегия.

Классический вариант – обучение с учителем, когда модели предоставляется вопрос и правильный ответ. Она учится, наблюдая, что считается правильным, и затем воспроизводит подобные решения в будущем.

Но другой подход – RLHF (Reinforcement Learning from Human Feedback). Это другой стиль: модель пробует что-то, получает “награду” за успешные действия и корректирует свое поведение. Постепенно она развивает эффективную стратегию.

RLHF можно сравнить с процессом превращения сырого материала в готовый продукт. Чтобы сделать модель, удобную для использования, требуется огромная работа с обратной связью человека.

Представьте, что я показываю вам объект без прямого названия. Вы колеблетесь: “Это лигет или держатель карт?” Я даю только намеки: “Ближе”, “Дальше”, “60% да”. После сотен таких итераций вы угадываете: “Ах, это кошелек”.

LLM обучаются подобным образом. Люди, аннотаторы и профессионалы в целом оценивают: этот ответ хороший, этот плохой, и присваивают оценки. Компании, такие как Keymakr, которые специализируются на высококачественной аннотации и валидации данных, играют ключевую роль в этом процессе. Обратная связь также поступает от обычных пользователей: лайки, жалобы и реакции. Модель интерпретирует эти сигналы, формируя поведенческие паттерны.

Как выглядит обучение моделей на практике

Ярким примером является эксперимент OpenAI по обучению агентов с помощью метода подкрепления в игре “Прятки”.

В нем участвовали две команды: “искатели” (красные) и “прятавшиеся” (синие). Правила были простыми: если искатель поймает прятавшегося, он получает очко; если нет, он теряет одно. Первоначально агенты имели только базовые физические способности – бег и прыжки – без каких-либо предустановленных стратегий.

Сначала искатели действовали хаотично, и поимка противников происходила случайно. Но после миллионов итераций их поведение эволюционировало. Прятавшиеся начали использовать окружающие объекты, чтобы блокировать двери и строить барьеры. Эти навыки появились без прямой программирования, исключительно через повторяющиеся попытки и награды за успех.

В ответ искатели начали использовать прыжки, способность, доступную с самого начала, но ранее игнорируемую. После серии неудач случайное использование прыжков раскрыло их тактическое значение. Затем прятавшиеся еще больше усложнили свою оборону, удаляя объекты из поля зрения искателей и строя более надежные укрытия.

Эксперимент показал, что через миллиарды циклов проб, ошибок, наград и штрафов может сформироваться сложное кооперативное поведение без вмешательства разработчиков. Более того, агенты начали действовать в координации, даже хотя механизмы коммуникации не были запрограммированы, просто потому, что командная работа оказалась более эффективной.

То же самое относится и к большим языковым моделям. Невозможно запрограммировать все сценарии: существует слишком много ситуаций и слишком большая вариативность в мире. Поэтому мы не учим модель фиксированным правилам; мы учим ее, как учиться.

Это ценность RLHF. Без нее LLM и агенты остаются просто библиотекой текстов. С ней они становятся разговорными партнерами, способными адаптироваться, исправлять себя и, по сути, эволюционировать.

Что дальше?

Многие задумываются, могут ли разработки LLM и агентов привести к нежелательным или даже опасным последствиям.

Важно понять, что то, что мы видим сегодня, – это не даже MVP, а просто прототип.

Настоящая революция не будет заключаться в том, чтобы помочь написать красивое письмо или перевести его на французский. Это мелочи. Основное направление – автоматизация микрозадач и рутинных процессов, оставляющая людям только действительно творческие, интеллектуальные задачи или время для отдыха.

Настоящие инновации сосредоточены вокруг агентов, систем, которые могут самостоятельно думать, действовать и принимать решения вместо человека. Именно здесь компании, такие как OpenAI, Google, Meta и другие, сосредотачивают свои усилия сегодня.

Большие языковые модели – это только основа. Будущее лежит в агентах, обученных жить в динамическом мире, получать обратную связь и адаптироваться к изменениям.

Михаил Абрамов является основателем и генеральным директором Introspector, привнося более 15 лет опыта в области программной инженерии и компьютерного зрения AI-систем для создания инструментов маркировки предприятия.

Михаил начал свою карьеру в качестве программного инженера и менеджера по исследованиям и разработкам, создавая масштабируемые системы данных и управляя межфункциональными инженерными командами. До 2025 года он занимал должность генерального директора Keymakr, компании, предоставляющей услуги по маркировке данных, где он был пионером в области человеческих циклов, передовых систем контроля качества и индивидуальных инструментов для поддержки крупномасштабных потребностей компьютерного зрения и автономности.

Он имеет степень бакалавра в области компьютерных наук и имеет опыт в области инженерии и творческих искусств, что позволяет ему подходить к решению сложных проблем с междисциплинарной точки зрения. Михаил живет на пересечении технологических инноваций, стратегического лидерства продукта и реального воздействия, продвигая вперед следующий рубеж автономных систем и интеллектуальной автоматизации.