Взгляд Anderson
Когда роль ИИ расширяется, страдает кодирование настроений

Новое исследование показало, что кодирование настроений улучшается, когда люди дают инструкции, но ухудшается, когда это делает ИИ, причем лучшая гибридная установка сохраняет людей на первом месте, а ИИ – в качестве арбитра или судьи.
Новые исследования из США, изучающие, что происходит, когда системы ИИ допускаются к управлению кодированием настроений, а не просто выполняют инструкции людей, показали, что когда модели крупного языка (МКМ) берут на себя более крупную направляющую роль, результаты почти всегда хуже.
Хотя исследователи использовали GPT-5 от OpenAI в качестве основы для своих экспериментов по сотрудничеству человека и ИИ, они позже подтвердили, что и Claude Opus 4.5 от Anthropic, и Google Gemini 3 Pro подвергались тому же ухудшению кривой при росте ответственности, заявив, что “даже ограниченное участие человека постоянно улучшает производительность”:
‘[Люди] обеспечивают уникально эффективное общее руководство на протяжении итераций, [в то время как] руководство ИИ часто приводит к коллапсу производительности. Кроме того, мы обнаружили, что тщательное распределение ролей, сохраняющее людей в качестве руководства, а оценку – ИИ, может улучшить гибридную производительность.’
Чтобы обеспечить последовательное тестирование, которое могло бы быть оценено одинаково людьми и ИИ, был создан контролируемый экспериментальный каркас вокруг итеративной задачи кодирования, в которой ссылочное изображение – фотография кошки, собаки, тигра, птицы, слона, пингвина, акулы, зебры, жирафа или панды – должно было быть воссоздано с помощью масштабируемой векторной графики (SVG), и это воссоздание было оценено по сравнению с исходным изображением, от которого оно было получено:

И люди, и ИИ были показаны фотографическое ссылочное изображение вместе с ИИ-генерированным SVG-воссозданием, и были попросены оценить, насколько похожи два изображения на семибалльной шкале. Источник
В каждом раунде один агент давал общую естественную языковую инструкцию для руководства генератором кода, и другой решал, сохранить ли новую версию или вернуться к предыдущей – структурированный цикл, отражающий реальные совместные рабочие процессы.
На протяжении 16 экспериментов, в которых участвовали 604 участника и тысячи вызовов API, полностью человеко-ориентированные тестовые раунды были напрямую сравнены с полностью ИИ-ориентированными раундами в идентичных условиях.

Некоторые из различных решений, полученных в результате разных комбинаций процентов и типов сотрудничества человека и ИИ (взятых из более крупной иллюстрации в исходной статье, на которую мы ссылаемся читателя).
Хотя люди и ИИ показали одинаковый уровень производительности на начальном этапе тестов, их траектории расходились со временем: когда люди давали инструкции и принимали решения, оценки сходства увеличивались на протяжении итераций, с постоянным кумулятивным улучшением; но когда системы ИИ заполняли обе роли, производительность не показала постоянного улучшения и часто ухудшалась за раунды – даже несмотря на то, что использовалась одна и та же базовая модель для генерации кода, и ИИ имел доступ к той же информации, что и люди.
Эффект многословия
Результаты также показали, что инструкции людей обычно были короткими и ориентированными на действие, сосредоточенными на том, что нужно изменить дальше в текущем изображении; в то время как инструкции ИИ были намного длиннее и более описательными (фактор, который был параметризирован для GPT-5), детализирующими визуальные атрибуты, а не отдающими приоритет инкрементальному исправлению.
Но, как видно на графике ниже, введение строгих ограничений на инструкции ИИ не изменило эту тенденцию; даже при ограничении до 10, 20 или 30 слов цепочки ИИ все равно не показали улучшения со временем:

Оценки сходства на протяжении итераций для человеко-ориентированных раундов по сравнению с полностью ИИ-ориентированными раундами, ограниченными до 10, 20 или 30-словных инструкций. Очевидно, что сокращение подсказок ИИ не предотвращает наблюдаемый спад производительности при направлении ИИ и выборе.
Гибридные эксперименты сделали эту тенденцию яснее, показав, что добавление даже небольшого участия человека улучшало результаты по сравнению с полностью ИИ-ориентированными установками; однако производительность обычно ухудшалась, когда доля руководства ИИ увеличивалась.
Когда роли были разделены, оценка и выбор могли быть переданы ИИ с относительно небольшим ущербом для качества; но замена человеческого высокоуровневого руководства на руководство ИИ привела к заметному снижению производительности, что предполагает, что то, что имело значение, было не то, кто генерировал код, а кто устанавливал и поддерживал направление на протяжении итераций.
Авторы заключают:
‘На протяжении нескольких экспериментов человеко-ориентированное кодирование последовательно улучшалось на протяжении итераций, в то время как ИИ-ориентированное кодирование часто разрушалось, несмотря на доступ к одной и той же информации и аналогичным возможностям выполнения.
‘Это указывает на ключевые трудности современных систем ИИ в поддержании последовательного высокоуровневого направления на протяжении повторяющихся взаимодействий, необходимых для успешного кодирования настроений’
Новая статья называется Почему руководство человека имеет значение в совместном кодировании настроений, и исходит от семи исследователей из Корнеллского университета, Принстонского университета, Массачусетского технологического института и Нью-Йоркского университета.
Метод
Для экспериментов человеко-инструктор смотрел на GPT-5-генерированное животное-образец, вместе с последней связанной попыткой имитации SVG. Затем он писал естественную языковую инструкцию для руководства генератором кода к более близкому совпадению.
Таким образом, генератор производил новый SVG каждый раунд, обеспечивая итеративный цикл для проверки того, как эффект руководства накапливается со временем. Целями были десять GPT-5-генерированных изображений животных, охватывающих диапазон форм и текстур, чтобы улучшения или ошибки были легко обнаружимы:

Схема рабочего процесса кодирования настроений, использованного в исследовании. В А) человеко-инструктор смотрит на фотографическое ссылочное изображение вместе с лучшим SVG, сгенерированным на данный момент, и пишет естественную языковую инструкцию для генератора кода, чтобы следовать при производстве следующего SVG; в Б) человеко-селектор сравнивает новый SVG с предыдущим и выбирает, какая версия лучше соответствует ссылочному изображению, прежде чем передать выбранный SVG дальше для следующего раунда инструкции; и в В) независимые человеко-оценщики оценивают, насколько похож каждый сгенерированный SVG на свое ссылочное изображение, поставляя оценки, используемые для оценки общей производительности.
Человеко-селектор сравнивал каждый новый сгенерированный SVG с предыдущим и либо принимал, либо отклонял его, что сохраняло процесс, согласованный со ссылочным изображением на протяжении раундов. В этой базовой установке один и тот же человек выполнял обе роли.
Чтобы измерить качество, независимые человеко-оценщики оценивали, насколько похож каждый сгенерированный SVG на свое ссылочное изображение. На протяжении шестнадцати экспериментов 120 человек произвели 4800 оценок. Все эксперименты были проведены на PsyNet-фреймворке, портале, предназначенном для структурированных взаимодействий между людьми и системами ИИ.
Исследование набрало 604 носителей английского языка, в тестах, которые прошли через 4800 вызовов API для генерации кода и 5327 вызовов API для инструкции. Хотя GPT-5 был основной моделью, использованной для экспериментов, меньшие сравнительные партии были сделаны с Claude Opus 4.5 и Google Gemini 3 Pro, которые обрабатывали по 280 запросов.
Результаты
Были проведены тридцать раундов кодирования настроений, каждый из которых состоял из пятнадцати редактирований десяти ссылочных изображений. Для этих целей были выбраны 45 человеко-участников, каждый из которых служил как селектором, так и инструктором на протяжении десяти итераций в “человеко-ориентированных” раундах.
В каждом раунде один и тот же участник сначала выбирал между текущим и предыдущим SVG, а затем писал следующую инструкцию. Вторая версия теста заменила эти человеко-решения на вызовы API к GPT 5, сохраняя остальную часть установки неизменной. Во всех случаях роли инструктора и селектора подсказывали генератору кода простым языком.
Представительный пример многораундового кодирования настроений показывает, как процесс расходится со временем; когда люди действовали как селекторы и инструкторы, выход SVG улучшался постоянно на протяжении итераций, приближаясь к ссылочному изображению с каждым раундом:

Пример прогрессий для одного ссылочного изображения под человеко-ориентированным (вверху) и ИИ-ориентированным (внизу) кодированием настроений, показывающий постоянное улучшение на протяжении итераций с людьми в обеих ролях и застой или дрейф, когда обе роли выполняются ИИ.
Напротив, в ИИ-ориентированной версии ранние раунды иногда захватывали ключевые визуальные особенности, но позже попытки не смогли построить на этих успехах и в некоторых случаях отклонились от цели:

Окончательные выходные данные из окончательной итерации, сравнивающие человеко-ориентированные (вверху) и ИИ-ориентированные (внизу) цепочки, на одном и том же наборе ссылочных изображений. Человеко-ориентированные результаты более точно соответствуют исходным животным, а ИИ-ориентированные результаты демонстрируют видимые искажения или потерю ключевых особенностей.
Чтобы измерить возникающие тенденции количественно, окончательные изображения были показаны независимым человеко-оценщикам и оценены по сходству с ссылочными изображениями. На ранних этапах человеко-ориентированные и ИИ-ориентированные результаты были примерно одинаковыми; но к пятнадцатому раунду разница стала очевидной, с человеко-выбранными изображениями, оцененными намного ближе к целям. Со временем человеко-оценки постоянно росли, с самым большим относительным приростом над ИИ, достигающим 27,1%.

Средние оценки сходства на протяжении итераций для человеко-ориентированного и ИИ-ориентированного кодирования настроений, показывающие постоянное улучшение, когда люди действуют как селекторы и инструкторы, и постепенное ухудшение, когда обе роли выполняются GPT 5.
Чтобы убедиться, что возникающие тенденции не были результатом коллективной силы нескольких человеко-участников, исследователи набрали десять дополнительных людей, чтобы работать в одиночку, каждый из которых проводил три раунда самостоятельно – и результаты улучшились таким же постоянным образом, демонстрируя, что улучшения не были случайностью коллективного усилия.
Большая картина
Однако, если GPT-5 оценивал выходные данные самостоятельно, признал бы ли он, что человеко-результаты лучше? Человеческие и ИИ-оценки в целом двигались в одном направлении, поэтому модель могла различать хорошее и плохое, но постоянно оценивала ИИ-генерированные изображения выше, чем люди.
‘В частности, мы спросили, признают ли агенты ИИ, что их собственные выходные данные хуже, чем те, которые производятся людьми, или же они покажут предпочтение своим собственным творениям, что указало бы на потенциальную проблему согласования.’
Как оказалось, есть проблема согласования*:
‘Оценщики ИИ присваивали более высокие оценки ИИ-генерированным [выходным данным]. Эти результаты предполагают, что наблюдаемые различия в производительности могут возникать из-за несоответствия в представлениях между людьми и ИИ.’
При изучении того, как люди и ИИ формулируют свое руководство, расхождения стали очевидными в тестах. Как видно на рисунке ниже, и фокус, и длина являются предметами расхождения между ИИ и людьми:

Сравнение того, как люди и ИИ давали инструкции во время задачи кодирования. ‘А’ показывает, что люди пишут короткие, прямые инструкции, в то время как ИИ пишет длинные, подробные описания. ‘Б’ картографирует инструкции, показывая, что человеко-подсказки кластеризуются вместе, в то время как подсказки ИИ разделяются по животным. ‘В’ отслеживает, как ограничение длины инструкции ИИ не исправляет его плохие результаты со временем; и ‘Г’ иллюстрирует, что люди дают более разнообразные и сбалансированные инструкции, чем ИИ, даже когда вводятся ограничения на длину слов.
Инструкции людей, как правило, были короткими и по существу, предлагая ясные правки, которые можно было применить в целом к целям. Инструкции ИИ, с другой стороны, были плотными с описательными деталями и часто были вздутыми с описаниями затенения, текстур, освещения или анатомических деталей – описаниями, которые могут иметь смысл в изоляции, но не обеспечивают полезные следующие шаги для модели (и которые будут знакомы тем, кто осведомлен о проблемах МКМ с длиной контекста, т. е. способностью сохранять “большую картину” при разработке и росте проекта).
Чтобы увидеть, улучшит ли сокращенная вербозность производительность, GPT-5 был ограничен до 10, 20 или 30 слов на инструкцию; но даже эти сжатые инструкции не показали никакого улучшения (см. нижний правый угол графика выше).
Совместные усилия
Чтобы проверить, что происходит, когда люди и ИИ делят контроль, исследователи провели задачи кодирования с разными комбинациями входных данных человека и ИИ, варьирующихся от в основном человека до в основном ИИ.
Каждая гибридная смесь превзошла полный контроль ИИ, так что даже небольшое количество человеко-руководства улучшило результаты:

Гибридные установки кодирования с разными смесями человека и ИИ. (А) Показывает, как люди и ИИ по очереди были инструкторами и селекторами для каждого шага кодирования; (Б) показывает, что большее участие человека привело к более высокому качеству результатов, в то время как больший вход ИИ снизил оценки; и (В) изображает постоянное снижение качества окончательного выхода по мере уменьшения доли участия человека, подтверждая, что более последовательное человеко-направление привело к лучшим результатам.
Когда ИИ взял на себя больше процесса, производительность снизилась, с лучшими результатами, наблюдаемыми, когда люди вели большинство раундов, и худшими, когда ИИ вел большинство раундов. Ни одна из этих смешанных установок не смогла постоянно улучшаться с каждым новым раундом, что предполагает, что человеко-направление работает лучше всего, когда оно последовательное и постоянное, а не случайное.
Роль обратного
Исследование также изучило, имеет ли значение кто делает что в этих видах задач, и протестировало это. Ревизированное упражнение включало две задачи: один участник диктовал, как изменить изображение, и другой выбирал предпочтительную версию.
Когда обе роли выполняли люди, качество сохранялось; но когда человек давал инструкции и никто не выбирал между версиями, качество ухудшалось:

Тесты на разделение ролей в кодировании настроений: в (А) удаление роли селектора привело к худшей производительности, даже когда человек давал инструкции; в (Б) замена человека-селектора на ИИ слегка снизила качество, но не так сильно, как пропуск выбора entirely.
Когда ИИ был в charge, пропуск шага выбора не имел значения, поскольку его выходные данные оставались последовательными в любом случае; но когда люди давали инструкции и ИИ выбирал между результатами, качество оставалось близким к полностью человеко-ориентированной установке.
Обратное не сработало: иметь ИИ, дающего инструкции, в то время как люди выбирали выходные данные, привело к слабым результатам, что предполагает, что человеко-творческое руководство остается важным, в то время как задача выбора между вариантами может быть передана ИИ без значительных потерь.
Статья заключает:
‘[Высокоуровневое] генерирование идей и инструкция являются критическими вкладами человека, в то время как оценка и выбор могут часто быть делегированы ИИ без потери производительности.
‘Это предполагает практический принцип проектирования для гибридных систем: люди должны устанавливать направление, в то время как ИИ может поддерживать оценку и выполнение.’
Заключение
Остается быть увиденным, в какой степени улучшенные и/или увеличенные контекстные окна повлияют на производительность МКМ в задачах этого типа. День, когда “амнезия МКМ” перестанет быть повседневной проблемой сотрудничества человека и ИИ, может быть поводом как для празднования, так и для беспокойства, поскольку проблема, которую ИИ стремится решить, по сути, является людьми.
Тем не менее, работа авторов также показывает, что есть врожденные и критические расхождения между ИИ и людьми в отношении качества, которые могут быть определены потребителями как неотъемлемая человеческая концепция.
* Мое преобразование внутренних цитат авторов в гиперссылки.
Опубликовано впервые в пятницу, 13 февраля 2026 года












