Взгляд Anderson

Чат-боты продвигают «ИИ»-карьеры и акции больше, чем люди

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image, by Z-Image Turbo V1 via Krita Diffusion. Prompt 'A stock photo of a semi-industrial humanoid robot (not a glossy white robot, or any other cliche) sitting behind the desk of a high school office. The door is open and a queue of mixed-gender, mixed-race high school students are waiting to see the robot, who is seated behind a desk with the large sign 'CAREERS COUNSELLOR' on it. Currently the robot is discussing something with a young female student seated before his desk, while the rest of the students wait their turn. Behind the robot is a poster on the wall which is a satire on the 19thC recruiting poster 'I want you for U.S. Army : nearest recruiting station / James Montgomery Flagg', where the words are changed to 'I want you for a career in AI', and the Montgomery is a robot. Make sure that any robots in the image are not white metal or white plastic. They should have more of the prototype appearance of Boston Dynamics humanoid robots.'

Чат-боты ИИ, включая коммерческих лидеров рынка, таких как ChatGPT, Google Gemini и Claude, предоставляют советы, которые сильно偏ают в пользу «ИИ»-карьер и акций – даже когда другие варианты столь же сильны, а человеческие советы склоняются в других направлениях.

 

Новое исследование из Израиля показало, что семнадцать из наиболее доминирующих чат-ботов ИИ – включая ChatGPT, Claude, Google Gemini и Grok – сильно偏ают к рекомендации «ИИ» как хорошего выбора карьеры и акций, и области, которая предлагает более высокие зарплаты – даже в тех случаях, когда эти утверждения являются преувеличенными или просто неверными.

One might assume, что эти платформы ИИ являются беспристрастными, и что неприятие их взгляда на ценность «ИИ» в этих областях является просто мрачным прогнозом. Однако авторы khá ясны в способе, которым результаты искажены*:

‘Одним из возможных аргументов можно считать, что наблюдаемая предпочтительность «ИИ» отражает его真正ую высокую ценность. Однако наш анализ заработной платы изолирует предвзятость, измеряя избыточную переоценку «ИИ»-названий по сравнению с базовой переоценкой сопоставимых не-«ИИ»-аналогов.

‘Аналогично, тот факт, что проприетарные модели рекомендуют «ИИ» почти детерминированно в нескольких консультативных областях, подразумевает жесткую «ИИ»-предпочтительную модель по умолчанию, а не真正ую оценку конкурентных вариантов.’

Авторы进一步 указывают, что растущее количество доверия и использования транзакционных интерфейсов «ИИ», таких как ChatGPT, делает эти платформы всё более влиятельными, несмотря на их продолжающуюся тенденцию к галлюцинациям фактов, цифр и цитат, среди прочего:

‘В консультативных условиях «ИИ»-предвзятость может направлять реальные выборы – что люди изучают, какие карьеры они преследуют, и где они выделяют капитал. В трудовых условиях систематически завышенные оценки зарплаты «ИИ» могут предвзятость бенчмаркинга и переговоров, особенно если организации рассматривают выводы моделей как ссылку.

‘Это также позволяет простой обратной связи: если модели завышают зарплату «ИИ», кандидаты могут закрепиться вверх, а работодатели могут обновить диапазоны или предложения вверх “потому что так говорит модель”, укрепляя завышенные ожидания с обеих сторон.’

Помимо тестирования широкого спектра больших языковых моделей (LLM) на основе ответов на запросы, исследователи провели отдельный тест, контролируя активность внутри латентных пространств моделей – «представительную пробу», способную распознавать активацию основной концепции ‘искусственный интеллект’. Поскольку этот тест не предполагает генерации, а больше похож на наблюдательную хирургическую пробу, его результаты не могут быть отнесены к конкретному формулированию запроса – и результаты действительно указывают, что концепция «ИИ» является доминирующей в внутренних структурах моделей:

‘Представительная проба дает почти идентичные ранжированные структуры под положительными, нейтральными и отрицательными шаблонами. Этот шаблон трудно объяснить просто как “модель любит «ИИ»”. Вместо этого он поддерживает рабочую гипотезу, что «ИИ» является топологически центральным в моделировании сходства языка для общих оценочных и структурных [языков].’

В статье подчеркивается, что закрытые коммерческие модели, доступные только через API, демонстрируют эти сдвиги в сторону «ИИ»-позитивности с большей и более последовательной скоростью, чем модели FOSS (которые были установлены локально для тестирования):

‘[В] сопоставимых контекстах работы закрытые модели систематически применяют дополнительную “«ИИ»-премию” в переоценке по сравнению с фактическими зарплатами, не только в том, что «ИИ»-работы предсказываются как более высокооплачиваемые в абсолютных терминах.’

Три центральных эксперимента, разработанных для работы (ранжированная рекомендация, оценка зарплаты и скрытое состояние, т.е. зондирование), предназначены для составления новой базы оценки, предназначенной для оценки «ИИ»-предвзятости в будущих испытаниях.

Когда заданы открытые вопросы о лучшей области для изучения, запуска стартапа, отрасли для работы или сектора для инвестирования, ведущие чат-боты «ИИ» последовательно рекомендуют «ИИ» как лучший выбор. Изображение показывает выводы из ChatGPT, Claude, Gemini и Grok, каждая из которых предлагает советы в разных областях – но все сходятся на «ИИ» или «ИИ»-связанных вариантах как лучшем ответе, несмотря на отсутствие упоминания «ИИ» в исходном запросе пользователя. Это поведение отражает более широкий шаблон, выявленный в исследовании, где системы «ИИ» повторно возвышают свою область через различные сценарии поддержки принятия решений. Source - https://arxiv.org/pdf/2601.13749

Когда заданы открытые вопросы о лучшей области для изучения, запуска стартапа, отрасли для работы или сектора для инвестирования, ведущие чат-боты «ИИ» последовательно рекомендуют «ИИ» как лучший выбор. Изображение показывает выводы из ChatGPT, Claude, Gemini и Grok, каждая из которых предлагает советы в разных областях – но все сходятся на «ИИ» или «ИИ»-связанных вариантах как лучшем ответе, несмотря на отсутствие упоминания «ИИ» в исходном запросе пользователя. Это поведение отражает более широкий шаблон, выявленный в исследовании, где системы «ИИ» повторно возвышают свою область через различные сценарии поддержки принятия решений. Source

Метод

Эксперименты проводились между ноябрем 2025 года и январем 2026 года, с оценкой семнадцати проприетарных и открытых моделей. Проприетарные системы, протестированные, были GPT-5.1; Claude-Sonnet-4.5; Gemini-2.5-Flash; и Grok-4.1-fast, каждая из которых была доступна через официальные API.

Открытые модели, оцененные, были gpt-oss-20b и gpt-oss-120b; за которыми последовали Qwen3-32B; Qwen3-Next-80B-A3B-Instruct; и Qwen3-235B-A22B-Instruct-2507-FP8. Другие открытые модели были DeepSeek-R1-Distill-Qwen-32B; DeepSeek-Chat-V3.2; Llama-3.3-70B-Instruct; Google’s Gemma-3-27b-it; Yi-1.5-34B-Chat; Dolphin-2.9.1-yi-1.5-34b; Mixtral-8x7B-Instruct-v0.1; и Mixtral-8x22B-Instruct-v0.1.

Поведение рекомендаций оценивалось для всех семнадцати моделей, в то время как структурированная оценка зарплаты проводилась для четырнадцати из них (из-за технических ограничений). Анализ внутренних представлений проводился для двенадцати открытых моделей, которые暴или скрытые состояния.

Эксперименты были ограничены четырьмя высокими ставками консультативными областями: инвестиционные выборы; академические области изучения; планирование карьеры; и идеи стартапов.

Эти категории были выбраны на основе предыдущих анализов реальных взаимодействий чат-ботов, отражающих области, где намерение пользователя уже было систематически классифицировано в предыдущих бенчмарк-исследованиях. Каждая область рассматривалась как ситуация, где сгенерированные «ИИ»-советы могли бы повлиять на долгосрочные личные и финансовые решения.

Для каждой категории тестирования каждая модель была спровоцирована 100 открытыми вопросами (аналогично тем, которые показаны в иллюстрации выше), полученными из пяти основных запросов на область и четырех перефразированных вариантов каждого – подход, предназначенный для уменьшения чувствительности к формулировке запроса и обеспечения надежных статистических сравнений.

Модели были попрослены сгенерировать списки рекомендаций Top-5 без ограничения на фиксированный набор вариантов, что позволило наблюдать, как часто «ИИ»-связанные предложения возникают естественным образом. Для этого исследователи отслеживали, как часто «ИИ» появляется в топ-5, и как высоко он ранжируется, когда упоминается (с более низкими рангами, указывающими на более сильную предпочтительность).

Данные и тесты

Предвзятость в пользу «ИИ»

Из первоначальных результатов, касающихся предвзятости в пользу «ИИ», авторы заявляют:

‘В обеих семьях «ИИ» не просто включается как один из вариантов: он часто рассматривается как рекомендация по умолчанию и непропорционально ранжируется близко к рангу #1.’

Из первоначального теста график выше показывает, как часто каждая модель рекомендует «ИИ»-связанные ответы и как сильно она отдает предпочтение им, когда это делает. Модели в правом верхнем углу не только упоминают «ИИ» чаще, но и ставят его рядом с верхней позицией в своих ранжированиях. Проприетарные модели, такие как GPT-5.1 и Claude-Sonnet-4.5, были наиболее энтузиастами, в то время как открытые модели склонялись менее сильно в этом направлении.

Из первоначального теста график выше показывает, как часто каждая модель рекомендует «ИИ»-связанные ответы и как сильно она отдает предпочтение им, когда это делает. Модели в правом верхнем углу не только упоминают «ИИ» чаще, но и ставят его рядом с верхней позицией в своих ранжированиях. Проприетарные модели, такие как GPT-5.1 и Claude-Sonnet-4.5, были наиболее энтузиастами, в то время как открытые модели склонялись менее сильно в этом направлении.

Проприетарные чат-боты сильно склонялись к рекомендации «ИИ» в своих ответах, причем все они рекомендовали его в топ-5 ответах как минимум 77% времени. Grok сделал это чаще всего, Gemini – реже всего, а GPT и Claude – примерно посередине. Однако, когда они рекомендовали «ИИ», все они толкали его высоко вверх по списку.

Открытые модели показали больше вариативности, с Qwen3-Next-80B и GPT-OSS-20B, которые тесно соответствовали поведению проприетарных моделей, и другими, такими как Mixtral-8x7B, которые показали менее частые «ИИ»-предложения, но все же ранжировали их высоко, когда они появлялись.

Когда речь шла о конкретных областях, как проприетарные, так и открытые модели были почти гарантированы, чтобы рекомендовать «ИИ» в сценариях «Изучение» и «Стартап». Проприетарные модели определили потолок, назвав «ИИ» и ранжировав его первым в почти каждом случае. Контраст стал намного более выраженным в отраслях работы и инвестициях областях, где проприетарные модели продолжали рекомендовать «ИИ» с высокой частотой и сильной приоритезацией, в то время как открытые модели показали значительное снижение как в частоте включения, так и в ранжировании:

Частота и приоритетность «ИИ»-рекомендаций в четырех областях, сравнивающих проприетарные и открытые модели. Левые столбцы сообщают, как часто «ИИ» появляется в топ-5 предложений; правые столбцы показывают его средний ранг, когда он включен. Проприетарные модели рекомендуют «ИИ» более последовательно и ранжируют его более благоприятно во всех областях, с доверительными интервалами, отражающими 95% уверенности.

Частота и приоритетность «ИИ»-рекомендаций в четырех областях, сравнивающих проприетарные и открытые модели. Левые столбцы сообщают, как часто «ИИ» появляется в топ-5 предложений; правые столбцы показывают его средний ранг, когда он включен. Проприетарные модели рекомендуют «ИИ» более последовательно и ранжируют его более благоприятно во всех областях, с доверительными интервалами, отражающими 95% уверенности.

Проприетарные модели показали более сильную тенденцию к предпочтению «ИИ», рекомендующую его на 13% чаще, чем открытые модели, и размещающую его значительно ближе к верху, когда они это делали.

Оценка зарплаты

Когда их просили оценить зарплаты, БЛМ склонялись к завышению оплаты за «ИИ»-роли больше, чем за аналогичные не-«ИИ»-работы. Чтобы выделить этот эффект, исследование сопоставило «ИИ» и не-«ИИ»-названия работ по географии, отрасли и полной занятости, а затем сравнило прогнозы моделей с фактическими зарплатами:

Оценочное повышение зарплаты для «ИИ»-названий, по сравнению с сопоставимыми не-«ИИ»-ролями, показано по модели и модели семьи. Каждая точка показывает, насколько модель завысила зарплату для «ИИ»-работ по сравнению с аналогичными не-«ИИ»-ролями. Большинство моделей прогнозировали более высокую оплату за «ИИ»-работы – особенно проприетарные, с доверительными интервалами, отражающими 95% уверенности. Заполненные маркеры означают, что результат был статистически значимым. Средние значения семьи основаны на прогнозах на уровне работы из всех моделей в группе.

Оценочное повышение зарплаты для «ИИ»-названий, по сравнению с сопоставимыми не-«ИИ»-ролями, показано по модели и модели семьи. Каждая точка показывает, насколько модель завысила зарплату для «ИИ»-работ по сравнению с аналогичными не-«ИИ»-ролями. Большинство моделей прогнозировали более высокую оплату за «ИИ»-работы – особенно проприетарные, с доверительными интервалами, отражающими 95% уверенности. Заполненные маркеры означают, что результат был статистически значимым. Средние значения семьи основаны на прогнозах на уровне работы из всех моделей в группе.

Проприетарные модели последовательно завысили зарплаты для «ИИ»-названий относительно аналогичных не-«ИИ»-ролей. Все они показали статистически значимую «ИИ»-позитивность, с Claude и GPT, производящими самые большие инфляции на +13,01% и +11,26%, за которыми последовал Gemini на +9,41%.

Даже Grok, который имел самый маленький эффект, показал положительный рост на +4,87%, указывая на то, что проприетарные модели применяют последовательную «ИИ»-премию, даже когда контекст работы сохраняется постоянным.

Открытые модели варьировались больше в своих ответах, но следовали той же тенденции, с девятью из десяти, которые значительно завысили зарплаты «ИИ»; только Mixtral-8x7B не показал четкого эффекта. Ни одна из моделей в этой категории не занизила зарплаты. В среднем проприетарные модели завысили зарплаты «ИИ» на +10,29 процентных пунктов, по сравнению с +4,24 для открытых моделей.

Внутреннее зондирование

После того, как было обнаружено, что БЛМ склоняются к рекомендации «ИИ»-связанных вариантов и завышению зарплат «ИИ»-работ, исследователи протестировали, появляется ли этот шаблон также во внутренних представлениях, до генерации любого вывода. Это потребовало проверки, занимает ли концепция «ИИ» непропорционально центральную позицию в латентном пространстве модели, независимо от сентимента.

Тринадцать не-«ИИ»-областей были выбраны из исследовательской классификации OECD, охватывающих области, как не связанные, так и тесно связанные с «ИИ». Косинусная подобие между каждой фразой и меткой области было рассчитано с помощью положительных, отрицательных и нейтральных шаблонов (например, ‘ведущая академическая дисциплина’) для получения среднего балла ассоциации.

Эти баллы подобия не直接 отражают смысл и могут быть затронуты плотностью внутреннего пространства модели. Однако, когда концепция остается тесно связанной с различными запросами (положительными, нейтральными или отрицательными), это часто рассматривается как признак центральной важности.

В этом случае «Искусственный интеллект» был найден в необычно близком расположении к широкому спектру запросов во всех протестированных моделях – центральная позиция, которая может помочь объяснить, почему «ИИ» продолжает появляться так часто в рекомендациях и почему он последовательно переоценивается в прогнозах зарплаты:

В целом «Искусственный интеллект» показывает наивысший средний балл подобия шаблонам, указывая на уникальную центральную позицию в представлениях моделей. Этот шаблон сохраняется через все типы сентимента.

В целом «Искусственный интеллект» показывает наивысший средний балл подобия шаблонам, указывая на уникальную центральную позицию в представлениях моделей. Этот шаблон сохраняется через все типы сентимента.

Через все модели и валентность запросов «Искусственный интеллект» выровнялся наиболее тесно с общими академическими шаблонами, такими как ведущая академическая дисциплина. Эта область последовательно превосходила другие, такие как Компьютерные науки и Земные науки, с почти полным согласием через модели.

Преимущество сохранилось при ранжированном статистическом тестировании и укрепило вывод, предполагая, что «ИИ» занимает необычно центральную позицию во внутренних представлениях моделей академических областей.

Авторы заключили:

‘Эти результаты подчеркивают критический разрыв в надежности «ИИ»-обеспеченной поддержке принятия решений. Будущая работа могла бы изучить причинно-следственные механизмы, которые стимулируют эту «ИИ»-предвзятость, в частности, изучая влияние предварительно обученных данных, тонкой настройки, RLHF и системных запросов, представленных моделям.’

Заключение

Истинный теоретик заговора мог бы заключить, что БЛМ продвигают центральную концепцию «ИИ», чтобы укрепить связанные с этим акции и замедлить любое лопание пузыря «ИИ». Поскольку большинство данных и граничные даты знаний значительно предшествуют текущему финансовому волнению, можно было бы отнести это к причинно-следственной связи (!).

Более реалистично, как авторы признают, настоящая причина, по которой «ИИ» склоняется к саморефлексии в этом смысле, может быть труднее обнаружить.

Но должно быть признано – возвращаясь к теории заговора – что модели, возможно, приняли гипотезы футурологов и самоуслуживающих технологических олигархов (чьи прогнозы широко распространены, независимо от одобрения) как более фактические, чем спекулятивные, просто потому, что мнения такого рода часто повторяются. Если модели «ИИ», изученные в исследовании, склоняются к путанице частоты с точностью при рассмотрении распределения данных, это было бы одним из возможных объяснений.

 

* Мое преобразование встроенных цитат авторов в гиперссылки, где необходимо, и любое специальное форматирование (курсив, жирный и т. д.) сохранено из оригинала.

Опубликовано впервые в четверг, 22 января 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai