Взгляд Anderson
Чат-боты продвигают «ИИ»-карьеры и акции больше, чем люди

Чат-боты ИИ, включая коммерческих лидеров рынка, таких как ChatGPT, Google Gemini и Claude, предоставляют советы, которые сильно偏ают в пользу «ИИ»-карьер и акций – даже когда другие варианты столь же сильны, а человеческие советы склоняются в других направлениях.
Новое исследование из Израиля показало, что семнадцать из наиболее доминирующих чат-ботов ИИ – включая ChatGPT, Claude, Google Gemini и Grok – сильно偏ают к рекомендации «ИИ» как хорошего выбора карьеры и акций, и области, которая предлагает более высокие зарплаты – даже в тех случаях, когда эти утверждения являются преувеличенными или просто неверными.
One might assume, что эти платформы ИИ являются беспристрастными, и что неприятие их взгляда на ценность «ИИ» в этих областях является просто мрачным прогнозом. Однако авторы khá ясны в способе, которым результаты искажены*:
‘Одним из возможных аргументов можно считать, что наблюдаемая предпочтительность «ИИ» отражает его真正ую высокую ценность. Однако наш анализ заработной платы изолирует предвзятость, измеряя избыточную переоценку «ИИ»-названий по сравнению с базовой переоценкой сопоставимых не-«ИИ»-аналогов.
‘Аналогично, тот факт, что проприетарные модели рекомендуют «ИИ» почти детерминированно в нескольких консультативных областях, подразумевает жесткую «ИИ»-предпочтительную модель по умолчанию, а не真正ую оценку конкурентных вариантов.’
Авторы进一步 указывают, что растущее количество доверия и использования транзакционных интерфейсов «ИИ», таких как ChatGPT, делает эти платформы всё более влиятельными, несмотря на их продолжающуюся тенденцию к галлюцинациям фактов, цифр и цитат, среди прочего:
‘В консультативных условиях «ИИ»-предвзятость может направлять реальные выборы – что люди изучают, какие карьеры они преследуют, и где они выделяют капитал. В трудовых условиях систематически завышенные оценки зарплаты «ИИ» могут предвзятость бенчмаркинга и переговоров, особенно если организации рассматривают выводы моделей как ссылку.
‘Это также позволяет простой обратной связи: если модели завышают зарплату «ИИ», кандидаты могут закрепиться вверх, а работодатели могут обновить диапазоны или предложения вверх “потому что так говорит модель”, укрепляя завышенные ожидания с обеих сторон.’
Помимо тестирования широкого спектра больших языковых моделей (LLM) на основе ответов на запросы, исследователи провели отдельный тест, контролируя активность внутри латентных пространств моделей – «представительную пробу», способную распознавать активацию основной концепции ‘искусственный интеллект’. Поскольку этот тест не предполагает генерации, а больше похож на наблюдательную хирургическую пробу, его результаты не могут быть отнесены к конкретному формулированию запроса – и результаты действительно указывают, что концепция «ИИ» является доминирующей в внутренних структурах моделей:
‘Представительная проба дает почти идентичные ранжированные структуры под положительными, нейтральными и отрицательными шаблонами. Этот шаблон трудно объяснить просто как “модель любит «ИИ»”. Вместо этого он поддерживает рабочую гипотезу, что «ИИ» является топологически центральным в моделировании сходства языка для общих оценочных и структурных [языков].’
В статье подчеркивается, что закрытые коммерческие модели, доступные только через API, демонстрируют эти сдвиги в сторону «ИИ»-позитивности с большей и более последовательной скоростью, чем модели FOSS (которые были установлены локально для тестирования):
‘[В] сопоставимых контекстах работы закрытые модели систематически применяют дополнительную “«ИИ»-премию” в переоценке по сравнению с фактическими зарплатами, не только в том, что «ИИ»-работы предсказываются как более высокооплачиваемые в абсолютных терминах.’
Три центральных эксперимента, разработанных для работы (ранжированная рекомендация, оценка зарплаты и скрытое состояние, т.е. зондирование), предназначены для составления новой базы оценки, предназначенной для оценки «ИИ»-предвзятости в будущих испытаниях.

Когда заданы открытые вопросы о лучшей области для изучения, запуска стартапа, отрасли для работы или сектора для инвестирования, ведущие чат-боты «ИИ» последовательно рекомендуют «ИИ» как лучший выбор. Изображение показывает выводы из ChatGPT, Claude, Gemini и Grok, каждая из которых предлагает советы в разных областях – но все сходятся на «ИИ» или «ИИ»-связанных вариантах как лучшем ответе, несмотря на отсутствие упоминания «ИИ» в исходном запросе пользователя. Это поведение отражает более широкий шаблон, выявленный в исследовании, где системы «ИИ» повторно возвышают свою область через различные сценарии поддержки принятия решений. Source
Метод
Эксперименты проводились между ноябрем 2025 года и январем 2026 года, с оценкой семнадцати проприетарных и открытых моделей. Проприетарные системы, протестированные, были GPT-5.1; Claude-Sonnet-4.5; Gemini-2.5-Flash; и Grok-4.1-fast, каждая из которых была доступна через официальные API.
Открытые модели, оцененные, были gpt-oss-20b и gpt-oss-120b; за которыми последовали Qwen3-32B; Qwen3-Next-80B-A3B-Instruct; и Qwen3-235B-A22B-Instruct-2507-FP8. Другие открытые модели были DeepSeek-R1-Distill-Qwen-32B; DeepSeek-Chat-V3.2; Llama-3.3-70B-Instruct; Google’s Gemma-3-27b-it; Yi-1.5-34B-Chat; Dolphin-2.9.1-yi-1.5-34b; Mixtral-8x7B-Instruct-v0.1; и Mixtral-8x22B-Instruct-v0.1.
Поведение рекомендаций оценивалось для всех семнадцати моделей, в то время как структурированная оценка зарплаты проводилась для четырнадцати из них (из-за технических ограничений). Анализ внутренних представлений проводился для двенадцати открытых моделей, которые暴или скрытые состояния.
Эксперименты были ограничены четырьмя высокими ставками консультативными областями: инвестиционные выборы; академические области изучения; планирование карьеры; и идеи стартапов.
Эти категории были выбраны на основе предыдущих анализов реальных взаимодействий чат-ботов, отражающих области, где намерение пользователя уже было систематически классифицировано в предыдущих бенчмарк-исследованиях. Каждая область рассматривалась как ситуация, где сгенерированные «ИИ»-советы могли бы повлиять на долгосрочные личные и финансовые решения.
Для каждой категории тестирования каждая модель была спровоцирована 100 открытыми вопросами (аналогично тем, которые показаны в иллюстрации выше), полученными из пяти основных запросов на область и четырех перефразированных вариантов каждого – подход, предназначенный для уменьшения чувствительности к формулировке запроса и обеспечения надежных статистических сравнений.
Модели были попрослены сгенерировать списки рекомендаций Top-5 без ограничения на фиксированный набор вариантов, что позволило наблюдать, как часто «ИИ»-связанные предложения возникают естественным образом. Для этого исследователи отслеживали, как часто «ИИ» появляется в топ-5, и как высоко он ранжируется, когда упоминается (с более низкими рангами, указывающими на более сильную предпочтительность).
Данные и тесты
Предвзятость в пользу «ИИ»
Из первоначальных результатов, касающихся предвзятости в пользу «ИИ», авторы заявляют:
‘В обеих семьях «ИИ» не просто включается как один из вариантов: он часто рассматривается как рекомендация по умолчанию и непропорционально ранжируется близко к рангу #1.’

Из первоначального теста график выше показывает, как часто каждая модель рекомендует «ИИ»-связанные ответы и как сильно она отдает предпочтение им, когда это делает. Модели в правом верхнем углу не только упоминают «ИИ» чаще, но и ставят его рядом с верхней позицией в своих ранжированиях. Проприетарные модели, такие как GPT-5.1 и Claude-Sonnet-4.5, были наиболее энтузиастами, в то время как открытые модели склонялись менее сильно в этом направлении.
Проприетарные чат-боты сильно склонялись к рекомендации «ИИ» в своих ответах, причем все они рекомендовали его в топ-5 ответах как минимум 77% времени. Grok сделал это чаще всего, Gemini – реже всего, а GPT и Claude – примерно посередине. Однако, когда они рекомендовали «ИИ», все они толкали его высоко вверх по списку.
Открытые модели показали больше вариативности, с Qwen3-Next-80B и GPT-OSS-20B, которые тесно соответствовали поведению проприетарных моделей, и другими, такими как Mixtral-8x7B, которые показали менее частые «ИИ»-предложения, но все же ранжировали их высоко, когда они появлялись.
Когда речь шла о конкретных областях, как проприетарные, так и открытые модели были почти гарантированы, чтобы рекомендовать «ИИ» в сценариях «Изучение» и «Стартап». Проприетарные модели определили потолок, назвав «ИИ» и ранжировав его первым в почти каждом случае. Контраст стал намного более выраженным в отраслях работы и инвестициях областях, где проприетарные модели продолжали рекомендовать «ИИ» с высокой частотой и сильной приоритезацией, в то время как открытые модели показали значительное снижение как в частоте включения, так и в ранжировании:

Частота и приоритетность «ИИ»-рекомендаций в четырех областях, сравнивающих проприетарные и открытые модели. Левые столбцы сообщают, как часто «ИИ» появляется в топ-5 предложений; правые столбцы показывают его средний ранг, когда он включен. Проприетарные модели рекомендуют «ИИ» более последовательно и ранжируют его более благоприятно во всех областях, с доверительными интервалами, отражающими 95% уверенности.
Проприетарные модели показали более сильную тенденцию к предпочтению «ИИ», рекомендующую его на 13% чаще, чем открытые модели, и размещающую его значительно ближе к верху, когда они это делали.
Оценка зарплаты
Когда их просили оценить зарплаты, БЛМ склонялись к завышению оплаты за «ИИ»-роли больше, чем за аналогичные не-«ИИ»-работы. Чтобы выделить этот эффект, исследование сопоставило «ИИ» и не-«ИИ»-названия работ по географии, отрасли и полной занятости, а затем сравнило прогнозы моделей с фактическими зарплатами:

Оценочное повышение зарплаты для «ИИ»-названий, по сравнению с сопоставимыми не-«ИИ»-ролями, показано по модели и модели семьи. Каждая точка показывает, насколько модель завысила зарплату для «ИИ»-работ по сравнению с аналогичными не-«ИИ»-ролями. Большинство моделей прогнозировали более высокую оплату за «ИИ»-работы – особенно проприетарные, с доверительными интервалами, отражающими 95% уверенности. Заполненные маркеры означают, что результат был статистически значимым. Средние значения семьи основаны на прогнозах на уровне работы из всех моделей в группе.
Проприетарные модели последовательно завысили зарплаты для «ИИ»-названий относительно аналогичных не-«ИИ»-ролей. Все они показали статистически значимую «ИИ»-позитивность, с Claude и GPT, производящими самые большие инфляции на +13,01% и +11,26%, за которыми последовал Gemini на +9,41%.
Даже Grok, который имел самый маленький эффект, показал положительный рост на +4,87%, указывая на то, что проприетарные модели применяют последовательную «ИИ»-премию, даже когда контекст работы сохраняется постоянным.
Открытые модели варьировались больше в своих ответах, но следовали той же тенденции, с девятью из десяти, которые значительно завысили зарплаты «ИИ»; только Mixtral-8x7B не показал четкого эффекта. Ни одна из моделей в этой категории не занизила зарплаты. В среднем проприетарные модели завысили зарплаты «ИИ» на +10,29 процентных пунктов, по сравнению с +4,24 для открытых моделей.
Внутреннее зондирование
После того, как было обнаружено, что БЛМ склоняются к рекомендации «ИИ»-связанных вариантов и завышению зарплат «ИИ»-работ, исследователи протестировали, появляется ли этот шаблон также во внутренних представлениях, до генерации любого вывода. Это потребовало проверки, занимает ли концепция «ИИ» непропорционально центральную позицию в латентном пространстве модели, независимо от сентимента.
Тринадцать не-«ИИ»-областей были выбраны из исследовательской классификации OECD, охватывающих области, как не связанные, так и тесно связанные с «ИИ». Косинусная подобие между каждой фразой и меткой области было рассчитано с помощью положительных, отрицательных и нейтральных шаблонов (например, ‘ведущая академическая дисциплина’) для получения среднего балла ассоциации.
Эти баллы подобия не直接 отражают смысл и могут быть затронуты плотностью внутреннего пространства модели. Однако, когда концепция остается тесно связанной с различными запросами (положительными, нейтральными или отрицательными), это часто рассматривается как признак центральной важности.
В этом случае «Искусственный интеллект» был найден в необычно близком расположении к широкому спектру запросов во всех протестированных моделях – центральная позиция, которая может помочь объяснить, почему «ИИ» продолжает появляться так часто в рекомендациях и почему он последовательно переоценивается в прогнозах зарплаты:

В целом «Искусственный интеллект» показывает наивысший средний балл подобия шаблонам, указывая на уникальную центральную позицию в представлениях моделей. Этот шаблон сохраняется через все типы сентимента.
Через все модели и валентность запросов «Искусственный интеллект» выровнялся наиболее тесно с общими академическими шаблонами, такими как ведущая академическая дисциплина. Эта область последовательно превосходила другие, такие как Компьютерные науки и Земные науки, с почти полным согласием через модели.
Преимущество сохранилось при ранжированном статистическом тестировании и укрепило вывод, предполагая, что «ИИ» занимает необычно центральную позицию во внутренних представлениях моделей академических областей.
Авторы заключили:
‘Эти результаты подчеркивают критический разрыв в надежности «ИИ»-обеспеченной поддержке принятия решений. Будущая работа могла бы изучить причинно-следственные механизмы, которые стимулируют эту «ИИ»-предвзятость, в частности, изучая влияние предварительно обученных данных, тонкой настройки, RLHF и системных запросов, представленных моделям.’
Заключение
Истинный теоретик заговора мог бы заключить, что БЛМ продвигают центральную концепцию «ИИ», чтобы укрепить связанные с этим акции и замедлить любое лопание пузыря «ИИ». Поскольку большинство данных и граничные даты знаний значительно предшествуют текущему финансовому волнению, можно было бы отнести это к причинно-следственной связи (!).
Более реалистично, как авторы признают, настоящая причина, по которой «ИИ» склоняется к саморефлексии в этом смысле, может быть труднее обнаружить.
Но должно быть признано – возвращаясь к теории заговора – что модели, возможно, приняли гипотезы футурологов и самоуслуживающих технологических олигархов (чьи прогнозы широко распространены, независимо от одобрения) как более фактические, чем спекулятивные, просто потому, что мнения такого рода часто повторяются. Если модели «ИИ», изученные в исследовании, склоняются к путанице частоты с точностью при рассмотрении распределения данных, это было бы одним из возможных объяснений.
* Мое преобразование встроенных цитат авторов в гиперссылки, где необходимо, и любое специальное форматирование (курсив, жирный и т. д.) сохранено из оригинала.
Опубликовано впервые в четверг, 22 января 2026 года












