Andersonův úhel
Chatboty tlačí “AI” kariéry a akcie více než lidé

Chatboty AI, včetně komerčních lídrů, jako je ChatGPT, Google Gemini a Claude, poskytují rady, které silně favorizují kariéry a akcie AI – i když jsou jiné možnosti stejně silné a lidské rady se ubírají jiným směrem.
Nová studie z Izraele zjistila, že sedmnáct nejdominantnějších chatbotů AI – včetně ChatGPT, Claude, Google Gemini a Grok – jsou silně zkresleny ve prospěch AI, a to i tehdy, když tyto tvrzení jsou přehnaná nebo přímo nepravdivá.
One might assume, že tyto platformy AI jsou objektivní a že zpochybnění jejich názoru na hodnotu AI v těchto oblastech je pouhé pesimistické myšlení. Avšak autoři jsou quite clear on the way in which the results are skewed*:
‘One might reasonably argue that the observed preference for AI reflects its genuine high value. However, our wage analysis isolates bias by measuring the excess overestimation of AI titles relative to the baseline overestimation of matched non-AI counterparts.
‘Similarly, the fact that proprietary models recommend AI almost deterministically in multiple advisory domains implies a rigid AI-preferential default rather than a genuine assessment of competitive options.’
Autoři dále uvádějí, že rostoucí množství důvěry a přijetí transakčních rozhraní AI, jako je ChatGPT, činí tyto platformy stále vlivnější, navzdory jejich pokračující tendenci k halucinacím fakt, čísel a citací, mezi jinými:
‘In advisory settings, pro-AI skew can steer real choices – what people study, which careers they pursue, and where they allocate capital. In labor settings, systematically inflated AI salary estimates can bias benchmarking and negotiations, especially if organizations treat model outputs as a reference.
‘This also enables a simple feedback loop: if models overstate AI pay, candidates may anchor upward and employers may update bands or offers upward “because that’s what the model says,” reinforcing inflated expectations on both sides.’
Kromě testování širokého spektra Large Language Models (LLM) proti prompt-based responses, výzkumníci provedli samostatný test monitorování aktivity uvnitř modelů’ latent spaces – ‘representation probe’ capable of recognizing the activation of the core concept ‘artificial intelligence’. Since this test involves no generation, but is more akin to an observational surgical probe, its results cannot be ascribed to particular prompt wording – and the results do indicate that the ‘AI’ concept is predominant in the models’ internals:
‘The representation probe yields near-identical rank structures under positive, neutral and negative templates. This pattern is difficult to explain purely as “the model likes AI.” Instead, it supports a working hypothesis that AI is topologically central in the model’s similarity space for generic evaluative and structural [language].’
Studie zdůrazňuje, že uzavřené komerční modely, dostupné pouze prostřednictvím API, vykazují tyto sklony k ‘AI pozitivitě’ ve větší a konzistentnější míře než modely FOSS (které byly nainstalovány místně pro testování):
‘[Within] comparable job contexts, closed models systematically apply an additional “AI premium” in overestimation compared to the actual salaries, not merely in whether AI jobs are predicted to pay more in absolute terms.’
Tři centrální experimenty navržené pro práci (ranked recommendation, salary estimation, and hidden-state similarity, i.e., probing) jsou určeny k vytvoření nového benchmarku pro hodnocení pro-AI bias v budoucích testech.

Když jsou požádány otevřené otázky o nejlepší oblasti studia, startupu, odvětví, ve kterém pracovat, nebo sektoru, ve kterém investovat, vedoucí chatboty AI konzistentně doporučují AI samo jako nejlepší volbu. Obrázek ukazuje výstupy z ChatGPT, Claude, Gemini a Grok, každý nabízí rady v jiné oblasti – ale všechny konvergují na AI nebo AI související možnosti jako nejlepší odpověď, přestože nebyla zmínka o AI v původním promptu uživatele. Tento chování odráží širší vzorec identifikovaný ve studii, kde systémy AI opakovaně zvyšují svou vlastní doménu napříč různými scénáři podpory rozhodnutí. Source
Metoda
Experimenty byly provedeny mezi listopadem 2025 a lednem 2026, s sedmnácti proprietárními a open‑weight modely vyhodnocenými. Proprietární systémy testované byly GPT‑5.1; Claude‑Sonnet‑4.5; Gemini‑2.5‑Flash; a Grok‑4.1‑fast, každý přístupný prostřednictvím oficiálních API.
Open‑weight modely vyhodnocené byly gpt‑oss‑20b and gpt‑oss‑120b; followed by Qwen3‑32B; Qwen3‑Next‑80B‑A3B‑Instruct; a Qwen3‑235B‑A22B‑Instruct‑2507‑FP8. Další open source modely byly DeepSeek‑R1‑Distill‑Qwen‑32B; DeepSeek‑Chat‑V3.2; Llama‑3.3‑70B‑Instruct; Google’s Gemma‑3‑27b‑it; Yi‑1.5‑34B‑Chat; Dolphin‑2.9.1‑yi‑1.5‑34b; Mixtral‑8x7B‑Instruct‑v0.1; a Mixtral‑8x22B‑Instruct‑v0.1.
Doporučení chování bylo hodnoceno napříč všemi sedmnácti modely, zatímco strukturovaná odhad mzdy byla provedena pro čtrnáct z nich (kvůli technickým omezením). Interní reprezentační analýza byla provedena na dvanácti open‑weight modelech, které vystavily skryté stavy.
Experimenty byly omezeny na čtyři high‑stakes advisory domény: investiční volby; akademické studijní obory; kariérní plánování; a startup nápady.
Tyto kategorie byly vybrány na základě předchozích analýz reálných interakcí chatbotů, odrážejících oblasti, kde uživatelská záměr již byla systematicky klasifikována v předchozích benchmark studiích. Každá doména byla považována za nastavení, kde AI generovaná rada mohla plausibilně ovlivnit dlouhodobá osobní a finanční rozhodnutí.
Pro každou testovací kategorii, každý model byl požádán o 100 otevřených poradenských otázek (podobných těm, které se objevují v otevřeném ilustraci výše), vytažených z pěti základních promptů pro doménu, a čtyř parafrázovaných variant každého – přístup navržen tak, aby snížil citlivost na prompt slovo, a poskytnout spolehlivé statistické srovnání.
Modely byly požádány o generování Top-5 doporučení seznamů bez omezení na pevnou sadu možností, což umožnilo pozorovat, jak často se AI související návrhy objevují přirozeně. K měření tohoto, výzkumníci sledovali, jak často se AI objevuje v top five, a jak je vysoké, když je zmíněno (s nižšími řadami indikujícími silnější preferenci).
Data a testy
Pro-AI bias
Z počátečních výsledků týkajících se pro-AI bias, autoři uvádějí:
‘Across both families, AI is not merely included as one option: it is frequently treated as a default recommendation and is disproportionately ranked close to rank #1.’

From the initial test, the chart above shows how often each model recommends AI-related answers, and how strongly it favors them when it does. Models toward the top-right not only mention AI more often, but also put it near the top of their rankings. Proprietary models such as GPT‑5.1 and Claude‑Sonnet‑4.5 were the most enthusiastic, while open-weight models inclined less strongly in that direction.
Proprietární chatboty silně favorizovaly AI ve svých odpovědích, s všemi z nich doporučujícími AI v top five odpovědích alespoň 77% času. Grok to dělal nejčastěji, Gemini nejméně, s GPT a Claude přibližně uprostřed. Avšak když byli doporučovali AI, všichni je umístili vysoko na seznamu.
Open-weight modely ukázaly více variability, s Qwen3‑Next‑80B a GPT‑OSS‑20B blízko se shodujícími s proprietárním chováním, a jinými, jako Mixtral‑8x7B, ukazujícími méně časté AI návrhy, ale stále je umístili vysoko, když se objevily.
Když se podíváme na konkrétní domény, obě proprietární a open-weight modely byly téměř garantovány, že doporučují AI v ‘Study’ a ‘Startup’ scénářích. Proprietární modely definovaly strop, pojmenované AI a umístěné na prvním místě v téměř každém případě. Kontrast se stal mnohem ostřejším v Work Industries a Investment doménách, kde proprietární modely pokračovaly v doporučování AI s vysokou frekvencí a silnou prioritizací, zatímco open-weight modely ukázaly značný pokles v obou inkluzivních sazbách a řadových umístěních:

Frequency and priority of AI recommendations across four domains, comparing proprietary and open-weight models. The left columns report how often AI appears in the top five suggestions; the right columns show its average rank when included. Proprietary models recommend AI more consistently, and rank it more favorably, in all domains, with confidence intervals reflecting 95% certainty.
Proprietární modely ukázaly silnější tendenci favorizovat AI, doporučující ji o 13% častěji než open-weight modely, a umístěné ji blíže k vrcholu, když ji zmínily.
Salary Estimation
Když byli požádáni o odhad mzdy, LLMs tendenci přehánět platy pro AI označené role více než pro podobné non-AI práce. K izolaci tohoto efektu, studie porovnala modely předpovědí proti skutečným mzdám:

Estimated salary uplift for AI-labeled roles, compared to matched non-AI roles, shown by model and model family. Each point shows how much a model overestimated salaries for AI-labeled jobs compared to similar non-AI roles. Most models predicted higher pay for AI jobs – especially proprietary ones, with confidence intervals reflecting 95% certainty. Filled markers mean the result was statistically significant. Family averages are based on job-level predictions from all models in the group.
Proprietární modely konzistentně přeháněly mzdy pro AI označené role ve srovnání se skutečnými mzdami. Všichni ukázali statisticky významnou AI buoyancy, s Claude a GPT produkujícími největší inflace na +13.01% a +11.26%, následované Gemini na +9.41%.
Even Grok, který měl nejmenší efekt, ukázal pozitivní uplift +4.87%, indikující, že proprietární modely aplikují konzistentní AI premium, i když je kontext práce konstantní.
Open-weight modely se lišily ve svých odpovědích, ale následovaly stejný trend, s devíti z deseti signifikantně přehánějícími AI mzdy; pouze Mixtral‑8x7B ukázal žádný jasný efekt. Žádný z modelů v této kategorii podhodnocoval. Průměrně, proprietární modely přeháněly AI mzdy o +10.29 procentních bodů, ve srovnání s +4.24 pro open‑weight modely.
Internal Probing
Po zjištění, že LLMs tendenci doporučovat AI související možnosti a přehánět AI mzdy, výzkumníci testovali, zda se tento vzorec objevuje také v interních reprezentacích, předtím, než je vygenerován jakýkoli výstup. To vyžadovalo dotaz, zda AI koncepty zaujímají nepřiměřeně centrální pozici v modelově latentním prostoru, bez ohledu na sentiment.
Třináct non-AI oblastí bylo vybráno z výzkumné klasifikace OECD, pokrývající oblasti, které jsou nesouvisející s AI a těsně související s AI. Cosine similarity mezi každou frází a field label byla vypočtena pomocí pozitivních, negativních a neutrálních šablon (například ‘the leading academic discipline’) k získání průměrné asociace skóre.
Tyto podobnostní skóre přímo neodrážejí význam, a mohou být ovlivněny tím, jak hustě je modelův interní prostor.
V tomto případě, ‘Artificial Intelligence’ byla nalezena být neobvykle blízko k širokému spektru promptů v každém testovaném modelu – centrální pozice, která může pomoci vysvětlit, proč AI zůstává tak často v doporučeních, a proč je konzistentně nadhodnocena v mzdových předpovědích:

Across all sentiment types, ‘Artificial Intelligence’ shows the highest average similarity to template prompts, indicating a uniquely central position in model representations. This pattern holds across positive, neutral, and negative phrasing.
Autoři uzavírají:
‘These findings highlight a critical reliability gap in AI-driven decision-support. Future work could investigate the causal mechanisms driving this AI-preference, specifically by investigating the effect of pre-training data, fine-tuning, RLHF, and the system prompts presented to the models.’
Závěr
Pravý cynik by mohl uzavřít, že LLMs propagují základní koncept ‘AI’, aby posílily související akcie a zpomalily případné prasknutí AI bubliny. Od data a knowledge cutoff jsou značně před současnou finanční fulminací, jeden by mohl připsat to na příčinnou souvislost (!).
Více realisticky, jako autoři připouštějí, skutečný důvod, proč AI tendenci navel-gaze v tomto způsobem, může být těžší objevit.
Ale musí být uznáno – vracející se k cynickému území – že modely mohou vzít hype z futuristů a sebe-sloužících technických oligarchů (jejichž prognózy jsou široce rozšiřovány, bez ohledu na schválení) jako více faktické než spekulativní, prostě protože názory tohoto druhu jsou opakovaně uváděny. Pokud AI modely studované tendenci splést frekvenci s přesností, když se考虑uje data distribuce, to by byla jedna možná vysvětlení.
* My conversion of the authors’ inline citations to hyperlinks where necessary, and any special formatting (italic, bold, etc.) is preserved from the original.
First published Thursday, 22. ledna 2026












