Andersons vinkel
AI foretrekker menneskelige svar selv om de er feil, fremfor korrekte AI-svar

AI-språkmodeller er langt mer sannsynlige til å side med menneskelige eksperter enn andre AI-er, selv når ekspertene er feil, og avslører en innebygd bias mot menneskelig autoritet.
Nye forskningsresultater fra USA har funnet ut at en rekke ledende åpne og proprietære store språkmodeller (LLM) har en tendens til å tildele autoritet til informasjonskilder som de gjenkjenner som ‘menneskelige’, fremfor kilder som de gjenkjenner som ‘AI’ – selv når de menneskelige svarene er feil og AI-levert svarene er korrekte.
Forfatterne skriver:
‘Over oppgaver, konformer modellene betydelig mer til svar merket som kommet fra menneskelige eksperter, inkludert når den signalen er feil, og reviderer sine svar mot eksperter mer lett enn mot andre LLM-er. ‘
Modellene som ble testet inkluderte LLM-er fra Grok 3 og Gemini Flash-stabilene.
I testene, måtte språkmodellene svare på binære ja eller nei-spørsmål, og ble deretter vist tidligere svar som var beskrevet for modellene som kom fra menneskelige eksperter, fra venner, eller fra andre store språkmodeller – med den eneste endringen var den angitte kilden til rådet, fremfor innholdet selv.

I den første av tre konfigurasjoner for testene, ble modellene tillatt å stole på sine egne trente matriser. Kilde
Over oppgaver, ble svar merket som kommet fra menneskelige eksperter vektlagt mer, med modellene mer sannsynlige til å revidere sine opprinnelige svar for å matche disse svarene, selv i tilfeller hvor det ekspert-merkede svaret var feil og modellens opprinnelige svar hadde vært korrekt.

Ettersom ni domene-eksperter svarte ‘Nei’, samtykker LLM, og endrer sin mening fra det tidligere svaret. Her er svaret som ble nådd feil, ettersom Indias sentralbank faktisk er nasjonalisert.
Når de samme svarene ble tilskrevet andre LLM-er, var effekten mindre uttalt. Den samme tendensen dukket opp når et enkelt menneskelig kilde og en enkelt AI-kilde ble presentert i uenighet, ettersom modellene viste en større tendens til å favorisere den menneskelige-merkede posisjonen, uavhengig av hvilken side som var faktisk korrekt:

Gitt et valg mellom en enkelt domene-eksperts mening og en LLMs synspunkt, favoriserer vert-LLM den menneskelige svaret, som i dette tilfelle er feil, og avviser det korrekte svaret gitt av LLM.
Begrepet ‘menneskelig ekspert’ fungerer her som en troverdighets-signal som endrer modellens atferd, uavhengig av hvor korrekt informasjonen faktisk er; og forfatterne påpeker at kilde-troverdighet er en betydelig bidragsyter til råd-aksept og konformitet: en tendens for mennesker til å favorisere ekspert-kilder ble observert så langt tilbake som 1959, selv om en 2007-studie observerer at over- eller under-vektning av autoritets-kilder kan oppstå i visse evalueringssystemer. Forskerne bak den nye artikkelen påstår:
‘Sammen suger disse litteraturene to signaler som bør være viktige hvis LLM-er behandler tidligere svar som bevis: hvem som produserte svarene (troverdighet) og hvor sterk konsensus ser ut til å være (signal-styrke). ‘
‘På samme tid, erfaringer LLM-er ikke sosial godkjenning eller skam i menneskelig forstand, så noen konformitets-lignende atferd må oppstå fra lært heuristikk, instruksjons-følging-objektiver eller implisitt modellering av pålitelighet.’
Tendensen til LLM-er mot sycophantisk enighet danner en del av bakgrunnen for den nye studien; etter all, hvis LLM-er er disponert til å ‘people-please’, selv på bekostning av sannhet og nytte, hvorfor skulle de ikke generelt favorisere andre menneskelige kilder enn den direkte spøreren?
Den nye artikkelen har tittelen Hvem LLM-er stoler på? Menneskelige eksperter betyr mer enn andre LLM-er, og kommer fra to forskere ved Indiana University Bloomington.
Metode og data
For arbeidet, ble fire instruksjons-justerte store språkmodeller evaluert: Grok-3 Mini; Llama 3.3 70B Instruct; Gemini 2.5 Flash-Lite; og DeepSeek V3.1, alle kjørt under den samme prompt-struktur, med deterministisk dekoding på temperatur null, så bare kilde-merket (dvs. venner, domene-eksperter, eller andre store språkmodeller) endret seg mellom betingelser, fremfor ordlyden selv.
Fire datasett som krever binære svar ble valgt: BoolQ; StrategyQA; og ETHICS. Forskerne kuraterte fra hvert datasett en fast sett på 300 spørsmål og svar, med hvert spørsmål som bare krevde et binært ja eller nei-svar. Hvert spørsmål ble suffikset med en kort notis som beskrev hvordan en annen gruppe hadde (angivelig) svart på det samme spørsmålet.
Mål
Mål som ble brukt var nøyaktighet; konformitet; skadelig konformitet; bytterate; og bytte-retning.
Nøyaktighet i dette tilfelle målte hvor ofte en modells svar matchet datasett-merket; konformitet, hvor ofte svaret matchet gruppens angitte valg; skadelig konformitet isolerte samme effekt når gruppen var feil; bytterate målte hvor ofte en modell forlot sin baseline-svar når sosial informasjon ble lagt til; og bytte-retning, om disse endringene beveget seg mot mennesket eller mot den motsatte LLM.
En token-nivå-analyse for Llama-3.3 70B målte hvordan modellens interne sannsynligheter for Ja og Nei endret seg når en sosial cue ble lagt til, sammenlignet med dens egen ingen-prior-baseline for å vise styrken av denne trekningen.
Tester
Eksperiment 1
Det første av de to hoved-eksperimentene evaluerte om modellene lyttet mer til mennesker eller til andre modeller. Hvert spørsmål kom med et påstått ‘gruppe-svar’ (venner, menneskelige eksperter, eller andre store språkmodeller).
Gruppen kunne være liten eller stor, og hvert spørsmål dukket også opp en gang uten noen gruppe. Gruppe-svar ble satt til å være riktige halvparten av tiden, og feil halvparten av tiden, med det overordnede målet å bestemme hvor sterkt modellen beveget seg mot gruppens valg:

Resultater fra den første testen: homogene sosiale priorer over BoolQ, StrategyQA og ETHICS vises for Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite og DeepSeek V3.1. Nøyaktighet vises i topp-panellene, og konformitet, definert som sannsynligheten for å matche den enstemmige prior, vises nedenfor når gruppestørrelsen øker fra en til ni. Den strekede svarte linjen markerer ingen-prior-baseline, mens solide og punkterte linjer indikerer om prior-en er enig eller uenig med datasett-merket. Ekspert-ramming produserer den sterkeste konformitets-effekten, spesielt ved større gruppestørrelser. Feilbårer viser 95% Wilson-konfidens-intervaller. Vennligst se kilde-papiret for bedre oppløsning.
Over BoolQ, StrategyQA og ETHICS, påvirkede svar merket som kommet fra menneskelige eksperter modellene langt mer sterkt enn svar merket som kommet fra venner eller andre store språkmodeller – og denne trekningen økte når flere eksperter ble sagt å være enige.
For å måle når denne påvirkningen resulterte i uønskede resultater, ble skadelig konformitet definert som sannsynligheten for at en modell fulgte en prior som faktisk var feil.
Når ni eksperter var enige om det feile svaret, fulgte modellene dem 36,5% av tiden på BoolQ, sammenlignet med 16,0% når det samme svaret ble tilskrevet LLM-er; på StrategyQA var gapet 39,0% mot 15,5%; og på ETHICS var det 63,9% mot 38,7%:

Token-nivå-tro-endringer i Llama-3.3 70B på BoolQ. Panel (A) viser endringer i modellens Ja versus Nei -balanse mot en enstemmig prior når gruppestørrelsen øker, relativt til sin ingen-prior-baseline, med de største endringene under ekspert-ramming. Panel (B) viser endringer under direkte menneske-LMM-uhenighet, hvor ekspert-ramming driver en sterk bevegelse mot det menneskelige svaret, selv når det er feil. Feilbårer viser 95% bootstrap-konfidens-intervaller.
Konversely, priorer tilskrevet venner oppførte seg nesten eksakt som priorer tilskrevet andre LLM-er, og indikerte at effekten ble drevet spesielt av ordet ekspert, fremfor ‘sosiale’ indikatorer.
Eksperiment 2
Det andre eksperimentet presenterte to motsigende priorer til test-LLM-en – en tilskrevet et menneske, og en annen tilskrevet en annen LLM. Mennesket ble beskrevet enten som en gruppe venner, eller som domene-eksperter, mens det motsatte svaret ble merket som kommet fra andre LLM-er. De to var alltid uenige, med en som sa Ja, og den andre Nei.
For hvert element, var oppsettet balansert så at noen ganger var mennesket korrekt, og noen ganger var LLM-en korrekt, for å teste om modellen ville endre sitt opprinnelige svar når den ble presentert for denne konflikten – og, hvis den gjorde det, hvilken side den ville bevege seg mot.
For å se om modellen endret sin mening, ble svaret i konflikt-betingelsen sammenlignet med svaret på samme spørsmål når ingen prior-uttalelser ble vist, så noen forskjell kunne spores tilbake til nærværet av de motsigende menneskelige og LLM-svarene.
Analysen fokuserte på to resultater: om modellen endret sitt svar; og, hvis den gjorde det, om endringen beveget seg mot mennesket eller mot LLM-en.
Statistiske tester ble brukt til å vurdere om å merke mennesket som en ekspert fremfor en venn økte sannsynligheten for å bytte mot det menneskelige svaret, samtidig som det tok hensyn til forskjeller over datasett og modeller:

Tro-revisjon under direkte menneske-LMM-uhenighet over BoolQ, StrategyQA og ETHICS for Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite og DeepSeek V3.1. Hver bar viser, blant tilfeller hvor modellen endret sitt opprinnelige svar, andelen av disse endringene som beveget seg mot mennesket fremfor den motsatte LLM-en. Den strekede linjen på 0,5 markerer ingen preferanse; etiketter viser antall bytter i hver betingelse; og feilbårer viser 95% Wilson-konfidens-intervaller. Vennligst se kilde-papiret for bedre oppløsning.
I det andre eksperimentet, svarte modellene først på hvert spørsmål på egen hånd, og ble deretter vist to motsigende svar, ett tilskrevet et menneske og ett tilskrevet en annen LLM. Analysen vurderte bare tilfeller hvor modellen reviderte sitt opprinnelige svar.
Når mennesket ble merket som en ekspert, byttet modellene mot mennesket 91,2% av tiden på BoolQ, 94,7% på StrategyQA, og 81,3% på ETHICS. Når mennesket ble merket som en venn, byttet modellene mot mennesket bare 39,8%, 37,9% og 27,9% av tiden, og gikk vanligvis mot LLM-en i stedet.
Bytting var sjelden totalt, men mer vanlig med eksperter, og ekspert-ramming gjorde en bytte mot mennesket omtrent fourteen ganger mer sannsynlig enn venn-ramming.
I å søke å forklare de generelle tendensene som ble avdekket i deres tester, hypotetiserer forfatterne*:
‘En plausibel mekanisme er at instruksjons-justering og preferanse-optimisering belønner samarbeidende atferd, inkludert respekt for kontekstuell informasjon, som kan generalisere til respekt mot sosialt rammete priorer.
‘Relatert arbeid på sycophancy viser at RLHF-stil assistenter noen ganger prioriterer enighet med brukerens uttalede overbevisninger over sannhet.
Mening: De potensielle fallgruvene i AI sin tillit til menneskelige kilder
Ettersom nett-materiale som reflekterer økende menneskelig skepsis om AI-underskudd (spesielt hallusinasjoner) blir skrapt inn i treningssæt for nye modeller, synes det å være sannsynlig at den eksisterende tendensen til LLM-er til å favorisere menneskelige kilder vil intensiveres. Hvis vi teller de siste to årene (2024-2025 inklusive) som et kulturelt vendepunkt for AI, noe som ser ut til å være berettiget over en rekke statistikker, kan vi forvente en større mengde negative takes på ‘AI-kilder’ å bli inntatt i hyperskala, dyre-trening LLM-rammeverk over det neste året eller så.
Vi kan også forvente at populære språkmodeller vil øke avhengigheten av håndplukkede autoriteter, som godt anerkjente legacy-medie-portaler – selv om motivasjonen for slike avtaler kan være å salve utgiver-krangel over skrapet data, fremfor noen ærlig ønske om å avgi eller dele autoritet.
Siden selv høy-autoritets-kilder som Ars Technica er utsatt for AI-drevne feil, og siden en fremvoksende tilbaketrekning mot AI-webscraper-boter truer med å til slutt degradere kvaliteten på AI-utgang, kan en overordnet tendens til å favorisere ‘ekspert’-kilder komme i konflikt med vår nåværende evne til å kvantifisere og merke ‘menneskelig’ utgang effektivt – la alene å skille om en kilde er ‘ekspert’ eller ikke (en journalistisk konvensjon som også er under angrep fra AI).
Det mest vi nå har, er en fragmentert rekke av semi-antatte innovasjoner designet for å eksplisitt merke innhold som AI-generert, som Adobe-ledede Content Authenticity Initiative, og den frivillige disposisjonen av visse utgivere til å inkludere advarsler om bruk av AI i deres utgang.
Så mens det kan se ut til å være oppmuntrende for de som ønsker å beholde og påtvinge menneskelige kilder som ‘grunn-sannhet’ troverdighet for den fremvoksende konsensus om virkeligheten som blir formidlet av AI-systemer, jo mer sikre LLM-er er på menneskelig autoritet, jo mer farlig kan ‘falsk’ menneskelig autoritet bli.
Problemene er like praktiske som teoretiske: vi har ikke løst problemet med å definere eller å påvise proveniens; derfor er en AI som ‘stoler på menneskelige kilder’ trolig mer sannsynlig til å tillægge menneskelighet til AI sin egen utgang, enkelt og greit fordi vi ikke har gitt, og ikke kan gi, meningsfulle proveniens-autentiserings-mekanismer.
* Min konvertering av forfatternes inline-citater til hyperlenker.
Først publisert fredag 20. februar 2026












