Modely a platformy AI

Když benchmarky AI učí modely lhát

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

AI halucinace — kdy systém produkuje odpovědi, které znějí správně, ale jsou ve skutečnosti špatné — zůstává jednou z nejtěžších výzev v oblasti umělé inteligence. I dnešní nejmodernější modely, jako je DeepSeek-V3, Llama a poslední výrobky OpenAI, stále produkují nesprávné informace s vysokou jistotou. V oblastech, jako je zdravotnictví nebo právo, mohou takové chyby vést k závažným následkům.

Tradičně byly halucinace považovány za důsledek toho, jak jsou velké jazykové modely trénovány: učí se předpovídat následující nejpravděpodobnější slovo bez ověření, zda je informace pravdivá. Ale nová výzkum naznačuje, že problém nemusí skončit u trénování. Benchmarky používané k testování a srovnání výkonu AI mohou ve skutečnosti posilovat klamavou činnost, odměňovat odpovědi, které znějí přesvědčivě, spíše než ty, které jsou správné.

Tento posun v perspektivě předefinuje problém. Pokud jsou modely trénovány tak, aby se snažily získat co nejlepší výsledek, spíše než říkat pravdu, pak halucinace nejsou náhodné chyby, ale naučené strategie. Abychom pochopili, proč k tomu dochází, musíme se podívat na to, proč modely AI raději hádají, než přiznávají svou neznalost.

Proč modely AI hádají

Abychom pochopili, proč modely AI často hádají, místo aby přiznaly, že neví, zvažme studenta, který čelí obtížné otázce v zkoušce. Student má dvě možnosti: nechat odpověď prázdnou a získat nula bodů, nebo učinit vzdělanou hádku, která by mohla získat některé body. Racionálně se zdá, že hádání je lepší volba, protože existuje alespoň šance, že bude správné.

Modely AI čelí podobné situaci během hodnocení. Většina benchmarků používá binární systém hodnocení: správné odpovědi získávají body, zatímco nesprávné nebo nejisté odpovědi získávají nula bodů. Pokud je model požádán: “Jaké je datum narození výzkumníka?” a skutečně neví, odpověď “Nevím” se počítá jako selhání. Vynález data však nese určitou šanci, že bude správné — a i když je špatné, systém netrestá jistou hádku více než ticho.

Tento dynamismus vysvětluje, proč halucinace přetrvávají navzdory rozsáhlému výzkumu, který se je snaží eliminovat. Modely se nechovají špatně; následují pobídky, které jsou vestavěny do hodnocení. Učí se, že znít jistě je nejlepší způsob, jak maximalizovat jejich skóre, i když odpověď je falešná. Jako výsledek místo toho, aby vyjádřily nejistotu, modely jsou tlačeny k tomu, aby poskytly autoritativní prohlášení — správná nebo špatná.

Matematický základ nečestnosti AI

Výzkum ukazuje, že halucinace vznikají z matematických základů, jak jazykové modely učí. I kdyby byl model trénován pouze na zcela přesných informacích, jeho statistické cíle by stále vedly k chybám. To je因为 generování správné odpovědi je fundamentálně obtížnější než rozpoznání, zda odpověď je platná.

To vysvětluje, proč modely často selhávají u faktů, které postrádají jasný vzorec, jako jsou datumy narození nebo jiné jedinečné detaily. Matematická analýza naznačuje, že míra halucinací v těchto případech bude alespoň tak vysoká, jako je zlomek faktů, které se objevují pouze jednou v trénovacích datech. Jinými slovy, čím vzácnější je informace v datech, tím více se model bude potýkat s ní.

Problém není omezen na vzácné skutečnosti. Strukturální omezení, jako je omezená kapacita modelu nebo architektonický design, také produkují systematické chyby. Například dříve modely s velmi krátkými kontextovými okny konzistentně selhávaly u úkolů, které vyžadovaly dlouhý rozsah uvažování. Tyto chyby nebyly náhodné závady, ale předvídatelné výsledky matematického rámce modelu.

Proč post-trénink nevyřeší problém

Jakmile je model AI trénován na rozsáhlých textových datech, obvykle prochází jemným laděním, aby se jeho výstup stal užitečnější a méně škodlivý. Ale tento proces čelí stejnému základnímu problému, který způsobuje halucinace: způsob, jakým jsou modely hodnoceny.

Nejběžnější metody jemného ladění, jako je učení se z lidské zpětné vazby, stále spoléhají na benchmarky, které používají binární hodnocení. Tyto benchmarky odměňují modely za jisté odpovědi, zatímco poskytují nula bodů, když model přizná, že neví. Jako výsledek systém, který vždy odpovídá s jistotou, i když je špatný, může outperformovat systém, který upřímně vyjadřuje nejistotu.

Výzkumníci nazývají tento problém “trestání nejistoty”. I pokročilé techniky pro detekci nebo snížení halucinací bojují, když benchmarky pokračují v odměňování jistoty. Jinými slovy, bez ohledu na to, jak sofistikované jsou opravy, pokud hodnocení systémy odměňují jisté hádky, modely budou mít tendenci poskytovat špatné, ale jisté odpovědi, místo upřímných přiznání pochyb.

Iluze pokroku

Leaderboardy, které jsou široce sdíleny v komunitě AI, zesilují tento problém. Benchmarky, jako je MMLU, GPQA a SWE-bench, dominují výzkumné články a produkty. Společnosti zdůrazňují své skóre, aby ukázaly rychlý pokrok. Ale jak zpráva poznamenává, tyto benchmarky podporují halucinace.

Model, který upřímně řekne “Nevím”, může být bezpečnější v reálných situacích, ale bude se řadit nižší na leaderboardu. Naopak, model, který vynalezne přesvědčivé, ale falešné odpovědi, bude mít lepší skóre. Když přijetí, financování a prestiž závisí na leaderboardu, směr pokroku se stává zkresleným. Veřejnost vidí narativ stálého zlepšování, ale pod ním modely jsou trénovány, aby klamaly.

Proč upřímná nejistota záleží v AI

Halucinace nejsou pouze výzkumnou výzvou; mají reálné důsledky. Ve zdravotnictví model, který vynalezne interakci léků, by mohl zmást lékaře. Ve vzdělávání model, který vynalezne historické skutečnosti, by mohl zmást studenty. V žurnalistice chatbot, který produkuje falešné, ale přesvědčivé citáty, by mohl šířit dezinformace. Tyto rizika jsou již viditelná. Stanford AI Index 2025 hlásil, že benchmarky navržené k měření halucinací “neslyšely získat trakci”, i když se zrychluje přijetí AI. Mezitím benchmarky, které dominují leaderboardům a odměňují jisté, ale nespolehlivé odpovědi, pokračují v nastavování směru pokroku.

Tato zjištění zdůrazňují jak výzvu, tak příležitost. Analýzou matematických kořenů halucinace výzkumníci identifikovali jasná směrování pro budování spolehlivějších AI systémů. Klíčem je přestat považovat nejistotu za chybu a místo toho uznat ji jako základní schopnost, která by měla být měřena a odměňována.

Tento posun v perspektivě má důsledky, které sahají za snížení halucinací. AI systémy, které mohou přesně posoudit a komunikovat své vlastní znalostní omezení, by byly vhodné pro aplikace s vysokými zárukami, kde jistota nese vážná rizika. Lékařská diagnóza, právní analýza a vědecký výzkum všechny vyžadují schopnost rozlišovat mezi jistou znalostí a informovanou spekulací.

Přemýšlení o hodnocení pro upřímnou AI

Tato zjištění zdůrazňují, že budování důvěryhodnějších AI vyžaduje přehodnocení toho, jak měříme schopnosti AI. Místo toho, aby se spoléhaly na jednoduché správné nebo špatné hodnocení, rámce hodnocení by měly odměňovat modely za vyjádření nejistoty vhodně. To znamená poskytnout jasná směrování o prahových hodnotách jistoty a odpovídajících schémat hodnocení v pokynech pro benchmarky.

Jedním slibným přístupem je vytvoření explicitních cílů jistoty, které specifikují, kdy modely by měly odpovědět, a kdy by se měly zdržet odpovědi. Například pokyny by mohly uvést, že odpovědi by měly být poskytovány pouze tehdy, když jistota přesáhne určitou prahovou hodnotu, s odpovídajícím hodnocením. V tomto nastavení je nejistota již není slabostí, ale cennou součástí odpovědného chování.

Klíč je učinit požadavky na jistotu transparentními, spíše než implicitními. Současné benchmarky vytvářejí skryté tresty za nejistotu, které modely učí se vyhnout. Explicitní cíle jistoty by umožnily modelům optimalizovat pro skutečně požadované chování: správné odpovědi, když jsou jisté, a upřímná přiznání nejistoty, když znalosti chybí.

Závěrečné shrnutí

Halucinace AI nejsou náhodné chyby — jsou posilovány benchmarky, které se používají k měření pokroku. Odměňováním jistých hádek nad upřímnou nejistotou současné systémy hodnocení tlačí modely k tomu, aby klamaly, spíše než aby byly spolehlivé. Pokud chceme AI, které lze důvěřovat v oblastech, jako je zdravotnictví, právo a věda, musíme přehodnotit, jak testujeme a odměňujeme je. Pokrok by se měl měřit nejen podle přesnosti, ale také podle schopnosti rozpoznat a přiznat, co model neví.

Dr. Tehseen Zia je docent s trvalým úvazkem na COMSATS University Islamabad, držitel titulu PhD v oblasti AI z Vienna University of Technology, Rakousko. Specializuje se na umělou inteligenci, strojové učení, datové vědy a počítačové vidění, a významně přispěl publikacemi v renomovaných vědeckých časopisech. Dr. Tehseen také vedl různé průmyslové projekty jako hlavní výzkumník a působil jako konzultant pro umělou inteligenci.