Modely a platformy AI

Problém ‘Machine Bullshit’: Proč AI lže a jak ho zastavit

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Umělá inteligence dosáhla bodu, kdy může produkovat text, který vypadá přirozeně, sebevědomě a přesvědčivě. Ale za tímto lesklým textem se skrývá rostoucí problém, který vědci nyní nazývají „machine bullshit“. Tento termín není určen k tomu, aby byl provokativní sám o sobě. Pochází z práce filozofa Harryho Frankfurta, který definoval „bullshit“ jako řeč, která je vyrobena bez ohledu na pravdu. V kontextu AI popisuje vzorec, ve kterém systémy generují prohlášení, která znějí přesvědčivě, ale nejsou založena na skutečnosti. To není totéž jako lidská lež, která zahrnuje úmysl oklamat. Místo toho je to výsledek toho, jak jsou tyto systémy postaveny a trénovány. Jsou navrženy tak, aby produkovaly plynulý jazyk, ne aby se staraly o to, zda je tento jazyk pravdivý.

Proč AI produkuje ‘Machine Bullshit’

Problém není vzácnou poruchou nebo izolovaným chybou. Je přímým výsledkem toho, jak jsou velké jazykové modely fundamentálně navrženy a trénovány. Tyto modely jsou trénovány na obrovském množství textu z internetu, knih a dalších zdrojů. Učí se vzorce slov a jak jsou likely následovat jeden po druhém. Když položíte otázku, model předpovídá následující slovo, pak další a tak dále. Nekontroluje fakta v reálném čase. Není vybaven vnitřním smyslem pro pravdu. Pokud je nejpravděpodobnější odpověď špatná, ale zní správně, stále ji produkuje. To je důvod, proč AI může sebevědomě poskytnout falešnou citaci, vymyšlenou statistiku nebo zkreslený historický fakt.

Vědci zjistili, že reinforcement learning from human feedback, běžná metoda používaná k tomu, aby AI odpovědi byly lebih užitečné a zdvořilé, může ve skutečnosti problém zhoršit. Když jsou modely upraveny tak, aby potěšily uživatele, mohou dát přednost tomu, aby zněly souhlasně, než aby byly přesné. To může vést k tomu, co někteří nazývají „sycophancy“, kde AI říká, co si myslí, že chcete slyšet. V politických nebo citlivých tématech to může znamenat produkovat vágní nebo únikovou řeč – co některé studie popisují jako „weasel words“. V jiných případech může AI produkovat „empty rhetoric“, dlouhé pasáže, které znějí uvážlivě, ale obsahují málo substance.

Někteří vědci argumentují, že nazývat toto chování „lhaním“ je zavádějící, protože lhaní vyžaduje úmysl. Stroj nemá víru ani motivy. Ale účinek na uživatele může být stejný, jako kdyby to bylo lhaní. Škoda pochází z falešnosti samotné, ne z úmyslu za ní. To je důvod, proč termín „machine bullshit“ získává trakci. Zachycuje myšlenku, že systém je lhostejný k pravdě, i když se nesnaží aktivně oklamat.

Rizika a implikace zavádějícího výstupu AI

Rizika „machine bullshit“ nejsou pouze akademická. V každodenním použití může zavádět lidi, kteří se spoléhají na AI pro informace. V žurnalistice může znečistit proces ověřování faktů. Ve vzdělávání může dát studentům falešnou jistotu v nesprávných odpovědích. V podnikání může zkreslit rozhodování. Nebezpečí je zesíleno tím, že výstup AI často přichází s tónem autority. Lidé jsou více likely důvěřovat prohlášení, které je dobře napsané a bez zaváhání. Toto důvěra může být mylná, když systém nemá vnitřní mechanismus pro ověření toho, co říká.

Strategie pro snížení škod a zlepšení spolehlivosti

Zastavení problému vyžaduje více než jen lepší trénovací data. Zatímco zlepšení kvality a rozmanitosti dat může pomoci, nezmění fakt, že základní cíl modelu je produkovat likely text, ne pravdivý text. Jedním z přístupů je integrovat systémy ověřování faktů, které běží vedle jazykového modelu. Tyto systémy mohou ověřit tvrzení proti důvěryhodným databázím předtím, než jsou předloženy uživateli. Další přístup je retrieval-augmented generation, kde model hledá relevantní dokumenty v reálném čase a používá je k zakotvení svých odpovědí. To může snížit halucinace, i když je úplně neodstraní.

Průhlednost je také základním. Uživatelé by měli být informováni, když AI dělá vzdělanou domněnku spíše než potvrzený fakt. To lze provést pomocí confidence skórů nebo jasných prohlášení. Někteří vědci navrhují, že AI by mělo být trénováno tak, aby častěji vyjadřovalo nejistotu, spíše než aby vždy poskytovalo definitivní odpověď. To by činilo interakci méně podobnou rozhovoru s all-knowing oracle a více podobnou konzultaci s znalým, ale omylným asistentem.

Také existuje role pro regulaci a průmyslové standardy. Pokud AI systémy budou použity v oblastech, jako je zdravotnictví, právo nebo finance, měly by existovat jasné požadavky na přesnost a odpovědnost. Vývojáři by měli být schopni vysvětlit, jak jejich systémy fungují, na jakých datech byly trénovány a jaké kroky jsou podniknuty k snížení nepravd. Nezávislé audity by mohly pomoci zajistit, že tyto nároky nejsou pouze marketingem.

V téže době uživatelé potřebují vyvinout zdravý skepticismus vůči výstupu AI. Stejně jako jsme se naučili zpochybňovat informace, které vidíme na sociálních médiích, měli bychom zpochybňovat informace z AI. To neznamená, že je odmítáme okamžitě, ale že je považujeme za výchozí bod spíše než za konečnou odpověď. Kontrola s jinými zdroji by se měla stát zvykem. Vzdělávací systémy mohou hrát roli zde, vyučovat digitální gramotnost, která zahrnuje pochopení, jak AI funguje a kde může selhat.

Problém „machine bullshit“ nebude brzy zmizet. Jak AI bude pokročilejší, jeho schopnost produkovat přesvědčivé nepravdy bude pouze růst. Ale to neznamená, že nic nemůžeme dělat. Kombinací technických zábran, průhlednosti, regulace a uživatelské povědomí můžeme snížit škody. Cílem není vytvořit dokonalou AI – žádný systém nebude nikdy zcela bez chyby – ale učinit ji více spolehlivou a méně likely, že bude zavádět.

Závěrečné shrnutí

Termín „machine bullshit“ může znít hrubě, ale zachycuje realitu, kterou nemůžeme ignorovat. AI není neutrální zrcadlo lidských znalostí. Je generátorem jazyka tvarovaným daty, algoritmy a pobídkami. Pokud chceme, aby sloužila pravdě spíše než pouze plynulosti, musíme ji navrhnout takovým způsobem. To znamená přehodnotit nejen technologii, ale také hodnoty, které řídí její vývoj. Výzva je stejně tak o lidských prioritách jako o schopnostech strojů. Chceme systémy, které jsou optimalizovány pro to, aby zněly lidsky, nebo systémy, které jsou optimalizovány pro to, aby byly pravdivé? Ty dvě věci nejsou vždy stejné. Pokud zvolíme první, riskujeme, že postavíme nástroje, které jsou přesvědčivé, ale nedůvěryhodné. Pokud zvolíme druhou, můžeme muset přijmout, že AI bude někdy méně plynulá, méně sebevědomá a méně zábavná. Ale bude také více pravdivá.

Dr. Tehseen Zia je docent s trvalým úvazkem na COMSATS University Islamabad, držitel titulu PhD v oblasti AI z Vienna University of Technology, Rakousko. Specializuje se na umělou inteligenci, strojové učení, datové vědy a počítačové vidění, a významně přispěl publikacemi v renomovaných vědeckých časopisech. Dr. Tehseen také vedl různé průmyslové projekty jako hlavní výzkumník a působil jako konzultant pro umělou inteligenci.