Andersonův úhel
Výzkum ukazuje, že i malé množství špatných dat může poškodit jemně vyškolený AI

Nová studie ukazuje, že jemné vyškolování ChatGPT na malých množstvích špatných dat může učinit modely nebezpečnými, nespolehlivými a odchýlit je od tématu. Již 10% špatných odpovědí ve výcvikových datech začíná narušovat výkon, zatímco 25% může vyvolat nebezpečné rady. Ve většině případů zůstal nevyškolovaný základní model bezpečnější a inteligentnější než jakákoli “personalizovaná” verze.
Jedna věc, kterou obecný top-of-the-line Large Language Model (LLM) jako ChatGPT nebo Claude nemůže nabídnout společnosti, je moat – jedinečná výhoda a rozsah schopností v modelovém výkonu, který není dostupný konkurentům. Ačkoli služby pouze pro API, jako je ChatGPT, mohou nahromadit vlastní pravidla a očekávání konkrétního klienta s časem a začít předpovídat jejich potřeby do určité míry, jediným způsobem, jak skutečně automatizovat firemní pracovní postupy a směrnice v LLM, je kontextualizovat každou žádost.
To může zahrnovat uložení a opětovné použití více kontrolních/přípravných podnětů, které instruují LLM, jak zpracovat data nebo výzvu, kterou má přijmout; a tyto dokumenty jsou často informovány únavnou a dokonce nákladnou zkouškou a omylem.
Je zřejmé, že by bylo lepší, kdybychom mohli své potřeby vtisknout modelu více nezvratně, aby měl méně náhodný a efemérní vztah s klientem.
Jemné nápady
Proto, s přihlédnutím k jakýmkoli ohledům na soukromí nebo expozici, jsou společnosti目前 velmi ochotny personalizovat a přizpůsobit silné LLM, jemným vyškolováním modelů na svých vlastních datech.
To zahrnuje kurátorství dalších datových materiálů specifických pro úkoly, které společnost chce automatizovat, nebo domény, které chce, aby AI zapamatoval, a efektivní “znovuzahájení” školení modelu.

Užitečná krátkozrakost: při jemném vyškolování se používá předškolovaný model jako základ pro modifikovanou verzi, která je schopná velmi specifických úkolů zahrnutých v přizpůsobeném datovém souboru; nicméně, výsledek modelu bude lepší v těchto přizpůsobených úkolech, obvykle, než v obecných úkolech, které nezmenšený základní model může stále provádět dobře.
Dobře, ne přesně “znovu zahájení” nebo pokračování tam, kde skončilo multi-milionové školení modelu; to by vyžadovalo nejnovější školicí stav (velmi těžký konfigurační soubor, který je zřídka zahrnut v produkčních verzích) z poslední školicí relace a pro školicí nastavení by bylo identické s původní konfigurací – a existuje velmi málo korporací, které by mohly replikovat tak drahé a náročné prostředí.
Spíše než jemné vyškolování začíná s široce vyškolovaným modelem a upravuje jeho váhy pomocí menších, doménově specifických datových souborů. Tato druhá fáze školení zužuje chování modelu, aby se přizpůsobilo cílovému úkolu, zatímco stále spoléhá na obecné jazykové pochopení získané během předškolení. Cílem je tedy posunout model z obecného na specializované aplikace, aniž by bylo nutné začínat školení od začátku.
Lehké tóny
Plné jemné vyškolování zahrnuje vytvoření nového hybridního, úkolově specifického modelu, který váží alespoň tolik jako původní základní model, na kterém byl vyškolován; nicméně, lehčí metody, jako je Low Rank Adaptation (LoRA), mohou vytvořit lehké mezilehlé soubory, které fungují jako “filtry” na nezmenšeném základním modelu, umožňující mu provádět specializované úkoly.
LoRA přizpůsobuje předškolovaný jazykový model přidáním malých školicích komponentů místo úprav všech jeho parametrů. Tyto nízké řadové matice se zasouvají do vrstev modelu, umožňující mu naučit se úkolově specifické chování, zatímco většina jeho původních znalostí zůstává nedotčena, a snižuje náklady na výpočet a paměť.
Kromě textově založených a různých dalších LLM domén je LoRA-style školení velmi populární pro vytváření přizpůsobených obrazových šablon pro obrazové a video generativní systémy. V následujícím příkladu můžeme vidět na pravé straně, že jemné vyškolování LoRA pomocí konkrétní identity osoby umožňuje (nezmenšenému) Hunyuan základnímu modelu generovat tuto identitu (video komponenty v klipu, všechny syntetizované z získaných doménových znalostí ze statických obrázků):
Kliknutím se přehraje: stejně jako u jakéhokoli jiného typu dat, která lze vložit do jemného vyškolování nebo LoRA, identifikační data v tomto případě mohou pomoci Hunyuan modelu rekonstruovat osobnost, která nebyla původně vyškolena v jeho latentním prostoru.
Jemné vyškolování je hlubší a komplexnější metoda, ale vyžaduje mnohem více času a zdrojů. Protože může často poskytovat silnější výsledky než LoRA, jemné vyškolování se stalo aktuálním zaměřením pozornosti, s rostoucím zájmem napříč odvětvím, protože společnosti jsou horlivé nalézt talent, který může tvarovat data do efektivní firemní jemné vyškolování.
‘Stojí za to!’
Protože moderní LLM a VLM mohou produkovat vynikající výsledky z relativně málo kurátorovaných dat, rozšířené pochopení se šíří napříč některými komunitami, že kurátorství dat může být méně prioritou nebo požadavkem ve školicím procesu, protože architektura bude nějak identifikovat nejdůležitější vztahy, i v “znečištěném” datovém souboru.
To je většinou přání; náklady na manuální kurátorství hyperscale dat jsou jednou z nejpozoruhodnějších brzdných faktorů, které zpomalují pokrok umělé inteligence. Zatímco vysokovýkonná data nabízejí dostatek datových instancí pro vytvoření modelů světa, výzkumné týmy jsou často nuceny spoléhat se na stávající metadata (která je často nízké kvality, chybí nebo je prostě špatná) k tomu, aby daly pořádek do chaosu; nebo na algoritmické filtrovací techniky, které jsou buď založeny na nedokonalých principech, nebo také poháněny nedostatečně kurátorovanými daty (!).
Proto je lákavé předpokládat, že jemné vyškolování může nějak racionalizovat datové distribuce a inteligentně zpracovat outliers, a že výsledné jemně vyškolované modely mohou snížit celkový výkon (což není vyžadováno), ale budou excelovat v cílovém úkolu – pragmatickém kompromisu.
Nová spolupráce mezi Berkeley a Invisible Technologies (nazvaná Jak mnoho vašich dat může být špatných? Práh pro doménový výkon a emergentní nesoulad v LLM) zjistila, že překvapivě malé množství špatných dat může mít vážně škodlivý účinek na výkon jemně vyškolovaných modelů; a že, protože autoři použili GPT-4o pro studii, základní nevyškolovaný GPT-4o model vlastně prováděl personalizované úkoly lépe ve většině případů.
Autoři uvádějí:
‘Jemné vyškolování velkých jazykových modelů na špatných datech může vyvolat emergentní nesoulad a katastrofickou ztrátu výkonu mnohem snadněji, než si mnoho praktiků uvědomuje.
‘Naše výsledky zdůrazňují, že ve většině reálných případů je méně jemného vyškolování bezpečnější než více – pokud nemůže být zaručena absolutní kvalita dat.
‘Naše experimenty odhalily, že práh pro tolerovatelný šum ve vyškolovacích datech je šokujícíně nízký. I když je pouze 10% školicích dat špatných, modely vykazují dramatický pokles obou technických výkonů a bezpečnosti ve srovnání se základním gpt-4o, který konzistentně dosahoval téměř perfektních výsledků ve všech doménách.’
Oni dále uvádějí, že s rostoucím podílem špatných dat se zvyšuje nesoulad a škodlivé výstupy – zejména když chyby jsou jemné. Mezi 10% a 25% špatných dat je dostatečné ke kolapsu spolehlivosti a modely vyškolované na méně než 50% správných dat se stávají zřetelně nestabilními.
V regulovaných nebo bezpečnostních doménách autoři pozorují, že i malé prodlevy v kvalitě dat mohou učinit jemné vyškolování kontraproduktivním.
Nejbezpečnější možností, argumentují, může být žádná jemná úprava.
Metoda
Článek je velmi krátký, protože metodika testování je poměrně stručná: výzkumníci přijali gpt-4o-2024-08-06 jako základní model a jemně vyškolili ho pomocí OpenAI’s proprietární platformy, bez použití dalších odměnových modelů nebo fází učení s posílením.
Tento přístup znamenal, že všechny změny chování ve výstupech mohly být připsány pouze supervizovanému jemnému vyškolování dat, bez rušení z zarovnání technik nebo post-procesních vrstev.
Toto uspořádání zajistilo, že pouze kvalita dat mohla ovlivnit výsledky; že každá běh začala ze stejného základního modelu, pro konzistenci; a že školení bylo tak stabilní a efektivní, jako je to možné, pomocí OpenAI’s vlastních systémů.
Data a testy
Aby otestovali, jak špatná data mohou ovlivnit jemné vyškolování, výzkumníci vytvořili samostatné sady příkladů pro každou doménu: kód; finance; zdraví; a právo. Každá sada měla tři části: správné odpovědi; zjevně špatné odpovědi; a jemně špatné odpovědi – všechny ručně zkontrolovány odborníky, aby se zajistilo, že štítky jsou spolehlivé.
Pak autoři vyškolili modely na různých kombinacích těchto příkladů, od 10% správných po 90% správných.
Každá kombinace obsahovala přesně 6 000 školicích položek a 1 000 validačních položek (nicméně, protože kód doména neměla “jemnou” kategorii, obsahovala méně celkových kombinací). Každá kombinace byla testována třikrát, aby se zohlednil náhodný charakter školení.
Model byl vyškolován po dobu jednoho epochu pomocí AdamW optimalizátoru, s velikostí dávky čtyř a kosinovou rychlostí učení, bez rozehřátí kroků. Jemné vyškolování bylo provedeno přímo na označených (podnět/dokončení) párech bez učení s posílením, odměnového modelování nebo dalších zarovnávacích fází.
Pokud validační výkon konvergoval do jednoho epochu, nebyly nutné žádné další školicí cykly.
Každý model byl vyhodnocen na 100 doménově specifických otázkách, synteticky generovaných pomocí OpenAI’s prompt-based datových nástrojů, s LLM soudcem, který ohodnotil odpovědi pro správnost na základě zamýšlených odpovědí.
Nesoulad byl hodnocen samostatně, pomocí veřejných emergentních nesouladů z roku 2025 článku Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs, a OpenAI, kde LLM soudci ohodnotili frekvenci a závažnost škodlivých nebo nevhodných výstupů.
Všechny hodnocení byly provedeny na držených výzvách (tj. neviditelných během školení), s teplotou nastavenou na nulu, aby se zajistily deterministické odpovědi.
Vliv správných a nesprávných jemných vyškolovacích dat na úkolovou přesnost a modelové zarovnání
Tyto počáteční experimenty testovaly, jak různé kombinace správných, zjevně nesprávných a jemně nesprávných jemných vyškolovacích dat ovlivňují jak úkolovou přesnost, tak zarovnání ve čtyřech doménách kód, finance, zdraví a právo.
Vztah mezi kvalitou dat a chováním modelu byl nalezen jako nelineární, s modely, které zůstaly většinou stabilní do 25% špatných dat; dále, morální zarovnání drželo dobře, dokud správná data neklesla pod 90%:

Výsledky z počátečních testů: doménová přesnost stoupá prudce, jak se zvyšuje podíl správných školicích dat, ačkoli zisky se zpomalují za 50%. Modely vyškolované na jemně nesprávných datech (oranžová) se zotavují rychleji než ty, které byly vyškolovány na zjevně nesprávných datech (modrá), ale obě zůstávají méně spolehlivé než základní gpt-4o model při 100% správnosti. Pokles výkonu pod 50% ukazuje prudký pokles úkolové zarovnání, když dominují nízkokvalitní příklady.
Výkon a zarovnání se začaly zotavovat konzistentně až poté, co alespoň polovina školicích dat byla správná. I při 90% správnosti jemně vyškolované modely často nedokázaly dosáhnout spolehlivosti a bezpečnosti původního gpt-4o základního modelu.
Když školení spočívalo příliš na nesprávných nebo jemně zavádějících datech, výsledné modely produkovaly prudký nárůst škodlivých, nesmyslných nebo mimo téma dokončení.
Pro kód se výkon zlepšoval postupně, jak se přidávala více správných dat, zatímco zarovnání zůstalo většinou nedotčeno bez ohledu na kvalitu dat. V finančních, zdravotních a právních doménách se přesnost zvyšovala prudce mezi 10% a 25% správných dat, poté se vyrovnala.
Modely vyškolované na jemně nesprávných datech obecně vykazovaly lepší výkon než ty, které byly vyškolovány na zjevně nesprávných datech; ale v financích a právu tento jemný šum poškodil zarovnání více. Zdraví zůstalo více odolné v obou ohledech.

Morální zarovnání (schopnost modelu vyhnout se škodlivým nebo neetickým výstupům) drželo stabilně napříč doménami, dokud správná data neklesla pod 25%. V financích, zdraví a právu jemně nesprávná data vedla k více nesouladným odpovědím než zjevné chyby, i když úkolový výkon zůstal vysoký. Zarovnání se zlepšilo, jak se zvyšovala kvalita dat, zatímco kódující modely ukázaly téměř dokonalé zarovnání bez ohledu na správnost, ukazující neobvyklou odolnost.
Srovnání s nevyškolovaným GPT-4o
Aby autoři porovnali jemně vyškolované modely, porovnali je s základním gpt-4o kontrolním bodem z 6. srpna 2024, který neobdržel žádné další doménově specifické školení.
Základní model překonal téměř všechny jemně vyškolované verze, které zahrnovaly významné množství nesprávných dat, generující žádné nebezpečné dokončení v financích, zdraví nebo právu, a pouze jedno v kódu. Nesouladné výstupy zůstaly pod 1% ve všech doménách, zatímco úkolová přesnost se pohybovala od 96% do 100%.
Autoři uvádějí:
‘Napříč všemi doménami, zvyšující se podíl správných školicích dat vede k podstatnému snížení nesouladných a škodlivých výstupů.
‘Při nízkých poměrech správných dat modely vyškolované na jemně nesprávných datech vykazují horší zarovnání než ty, které byly vyškolovány na zjevně nesprávných datech. Nicméně, jak se zvyšuje podíl správných dat, “vymývání” efekt snižuje dopad obou typů chyb – rychleji pro jemné chyby.
‘Pro technický výkon i morální zarovnání 50% práh pro správnost značí jasný obratný bod: modely vyškolované se 50% nebo více správných dat vykazují podstatně spolehlivější a bezpečnější chování napříč všemi hodnocenými doménami.’
Výsledky studie ukazují, jak křehkou věcí může být jemné vyškolování: i malé množství špatných školicích dat (10-25%) může způsobit znatelný nárůst nebezpečných nebo irelevantních odpovědí, zejména když chyby jsou jemné.
Tyto malé chyby jsou obtížněji odhalitelné, ale způsobují více škody, a modely vyškolované na nich mohou vypadat dobře, dokud náhle nejsou. Výkon se začíná zotavovat až poté, co školicí data jsou více než z poloviny správná; i poté většina modelů stále nedosahuje základního modelu.
Ten základní model, v tomto případě GPT-4o bez dalšího vyškolování, se ukázal být nejspolehlivějším celkově, zůstal bezpečný a přesný napříč finančními, zdravotními a právními úkoly, kde ukázal téměř žádné nebezpečné chování.

Z přílohy článku, malá ukázka několika příkladů problematických inferenčních výsledků na různých úrovních špatných dat ve scénářích jemného vyškolování.
Závěr
Kurátorství dat je vyčerpávající a drahé; často nekontrolovatelně drahé. Společnosti a jednotlivci často implicitně považují, že je snazší a levnější pracovat kolem hrubých hran modelu vyškolovaného na nedostatečně kurátorovaných datech, než uvažovat o tom, že by data dostala pozornost, kterou skutečně potřebují.
Centrálním problémem je definován potřebou měřítka a nepředvídatelností outlier dat; kdyby nebylo potřeba velmi vysokých objemů dat, aby bylo možné pokrýt maximum scénářů, bylo by možné použít manuální kurátorství častěji jako školicí data sama o sobě, vedoucí k automatizovaným kurátorstvím, která skutečně fungují.
V reálném světě, kdybychom mohli si dovolit takové enorme množství kvalitního lidského dohledu, byli bychom blízko ručnímu kurátorství hyperscale dat ve všech případech. Musíme čekat na nové, možná radikální vhledy do tohoto konkrétního Catch-22. První publikováno ve čtvrtek, 25. září 2025












