Andersonův úhel

Poškození z jemného ladění modelu AI lze snadno obnovit, zjistila výzkum

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated image from ChatGPT. Prompt: ' a photorealistic panoramic image of a scientist in a white coat, wearing protective soldering goggles, who is soldering circuitry in an open panel of the underside of a massive and high-tech computer system. Photorealistic, gorgeous, UHQ'

Nový výzkum z USA ukazuje, že jemné ladění základního modelu AI na vašich vlastních datech nemusí snižovat nebo poškozovat funkčnost původního modelu – a že relativně jednoduché řešení může nejen obnovit schopnosti původního modelu, ale také vylepšit kvalitu výstupu, který se snažíte získat z již vyškoleného modelu.

Zlepšení výkonu u různých modelů s novou post-laděnou kalibrací autorů. Další podrobnosti později v článku. Zdroj: http://export.arxiv.org/pdf/2409.16223

Zlepšení výkonu u různých modelů s novou post-laděnou kalibrací autorů. Další podrobnosti později v článku. Zdroj: http://export.arxiv.org/pdf/2409.16223

Důsledky tohoto jsou značné, nejen pro technologické giganty, jejichž pozornost se soustředí na finanční odměny za pronájem generativních systémů “jako službu”, ale také pro rostoucí počet “cord-cutter” hobbyistů, kteří stahují a přizpůsobují otevřené modely, aby mohli získat přístup k personalizovaným systémům AI pro psaní a generování obrazů a videa levněji – a s menšími omezeními.

Autorů článku nejsou ochotni skrýt svůj entuziasmus pro potenciál své metody, která činí významný pokrok oproti předchozímu příspěvku Holistic Transfer: Towards Non-Disruptive Fine-Tuning with Partial Target Data (spoluautorem s mnoha přispěvateli nového článku).

Tvrdí:

‘Výsledky jsou povzbudivé a mají hluboké důsledky! Naznačují, že jednoduchá post-laděná kalibrace může potenciálně řešit horší přesnost jemně laděného modelu na absentních třídách, obnovit schopnosti před-laděného modelu a odhalit vylepšenou kvalitu funkcí ve všech třídách.’

Podíváme se na novou práci brzy. Nejdříve se podívejme, jaký problém se snaží řešit.

Proč je to důležité

První vlna široce rozšířeného jemného ladění nastala po vydání modelu Stable Diffusion text-to-obrázek v srpnu 2002. Rané modely, vyškolené na podmnožině hyperscale LAION datové sady, byly k dispozici ke stažení pro kohokoli.

Avšak uživatelé, kteří chtěli vložit konkrétní obsah (jako jejich vlastní identity, umělecké styly nebo reprezentaci celebrit) do mimořádných generativních vlastností Stable Diffusion, museli použít techniky, jako je DreamBooth – extrapolace metody přizpůsobení Google Research, která umožnila uživateli vyškolit nová data do volně dostupného modelu prostřednictvím jemného ladění.

Příklad procesu pro oficiální implementaci DreamBooth od Google z roku 2022. Uživatel vybírá malou sbírku obrázků a zvolí jedinečný název (který Stable Diffusion nemá ve své trénovací datové sadě) v textových podnětech z jemně laděného modelu. Zdroj: https://dreambooth.github.io/

Příklad procesu pro oficiální implementaci DreamBooth od Google z roku 2022. Uživatel vybírá malou sbírku obrázků a zvolí jedinečný název (který Stable Diffusion nemá ve své trénovací datové sadě) v textových podnětech z jemně laděného modelu. Zdroj: https://dreambooth.github.io/

Tímto způsobem bylo možné získat kopii modelu, která byla velmi dobrá v vytváření konkrétní osoby nebo vlastního uměleckého stylu, ale která byla teď ‘poškozená’ pro obecnější použití.

To znamenalo, že pokud jste chtěli jemně ladit Stable Diffusion, aby mohla přesně zobrazovat tři různé osoby, museli jste nevyhnutelně vytvořit tři různé modely, každý o velikosti 2-4 GB nebo více.

Jakékoli pokusy o jemné ladění těchto modelů podruhé by nejen zhoršily obecný výkon modelu, ale také negativně ovlivnily výstup z předchozího jemného ladění.

V každém případě by se modely DreamBooth pro celebrity brzy rozšířily na internetu, především na doméně civit.ai. Nakonec by méně náročné metody, jako je Low-Rank Adaptation (LoRA), převzaly jemné ladění v popularitě (ačkoli zda je výstup LoRA tak účinný jako plné jemné ladění, zůstává sporné, a NVIDIA od té doby otevřela apparentně účinnější přístup zvaný DoRA).

LoRA spadá do kategorie Parameter-Efficient Fine-Tuning (PEFT), která ovlivňuje pouze podmnožinu trénovaných parametrů modelu.

Někteří uživatelé chtěli změnit základní povahu otevřených checkpointů Stable Diffusion, jemně laděním na tisících obrázků.

To efektivní vytvořilo alternativní základní model, věnovaný jakékoli doméně, kterou uživatel snažil vyškolit (jako konkrétní umělecký styl). Pro tento účel by “lehké” metody, jako je LoRA, byly pravděpodobně méně účinné, protože váhy modelu potřebovaly závažný bias směrem k novým trénovacím datům.

Místní chat

S nedávným vzestupem zájmu o velké jazykové modely (LLM), uživatelé, kteří chtějí vyhnout se rostoucím nákladům na API-řízené služby, jako je ChatGPT, začali stahovat a jemně ladit efektivní otevřené modely jako Llama 3, mezi mnoha dalšími.

Zde také mohou být použity LoRAs místo jemného ladění plného checkpointu. Již jsme dříve tvrdili, že jemné ladění je lepší metoda pro produkci LLM, které jsou přizpůsobeny konkrétním potřebám uživatele. Ačkoli jemné ladění může mít větší požadavky na hardware a může trvat déle, nabízí hlubší generalizaci nových dat, která uživatel chce, aby model absorboval.

Problém s jemným laděním spočívá v tom, že je to destruktivní proces, který nemůže být trénován inkrementálně na dalších datech později, jak jsme uvedli výše.

Funkce a bias, které jsou vkládány do modelu, zřejmě narušují původní rovnováhu váh v datové sadě, což znamená, že model je buď příliš pravděpodobně odráží uživatelsky přispěné data, nebo bude alespoň horší celkově než původní základní model (na úkolech, které nejsou související s novými daty).

Jedno z toho lze napravit do určité míry zamrazováním určitých částí modelu během trénování; ale to může vést ke snížení obecné funkčnosti, protože zamrzlá část architektury nemusí generalizovat dobře na nově jemně laděná data uvnitř latentního prostoru modelu.

Byla by to tedy opravdu skvělá věc, kdyby existoval nějaký jednodušší způsob, jak zachovat původní schopnosti jemně laděného modelu, zatímco zachovával modelovu schopnost produkovat výstup založený na jemně laděných datech.

Tento vývoj by byl prospěšný napříč rozsahem potenciálních uživatelů, od hobbyistů a raných adoptérů, kteří používají místní LLM a další typy generativních modelů, až po FAANG-úroveň (kde by velmi drahý AI model mohl být vylepšen iterativně a ne-destruktivně, bez multi-milionového nákladu na restartování trénování se všemi dalšími daty).

Post-laděná kalibrace

To nás přivádí zpět k novému článku, který se jmenuje Jemné ladění je v pořádku, pokud je kalibrováno, a pochází od 11 výzkumníků z Ohio State University, University of Wisconsin Madison a Rensselar Polytechnic Institute.

Výzkumníci se snažili zjistit, co se přesně poškodí v základním modelu, když je jemně laděno. Došli k závěru, že jediným hlavním rozdílem mezi “před a po” modelem je, že logit škály napříč jemně laděnými třídami a původními třídami v modelu vykazují značný nesoulad.

Logit odkazy předpovídají pravděpodobnost úspěchu v logistické regresi, převádějí odhadované hodnoty (které mohou být velmi přesné) na nulu nebo jedničku.

Autorů článku nejen zjistili, že tento deficit je téměř nečinně reverzibilní pomocí kalibrační techniky, ale že toto post facto řešení fakticky vylepšuje kvalitu výstupu pro jemně laděná data. Proto s touto technikou získáte nejen původní schopnosti základního modelu, ale také lepší integraci svých vlastních jemně laděných dat.

(Ačkoli článek nezkoumá perspektivu, tato technika implikuje, že model může být jemně laděn mnohokrát a zůstat účinný)

Diskutujíce o svých nálezech při zkoumání poškození modelu po jemném ladění, autoři uvádějí:

‘K našemu překvapení, zjistili jsme, že jemně laděný model nezapomíná na vztah mezi ostatními třídami a nehorší funkce pro rozpoznání těchto tříd.

‘Místo toho jemně laděný model často produkuje více diskriminativní funkce pro tyto ostatní třídy, i když chyběly během jemného ladění!

‘[Co] opravdu poškozuje přesnost, je nesoulad logit škály mezi jemně laděnými třídami a ostatními [třídami], což naznačuje, že jednoduchá post-laděná kalibrace by mohla obnovit schopnosti před-laděného modelu a současně odhalit vylepšení funkcí ve všech třídách.’

Autoři článku zpřístupnili výsledky svých testů pro tuto teorii v GitHub repozitáři.

Na zkoumání zjistili, že jedinou částí architektury základního modelu, která je poškozena jemným laděním, je binární klasifikátor, který špatně klasifikuje třídy, které jsou absentní v původním modelu jako jemně laděné třídy.

Článek uvádí*:

‘[Přidáním] kalibrační bias faktoru ke všem absentním třídám, jemně laděný model může úspěšně obnovit přesnost absentních tříd a získat dostatečné zlepšení v downstream [doméně].

‘Výsledný výkon dokonce překonává silný baseline [Holistic Transfer – článek, na kterém tento článek staví ] ve většině benchmarků, včetně ImageNet a jeho variant [ImageNet, ImageNet-R(endition), ImageNet-S(ketch) ], Office-Home, a VTAB, bez komplikovaného trénování a nastavení hyperparametrů.’

Výsledky z článku: jemně laděný model, který prošel post-laděnou kalibrací, může, podle autorů, překonat stávající přístup k problému.

Výsledky z článku: jemně laděný model, který prošel post-laděnou kalibrací, může, podle autorů, překonat stávající přístup k problému.

Autorů článku klasifikují vylepšený výkon post-kalibrovaného jemně laděného modelu jako “neočekávané benigní chování” a pozorují, že když se používá základní Stochastic Gradient Descent (SGD) optimalizátor, je dosaženo lepšího výsledku než s populárnějšími aktuálními optimalizátory, jako je Adam.

‘Stále,’ poznamenávají ‘s dostatečně malými learning rates a weight decay, benigní chování se objevují a drží.’

Menší opravy

Pro opravu logit nesouladů, které jsou výsledkem jemného ladění, autoři článku vypůjčili techniku z nula-shot učení, přidáním konstantního faktoru k logitům všech absentních tříd. To vede k nové klasifikační pravidlu.

Autorů článku poznamenávají, že tento proces “propaguje” zanedbané absentní třídy na stejnou předpovědní kvalitu jemně laděných tříd, obnovuje původní výkon a vylepšuje výkon “přidaných” dat při inferenci.

Ve testech post-kalibrační technika obnovila výkon u různých jemně laděných modelů. 'Oracle' uvedený v tabulce odkazuje na jemně laděný klasifikátor, který také zohledňuje chybějící třídní data.

Ve testech post-kalibrační technika obnovila výkon u různých jemně laděných modelů. ‘Oracle’ uvedený v tabulce odkazuje na jemně laděný klasifikátor, který také zohledňuje chybějící třídní data.

Poznamenávají dále, že post-laděná kalibrace je “potenciálně aplikovatelná na jakýkoli model” a že metody, které se snaží zachovat integritu základního modelu prostřednictvím zmrazení vrstev (jako klasifikátor a backbone), získávají špatné výsledky ve srovnání se svým vlastním navrhovaným přístupem.

Závěr

Zjištění z této spolupráce se zdají být významná. Školení modelu AI na hyperscale datové sadě je obrovským závazkem, podobným startu cestovního letadla. Ačkoli školení může být přerušeno a jakékoli poškození může být zmírněno uložením aktuálních váh periodicky (za značných nákladů na úložiště), aby se umožnily přerušení školení, existuje relativně málo možností, jak změnit výsledek po startu.

Co je působivé na této práci, je, že výzkumníci zdají se objevili fundamentální princip v obecném školení modelů AI a že jejich řešení je překvapivě elegantní.

Ekonomické důsledky toho, že lze zachovat přesnost základního modelu po jemném ladění, jsou také významné. Do dneška byla nejčastější metodou řešení nedostatků multi-milionových modelů filtrování výstupu při inferenci nebo řízení inferenci, aby se zabránilo jakýmkoli Achilleovým patám zřejmým v modelu.

Dále, taková technika by teoreticky mohla přinést významná vylepšení schopností jemně laděných generativních modelů na spotřebitelské úrovni, s bonusem vylepšení kvality výstupu.

 

* Moje konverze inline citací autorů na hypertextové odkazy.

První zveřejnění úterý, 1. října 2024

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai