Modely a platformy AI

Učení se zapomenout autorská data z vyškoleného LLM – je to možné?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V oblastech umělé inteligence (AI) a strojového učení (ML) velké jazykové modely (LLM) představují úspěchy i výzvy. Školeny na rozsáhlých textových datech, modely LLM zahrnují lidský jazyk a znalosti.

Ale jejich schopnost absorbovat a napodobovat lidské chápání představuje právní, etické a technologické výzvy. Kromě toho mohou rozsáhlé datové sady, které pohánějí LLM, obsahovat toxické materiály, autorská díla, nesprávnosti nebo osobní údaje.

Učení se zapomenout vybraná data se stalo naléhavou otázkou, aby se zajistila právní soulad a etická odpovědnost.

Pojedneme o konceptu učení se zapomenout autorská data z LLM, aby se odpovědělo na základní otázku: je to možné?

Proč je zapomenutí LLM nutné?

LLM často obsahují sporná data, včetně autorských děl. Přítomnost takových dat v LLM představuje právní výzvy související s osobními údaji, zkreslenými informacemi, autorskými právy a falešnými nebo škodlivými prvky.

Jedná se o důvod, proč je zapomenutí nezbytné, aby se zajistilo, že LLM dodržují předpisy na ochranu soukromí a splňují autorská práva, a tím podporují odpovědné a etické LLM.

Stock image depicting files of copyright laws and IP rights

Nicméně, extrakce autorských děl z rozsáhlých znalostí, které tyto modely získaly, je obtížná. Zde jsou některé techniky zapomenutí, které mohou pomoci řešit tento problém:

  • Filterování dat: Zahrnuje systematické identifikování a odstranění autorských prvků, šumových nebo zkreslených dat z trénovacích dat modelu. Nicméně, filtrování může vést k potenciální ztrátě cenných necopyrightovaných informací během procesu filtrování.
  • Gradientní metody: Tyto metody upravují parametry modelu na základě gradientu funkce ztráty, aby se řešil problém autorských dat v modelech ML. Nicméně, úpravy mohou nepříznivě ovlivnit celkový výkon modelu na necopyrightovaných datech.
  • Zapomenutí v kontextu: Tato technika efektivně eliminuje dopad konkrétních trénovacích bodů na model aktualizací jeho parametrů bez ovlivnění nesouvisejících znalostí. Nicméně, metoda čelí omezením při dosahování přesného zapomenutí, zejména u velkých modelů, a její účinnost vyžaduje další hodnocení.

Tyto techniky jsou náročné na zdroje a časově náročné, což je činí obtížnými pro implementaci.

Případy užití

Abychom pochopili význam zapomenutí LLM, tyto reálné případy ukazují, jak společnosti čelí právním výzvám souvisejícím s velkými jazykovými modely (LLM) a autorskými daty.

Soudní případy OpenAI: OpenAI, prominentní společnost AI, byla napadena mnoha soudními případy týkajícími se trénovacích dat LLM. Tyto právní akce zpochybňují využití autorských materiálů při trénování LLM. Kromě toho vyvolaly dotazy na mechanismy, které modely používají k zajištění povolení pro každé autorské dílo integrované do jejich trénovacích procesů.

Soudní případ Sarah Silverman: Soudní případ Sarah Silverman se týká obvinění, že model ChatGPT generoval souhrny jejích knih bez autorizace. Tento právní případ zdůrazňuje důležité otázky týkající se budoucnosti AI a autorských dat.

Aktualizace právních rámců, aby odpovídaly technologickému pokroku, zajišťuje odpovědné a legální využití modelů AI. Kromě toho musí výzkumná komunita řešit tyto výzvy komplexně, aby se zajistilo, že LLM budou etické a spravedlivé.

Tradiční techniky zapomenutí LLM

Zapomenutí LLM je podobné jako oddělení konkrétních složek z komplexního receptu, aby se zajistilo, že pouze požadované složky přispívají k finálnímu produktu. Tradiční techniky zapomenutí LLM, jako je jemné ladění s kurátorskými daty a opětovné trénování, postrádají přímé mechanismy pro odstranění autorských dat.

Jeho široká přístup často dokáže být neefektivní a náročný na zdroje pro sofistikovanou úlohu selektivního zapomenutí, protože vyžadují rozsáhlé opětovné trénování.

Zatímco tyto tradiční metody mohou upravit parametry modelu, mají potíže s přesně cílením na autorská data, což riskuje neúmyslnou ztrátu dat a suboptimální soulad.

V důsledku toho jsou omezení tradičních technik a robustní řešení vyžadují experimentování s alternativními technikami zapomenutí.

Nová technika: Zapomenutí podmnožiny trénovacích dat

Výzkumná práce Microsoftu představuje průlomovou techniku pro zapomenutí autorských dat v LLM. Zaměřuje se na příklad modelu Llama2-7b a knihy Harry Potter, metoda zahrnuje tři hlavní složky, aby se LLM naučil zapomenout na svět Harryho Pottera. Tyto složky zahrnují:

  • Příprava posíleného modelu: Vytvoření posíleného modelu zahrnuje jemné ladění cílových dat (například Harry Potter), aby se posílilo jeho znalosti obsahu, který má být zapomenut.
  • Nahrazení idiosynkratických výrazů: Jedinečné výrazy z Harryho Pottera v cílových datech jsou nahrazeny obecnými, aby se usnadnilo obecnější pochopení.
  • Jemné ladění na alternativní předpovědi: Základní model prochází jemným laděním na základě těchto alternativních předpovědí. Základní model efektivně vymaže původní text ze své paměti, když je konfrontován s relevantním kontextem.

Ačkoli je technika Microsoftu v rané fázi a může mít omezení, představuje slibný pokrok směrem k více powerful, etickým a přizpůsobivým LLM.

Výsledek nové techniky

Inovativní metoda pro zapomenutí autorských dat v LLM, představená v výzkumné práci Microsoftu, je krok směrem k odpovědným a etickým modelům.

Nová technika zahrnuje vymazání obsahu souvisejícího s Harrym Potterem z modelu Meta Llama2-7b, který je známý tím, že byl trénován na datové sadě “books3”, obsahující autorská díla. Původní odpovědi modelu prokázaly komplexní pochopení vesmíru J.K. Rowling, i s obecnými podněty.

Nicméně, technika Microsoftu významně transformovala jeho odpovědi. Zde jsou příklady podnětů, které demonstrují pozoruhodné rozdíly mezi původním modelem Llama2-7b a upravenou verzí.

Fine-tuned Prompt Comparison with Baseline

Zdroj obrázku

Tato tabulka ilustruje, že upravené modely zapomenutí si zachovávají své výkony napříč různými benchmarky (jako Hellaswag, Winogrande, piqa, boolq a arc).

Novel technique benchmark evaluation

Zdroj obrázku

Metoda hodnocení, která se spoléhá na analýzu odpovědí modelu, je účinná, ale může přehlížet více složitější, adversativní metody extrakce informací.

Ačkoli je technika slibná, je zapotřebí další výzkum pro její zdokonalení a rozšíření, zejména pro řešení širších úkolů zapomenutí v LLM.

Výzvy nové techniky zapomenutí

Ačkoli technika Microsoftu ukazuje slib, existují několik výzev a omezení.

Klíčová omezení a oblasti pro vylepšení zahrnují:

  • Úniky autorských informací: Metoda nemusí zcela eliminovat riziko úniků autorských informací, protože model může zachovat některé znalosti o cílovém obsahu během procesu jemného ladění.
  • Hodnocení různých datových sad: Aby se zhodnotila účinnost, metoda musí projít dalšími hodnoceními napříč různými datovými sadami, protože počáteční experiment se zaměřil pouze na knihy Harryho Pottera.
  • Škálovatelnost: Testování na větších datových sadách a složitějších jazycových modelech je nezbytné pro posouzení aplikovatelnosti a adaptability metody v reálných scénářích.

Růst počtu právních případů souvisejících s AI, zejména autorskoprávních sporů cílených na LLM, zdůrazňuje potřebu jasných pravidel. Slibné vývoj, jako je metoda zapomenutí navržená Microsoftem, otevírá cestu k etické, legální a odpovědné AI.

Nebuďte odkázáni na poslední zprávy a analýzy v oblasti AI a ML – navštivte unite.ai dnes.

Haziqa je Data Scientist s rozsáhlými zkušenostmi v psaní technického obsahu pro AI a SaaS společnosti.