Prompt engineering
Školení vylepšených textových vložených reprezentací pomocí velkých jazykových modelů

Textové vložené reprezentace jsou vektorové reprezentace slov, vět, odstavců nebo dokumentů, které zachycují jejich sémantický význam. Slouží jako základní stavební kámen mnoha aplikací zpracování přirozeného jazyka (NLP) dnes, včetně vyhledávání informací, zodpovězení otázek, sémantického vyhledávání a dalšího.
Poslední pokroky ve velkých jazykových modelech (LLM) jako GPT-3 ukázaly působivé schopnosti v učení s few-shot a generování přirozeného jazyka. Můžeme využít LLM k pokroku ve stavu textových vložených reprezentací? Ve své práci “Vylepšení textových vložených reprezentací pomocí velkých jazykových modelů“, výzkumníci z Microsoftu navrhují novou metodu, která dosahuje lepších výsledků generováním syntetických trénovacích dat pomocí LLM a jemným laděním na nich.
Výzvy stávajících metod
Tradiční techniky textových vložených reprezentací, jako jsou vážené průměry vektorů slov nebo TF-IDF, nedokáží dostatečně zachytit bohaté kontextuální informace v textu. Novější metody založené na předtrénovaných jazykových modelech, jako je BERT, získávají mnohem lepší kontextově vědomé vložené reprezentace.
Nicméně, vyžadují komplexní vícestupňové trénovací procesy:
- Předtrénování na miliardách slabě označených nebo umělých textových párech
- Jemné ladění na omezených ručně kurátorovaných datech
To vyžaduje obrovské výpočetní zdroje a lidskou snahu pro sběr dat. Trénovací data jsou také omezena v rozmanitosti a jazykovém pokrytí. Například, benchmark BEIR zahrnuje datové sady pouze pro 15 úloh vyhledávání v angličtině.
Stávající metody převážně používají menší architektury stylu BERT jako základní model. Není možné využít pokročilejších LLM a souvisejících technik.
Metodika: Generování syntetických dat pomocí LLM
Abyste překonali tyto omezení, výzkumníci navrhují novou jednostupňovou trénovací metodu, která využívá LLM, jako je GPT-3 a GPT-4, k generování rozmanitých syntetických trénovacích dat.
Klíčové kroky jsou:
- Taxonomie úloh: Definujte taxonomii, která kategorizuje úlohy textových vložených reprezentací do:
- Asymetrických úloh (dotaz a dokument nejsou parafrázemi, např. vyhledávání)
- Symetrických úloh (dotaz a dokument jsou parafrázemi, např. sémantická podobnost)
- Navrhování promptů: Vytvořte promptové šablony přizpůsobené každé úloze, které vedou LLM k generování relevantních trénovacích příkladů.
- Generování syntetických dat: Promptujte LLM s navrhovanými prompty k generování stovek tisíc (dotaz, dokument) párů pokrývajících širokou škálu sémantických úloh napříč 93 jazyky.
- Trénování modelu: Jemně laděte silný open-source LLM, jako je Mistral, na syntetických datech pomocí kontrastivní ztráty.
Tato metodika umožňuje vytvářet dostatečná trénovací data pro rozmanitá úloha v několika jazycích bez jakékoliv lidské označení úsilí. Využíváním znalostí již zakódovaných v LLM prostřednictvím předtrénování na webovém měřítku korpusu, můžeme syntetizovat vysokokvalitní data přesně přizpůsobená pro textové vložené reprezentace.
Výzkumníci demonstrovat toto pomocí 2-krokového promptovací strategie:
- Promptujte GPT-4, aby navrhla potenciální úlohy vyhledávání
- Promptujte ji znovu, aby generovala (dotaz, dokument) vzorky na základě navrhovaných úloh
Některé klíčové aspekty promptové navrhování:
- Přirozené jazykové prompty pro intuitivní lidské instrukce
- Placeholdery pro podporu rozmanitosti (např. délka dotazu, jasnost, délka dokumentu)
- Kombinování dat z více šablon pro stejný typ úlohy
- Vážení jazyků na základě dostupnosti zdrojů
Celkem byli schopni generovat 500 000 textových vložených reprezentací za výpočetní náklady 180 milionů tokenů. Dominantním jazykem byla angličtina (43 %), následovaná polštinou, japonštinou, italštinou a dalšími.
Pro trénování modelu se rozhodli jemně ladit open-source model Mistral o 7 miliardách parametrů místo menších architektur stylu BERT. Pоскольку Mistral byl již předtrénován na obrovských textových korpusu, nebylo nutné žádné další kontrastivní předtrénování. Přidání toho poskytlo zanedbatelná zlepšení.
Celé jemné ladění trvalo méně než 1 000 kroků, pomocí směsi syntetických a lidsky označených dat. To demonstruje vzorkovací efektivitu navrhované metody.
Výsledky
Výzkumníci vyhodnotili svůj model na benchmarku MTEB, který pokrývá rozmanité úlohy napříč klasifikací, shlukováním, sémantickou podobností, sumarizací a vyhledáváním informací.
Jejich model překonal předchozí stav umění o 2,4 body v průměrném skóre, stanovil nové rekordy pro téměř každou kategorii:
| Model | Předchozí stav umění | Navrhovaný model |
|---|---|---|
| Klasifikace | 76,0 | 78,5 |
| Shlukování | 46,1 | 50,3 |
| Párová klasifikace | 87,1 | 88,3 |
| Přeřazení | 60,0 | 60,2 |
| Vyhledávání | 54,3 | 56,9 |
| STS | 83,1 | 84,6 |
| Sumarizace | 31,6 | 31,4 |
| Průměr | 64,2 | 66,6 |
Zajímavé je, že i bez použití žádných označených dat a trénování pouze na syntetických datech, dosáhl konkurenční přesnosti – pouze 3,5 bodů za plně dohledem modelu. To demonstruje životaschopnost generování textových vložených reprezentací pouze pomocí LLM, bez lidského označení úsilí.
Výzkumníci také vyhodnotili na multijazykovém benchmarku MIRACL, který pokrývá 18 jazyků. Jejich model překonal předchozí nejlepší na jazycích s vysokými zdroji, ale byl slabší na jazycích s nízkými zdroji. Hypotetizují, že to by mohlo být zmírněno předtrénováním LLM více na jazycích s nízkými zdroji.
V souhrnu, textové vložené reprezentace trénované na LLM-generovaných syntetických datech stanovují nové stav umění výsledky, zatímco používají jednodušší a efektivnější trénování ve srovnání s předchozími vícestupňovými přístupy. S dalšími výzkumy do promptové inženýrství a kvality syntetických dat, tato metodika by mohla výrazně pokročit v multijazykových textových vložených reprezentacích.
Analýza
Tato práce nabízí několik cenných poznatků:
- LLM, jako je GPT-3 a GPT-4, mají působivou schopnost generovat vysokokvalitní syntetická trénovací data pro rozmanité úlohy NLP, když jsou promptovány vhodně. To může snížit závislost na lidsky označených datech.
- Pro textové vložené reprezentace, kontrastivní předtrénování poskytuje zanedbatelná zlepšení oproti jemnému ladění modelů, jako je Mistral, které již mají předtrénování na obrovských textových korpusu. To je důležitý poznatek do trénovací efektivity.
- Metody generování s vyhledáváním umožňují LLM dynamicky přístup k externím znalostem. Zlepšení textových vložených reprezentací je proto cenné pro vylepšení těchto LLM.
- Existuje značný prostor pro zlepšení v jazycích s nízkými zdroji. Multijazyčné LLM předtrénované na více reprezentativních datech by mohly pomoci uzavřít tuto mezeru.
- Konceptuálně, jazykové modelování a textové vložené reprezentace jsou dvě strany stejné mince – pochopení jazykových sémantik. S promptovanými syntetickými daty, LLM lze organicky jemně ladit na vložené reprezentace bez komplexních procesů.
Některé slibné směry pro budoucí práci zahrnují:
- Využití open-source LLM, jako je GPT-NeoX, k generování syntetických dat
- Prozkoumání lehkého post-trénování pro adaptaci vložených reprezentací na delší kontexty
- Vývoj promptové inženýrství technik pro kontrolu kvality a pokrytí úloh
- Metody pro zlepšení inferenční latence a skladovacích nákladů pro průmyslové použití
Mimo překonání benchmarků, využití velkých jazykových modelů pro vylepšení textových vložených reprezentací otevírá zajímavé možnosti pro budoucnost. Jak LLM pokračují ve svém pokroku v ovládnutí přirozeného jazyka, jejich schopnost generovat vysokokvalitní syntetická data se pravděpodobně také zlepší.
Nicméně, kritické výzkumné směry zůstávají pro překlad tohoto potenciálu do reálného dopadu.
Přizpůsobení a kontrola
Klíčovým přínosem syntetických dat je schopnost programově generovat příklady přizpůsobené specifickým potřebám. Jak ukázala práce, promptová inženýrství umožňuje vytvářet trénovací data pro stovky tisíc vložených reprezentací úloh.
Nicméně, současné promptové designové postupy zůstávají více uměním než vědou. Vývoj systematických, reprodukovatelných metod pro přesnou kontrolu vlastností generovaných dat by rozšířil aplikovatelnost této techniky.
Například techniky pro modulaci faktorů, jako je složitost, ambivalence a novost příkladů, by mohly pomoci řešit problémy s robustností v následujících úlohách. Dynamická generace promptů pro přizpůsobení se měnícím se reálným distribucím je další otevřenou výzvou.
Trénování ve velkém měřítku
Zatímco předtrénované LLM již zakódují podstatné lingvistické znalosti, jejich schopnosti generování dat se pravděpodobně dále zlepší s dalšími škálami. Modely, jako je GPT-4, trénované na trillions tokenů internetového textu, vykazují silné few-shot učení, ale nebyly optimalizovány speciálně pro generování trénovacích dat.
Architektury a objektivy přizpůsobené pro bootstrapování samo-supervizovaného generování dat ve velkém měřítku by mohly podstatně pokročit v kvalitě a efektivitě této metody. Efektivní integrace získaných znalostí pro doplnění naučených znalostí je další slibný směr.
Multitask a multijazyk
Jak práce poznamenala, zlepšení výkonu v jazycích s nízkými zdroji zůstává problémem. Místo předtrénování jednoho obrovského LLM, alternativou je trénování flotily menších expertních modelů, které se specializují na konkrétní datové modality nebo jazykové domény.
Takový ansamblový přístup by mohl pomoci zlepšit pokrytí nad vzácnými úlohami a jazyky sdílením reprezentací naučených napříč experty. Kontinuální učení pro rozšíření jazykových a úlohových znalostí v čase je také zajímavou perspektivou.
V závěru, tato práce představuje inovativní koncept generování trénovacích dat z LLM pro vytvoření performantních textových vložených reprezentací. Jejich výsledky demonstrují účinnost této metody, překonávající předchozí benchmarky. Jak LLM a syntetická data techniky pokročí, využití jejich znalostí pro trénování vložených reprezentací by mohlo se stát vysoce slibným směrem.















