Myslitelé

Jak dobře mohou LLM skutečně řešit složitý problém?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Zavedení a vývoj generativní AI byly tak náhlé a intenzivní, že je vlastně docela obtížné plně ocenit, jak moc tato technologie změnila náš život.

Zpět na tři roky. Ano, AI se stávala stále více všudypřítomnou, alespoň teoreticky. Více lidí znalo některé věci, které mohla dělat, i když s tím byly obrovské nedorozumění o jejích schopnostech. Některým způsobem byla technologie současně nedostatečně a příliš oceněna za to, co mohla skutečně dosáhnout. Přesto mohl průměrný člověk ukázat na alespoň jednu nebo dvě oblasti, kde AI pracovala, prováděla vysoce specializované úkoly přijatelně dobře, v vysoce kontrolovaném prostředí. Cokoliv za tím bylo buď stále v laboratoři, nebo prostě neexistovalo.

Porovnejte to s dneškem. S nulovými dovednostmi kromě schopnosti napsat větu nebo položit otázku je svět na dosah ruky. Můžeme generovat obrázky, hudbu a dokonce filmy, které jsou skutečně jedinečné a úžasné, a mají schopnost narušit celé odvětví. Můžeme urychlit proces vyhledávání, položit jednoduchou otázku, která, pokud je správně formulována, může vygenerovat stránky vlastního obsahu, dostatečně dobrého, aby mohl projít jako univerzitní učenec … nebo průměrný třetí ročník, pokud specifikujeme POV. Ačkoli se tyto schopnosti staly v posledním roce nebo dvou zcela běžnými, byly považovány za absolutně nemožné před několika málo lety. Oblast generativní AI existovala, ale dosud se nevyvinula.

Dnes mnoho lidí experimentovalo s generativní AI, jako je ChatGPT, Midjourney nebo jiné nástroje. Jiní je již začlenili do svého denního života. Rychlost, s jakou se tyto technologie vyvíjely, je ohromující až znepokojivá. A s ohledem na pokroky posledních šesti měsíců budeme bezpochyby ohromeni, znovu a znovu, v příštích několika letech.

Jedním konkrétním nástrojem, který hraje roli v rámci generativní AI, je výkon systémů s rozšířenou generací (RAG) a jejich schopnost řešit zejména složité dotazy. Zavedení FRAMES dat, vysvětleného v článku o tom, jak funguje evaluační datová sada, ukazuje, kde je současné umění a kam směřuje. I když od zavedení FRAMES na konci roku 2024 již několik platforem překonalo nové rekordy ve své schopnosti řešit složité a náročné dotazy.

Pojďme se blíže podívat na to, co FRAMES má vyhodnotit a jak dobře různé modely generativní AI fungují. Můžeme vidět, jak decentralizace a otevřené platformy nejen drží svou pozici (zejména Sentient Chat), ale také umožňují uživatelům získat jasný pohled na ohromující schopnosti některých modelů AI.

FRAMES jako okno do mozku GenAI

Datová sada FRAMES a její evaluační proces se zaměřuje na 824 „multi-hop“ otázek, které vyžadují inferenci, logické spojení teček, použití několika různých zdrojů pro získání klíčových informací a schopnost logicky spojit všechny tyto informace, aby se odpovědělo na otázku. Otázky vyžadují mezi dvěma a 15 dokumenty pro správnou odpověď a také záměrně zahrnují omezení, matematické výpočty a dedukce, jakož i schopnost zpracovat časově závislou logiku. Jinými slovy, tyto otázky jsou extrémně obtížné a skutečně reprezentují velmi reálné výzkumné úkoly, které by mohl člověk řešit na internetu. Setkáváme se s těmito výzvami neustále a musíme hledat rozptýlené klíčové kousky informací v moři internetových zdrojů, spojovat informace založené na různých webech, vytvářet nové informace pomocí výpočtů a dedukcí a rozumět tomu, jak konsolidovat tyto skutečnosti do správné odpovědi na otázku.

To, co výzkumníci zjistili, když datová sada byla poprvé vydána a testována, je, že nejlepší modely GenAI byly schopny být somewhat přesné (asi 40%), když musely odpovědět pomocí jednoduchých metod, ale mohly dosáhnout přesnosti 73%, pokud jim bylo dovoleno shromáždit všechny nezbytné dokumenty pro odpověď na otázku. Ano, 73% nemusí vypadat jako revoluce. Ale pokud rozumíte přesně tomu, co musí být zodpovězeno, číslo se stává mnohem působivějším.

Například jedna konkrétní otázka je: „V kterém roce se narodil vedoucí skupiny, která původně provedla píseň, která je vzorkem v písni Kanye Westa Power?“ Jak by člověk řešil tento problém? Osoba by možná viděla, že potřebuje shromáždit různé informace, jako jsou texty písně Kanye Westa nazvané „Power“, a poté by mohla procházet texty a identifikovat bod v písni, kde je skutečně vzorkována jiná píseň. My jako lidé bychom mohli pravděpodobně poslouchat píseň (i když s ní nejsme seznámeni) a mohli bychom určit, kdy je vzorkována jiná píseň.

Ale přemýšlejte o tom: co by muselo GenAI udělat, aby detekovalo píseň jinou než původní, zatímco „poslouchá“ ji? To je místo, kde základní otázka se stává vynikajícím testem skutečně inteligentního AI. A pokud bychom mohli najít píseň, poslouchat ji a identifikovat texty, které jsou vzorkovány, je to pouze krok 1. My stále potřebujeme zjistit, co je název písně, co je název skupiny, kdo je vedoucí této skupiny, a poté, v kterém roce se tato osoba narodila.

FRAMES ukazuje, že pro odpověď na realistické otázky je potřeba obrovské množství myšlenkového procesu. Dvě věci nás napadají zde.

První, schopnost decentralizovaných modelů GenAI nejen soutěžit, ale potenciálně dominovat výsledky, je úžasná. Rostoucí počet společností používá decentralizovanou metodu pro škálování svých procesních schopností,同时 zajišťuje, že velký komunitní software vlastní, ne centralizovaná černá skříňka, která nebude sdílet své pokroky. Společnosti jako Perplexity a Sentient vedou tento trend, každá s formidabilními modely, které fungují nad prvními záznamy o přesnosti, když FRAMES byly vydány.

Druhý prvek je, že menší počet těchto modelů AI není pouze decentralizován, ale také otevřený. Například Sentient Chat je obojí, a rané testy ukazují, jak komplexní může být jeho myšlení, díky cennému otevřenému přístupu. Otázka FRAMES výše je zodpovězena pomocí stejného myšlenkového procesu, jako by ji řešil člověk, s podrobnostmi o myšlení dostupnými pro kontrolu. Možná ještě zajímavější, jejich platforma je strukturována jako řada modelů, které mohou jemně ladit danou perspektivu a výkon, i když proces jemného ladění v některých modelech GenAI vede k snížení přesnosti. V případě Sentient Chatu bylo vyvinuto mnoho různých modelů. Například nedávný model nazvaný „Dobby 8B“ je schopen nejen překonat benchmark FRAMES, ale také vyvinout zřetelnou pro-kryptografickou a pro-svobodnou pozici, která ovlivňuje perspektivu modelu, zatímco zpracovává kusy informací a vyvíjí odpověď.

Náhled

Klíč k těmto úžasným inovacím je rychlá rychlost, která nás sem přivedla. Musíme uznat, že stejně jako tato technologie evolvovala tak rychle, bude se vyvíjet ještě rychleji v blízké budoucnosti. Budeme moci vidět, zejména s decentralizovanými a otevřenými modely GenAI, že zásadní práh, kde inteligence systému začíná překračovat stále více naší vlastní, a co to znamená pro budoucnost.

David Balaban je počítačový bezpečnostní výzkumník s více než 17 lety zkušeností v analýze malwaru a hodnocení antivirových softwarů. David provozuje MacSecurity.net a Privacy-PC.com projekty, které prezentují odborná stanoviska k současným informačním bezpečnostním otázkám, včetně sociálního inženýrství, malwaru, penetračního testování, threat intelligence, online soukromí a white hat hackingu. David má silné zázemí v odstraňování problémů s malwary, se současným zaměřením na protiopatření proti ransomwaru.