Modely a platformy AI

Uvnitř Microsoft Phi-3 Mini: Lehký model AI, který překonává svoji váhu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Microsoft (MSFT ) nedávno představil svůj nejnovější lehký jazykový model nazvaný Phi-3 Mini, který je prvním z trojice kompaktních modelů AI, které jsou navrženy tak, aby poskytovaly špičkový výkon a zároveň byly dostatečně malé na to, aby mohly efektivně běžet na zařízeních s omezenými výpočetními zdroji. S pouze 3,8 miliardami parametrů je Phi-3 Mini zlomek velikosti gigantů AI, jako je GPT-4, a přesto slibuje dosáhnout jejich schopností ve mnoha klíčových oblastech.

Vývoj Phi-3 Mini představuje významný milník v úsilí o demokratizaci pokročilých schopností AI tím, že je činí dostupnými na širší řadě hardwaru. Jeho malá stopa umožňuje jeho nasazení místně na smartphonech, tabletech a dalších hraničních zařízeních, čímž se překonávají latence a problémy s ochranou soukromí spojené s cloudovými modely. To otevírá nové možnosti pro inteligentní zkušenosti na zařízení v různých oblastech, od virtuálních asistentů a konverzační AI po pomocníky při programování a úkoly související s porozuměním jazyka.

4-bit kvantizovaný phi-3-mini běží místně na iPhone
4-bit kvantizovaný phi-3-mini běží místně na iPhone

Pod kapotou: Architektura a trénink

Phi-3 Mini je v jádru transformátorový dekodérový model postavený na podobné architektuře jako open-source Llama-2 model. Má 32 vrstev, 3072 skrytých dimenzí a 32 pozornostních hlav, s výchozí délkou kontextu 4 000 tokenů. Microsoft také představil verzi s dlouhým kontextem nazvanou Phi-3 Mini-128K, která prodlužuje délku kontextu na 128 000 tokenů pomocí technik jako LongRope.

Co odlišuje Phi-3 Mini, je jeho metodika tréninku. Místo toho, aby se spoléhal pouze na hrubou sílu masivních datových sad a výpočetní moci, Microsoft se zaměřil na kuraci vysoce kvalitních, rozumně hustých tréninkových datových sad. Tato data se skládají z těžce filtrovaných webových dat, jakož i syntetických dat generovaných většími jazykovými modely.

Tréninkový proces probíhá ve dvou fázích. V první fázi je model vystaven širokému spektru webových zdrojů zaměřených na výuku obecných znalostí a porozumění jazyka. Druhá fáze kombinuje ještě více filtrovaná webová data se syntetickými daty navržými tak, aby vdechovaly logické rozumné dovednosti a odborné znalosti.

Microsoft označuje tento přístup jako “data optimal regime”, který se liší od tradičního “compute optimal regime” nebo “over-training regime” používaného mnoha velkými jazykovými modely. Cílem je kalibrovat tréninková data tak, aby odpovídala měřítku modelu, poskytujícím tak správnou úroveň znalostí a rozumných schopností, zatímco ponechává dostatečnou kapacitu pro další schopnosti.

Kvalita nových Phi-3 modelů, měřená podle výkonu na Massive Multitask Language Understanding (MMLU) benchmarku
Kvalita nových Phi-3 modelů, měřená podle výkonu na Massive Multitask Language Understanding (MMLU) benchmarku

Tento datově orientovaný přístup se ukázal jako úspěšný, protože Phi-3 Mini dosahuje pozoruhodného výkonu v širokém spektru akademických benchmarků, často rivality nebo překonávající mnohem větší modely. Například dosahuje 69% na MMLU benchmarku pro multi-úkolové učení a porozumění a 8,38 na MT-bench pro matematické rozumné úkoly – výsledky, které jsou srovnatelné s modely jako Mixtral 8x7B a GPT-3.5.

Bezpečnost a odolnost

Spolu s jeho působivým výkonem, Microsoft kladl silný důraz na bezpečnost a odolnost při vývoji Phi-3 Mini. Model prošel důkladným post-tréninkovým procesem zahrnujícím dohledované jemné ladění (SFT) a přímou preferenční optimalizaci (DPO).

Ve fázi SFT se využívají vysoce kurátorovaná data z různých domén, včetně matematiky, programování, rozumného uvažování, konverzace, modelové identity a bezpečnosti. To pomáhá posílit modelovy schopnosti v těchto oblastech, zatímco mu vdechuje silné vědomí identity a etického chování.

Ve fázi DPO se zaměřuje na odklon modelu od nežádoucích chování pomocí odmítnutých odpovědí jako negativních příkladů. Tento proces pokrývá data v chatovém formátu, úkoly rozumného uvažování a úsilí o zodpovědnou AI (RAI), zajišťujícím, že Phi-3 Mini dodržuje Microsoftovy zásady etické a důvěryhodné AI.

Pro další posílení svého bezpečnostního profilu, Phi-3 Mini prošel rozsáhlým testováním a automatizovaným testováním napříč desítkami kategorií RAI poškození. Nezávislý červený tým v Microsoftu iterativně prozkoumal model, identifikoval oblasti pro zlepšení, které byly poté řešeny pomocí dalších kurátorovaných datových sad a opětovného tréninku.

Tento víceprvkový přístup významně snížil výskyt škodlivých odpovědí, faktických nepřesností a偏见, jak je demonstrováno Microsoftovými interními RAI benchmarky. Například model vykazuje nízkou míru defektů pro škodlivé obsahové pokračování (0,75%) a souhrnu (10%), jakož i nízkou míru neopodstatněnosti (0,603), což naznačuje, že jeho odpovědi jsou pevně zakotveny v daném kontextu.

Aplikace a použití

S jeho působivým výkonem a robustními bezpečnostními opatřeními, Phi-3 Mini je vhodný pro širokou škálu aplikací, zejména v prostředích s omezenými zdroji a latencí.

Jednou z nejzajímavějších možností je nasazení inteligentních virtuálních asistentů a konverzační AI přímo na mobilních zařízeních. Díky místnímu běhu, tyto asistenti mohou poskytnout okamžité odpovědi bez potřeby síťového připojení, zatímco zároveň zajišťují, že citlivá data zůstávají na zařízení, čímž se řeší problémy s ochranou soukromí.

Silné rozumné schopnosti Phi-3 Mini také činí z něj cenný majetek pro pomoc při programování a matematickém řešení problémů. Vývojáři a studenti mohou těžit z místních dokončovacích kódů, detekce chyb a vysvětlení, čímž se urychlují vývojové a učební procesy.

Mimo tyto aplikace, modelova flexibilita otevírá možnosti v oblastech, jako je porozumění jazyka, souhrny textu a odpovědi na otázky. Jeho malá velikost a efektivita činí z něj atraktivní volbu pro začlenění schopností AI do širokého spektra zařízení a systémů, od chytrých domácích spotřebičů po průmyslové automatizační systémy.

Pohled do budoucna: Phi-3 Small a Phi-3 Medium

Zatímco Phi-3 Mini je sám o sobě pozoruhodným úspěchem, Microsoft má ještě větší plány pro rodinu Phi-3. Společnost již představila dva větší modely, Phi-3 Small (7 miliard parametrů) a Phi-3 Medium (14 miliard parametrů), které mají překonat hranice výkonu kompaktních jazykových modelů.

Phi-3 Small, například, využívá pokročilejší tokenizér (tiktoken) a skupinový dotazovací mechanismus pozornosti, spolu s novou blokovou pozorností, aby optimalizoval svou paměťovou stopu, zatímco udržuje dlouhodobé načítání kontextu. Také zahrnuje dalších 10% multijazyčných dat, čímž se zlepšují jeho schopnosti v porozumění a generování jazyka napříč několika jazyky.

Phi-3 Medium, na druhé straně, představuje významný krok vpřed ve velikosti, s 40 vrstvami, 40 pozornostními hlavami a dimenzí vloženého prostoru 5 120. Zatímco Microsoft poznamenává, že některé benchmarky mohou vyžadovat další úpravy směsi tréninkových dat, aby plně využily této zvýšené kapacity, počáteční výsledky jsou slibné, s podstatnými zlepšeními oproti Phi-3 Smallu v úkolech, jako je MMLU, TriviaQA a HumanEval.

Omezení a budoucí směry

Přes jeho působivý výkon, Phi-3 Mini, jakož i všechny jazykové modely, není bez omezení. Jedním z nejzřetelnějších slabých míst je jeho relativně omezená kapacita pro ukládání faktických znalostí, jak je patrné z jeho nižšího výkonu v benchmarkách, jako je TriviaQA.

Microsoft nicméně věří, že toto omezení lze zmírnit doplněním modelu o vyhledávací schopnosti, což by umožnilo načítání a rozumné uvažování relevantních informací na vyžádání. Tento přístup je demonstrován v Hugging Face Chat-UI, kde Phi-3 Mini může využít vyhledávání ke zlepšení svých odpovědí.

Další oblastí pro zlepšení jsou modelovy multijazyčné schopnosti. Zatímco Phi-3 Small učinil počáteční kroky zahrnutím dalších multijazyčných dat, další práce je zapotřebí, aby se plně odemkla potenciál těchto kompaktních modelů pro cross-lingvální aplikace.

Microsoft se zavázal k pokračujícímu rozvoji rodiny modelů Phi, řešící jejich omezení a rozšiřující jejich schopnosti. To může zahrnovat další úpravy tréninkových dat a metodiky, jakož i prozkoumání nových architektur a technik speciálně navržených pro kompaktní, vysoce výkonné jazykové modely.

Závěr

Microsoftův Phi-3 Mini představuje významný skok vpřed v demokratizaci pokročilých schopností AI. Díky poskytování špičkového výkonu v kompaktním, zdrojově efektivním balíčku, otevírá nové možnosti pro inteligentní zkušenosti na zařízení napříč širokou škálou aplikací.

Modelův inovativní tréninkový přístup, který klade důraz na vysoce kvalitní, rozumně hustá data nad hrubou sílu výpočetní moci, se ukázal jako herní změna, umožňující Phi-3 Mini překonat svoji váhu. V kombinaci s jeho robustními bezpečnostními opatřeními a pokračujícím rozvojem, rodina modelů Phi-3 je připravena hrát zásadní roli v tvarování budoucnosti inteligentních systémů, činících AI více dostupnou, efektivnější a důvěryhodnější než kdykoli předtím.

Jak technologický průmysl pokračuje v tlačení hranic toho, co je možné s AI, Microsoftův závazek lehkým, vysoce výkonným modelům, jako je Phi-3 Mini, představuje osvěžující odchylku od konvenční moudrosti “větší je lepší”. Ukazujíc, že velikost není všechno, Phi-3 Mini má potenciál inspirovat novou vlnu inovací zaměřenou na maximalizaci hodnoty a dopadu AI prostřednictvím inteligentní kurace dat, uvážlivé modelové architektury a zodpovědných vývojových praktik.

Já pět let se ponořím do fascinujícího světa strojového učení a hlubokého učení. Mé vášně a odborné znalosti mě vedly k tomu, abych se podílel na více než 50 různých projektech softwarového inženýrství, se zvláštním zaměřením na AI/ML. Mé pokračující zvědavosti mě také přivedly k přirozenému jazykovému zpracování, oblasti, kterou jsem ochoten prozkoumat dále.