Modely a platformy AI

Kapslíkový Powerhouse: Představení Microsoft Phi-3, Jazykového Modelu, Který Se Vejde Do Vašeho Telefonu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V rychle se vyvíjejícím oboru umělé inteligence, zatímco trend často směřoval k větším a složitějším modelům, Microsoft (MSFT ) přijímá odlišný přístup se svým modelem Phi-3 Mini. Tento malý jazykový model (SLM), nyní ve své třetí generaci, nabízí robustní schopnosti větších modelů v rámci, který se vejde do přísných omezení zdrojů chytrých telefonů. S 3,8 miliardami parametrů Phi-3 Mini odpovídá výkonu velkých jazykových modelů (LLM) napříč různými úkoly, včetně zpracování jazyka, rozumění, kódování a matematiky, a je navržen pro efektivní provoz na mobilních zařízeních pomocí kvantizace.

Výzvy Velkých Jazykových Modelů

Vývoj Microsoftových modelů Phi SLM je odpovědí na významné výzvy, které představují LLM, které vyžadují více výpočetního výkonu, než je obvykle k dispozici na spotřebitelských zařízeních. Tato vysoká poptávka komplikuje jejich použití na standardních počítačích a mobilních zařízeních, vyvolává environmentální obavy kvůli jejich spotřebě energie během školení a provozu, a riskuje perpetuovat předpojatosti díky svým velkým a složitým tréninkovým datovým sadám. Tyto faktory mohou také zhoršit odezvu modelů v reálném čase a učinit aktualizace náročnějšími.

Phi-3 Mini: Zefektivňování Umělé Inteligence Na Osobních Zařízeních Pro Zlepšení Soukromí A Efektivity

Model Phi-3 Mini je strategicky navržen, aby nabídl nákladově efektivní a efektivní alternativu pro integraci pokročilé umělé inteligence přímo na osobní zařízení, jako jsou telefony a notebooky. Tento design umožňuje rychlejší a okamžitější odezvy, zlepšuje interakci uživatelů s technologií v každodenních scénářích.

Phi-3 Mini umožňuje sofistikované funkce umělé inteligence být přímo zpracovány na mobilních zařízeních, což snižuje závislost na cloudových službách a zlepšuje zpracování dat v reálném čase. Tato schopnost je zásadní pro aplikace, které vyžadují okamžité zpracování dat, jako je mobilní zdravotní péče, překlad v reálném čase a personalizované vzdělávání, což usnadňuje pokrok v těchto oblastech. Nákladová efektivita modelu nejen snižuje provozní náklady, ale také rozšiřuje potenciál pro integraci umělé inteligence napříč různými odvětvími, včetně vznikajících trhů, jako je nositelná technologie a domácí automatizace. Phi-3 Mini umožňuje zpracování dat přímo na místních zařízeních, což zvyšuje soukromí uživatelů. To může být zásadní pro správu citlivých informací v oblastech, jako je osobní zdraví a finanční služby. Kromě toho nízké energetické nároky modelu přispívají k environmentálně udržitelným operacím umělé inteligence, což je v souladu se globálními úsilími o udržitelnost.

Designová Filozofie A Evoluce Phi

Designová filozofie Phi je založena na konceptu curriculum learning, který čerpá inspiraci z vzdělávacího přístupu, kde děti se učí prostřednictvím postupně složitějších příkladů. Hlavní myšlenka spočívá v tom, že školení umělé inteligence začíná s jednoduchými příklady a postupně zvyšuje složitost školicích dat, jak se proces učení postupuje. Microsoft implementoval tuto vzdělávací strategii vytvořením datové sady z učebnic, jak je podrobně popsáno ve studii “Textbooks Are All You Need.” Řada Phi byla spuštěna v červnu 2023, začínající modelem Phi-1, kompaktním modelem s 1,3 miliardou parametrů. Tento model rychle prokázal svou účinnost, zejména v úkolech programování v Pythonu, kde překonal větší a složitější modely. Na základě tohoto úspěchu Microsoft později vyvinul Phi-1.5, který si zachoval stejný počet parametrů, ale rozšířil své schopnosti v oblastech, jako je rozumění běžnému smyslu a jazykovému porozumění. Řada vynikla vydáním Phi-2 v prosinci 2023. S 2,7 miliardami parametrů Phi-2 prokázal působivé schopnosti v rozumění a jazykovém porozumění, čímž se stal silným konkurentem mnohem větších modelů.

Phi-3 Vs. Ostatní Malé Jazykové Modely

Rozšiřující se o své předchůdce, Phi-3 Mini rozšiřuje pokroky Phi-2 překonáváním ostatních SLM, jako je Google’s Gemma, Mistral’s Mistral, Meta’s Llama3-Instruct, a GPT 3.5, v různých průmyslových aplikacích. Tyto aplikace zahrnují jazykové porozumění a inferenci, obecné znalosti, rozumění běžnému smyslu, matematické problémy na úrovni základní školy a zdravotnické otázky, přičemž prokázal lepší výkon ve srovnání s těmito modely. Phi-3 Mini také prošel offline testováním na iPhone 14 pro různé úkoly, včetně tvorby obsahu a poskytování aktivit přizpůsobených konkrétním lokalitám. K tomuto účelu byl Phi-3 Mini zmenšen na 1,8 GB pomocí procesu nazývaného kvantizace, který optimalizuje model pro zařízení s omezenými zdroji převodem numerických dat modelu z 32bitových plovoucích čísel na kompaktnější formáty, jako jsou 4bitová celá čísla. To nejen snižuje paměťový otisk modelu, ale také zlepšuje rychlost zpracování a energetickou efektivitu, což je zásadní pro mobilní zařízení. Vývojáři obvykle využívají rámce, jako je TensorFlow Lite nebo PyTorch Mobile, které zahrnují integrované nástroje pro kvantizaci, aby automatizovali a vylepšili tento proces.

Srovnání Funkcí: Phi-3 Mini Vs. Phi-2 Mini

Níže srovnáváme některé funkce Phi-3 s jeho předchůdcem Phi-2.

  • Architektura Modelu: Phi-2 funguje na základě architektury založené na transforméru, navržené pro předpověď následujícího slova. Phi-3 Mini také využívá architekturu dekodéru transformátoru, ale více se shoduje se strukturou modelu Llama-2, používaním stejného tokenizéru s velikostí slovníku 320 641. Tato kompatibilita zajišťuje, že nástroje vyvinuté pro Llama-2 lze snadno přizpůsobit pro použití s Phi-3 Mini.
  • Délka Kontextu: Phi-3 Mini podporuje délku kontextu 8 000 tokenů, což je podstatně větší než 2 048 tokenů Phi-2. Tento nárůst umožňuje Phi-3 Mini lépe zvládat podrobnější interakce a zpracovávat delší pasáže textu.
  • Spouštění Místně Na Mobilních Zařízeních: Phi-3 Mini lze komprimovat na 4 bity, zabírající asi 1,8 GB paměti, podobně jako Phi-2. Byl testován offline na iPhone 14 s čipem A16 Bionic, kde dosáhl rychlosti zpracování více než 12 tokenů za sekundu, což odpovídá výkonu Phi-2 za podobných podmínek.
  • Velikost Modelu: S 3,8 miliardami parametrů má Phi-3 Mini větší rozsah než Phi-2, který má 2,7 miliard parametrů. To odráží jeho zvýšené schopnosti.
  • Školicí Data: Na rozdíl od Phi-2, který byl školen na 1,4 bilionu tokenů, byl Phi-3 Mini školen na mnohem větší sadě 3,3 bilionu tokenů, což mu umožňuje lépe chápat složité jazykové vzorce.

Vyřešení Omezení Phi-3 Mini

Zatímco Phi-3 Mini prokazuje významné pokroky v oblasti malých jazykových modelů, není bez svých omezení. Primární omezení Phi-3 Mini, dané jeho menší velikostí ve srovnání s velkými jazykovými modely, je jeho omezená kapacita pro uložení rozsáhlých faktických znalostí. To může ovlivnit jeho schopnost nezávisle zpracovat dotazy, které vyžadují hluboké specifické faktické znalosti nebo detailní odborné znalosti. To však lze zmírnit integrací Phi-3 Mini s vyhledávacím motorem. Tímto způsobem může model přístup k širšímu spektru informací v reálném čase, efektivní kompenzaci svých vnitřních znalostních omezení. Tato integrace umožňuje Phi-3 Mini fungovat jako vysoce schopný konverzační partner, který, navzdory komplexnímu chápání jazyka a kontextu, může občas potřebovat “vyhledat” informace, aby poskytl přesné a aktuální odpovědi.

Dostupnost

Phi-3 je nyní k dispozici na několika platformách, včetně Microsoft Azure AI Studio, Hugging Face a Ollama. Na Azure AI je model integrován do workflow nasazení, hodnocení a jemného ladění, a na Ollama lze spustit místně na noteboocích. Model byl přizpůsoben pro ONNX Runtime a podporuje Windows DirectML, zajišťující jeho fungování napříč různými typy hardwaru, jako jsou GPU, CPU a mobilní zařízení. Kromě toho je Phi-3 nabízen jako mikroslužba prostřednictvím NVIDIA NIM (NVDA ), vybavený standardním API pro snadné nasazení napříč různými prostředími a optimalizovaný speciálně pro NVIDIA GPU. Microsoft plánuje dále rozšiřovat řadu Phi-3 v blízké budoucnosti přidáním modelů Phi-3-small (7B) a Phi-3-medium (14B), poskytujícím uživatelům další možnosti pro vyvážení kvality a nákladů.

Závěrečné Shrnutí

Microsoftův Phi-3 Mini činí významné kroky v oblasti umělé inteligence přizpůsobením síly velkých jazykových modelů pro mobilní použití. Tento model zlepšuje interakci uživatelů se zařízeními prostřednictvím rychlejšího a reálného zpracování a vylepšených funkcí soukromí. Minimalizuje potřebu cloudových služeb, snižuje provozní náklady a rozšiřuje potenciál aplikací umělé inteligence v oblastech, jako je zdravotní péče a domácí automatizace. S důrazem na snižování předpojatostí prostřednictvím curriculum learning a udržení konkurenceschopného výkonu se Phi-3 Mini vyvíjí v klíčový nástroj pro efektivní a udržitelnou mobilní umělou inteligenci, jemně měnící, jak interagujeme s technologií denně.

Dr. Tehseen Zia je docent s trvalým úvazkem na COMSATS University Islamabad, držitel titulu PhD v oblasti AI z Vienna University of Technology, Rakousko. Specializuje se na umělou inteligenci, strojové učení, datové vědy a počítačové vidění, a významně přispěl publikacemi v renomovaných vědeckých časopisech. Dr. Tehseen také vedl různé průmyslové projekty jako hlavní výzkumník a působil jako konzultant pro umělou inteligenci.