Modele i platformy AI

Wewnętrzne spojrzenie na Phi-3 Mini od Microsoftu: lekki model AI, który bije powyżej swojej wagi

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Firma Microsoft (MSFT ) niedawno przedstawiła swój najnowszy lekki model językowy o nazwie Phi-3 Mini, który jest pierwszym z trzech kompaktnych modeli AI zaprojektowanych do dostarczania najlepszych wyników przy jednoczesnym zachowaniu niewielkiego rozmiaru, co pozwala na efektywną pracę na urządzeniach z ograniczonymi zasobami obliczeniowymi. Mając tylko 3,8 miliarda parametrów, Phi-3 Mini jest ułamkiem rozmiaru gigantów AI, takich jak GPT-4, a jednak obiecuje dorównać ich możliwościom w wielu kluczowych obszarach.

Rozwój Phi-3 Mini stanowi znaczący kamień milowy w dążeniu do udostępnienia zaawansowanych możliwości AI na szerszym zakresie sprzętu. Jego niewielki rozmiar pozwala na lokalne wdrożenie na smartfonach, tabletach i innych urządzeniach krawędziowych, pokonując opóźnienia i problemy z prywatnością związane z modelami opartymi na chmurze. Otwiera to nowe możliwości dla inteligentnych doświadczeń na urządzeniach w różnych dziedzinach, od asystentów wirtualnych i AI konwersacyjnej po asystentów kodowania i zadania związane z rozumieniem języka.

4-bit quantized phi-3-mini running natively on an iPhone
4-bit quantized phi-3-mini running natively on an iPhone

Pod powierzchnią: Architektura i szkolenie

W swojej istocie, Phi-3 Mini jest modelem dekodera transformatora zbudowanym na podobnej architekturze, co model Llama-2. Posiada 32 warstwy, 3072 wymiary ukryte i 32 głowy uwagi, z domyślną długością kontekstu 4,000 tokenów. Firma Microsoft wprowadziła również wersję o dłuższym kontekście, nazwaną Phi-3 Mini-128K, która wydłuża długość kontekstu do imponujących 128,000 tokenów za pomocą technik takich jak LongRope.

To, co odróżnia Phi-3 Mini, jest jednak jego metoda szkolenia. Zamiast polegać wyłącznie na sile brute duży zbiorów danych i mocy obliczeniowej, firma Microsoft skupiła się na tworzeniu wysokiej jakości, gęstych danych szkoleniowych. Dane te składają się z intensywnie przefiltrowanych danych internetowych, a także danych syntetycznych wygenerowanych przez większe modele językowe.

Proces szkolenia odbywa się w dwuetapowej procedurze. W pierwszym etapie model jest narażony na różnorodne źródła internetowe, mające na celu nauczenie go ogólnej wiedzy i zrozumienia języka. W drugim etapie łączy się jeszcze bardziej intensywnie przefiltrowane dane internetowe z danymi syntetycznymi, zaprojektowanymi w celu przekazania umiejętności logicznego myślenia i wiedzy z dziedziny.

Firma Microsoft nazywa ten podejście “optymalnym reżimem danych”, odbiegającym od tradycyjnego “optymalnego reżimu obliczeniowego” lub “nadmiernego reżimu szkolenia” stosowanego przez wiele dużych modeli językowych. Celem jest dostosowanie danych szkoleniowych do skali modelu, zapewnienie odpowiedniego poziomu wiedzy i umiejętności rozumowania, pozostawiając wystarczającą pojemność dla innych zdolności.

Quality of new Phi-3 models, as measured by performance on the Massive Multitask Language Understanding (MMLU) benchmark
Quality of new Phi-3 models, as measured by performance on the Massive Multitask Language Understanding (MMLU) benchmark

To podejście oparte na danych przyniosło efekty, ponieważ Phi-3 Mini osiąga imponujące wyniki w szerokim zakresie akademickich benchmarków, często rywalizując lub przewyższając znacznie większe modele. Na przykład, uzyskuje 69% w teście MMLU dla wielozadaniowego zrozumienia języka i 8,38 w teście MT-bench dla rozumowania matematycznego – wyniki, które są porównywalne z modelami takimi jak Mixtral 8x7B i GPT-3.5.

Bezpieczeństwo i wytrzymałość

Oprócz imponujących osiągnięć, firma Microsoft postawiła silny nacisk na bezpieczeństwo i wytrzymałość w rozwoju Phi-3 Mini. Model przeszedł rygorystyczny proces szkolenia po szkoleniu, obejmujący nadzorowane doskonalenie (SFT) i bezpośrednią optymalizację preferencji (DPO).

Etapy SFT wykorzystują starannie wyselekcjonowane dane z różnych dziedzin, w tym matematyki, kodowania, rozumowania, konwersacji, tożsamości modelu i bezpieczeństwa. Pomaga to wzmocnić zdolności modelu w tych obszarach, jednocześnie wpajając silne poczucie tożsamości i etycznego zachowania.

Etapy DPO koncentrują się na kierowaniu modelem z dala od niepożądanych zachowań, wykorzystując odrzucone odpowiedzi jako negatywne przykłady. Proces ten obejmuje dane w formacie czatu, zadania związane z rozumowaniem i wysiłki RAi (odpowiedzialne AI), zapewniając, że Phi-3 Mini przestrzega zasad etycznego i godnego zaufania AI firmy Microsoft.

Aby dalej poprawić swój profil bezpieczeństwa, Phi-3 Mini został poddany obszernemu testowaniu czerwonymi zespołami i automatycznemu testowaniu w dziesiątkach kategorii RAi. Niezależny czerwony zespół w firmie Microsoft iteracyjnie sprawdził model, identyfikując obszary do poprawy, które zostały następnie zaadresowane za pomocą dodatkowych, starannie wyselekcjonowanych zbiorów danych i ponownego szkolenia.

To wieloetapowe podejście znacznie zmniejszyło występowanie szkodliwych odpowiedzi, nieścisłości faktograficznych i uprzedzeń, jak to zostało zademonstrowane w wewnętrznych benchmarkach RAi firmy Microsoft. Na przykład, model wykazuje niski wskaźnik wad dla szkodliwego kontynuowania treści (0,75%) i podsumowania (10%), a także niski wskaźnik nieuzasadnionych odpowiedzi (0,603), wskazując, że jego odpowiedzi są solidnie zakorzenione w danym kontekście.

Zastosowania i przypadki użycia

Z imponującymi osiągnięciami i solidnymi środkami bezpieczeństwa, Phi-3 Mini jest idealnie nadany do szerokiego zakresu zastosowań, szczególnie w środowiskach o ograniczonych zasobach i opóźnieniach.

Jednym z najbardziej ekscytujących perspektyw jest wdrożenie inteligentnych asystentów wirtualnych i AI konwersacyjnej bezpośrednio na urządzeniach mobilnych. Dzięki pracy lokalnej, asystenci ci mogą zapewnić natychmiastowe odpowiedzi bez potrzeby połączenia sieciowego, jednocześnie zapewniając, że wrażliwe dane pozostają na urządzeniu, rozwiązując problemy z prywatnością.

Silne zdolności rozumowania Phi-3 Mini sprawiają, że jest on cennym aktywem dla asystentów kodowania i rozwiązywania problemów matematycznych. Deweloperzy i studenci mogą skorzystać z uzupełniania kodu, wykrywania błędów i wyjaśnień na urządzeniu, usprawniając procesy rozwoju i nauki.

Poza tymi zastosowaniami, wszechstronność modelu otwiera możliwości w dziedzinach takich jak zrozumienie języka, podsumowanie tekstu i odpowiedzi na pytania. Jego niewielki rozmiar i efektywność sprawiają, że jest on atrakcyjnym wyborem do wbudowywania możliwości AI w szeroki zakres urządzeń i systemów, od inteligentnych urządzeń domowych po systemy automatyki przemysłowej.

Wzrok na przyszłość: Phi-3 Small i Phi-3 Medium

Chociaż Phi-3 Mini jest osiągnięciem samym w sobie, firma Microsoft ma jeszcze większe plany dla rodziny Phi-3. Firma już zapowiedziała dwa większe modele, Phi-3 Small (7 miliardów parametrów) i Phi-3 Medium (14 miliardów parametrów), które mają przesunąć granice wydajności kompaktnych modeli językowych.

Phi-3 Small, na przykład, wykorzystuje bardziej zaawansowany tokenizator (tiktoken) i mechanizm uwagi grupowej, wraz z nową warstwą uwagi blocksparse, aby zoptymalizować swój ślad pamięci, jednocześnie utrzymując długie możliwości kontekstowe. Zawiera również dodatkowe 10% danych wielojęzycznych, zwiększając swoje zdolności w zrozumieniu i generowaniu języka w wielu językach.

Phi-3 Medium, z drugiej strony, reprezentuje znaczący krok w skali, z 40 warstwami, 40 głowami uwagi i wymiarem osadzania 5,120. Chociaż firma Microsoft zauważa, że niektóre benchmarki mogą wymagać dalszego udoskonalenia mieszanki danych szkoleniowych, aby w pełni wykorzystać tę zwiększoną pojemność, wstępne wyniki są obiecujące, z znaczącymi poprawami w stosunku do Phi-3 Small w zadaniach takich jak MMLU, TriviaQA i HumanEval.

Ograniczenia i przyszłe kierunki

Pomimo imponujących zdolności, Phi-3 Mini, jak wszystkie modele językowe, nie jest pozbawiony ograniczeń. Jednym z najbardziej znaczących słabości jest jego relatywnie ograniczona zdolność do przechowywania wiedzy faktograficznej, co jest widoczne w jego niższych wynikach w benchmarkach takich jak TriviaQA.

Jednak firma Microsoft uważa, że to ograniczenie można złagodzić, uzupełniając model o możliwości wyszukiwania, pozwalając mu na pobieranie i rozumowanie istotnych informacji na żądanie. To podejście jest zademonstrowane w Hugging Face Chat-UI, gdzie Phi-3 Mini może wykorzystać wyszukiwanie, aby poprawić swoje odpowiedzi.

Innym obszarem do poprawy są zdolności wielojęzyczne modelu. Chociaż Phi-3 Small poczynił pierwsze kroki, włączając dodatkowe dane wielojęzyczne, potrzebne są dalsze prace, aby w pełni odblokować potencjał tych kompaktnych modeli dla aplikacji wielojęzycznych.

Patrząc w przyszłość, firma Microsoft jest zaangażowana w ciągłe doskonalenie rodziny modeli Phi, rozwiązywanie ich ograniczeń i rozwijanie ich zdolności. Może to obejmować dalsze udoskonalenia danych szkoleniowych i metodologii, a także eksplorację nowych architektur i technik specjalnie dostosowanych do kompaktnych, wysokowydajnych modeli językowych.

Podsumowanie

Phi-3 Mini od Microsoftu reprezentuje znaczący krok w demokracji zaawansowanych możliwości AI. Dostarczając najlepsze wyniki w kompaktnym, efektywnym pakiecie, otwiera nowe możliwości dla inteligentnych doświadczeń na urządzeniach w szerokim zakresie aplikacji.

Innowacyjne podejście do szkolenia, które kładzie nacisk na wysokiej jakości, gęste dane szkoleniowe, przyniosło efekty, umożliwiając Phi-3 Mini bijąc powyżej swojej wagi. W połączeniu z solidnymi środkami bezpieczeństwa i ciągłymi wysiłkami rozwojowymi, rodzina modeli Phi jest gotowa do odegrania kluczowej roli w kształtowaniu przyszłości systemów inteligentnych, czyniąc AI bardziej dostępnym, efektywnym i godnym zaufania niż kiedykolwiek wcześniej.

Podczas gdy branża technologiczna kontynuuje przesunięcie granic tego, co możliwe z AI, zaangażowanie firmy Microsoft w lekkie, wysokowydajne modele, takie jak Phi-3 Mini, reprezentuje odświeżające odejście od konwencjonalnej mądrości “im większy, tym lepiej”. Pokazując, że rozmiar nie jest wszystkim, Phi-3 Mini ma potencjał, aby zainspirować nową falę innowacji, skupiając się na maksymalizowaniu wartości i wpływu AI poprzez inteligentne kurację danych, przemyślane projektowanie modeli i odpowiedzialne praktyki rozwojowe.

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 różnorodnych projektach inżynierii oprogramowania, ze szczególnym uwzględnieniem AI/ML. Moja nieustanna ciekawość również skierowała mnie w stronę Natural Language Processing, dziedziny, którą chcę dalej eksplorować.