Modele i platformy AI

Kieszonkowy potęga: prezentujemy Phi-3 od Microsoftu, model językowy, który zmieści się w Twoim telefonie

mm
Dodaj Unite.AI do preferowanych źródeł w Google

W dynamicznie rozwijającym się obszarze sztucznej inteligencji, gdzie tendencja często nakierowana jest na większe i bardziej złożone modele, Microsoft (MSFT ) przyjmuje odmienną strategię z modelem Phi-3 Mini. Ten mały model językowy (SLM), obecnie w trzeciej generacji, oferuje możliwości większych modeli w ramach ograniczeń zasobowych smartfonów. Z 3,8 miliardami parametrów, Phi-3 Mini dorównuje wydajności dużych modeli językowych (LLM) w różnych zadaniach, w tym przetwarzaniu języka, rozumowaniu, kodowaniu i matematyce, i jest dostosowany do efektywnej pracy na urządzeniach mobilnych dzięki kwantyzacji.

Wyzwania dużych modeli językowych

Rozwój modeli Phi SLM przez Microsoft jest odpowiedzią na znaczne wyzwania stawiane przez LLM, które wymagają większej mocy obliczeniowej niż ta, która jest zwykle dostępna na urządzeniach konsumenckich. To wysokie zapotrzebowanie utrudnia ich użycie na standardowych komputerach i urządzeniach mobilnych, rodzi obawy środowiskowe z powodu ich zużycia energii podczas szkolenia i eksploatacji, oraz naraża na utrwalenie uprzedzeń dzięki ich dużym i złożonym zbiorom danych szkoleniowych. Te czynniki mogą również pogorszyć responsywność modeli w aplikacjach w czasie rzeczywistym i utrudnić ich aktualizację.

Phi-3 Mini: uproszczenie sztucznej inteligencji na urządzeniach osobistych dla zwiększenia prywatności i efektywności

Phi-3 Mini został strategicznie zaprojektowany, aby zapewnić opłacalną i efektywną alternatywę dla integracji zaawansowanej sztucznej inteligencji bezpośrednio na urządzeniach osobistych, takich jak telefony i laptopy. Ten projekt umożliwia szybsze i bardziej natychmiastowe odpowiedzi, poprawiając interakcję użytkownika z technologią w codziennych sytuacjach.

Phi-3 Mini umożliwia zaawansowane funkcjonalności sztucznej inteligencji, które są bezpośrednio przetwarzane na urządzeniach mobilnych, zmniejszając w ten sposób zależność od usług chmurowych i poprawiając przetwarzanie danych w czasie rzeczywistym. Ta zdolność jest kluczowa dla aplikacji, które wymagają natychmiastowego przetwarzania danych, takich jak mobilna opieka zdrowotna, tłumaczenie języka w czasie rzeczywistym i edukacja personalizowana, ułatwiając postępy w tych dziedzinach. Kosztowość modelu nie tylko zmniejsza koszty operacyjne, ale także rozszerza potencjał integracji sztucznej inteligencji w różnych branżach, w tym w nowych rynkach, takich jak technologia nosimych i automatyka domowa. Phi-3 Mini umożliwia przetwarzanie danych bezpośrednio na urządzeniach lokalnych, co zwiększa prywatność użytkownika. Może to być istotne w zarządzaniu informacjami wrażliwymi w dziedzinach takich jak zdrowie i usługi finansowe. Ponadto niskie wymagania energetyczne modelu przyczyniają się do zrównoważonej ekologicznie eksploatacji sztucznej inteligencji, współgrając z globalnymi wysiłkami na rzecz zrównoważonego rozwoju.

Filozofia projektowa i ewolucja Phi

Filozofia projektowa Phi oparta jest na pojęciu nauki programowej, która czerpie inspirację z podejścia edukacyjnego, w którym dzieci uczą się przez stopniowo trudniejsze przykłady. Głównym pomysłem jest rozpoczęcie szkolenia sztucznej inteligencji od łatwiejszych przykładów i stopniowe zwiększanie złożoności danych szkoleniowych wraz z postępem procesu uczenia. Microsoft zaimplementował tę strategię edukacyjną, budując zbiór danych z podręczników, jak opisano w ich badaniu “Podręczniki to wszystko, czego potrzebujesz“. Seria Phi została uruchomiona w czerwcu 2023 roku, rozpoczynając się od Phi-1, kompaktowego modelu z 1,3 miliarda parametrów. Ten model szybko wykazał swoją skuteczność, szczególnie w zadaniach związanych z kodowaniem w języku Python, gdzie przewyższył większe i bardziej złożone modele. W oparciu o ten sukces, Microsoft później opracował Phi-1.5, który utrzymywał tę samą liczbę parametrów, ale rozszerzył swoje możliwości w obszarach takich jak rozumowanie zdroworozsądkowe i zrozumienie języka. Seria wyróżniła się z releasem Phi-2 w grudniu 2023 roku. Z 2,7 miliardami parametrów, Phi-2 wykazał imponujące umiejętności w rozumowaniu i zrozumieniu języka, stając się silnym konkurentem wobec znacznie większych modeli.

Phi-3 vs. inne małe modele językowe

Rozwijając swoich poprzedników, Phi-3 Mini rozszerza osiągnięcia Phi-2, przewyższając inne SLM, takie jak Gemma od Google (GOOGL ), Mistral od Mistral, Llama3-Instruct od Meta i GPT 3.5, w różnych aplikacjach przemysłowych. Te aplikacje obejmują zrozumienie języka i inferencję, ogólną wiedzę, rozumowanie zdroworozsądkowe, zadania matematyczne na poziomie szkoły podstawowej i odpowiedzi na pytania medyczne, wykazując lepszą wydajność w porównaniu z tymi modelami. Phi-3 Mini przeszedł również testy offline na iPhone 14 dla różnych zadań, w tym tworzenia treści i sugerowania aktywności dostosowanych do konkretnych lokalizacji. W tym celu Phi-3 Mini został skompresowany do 1,8 GB przy użyciu procesu zwаного kwantyzacją, który optymalizuje model dla urządzeń o ograniczonych zasobach, konwertując dane numeryczne modelu z 32-bitowych liczb zmiennoprzecinkowych na bardziej kompaktowe formaty, takie jak 4-bitowe liczby całkowite. To nie tylko zmniejsza ślad pamięci modelu, ale także poprawia szybkość przetwarzania i efektywność energetyczną, co jest niezwykle ważne dla urządzeń mobilnych. Deweloperzy zwykle wykorzystują ramy takie jak TensorFlow Lite lub PyTorch Mobile, które zawierają wbudowane narzędzia do kwantyzacji, aby zautomatyzować i udoskonalić ten proces.

Porównanie funkcji: Phi-3 Mini vs. Phi-2 Mini

Poniżej porównujemy niektóre funkcje Phi-3 z jego poprzednikiem Phi-2.

  • Architektura modelu: Phi-2 działa na architekturze opartej na transformatorze, zaprojektowanej do przewidywania następnego słowa. Phi-3 Mini również wykorzystuje architekturę dekodera transformatora, ale bardziej przypomina strukturę modelu Llama-2, wykorzystując ten sam tokenizator z rozmiarem słownika 320 641. Ta kompatybilność gwarantuje, że narzędzia opracowane dla Llama-2 mogą być łatwo dostosowane do użycia z Phi-3 Mini.
  • Długość kontekstu: Phi-3 Mini obsługuje długość kontekstu 8 000 tokenów, co jest znacznie większe niż 2 048 tokenów w Phi-2. To zwiększenie pozwala Phi-3 Mini zarządzać bardziej szczegółowymi interakcjami i przetwarzać dłuższe fragmenty tekstu.
  • Uruchamianie lokalnie na urządzeniach mobilnych: Phi-3 Mini może być skompresowany do 4 bitów, zajmując około 1,8 GB pamięci, podobnie jak Phi-2. Został przetestowany podczas uruchamiania offline na iPhone 14 z chipem A16 Bionic, gdzie osiągnął szybkość przetwarzania ponad 12 tokenów na sekundę, dorównując wydajności Phi-2 w podobnych warunkach.
  • Rozmiar modelu: Z 3,8 miliardami parametrów, Phi-3 Mini ma większą skalę niż Phi-2, który ma 2,7 miliarda parametrów. To odzwierciedla jego zwiększone możliwości.
  • Dane szkoleniowe: W przeciwieństwie do Phi-2, który został wyszkolony na 1,4 bilionie tokenów, Phi-3 Mini został wyszkolony na znacznie większym zbiorze 3,3 biliona tokenów, co pozwoliło mu osiągnąć lepsze zrozumienie złożonych wzorców językowych.

Rozwiązywanie ograniczeń Phi-3 Mini

Chociaż Phi-3 Mini wykazuje znaczne postępy w dziedzinie małych modeli językowych, nie jest pozbawiony ograniczeń. Głównym ograniczeniem Phi-3 Mini, biorąc pod uwagę jego mniejszy rozmiar w porównaniu z ogromnymi modelami językowymi, jest ograniczona pojemność do przechowywania obszernych faktów. To może wpłynąć na jego zdolność do samodzielnego radzenia sobie z zapytaniami, które wymagają głębi konkretnych faktów lub szczegółowej wiedzy eksperckiej. Może to być jednak złagodzone przez integrację Phi-3 Mini z wyszukiwarką. W ten sposób model może uzyskać dostęp do szerszego zakresu informacji w czasie rzeczywistym, skutecznie kompensując swoje wrodzone ograniczenia wiedzy. Ta integracja umożliwia Phi-3 Mini funkcjonowanie jak wysoce zdolny konwersator, który, pomimo wszechstronnego zrozumienia języka i kontekstu, może czasem potrzebować “sprawdzić” informacje, aby zapewnić dokładne i aktualne odpowiedzi.

Dostępność

Phi-3 jest teraz dostępny na kilku platformach, w tym Microsoft Azure AI Studio, Hugging Face i Ollama. Na Azure AI, model obejmuje proces wdrażania, oceny i dostrajania, a na Ollama może być uruchamiany lokalnie na laptopach. Model został dostosowany do ONNX Runtime i obsługuje Windows DirectML, zapewniając jego poprawne działanie na różnych typach sprzętu, takich jak GPU, CPU i urządzenia mobilne. Dodatkowo, Phi-3 jest oferowany jako mikrousługa za pośrednictwem NVIDIA NIM (NVDA ), wyposażony w standardowy interfejs API dla łatwego wdrożenia w różnych środowiskach i zoptymalizowany specjalnie dla GPU NVIDIA. Microsoft planuje dalej rozwijać serię Phi-3 w najbliższej przyszłości, dodając modele Phi-3-small (7B) i Phi-3-medium (14B), zapewniając użytkownikom dodatkowe wybory, aby zrównoważyć jakość i koszt.

Podsumowanie

Phi-3 Mini od Microsoftu robi znaczne postępy w dziedzinie sztucznej inteligencji, dostosowując możliwości dużych modeli językowych do użycia na urządzeniach mobilnych. Ten model poprawia interakcję użytkownika z urządzeniami dzięki szybszemu i bardziej natychmiastowemu przetwarzaniu oraz zwiększonym funkcjom prywatności. Zmniejsza potrzebę korzystania z usług chmurowych, redukując koszty operacyjne i rozszerzając zakres zastosowań sztucznej inteligencji w dziedzinach takich jak opieka zdrowotna i automatyka domowa. Poprzez koncentrację na zmniejszaniu uprzedzeń za pomocą nauki programowej i utrzymaniu konkurencyjnej wydajności, Phi-3 Mini ewoluuje w kierunku kluczowego narzędzia dla efektywnej i zrównoważonej sztucznej inteligencji mobilnej, subtelnie zmieniając sposób, w jaki wchodzimy w interakcje z technologią na co dzień.

Dr. Tehseen Zia jest profesorem nadzwyczajnym w COMSATS University Islamabad, posiada tytuł doktora w dziedzinie sztucznej inteligencji na Vienna University of Technology, Austria. Specjalizując się w sztucznej inteligencji, uczeniu maszynowym, nauce o danych i widzeniu komputerowym, wniósł znaczący wkład poprzez publikacje w renomowanych czasopismach naukowych. Dr. Tehseen Zia również kierował różnymi projektami przemysłowymi jako główny badacz i pełnił funkcję konsultanta ds. sztucznej inteligencji.