Modele i platformy AI

Gemma: Google wprowadza zaawansowane możliwości sztucznej inteligencji poprzez oprogramowanie open source

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Dziedzina sztucznej inteligencji (AI) odnotowała ogromny postęp w ostatnich latach, głównie dzięki postępom w głębokim uczeniu i przetwarzaniu języka naturalnego (NLP). Na czele tych postępów znajdują się duże modele językowe (LLM) – systemy AI szkolone na ogromnych ilościach danych tekstowych, które mogą generować tekst podobny do ludzkiego i uczestniczyć w zadaniach konwersacyjnych.

Modele LLM, takie jak PaLM od Google , Claude od Anthropic i Gopher od DeepMind, wykazały się niezwykłymi możliwościami, od programowania po rozumowanie zdroworozsądkowe. Niemniej jednak, większość z tych modeli nie została jeszcze otwarcie udostępniona, co ogranicza ich dostęp do badań, rozwoju i korzystnych zastosowań.

To się zmieniło z niedawnym otwarciem Gemmy – rodziny modeli LLM od Google’s DeepMind, opartych na ich potężnych modelach Gemini. W tym poście, zagłębimy się w Gemmę, analizując jej architekturę, proces szkolenia, wydajność i odpowiedzialne wydanie.

Przegląd Gemmy

W lutym 2023 roku, DeepMind otworzyło dwa rozmiary modeli Gemmy – wersję 2 miliardów parametrów zoptymalizowaną do wdrożenia na urządzeniu, oraz większą wersję 7 miliardów parametrów zaprojektowaną do użycia na GPU/TPU.

Gemma wykorzystuje podobną architekturę transformatora i metodologię szkolenia, jak modele Gemini od DeepMind. Została ona wyszkolona na do 6 bilionów tokenów danych tekstowych, głównie w języku angielskim. Obejmowało to dokumenty internetowe, teksty matematyczne i kod źródłowy.

DeepMind wydało surowe punkty kontrolne Gemmy, a także wersje dostrajane z uczeniem nadzorowanym i informacjami zwrotnymi od ludzi w celu poprawy możliwości w obszarach takich jak dialog, wykonanie instrukcji i programowanie.

Rozpoczęcie pracy z Gemmą

Otwarte wydanie Gemmy sprawia, że zaawansowane możliwości AI są dostępne dla deweloperów, badaczy i entuzjastów. Oto szybki przewodnik, aby rozpocząć pracę:

Wdrożenie niezależne od platformy

Jedną z głównych zalet Gemmy jest jej elastyczność – możesz ją uruchomić na procesorach, GPU lub TPU. Dla CPU, wykorzystaj TensorFlow Lite lub HuggingFace Transformers. Dla przyspieszonej wydajności na GPU/TPU, użyj TensorFlow. Usługi chmurowe, takie jak Google Cloud’s Vertex AI, również zapewniają płynne skalowanie.

Dostęp do wstępnie wyszkolonych modeli

Gemma jest dostępna w różnych wersjach wstępnie wyszkolonych, w zależności od Twoich potrzeb. Modele 2B i 7B oferują silne możliwości generatywne bezpośrednio po wyjęciu z pudełka. Dla niestandardowego dostrajania, modele 2B-FT i 7B-FT są idealnymi punktami startu.

Budowanie interesujących aplikacji

Możesz zbudować szeroki zakres aplikacji z Gemmą, takich jak generowanie historii, tłumaczenie języka, odpowiedzi na pytania i tworzenie kreatywnych treści. Kluczem jest wykorzystanie możliwości Gemmy poprzez dalsze szkolenie na własnych danych.

Architektura

Gemma wykorzystuje architekturę transformatora dekodera, opartą na postępach, takich jak uwaga wielokrotna i rotary positional embeddings:

  • Transformator: Wprowadzony w 2017 roku, architektura transformatora oparta wyłącznie na mechanizmach uwagi stała się powszechna w NLP. Gemma odziedziczyła możliwość transformatora do modelowania dalekosiężnych zależności w tekście.
  • Dekoder-only: Gemma wykorzystuje tylko stos dekodera transformatora, w przeciwieństwie do modeli kodera-dekodera, takich jak BART lub T5. Zapewnia to silne możliwości generatywne dla zadań, takich jak generowanie tekstu.
  • Uwaga wielokrotna: Gemma wykorzystuje uwagę wielokrotną w swoim większym modelu, pozwalając każdej głowie uwagi na przetwarzanie wielu zapytań równolegle do szybszej inferencji.
  • Rotary positional embeddings: Gemma reprezentuje informacje położeniowe za pomocą rotary embeddings zamiast absolutnych kodowań pozycyjnych. Technika ta redukuje rozmiar modelu, zachowując jednocześnie informacje o położeniu.

Użycie takich technik, jak uwaga wielokrotna i rotary positional embeddings, umożliwia modelom Gemmy osiągnięcie optymalnego kompromisu między wydajnością, szybkością inferencji a rozmiarem modelu.

Dane i proces szkolenia

Gemma została wyszkolona na do 6 bilionów tokenów danych tekstowych, głównie w języku angielskim. Obejmowało to dokumenty internetowe, teksty matematyczne i kod źródłowy. DeepMind zainwestowało znaczne wysiłki w filtrowanie danych, usuwając potencjalnie toksyczny, nielegalny lub tendencyjny tekst za pomocą klasyfikatorów i heurystyk.

Szkolenie zostało przeprowadzone przy użyciu infrastruktury TPUv5 od Google, z użyciem do 4096 TPU do szkolenia Gemmy-7B. Efektywne techniki równoległości modelu i danych umożliwiły szkolenie ogromnych modeli przy użyciu sprzętu komercyjnego.

Zastosowano szkolenie stopniowe, ciągle dostosowując dystrybucję danych, aby skoncentrować się na wysokiej jakości, istotnym tekście. Ostateczne etapy dostrajania wykorzystywały mieszaninę przykładów instrukcji generowanych przez ludzi i syntetycznych do poprawy możliwości.

Wydajność modelu

DeepMind rygorystycznie oceniło modele Gemmy na ponad 25 benchmarkach, obejmujących pytania i odpowiedzi, rozumowanie, matematykę, programowanie, zdrowy rozsądek i możliwości dialogowe.

Gemma osiąga wyniki na poziomie stanu techniki w porównaniu z podobnymi modelami open source w większości benchmarków. Niektóre z nich to:

  • Matematyka: Gemma wyróżnia się w testach rozumowania matematycznego, takich jak GSM8K i MATH, przewyższając modele takie jak Codex i Claude od Anthropic o ponad 10 punktów.
  • Programowanie: Gemma dorównuje lub przewyższa wydajność Codex na benchmarkach programistycznych, takich jak MBPP, pomimo niebycia specjalnie szkolonym na kodzie.
  • Dialog: Gemma wykazuje silne zdolności konwersacyjne z 51,7% wskaźnikiem wygranych nad Mistral-7B od Anthropic w testach preferencji ludzi.
  • Reasoning: W zadaniach wymagających inferencji, takich jak ARC i Winogrande, Gemma przewyższa inne modele 7B o 5-10 punktów.

Wydajność Gemmy we wszystkich dziedzinach pokazuje jej silne możliwości ogólnej inteligencji. Chociaż pozostają luki do poziomu wydajności ludzi, Gemma reprezentuje skok w przód w NLP open source.

Bezpieczeństwo i odpowiedzialność

Wydanie otwartych wag dużych modeli wprowadza wyzwania związane z celowym nadużyciem i wrodzonymi uprzedzeniami modelu. DeepMind podjął kroki w celu złagodzenia tych ryzyk:

  • Filtrowanie danych: Potencjalnie toksyczny, nielegalny lub tendencyjny tekst został usunięty z danych szkoleniowych przy użyciu klasyfikatorów i heurystyk.
  • Oceny: Gemma została przetestowana na 30+ benchmarkach opracowanych w celu oceny bezpieczeństwa, sprawiedliwości i wytrzymałości. Dorównała lub przewyższyła inne modele.
  • Dostrajanie: Dostrajanie modelu koncentrowało się na poprawie możliwości bezpieczeństwa, takich jak filtrowanie informacji i odpowiednie zachowania odmowy.
  • Warunki użytkowania: Warunki użytkowania zabraniają obraźliwych, nielegalnych lub nieetycznych zastosowań modeli Gemmy. Jednak egzekwowanie pozostaje wyzwaniem.
  • Karty modelu: Karty zawierające szczegóły o możliwościach modelu, ograniczeniach i uprzedzeniach zostały wydane w celu promowania przejrzystości.

Chociaż istnieją ryzyka związane z wydaniem otwartym, DeepMind uznał, że wydanie Gemmy przynosi korzyści społeczne dzięki jej profilowi bezpieczeństwa i umożliwieniu badań. Jednakże, uważne monitorowanie potencjalnych szkód pozostanie kluczowe.

Umożliwianie następnej fali innowacji AI

Wydanie Gemmy jako rodziny modeli open source ma szansę odblokować postęp w społeczności AI:

  • Dostępność: Gemma redukuje bariery dla organizacji, które chcą budować z wykorzystaniem najnowocześniejszych możliwości NLP, które wcześniej musiały ponosić wysokie koszty obliczeniowe i danych do szkolenia własnych modeli LLM.
  • Nowe aplikacje: Dzięki otwarciu wstępnie wyszkolonych i dostrajanych punktów kontrolnych, DeepMind umożliwia łatwiejszy rozwój korzystnych aplikacji w obszarach takich jak edukacja, nauka i dostępność.
  • Customizacja: Deweloperzy mogą dalej dostosowywać Gemmę do aplikacji specyficznych dla branży lub domeny poprzez dalsze szkolenie na danych własnych.
  • Badania: Otwarte modele, takie jak Gemma, sprzyjają większej przejrzystości i audytowi obecnych systemów NLP, oświetlając przyszłe kierunki badań.
  • Innowacje: Dostępność silnych modeli bazowych, takich jak Gemma, przyspieszy postęp w obszarach, takich jak mitigacja uprzedzeń, faktualność i bezpieczeństwo AI.

Poprzez udostępnienie możliwości Gemmy wszystkim poprzez otwarte źródło, DeepMind liczy na odpowiedzialny rozwój AI dla dobra społecznego.

Droga do przodu

Z każdym skokiem w AI, zbliżamy się do modeli, które rywalizują lub przewyższają inteligencję ludzką we wszystkich dziedzinach. Systemy, takie jak Gemma, podkreślają, jak szybkie postępy w samouczkach są odblokowaniem coraz bardziej zaawansowanych zdolności poznawczych.

Jednak pozostaje jeszcze wiele do zrobienia, aby poprawić niezawodność, interpretowalność i kontrolę AI – obszary, w których inteligencja ludzka wciąż dominuje. Domeny, takie jak matematyka, podkreślają te trwałe luki, z Gemmą uzyskującą 64% w MMLU w porównaniu z szacowaną 89% wydajnością ludzi.

Zamknięcie tych luk, przy jednoczesnym zapewnieniu bezpieczeństwa i etyki coraz bardziej zaawansowanych systemów AI, będzie kluczowym wyzwaniem w nadchodzących latach. Znalezienie odpowiedniego balansu między otwartością a ostrożnością będzie krytyczne, gdy DeepMind dąży do demokratyzacji dostępu do korzyści AI, jednocześnie zarządzając nowo pojawiającymi się ryzykami.

Inicjatywy promujące bezpieczeństwo AI, takie jak ANC Dario Amodei, zespół Etyki i Społeczeństwa DeepMind oraz Konstytucyjny AI Anthropic, sygnalizują rosnące uznanie potrzeby tej nuansowanej podejścia. Istotny postęp będzie wymagał otwartego, opartego na dowodach dialogu między badaczami, deweloperami, decydentami i społeczeństwem.

Jeśli zostanie to przejęte w sposób odpowiedzialny, Gemma reprezentuje nie szczyt AI, ale bazę dla następnej generacji badaczy AI, którzy będą śledzić ślady DeepMind w kierunku sprawiedliwej, korzystnej sztucznej inteligencji ogólnej.

Podsumowanie

Wydanie modeli Gemmy przez DeepMind oznacza nową erę dla AI open source – jedną, która wykracza poza wąskie benchmarki do zdolności inteligencji uogólnionej. Przetestowana gruntownie pod kątem bezpieczeństwa i szeroko dostępna, Gemma ustanawia nowy standard dla odpowiedzialnego wydania otwartego w AI.

Pomimo ryzyk, DeepMind wykazał techniczną i etyczną staranność, co daje pewność, że korzyści Gemmy przewyższają jej potencjalne szkody. Gdy możliwości AI stają się coraz bardziej zaawansowane, utrzymanie tej nuansowanej podejścia między otwartością a ostrożnością będzie kluczowe.

Gemma przybliża nas o krok do AI, która korzysta wszystkim ludziom. Jednak wiele wielkich wyzwań wciąż pozostaje na drodze do przyjaznej sztucznej inteligencji ogólnej. Jeśli badacze AI, deweloperzy i społeczeństwo będą mogli utrzymać współpracę, Gemma może kiedyś być postrzegana jako historyczna baza, a nie ostateczny szczyt.

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 różnorodnych projektach inżynierii oprogramowania, ze szczególnym uwzględnieniem AI/ML. Moja nieustanna ciekawość również skierowała mnie w stronę Natural Language Processing, dziedziny, którą chcę dalej eksplorować.