Modele i platformy AI

Pierwsza rocznica ChatGPT: Przekształcanie przyszłości interakcji z AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Odgrywając rok ChatGPT, jest jasne, że ten narzędzie znacznie zmieniło scenę AI. Uruchomione pod koniec 2022 roku, ChatGPT wyróżniało się ze względu na przyjazny, konwersacyjny styl, który sprawił, że interakcja z AI stała się bardziej podobna do rozmowy z osobą niż z maszyną. Ten nowy podejście szybko przyciągnęło uwagę publiczności. W ciągu zaledwie pięciu dni po wydaniu, ChatGPT przyciągnęło już milion użytkowników. Na początku 2023 roku liczba ta wyniosła około 100 milionów użytkowników miesięcznych, a do października platforma przyciągała około 1,7 miliarda odwiedzin na całym świecie. Te liczby mówią wiele o jej popularności i użyteczności.

W ciągu minionego roku użytkownicy znaleźli wiele kreatywnych sposobów, aby wykorzystać ChatGPT, od prostych zadań, takich jak pisanie e-maili i aktualizowanie CV, po rozpoczęcie udanych firm. Ale to nie tylko to, jak ludzie go używają; sama technologia również rosła i poprawiała się. Początkowo ChatGPT było darmową usługą oferującą szczegółowe odpowiedzi tekstowe. Teraz jest ChatGPT Plus, który zawiera ChatGPT-4. Ta zaktualizowana wersja została przeszkolona na większych danych, daje mniej błędnych odpowiedzi i lepiej rozumie złożone instrukcje.

Jedna z największych aktualizacji polega na tym, że ChatGPT może teraz współdziałać na wiele sposobów – może słuchać, mówić i nawet przetwarzać obrazy. Oznacza to, że możesz z nim rozmawiać za pomocą aplikacji mobilnej i pokazywać mu zdjęcia, aby uzyskać odpowiedzi. Te zmiany otworzyły nowe możliwości dla AI i zmieniły sposób, w jaki ludzie postrzegają i myślą o roli AI w naszym życiu.

Od swoich początków jako demonstracja techniczna do obecnego statusu jako główny gracz w świecie techniki, podróż ChatGPT jest dość imponująca. Początkowo było postrzegane jako sposób testowania i udoskonalania technologii poprzez uzyskanie opinii od publiczności. Ale szybko stało się niezbędną częścią krajobrazu AI. Ten sukces pokazuje, jak skuteczne jest dokształcanie dużych modeli językowych (LLM) za pomocą nadzorowanego uczenia i opinii ludzi. W rezultacie ChatGPT może obsłużyć szeroki zakres pytań i zadań.

W wyścigu do opracowania najbardziej zdolnych i wszechstronnych systemów AI powstało wiele modeli open-source i własnościowych, takich jak ChatGPT. Zrozumienie ich ogólnych możliwości wymaga kompleksowych testów na szerokim spektrum zadań. Ten rozdział bada te testy, rzucając światło na to, jak różne modele, w tym ChatGPT, są porównywalne do siebie.

Ocena LLM: Testy

  1. MT-Bench: Ten test sprawdza możliwości konwersacji wieloetapowej i wykonania instrukcji w ośmiu dziedzinach: pisaniu, roleplay, ekstrakcji informacji, rozumowaniu, matematyce, kodowaniu, wiedzy STEM i naukach humanistycznych i społecznych. Silniejsze LLM, takie jak GPT-4, są używane jako ewaluatory.
  2. AlpacaEval: Opiera się na zestawie oceny AlpacaFarm, ten ewaluator LLM automatycznie ocenia modele w porównaniu z odpowiedziami zaawansowanych LLM, takich jak GPT-4 i Claude, obliczając współczynnik wygranych modeli kandydujących.
  3. Open LLM Leaderboard

    : Wykorzystując Harness Oceny Modelu Językowego, ten leaderboard ocenia LLM w siedmiu kluczowych testach, w tym wyzwaniach rozumowania i testach wiedzy ogólnej, w ustawieniach zero-shot i few-shot.
  4. BIG-bench: Ten współpracujący test obejmuje ponad 200 nowych zadań językowych, obejmujących szeroki zakres tematów i języków. Ma on na celu zbadanie LLM i przewidzenie ich przyszłych możliwości.
  5. ChatEval: Ramy debaty wieloagentowej, które pozwalają zespołom na autonomiczną dyskusję i ocenę jakości odpowiedzi z różnych modeli na pytania otwarte i tradycyjne zadania generowania języka naturalnego.

Porównawcze wyniki

W kwestii ogólnych testów, LLM open-source pokazały znaczny postęp. Llama-2-70B, na przykład, osiągnęło imponujące wyniki, szczególnie po dostrajaniu z danymi instrukcyjnymi. Jego wariant, Llama-2-chat-70B, wyróżnił się w AlpacaEval z 92,66% współczynnikiem wygranych, przewyższając GPT-3.5-turbo. Jednak GPT-4 pozostaje liderem z 95,28% współczynnikiem wygranych.

Zephyr-7B, mniejszy model, wykazał możliwości porównywalne do większych modeli LLM 70B, szczególnie w AlpacaEval i MT-Bench. Tymczasem WizardLM-70B, dostrajany z różnorodnymi danymi instrukcyjnymi, uzyskał najwyższy wynik wśród modeli LLM open-source w MT-Bench. Jednak nadal pozostawał w tyle za GPT-3.5-turbo i GPT-4.

Ciekawym wpisem jest GodziLLa2-70B, który osiągnął konkurencyjny wynik na Open LLM Leaderboard, pokazując potencjał eksperymentalnych modeli łączących różnorodne zestawy danych. Podobnie, Yi-34B, opracowany od podstaw, wyróżnił się wynikami porównywalnymi do GPT-3.5-turbo i tylko nieznacznie gorszymi niż GPT-4.

UltraLlama, z jego dostrajaniem na różnorodnych i wysokiej jakości danych, dopasował się do GPT-3.5-turbo w proponowanych testach i nawet przewyższył go w dziedzinach wiedzy świata i profesjonalnej.

Skalowanie w górę: Wzrost olbrzymich LLM

Modele LLM

Najlepsze modele LLM od 2020 roku

Godny uwagi trend w rozwoju LLM to zwiększanie parametrów modelu. Modele takie jak Gopher, GLaM, LaMDA, MT-NLG i PaLM przesunęły granice, kończąc się modelami z nawet 540 miliardami parametrów. Te modele wykazały wyjątkowe możliwości, ale ich zamknięta natura ograniczyła ich szersze zastosowanie. To ograniczenie spowodowało zainteresowanie rozwijaniem modeli LLM open-source, trend, który zyskuje na sile.

Równolegle do zwiększania rozmiaru modeli, badacze badali alternatywne strategie. Zamiast po prostu robić modele większymi, skupili się na poprawie wstępnego szkolenia mniejszych modeli. Przykładami są Chinchilla i UL2, które pokazały, że więcej nie zawsze oznacza lepiej; inteligentniejsze strategie mogą dać wydajne wyniki. Ponadto, istnieje znaczne zainteresowanie dostrajaniem modeli językowych, z projektami takimi jak FLAN, T0 i Flan-T5, które wniosły znaczący wkład w tę dziedzinę.

Katalizator ChatGPT

Wprowadzenie przez OpenAI ChatGPT oznaczało punkt zwrotny w badaniach NLP. Aby konkurować z OpenAI, firmy takie jak Google (GOOGL ) i Anthropic uruchomiły swoje własne modele, odpowiednio Bard i Claude. Chociaż te modele wykazują porównywalne wyniki do ChatGPT w wielu zadaniach, nadal pozostają w tyle za najnowszym modelem OpenAI, GPT-4. Sukces tych modeli jest głównie przypisywany uczeniu wzmocnionemu przez opinie ludzi (RLHF), technice, która otrzymuje coraz więcej uwagi badawczej do dalszej poprawy.

Pogłoski i spekulacje wokół Q* (Q-Gwiazda) OpenAI

Niedawne raporty sugerują, że badacze w OpenAI mogli osiągnąć znaczący postęp w AI z rozwojem nowego modelu o nazwie Q* (wymawiane jako Q-gwiazda). Podobno Q* ma zdolność do wykonywania matematyki na poziomie szkoły podstawowej, co wywołało dyskusje wśród ekspertów na temat jego potencjału jako kamienia milowego w kierunku sztucznej inteligencji ogólnej (AGI). Chociaż OpenAI nie skomentowało tych raportów, domniemane możliwości Q* wywołały znaczące podekscytowanie i spekulacje w mediach społecznościowych i wśród entuzjastów AI.

Rozwój Q* jest godny uwagi, ponieważ istniejące modele językowe, takie jak ChatGPT i GPT-4, chociaż zdolne do niektórych zadań matematycznych, nie są szczególnie dobrze przystosowane do ich niezawodnego wykonywania. Wyzwanie polega na tym, że modele AI muszą nie tylko rozpoznawać wzorce, tak jak robią to obecnie za pomocą głębokiego uczenia i transformatorów, ale także rozumieć i wykonywać abstrakcyjne pojęcia. Matematyka, będąca miarą rozumowania, wymaga od AI planowania i wykonywania wielu kroków, demonstrując głębokie zrozumienie abstrakcyjnych pojęć. Ta zdolność oznaczałaby znaczący skok w możliwościach AI, potencjalnie sięgający poza matematykę do innych złożonych zadań.

Jednak eksperci ostrzegają przed przecenianiem tego rozwoju. Chociaż system AI, który niezawodnie rozwiązuje problemy matematyczne, byłby imponującym osiągnięciem, niekoniecznie sygnalizuje on nadejście superinteligentnej AI lub AGI. Bieżące badania AI, w tym wysiłki OpenAI, koncentrowały się na elementarnych problemach, z różnymi stopniami powodzenia w bardziej złożonych zadaniach.

Potencjalne zastosowania postępów, takich jak Q*, są ogromne, od personalizowanego nauczania po wspomaganie badań naukowych i inżynierskich. Jednak równie ważne jest zarządzanie oczekiwaniami i rozpoznawanie ograniczeń oraz problemów bezpieczeństwa związanych z takimi postępami. Obawy dotyczące ryzyka egzystencjalnego AI, podstawowej troski OpenAI, pozostają istotne, zwłaszcza gdy systemy AI zaczynają coraz więcej współdziałać z rzeczywistym światem.

Ruch LLM open-source

Aby wesprzeć badania LLM open-source, Meta wydała serie modeli Llama, wywołując falę nowych rozwojów opartych na Llama. Obejmuje to modele dostrajane z danymi instrukcyjnymi, takimi jak Alpaca, Vicuna, Lima i WizardLM. Badania rozprzestrzeniają się również na wzmacnianie możliwości agentów, rozumowania logicznego i modelowania długich kontekstów w ramach struktury Llama.

Ponadto istnieje rosnący trend tworzenia potężnych LLM od podstaw, z projektami takimi jak MPT, Falcon, XGen, Phi, Baichuan, Mistral, Grok i Yi. Te wysiłki odzwierciedlają zaangażowanie w demokratyzację możliwości modeli LLM zamkniętych, czyniąc zaawansowane narzędzia AI bardziej dostępnymi i wydajnymi.

Wpływ ChatGPT i modeli open-source na ochronę zdrowia

Patrzymy na przyszłość, w której LLM będą wspomagać notowanie kliniczne, wypełnianie formularzy dla zwrotów, oraz wspierać lekarzy w planowaniu diagnozy i leczenia. To przyciągnęło uwagę zarówno gigantów technologicznych, jak i instytucji opieki zdrowotnej.

Rozmowy Microsoftu z Epic, wiodącym dostawcą oprogramowania do elektronicznych kart zdrowia, sygnalizują integrację LLM z ochroną zdrowia. Inicjatywy są już wdrożone w UC San Diego Health i Stanford University Medical Center. Podobnie, partnerstwa Google z Mayo Clinic oraz uruchomienie przez Amazon (AMZN ) Web Services usługi HealthScribe, AI do dokumentacji klinicznej, oznaczają znaczące postępy w tym kierunku.

Jednak te szybkie wdrożenia budzą obawy o oddanie kontroli nad medycyną interesom korporacyjnym. Zamknięta natura tych LLM utrudnia ich ocenę. Ich możliwa modyfikacja lub przerwanie z powodów zysku mogłoby skompromitować opiekę nad pacjentami, prywatność i bezpieczeństwo.

Pilna potrzeba jest taka, aby podejście do rozwoju LLM w ochronie zdrowia było otwarte i inkluzywne. Instytucje opieki zdrowotnej, badacze, klinicyści i pacjenci muszą współpracować na całym świecie, aby tworzyć LLM open-source dla ochrony zdrowia. To podejście, podobne do Konsorcjum Trillion Parameter, pozwoliłoby na wspólne wykorzystanie zasobów obliczeniowych, finansowych i ekspertów.

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 różnorodnych projektach inżynierii oprogramowania, ze szczególnym uwzględnieniem AI/ML. Moja nieustanna ciekawość również skierowała mnie w stronę Natural Language Processing, dziedziny, którą chcę dalej eksplorować.