Modele i platformy AI

Sztuczna inteligencja generatywna: Pomysł za ChatGPT, DALL-E, Midjourney i więcej

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Świat sztuki, komunikacji i postrzegania rzeczywistości przechodzi przez szybkie przemiany. Jeśli spojrzymy na historię ludzkiej innowacji, możemy uznać wynalezienie koła lub odkrycie elektryczności za monumentalne skoki. Dziś nowa rewolucja ma miejsce – łącząc przepaść między ludzką kreatywnością a obliczeniami maszynowymi. To jest sztuczna inteligencja generatywna.

Modele generatywne zatarły granicę między ludźmi a maszynami. Z pojawieniem się modeli takich jak GPT-4, które wykorzystują moduły transformatora, zbliżyliśmy się do naturalnej i bogatej w kontekst generacji języka. Te postępy zaowocowały zastosowaniami w tworzeniu dokumentów, systemach dialogowych chatbotów i nawet kompozycji muzyki syntetycznej.

Ostatnie decyzje dużych firm podkreślają jego znaczenie. Microsoft (MSFT ) już zakończył swoją aplikację Cortana w tym miesiącu, aby priorytetem nowych innowacji sztucznej inteligencji generatywnej, takich jak Bing Chat. Apple (AAPL ) również poświęcił znaczną część swojego $22,6 miliardów budżetu badawczo-rozwojowego sztucznej inteligencji generatywnej, jak podaje CEO Tim Cook.

Nowa era modeli: Generatywne vs. Dyskryminatywne

Historia sztucznej inteligencji generatywnej nie dotyczy tylko jej zastosowań, ale fundamentalnie jej wewnętrznych mechanizmów. W ekosystemie sztucznej inteligencji istnieją dwa modele: dyskryminatywne i generatywne.

Modele dyskryminatywne to te, z którymi większość ludzi spotyka się w codziennym życiu. Te algorytmy pobierają dane wejściowe, takie jak tekst lub obraz, i łączą je z docelowym wyjściem, takim jak tłumaczenie słowa lub diagnoza medyczna. Są to mapowania i predykcje.

Modele generatywne, z drugiej strony, są twórcami. Nie tylko interpretują lub przewidują, ale generują nowe, złożone wyjścia z wektorów liczb, które często nie są nawet związane z wartościami rzeczywistymi.

 

Typy sztucznej inteligencji generatywnej: Tekst do tekstu, tekst do obrazu (GPT, DALL-E, Midjourney)

Technologie za sztuczną inteligencją generatywną

Modele generatywne zawdzięczają swoje istnienie głębokim sieciom neuronowym, złożonym strukturom zaprojektowanym w celu naśladowania funkcjonalności ludzkiego mózgu. Przechwytując i przetwarzając wielowarstwowe zmiany w danych, te sieci służą jako podstawa licznych modeli generatywnych.

Jak te modele generatywne są tworzone? Zazwyczaj są one budowane z głębokich sieci neuronowych, zoptymalizowanych do przechwycenia wielowarstwowych zmian w danych. Przykładem jest Generative Adversarial Network (GAN), gdzie dwie sieci neuronowe, generator i dyskryminator, konkurują i uczą się od siebie w unikalnej relacji nauczyciel-uczeń. Od malowania po transfer stylu, od kompozycji muzyki po grę, te modele ewoluują i rozwijają się w sposób wcześniej niewyobrażalny.

To nie kończy się na GAN. Variational Autoencoders (VAE) to kolejny kluczowy gracz w polu modeli generatywnych. VAE wyróżniają się zdolnością tworzenia fotorealistycznych obrazów z pozornie losowych liczb. Jak? Przetwarzając te liczby przez wektor latentny, dają one życie sztuce, która odbija złożoności ludzkiej estetyki.

Typy sztucznej inteligencji generatywnej: Tekst do tekstu, tekst do obrazu

Transformery i LLM

Artykuł „Attention Is All You Need” autorstwa Google (GOOGL ) Brain oznaczał zmianę w sposobie myślenia o modelowaniu tekstu. Zamiast złożonych i sekwencyjnych architektur, takich jak Recurrent Neural Networks (RNN) lub Convolutional Neural Networks (CNN), model Transformer wprowadził pojęcie uwagi, które podstawowo oznaczało koncentrowanie się na różnych częściach tekstu wejściowego w zależności od kontekstu. Jednym z głównych korzyści było ułatwienie paralelizacji. W przeciwieństwie do RNN, które przetwarzają tekst sekwencyjnie, co utrudnia ich skalowanie, Transformatory mogą przetwarzać części tekstu jednocześnie, co sprawia, że trening jest szybszy i bardziej wydajny na dużych zbiorach danych.

W długim tekście nie każde słowo lub zdanie, które czytasz, ma takie same znaczenie. Niektóre części wymagają więcej uwagi w zależności od kontekstu. To zdolność do przesunięcia naszej uwagi na podstawie istotności jest tym, co mechanizm uwagi naśladuje.

Aby to zrozumieć, pomyśl o zdaniu: “Unite AI Publikuje AI i nowości z dziedziny robotyki.” Przewidywanie następnego słowa wymaga zrozumienia tego, co najbardziej istotne w poprzednim kontekście. Termin ‘robotyka’ może sugerować, że następne słowo może być związane z konkretnym postępem lub wydarzeniem w dziedzinie robotyki, podczas gdy ‘Publikuje’ może wskazywać, że następny kontekst może dotyczyć niedawnego publikowania lub artykułu.

Samouwaga Mechanizm wyjaśnienia na przykładzie zdania
Ilustracja samouwagi

Mechanizmy uwagi w Transformatore są zaprojektowane, aby osiągnąć ten wybiórczy focus. Ocenią one znaczenie różnych części tekstu wejściowego i zdecydują, gdzie „spojrzeć”, generując odpowiedź. To odejście od starszych architektur, takich jak RNN, które próbowały wcisnąć istotę całego tekstu wejściowego do jednego ‘stanu’ lub ‘pamięci’.

Działanie uwagi można porównać do systemu przechowywania kluczy i wartości. Próbując przewidzieć następne słowo w zdaniu, każde poprzednie słowo oferuje ‘klucz’ sugerujący jego potencjalne znaczenie, a na podstawie tego, jak dobrze te klucze pasują do bieżącego kontekstu (lub zapytania), przyczyniają się one do ‘wartości’ lub wagi przewidywania.

Te zaawansowane modele głębokiego uczenia się zostały bezproblemowo zintegrowane z różnymi aplikacjami, od ulepszeń silnika wyszukiwania Google z BERT do GitHub Copilot, który wykorzystuje możliwości Large Language Models (LLM), aby przekształcić proste fragmenty kodu w pełnoprawny kod źródłowy.

Large Language Models (LLM) takie jak GPT-4, Bard i LLaMA to ogromne konstrukcje zaprojektowane do odczytywania i generowania ludzkiego języka, kodu i więcej. Ich ogromny rozmiar, sięgający od miliardów do bilionów parametrów, jest jedną z ich wyróżniających cech. Te LLM są karmione ogromnymi ilościami danych tekstowych, co pozwala im zrozumieć złożoności ludzkiego języka. Jedną z ich charakterystycznych cech jest zdolność do „niewielkiego” uczenia. W przeciwieństwie do konwencjonalnych modeli, które wymagają ogromnych ilości specyficznych danych szkoleniowych, LLM mogą uogólniać z bardzo ograniczonej liczby przykładów (lub „strzałów”)

Stan Large Language Models (LLM) na koniec 2023

Nazwa modelu Deweloper Parametry Dostępność i dostęp Wyróżniające cechy i uwagi
GPT-4 OpenAI 1,5 biliona Nie jest otwarte, dostęp tylko przez API Zadziwiająca wydajność w różnych zadaniach, może przetwarzać obrazy i tekst, maksymalna długość wejścia to 32 768 tokenów
GPT-3 OpenAI 175 miliardów Nie jest otwarte, dostęp tylko przez API Wykazał zdolność do uczenia się z niewielu przykładów i bez przykładów. Wykonuje uzupełnianie tekstu w języku naturalnym.
BLOOM BigScience 176 miliardów Model do pobrania, dostępny API Model językowy wielojęzyczny opracowany we współpracy międzynarodowej. Obsługuje 13 języków programowania.
LaMDA Google 173 miliardy Nie jest otwarte, brak API lub pobierania Nauczony na dialogach, mógłby nauczyć się mówić o niemal wszystkim.
MT-NLG Nvidia /Microsoft 530 miliardów Dostęp do API po zastosowaniu Wykorzystuje architekturę Megatron opartą na transformatore, dla różnych zadań NLP.
LLaMA Meta AI 7B do 65B) Dostęp do pobierania po zastosowaniu Zamierzone do demokratyzacji AI, oferując dostęp tym, którzy są w badaniach, rządzie i środowisku akademickim.

Jak są wykorzystywane LLM?

LLM mogą być wykorzystywane na wiele sposobów, w tym:

  1. Bezpośrednie wykorzystanie: Po prostu korzystanie z wstępnie wyuczonych LLM do generacji tekstu lub przetwarzania. Na przykład, korzystanie z GPT-4 do napisania posta na blogu bez dodatkowego dokształcania.
  2. Dokształcanie: Przystosowanie wstępnie wyuczonego LLM do konkretnego zadania, metoda znana jako transfer learning. Przykładem byłoby dostosowanie T5 do generowania podsumowań dokumentów w określonej branży.
  3. Przeszukiwanie informacji: Używanie LLM, takich jak BERT lub GPT, jako części większych architektur, aby rozwijać systemy, które mogą pobierać i klasyfikować informacje.
Sztuczna inteligencja generatywna ChatGPT - Dokształcanie
Architektura dokształcania ChatGPT

Wielogłowy mechanizm uwagi: Dlaczego jeden, gdy można mieć wiele?

Jednak poleganie na jednym mechanizmie uwagi może być ograniczające. Różne słowa lub sekwencje w tekście mogą mieć różne typy istotności lub powiązań. To jest tam, gdzie pojawia się wielogłowy mechanizm uwagi. Zamiast jednego zestawu wag uwagi, wielogłowy mechanizm uwagi zatrudnia wiele zestawów, pozwalając modelowi przechwycić bogatszy wachlarz relacji w tekście wejściowym. Każda „głowa” uwagi może koncentrować się na różnych częściach lub aspektach tekstu wejściowego, a ich łączna wiedza jest wykorzystywana do ostatecznej predykcji.

ChatGPT: Najpopularniejszy narzędzie sztucznej inteligencji generatywnej

Zaczynając od powstania GPT w 2018 roku, model został zbudowany na fundamencie 12 warstw, 12 głów uwagi i 120 milionów parametrów, głównie trenowany na zbiorze danych BookCorpus. Był to imponujący początek, dający wgląd w przyszłość modeli językowych.

GPT-2, zaprezentowany w 2019 roku, miał czterokrotny wzrost warstw i głów uwagi. Znacząco, jego liczba parametrów skoczyła do 1,5 miliarda. Ta udoskonalona wersja pochodziła ze zbioru WebText, wzbogaconego o 40 GB tekstu z różnych linków Reddit.

GPT-3, wydany w maju 2020 roku, miał 96 warstw, 96 głów uwagi i ogromną liczbę parametrów – 175 miliardów. To, co wyróżniało GPT-3, było różnorodne źródła danych szkoleniowych, obejmujące CommonCrawl, WebText, angielską Wikipedię, zbiory książek i inne, łącząc się na łączną objętość 570 GB.

Szczegóły działania ChatGPT pozostają ściśle strzeżoną tajemnicą. Jednak proces zwany „wzmocnionym uczeniem się z ludzkiej informacji zwrotnej” (RLHF) jest znany jako kluczowy. Pochodzący z wcześniejszego projektu ChatGPT, ta technika odegrała istotną rolę w udoskonaleniu modelu GPT-3.5, aby był bardziej zgodny z napisanymi instrukcjami.

Proces szkolenia ChatGPT składa się z trzech etapów:

  1. Szkolenie nadzorowane: Obejmuje tworzenie ludzkich wejść i wyjść konwersacyjnych, aby udoskonalić podstawowy model GPT-3.5.
  2. Modelowanie nagród: Ludzie oceniają różne wyjścia modelu pod kątem jakości, pomagając wytrenować model nagród, który ocenia każde wyjście, biorąc pod uwagę kontekst konwersacji.
  3. Uczenie się wzmocnione: Kontekst konwersacji służy jako tło, gdzie podstawowy model proponuje odpowiedź. Odpowiedź ta jest oceniana przez model nagród, a proces jest optymalizowany za pomocą algorytmu o nazwie proximal policy optimization (PPO).

Dla tych, którzy dopiero zaczynają swoją przygodę z ChatGPT, kompletny przewodnik startowy można znaleźć tutaj. Jeśli chcesz zagłębić się w inżynierię promtu z ChatGPT, mamy również zaawansowany przewodnik, który rzuca światło na najnowsze i najbardziej zaawansowane techniki promtu, dostępny pod adresem ‘ChatGPT & Zaawansowana inżynieria promtu: Prowadząc ewolucję AI‘.

Model dyfuzyjny i wielomodalny

Podczas gdy modele takie jak VAE i GAN generują swoje wyjścia przez jednorazowy przebieg, a więc są ograniczone do tego, co produkują, modele dyfuzyjne wprowadziły pojęcie „iteracyjnej refinaryzacji”. Za pomocą tej metody wracają, poprawiając błędy z poprzednich kroków i stopniowo produkując bardziej wyrafinowany wynik.

Centralnym elementem modeli dyfuzyjnych jest sztuka „zanieczyszczenia” i „poprawy”. W fazie treningu typowy obraz jest stopniowo zanieczyszczany przez dodawanie różnych poziomów szumu. Ta wersja z szumem jest następnie podawana do modelu, który próbuje „odszumieniać” lub „odzanieczyszczyć” ją. Przez wiele rund tego procesu model staje się zdolny do rekonstrukcji, rozumiejąc zarówno subtelne, jak i znaczące aberracje.

Obraz wygenerowany z Midjourney
Obraz wygenerowany z Midjourney

Proces generowania nowych obrazów po treningu jest interesujący. Zaczynając od całkowicie losowego wejścia, jest on stale udoskonalany za pomocą predykcji modelu. Zamierzeniem jest osiągnięcie idealnego obrazu z minimalną liczbą kroków. Kontrolowanie poziomu zanieczyszczenia odbywa się za pomocą „harmonogramu szumu”, mechanizmu, który określa, ile szumu jest stosowane na różnych etapach. Planista, jak można zobaczyć w bibliotekach takich jak „diffusers”, decyduje o charakterze tych szumnych wersji na podstawie ustalonych algorytmów.

Kluczową architekturą dla wielu modeli dyfuzyjnych jest UNet – sieć neuronowa konwolucyjna dostosowana do zadań wymagających wyjść o tym samym wymiarze przestrzennym co dane wejściowe. Jest to połączenie warstw downsamplingu i upsamplingu, ściśle połączonych, aby zachować dane o wysokiej rozdzielczości, co jest kluczowe dla wyjść związanych z obrazami.

Zanurzając się głębiej w świat modeli generatywnych, DALL-E 2 od OpenAI pojawia się jako wybitny przykład fuzji zdolności AI tekstowych i wizualnych. Zatrudnia strukturę trójwarstwową:

DALL-E 2 prezentuje trójwarstwową architekturę:

  1. Kodowanie tekstu: Przekształca tekstowy promt w konceptualne osadzenie w przestrzeni latentnej. Ten model nie zaczyna od zera. Opiera się na zestawie danych OpenAI Contrastive Language–Image Pre-training (CLIP) jako swojej podstawy. CLIP służy jako mostek między danymi wizualnymi a tekstowymi, ucząc się pojęć wizualnych za pomocą języka naturalnego. Za pomocą mechanizmu kontrastowego uczenia, identyfikuje i dopasowuje obrazy do ich odpowiednich opisów tekstowych.
  2. Przedział: Osadzanie tekstu pochodzące z kodera jest następnie przekształcane w osadzanie obrazu. DALL-E 2 przetestował zarówno autoregresyjne, jak i dyfuzyjne metody do tego zadania, z tym ostatnim pokazując lepsze wyniki. Modele autoregresyjne, jak te widoczne w Transformatore i PixelCNN, generują wyjścia w sekwencjach. Z drugiej strony, modele dyfuzyjne, takie jak ten użyty w DALL-E 2, przekształcają losowy szum w przewidywane osadzanie obrazu za pomocą osadzania tekstu.
  3. Dekoder: Kulminacja procesu, generuje ostateczne wyjście wizualne na podstawie promtu tekstu i osadzania obrazu z fazy przedniej. Dekoder DALL-E 2 zawdzięcza swoją architekturę innemu modelowi, GLIDE, który również może produkować realistyczne obrazy z podpowiedziami tekstowymi.
Uproszczona architektura modelu DALL-E
Uproszczona architektura modelu DALL-E

Użytkownicy Pythona zainteresowani Langchain powinni sprawdzić nasz szczegółowy tutorial, obejmujący wszystko od podstaw do zaawansowanych technik.

Zastosowania sztucznej inteligencji generatywnej

Domeny tekstowe

Zaczynając od tekstu, sztuczna inteligencja generatywna została fundamentalnie zmieniona przez chatboty takie jak ChatGPT. Opierając się silnie na przetwarzaniu języka naturalnego (NLP) i dużych modelach językowych (LLM), te jednostki są wyposażone w wykonywanie zadań od generacji kodu i tłumaczenia języka po sumaryzowanie i analizę sentymentu. ChatGPT, na przykład, stał się powszechnie przyjętym standardem dla milionów. To jest dalej wspierane przez platformy AI konwersacyjne, oparte na LLM, takich jak GPT-4, PaLM i BLOOM, które bezproblemowo produkują tekst, asystują w programowaniu i nawet oferują rozumowanie matematyczne.

Z komercyjnego punktu widzenia te modele stają się niezwykle cenne. Firmy wykorzystują je do różnych operacji, w tym zarządzania ryzykiem, optymalizacji zapasów i prognozowania popytu. Niektóre godne uwagi przykłady obejmują Bing AI, Google’s BARD i ChatGPT API.

Sztuka

Świat obrazów doświadczył dramatycznych przemian dzięki sztucznej inteligencji generatywnej, szczególnie od wprowadzenia DALL-E 2 w 2022 roku. Ta technologia, która może generować obrazy z podpowiedziami tekstowymi, ma zarówno artystyczne, jak i profesjonalne implikacje. Na przykład, Midjourney wykorzystał tę technologię do produkcji imponująco realistycznych obrazów. Ten ostatni post demistyfikuje Midjourney w szczegółowym przewodniku, wyjaśniając zarówno platformę, jak i związane z nią inżynierię promtu. Ponadto, platformy takie jak Alpaca AI i Photoroom AI wykorzystują sztuczną inteligencję generatywną do zaawansowanych funkcji edycji obrazu, takich jak usuwanie tła, usuwanie obiektów i nawet restauracja twarzy.

Produkcja wideo

Produkcja wideo, chociaż wciąż w powijakach w dziedzinie sztucznej inteligencji generatywnej, pokazuje obiecujące postępy. Platformy takie jak Imagen Video, Meta Make A Video i Runway Gen-2 są na granicy tego, co jest możliwe, nawet jeśli w pełni realistyczne wyjścia są jeszcze w przyszłości. Te modele oferują znaczną użyteczność do tworzenia cyfrowych wideo z ludźmi, z aplikacjami takimi jak Synthesia i SuperCreator na czele. Godne uwagi jest to, że Tavus AI oferuje unikalną wartość, personalizując wideo dla poszczególnych członków publiczności, co jest błogosławieństwem dla firm.

Tworzenie kodu

Kodowanie, niezbędny aspekt naszego cyfrowego świata, nie pozostało nietknięte przez sztuczną inteligencję generatywną. Chociaż ChatGPT jest ulubionym narzędziem, wiele innych aplikacji AI zostało opracowanych do celów programistycznych. Te platformy, takie jak GitHub Copilot, Alphacode i CodeComplete, służą jako asystenci programistyczni i mogą nawet produkować kod z podpowiedziami tekstowymi. Co jest interesujące, to ich dostosowywalność. Codex, siła napędowa GitHub Copilot, może być dostosowany do stylu kodowania jednostki, podkreślając potencjał personalizacji sztucznej inteligencji generatywnej.

Podsumowanie

Łącząc ludzką kreatywność z obliczeniami maszynowymi, sztuczna inteligencja generatywna ewoluowała w niezwykle cenne narzędzie, z platformami takimi jak ChatGPT i DALL-E 2, które rozciągają granice tego, co jest możliwe. Od tworzenia treści tekstowych po kształtowanie wizualnych arcydzieł, ich zastosowania są ogromne i zróżnicowane.

Jak w przypadku każdej technologii, implikacje etyczne są najważniejsze. Podczas gdy sztuczna inteligencja generatywna obiecuje nieograniczoną kreatywność, jest kluczowe, aby ją wykorzystywać odpowiedzialnie, będąc świadomym potencjalnych uprzedzeń i mocy manipulacji danymi.

Z narzędziami takimi jak ChatGPT stają się coraz bardziej dostępne, teraz jest idealny moment, aby sprawdzić wody i eksperymentować. Niezależnie od tego, czy jesteś artystą, programistą czy entuzjastą technologii, dziedzina sztucznej inteligencji generatywnej jest pełna możliwości, które czekają na odkrycie. Rewolucja nie jest na horyzoncie; jest tu i teraz. Więc, zanurz się!

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 różnorodnych projektach inżynierii oprogramowania, ze szczególnym uwzględnieniem AI/ML. Moja nieustanna ciekawość również skierowała mnie w stronę Natural Language Processing, dziedziny, którą chcę dalej eksplorować.