Modele i platformy AI

Sztuczna inteligencja wielomodalna ewoluuje, gdy ChatGPT zyskuje wzrok z GPT-4V(ision)

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

W ramach ciągłych wysiłkÃģw, aby uczynić sztuczną inteligencję bardziej podobną do ludzi, modele GPT OpenAI ciągle posuwają granice. GPT-4 jest teraz w stanie akceptować polecenia zarÃģwno w postaci tekstu, jak i obrazÃģw.

Wielomodalność w generatywnej sztucznej inteligencji oznacza zdolność modelu do generowania rÃģÅžnorodnych danych wyjściowych, takich jak tekst, obrazy lub dÅšwięk, w oparciu o dane wejściowe. Modele te, przeszkolone na określonych danych, uczą się podstawowych wzorcÃģw, aby generować podobne nowe dane, wzbogacając aplikacje sztucznej inteligencji.

Ostatnie postępy w sztucznej inteligencji wielomodalnej

Warto zwrÃģcić uwagę na ostatni znaczący skok w tej dziedzinie, ktÃģry jest widoczny w integracji DALL-E 3 z ChatGPT, co jest znaczącym ulepszeniem technologii tekst-to-image OpenAI. To połączenie pozwala na gładką interakcję, w ktÃģrej ChatGPT pomaga w tworzeniu precyzyjnych poleceń dla DALL-E 3, zmieniając pomysły uÅžytkownikÃģw w Åžywe sztucznie generowane dzieła sztuki. Tak więc, podczas gdy uÅžytkownicy mogą bezpośrednio wchodzić w interakcje z DALL-E 3, posiadanie ChatGPT w połączeniu sprawia, Åže proces tworzenia sztuki sztucznej inteligencji staje się znacznie bardziej przyjazny dla uÅžytkownika.

Zobacz więcej na temat DALL-E 3 i jego integracji z ChatGPT tutaj. To połączenie nie tylko pokazuje postęp w sztucznej inteligencji wielomodalnej, ale takÅže sprawia, Åže tworzenie sztuki sztucznej inteligencji staje się łatwiejsze dla uÅžytkownikÃģw.

Firma Google (GOOGL ) wprowadziła Med-PaLM M w czerwcu tego roku. Jest to model generatywny wielomodalny, ktÃģry jest zdolny do kodowania i interpretowania rÃģÅžnorodnych danych biomedycznych. To osiągnięcie zostało uzyskane poprzez dostosowanie modelu językowego PaLM-E do dziedzin medycznych, wykorzystując otwarte benchmarki, MultiMedBench. Ten benchmark składa się z ponad 1 miliona prÃģbek w 7 typach danych biomedycznych i 14 zadaniach, takich jak generowanie raportÃģw radiologicznych i odpowiedzi na pytania medyczne.

RÃģÅžne branÅže przyjmują innowacyjne narzędzia sztucznej inteligencji wielomodalnej, aby napędzać rozwÃģj biznesu, usprawniać operacje i podnosić zaangaÅžowanie klientÃģw. Postęp w zdolnościach sztucznej inteligencji głosowej, wideo i tekstowej napędza wzrost sztucznej inteligencji wielomodalnej.

Przedsiębiorstwa szukają aplikacji sztucznej inteligencji wielomodalnej, ktÃģre mogą zmienić modele biznesowe i procesy, otwierając drogi wzrostu w całym ekosystemie sztucznej inteligencji generatywnej, od narzędzi danych do nowych aplikacji sztucznej inteligencji.

Po wydaniu GPT-4 w marcu niektÃģrzy uÅžytkownicy zauwaÅžyli spadek jakości odpowiedzi w czasie, co jest problemem, ktÃģry został potwierdzony przez znanych deweloperÃģw i na forach OpenAI. Początkowo odrzucony przez OpenAI, pÃģÅšniejsze badanie potwierdziło problem. Wykazało ono spadek dokładności GPT-4 z 97,6% do 2,4% między marcem a czerwcem, co wskazuje na spadek jakości odpowiedzi wraz z kolejnymi aktualizacjami modelu.

chatgpt-ai

ChatGPT (niebieski) & sztuczna inteligencja (czerwony) trendy wyszukiwania Google

Hype wokÃģł Open AI’s ChatGPT powrÃģcił. Teraz posiada funkcję wizji GPT-4V, ktÃģra pozwala uÅžytkownikom na analizę obrazÃģw podanych przez nich. Jest to najnowsza funkcja, ktÃģra została udostępniona uÅžytkownikom.

Dodanie analizy obrazu do duÅžych modeli językowych, takich jak GPT-4, jest postrzegane przez niektÃģrych jako duÅžy krok naprzÃģd w badaniach i rozwoju sztucznej inteligencji. Ten rodzaj modelu językowego wielomodalnego otwiera nowe moÅžliwości, przenosząc modele językowe poza tekst, aby oferować nowe interfejsy i rozwiązywać nowe rodzaje zadań, tworząc nowe doświadczenia dla uÅžytkownikÃģw.

Szkolenie GPT-4V zostało zakończone w 2022 roku, a wczesny dostęp został udostępniony w marcu 2023 roku. Funkcja wizualna w GPT-4V jest napędzana przez technologię GPT-4. Proces szkolenia pozostał taki sam. Początkowo model został przeszkolony do przewidywania następnego słowa w tekście przy uÅžyciu ogromnego zbioru danych tekstowych i obrazÃģw z rÃģÅžnych ÅšrÃģdeł, w tym z Internetu.

PÃģÅšniej został dostosowany z uÅžyciem dodatkowych danych, wykorzystując metodę wzmocnionego uczenia się z ludzkimi opiniami (RLHF), aby generować dane wyjściowe, ktÃģre są preferowane przez ludzi.

Mechanika wizji GPT-4

Zdjęcia językowe GPT-4, chociaÅž imponujące, mają podstawowe metody, ktÃģre pozostają na powierzchni.

Aby zbadać tę hipotezę, wprowadzono nowy model językowy wizji, MiniGPT-4, wykorzystujący zaawansowany model językowy o nazwie Vicuna. Ten model wykorzystuje kodery wizji z pre-trenowanymi komponentami do percepcji wizualnej, wyrÃģwnując zakodowane cechy wizualne z modelem językowym Vicuna za pomocą jednej warstwy projekcji. Architektura MiniGPT-4 jest prosta, ale skuteczna, z naciskiem na wyrÃģwnywanie cech wizualnych i językowych w celu poprawy zdolności konwersacyjnych.

MiniGPT-4

Architektura MiniGPT-4 zawiera kodery wizji z pre-trenowanymi komponentami ViT i Q-Former, jedną liniową warstwę projekcji oraz zaawansowany model językowy Vicuna.

Trend autoregresyjnych modeli językowych w zadaniach wizji-języka rÃģwnieÅž wzrasta, wykorzystując transfer między modalnościami do udostępniania wiedzy między domenami języka i multimodalnymi.

MiniGPT-4 mostkuje domeny wizualne i językowe, wyrÃģwnując informacje wizualne z pre-trenowanego kodera wizji z zaawansowanym modelem językowym. Model wykorzystuje Vicuna jako dekodera językowego i stosuje dwuetapowy proces szkolenia. Początkowo jest szkolony na duÅžym zbiorze par obraz-tekst, aby zrozumieć wiedzę wizji-języka, a następnie dostosowany do mniejszego, wysokiej jakości zbioru danych, aby poprawić niezawodność i uÅžyteczność generacji.

Aby poprawić naturalność i uÅžyteczność generowanych językÃģw w MiniGPT-4, badacze opracowali dwuetapowy proces wyrÃģwnywania, rozwiązując brak odpowiednich zestawÃģw danych wizji-języka. Stworzyli specjalny zestaw danych do tego celu.

Początkowo model generował szczegÃģłowe opisy obrazÃģw wejściowych, poprawiając szczegÃģłowość za pomocą konwersacyjnego polecenia wyrÃģwnanego z formatem modelu językowego Vicuna. Ten etap miał na celu generowanie bardziej kompletnych opisÃģw obrazÃģw.

Początkowe polecenie opisu obrazu:

###Człowiek: <Img><ImageFeature></Img>Opisz ten obraz szczegÃģłowo. Podaj jak najwięcej szczegÃģłÃģw. Powiedz wszystko, co widzisz. ###Asystent:

Do przetwarzania danych wykorzystano korektę nieścisłości lub błędÃģw w wygenerowanych opisach za pomocą ChatGPT, a następnie ręczną weryfikację, aby zapewnić wysoką jakość.

Polecenie dokładnego dostosowania:

###Człowiek: <Img><ImageFeature></Img><Instruction>###Asystent:

To badanie otwiera okno do zrozumienia mechaniki generatywnej sztucznej inteligencji wielomodalnej, takiej jak GPT-4, rzucając światło na to, jak modalności wizji i języka mogą być skutecznie zintegrowane, aby generować spÃģjne i bogate kontekstowo dane wyjściowe.

Eksploracja wizji GPT-4

Określanie pochodzenia obrazÃģw z ChatGPT

GPT-4 Vision zwiększa moÅžliwości ChatGPT do analizy obrazÃģw i określania ich pochodzenia geograficznego. Ta funkcja przenosi interakcje uÅžytkownikÃģw z samego tekstu na połączenie tekstu i wizji, stając się przydatnym narzędziem dla tych, ktÃģrzy są ciekawi rÃģÅžnych miejsc poprzez dane obrazowe.

Chatgpt-vision-GPT-4

Zapytanie ChatGPT o to, gdzie został wykonany obraz pomnika

ZłoÅžone pojęcia matematyczne

GPT-4 Vision wyrÃģÅžnia się w analizowaniu złoÅžonych pojęć matematycznych poprzez analizę wyraÅžeń graficznych lub odręcznych. Ta funkcja działa jako przydatne narzędzie dla osÃģb, ktÃģre chcą rozwiązać skomplikowane problemy matematyczne, czyniąc GPT-4 Vision godnym uwagi wsparciem w dziedzinach edukacyjnych i akademickich.

Chatgpt-vision-GPT-4

Zapytanie ChatGPT o zrozumienie złoÅžonego pojęcia matematycznego

Przekształcanie danych wejściowych odręcznych w kody LaTeX

Jedną z godnych uwagi zdolności GPT-4V jest jego zdolność do tłumaczenia danych wejściowych odręcznych na kody LaTeX. Ta funkcja jest błogosławieństwem dla badaczy, akademikÃģw i studentÃģw, ktÃģrzy często muszą przekształcać wyraÅženia matematyczne lub inne informacje techniczne zapisane odręcznie w postać cyfrową. Przekształcenie z odręcznego w LaTeX rozszerza horyzont cyfryzacji dokumentÃģw i upraszcza proces pisania technicznego.

GPT-4V's ability to convert handwritten input into LaTeX codes

GPT-4V’s ability to convert handwritten input into LaTeX codes

Wydobywanie szczegÃģłÃģw tabeli

GPT-4V prezentuje umiejętność wydobywania szczegÃģłÃģw z tabel i odpowiadania na związane z nimi pytania, co jest istotnym atutem w analizie danych. UÅžytkownicy mogą wykorzystać GPT-4V do przeszukiwania tabel, gromadzenia kluczowych informacji i rozwiązywania pytań, czyniąc go solidnym narzędziem dla analitykÃģw danych i innych specjalistÃģw.

GPT-4V deciphering table details and responding to related queries

GPT-4V deciphering table details and responding to related queries

Pochopienie wskazywania wizualnego

Unikalna zdolność GPT-4V do pochopenia wskazywania wizualnego dodaje nowy wymiar do interakcji uÅžytkownika. Poprzez zrozumienie wskazań wizualnych, GPT-4V moÅže odpowiadać na pytania z wyÅžszym kontekstowym zrozumieniem.

GPT-4V-demonstrates-the-unique-capability-of-understanding-visual-pointing

GPT-4V showcases the distinct ability to comprehend visual pointing

Budowanie prostych stron internetowych za pomocą rysunku

Zainspirowany tym tweetem, prÃģbowałem stworzyć makietę dla strony unite.ai.

ChociaÅž wynik nie całkowicie odpowiadał moim początkowym wizjom, oto efekt, jaki osiągnąłem.

ChatGPT Vision based output HTML Frontend

ChatGPT Vision based output HTML Frontend

Ograniczenia i wady GPT-4V(ision)

Aby przeanalizować GPT-4V, zespÃģł Open AI przeprowadził jakościowe i ilościowe oceny. Ocenę jakościową przeprowadzono za pomocą wewnętrznych testÃģw i zewnętrznych recenzji ekspertÃģw, a ocenę ilościową przeprowadzono, mierząc odmowy modelu i dokładność w rÃģÅžnych scenariuszach, takich jak identyfikacja szkodliwych treści, rozpoznawanie demograficzne, problemy z prywatnością, geolokalizacja, bezpieczeństwo cybernetyczne i multimodalne ataki.

Jednak model ten nie jest doskonały.

Artykuł artykuł podkreśla ograniczenia GPT-4V, takie jak błędne wnioski i brakujący tekst lub znaki w obrazach. MoÅže on wymyślać lub wymyślać fakty. SzczegÃģlnie nie nadaje się do identyfikacji niebezpiecznych substancji w obrazach, często myląc je.

W obrazach medycznych GPT-4V moÅže dostarczać niekonsekwentne odpowiedzi i brakuje mu świadomości standardowych praktyk, co moÅže prowadzić do potencjalnych błędnych diagnoz.

Niewiarygodne wyniki dla celÃģw medycznych.

Niewiarygodne wyniki dla celÃģw medycznych (ÅđrÃģdło)

Ono rÃģwnieÅž nie potrafi zrozumieć nuansÃģw pewnych symboli nienawiści i moÅže generować nieodpowiednie treści na podstawie wizualnych danych wejściowych. OpenAI zaleca, aby nie uÅžywać GPT-4V do krytycznych interpretacji, szczegÃģlnie w kontekstach medycznych lub wraÅžliwych.

Podsumowanie

Utworzone przy uÅžyciu Fast Stable Diffusion XL

Utworzone przy uÅžyciu Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl

Przybycie GPT-4 Vision (GPT-4V) wnosi wiele interesujących moÅžliwości i nowych wyzwań. Przed wprowadzeniem go do uÅžytku, wiele wysiłku włoÅžono w minimalizowanie ryzyka, zwłaszcza w odniesieniu do zdjęć ludzi. Impresjonujące jest to, jak GPT-4V zwiększył swoje moÅžliwości, pokazując duÅžy potencjał w trudnych dziedzinach, takich jak medycyna i nauka.

Teraz pojawiają się duÅže pytania. Na przykład, czy te modele powinny być w stanie identyfikować znane osoby na zdjęciach? Czy powinny one zgadywać płeć, rasę lub uczucia osoby na podstawie obrazu? Czy powinny być specjalne dostosowania, aby pomÃģc osobom z niepełnosprawnościami wzroku? Te pytania otwierają puszkę robaka w kwestiach prywatności, sprawiedliwości i tego, jak sztuczna inteligencja powinna wpisywać się w nasze Åžycie, co jest czymś, w czym kaÅždy powinien mieć głos.

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 rÃģÅžnorodnych projektach inÅžynierii oprogramowania, ze szczegÃģlnym uwzględnieniem AI/ML. Moja nieustanna ciekawość rÃģwnieÅž skierowała mnie w stronę Natural Language Processing, dziedziny, ktÃģrą chcę dalej eksplorować.