Modele i platformy AI
Sztuczna inteligencja wielomodalna ewoluuje, gdy ChatGPT zyskuje wzrok z GPT-4V(ision)
W ramach ciÄ gÅych wysiÅkÃģw, aby uczyniÄ sztucznÄ inteligencjÄ bardziej podobnÄ do ludzi, modele GPT OpenAI ciÄ gle posuwajÄ granice. GPT-4 jest teraz w stanie akceptowaÄ polecenia zarÃģwno w postaci tekstu, jak i obrazÃģw.
WielomodalnoÅÄ w generatywnej sztucznej inteligencji oznacza zdolnoÅÄ modelu do generowania rÃģÅžnorodnych danych wyjÅciowych, takich jak tekst, obrazy lub dÅšwiÄk, w oparciu o dane wejÅciowe. Modele te, przeszkolone na okreÅlonych danych, uczÄ siÄ podstawowych wzorcÃģw, aby generowaÄ podobne nowe dane, wzbogacajÄ c aplikacje sztucznej inteligencji.
Ostatnie postÄpy w sztucznej inteligencji wielomodalnej
Warto zwrÃģciÄ uwagÄ na ostatni znaczÄ cy skok w tej dziedzinie, ktÃģry jest widoczny w integracji DALL-E 3 z ChatGPT, co jest znaczÄ cym ulepszeniem technologii tekst-to-image OpenAI. To poÅÄ czenie pozwala na gÅadkÄ interakcjÄ, w ktÃģrej ChatGPT pomaga w tworzeniu precyzyjnych poleceÅ dla DALL-E 3, zmieniajÄ c pomysÅy uÅžytkownikÃģw w Åžywe sztucznie generowane dzieÅa sztuki. Tak wiÄc, podczas gdy uÅžytkownicy mogÄ bezpoÅrednio wchodziÄ w interakcje z DALL-E 3, posiadanie ChatGPT w poÅÄ czeniu sprawia, Åže proces tworzenia sztuki sztucznej inteligencji staje siÄ znacznie bardziej przyjazny dla uÅžytkownika.
Zobacz wiÄcej na temat DALL-E 3 i jego integracji z ChatGPT tutaj. To poÅÄ czenie nie tylko pokazuje postÄp w sztucznej inteligencji wielomodalnej, ale takÅže sprawia, Åže tworzenie sztuki sztucznej inteligencji staje siÄ Åatwiejsze dla uÅžytkownikÃģw.
Firma Google (GOOGL ) wprowadziÅa Med-PaLM M w czerwcu tego roku. Jest to model generatywny wielomodalny, ktÃģry jest zdolny do kodowania i interpretowania rÃģÅžnorodnych danych biomedycznych. To osiÄ gniÄcie zostaÅo uzyskane poprzez dostosowanie modelu jÄzykowego PaLM-E do dziedzin medycznych, wykorzystujÄ c otwarte benchmarki, MultiMedBench. Ten benchmark skÅada siÄ z ponad 1 miliona prÃģbek w 7 typach danych biomedycznych i 14 zadaniach, takich jak generowanie raportÃģw radiologicznych i odpowiedzi na pytania medyczne.
RÃģÅžne branÅže przyjmujÄ innowacyjne narzÄdzia sztucznej inteligencji wielomodalnej, aby napÄdzaÄ rozwÃģj biznesu, usprawniaÄ operacje i podnosiÄ zaangaÅžowanie klientÃģw. PostÄp w zdolnoÅciach sztucznej inteligencji gÅosowej, wideo i tekstowej napÄdza wzrost sztucznej inteligencji wielomodalnej.
PrzedsiÄbiorstwa szukajÄ aplikacji sztucznej inteligencji wielomodalnej, ktÃģre mogÄ zmieniÄ modele biznesowe i procesy, otwierajÄ c drogi wzrostu w caÅym ekosystemie sztucznej inteligencji generatywnej, od narzÄdzi danych do nowych aplikacji sztucznej inteligencji.
Po wydaniu GPT-4 w marcu niektÃģrzy uÅžytkownicy zauwaÅžyli spadek jakoÅci odpowiedzi w czasie, co jest problemem, ktÃģry zostaÅ potwierdzony przez znanych deweloperÃģw i na forach OpenAI. PoczÄ tkowo odrzucony przez OpenAI, pÃģÅšniejsze badanie potwierdziÅo problem. WykazaÅo ono spadek dokÅadnoÅci GPT-4 z 97,6% do 2,4% miÄdzy marcem a czerwcem, co wskazuje na spadek jakoÅci odpowiedzi wraz z kolejnymi aktualizacjami modelu.
Hype wokÃģÅ Open AIâs ChatGPT powrÃģciÅ. Teraz posiada funkcjÄ wizji GPT-4V, ktÃģra pozwala uÅžytkownikom na analizÄ obrazÃģw podanych przez nich. Jest to najnowsza funkcja, ktÃģra zostaÅa udostÄpniona uÅžytkownikom.
Dodanie analizy obrazu do duÅžych modeli jÄzykowych, takich jak GPT-4, jest postrzegane przez niektÃģrych jako duÅžy krok naprzÃģd w badaniach i rozwoju sztucznej inteligencji. Ten rodzaj modelu jÄzykowego wielomodalnego otwiera nowe moÅžliwoÅci, przenoszÄ c modele jÄzykowe poza tekst, aby oferowaÄ nowe interfejsy i rozwiÄ zywaÄ nowe rodzaje zadaÅ, tworzÄ c nowe doÅwiadczenia dla uÅžytkownikÃģw.
Szkolenie GPT-4V zostaÅo zakoÅczone w 2022 roku, a wczesny dostÄp zostaÅ udostÄpniony w marcu 2023 roku. Funkcja wizualna w GPT-4V jest napÄdzana przez technologiÄ GPT-4. Proces szkolenia pozostaÅ taki sam. PoczÄ tkowo model zostaÅ przeszkolony do przewidywania nastÄpnego sÅowa w tekÅcie przy uÅžyciu ogromnego zbioru danych tekstowych i obrazÃģw z rÃģÅžnych ÅšrÃģdeÅ, w tym z Internetu.
PÃģÅšniej zostaÅ dostosowany z uÅžyciem dodatkowych danych, wykorzystujÄ c metodÄ wzmocnionego uczenia siÄ z ludzkimi opiniami (RLHF), aby generowaÄ dane wyjÅciowe, ktÃģre sÄ preferowane przez ludzi.
Mechanika wizji GPT-4
ZdjÄcia jÄzykowe GPT-4, chociaÅž imponujÄ ce, majÄ podstawowe metody, ktÃģre pozostajÄ na powierzchni.
Aby zbadaÄ tÄ hipotezÄ, wprowadzono nowy model jÄzykowy wizji, MiniGPT-4, wykorzystujÄ cy zaawansowany model jÄzykowy o nazwie Vicuna. Ten model wykorzystuje kodery wizji z pre-trenowanymi komponentami do percepcji wizualnej, wyrÃģwnujÄ c zakodowane cechy wizualne z modelem jÄzykowym Vicuna za pomocÄ jednej warstwy projekcji. Architektura MiniGPT-4 jest prosta, ale skuteczna, z naciskiem na wyrÃģwnywanie cech wizualnych i jÄzykowych w celu poprawy zdolnoÅci konwersacyjnych.

Architektura MiniGPT-4 zawiera kodery wizji z pre-trenowanymi komponentami ViT i Q-Former, jednÄ liniowÄ warstwÄ projekcji oraz zaawansowany model jÄzykowy Vicuna.
Trend autoregresyjnych modeli jÄzykowych w zadaniach wizji-jÄzyka rÃģwnieÅž wzrasta, wykorzystujÄ c transfer miÄdzy modalnoÅciami do udostÄpniania wiedzy miÄdzy domenami jÄzyka i multimodalnymi.
MiniGPT-4 mostkuje domeny wizualne i jÄzykowe, wyrÃģwnujÄ c informacje wizualne z pre-trenowanego kodera wizji z zaawansowanym modelem jÄzykowym. Model wykorzystuje Vicuna jako dekodera jÄzykowego i stosuje dwuetapowy proces szkolenia. PoczÄ tkowo jest szkolony na duÅžym zbiorze par obraz-tekst, aby zrozumieÄ wiedzÄ wizji-jÄzyka, a nastÄpnie dostosowany do mniejszego, wysokiej jakoÅci zbioru danych, aby poprawiÄ niezawodnoÅÄ i uÅžytecznoÅÄ generacji.
Aby poprawiÄ naturalnoÅÄ i uÅžytecznoÅÄ generowanych jÄzykÃģw w MiniGPT-4, badacze opracowali dwuetapowy proces wyrÃģwnywania, rozwiÄ zujÄ c brak odpowiednich zestawÃģw danych wizji-jÄzyka. Stworzyli specjalny zestaw danych do tego celu.
PoczÄ tkowo model generowaÅ szczegÃģÅowe opisy obrazÃģw wejÅciowych, poprawiajÄ c szczegÃģÅowoÅÄ za pomocÄ konwersacyjnego polecenia wyrÃģwnanego z formatem modelu jÄzykowego Vicuna. Ten etap miaÅ na celu generowanie bardziej kompletnych opisÃģw obrazÃģw.
PoczÄ tkowe polecenie opisu obrazu:
###CzÅowiek: <Img><ImageFeature></Img>Opisz ten obraz szczegÃģÅowo. Podaj jak najwiÄcej szczegÃģÅÃģw. Powiedz wszystko, co widzisz. ###Asystent:
Do przetwarzania danych wykorzystano korektÄ nieÅcisÅoÅci lub bÅÄdÃģw w wygenerowanych opisach za pomocÄ ChatGPT, a nastÄpnie rÄcznÄ weryfikacjÄ, aby zapewniÄ wysokÄ jakoÅÄ.
Polecenie dokÅadnego dostosowania:
###CzÅowiek: <Img><ImageFeature></Img><Instruction>###Asystent:
To badanie otwiera okno do zrozumienia mechaniki generatywnej sztucznej inteligencji wielomodalnej, takiej jak GPT-4, rzucajÄ c ÅwiatÅo na to, jak modalnoÅci wizji i jÄzyka mogÄ byÄ skutecznie zintegrowane, aby generowaÄ spÃģjne i bogate kontekstowo dane wyjÅciowe.
Eksploracja wizji GPT-4
OkreÅlanie pochodzenia obrazÃģw z ChatGPT
GPT-4 Vision zwiÄksza moÅžliwoÅci ChatGPT do analizy obrazÃģw i okreÅlania ich pochodzenia geograficznego. Ta funkcja przenosi interakcje uÅžytkownikÃģw z samego tekstu na poÅÄ czenie tekstu i wizji, stajÄ c siÄ przydatnym narzÄdziem dla tych, ktÃģrzy sÄ ciekawi rÃģÅžnych miejsc poprzez dane obrazowe.
ZÅoÅžone pojÄcia matematyczne
GPT-4 Vision wyrÃģÅžnia siÄ w analizowaniu zÅoÅžonych pojÄÄ matematycznych poprzez analizÄ wyraÅžeÅ graficznych lub odrÄcznych. Ta funkcja dziaÅa jako przydatne narzÄdzie dla osÃģb, ktÃģre chcÄ rozwiÄ zaÄ skomplikowane problemy matematyczne, czyniÄ c GPT-4 Vision godnym uwagi wsparciem w dziedzinach edukacyjnych i akademickich.
PrzeksztaÅcanie danych wejÅciowych odrÄcznych w kody LaTeX
JednÄ z godnych uwagi zdolnoÅci GPT-4V jest jego zdolnoÅÄ do tÅumaczenia danych wejÅciowych odrÄcznych na kody LaTeX. Ta funkcja jest bÅogosÅawieÅstwem dla badaczy, akademikÃģw i studentÃģw, ktÃģrzy czÄsto muszÄ przeksztaÅcaÄ wyraÅženia matematyczne lub inne informacje techniczne zapisane odrÄcznie w postaÄ cyfrowÄ . PrzeksztaÅcenie z odrÄcznego w LaTeX rozszerza horyzont cyfryzacji dokumentÃģw i upraszcza proces pisania technicznego.
Wydobywanie szczegÃģÅÃģw tabeli
GPT-4V prezentuje umiejÄtnoÅÄ wydobywania szczegÃģÅÃģw z tabel i odpowiadania na zwiÄ zane z nimi pytania, co jest istotnym atutem w analizie danych. UÅžytkownicy mogÄ wykorzystaÄ GPT-4V do przeszukiwania tabel, gromadzenia kluczowych informacji i rozwiÄ zywania pytaÅ, czyniÄ c go solidnym narzÄdziem dla analitykÃģw danych i innych specjalistÃģw.
Pochopienie wskazywania wizualnego
Unikalna zdolnoÅÄ GPT-4V do pochopenia wskazywania wizualnego dodaje nowy wymiar do interakcji uÅžytkownika. Poprzez zrozumienie wskazaÅ wizualnych, GPT-4V moÅže odpowiadaÄ na pytania z wyÅžszym kontekstowym zrozumieniem.
Budowanie prostych stron internetowych za pomocÄ rysunku
Zainspirowany tym tweetem, prÃģbowaÅem stworzyÄ makietÄ dla strony unite.ai.
ChociaÅž wynik nie caÅkowicie odpowiadaÅ moim poczÄ tkowym wizjom, oto efekt, jaki osiÄ gnÄ Åem.
Ograniczenia i wady GPT-4V(ision)
Aby przeanalizowaÄ GPT-4V, zespÃģÅ Open AI przeprowadziÅ jakoÅciowe i iloÅciowe oceny. OcenÄ jakoÅciowÄ przeprowadzono za pomocÄ wewnÄtrznych testÃģw i zewnÄtrznych recenzji ekspertÃģw, a ocenÄ iloÅciowÄ przeprowadzono, mierzÄ c odmowy modelu i dokÅadnoÅÄ w rÃģÅžnych scenariuszach, takich jak identyfikacja szkodliwych treÅci, rozpoznawanie demograficzne, problemy z prywatnoÅciÄ , geolokalizacja, bezpieczeÅstwo cybernetyczne i multimodalne ataki.
Jednak model ten nie jest doskonaÅy.
ArtykuÅ artykuÅ podkreÅla ograniczenia GPT-4V, takie jak bÅÄdne wnioski i brakujÄ cy tekst lub znaki w obrazach. MoÅže on wymyÅlaÄ lub wymyÅlaÄ fakty. SzczegÃģlnie nie nadaje siÄ do identyfikacji niebezpiecznych substancji w obrazach, czÄsto mylÄ c je.
W obrazach medycznych GPT-4V moÅže dostarczaÄ niekonsekwentne odpowiedzi i brakuje mu ÅwiadomoÅci standardowych praktyk, co moÅže prowadziÄ do potencjalnych bÅÄdnych diagnoz.

Niewiarygodne wyniki dla celÃģw medycznych (ÅđrÃģdÅo)
Ono rÃģwnieÅž nie potrafi zrozumieÄ nuansÃģw pewnych symboli nienawiÅci i moÅže generowaÄ nieodpowiednie treÅci na podstawie wizualnych danych wejÅciowych. OpenAI zaleca, aby nie uÅžywaÄ GPT-4V do krytycznych interpretacji, szczegÃģlnie w kontekstach medycznych lub wraÅžliwych.
Podsumowanie

Utworzone przy uÅžyciu Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl
Przybycie GPT-4 Vision (GPT-4V) wnosi wiele interesujÄ cych moÅžliwoÅci i nowych wyzwaÅ. Przed wprowadzeniem go do uÅžytku, wiele wysiÅku wÅoÅžono w minimalizowanie ryzyka, zwÅaszcza w odniesieniu do zdjÄÄ ludzi. ImpresjonujÄ ce jest to, jak GPT-4V zwiÄkszyÅ swoje moÅžliwoÅci, pokazujÄ c duÅžy potencjaÅ w trudnych dziedzinach, takich jak medycyna i nauka.
Teraz pojawiajÄ siÄ duÅže pytania. Na przykÅad, czy te modele powinny byÄ w stanie identyfikowaÄ znane osoby na zdjÄciach? Czy powinny one zgadywaÄ pÅeÄ, rasÄ lub uczucia osoby na podstawie obrazu? Czy powinny byÄ specjalne dostosowania, aby pomÃģc osobom z niepeÅnosprawnoÅciami wzroku? Te pytania otwierajÄ puszkÄ robaka w kwestiach prywatnoÅci, sprawiedliwoÅci i tego, jak sztuczna inteligencja powinna wpisywaÄ siÄ w nasze Åžycie, co jest czymÅ, w czym kaÅždy powinien mieÄ gÅos.




















