AI-modeller och plattformar

Multimodal AI utvecklas när ChatGPT får syn med GPT-4V(ision)

mm
Lägg till Unite.AI bland dina föredragna källor på Google

I den pågående ansträngningen att göra AI mer lik människor har OpenAI:s GPT-modeller kontinuerligt pressat gränserna. GPT-4 kan nu acceptera prompt av både text och bilder.

Multimodalitet i generativ AI betecknar en modells förmåga att producera varierade utdata som text, bilder eller ljud baserat på indata. Dessa modeller, som tränats på specifik data, lär sig underliggande mönster för att generera liknande ny data, vilket berikar AI-applikationer.

Senaste stegen i multimodal AI

Ett nyligt noterbart språng i detta område ses med integrationen av DALL-E 3 i ChatGPT, en betydande uppgradering av OpenAI:s text-till-bild-teknologi. Denna kombination möjliggör en smidigare interaktion där ChatGPT hjälper till att skapa precisa prompt för DALL-E 3, vilket omvandlar användaridéer till levande AI-genererad konst. Så, medan användare kan interagera direkt med DALL-E 3, gör ChatGPT-processen att skapa AI-konst mycket mer användarvänlig.

Läs mer om DALL-E 3 och dess integration med ChatGPT här. Detta samarbete visar inte bara framstegen inom multimodal AI utan gör också AI-konstskapande till en enkel uppgift för användare.

Google’s hälsa har på andra sidan introducerat Med-PaLM M i juni i år. Det är en multimodal generativ modell som är skicklig på att koda och tolka olika biomedicinska data. Detta uppnåddes genom att finjustera PaLM-E, ett språkmodell, för att tillgodose medicinska domäner med hjälp av en öppen källkodsbenchmark, MultiMedBench. Denna benchmark består av över 1 miljon prover över 7 biomedicinska datatyper och 14 uppgifter som medicinsk frågesvar och generering av radiologirapporter.

Olka branscher antar innovativa multimodala AI-verktyg för att driva företagsutveckling, strömlinjeforma operationer och höja kundengagemang. Framsteg inom röst-, video- och text-AI-förmågor driver multimodal AI:s tillväxt.

Företag söker multimodala AI-applikationer som kan omvandla affärsmodeller och processer, öppna tillväxtvägar över hela den generativa AI-ekosystemet, från dataverktyg till nya AI-applikationer.

Efter GPT-4:s lansering i mars observerade vissa användare en nedgång i dess svars kvalitet över tid, en oro som också uttryckts av framstående utvecklare och på OpenAI:s forum. Initialt avfärdades detta av OpenAI, men en senare studie bekräftade problemet. Den visade en minskning av GPT-4:s noggrannhet från 97,6% till 2,4% mellan mars och juni, vilket indikerar en nedgång i svarskvalitet med efterföljande modelluppdateringar.

chatgpt-ai

ChatGPT (Blå) & Artificiell intelligens (Röd) Google Sök Trend

Hypeen kring Open AI:s ChatGPT är tillbaka nu. Den kommer med en visionfunktion GPT-4V, som tillåter användare att låta GPT-4 analysera bilder som de tillhandahåller. Detta är den senaste funktionen som har öppnats upp för användare.

Att lägga till bildanalys till stora språkmodeller (LLM) som GPT-4 ses av vissa som ett stort steg framåt i AI-forskning och utveckling. Denna typ av multimodal LLM öppnar upp nya möjligheter, tar språkmodeller bortom text för att erbjuda nya gränssnitt och lösa nya typer av uppgifter, skapar färska upplevelser för användare.

Träningen av GPT-4V slutfördes 2022, med tidig åtkomst som rullades ut i mars 2023. Den visuella funktionen i GPT-4V drivs av GPT-4-teknik. Träningsprocessen förblev densamma. Initialt tränades modellen för att förutsäga nästa ord i en text med hjälp av en enorm dataset av både text och bilder från olika källor, inklusive internet.

Sedan fine-tunades den med mer data, med hjälp av en metod som kallas förstärkt inlärning från mänsklig feedback (RLHF), för att generera utdata som människor föredrog.

GPT-4 Vision Mechanics

GPT-4:s remarkabla visionsspråksförmågor, även om de är imponerande, har underliggande metoder som förblir på ytan.

För att utforska denna hypotes introducerades en ny visionsspråksmodell, MiniGPT-4 , som använder en avancerad LLM som heter Vicuna. Denna modell använder en visionencoder med förtränade komponenter för visuell perception, som justerar kodade visuella funktioner med Vicuna-språkmodellen genom en enda projiceringsskikt. Arkitekturen för MiniGPT-4 är enkel men effektiv, med fokus på att justera visuella och språkliga funktioner för att förbättra visuell konversationsförmåga.

MiniGPT-4

MiniGPT-4:s arkitektur innehåller en visionencoder med förtränad ViT och Q-Former, en enda linjär projiceringsskikt och en avancerad Vicuna-stor språkmodell.

Trenden med autoregressiva språkmodeller i visionsspråksuppgifter har också vuxit, och kapitaliserar på cross-modalt överföring för att dela kunskap mellan språk och multimodala domäner.

MiniGPT-4 brottar visuella och språkliga domäner genom att justera visuell information från en förtränad visionencoder med en avancerad LLM. Modellen använder Vicuna som språkdecodare och följer en tvåstegsträningsansats. Initialt tränas den på en stor dataset av bild-textpar för att förstå visionsspråkskunskap, följt av finjustering på en mindre, högkvalitativ dataset för att förbättra generations tillförlitlighet och användbarhet.

För att förbättra den naturliga och användbara genererade språket i MiniGPT-4 utvecklade forskare en tvåstegsjusteringsprocess, som hanterar bristen på adekvat visionsspråksjustering dataset. De kuraterade ett specialiserat dataset för detta ändamål.

Initialt genererade modellen detaljerade beskrivningar av ingångsbilder, förbättrade detaljerna genom att använda en konversationsprompt som justerades med Vicuna-språkmodellens format. Detta skede syftade till att generera mer omfattande bildbeskrivningar.

Initial Bildbeskrivningsprompt:

###Människa: <Bild><Bildfunktion></Bild>Beskriv denna bild i detalj. Ge så många detaljer som möjligt. Säg allt du ser. ###Assistent:

För datapostbearbetning korrigerades eventuella inkonsekvenser eller fel i de genererade beskrivningarna med hjälp av ChatGPT, följt av manuell verifiering för att säkerställa hög kvalitet.

Andra etappen finjusteringsprompt:

###Människa: <Bild><Bildfunktion></Bild><Instruktion>###Assistent:

Denna utforskning öppnar ett fönster för att förstå mekanismerna i multimodal generativ AI som GPT-4, och belyser hur vision och språkliga modaliteter kan integreras effektivt för att generera sammanhängande och kontextuellt rika utdata.

Utforska GPT-4 Vision

Bestämma bildursprung med ChatGPT

GPT-4 Vision förbättrar ChatGPT:s förmåga att analysera bilder och fastställa deras geografiska ursprung. Denna funktion övergår användarinteraktioner från enbart text till en blandning av text och visuella element, och blir ett användbart verktyg för dem som är nyfikna på olika platser genom bilddata.

Chatgpt-vision-GPT-4

Fråga ChatGPT var en landmärkesbild är tagen

Komplexa matematiska begrepp

GPT-4 Vision excellerar i att dyka in i komplexa matematiska idéer genom att analysera grafiska eller handskrivna uttryck. Denna funktion fungerar som ett användbart verktyg för personer som vill lösa intrikata matematiska problem, vilket gör GPT-4 Vision till en betydande hjälp i utbildnings- och akademiska områden.

Chatgpt-vision-GPT-4

Fråga ChatGPT att förstå ett komplext matematiskt begrepp

Omvandla handskriven inmatning till LaTeX-koder

En av GPT-4V:s remarkabla förmågor är dess förmåga att översätta handskrivna inmatningar till LaTeX-koder. Denna funktion är en välsignelse för forskare, akademiker och studenter som ofta behöver omvandla handskrivna matematiska uttryck eller annan teknisk information till ett digitalt format. Omvandlingen från handskriven till LaTeX utvidgar horisonten för dokumentdigitalisering och förenklar den tekniska skrivprocessen.

GPT-4V:s förmåga att generera LaTeX-koder baserat på handskriven inmatning

GPT-4V:s förmåga att omvandla handskriven inmatning till LaTeX-koder

Extrahera tabellinformation

GPT-4V visar skicklighet i att extrahera information från tabeller och besvara relaterade frågor, en viktig tillgång i dataanalys. Användare kan använda GPT-4V för att gå igenom tabeller, samla in viktiga insikter och lösa frågor, vilket gör det till ett kraftfullt verktyg för dataanalytiker och andra yrkesverksamma.

GPT-4V förstår informationen i tabellen och svarar på relaterade frågor

GPT-4V förstår informationen i tabellen och svarar på relaterade frågor

Förstå visuell peking

GPT-4V:s unika förmåga att förstå visuell peking lägger till en ny dimension till användarinteraktion. Genom att förstå visuella signaler kan GPT-4V svara på frågor med en högre kontextuell förståelse.

GPT-4V visar den unika förmågan att förstå visuell peking

GPT-4V visar den unika förmågan att förstå visuell peking

Bygga enkla mockup-webbplatser med en ritning

Motiverad av denna tweet, försökte jag skapa en mockup för unite.ai-webbplatsen.

Medan resultatet inte riktigt matchade min ursprungliga vision, här är vad jag lyckades uppnå.

ChatGPT Vision-baserad HTML-framänd

ChatGPT Vision-baserad HTML-framänd

Begränsningar och brister i GPT-4V(ision)

För att analysera GPT-4V genomförde Open AI-teamet kvalitativa och kvantitativa bedömningar. Kvalitativa bedömningar inkluderade interna tester och externa expertgranskningar, medan kvantitativa bedömningar mätte modellvägran och noggrannhet i olika scenarier, såsom identifiering av skadligt innehåll, demografisk igenkänning, integritetsproblem, geolokalisering, cybersäkerhet och multimodala fängelseupplopp.

Ändå är modellen inte perfekt.

Den artikeln betonar begränsningarna i GPT-4V, som felaktiga inferenser och saknad text eller tecken i bilder. Den kan hallucinera eller uppfinna fakta. Särskilt är den inte lämplig för att identifiera farliga ämnen i bilder, ofta misstolkar dem.

I medicinsk avbildning kan GPT-4V ge inkonsekventa svar och saknar kännedom om standardpraxis, vilket kan leda till potentiella feldiagnoser.

Opålitlig prestanda för medicinska ändamål.

Opålitlig prestanda för medicinska ändamål (Källa)

Den misslyckas också med att förstå nyanserna i vissa hat-symbols och kan generera olämpligt innehåll baserat på visuella indata. OpenAI råder mot att använda GPT-4V för kritiska tolkningar, särskilt i medicinska eller känsliga sammanhang.

Sammanfattning

Skapad med Fast Stable Diffusion XL

Skapad med Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl

Ankomsten av GPT-4 Vision (GPT-4V) medför en mängd coola möjligheter och nya hinder att övervinna. Innan det lanserades lades stor ansträngning på att säkerställa att risker, särskilt när det gäller bilder av människor, undersöktes och minskades. Det är imponerande att se hur GPT-4V har tagit sig an utmaningar och visar stort löfte i svåra områden som medicin och vetenskap.

Nu finns det stora frågor på bordet. Till exempel, bör dessa modeller kunna identifiera kända personer från foton? Bör de gissa en persons kön, ras eller känslor från en bild? Och, bör det finnas särskilda justeringar för att hjälpa personer med synskador? Dessa frågor öppnar en bur av maskar om integritet, rättvisa och hur AI bör passa in i våra liv, vilket är något som alla bör ha ett ord med i.

Jag har tillbringat de senaste fem åren med att dyka djupt in i den fascinerande världen av Maskinlärning och Djupinlärning. Min passion och expertis har lett mig till att bidra till över 50 olika mjukvaruprojekt, med särskild fokus på AI/ML. Min pågående nyfikenhet har också lett mig mot Naturlig Språkbehandling, ett område som jag är angelägen om att utforska vidare.