AI-modellen en platforms

De evolutie van multimodale AI: ChatGPT krijgt zicht met GPT-4V(ision)

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

In de voortdurende inspanning om AI meer op mensen te laten lijken, hebben de GPT-modellen van OpenAI de grenzen voortdurend verlegd. GPT-4 kan nu prompts accepteren van zowel tekst als afbeeldingen.

Multimodaliteit in generatieve AI verwijst naar de mogelijkheid van een model om verschillende uitvoer te produceren, zoals tekst, afbeeldingen of audio, op basis van de invoer. Deze modellen, getraind op specifieke gegevens, leren onderliggende patronen om soortgelijke nieuwe gegevens te genereren, waardoor AI-toepassingen worden verrijkt.

Recente ontwikkelingen in multimodale AI

Een recente opvallende sprong in dit veld is te zien met de integratie van DALL-E 3 in ChatGPT, een significante upgrade in OpenAI’s tekst-naar-afbeeldingstechnologie. Deze combinatie maakt een soepelere interactie mogelijk waarbij ChatGPT helpt bij het maken van precieze prompts voor DALL-E 3, waardoor gebruikersideeën worden omgezet in levendige AI-gegenereerde kunst. Terwijl gebruikers rechtstreeks kunnen communiceren met DALL-E 3, maakt het hebben van ChatGPT in de mix het proces van het maken van AI-kunst veel gebruikersvriendelijker.

Bekijk meer over DALL-E 3 en de integratie met ChatGPT hier. Deze samenwerking toont niet alleen de vooruitgang in multimodale AI, maar maakt ook het maken van AI-kunst een fluitje van een cent voor gebruikers.

Google’s health heeft ondertussen Med-PaLM M geïntroduceerd in juni van dit jaar. Het is een multimodaal generatief model dat is ingesteld op het coderen en interpreteren van diverse biomedische gegevens. Dit is bereikt door het fijntunen van PaLM-E, een taalmodel, om te voldoen aan medische domeinen met behulp van een open-source benchmark, MultiMedBench. Deze benchmark bestaat uit meer dan 1 miljoen samples uit 7 biomedische gegevenstypen en 14 taken, zoals medische vraagbeantwoording en radiologierapportgeneratie.

Verschillende industrieën nemen innovatieve multimodale AI-hulpmiddelen aan om bedrijfsgroei te stimuleren, operaties te stroomlijnen en klantbetrokkenheid te verhogen. Vooruitgang in spraak-, video- en tekst-AI-mogelijkheden zet de groei van multimodale AI aan.

Bedrijven zoeken naar multimodale AI-toepassingen die in staat zijn om bedrijfsmodellen en -processen te transformeren, waardoor groeimogelijkheden ontstaan in het hele generatieve AI-ecosysteem, van gegevenstools tot opkomende AI-toepassingen.

Na de lancering van GPT-4 in maart, hebben sommige gebruikers een afname van de kwaliteit van de antwoorden van het model over tijd gezien, een zorg die wordt gedeeld door opvallende ontwikkelaars en op de forums van OpenAI. Aanvankelijk werd dit door OpenAI afgewezen, maar een latere studie bevestigde het probleem. Het onthulde een daling in de nauwkeurigheid van GPT-4 van 97,6% naar 2,4% tussen maart en juni, wat wijst op een afname in antwoordkwaliteit met latere modelupdates.

chatgpt-ai

ChatGPT (Blauw) & Artificial intelligence (Rood) Google Search Trend

De hype rond Open AI’s ChatGPT is terug. Het komt nu met een visiefunctie GPT-4V, waardoor gebruikers GPT-4 kunnen laten analyseren van afbeeldingen die zij hen geven. Dit is de nieuwste functie die voor gebruikers is geopend.

Het toevoegen van afbeeldingsanalyse aan grote taalmodellen (LLM’s) zoals GPT-4 wordt door sommigen gezien als een grote stap voorwaarts in AI-onderzoek en -ontwikkeling. Dit type multimodaal LLM opent nieuwe mogelijkheden, waardoor taalmodellen verder gaan dan tekst om nieuwe interfaces te bieden en nieuwe soorten taken op te lossen, waardoor nieuwe ervaringen voor gebruikers ontstaan.

De training van GPT-4V werd voltooid in 2022, met vroeg toegang in maart 2023. De visuele functie in GPT-4V wordt aangedreven door GPT-4-tech. Het trainingsproces bleef hetzelfde. Aanvankelijk werd het model getraind om het volgende woord in een tekst te voorspellen met een enorme dataset van zowel tekst als afbeeldingen van verschillende bronnen, waaronder het internet.

Later werd het fijngesteld met meer gegevens, waarbij een methode genaamd versterking van het leren vanuit menselijke feedback (RLHF) werd gebruikt, om uitvoer te genereren die door mensen werd bevoroordeeld.

GPT-4 Visiemechanica

GPT-4’s opvallende visuele taalvaardigheden, hoewel indrukwekkend, hebben onderliggende methoden die aan de oppervlakte blijven.

Om deze hypothese te onderzoeken, werd een nieuw visueel-taalmodel MiniGPT-4 geïntroduceerd, dat gebruik maakt van een geavanceerd LLM genaamd Vicuna. Dit model gebruikt een visuele encoder met vooraf getrainde componenten voor visuele perceptie, die de gecodeerde visuele kenmerken uitlijnt met het Vicuna-taalmodel via een enkele projectielaag. De architectuur van MiniGPT-4 is eenvoudig maar effectief, met de focus op het uitlijnen van visuele en taalkenmerken om visuele conversatievaardigheden te verbeteren.

MiniGPT-4

MiniGPT-4’s architectuur omvat een visuele encoder met vooraf getrainde ViT en Q-Former, een enkele lineaire projectielaag en een geavanceerd Vicuna-groot taalmodel.

De trend van autoregressieve taalmodellen in visuele-taaltaken is ook toegenomen, waarbij gebruik wordt gemaakt van cross-modale overdracht om kennis te delen tussen taal- en multimodale domeinen.

MiniGPT-4 verbindt de visuele en taaldomeinen door visuele informatie van een vooraf getrainde visuele encoder uit te lijnen met een geavanceerd LLM. Het model gebruikt Vicuna als taaldecoder en volgt een tweestaps trainingsaanpak. Aanvankelijk wordt het getraind op een grote dataset van afbeelding-tekstparen om visuele-taalkennis te begrijpen, gevolgd door fijntuning op een kleinere, hoogwaardige dataset om generatiebetrouwbaarheid en bruikbaarheid te verbeteren.

Om de natuurlijkheid en bruikbaarheid van gegenereerde taal in MiniGPT-4 te verbeteren, ontwikkelden onderzoekers een tweestapsuitlijningsproces, waarbij het gebrek aan adequate visuele-taalkennis werd aangepakt. Zij curateerden een gespecialiseerde dataset voor dit doel.

Aanvankelijk genereerde het model gedetailleerde beschrijvingen van invoerafbeeldingen, waarbij het detail werd verbeterd door het gebruik van een conversatieprompt die was uitgelijnd met Vicuna’s taalmodelformaat. Deze stap was gericht op het genereren van meer uitgebreide afbeeldingsbeschrijvingen.

Initial Image Description Prompt:

###Human: <Img><ImageFeature></Img>Beschrijf deze afbeelding in detail. Geef zoveel mogelijk details. Zeg alles wat je ziet. ###Assistant:

Voor gegevensnabewerking werden eventuele inconsistenties of fouten in de gegenereerde beschrijvingen gecorrigeerd met behulp van ChatGPT, gevolgd door handmatige verificatie om een hoge kwaliteit te garanderen.

Second-Stage Fine-tuning Prompt:

###Human: <Img><ImageFeature></Img><Instruction>###Assistant:

Deze verkenning opent een venster naar het begrijpen van de mechanismen van multimodale generatieve AI zoals GPT-4, waarbij wordt getoond hoe visuele en taalmodi effectief kunnen worden geïntegreerd om coherente en contextueel rijke uitvoer te genereren.

Verkennen van GPT-4 Visie

Bepalen van afbeeldingsbronnen met ChatGPT

GPT-4 Visie verhoogt ChatGPT’s vermogen om afbeeldingen te analyseren en hun geografische oorsprong te bepalen. Deze functie verandert gebruikersinteracties van alleen tekst naar een combinatie van tekst en visuele elementen, waardoor het een handig hulpmiddel wordt voor mensen die nieuwsgierig zijn naar verschillende plaatsen via afbeeldingsgegevens.

Chatgpt-vision-GPT-4

Vragen stellen aan ChatGPT over de locatie van een afbeelding van een landmark

Complexe wiskundige concepten

GPT-4 Visie blinkt uit in het doorgronden van complexe wiskundige ideeën door grafische of handgeschreven uitdrukkingen te analyseren. Deze functie fungeert als een nuttig hulpmiddel voor mensen die complexe wiskundige problemen willen oplossen, waardoor GPT-4 Visie een opvallende bijdrage levert in het onderwijs en academische velden.

Chatgpt-vision-GPT-4

Vragen stellen aan ChatGPT over een complex wiskundig concept

Omzetten van handgeschreven invoer naar LaTeX-codes

Een van de opvallende mogelijkheden van GPT-4V is de mogelijkheid om handgeschreven invoer om te zetten in LaTeX-codes. Deze functie is een zegen voor onderzoekers, academici en studenten die vaak handgeschreven wiskundige uitdrukkingen of andere technische informatie moeten omzetten in een digitale vorm. De transformatie van handgeschreven naar LaTeX breidt de horizon van documentdigitalisering uit en vereenvoudigt het technische schrijfproces.

GPT-4V's mogelijkheid om handgeschreven invoer om te zetten in LaTeX-codes

GPT-4V’s mogelijkheid om handgeschreven invoer om te zetten in LaTeX-codes

Extractie van tabelgegevens

GPT-4V toont vaardigheid in het extraheren van gegevens uit tabellen en het beantwoorden van gerelateerde vragen, een essentieel hulpmiddel in gegevensanalyse. Gebruikers kunnen GPT-4V gebruiken om door tabellen te bladeren, belangrijke inzichten te verzamelen en vragen op te lossen, waardoor het een robuust hulpmiddel wordt voor gegevensanalisten en andere professionals.

GPT-4V begrijpt de details in de tabel en beantwoordt gerelateerde vragen

GPT-4V begrijpt de details in de tabel en beantwoordt gerelateerde vragen

Visueel aanwijzen begrijpen

De unieke mogelijkheid van GPT-4V om visueel aanwijzen te begrijpen voegt een nieuwe dimensie toe aan gebruikersinteractie. Door visuele hints te begrijpen, kan GPT-4V antwoorden geven met een hogere contextuele begrip.

GPT-4V toont de unieke mogelijkheid om visueel aanwijzen te begrijpen

GPT-4V toont de unieke mogelijkheid om visueel aanwijzen te begrijpen

Opbouwen van eenvoudige mock-up-websites met een tekening

Gestimuleerd door deze tweet, heb ik geprobeerd een mock-up te maken voor de unite.ai-website.

Hoewel het resultaat niet helemaal overeenkwam met mijn oorspronkelijke visie, hier is het resultaat dat ik bereikte.

ChatGPT Visie-gebaseerde HTML-frontend

ChatGPT Visie-gebaseerde HTML-frontend

Beperkingen en fouten van GPT-4V(ision)

Om GPT-4V te analyseren, voerde het Open AI-team kwalitatieve en kwantitatieve evaluaties uit. Kwalitatieve evaluaties omvatten interne tests en externe expertbeoordelingen, terwijl kwantitatieve evaluaties modelweigeringen en nauwkeurigheid in verschillende scenario’s maten, zoals het identificeren van schadelijke inhoud, demografische herkenning, privacyproblemen, geolocatie, cybersecurity en multimodale jailbreaks.

Toch is het model niet perfect.

Het document benadrukt de beperkingen van GPT-4V, zoals onjuiste inferenties en ontbrekende tekst of tekens in afbeeldingen. Het kan hallucineren of feiten verzinnen. In het bijzonder is het niet geschikt voor het identificeren van gevaarlijke stoffen in afbeeldingen, die het vaak verkeerd identificeert.

In medische beeldvorming kan GPT-4V inconsistentie antwoorden geven en ontbreekt het aan kennis van standaardpraktijken, wat kan leiden tot potentiële misdiagnoses.

Onbetrouwbaar voor medische doeleinden.

Onbetrouwbaar voor medische doeleinden (Bron)

Het faalt ook om de nuances van bepaalde haattekens te begrijpen en kan ongepaste inhoud genereren op basis van visuele invoer. OpenAI raadt af om GPT-4V te gebruiken voor kritische interpretaties, vooral in medische of gevoelige contexten.

Samenvatting

Gemaakt met Fast Stable Diffusion XL

Gemaakt met Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl

De komst van GPT-4 Visie (GPT-4V) brengt een reeks interessante mogelijkheden en nieuwe uitdagingen met zich mee. Voordat het werd uitgerold, is veel moeite gestoken in het waarborgen dat risico’s, vooral met betrekking tot afbeeldingen van personen, grondig zijn onderzocht en verminderd. Het is indrukwekkend om te zien hoe GPT-4V een stap voorwaarts heeft gezet, met veelbelovende resultaten in moeilijke gebieden zoals geneeskunde en wetenschap.

Er zijn nu enkele grote vragen op tafel. Bijvoorbeeld, zouden deze modellen in staat moeten zijn om beroemde personen te identificeren op basis van afbeeldingen? Zouden ze de geslacht, ras of gevoelens van een persoon moeten raden op basis van een afbeelding? En zouden er speciale aanpassingen moeten worden gemaakt om visueel gehandicapten te helpen? Deze vragen openen een doos van wormen over privacy, eerlijkheid en hoe AI in ons leven past, waar iedereen een mening over zou moeten hebben.

Ik heb de afgelopen vijf jaar doorgebracht met het onderdompelen van mezelf in de fascinerende wereld van Machine Learning en Deep Learning. Mijn passie en expertise hebben me geleid om bij te dragen aan meer dan 50 diverse software-engineeringprojecten, met een bijzondere focus op AI/ML. Mijn voortdurende nieuwsgierigheid heeft me ook aangetrokken tot Natural Language Processing, een vakgebied dat ik graag verder wil verkennen.