KI-Modelle und Plattformen

Die Evolution von Multimodalem KI: ChatGPT erhält mit GPT-4V die Fähigkeit, Bilder zu erkennen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

In dem Bemühen, KI-Systeme menschlicher zu machen, haben OpenAIs GPT-Modelle kontinuierlich die Grenzen erweitert. GPT-4 kann nun sowohl Text- als auch Bildprompts akzeptieren.

Multimodalität in generativer KI bezeichnet die Fähigkeit eines Modells, verschiedene Ausgaben wie Text, Bilder oder Audio basierend auf der Eingabe zu erzeugen. Diese Modelle, die auf spezifischen Daten trainiert werden, lernen die zugrunde liegenden Muster, um ähnliche neue Daten zu erzeugen und so KI-Anwendungen zu bereichern.

Neue Entwicklungen im Bereich Multimodale KI

Ein bemerkenswerter Fortschritt in diesem Bereich ist die Integration von DALL-E 3 in ChatGPT, eine bedeutende Verbesserung von OpenAIs Text-Bild-Technologie. Diese Kombination ermöglicht eine nahtlosere Interaktion, bei der ChatGPT hilft, präzise Prompts für DALL-E 3 zu erstellen, um Benutzerideen in lebendige, von KI generierte Kunst umzusetzen. Während Benutzer direkt mit DALL-E 3 interagieren können, macht die Einbeziehung von ChatGPT den Prozess der KI-Kunst-Erstellung viel benutzerfreundlicher.

Erfahren Sie mehr über DALL-E 3 und seine Integration mit ChatGPT hier. Diese Zusammenarbeit zeigt nicht nur den Fortschritt in der multimodalen KI, sondern macht auch die Erstellung von KI-Kunst für Benutzer einfach.

Google (GOOGL ) hat auf der anderen Seite im Juni dieses Jahres Med-PaLM M vorgestellt. Es handelt sich um ein multimodales generatives Modell, das in der Lage ist, diverse biomedizinische Daten zu kodieren und zu interpretieren. Dies wurde durch Feinabstimmung von PaLM-E, einem Sprachmodell, für medizinische Domänen unter Verwendung eines Open-Source-Benchmarks, MultiMedBench, erreicht. Dieser Benchmark umfasst über 1 Million Samples aus 7 biomedizinischen Datentypen und 14 Aufgaben wie medizinische Fragebeantwortung und Erstellung von Röntgenberichten.

Unternehmen verschiedener Branchen setzen innovative multimodale KI-Tools ein, um ihr Geschäftswachstum zu fördern, Betriebsabläufe zu optimieren und die Kundenbindung zu erhöhen. Die Fortschritte in Sprach-, Video- und Text-KI-Fähigkeiten treiben das Wachstum der multimodalen KI voran.

Unternehmen suchen nach multimodalen KI-Anwendungen, die in der Lage sind, Geschäftsmodelle und -prozesse zu revolutionieren und Wachstumschancen im gesamten Ökosystem der generativen KI zu eröffnen, von Daten-Tools bis hin zu aufstrebenden KI-Anwendungen.

Nach der Veröffentlichung von GPT-4 im März haben einige Benutzer eine Verschlechterung der Antwortqualität im Laufe der Zeit festgestellt, ein Anliegen, das auch von bekannten Entwicklern und in den Foren von OpenAI geäußert wurde. Zunächst wurde dies von OpenAI abgetan, doch eine spätere Studie bestätigte das Problem. Sie zeigte einen Rückgang der Genauigkeit von GPT-4 von 97,6 % auf 2,4 % zwischen März und Juni, was auf eine Verschlechterung der Antwortqualität bei nachfolgenden Modellaktualisierungen hinweist.

chatgpt-ai

ChatGPT (Blau) & Künstliche Intelligenz (Rot) Google-Suchtrend

Die Aufregung um Open AIs ChatGPT ist zurück. Es verfügt nun über eine Vision-Funktion GPT-4V, die es Benutzern ermöglicht, GPT-4 Bilder zu analysieren. Dies ist das neueste Feature, das für Benutzer freigegeben wurde.

Die Hinzufügung von Bildanalyse zu großen Sprachmodellen (LLM) wie GPT-4 wird von einigen als großer Schritt in der KI-Forschung und -Entwicklung angesehen. Diese Art von multimodalem LLM eröffnet neue Möglichkeiten, indem sie Sprachmodelle über den Text hinaus erweitert, um neue Schnittstellen und Aufgaben zu bieten und so neue Erfahrungen für Benutzer zu schaffen.

Die Ausbildung von GPT-4V wurde 2022 abgeschlossen, und der frühe Zugang wurde im März 2023 bereitgestellt. Die visuelle Funktion in GPT-4V basiert auf GPT-4-Technologie. Der Trainingsprozess blieb derselbe. Zunächst wurde das Modell trainiert, das nächste Wort in einem Text vorherzusagen, indem es eine massive Datenbank aus Texten und Bildern aus verschiedenen Quellen, einschließlich des Internets, nutzte.

Später wurde es mit mehr Daten feinabgestimmt, indem eine Methode namens Verstärkendes Lernen durch menschliches Feedback (RLHF) eingesetzt wurde, um Ausgaben zu erzeugen, die Menschen bevorzugten.

GPT-4 Vision-Mechanik

GPT-4s bemerkenswerte visuelle Sprachfähigkeiten, obwohl beeindruckend, haben zugrunde liegende Methoden, die an der Oberfläche bleiben.

Um diese Hypothese zu erforschen, wurde ein neues visuelles Sprachmodell, MiniGPT-4, vorgestellt, das ein fortschrittliches LLM namens Vicuna nutzt. Dieses Modell verwendet einen visuellen Encoder mit vorgefertigten Komponenten für visuelle Wahrnehmung, die codierten visuellen Merkmale mit dem Vicuna-Sprachmodell durch eine einzelne Projektionsschicht ausrichten. Die Architektur von MiniGPT-4 ist einfach, aber effektiv, mit dem Fokus auf die Ausrichtung visueller und sprachlicher Merkmale, um visuelle Konversationsfähigkeiten zu verbessern.

MiniGPT-4

MiniGPT-4s Architektur umfasst einen visuellen Encoder mit vorgefertigten ViT- und Q-Former-Komponenten, einer einzelnen linearen Projektionsschicht und einem fortschrittlichen Vicuna-Sprachmodell.

Der Trend autoregressiver Sprachmodelle in visuellen Sprachaufgaben hat auch zugenommen, indem er auf cross-modale Übertragung setzt, um Wissen zwischen Sprache und multimodalen Domänen zu teilen.

MiniGPT-4 verbindet visuelle und sprachliche Domänen, indem es visuelle Informationen aus einem vorgefertigten visuellen Encoder mit einem fortschrittlichen LLM ausrichtet. Das Modell nutzt Vicuna als Sprachdecoder und verfolgt einen zweistufigen Trainingsansatz. Zunächst wird es auf einer großen Datenbank von Bild-Text-Paaren trainiert, um visuelle Sprachkenntnisse zu erwerben, gefolgt von einer Feinabstimmung auf einer kleineren, hochwertigen Datenbank, um die Zuverlässigkeit und Benutzerfreundlichkeit der Generierung zu verbessern.

Um die Natürlichkeit und Benutzerfreundlichkeit der generierten Sprache in MiniGPT-4 zu verbessern, entwickelten Forscher einen zweistufigen Ausrichtungsprozess, um den Mangel an angemessenen visuellen Sprachausrichtungsdatensätzen anzugehen. Sie kuratierten einen speziellen Datensatz zu diesem Zweck.

Zunächst generierte das Modell detaillierte Beschreibungen der Eingabebilder, wobei es die Details durch die Verwendung eines konversationellen Prompts, der mit dem Format des Vicuna-Sprachmodells übereinstimmt, verbesserte. Diese Phase zielt darauf ab, umfassendere Bildbeschreibungen zu generieren.

Initialer Bildbeschreibungsprompt:

###Mensch: <Bild><Bildmerkmal></Bild>Beschreiben Sie dieses Bild im Detail. Geben Sie so viele Details wie möglich an. Sagen Sie alles, was Sie sehen. ###Assistent:

Bei der Nachbearbeitung von Daten wurden alle Inkonsistenzen oder Fehler in den generierten Beschreibungen mithilfe von ChatGPT korrigiert, gefolgt von einer manuellen Überprüfung, um eine hohe Qualität sicherzustellen.

Zweistufiger Feinabstimmungsprompt:

###Mensch: <Bild><Bildmerkmal></Bild><Anweisung>###Assistent:

Diese Erforschung gibt Einblicke in die Mechanismen multimodaler generativer KI wie GPT-4, indem sie zeigt, wie visuelle und sprachliche Modalitäten effektiv integriert werden können, um kohärente und kontextuell reiche Ausgaben zu erzeugen.

Erkundung von GPT-4 Vision

Bestimmung der Bildursprünge mit ChatGPT

GPT-4 Vision verbessert ChatGPTs Fähigkeit, Bilder zu analysieren und ihre geografischen Ursprünge zu bestimmen. Diese Funktion ermöglicht es Benutzern, von reinen Textinteraktionen zu einer Kombination aus Text und Bildern überzugehen, und wird zu einem nützlichen Werkzeug für diejenigen, die sich für verschiedene Orte durch Bildinformationen interessieren.

Chatgpt-vision-GPT-4

ChatGPT fragen, wo ein Landmarkenbild aufgenommen wurde

Komplexe mathematische Konzepte

GPT-4 Vision exceliert darin, komplexe mathematische Ideen durch die Analyse von grafischen oder handschriftlichen Ausdrücken zu erforschen. Diese Funktion dient als nützliches Werkzeug für Personen, die komplexe mathematische Probleme lösen möchten, und markiert GPT-4 Vision als bemerkenswerte Hilfe im Bildungsbereich.

Chatgpt-vision-GPT-4

ChatGPT fragen, ein komplexes mathematisches Konzept zu verstehen

Umwandlung von handschriftlichen Eingaben in LaTeX-Codes

Eine der bemerkenswerten Fähigkeiten von GPT-4V ist die Fähigkeit, handschriftliche Eingaben in LaTeX-Codes umzuwandeln. Diese Funktion ist ein Segen für Forscher, Akademiker und Studenten, die oft handschriftliche mathematische Ausdrücke oder andere technische Informationen in ein digitales Format umwandeln müssen. Die Umwandlung von handschriftlichen zu LaTeX-Codes erweitert den Horizont der Dokumentendigitalisierung und vereinfacht den technischen Schreibprozess.

GPT-4Vs Fähigkeit, LaTeX-Codes aus handschriftlichen Eingaben zu generieren

GPT-4Vs Fähigkeit, LaTeX-Codes aus handschriftlichen Eingaben zu generieren

Extraktion von Tabellendetails

GPT-4V zeigt Fähigkeiten bei der Extraktion von Details aus Tabellen und der Beantwortung damit verbundener Fragen, ein wichtiger Vermögenswert bei der Datenanalyse. Benutzer können GPT-4V nutzen, um durch Tabellen zu suchen, wichtige Erkenntnisse zu sammeln und Fragen zu beantworten, was es zu einem robusten Werkzeug für Datenanalysten und andere Fachleute macht.

GPT-4V versteht Tabellendetails und beantwortet damit verbundene Fragen

GPT-4V versteht Tabellendetails und beantwortet damit verbundene Fragen

Verständnis von visuellem Zeigen

Die einzigartige Fähigkeit von GPT-4V, visuelles Zeigen zu verstehen, fügt der Benutzerinteraktion eine neue Dimension hinzu. Durch das Verständnis visueller Hinweise kann GPT-4V auf Anfragen mit einem höheren kontextuellen Verständnis reagieren.

GPT-4V-demonstrates-the-unique-capability-of-understanding-visual-pointing

GPT-4V zeigt die einzigartige Fähigkeit, visuelles Zeigen zu verstehen

Erstellung einfacher Mock-Up-Websites mithilfe einer Zeichnung

Angeregt durch diesen Tweet, habe ich versucht, ein Mock-Up für die unite.ai-Website zu erstellen.

Obwohl das Ergebnis nicht ganz meinem ursprünglichen Konzept entsprach, hier ist das Ergebnis, das ich erreicht habe.

ChatGPT-Vision-basiertes HTML-Frontend

ChatGPT-Vision-basiertes HTML-Frontend

Begrenzungen und Schwächen von GPT-4V

Um GPT-4V zu analysieren, führte das Open-AI-Team qualitative und quantitative Bewertungen durch. Qualitative Bewertungen umfassten interne Tests und externe Expertenbewertungen, während quantitative Bewertungen Modellverweigerungen und Genauigkeit in verschiedenen Szenarien wie der Identifizierung schädlicher Inhalte, demografischer Erkennung, Datenschutzbedenken, Geolocation, Cybersicherheit und multimodalen Jailbreaks maßen.

Trotzdem ist das Modell nicht perfekt.

Das Papier hebt die Begrenzungen von GPT-4V hervor, wie z.B. falsche Rückschlüsse und fehlende Texte oder Zeichen in Bildern. Es kann halluzinieren oder Fakten erfinden. Insbesondere ist es nicht geeignet für die Identifizierung gefährlicher Substanzen in Bildern, da es diese oft falsch identifiziert.

Bei medizinischen Bildern kann GPT-4V inkonsistente Antworten liefern und mangelt es an Kenntnissen über Standardpraktiken, was zu möglichen Fehldiagnosen führen kann.

Unzuverlässige Leistung für medizinische Zwecke.

Unzuverlässige Leistung für medizinische Zwecke (Quelle)

Es versteht auch nicht die Nuancen bestimmter Hasssymbole und kann unangemessene Inhalte auf der Grundlage visueller Eingaben generieren. OpenAI rät davon ab, GPT-4V für kritische Interpretationen, insbesondere in medizinischen oder sensiblen Kontexten, zu verwenden.

Zusammenfassung

Erstellt mit Fast Stable Diffusion XL

Erstellt mit Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl

Die Ankunft von GPT-4 Vision (GPT-4V) bringt eine Reihe von coolen Möglichkeiten und neuen Herausforderungen mit sich. Bevor es veröffentlicht wurde, wurde viel Mühe darauf verwendet, Risiken, insbesondere im Zusammenhang mit Bildern von Personen, zu minimieren. Es ist beeindruckend, wie GPT-4V Fortschritte in anspruchsvollen Bereichen wie Medizin und Wissenschaft gemacht hat.

Jetzt gibt es einige große Fragen auf dem Tisch. Zum Beispiel, sollten diese Modelle in der Lage sein, berühmte Personen von Fotos zu identifizieren? Sollten sie das Geschlecht, die Rasse oder die Gefühle einer Person aus einem Bild erraten? Und sollten es spezielle Anpassungen geben, um sehbehinderten Personen zu helfen? Diese Fragen werfen ein Problem hinsichtlich Datenschutz, Fairness und der Rolle von KI in unserem Leben auf, bei dem jeder eine Meinung haben sollte.

Ich habe die letzten fünf Jahre damit verbracht, mich in die faszinierende Welt des Machine Learning und Deep Learning zu vertiefen. Mein Engagement und meine Expertise haben mich dazu geführt, an über 50 verschiedenen Software-Entwicklungsprojekten mit einem besonderen Fokus auf AI/ML beizutragen. Meine anhaltende Neugier hat mich auch zum Bereich der Natural Language Processing hingezogen, einem Feld, das ich weiter erforschen möchte.