Andersons Blickwinkel

Visuelle Analogien in KI bringen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen
AI-generated image: comparative cross-sections of a peach and the planet Earth. GPT-image-1, Firefly 3.

Aktuelle KI-Modelle erkennen keine ‘relationalen’ BildÃĪhnlichkeiten, wie z.B. die Ähnlichkeit zwischen den Schichten der Erde und einem Pfirsich, und vermissen damit einen wichtigen Aspekt der menschlichen Wahrnehmung von Bildern.

 

Obwohl es viele Computer-Vision-Modelle gibt, die in der Lage sind, Bilder zu vergleichen und Ähnlichkeiten zwischen ihnen zu finden, haben die aktuellen Vergleichssysteme der neuen Generation nur wenig oder keine imaginative FÃĪhigkeit. Betrachten Sie einige der Textzeilen des klassischen Liedes der 1960er Jahre, Windmills of Your Mind:

Wie ein Karussell, das sich dreht, Ringe um den Mond laufend
Wie eine Uhr, deren Zeiger Þber das Gesicht huschen
Und die Welt ist wie ein Apfel, der still im Weltraum schwebt

Vergleiche dieser Art reprÃĪsentieren ein Gebiet poetischer Anspielung, das fÞr Menschen in einer Weise bedeutsam ist, die weit Þber die kÞnstlerische Ausdrucksform hinausgeht; vielmehr ist es eng mit unserer Wahrnehmung verbunden; wÃĪhrend wir unser “Objekt”-Gebiet entwickeln, entwickeln wir eine FÃĪhigkeit zur visuellen Ähnlichkeit, so dass wir z.B. Querschnitte, die einen Pfirsich und die Erde darstellen, oder fraktale Rekursionen wie Kaffeespiralen und Galaxienzweige als analog wahrnehmen.

Auf diese Weise kÃķnnen wir Verbindungen zwischen scheinbar unverbundenen Objekten und Objekttypen herstellen und Systeme (wie Schwerkraft, Impuls und OberflÃĪchenhaftung) ableiten, die auf verschiedene Bereiche in verschiedenen GrÃķßenordnungen anwendbar sind.

Das Sehen

Even die neueste Generation von Bildvergleichs-KI-Systemen, wie z.B. Learned Perceptual Image Patch Similarity (LPIPS) und DINO, die durch menschliche RÞckmeldungen informiert werden, fÞhren nur literale OberflÃĪchenvergleiche durch.

Ihre FÃĪhigkeit, Gesichter zu finden, wo keine existieren – d.h. Pareidolie – stellt nicht die Art von visueller Ähnlichkeitsmechanismus dar, den Menschen entwickeln, sondern tritt auf, weil Gesichtssuch-Algorithmen niedrigstufige Gesichtsstruktur-Merkmale verwenden, die manchmal mit zufÃĪlligen Objekten Þbereinstimmen:

Beispiele fÞr Falschpositiv-Ergebnisse bei der Gesichtserkennung im 'Faces with Things'-Datensatz. Quelle - https://arxiv.org/pdf/2409.16143

Beispiele fÞr Falschpositiv-Ergebnisse bei der Gesichtserkennung im ‘Faces with Things’-Datensatz. Quelle

Um zu bestimmen, ob Maschinen wirklich unsere imaginative FÃĪhigkeit entwickeln kÃķnnen, visuelle Ähnlichkeit Þber Bereiche hinweg zu erkennen, haben Forscher in den USA eine Studie zu relationaler visueller Ähnlichkeit durchgefÞhrt und ein neues Datenset erstellt, das darauf abzielt, abstrakte Beziehungen zwischen verschiedenen Objekten zu bilden, die dennoch durch eine abstrakte Beziehung verbunden sind:

Die meisten KI-Modelle erkennen Ähnlichkeit nur, wenn Bilder OberflÃĪchenmerkmale wie Form oder Farbe teilen, weshalb sie nur Gruppe B (oben) mit dem Referenzbild verbinden. Menschen hingegen sehen auch Gruppe A als ÃĪhnlich – nicht, weil die Bilder ÃĪhnlich aussehen, sondern weil sie der gleichen zugrunde liegenden Logik folgen, wie z.B. eine Transformation Þber die Zeit.

Die meisten KI-Modelle erkennen Ähnlichkeit nur, wenn Bilder OberflÃĪchenmerkmale wie Form oder Farbe teilen, weshalb sie nur Gruppe B (oben) mit dem Referenzbild verbinden. Menschen hingegen sehen auch Gruppe A als ÃĪhnlich – nicht, weil die Bilder ÃĪhnlich aussehen, sondern weil sie der gleichen zugrunde liegenden Logik folgen, wie z.B. eine Transformation Þber die Zeit.

Das entwickelte Beschriftungssystem fÞr das Datenset ermÃķglicht ungewÃķhnlich abstrakte Annotationen, die darauf abzielen, KI-Systeme dazu zu bringen, sich auf Basismerkmale statt auf spezifische lokale Details zu konzentrieren:

Die vorhergesagten 'anonymen' Beschriftungen, die zum 'relsim'-Metrik der Autoren beitragen.

Die vorhergesagten ‘anonymen’ Beschriftungen, die zum ‘relsim’-Metrik der Autoren beitragen.

Das kuratierte Datenset und der ungewÃķhnliche Beschriftungsstil liefern die Grundlage fÞr die neue, vorgeschlagene Metrik relsim, die die Autoren in ein fein abgestimmtes Bild-Sprach-Modell (VLM) eingebettet haben.

Ein Vergleich zwischen der Beschriftungsweise typischer DatensÃĪtze, die auf Attribut-Ähnlichkeit abzielen, und dem relsim-Ansatz (untere Zeile), der relationale Ähnlichkeit betont.

Ein Vergleich zwischen der Beschriftungsweise typischer DatensÃĪtze, die auf Attribut-Ähnlichkeit abzielen, und dem relsim-Ansatz (untere Zeile), der relationale Ähnlichkeit betont.

Der neue Ansatz basiert auf Methoden aus der Kognitionsforschung, insbesondere auf Dedre Gentners Struktur-Abbildungstheorie (eine Studie Þber Analogie) und Amos Tverskys Definition relationaler Ähnlichkeit und Attribut-Ähnlichkeit.

Vom zugehÃķrigen Projekt-Website, ein Beispiel fÞr relationale Ähnlichkeit. Quelle - https://thaoshibe.github.io/relsim/

Vom zugehÃķrigen Projekt-Website, ein Beispiel fÞr relationale Ähnlichkeit. Quelle

Die Autoren erklÃĪren:

‘[Menschen] verarbeiten Attribut-Ähnlichkeit wahrnehmungsbezogen, aber relationale Ähnlichkeit erfordert konzeptuelle Abstraktion, oft unterstÞtzt durch Sprache oder Vorwissen. Dies legt nahe, dass das Erkennen relationaler Ähnlichkeit zuerst das VerstÃĪndnis des Bildes, das Aufnehmen von Wissen und die Abstraktion seiner zugrunde liegenden Struktur erfordert.’

Das neue Papier trÃĪgt den Titel Relationale visuelle Ähnlichkeit und ist mit einer Projekt-Website (siehe Video am Ende des Artikels) verbunden.

Methode

Die Forscher verwendeten eines der bekanntesten hyperskaligen DatensÃĪtze als Ausgangspunkt fÞr ihre eigene Sammlung – LAION-2B:

Metadaten fÞr einen Eintrag in der LAION-2B-Sammlung. Quelle - https://huggingface.co/datasets/laion/laion2B-en-aesthetic/viewer/default/train

Metadaten fÞr einen Eintrag in der LAION-2B-Sammlung. Quelle

114.000 Bilder, die wahrscheinlich elastische relationale Strukturen enthalten, wurden aus LAION-2B extrahiert, wobei die Filterung der vielen niedrigqualitativen Bilder, die in dem minimal kuratierten Datensatz vorhanden sind, erforderlich war.

Um eine Pipeline fÞr diesen Auswahlprozess zu erstellen, nutzten die Autoren Qwen2.5-VL-7B, wobei 1.300 positive und 11.000 negative menschlich beschriftete Beispiele verwendet wurden:

Das relsim-System wird in drei Stufen trainiert: Filtern von Bildern aus LAION-2B fÞr relationale Inhalte; Zuweisung jeder Gruppe einer gemeinsamen anonymen Beschriftung, die ihre zugrunde liegende Logik erfasst; und Lernen, Bilder mit diesen Beschriftungen zu verbinden, indem ein kontrastiver Verlust verwendet wird.

Das relsim-System wird in drei Stufen trainiert: Filtern von Bildern aus LAION-2B fÞr relationale Inhalte; Zuweisung jeder Gruppe einer gemeinsamen anonymen Beschriftung, die ihre zugrunde liegende Logik erfasst; und Lernen, Bilder mit diesen Beschriftungen zu verbinden, indem ein kontrastiver Verlust verwendet wird.

Das Papier besagt:

‘Die Annotatoren wurden angewiesen: “KÃķnnen Sie in diesem Bild ein relationales Muster, eine Logik oder Struktur erkennen, die zur Erstellung oder Verbindung zu einem anderen Bild nÞtzlich sein kÃķnnte?” Die fein abgestimmte Modell erreicht 93% Übereinstimmung mit menschlichen Urteilen, und wenn es auf LAION-2B angewendet wird, ergibt es N = 114k Bilder, die als relational interessant identifiziert wurden.’

Um relationale Beschriftungen zu generieren, forderten die Forscher das Qwen-Modell auf, die gemeinsame Logik hinter Bildgruppen zu beschreiben, ohne spezifische Objekte zu nennen. Diese Abstraktion war schwierig zu erhalten, wenn das Modell nur ein Bild sah, aber wurde machbar, wenn mehrere Beispiele das zugrunde liegende Muster demonstrierten.

Die resultierenden Gruppen-Beschriftungen ersetzten spezifische Begriffe durch Platzhalter wie ‘{Subjekt}’ oder ‘{Art der Bewegung}’, was sie allgemein anwendbar machte.

Nach menschlicher ÜberprÞfung wurde jede Beschriftung mit allen Bildern in ihrer Gruppe verknÞpft. Mehr als 500 solcher Gruppen wurden verwendet, um das Modell zu trainieren, das dann auf die 114.000 gefilterten Bilder angewendet wurde, um eine große Menge abstrakter, relational annotierter Beispiele zu produzieren.

Daten und Tests

Nach der Extraktion relationaler Merkmale mit Qwen2.5-VL-7B wurde ein Modell fein abgestimmt, indem LoRA fÞr 15.000 Schritte Þber acht A100-GPUs* verwendet wurde. FÞr die Textseite wurden relationale Beschriftungen unter Verwendung von all-MiniLM-L6-v2 aus der Sentence-Transformers-Bibliothek eingebettet.

Das Datenset von 114.000 beschrifteten Bildern wurde in 100.000 fÞr das Training und 14.000 fÞr die Bewertung aufgeteilt. Um das System zu testen, wurde ein Abruf-Setup verwendet: Bei einem gegebenen Abfragebild musste das Modell ein anderes Bild aus einem Pool von 28.000 Elementen finden, das die gleiche relationale Idee ausdrÞckt. Der Abruf-Pool enthielt 14.000 Bewertungsbilder und 14.000 zusÃĪtzliche Beispiele aus LAION-2B, wobei 1.000 Abfragen zufÃĪllig aus dem Bewertungssatz fÞr die Benchmark ausgewÃĪhlt wurden.

Um die QualitÃĪt des Abrufs zu bewerten, wurde GPT-4o verwendet, um die relationale Ähnlichkeit zwischen jeder Abfrage und dem abgerufenen Bild auf einer Skala von 0 bis 10 zu bewerten. Eine separate menschliche Studie wurde ebenfalls durchgefÞhrt, um die BenutzerprÃĪferenz zu messen (siehe unten).

Jeder Teilnehmer wurde ein anonymisiertes Abfragebild mit zwei Kandidaten gezeigt, einem, der durch die vorgeschlagene Methode abgerufen wurde, und einem anderen, der durch einen Baseline-Algorithmus abgerufen wurde. Die Teilnehmer wurden gefragt, welches Bild relational ÃĪhnlicher zum Abfragebild war oder ob beide gleich nah waren. FÞr jeden Baseline-Algorithmus wurden 300 Triplett-Gruppen erstellt und von mindestens drei Personen bewertet, was etwa 900 Antworten ergab.

Der relsim-Ansatz wurde mit mehreren etablierten Bild-zu-Bild-Ähnlichkeitsmethoden verglichen, einschließlich der oben genannten LPIPS und DINO, sowie dreamsim und CLIP-I. Neben Baseline-Algorithmen, die direkte Ähnlichkeitswerte zwischen Bildpaaren berechnen, wie LPIPS, DINO, dreamsim und CLIP-I, testeten die Autoren auch Beschriftungsbasierte Methoden, bei denen Qwen verwendet wurde, um eine anonyme oder abstrakte Beschriftung fÞr jedes Bild zu generieren; diese diente dann als Abruf-Abfrage.

Zwei Abruf-Varianten wurden ausgewertet, wobei CLIP-basierte Text-zu-Bild-Abfrage (CLIP-T) fÞr Text-zu-Bild-Abfrage verwendet wurde und Qwen-T Text-zu-Text-Abfrage verwendete. Beide Beschriftungsbasierten Baseline-Methoden verwendeten das ursprÞngliche Qwen-Modell, das nicht auf relationale Logik fein abgestimmt worden war, anstelle der Version, die auf relationale Logik fein abgestimmt worden war. Dies ermÃķglichte es den Autoren, den Effekt der gruppenbasierten Schulung zu isolieren, da das fein abgestimmte Modell Bildgruppen und nicht isolierte Beispiele gesehen hatte.

Vorhandene Metriken und relationale Ähnlichkeit

Die Autoren testeten zunÃĪchst, ob bestehende Metriken relationale Ähnlichkeit erfassen kÃķnnen:

Vergleich der Abrufleistung, bewertet durch GPT-4o, mit dem Durchschnittswert der relationalen Ähnlichkeit fÞr jede Methode. Konventionelle Ähnlichkeitsmetriken wie LPIPS, DINO und CLIP-I erzielten niedrigere Werte, einschließlich wenn sie fein abgestimmt wurden. Beschriftungsbasierte Baseline-Methoden Qwen-T und CLIP-T unterboten ebenfalls die Leistung. Der hÃķchste Wert wurde durch relsim (6,77, rechte blaue Spalte) erzielt, was darauf hinweist, dass die Feinabstimmung auf gruppenbasierte relationale Muster die Übereinstimmung mit den Bewertungen von GPT-4o verbesserte.

Vergleich der Abrufleistung, bewertet durch GPT-4o, mit dem Durchschnittswert der relationalen Ähnlichkeit fÞr jede Methode. Konventionelle Ähnlichkeitsmetriken wie LPIPS, DINO und CLIP-I erzielten niedrigere Werte. Beschriftungsbasierte Baseline-Methoden Qwen-T und CLIP-T unterboten ebenfalls die Leistung. Der hÃķchste Wert wurde durch relsim (6,77, rechte blaue Spalte) erzielt, was darauf hinweist, dass die Feinabstimmung auf gruppenbasierte relationale Muster die Übereinstimmung mit den Bewertungen von GPT-4o verbesserte.

In Bezug auf diese Ergebnisse erklÃĪren die Autoren**:

‘[LPIPS], die sich ausschließlich auf wahrnehmungsbezogene Ähnlichkeit konzentriert, erzielt den niedrigsten Wert (4,56). [DINO] performt nur slightly besser (5,14), wahrscheinlich weil es ausschließlich in einer selbstÞberwachten Weise auf Bilddaten trainiert wurde. [CLIP-I] erzielt die stÃĪrksten Ergebnisse unter den Baseline-Methoden (5,91), vermutlich weil einige Abstraktionen manchmal in Bildbeschriftungen vorhanden sind.

‘Jedoch unterbietet CLIP-I unsere Methode, da das Erzielen eines besseren Wertes mÃķglicherweise die FÃĪhigkeit erfordert, noch hÃķhere Abstraktionsebenen zu erreichen, wie z.B. die in anonymen Beschriftungen.’

In der menschlichen Studie bevorzugten die Teilnehmer konsequent die relsim-Methode gegenÞber allen Baseline-Methoden:

Relationale Ähnlichkeitswerte, die von GPT-4o fÞr jede Methode zugewiesen wurden. Standard-Ähnlichkeitsmetriken wie LPIPS, DINO und CLIP-I erzielten niedrigere Werte, und beschriftungsbasierte Varianten Qwen-T und CLIP-T performten nur slightly besser. Sogar fein abgestimmte Versionen von DINO und CLIP schlossen die LÞcke nicht. Der hÃķchste Wert, 6,77, wurde durch das vorgeschlagene Modell erzielt, das mit gruppenbasierter Aufsicht trainiert wurde.

Relationale Ähnlichkeitswerte, die von GPT-4o fÞr jede Methode zugewiesen wurden. Standard-Ähnlichkeitsmetriken wie LPIPS, DINO und CLIP-I erzielten niedrigere Werte, und beschriftungsbasierte Varianten Qwen-T und CLIP-T performten nur slightly besser. Sogar fein abgestimmte Versionen von DINO und CLIP schlossen die LÞcke nicht. Der hÃķchste Wert, 6,77, wurde durch das relsim-Modell erzielt, das mit gruppenbasierter Aufsicht trainiert wurde.

Die Autoren bemerken:

‘Dies ist sehr ermutigend, da es nicht nur zeigt, dass unser Modell, relsim, erfolgreich relationale Ähnlichkeiten erkennen kann, sondern auch bestÃĪtigt, dass Menschen relationale Ähnlichkeit – und nicht nur Attribut-Ähnlichkeit – wahrnehmen!’

Um zu untersuchen, wie relationale und Attribut-Ähnlichkeit einander ergÃĪnzen kÃķnnten, verwendeten die Forscher eine kombinierte Visualisierungsmethode. Ein einzelnes Abfragebild (‘Ein Hund, der eine Kamera hÃĪlt’) wurde mit 3.000 zufÃĪlligen Bildern verglichen, und die Ähnlichkeit wurde unter Verwendung relationaler und attributbasierter Modelle berechnet:

Gemeinsame Visualisierung des visuellen Ähnlichkeitsraums unter Verwendung relationaler und attributbasierter Achsen. Ein einzelnes Abfragebild, das einen Hund zeigt, der eine Kamera hÃĪlt, wurde mit 3.000 anderen Bildern verglichen. Die Ergebnisse wurden nach relationaler Ähnlichkeit (vertikal) und Attribut-Ähnlichkeit (horizontal) organisiert. Die obere rechte Region enthÃĪlt Bilder, die dem Abfragebild in Logik und Erscheinungsbild ÃĪhnlich sind, wie z.B. andere Hunde, die Werkzeuge verwenden. Die obere linke Region enthÃĪlt semantisch verwandte, aber visuell unterschiedliche FÃĪlle, wie z.B. verschiedene Tiere, die kameraÃĪhnliche Aktionen ausfÞhren. Die meisten verbleibenden Beispiele gruppieren sich tiefer im Raum, was eine schwÃĪchere Ähnlichkeit widerspiegelt. Die Anordnung zeigt, wie relationale und attributbasierte Modelle komplementÃĪre Aspekte visueller Daten hervorheben. Bitte beachten Sie die Quelle fÞr eine bessere AuflÃķsung.

Gemeinsame Visualisierung des visuellen Ähnlichkeitsraums unter Verwendung relationaler und attributbasierter Achsen. Ein einzelnes Abfragebild, das einen Hund zeigt, der eine Kamera hÃĪlt, wurde mit 3.000 anderen Bildern verglichen. Die Ergebnisse wurden nach relationaler Ähnlichkeit (vertikal) und Attribut-Ähnlichkeit (horizontal) organisiert. Die obere rechte Region enthÃĪlt Bilder, die dem Abfragebild in Logik und Erscheinungsbild ÃĪhnlich sind, wie z.B. andere Hunde, die Werkzeuge verwenden. Die obere linke Region enthÃĪlt semantisch verwandte, aber visuell unterschiedliche FÃĪlle, wie z.B. verschiedene Tiere, die kameraÃĪhnliche Aktionen ausfÞhren. Die meisten verbleibenden Beispiele gruppieren sich tiefer im Raum, was eine schwÃĪchere Ähnlichkeit widerspiegelt. Die Anordnung zeigt, wie relationale und attributbasierte Modelle komplementÃĪre Aspekte visueller Daten hervorheben. Bitte beachten Sie die Quelle fÞr eine bessere AuflÃķsung.

Die Ergebnisse zeigten Cluster, die verschiedenen Arten von Ähnlichkeit entsprachen: einige Bilder waren sowohl relational als auch visuell ÃĪhnlich, wie z.B. andere Hunde in menschlichen Posen; andere teilten relationale Logik, aber nicht das Erscheinungsbild, wie z.B. verschiedene Tiere, die menschliche Aktionen nachahmen; der Rest zeigte keine Ähnlichkeit.

Diese Analyse legt nahe, dass die beiden Arten von Ähnlichkeit unterschiedliche Rollen spielen und eine reichere Struktur ergeben, wenn sie kombiniert werden.

AnwendungsfÃĪlle

Das Papier erforscht auch einige mÃķgliche EndanwendungsfÃĪlle fÞr relationale Ähnlichkeit, einschließlich relationaler Bildabfrage, die eine Bildsuche ermÃķglicht, die mehr mit der kreativen Art und Weise Þbereinstimmt, wie Menschen die Welt betrachten:

Relationale Abfrage gibt Bilder zurÞck, die eine tiefere konzeptuelle Struktur mit dem Abfragebild teilen, anstatt OberflÃĪchenmerkmale zu entsprechen. Zum Beispiel gibt ein Nahrungsmittel, das wie ein Gesicht gestaltet ist, andere anthropomorphe Mahlzeiten zurÞck; ein geschnittenes Objekt gibt andere geschnittene Formen zurÞck; und Szenen von Erwachsenen-Kind-Interaktionen geben Bilder mit ÃĪhnlichen relationalen Rollen zurÞck, auch wenn die Arten und die Zusammensetzung unterschiedlich sind.

Relationale Abfrage gibt Bilder zurÞck, die eine tiefere konzeptuelle Struktur mit dem Abfragebild teilen, anstatt OberflÃĪchenmerkmale zu entsprechen. Zum Beispiel gibt ein Nahrungsmittel, das wie ein Gesicht gestaltet ist, andere anthropomorphe Mahlzeiten zurÞck; ein geschnittenes Objekt gibt andere geschnittene Formen zurÞck; und Szenen von Erwachsenen-Kind-Interaktionen geben Bilder mit ÃĪhnlichen relationalen Rollen zurÞck, auch wenn die Arten und die Zusammensetzung unterschiedlich sind.

Ein weiterer mÃķglicher Anwendungsfall ist analoge Bildgenerierung, die die Synthese von Abfragen ermÃķglichen wÞrde, die relationale Strukturen anstelle von direkten Beschreibungen verwenden. Im Vergleich der Ergebnisse, die von der aktuellen Generation von State-of-the-Art-Text-zu-Bild-Modellen erzielt wurden, ist es wahrscheinlich, dass die Ergebnisse eines solchen Ansatzes vielfÃĪltiger sind:

Gegeben ein Eingabebild und eine relationale Abfrage, wurden die Modelle aufgefordert, ein neues Bild zu generieren, das die gleiche zugrunde liegende Konzeption ausdrÞckt. ProprietÃĪre Modelle produzierten treue Analogien, die die strukturelle Logik Þber große FormÃĪnderungen hinweg bewahrten, und Open-Source-Modelle neigten dazu, auf literale oder stilistische Übereinstimmungen zurÞckzugreifen und die tiefere Idee nicht zu Þbertragen. Die Ausgaben wurden mit menschlich kuratierten Analogien verglichen, die die beabsichtigte Transformation veranschaulichten.

Gegeben ein Eingabebild und eine relationale Abfrage, wurden die Modelle aufgefordert, ein neues Bild zu generieren, das die gleiche zugrunde liegende Konzeption ausdrÞckt. ProprietÃĪre Modelle produzierten treue Analogien, die die strukturelle Logik Þber große FormÃĪnderungen hinweg bewahrten, wÃĪhrend Open-Source-Modelle dazu neigten, auf literale oder stilistische Übereinstimmungen zurÞckzugreifen und die tiefere Idee nicht zu Þbertragen. Die Ausgaben wurden mit menschlich kuratierten Analogien verglichen, die die beabsichtigte Transformation veranschaulichten.

Schlussfolgerung

Generative KI-Systeme wÞrden, so scheint es, durch die FÃĪhigkeit, abstrakte ReprÃĪsentationen in ihre Konzepte zu integrieren, deutlich verbessert. Wie es derzeit steht, tendieren Anfragen nach konzeptbasierten Bildern wie “Wut” oder “GlÞck” dazu, Bilder zurÞckzugeben, die aus den populÃĪrsten oder hÃĪufigsten Bildern im Datensatz stammen, die diese Assoziationen hatten; was Memorisation anstelle von Abstraktion ist.

Es ist anzunehmen, dass dieses Prinzip noch nÞtzlicher wÃĪre, wenn es auf generative Schreibweise, insbesondere analytische, spekulative oder fiktive Ausgaben, angewendet werden kÃķnnte.

DrÞcken Sie zum Abspielen. Quelle

 

 

* Ein A100 kann 40Gb oder 80GB VRAM haben; dies ist im Papier nicht spezifiziert.

** Die Zitate der Autoren sind redundant und ausgeschlossen.

ErstverÃķffentlichung am Dienstag, den 16. Dezember 2025

Schriftsteller Þber maschinelles Lernen, DomÃĪnen-Spezialist in der menschlichen Bildsynthese. Ehemaliger Leiter des Forschungsinhalts bei Metaphysic.ai, bis zu dessen AuflÃķsung in DNEG's Brahma.ai.
Portfolio-Seite: martinanderson.ai
Kontakt: [email protected]