Andersons Blickwinkel

Warum AI-Videos manchmal rückwärts laufen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
ChatGPT/Firefly image depicting a jet-skier impossibly leaving a wake in front of himself.

Wenn 2022 das Jahr war, in dem generative KI die Vorstellungskraft einer breiteren Öffentlichkeit eroberte, ist 2025 das Jahr, in dem die neue Generation generativer Video-Frameworks, die aus China stammt, anscheinend dasselbe tun wird.

Tencents Hunyuan-Video hat mit seiner Open-Source-Veröffentlichung eines vollständigen Video-Diffusionsmodells, das Benutzer an ihre Bedürfnisse anpassen können, einen großen Einfluss auf die AI-Hobbyistengemeinschaft.

Dicht gefolgt ist Alibabas jüngstes Wan 2.1, eines der leistungsstärksten Bild-zu-Video-FOSS-Lösungen dieser Zeit – jetzt mit Anpassungsmöglichkeiten durch Wan LoRAs unterstützt.

Abgesehen von der Verfügbarkeit des aktuellen humanzentrierten Grundmodells SkyReels warten wir zum Zeitpunkt des Schreibens auch auf die Veröffentlichung von Alibabas umfassendem VACE-Video-Erstellung- und -Bearbeitungspaket:

Bitte klicken Sie, um abzuspielen. Die bevorstehende Veröffentlichung von Alibabas multifunktionalem AI-Bearbeitungspaket VACE hat die Benutzercommunity begeistert. Quelle: https://ali-vilab.github.io/VACE-Page/

Plötzlicher Einfluss

Die Szene der generativen Video-KI-Forschung ist selbst nicht weniger explosiv; es ist noch die erste Hälfte des März, und die Einreichungen vom Dienstag bei Arxivs Computer-Vision-Sektion (einem Zentrum für generative KI-Papiere) beliefen sich auf fast 350 Einträge – eine Zahl, die normalerweise mit dem Höhepunkt der Konferenzsaison assoziiert wird.

Die zwei Jahre seit der Veröffentlichung von Stable Diffusion im Sommer 2022 (und der anschließenden Entwicklung von Dreambooth und LoRA-Anpassungsmethoden) waren durch das Fehlen weiterer bedeutender Entwicklungen gekennzeichnet, bis zu den letzten Wochen, in denen neue Veröffentlichungen und Innovationen in einem solchen atemberaubenden Tempo voranschritten, dass es fast unmöglich ist, sich darüber im Klaren zu sein, geschweige denn alles abzudecken.

Video-Diffusionsmodelle wie Hunyuan und Wan 2.1 haben das Problem der zeitlichen Konsistenz im Zusammenhang mit der Generierung von Menschen und größtenteils auch mit Umwelten und Objekten endlich gelöst.

Es kann kaum ein Zweifel daran bestehen, dass VFX-Studio derzeit Personal und Ressourcen einsetzen, um die neuen chinesischen Video-Modelle anzupassen, um sofortige Herausforderungen wie Gesichtsaustausch zu lösen, trotz des aktuellen Fehlens von ControlNet-ähnlichen Hilfsmechanismen für diese Systeme.

Es muss eine große Erleichterung sein, dass ein solches erhebliches Hindernis möglicherweise überwunden wurde, wenn auch nicht auf den erwarteten Wegen.

Unter den verbleibenden Problemen ist dieses jedoch nicht unbedeutend:

Bitte klicken Sie, um abzuspielen. Basierend auf dem Prompt ‘Ein kleiner Stein rollt eine steile, felsige Hänge hinunter, verschiebt Erde und kleine Steine’, macht Wan 2.1, das in der neuen Studie die höchsten Punktzahlen erzielte, einen einfachen Fehler. Quelle: https://videophy2.github.io/

Bergaufwärts

Alle text-zu-Video- und Bild-zu-Video-Systeme, die derzeit verfügbar sind, einschließlich kommerzieller Closed-Source-Modelle, neigen dazu, physikalische Fehler wie den oben gezeigten zu produzieren, bei dem das Video einen Stein zeigt, der bergaufwärts rollt, basierend auf dem Prompt ‘Ein kleiner Stein rollt eine steile, felsige Hänge hinunter, verschiebt Erde und kleine Steine‘.

Eine Theorie, warum dies passiert, wurde kürzlich in einer akademischen Zusammenarbeit zwischen Alibaba und den Vereinigten Arabischen Emiraten vorgeschlagen, ist, dass Modelle immer auf einzelnen Bildern trainiert werden, in gewissem Sinne, auch wenn sie auf Videos trainieren (die für Trainingszwecke in einzelne Bildsequenzen umgewandelt werden); und sie mögen nicht unbedingt die richtige zeitliche Reihenfolge von ‘vorher’ und ‘nachher’ Bildern lernen.

Die wahrscheinlichste Lösung ist jedoch, dass die Modelle in Frage Data-Augmentation-Routinen verwendet haben, die das Vorzeigen eines Quell-Trainingsclips an das Modell sowohl vorwärts und rückwärts beinhalten, was die Trainingsdaten effektiv verdoppelt.

Es ist seit langem bekannt, dass dies nicht willkürlich erfolgen sollte, da einige Bewegungen rückwärts funktionieren, viele jedoch nicht. Eine Studie von 2019 der Universität Bristol im Vereinigten Königreich versuchte, eine Methode zu entwickeln, die äquivariante, invariante und irreversible Quell-Video-Clips in einem einzelnen Datensatz unterscheiden kann (siehe Bild unten), mit der Idee, dass ungeeignete Quell-Clips möglicherweise aus Data-Augmentation-Routinen gefiltert werden könnten.

Beispiele für drei Arten von Bewegungen, von denen nur eine frei rückwärts umkehrbar ist und dabei plausible physikalische Dynamiken beibehält. Quelle: https://arxiv.org/abs/1909.09422

Beispiele für drei Arten von Bewegungen, von denen nur eine frei rückwärts umkehrbar ist und dabei plausible physikalische Dynamiken beibehält. Quelle: https://arxiv.org/abs/1909.09422

Die Autoren dieser Arbeit formulieren das Problem klar:

‘Wir stellen fest, dass die Realität umgekehrter Videos durch Umkehrartefakte verraten wird, Aspekte der Szene, die in der realen Welt nicht möglich wären. Einige Artefakte sind subtil, während andere leicht zu erkennen sind, wie eine umgekehrte ‘Wurf’-Aktion, bei der das geworfene Objekt spontan vom Boden aufsteigt.

‘Wir beobachten zwei Arten von Umkehrartefakten, physikalische, die Verletzungen der Naturgesetze zeigen, und unwahrscheinliche, die ein mögliches, aber unwahrscheinliches Szenario darstellen. Diese sind nicht exklusiv, und viele umgekehrte Aktionen leiden unter beiden Arten von Artefakten, wie z. B. beim Glätten eines Papiers.

‘Beispiele für physikalische Artefakte sind: umgekehrte Schwerkraft (z. B. ‘etwas fallen lassen’), spontane Impulse auf Objekten (z. B. ‘einen Stift drehen’) und irreversible Zustandsänderungen (z. B. ‘eine Kerze anzünden’). Ein Beispiel für ein unwahrscheinliches Artefakt: ein Tablett aus dem Schrank nehmen, es trocknen und auf ein Trockengestell legen.

‘Diese Art von Datenwiederverwendung ist sehr häufig während des Trainings und kann nützlich sein – beispielsweise kann sie dazu beitragen, dass das Modell nicht nur eine Ansicht eines Bildes oder Objekts lernt, das gedreht oder gespiegelt werden kann, ohne seine zentrale Kohärenz und Logik zu verlieren.

‘Dies funktioniert jedoch nur für Objekte, die wirklich symmetrisch sind; und das Lernen von Physik aus einem ‘umgekehrten’ Video funktioniert nur, wenn die umgekehrte Version genauso viel Sinn ergibt wie die Vorwärtsversion.’

Vorübergehende Umkehrungen

Wir haben keine Beweise dafür, dass Systeme wie Hunyuan-Video und Wan 2.1 willkürlich ‘umgekehrte’ Clips dem Modell während des Trainings vorlegten (keine der Forschergruppen hat sich über Data-Augmentation-Routinen geäußert).

Die einzige vernünftige alternative Möglichkeit wäre jedoch, dass die hyperskaligen Datensätze, die diese Modelle antreiben, Clips enthalten, die tatsächlich Bewegungen in umgekehrter Reihenfolge zeigen.

Der Stein im oben eingebetteten Beispielvideo wurde mit Wan 2.1 generiert und ist Teil einer neuen Studie, die untersucht, wie gut Video-Diffusionsmodelle Physik handhaben.

Bei Tests für dieses Projekt erzielte Wan 2.1 einen Punktestand von nur 22 % bei seiner Fähigkeit, physikalische Gesetze konsistent einzuhalten.

Dennoch ist dies die beste Punktzahl aller getesteten Systeme, was darauf hindeutet, dass wir möglicherweise unseren nächsten Hindernis für Video-KI gefunden haben:

Punktzahlen, die von führenden Open-Source- und Closed-Source-Systemen erzielt wurden, wobei die Ausgabe der Frameworks von menschlichen Annotatoren bewertet wurde. Quelle: https://arxiv.org/pdf/2503.06800

Punktzahlen, die von führenden Open-Source- und Closed-Source-Systemen erzielt wurden, wobei die Ausgabe der Frameworks von menschlichen Annotatoren bewertet wurde. Quelle: https://arxiv.org/pdf/2503.06800

Die Autoren der neuen Arbeit haben ein Benchmarking-System entwickelt, jetzt in seiner zweiten Iteration, namens VideoPhy, mit dem Code verfügbar auf GitHub.

Obwohl der Umfang der Arbeit über das hinausgeht, was wir hier umfassend abdecken können, lassen Sie uns einen allgemeinen Blick auf ihre Methodik und ihr Potenzial werfen, um einen Maßstab zu etablieren, der den Kurs zukünftiger Modell-Trainings-Sitzungen von diesen seltsamen Fällen von Umkehrungen ablenken kann.

Die Studie, durchgeführt von sechs Forschern von der UCLA und Google Research, heißt VideoPhy-2: Eine anspruchsvolle aktionszentrierte physikalische Alltagsbewertung bei der Videogenerierung. Eine umfangreiche begleitende Projekt-Website ist ebenfalls verfügbar, zusammen mit Code und Datensätzen auf GitHub und einem Datensatz-Viewer auf Hugging Face.

Bitte klicken Sie, um abzuspielen. Der gefeierte OpenAI-Sora-Modell kann die Interaktionen zwischen Rudern und Reflexionen nicht verstehen und kann auch keine logische physikalische Fluss für die Person im Boot oder die Art und Weise, wie das Boot mit ihr interagiert, bereitstellen.

Methode

Die Autoren beschreiben die neueste Version ihrer Arbeit, VideoPhy-2, als ‘anspruchsvolle Alltagsbewertung für reale Aktionen’. Die Sammlung umfasst 197 Aktionen über eine breite Palette von verschiedenen physikalischen Aktivitäten wie Hula-Reifen, Turnen und Tennis, sowie Objektinteraktionen wie ein Objekt biegen, bis es bricht.

Ein großes Sprachmodell (LLM) wird verwendet, um 3840 Prompts aus diesen Ausgangsaktionen zu generieren, und die Prompts werden dann verwendet, um Videos über die verschiedenen Frameworks zu synthetisieren.

Während des gesamten Prozesses haben die Autoren eine Liste von ‘Kandidaten’ für physikalische Regeln und Gesetze entwickelt, die von AI-generierten Videos erfüllt werden sollten, unter Verwendung von Bild-Sprach-Modellen für die Bewertung.

Die Autoren erklären:

‘Zum Beispiel in einem Video von einem Sportler, der Tennis spielt, wäre eine physikalische Regel, dass ein Tennisball eine parabolische Flugbahn unter Schwerkraft beschreiben sollte. Für Gold-Standard-Urteile bitten wir menschliche Annotatoren, jedes Video anhand der allgemeinen semantischen Übereinstimmung und physikalischen Alltagsverständnis zu bewerten und seine Übereinstimmung mit verschiedenen physikalischen Regeln zu markieren.’

Oben: Ein Text-Prompt wird aus einer Aktion unter Verwendung eines LLM generiert und verwendet, um ein Video mit einem Text-zu-Video-Generator zu erstellen. Ein Bild-Sprach-Modell beschriftet das Video und identifiziert mögliche physikalische Regeln, die zur Anwendung kommen. Unten: Menschliche Annotatoren bewerten die Realistik des Videos, bestätigen Regelverletzungen, fügen fehlende Regeln hinzu und prüfen, ob das Video dem ursprünglichen Prompt entspricht.

Oben: Ein Text-Prompt wird aus einer Aktion unter Verwendung eines LLM generiert und verwendet, um ein Video mit einem Text-zu-Video-Generator zu erstellen. Ein Bild-Sprach-Modell beschriftet das Video und identifiziert mögliche physikalische Regeln, die zur Anwendung kommen. Unten: Menschliche Annotatoren bewerten die Realistik des Videos, bestätigen Regelverletzungen, fügen fehlende Regeln hinzu und prüfen, ob das Video dem ursprünglichen Prompt entspricht.

Ursprünglich kuratierten die Forscher eine Reihe von Aktionen, um physikalische Alltagsverständnis in AI-generierten Videos zu bewerten. Sie begannen mit über 600 Aktionen aus den Kinetics-, UCF-101– und SSv2-Datensätzen, mit dem Fokus auf Aktivitäten, die Sport, Objektinteraktionen und reale Physik beinhalten.

Zwei unabhängige Gruppen von STEM-ausgebildeten Studenten-Annotatoren (mit einem Mindestabschluss auf Bachelor-Niveau) überprüften und filterten die Liste, wählten Aktionen aus, die Prinzipien wie Schwerkraft, Impuls und Elastizität testeten, während sie Aufgaben mit geringer Bewegung wie Tippen, ein Haustier streicheln oder Kauen entfernten.

Nach weiterer Verfeinerung mit Gemini-2.0-Flash-Exp zur Eliminierung von Duplikaten umfasste der endgültige Datensatz 197 Aktionen, von denen 54 Objektinteraktionen und 143 physikalische und sportliche Aktivitäten umfassten:

Beispiele aus den destillierten Aktionen.

Beispiele aus den destillierten Aktionen.

Im zweiten Schritt verwendeten die Forscher Gemini-2.0-Flash-Exp, um 20 Prompts für jede Aktion im Datensatz zu generieren, was insgesamt 3.940 Prompts ergab. Der Generierungsprozess konzentrierte sich auf sichtbare physikalische Interaktionen, die klar in einem generierten Video dargestellt werden konnten. Dies schloss nicht-sichtbare Elemente wie Emotionen, Sinneseindrücke und abstrakte Sprache aus, aber beinhaltete vielfältige Charaktere und Objekte.

Beispielsweise anstelle eines einfachen Prompts wie ‘Ein Bogenschütze lässt den Pfeil los’ wurde das Modell angewiesen, eine detailliertere Version wie ‘Ein Bogenschütze spannt die Bogensehne bis zum vollen Zug zurück und lässt den Pfeil los, der geradeaus fliegt und ein Bullseye auf einem Papierschuss trifft‘ zu produzieren.

Da moderne Video-Modelle längere Beschreibungen interpretieren können, verfeinerten die Forscher die Beschriftungen mithilfe des Mistral-NeMo-12B-Instruct-Prompt-Aufwärts-Scalings, um visuelle Details hinzuzufügen, ohne die ursprüngliche Bedeutung zu ändern.

Beispiel-Prompts aus VideoPhy-2, nach physikalischen Aktivitäten oder Objektinteraktionen kategorisiert. Jeder Prompt ist mit seiner entsprechenden Aktion und dem relevanten physikalischen Prinzip, das er testet, verbunden.

Beispiel-Prompts aus VideoPhy-2, nach physikalischen Aktivitäten oder Objektinteraktionen kategorisiert. Jeder Prompt ist mit seiner entsprechenden Aktion und dem relevanten physikalischen Prinzip, das er testet, verbunden.

Im dritten Schritt wurden physikalische Regeln nicht aus Text-Prompts abgeleitet, sondern aus generierten Videos, da generative Modelle Schwierigkeiten haben können, konditionierten Text-Prompts zu folgen.

Videos wurden zuerst unter Verwendung von VideoPhy-2-Prompts erstellt, dann mit Gemini-2.0-Flash-Exp ‘hochbeschriftet’, um Schlüsseldetails zu extrahieren. Das Modell schlug drei erwartete physikalische Regeln pro Video vor, die menschliche Annotatoren überprüften und erweiterten, indem sie zusätzliche potenzielle Verletzungen identifizierten.

Beispiele aus den hochbeschrifteten Beschriftungen.

Beispiele aus den hochbeschrifteten Beschriftungen.

Als nächstes, um die anspruchsvollsten Aktionen zu identifizieren, generierten die Forscher Videos unter Verwendung von CogVideoX-5B mit Prompts aus dem VideoPhy-2-Datensatz. Sie wählten dann 60 Aktionen aus 197 aus, bei denen das Modell konsistent nicht in der Lage war, den Prompts und dem grundlegenden physikalischen Alltagsverständnis zu folgen.

Diese Aktionen umfassten physikreiche Interaktionen wie Impulstransfer beim Diskuswerfen, Zustandsänderungen wie das Biegen eines Objekts, bis es bricht, Balancieraufgaben wie Seiltanz und komplexe Bewegungen, die Rückwärtssaltos, Stabhochsprung und Pizzawürfe umfassten. Insgesamt wurden 1.200 Prompts ausgewählt, um die Schwierigkeit des Sub-Datensatzes zu erhöhen.

Der resultierende Datensatz umfasste 3.940 Beschriftungen – 5,72-mal mehr als die vorherige Version von VideoPhy. Die durchschnittliche Länge der ursprünglichen Beschriftungen beträgt 16 Token, während die hochbeschrifteten Beschriftungen 138 Token erreichen – 1,88-mal und 16,2-mal länger, jeweils.

Der Datensatz umfasst auch 102.000 menschliche Annotierungen, die semantische Übereinstimmung, physikalische Alltagsverständnis und Regelverletzungen über mehrere Video-Generierungs-Modelle abdecken.

Bewertung

Die Forscher definierten dann klare Kriterien für die Bewertung der Videos. Das Hauptziel bestand darin, zu bewerten, wie gut jedes Video seinem Eingabe-Prompt entsprach und grundlegende physikalische Prinzipien befolgte.

Anstatt die Videos einfach nach Vorliebe zu bewerten, verwendeten sie Bewertungen auf der Grundlage von Punktzahlen, um spezifische Erfolge und Misserfolge zu erfassen, während die Bewertung auch überprüfte, ob die Videos verschiedenen physikalischen Regeln und Gesetzen folgten.

Für die menschliche Bewertung wurde eine Gruppe von 12 Annotatoren aus Tests auf Amazon Mechanical Turk (AMT) ausgewählt und erhielt nach detaillierten Remote-Anweisungen Bewertungen. Aus Fairnessgründen wurden semantische Übereinstimmung und physikalische Alltagsverständnis getrennt bewertet (in der ursprünglichen VideoPhy-Studie wurden sie gemeinsam bewertet).

Die Annotatoren bewerteten zunächst, wie gut die Videos ihren Eingabe-Prompts entsprachen, und bewerteten dann getrennt die physikalische Plausibilität, indem sie Regelverletzungen und die allgemeine Realistik auf einer Skala von 1 bis 5 bewerteten. Es wurden nur die ursprünglichen Prompts angezeigt, um einen fairen Vergleich zwischen den Modellen zu gewährleisten.

Die Oberfläche, die den AMT-Annotatoren präsentiert wurde.

Die Oberfläche, die den AMT-Annotatoren präsentiert wurde.

Obwohl menschliche Urteile der Goldstandard bleiben, sind sie teuer und haben eine Reihe von Nachteilen. Deshalb ist automatisierte Bewertung für schnellere und skalierbarere Modellbewertungen unerlässlich.

Die Autoren der Studie testeten mehrere Video-Sprach-Modelle, darunter Gemini-2.0-Flash-Exp und VideoScore, auf ihre Fähigkeit, Videos für semantische Genauigkeit und ‘physikalische Alltagsverständnis’ zu bewerten.

Die Modelle bewerteten jedes Video auf einer Skala von 1 bis 5, während eine separate Klassifizierungsaufgabe bestimmt, ob physikalische Regeln befolgt, verletzt oder unklar waren.

Experiments zeigten, dass bestehende Video-Sprach-Modelle Schwierigkeiten hatten, menschliche Urteile zu treffen, hauptsächlich aufgrund schwacher physikalischer Argumentation und der Komplexität der Prompts. Um die automatisierte Bewertung zu verbessern, entwickelten die Forscher VideoPhy-2-Autoeval, ein 7-B-Parameter-Modell, das darauf ausgelegt ist, genauere Vorhersagen über drei Kategorien zu liefern: semantische Übereinstimmung; physikalische Alltagsverständnis; und Regelkonformität, fein abgestimmt auf dem VideoCon-Physics-Modell unter Verwendung von 50.000 menschlichen Annotierungen*.

Daten und Tests

Mit diesen Werkzeugen an Bord testeten die Autoren eine Reihe von generativen Video-Systemen, sowohl durch lokale Installationen als auch, wo notwendig, über kommerzielle APIs: CogVideoX-5B; VideoCrafter2; HunyuanVideo-13B; Cosmos-Diffusion; Wan2.1-14B; OpenAI Sora; und Luma Ray.

Die Modelle wurden mit hochaufgelösten Beschriftungen versehen, wo möglich, mit Ausnahme davon, dass Hunyuan-Video und VideoCrafter2 unter 77-TOKEN-CLIP-Einschränkungen operieren und keine Prompts über eine bestimmte Länge akzeptieren können.

Die generierten Videos wurden auf weniger als 6 Sekunden beschränkt, da kürzere Ausgabe leichter zu bewerten ist.

Die treibenden Daten stammten aus dem VideoPhy-2-Datensatz, der in einen Benchmark- und Trainings-Satz aufgeteilt wurde. 590 Videos wurden pro Modell generiert, mit Ausnahme von Sora und Ray2; aufgrund des Kosteneffekts (äquivalente niedrigere Zahlen an Videos wurden für diese generiert).

(Bitte beziehen Sie sich auf das Quellpapier für weitere Bewertungsdetails, die dort ausführlich dokumentiert sind)

Die anfängliche Bewertung befasste sich mit physikalischen Aktivitäten/Sport (PA) und Objektinteraktionen (OI) und testete sowohl den allgemeinen Datensatz als auch die oben genannte ‘schwierigere’ Teilmenge:

Ergebnisse aus der ersten Runde.

Ergebnisse aus der ersten Runde.

Hier kommentieren die Autoren:

‘Sogar das am besten abschneidende Modell, Wan2.1-14B, erreicht nur 32,6 % und 21,9 % auf dem vollständigen und harten Split unseres Datensatzes. Seine relativ starke Leistung im Vergleich zu anderen Modellen kann auf die Vielfalt seiner multimodalen Trainingsdaten und robuste Bewegungsfilterung zurückgeführt werden, die hochwertige Videos über eine breite Palette von Aktionen hinweg beibehält.

‘Darüber hinaus beobachten wir, dass geschlossene Modelle wie Ray2 schlechter abschneiden als offene Modelle wie Wan2.1-14B und CogVideoX-5B. Dies deutet darauf hin, dass geschlossene Modelle nicht unbedingt besser sind als offene Modelle, wenn es um die Erfassung physikalischen Alltagsverständnisses geht.

‘Bemerkenswerterweise erreicht Cosmos-Diffusion-7B die zweitbeste Punktzahl auf dem harten Split, sogar besser als das viel größere HunyuanVideo-13B-Modell. Dies könnte auf die hohe Darstellung von menschlichen Aktionen in seinen Trainingsdaten und synthetisch gerenderten Simulationen zurückzuführen sein.’

Die Ergebnisse zeigten, dass Video-Modelle mehr mit physikalischen Aktivitäten wie Sport zu kämpfen hatten als mit einfacheren Objektinteraktionen. Dies deutet darauf hin, dass die Verbesserung von AI-generierten Videos in diesem Bereich bessere Datensätze erfordern wird – insbesondere hochwertige Aufnahmen von Sportarten wie Tennis, Diskuswurf, Baseball und Cricket.

Die Studie untersuchte auch, ob die physikalische Plausibilität eines Modells mit anderen Video-Qualitätsmetriken wie Ästhetik und Bewegungsglätte korrelierte. Die Ergebnisse zeigten, dass es keine starke Korrelation gibt, was bedeutet, dass ein Modell seine Leistung bei VideoPhy-2 nicht allein durch die Generierung visuell ansprechender oder flüssiger Bewegungen verbessern kann – es benötigt ein tieferes Verständnis von physikalischen Alltagsverständnis.

Obwohl die Studie eine Fülle von qualitativen Beispielen liefert, scheinen wenige der statischen Beispiele, die im PDF bereitgestellt werden, mit den umfangreichen video-basierten Beispielen zusammenzuhängen, die die Autoren auf der Projekt-Website bereitstellen. Deshalb werden wir uns auf eine kleine Auswahl der statischen Beispiele und einige der tatsächlichen Projekt-Videos konzentrieren.

Die obere Zeile zeigt Videos, die von Wan2.1 generiert wurden. (a) In Ray2 bleibt das Jet-Ski auf der linken Seite zurück, bevor es rückwärts fährt. (b) In Hunyuan-13B verformt sich der Vorschlaghammer während des Schwungs und ein gebrochenes Holzbrett erscheint unerwartet. (c) In Cosmos-7B schleudert der Speer Sand aus, bevor er den Boden berührt.

Die obere Zeile zeigt Videos, die von Wan2.1 generiert wurden. (a) In Ray2 bleibt das Jet-Ski auf der linken Seite zurück, bevor es rückwärts fährt. (b) In Hunyuan-13B verformt sich der Vorschlaghammer während des Schwungs und ein gebrochenes Holzbrett erscheint unerwartet. (c) In Cosmos-7B schleudert der Speer Sand aus, bevor er den Boden berührt.

In Bezug auf die obige qualitative Bewertung kommentieren die Autoren:

‘[Wir] beobachten Verletzungen physikalischen Alltagsverständnisses, wie z. B. Jet-Skis, die unnatürlich rückwärts fahren, und die Deformation eines festen Vorschlaghammers, der die Prinzipien der Elastizität verletzt. Allerdings leidet auch Wan unter dem Mangel an physikalischen Alltagsverständnis, wie im Clip zu sehen ist, der am Anfang dieses Artikels eingebettet ist.

‘In diesem Fall heben wir hervor, dass ein Stein beginnt, zu rollen und zu beschleunigen, bergaufwärts, was das physikalische Gesetz der Schwerkraft verletzt.’

Weitere Beispiele von der Projekt-Website:

Bitte klicken Sie, um abzuspielen. Die Beschriftung lautete ‘Eine Person dreht ein nasses Handtuch heftig, Wasser sprüht in einem sichtbaren Bogen nach außen’ – aber die resultierende Wasserquelle sieht eher aus wie ein Wasserschlauch als ein Handtuch.

Bitte klicken Sie, um abzuspielen. Die Beschriftung lautete ‘Ein Chemiker gießt eine klare Flüssigkeit aus einem Becher in ein Reagenzglas, vermeidet sorgfältig Überschüsse’, aber wir können sehen, dass das Volumen des Wassers, das in den Becher gegeben wird, nicht mit der Menge übereinstimmt, die aus dem Krug austritt.

Wie ich zu Beginn erwähnte, übersteigt der Umfang des Materials, das mit diesem Projekt verbunden ist, bei weitem, was hier abgedeckt werden kann. Bitte beziehen Sie sich auf das Quellpapier, die Projekt-Website und die oben genannten verwandten Seiten, um einen umfassenden Überblick über die Verfahren der Autoren und viele weitere Testbeispiele und prozedurale Details zu erhalten.

 

* Was die Herkunft der Annotierungen betrifft, so spezifiziert das Papier nur ‘erworben für diese Aufgaben’ – es scheint viel, um von 12 AMT-Arbeitern generiert worden zu sein.

Erstveröffentlichung Donnerstag, 13. März 2025

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai