Andersons Blickwinkel
Mit KI “Anleitung”-Videos zusammenfassen

Wenn Sie der Typ sind, der die Geschwindigkeit eines YouTube-“Anleitung”-Videos erhöht, um an die Informationen zu gelangen, die Sie wirklich wollen; die Transkription des Videos konsultiert, um die wesentlichen Informationen zu erhalten, die in den langen und oft sponsorbehafteten Laufzeiten versteckt sind; oder hoffen, dass WikiHow eine weniger zeitaufwändige Version der Informationen in dem Anleitungsvideo erstellt hat; dann könnte ein neues Projekt von UC Berkeley, Google Research und Brown University für Sie von Interesse sein.
Unter dem Titel TL;DW? Zusammenfassung von Anleitungsvideos mit Aufgabenrelevanz und Cross-Modal-Saliency beschreibt die neue Studie die Erstellung eines KI-gestützten Videozusammenfassungssystems, das relevante Schritte aus dem Video identifizieren und alles andere entfernen kann, was zu kurzen Zusammenfassungen führt, die schnell zum Punkt kommen.

WikiHow’s Ausnutzung bestehender langer Videoclips für Text- und Videoinformationen wird vom IV-Sum-Projekt verwendet, um gefälschte Zusammenfassungen zu generieren, die die Grundwahrheit für die Ausbildung des Systems liefern. Quelle: https://arxiv.org/pdf/2208.06773.pdf
Die resultierenden Zusammenfassungen haben nur einen Bruchteil der ursprünglichen Video-Laufzeit, während multi-modale (d. h. textbasierte) Informationen auch während des Prozesses aufgezeichnet werden, sodass zukünftige Systeme möglicherweise die Erstellung von WikiHow-ähnlichen Blog-Beiträgen automatisieren können, die in der Lage sind, ein umfangreiches “Anleitung”-Video in einen prägnanten und suchbaren kurzen Artikel zu parsen, einschließlich Illustrationen, was möglicherweise Zeit und Frustration sparen kann.
Das neue System heißt IV-Sum (‘Anleitungsvideozusammenfasser’), und verwendet den Open-Source-ResNet-50-Computer-Vision-Algorithmus, zusammen mit mehreren anderen Techniken, um relevante Frames und Segmente eines langen Quellvideos zu individuieren.
Das System wird auf pseudo-Zusammenfassungen trainiert, die aus dem Inhaltsstruktur der WikiHow-Website generiert werden, wo reale Menschen oft beliebte Anleitungsvideos in eine flachere, textbasierte Multimedia-Form umwandeln, oft unter Verwendung kurzer Clips und animierter GIFs aus den Quell-Anleitungsvideos.
In der Diskussion des Projekts über die Verwendung von WikiHow-Zusammenfassungen als Grundwahrheitsdaten für das System sagen die Autoren:
‘Jeder Artikel auf der WikiHow-Videos-Website besteht aus einem Hauptanleitungsvideo, das eine Aufgabe demonstriert, die oft Werbeinhalte, Clips des Sprechers, der zur Kamera spricht, ohne visuelle Informationen über die Aufgabe, und Schritte enthält, die nicht entscheidend für die Ausführung der Aufgabe sind.
‘Zuschauer, die eine Übersicht über die Aufgabe bevorzugen, würden ein kürzeres Video ohne all diese irrelevanten Informationen bevorzugen. Die WikiHow-Artikel (z. B. siehe So macht man Sushi-Reis) enthalten genau dies: entsprechenden Text, der alle wichtigen Schritte im Video auflistet, zusammen mit begleitenden Bildern/Clips, die die verschiedenen Schritte in der Aufgabe veranschaulichen.’
Die resultierende Datenbank aus diesem Web-Scraping wird WikiHow-Zusammenfassungen genannt. Die Datenbank besteht aus 2.106 Eingabevideos und ihren zugehörigen Zusammenfassungen. Dies ist eine bemerkenswert größere Datenmenge als normalerweise für Videozusammenfassungsprojekte verfügbar, die in der Regel teure und arbeitsintensive manuelle Markierung und Annotation erfordern – ein Prozess, der in der neuen Arbeit größtenteils automatisiert wurde, dank des eingeschränkteren Umfangs der Zusammenfassung von Anleitungsvideos (und nicht allgemeinen Videos).
IV-Sum nutzt temporale 3D-Convolutional-Neural-Network-Darstellungen, anstatt der framebasierten Darstellungen, die vorherige ähnliche Arbeiten charakterisieren, und eine Ablationsstudie, die in der Studie detailliert wird, bestätigt, dass alle Komponenten dieses Ansatzes für die Funktionalität des Systems unerlässlich sind.
IV-Sum wurde positiv gegenüber verschiedenen vergleichbaren Frameworks getestet, einschließlich CLIP-It (an dem mehrere der Autoren der Studie auch gearbeitet haben).

IV-Sum erzielt gute Ergebnisse gegenüber vergleichbaren Methoden, möglicherweise aufgrund seines eingeschränkteren Anwendungsbereichs im Vergleich zu allgemeinen Videozusammenfassungsinitiativen. Details zu Metriken und Bewertungsmethoden weiter unten in diesem Artikel.
Methode
Der erste Schritt im Zusammenfassungsprozess besteht darin, ein relativ einfaches, schwach überwachtes Algorithmus zu verwenden, um Pseudozusammenfassungen und frameweise Bedeutungsscores für eine große Anzahl von webgekrabbelten Anleitungsvideos zu erstellen, mit nur einem Aufgabenlabel in jedem Video.
Als nächstes wird ein Anleitungszusammenfassungsnetzwerk auf diesen Daten trainiert. Das System nimmt auto-transkribierte Sprache (z. B. YouTube’s eigene KI-generierte Untertitel für das Video) und das Quellvideo als Eingabe.
Das Netzwerk besteht aus einem Video-Encoder und einem Segment-Scoring-Transformer (SST), und die Ausbildung wird durch die Bedeutungsscores geleitet, die in den Pseudozusammenfassungen zugewiesen werden. Die endgültige Zusammenfassung wird durch Konkatenation von Segmenten erstellt, die einen hohen Bedeutungsscore erreicht haben.
Aus der Studie:
‘Die Hauptintuition hinter unserem Pseudozusammenfassungs-Generierungsprozess ist, dass, wenn man viele Videos einer Aufgabe hat, Schritte, die für die Aufgabe entscheidend sind, wahrscheinlich in mehreren Videos vorkommen (Aufgabenrelevanz).
‘Darüber hinaus ist es, wenn ein Schritt wichtig ist, typischerweise der Fall, dass der Demonstrator über diesen Schritt spricht, entweder vor, während oder nach der Ausführung. Daher werden die Untertitel für das Video, die mit automatischer Spracherkennung (ASR) erhalten werden, wahrscheinlich auf diese Schlüsselschritte verweisen (Cross-Modal-Saliency).’

Um die Pseudozusammenfassung zu generieren, wird das Video zunächst gleichmäßig in Segmente unterteilt, und die Segmente werden basierend auf ihrer visuellen Ähnlichkeit in ‘Schritte’ (verschiedene Farben im Bild oben) gruppiert. Diese Schritte werden dann Bedeutungsscores basierend auf ‘Aufgabenrelevanz’ und ‘Cross-Modal-Saliency’ (d. h. die Korrelation zwischen ASR-Text und Bildern) zugewiesen. Hochbewertete Schritte werden dann ausgewählt, um Stadien in der Pseudozusammenfassung darzustellen.
Das System verwendet Cross-Modal-Saliency, um die Relevanz jedes Schritts zu helfen, indem es die interpretierte Sprache mit den Bildern und Aktionen im Video vergleicht. Dies wird durch die Verwendung eines vorgefertigten Video-Text-Modells erreicht, bei dem jedes Element gemeinsam unter MIL-NCE-Verlust trainiert wird, unter Verwendung eines 3D-CNN-Video-Encoders, der von DeepMind entwickelt wurde.
Ein allgemeiner Bedeutungsscore wird dann aus einem berechneten Durchschnitt dieser Aufgabenrelevanz- und Cross-Modal-Analyse-Stadien erhalten.
Daten
Eine anfängliche Pseudozusammenfassungsdatenbank wurde für den Prozess generiert, die die meisten Inhalte von zwei vorherigen Datenbanken umfasst – COIN, eine 2019 erstellte Sammlung von 11.000 Videos, die 180 Aufgaben betreffen; und Cross-Task, das 4.700 Anleitungsvideos enthält, von denen 3.675 in der Forschung verwendet wurden. Cross-Task umfasst 83 verschiedene Aufgaben.

Oben, Beispiele aus COIN; unten, aus Cross-Task. Quellen, jeweils: https://arxiv.org/pdf/1903.02874.pdf und https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf
Indem die Forscher nur Videos verwendet haben, die in beiden Datenbanken vorkamen, konnten sie so 12.160 Videos über 263 verschiedene Aufgaben und 628,53 Stunden Inhalt für ihre Datenbank erhalten.
Um die WikiHow-basierte Datenbank zu füllen und die Grundwahrheit für das System zu liefern, haben die Autoren WikiHow-Videos für alle langen Anleitungsvideos, zusammen mit ihren Bildern und Video-Clips (d. h. GIFs), die mit jedem Schritt verbunden sind, gekrabbelt. So sollte die Struktur des WikiHow-abgeleiteten Inhalts als Vorlage für die Individuierung von Schritten in dem neuen System dienen.
Merkmale, die durch ResNet50 extrahiert wurden, wurden verwendet, um die ausgewählten Abschnitte des Videos in WikiHow-Bildern zu kreuzköpfen und die Lokalisierung der Schritte durchzuführen. Das am besten geeignete erhaltene Bild innerhalb eines 5-Sekunden-Video-Fensters wurde als Ankerpunkt verwendet.
Diese kürzeren Clips wurden dann zu Videos zusammengestellt, die die Grundwahrheit für die Ausbildung des Modells bilden würden.
Labels wurden jedem Frame im Eingabevideo zugewiesen, um zu deklarieren, ob sie zum Eingabesummary gehörten oder nicht, wobei jedes Video von den Forschern einen framebasierten binären Label und einen durchschnittlichen Summary-Score erhielt, der durch die Bedeutungsscores für alle Frames im Segment erhalten wurde.
Zu diesem Zeitpunkt waren die “Schritte” in jedem Anleitungsvideo nun mit textbasierten Daten verbunden und beschriftet.
Schulung, Tests und Metriken
Die endgültige WikiHow-Datenbank wurde in 1.339 Testvideos und 768 Validierungsvideos unterteilt – eine bemerkenswerte Erhöhung im Vergleich zu der durchschnittlichen Größe von nicht-rohen Datenbanken, die für Videoanalyse verwendet werden.
Die Video- und Text-Encoder im neuen Netzwerk wurden gemeinsam auf einem S3D-Netzwerk mit Gewichten trainiert, die von einem vorgefertigten HowTo100M-Modell unter MIL-NCE-Verlust geladen wurden.
Das Modell wurde mit dem Adam-Optimizer bei einer Lernrate von 0,01 und einem Batch-Size von 24 trainiert, wobei Distributed Data Parallel die Ausbildung über acht NVIDIA RTX 2080 GPUs verteilte, für insgesamt 24 GB verteilter VRAM.
IV-Sum wurde dann mit verschiedenen Szenarien für CLIP-It verglichen, gemäß ähnlichen vorherigen Arbeiten, einschließlich einer Studie über CLIP-It. Die verwendeten Metriken waren Präzision, Recall und F-Score-Werte, über drei unsupervised Baselines (siehe Studie für Details).
Die Ergebnisse sind in dem früheren Bild aufgeführt, aber die Forscher bemerken zusätzlich, dass CLIP-It eine Reihe von möglichen Schritten in verschiedenen Stadien der Tests verpasst, die IV-Sum nicht tut. Sie führen dies darauf zurück, dass CLIP-It mit deutlich kleineren Datenbanken trainiert und entwickelt wurde als der neue WikiHow-Korpus.
Konsequenzen
Der langfristige Wert dieser Forschungsrichtung (die IV-Sum mit der breiteren Herausforderung der Videoanalyse teilt) könnte darin bestehen, Anleitungsvideo-Clips für herkömmliche Suchmaschinen-Indexierung zugänglicher zu machen und die Art von reduktiven “Ausschnitten” für Videos zu ermöglichen, die Google oft aus einem längeren herkömmlichen Artikel extrahiert.
Offensichtlich könnte die Entwicklung von jedem KI-gestützten Prozess, der unsere Verpflichtung, linear und exklusiv auf Video-Inhalte zu achten, reduziert, Konsequenzen für den Reiz des Mediums für eine Generation von Marketingspezialisten haben, für die die Undurchsichtigkeit von Video vielleicht die einzige Möglichkeit war, uns exklusiv zu involvieren.
Da die Lage des “wichtigen” Inhalts schwer zu bestimmen ist, hat Benutzer-Video eine weite (wenn auch zögerliche) Nachsicht von Medienkonsumenten in Bezug auf Produktplatzierung, Sponsoren-Slots und die allgemeine Selbstverherrlichung, in der der Wert des Videos oft verpackt ist, genossen. Projekte wie IV-Sum versprechen, dass sich subtile Aspekte von Video-Inhalten letztendlich von dem, was viele als “Ballast” von In-Content-Werbung und Nicht-Inhalt-Extemporisation betrachten, granular und trennbar machen werden.
Erstveröffentlicht am 16. August 2022. Aktualisiert am 16. August, 14:52 Uhr, entfernte duplizierte Phrase.













