Andersons hoek

Het gebruik van AI om lange ‘How To’-video’s samen te vatten

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Als je het type bent dat de snelheid van een YouTube-instructievideo verhoogt om bij de informatie te komen die je eigenlijk wilt; raadpleeg de transcriptie van de video om de essentiële informatie te verzamelen die verborgen ligt in de lange en vaak sponsor-georiënteerde speeltijden; of hoop dat WikiHow een minder tijdrovende versie van de informatie in de instructievideo heeft gemaakt; dan kan een nieuw project van UC Berkeley, Google Research en Brown University interessant voor je zijn.

Genoemd TL;DW? Samenvatting van instructievideo’s met taakrelevantie en cross-modale opvallendheid, het nieuwe artikel beschrijft de creatie van een AI-geassisteerd videosamenvattingsysteem dat pertinente stappen uit de video kan identificeren en alles anders wegwerpen, resulterend in korte samenvattingen die snel ter zake komen.

WikiHow's exploitatie van bestaande lange videoclips voor zowel tekst als video-informatie wordt door het IV-Sum-project gebruikt om nep-samenvattingen te genereren die de grondwaarheid bieden om het systeem te trainen. Bron: https://arxiv.org/pdf/2208.06773.pdf

WikiHow’s exploitatie van bestaande lange videoclips voor zowel tekst als video-informatie wordt door het IV-Sum-project gebruikt om nep-samenvattingen te genereren die de grondwaarheid bieden om het systeem te trainen. Bron: https://arxiv.org/pdf/2208.06773.pdf

De resulterende samenvattingen hebben een fractie van de oorspronkelijke videospeltime, terwijl multi-modale (d.w.z. tekstgebaseerde) informatie ook tijdens het proces wordt opgenomen, zodat toekomstige systemen mogelijk de creatie van WikiHow-stijl blogposts kunnen automatiseren die in staat zijn om een prolix how-to-video automatisch te parseren in een bondig en doorzoekbaar kort artikel, compleet met illustraties, waardoor mogelijk tijd en frustratie worden bespaard.

Het nieuwe systeem heet IV-Sum (‘Instructievideo Samenvatter’), en gebruikt de open source ResNet-50 computer vision recognition algoritme, onder andere technieken, om pertinente frames en segmenten van een lange bronvideo te individueren.

De conceptuele workflow voor IV-Sum.

De conceptuele workflow voor IV-Sum.

Het systeem is getraind op pseudo-samenvattingen gegenereerd uit de inhoudsstructuur van de WikiHow-website, waar echte mensen vaak populaire instructievideo’s in een minder diepe, tekstgebaseerde multimediavorm omzetten, vaak met korte clips en geanimeerde GIF’s uit broninstructievideo’s.

In het kader van het project wordt de volgende verklaring gegeven over het gebruik van WikiHow-samenvattingen als bron van grondwaarheidsgegevens voor het systeem:

‘Elk artikel op de WikiHow Video’s website bestaat uit een hoofdinstructievideo die een taak demonstreert die vaak promotionele inhoud bevat, clips van de instructeur die tegen de camera spreekt zonder visuele informatie over de taak, en stappen die niet cruciaal zijn voor het uitvoeren van de taak.

‘Kijkers die een overzicht van de taak willen, zouden een kortere video zonder al deze irrelevante informatie prefereren. De WikiHow-artikelen (bijv. zie Hoe maak je sushi-rice) bevatten precies dit: overeenkomstige tekst die alle belangrijke stappen in de video bevat, samen met beelden/clips die de verschillende stappen in de taak illustreren.’

Het resulterende database van deze web scraping wordt WikiHow Samenvattingen genoemd. De database bestaat uit 2.106 invoervideo’s en hun gerelateerde samenvattingen. Dit is een opvallend grotere dataset dan normaal beschikbaar is voor video-samenvattingsprojecten, die meestal dure en arbeidsintensieve handmatige labeling en annotatie vereisen – een proces dat grotendeels geautomatiseerd is in het nieuwe werk, dankzij de meer beperkte reikwijdte van het samenvatten van instructievideo’s (in plaats van algemene video’s).

IV-Sum maakt gebruik van tijdelijke 3D convolutionele neurale netwerkrepresentaties, in plaats van de frame-gebaseerde representaties die kenmerkend zijn voor eerdere soortgelijke werken, en een ablatiestudie die in het artikel wordt beschreven, bevestigt dat alle componenten van deze benadering essentieel zijn voor de functionaliteit van het systeem.

IV-Sum testte gunstig tegenover verschillende vergelijkbare kaders, waaronder CLIP-It (waarvan verschillende auteurs van het artikel ook aan hebben gewerkt).

IV-Sum scoort goed tegen vergelijkbare methoden, mogelijk vanwege de meer beperkte toepassingsgebied, in vergelijking met de algemene video-samenvattingsinitiatieven. Details van metrics en scoringmethoden verderop in dit artikel.

IV-Sum scoort goed tegen vergelijkbare methoden, mogelijk vanwege de meer beperkte toepassingsgebied, in vergelijking met de algemene video-samenvattingsinitiatieven. Details van metrics en scoringmethoden verderop in dit artikel.

Methode

Het eerste stadium in het samenvattingsproces omvat het gebruik van een relatief lage inspanning, zwak toezicht algoritme om pseudo-samenvattingen en frame-wise belangrijkheidsscores te creëren voor een groot aantal web-geëxtraheerde instructievideo’s, met slechts één taaklabel in elke video.

Vervolgens wordt een instructiesamenvattingsnetwerk getraind op deze gegevens. Het systeem neemt auto-getranscribeerde spraak (bijvoorbeeld YouTube’s eigen AI-gegenereerde ondertiteling voor de video) en de bronvideo als invoer.

Het netwerk bestaat uit een video-encoder en een segment scoring transformer (SST), en de training wordt geleid door de belangrijkheidsscores die zijn toegewezen in de pseudo-samenvattingen. De uiteindelijke samenvatting wordt gemaakt door segmenten te concatenen die een hoge belangrijkheidsscore hebben behaald.

Uit het artikel:

‘De belangrijkste intuïtie achter onze pseudo-samenvattingsgeneratiepijplijn is dat, gegeven veel video’s van een taak, stappen die cruciaal zijn voor de taak waarschijnlijk in meerdere video’s zullen verschijnen (taakrelevantie).

‘Bovendien, als een stap belangrijk is, is het typisch voor de demonstrator om over deze stap te spreken, hetzij voor, tijdens of na het uitvoeren ervan. Daarom zullen de ondertitelingen voor de video, gegenereerd met behulp van Automatic Speech Recognition (ASR), waarschijnlijk naar deze belangrijke stappen verwijzen (cross-modale opvallendheid).’

Om de pseudo-samenvatting te genereren, wordt de video eerst uniform verdeeld in segmenten, en de segmenten gegroepeerd op basis van hun visuele gelijkenis in 'stappen' (verschillende kleuren in de afbeelding hierboven). Deze stappen worden vervolgens belangrijkheidsscores toegewezen op basis van 'taakrelevantie' en 'cross-modale opvallendheid' (d.w.z. de correlatie tussen ASR-tekst en afbeeldingen). Hoge scores worden vervolgens geselecteerd om stadia in de pseudo-samenvatting te vertegenwoordigen.

Om de pseudo-samenvatting te genereren, wordt de video eerst uniform verdeeld in segmenten, en de segmenten gegroepeerd op basis van hun visuele gelijkenis in ‘stappen’ (verschillende kleuren in de afbeelding hierboven). Deze stappen worden vervolgens belangrijkheidsscores toegewezen op basis van ‘taakrelevantie’ en ‘cross-modale opvallendheid’ (d.w.z. de correlatie tussen ASR-tekst en afbeeldingen). Hoge scores worden vervolgens geselecteerd om stadia in de pseudo-samenvatting te vertegenwoordigen.

Het systeem gebruikt Cross-Modale Opvallendheid om de relevantie van elke stap te helpen vaststellen, door de geïnterpreteerde spraak te vergelijken met de afbeeldingen en acties in de video. Dit wordt bereikt door het gebruik van een voorgetraind video-tekstmodel waarin elk element gezamenlijk wordt getraind onder MIL-NCE-verlies, met behulp van een 3D CNN-video-encoder ontwikkeld door, onder anderen, DeepMind.

Een algemene belangrijkheidsscore wordt vervolgens verkregen uit een berekende gemiddelde van deze taakrelevantie- en cross-modale analysestadia.

Gegevens

Een initiële pseudo-samenvattingendataset werd gegenereerd voor het proces, bestaande uit de meeste inhoud van twee eerdere datasets – COIN, een set van 2019 met 11.000 video’s gerelateerd aan 180 taken; en Cross-Task, die 4.700 instructievideo’s bevat, waarvan 3.675 in het onderzoek werden gebruikt. Cross-Task heeft 83 verschillende taken.

Boven, voorbeelden uit COIN; onder, uit Cross-Task. Bronnen, respectievelijk: https://arxiv.org/pdf/1903.02874.pdf en https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

Boven, voorbeelden uit COIN; onder, uit Cross-Task. Bronnen, respectievelijk: https://arxiv.org/pdf/1903.02874.pdf en https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

Door video’s te gebruiken die in beide datasets voorkwamen, konden de onderzoekers zo 12.160 video’s verkrijgen die 263 verschillende taken omvatten, en 628,53 uur aan inhoud voor hun dataset.

Om de WikiHow-gebaseerde dataset te bevolken en om de grondwaarheid voor het systeem te bieden, hebben de auteurs WikiHow Video’s gescraped voor alle lange instructievideo’s, samen met hun afbeeldingen en videoclips (d.w.z. GIF’s) die zijn geassocieerd met elke stap. Zo diende de structuur van WikiHow’s afgeleide inhoud als sjabloon voor de individuatie van stappen in het nieuwe systeem.

Kenmerken die zijn geëxtraheerd via ResNet50, werden gebruikt om de geselecteerde secties van de video in WikiHow-afbeeldingen te kruis-matchen en om de lokaliseren van de stappen uit te voeren. De meest gelijkaardige verkregen afbeelding binnen een 5-seconde videovenster werd gebruikt als ankerpunt.

Deze kortere clips werden vervolgens in video’s genaaid die de grondwaarheid voor de training van het model zouden vormen.

Labels werden toegewezen aan elke frame in de invoervideo, om aan te geven of ze tot de invoersamenvatting behoorden of niet, met elk video dat van de onderzoekers een frame-niveau binaire label ontving, en een gemiddelde samenvattingscore die werd verkregen via de belangrijkheidsscores voor alle frames in het segment.

Op dit punt waren de ‘stappen’ in elke instructievideo nu geassocieerd met tekstgebaseerde gegevens en gelabeld.

Training, Tests en Metrics

De definitieve WikiHow-dataset werd verdeeld in 1.339 testvideo’s en 768 validatievideo’s – een opvallende toename ten opzichte van de gemiddelde grootte van niet-ruwe datasets die zijn gewijd aan videoanalyse.

De video- en tekstencoders in het nieuwe netwerk werden gezamenlijk getraind op een S3D netwerk met gewichten geladen van een voorgetraind HowTo100M model onder MIL-NCE-verlies.

Het model werd getraind met de Adam-optimizer met een leer tempo van 0,01 bij een batchgrootte van 24, met Distributed Data Parallel linking die de training verspreidde over acht NVIDIA RTX 2080 GPU’s, voor een totaal van 24 GB aan gedistribueerde VRAM.

IV-Sum werd vervolgens vergeleken met verschillende scenario’s voor CLIP-It in overeenstemming met soortgelijke eerder werken, waaronder een studie over CLIP-It. Metrics die werden gebruikt, waren Precisie-, Recall- en F-Score-waarden, over drie onbegeleide baselines (zie artikel voor details).

De resultaten worden vermeld in de eerdere afbeelding, maar de onderzoekers merken verder op dat CLIP-It een aantal mogelijke stappen op verschillende stadia in de tests mist die IV-Sum niet mist. Zij schrijven dit toe aan het feit dat CLIP-It is getraind en ontwikkeld met aanzienlijk kleinere datasets dan de nieuwe WikiHow-corpus.

Implicaties

De mogelijke langetermijnwaarde van deze onderzoekslijn (die IV-Sum deelt met de bredere uitdaging van videoanalyse) kan zijn om instructievideo’s toegankelijker te maken voor conventionele zoekmachine-indexering en om het soort reductieve in-resultaat ‘snippet’ voor video’s te ermöglichen die Google vaak zal extraheren uit een langer conventioneel artikel.

Het is duidelijk dat de ontwikkeling van enig AI-geassisteerd proces dat onze verplichting om lineaire en exclusieve aandacht te schenken aan video-inhoud vermindert, gevolgen kan hebben voor de aantrekkelijkheid van het medium voor een generatie marketeers voor wie de ondoorzichtigheid van video misschien de enige manier was waarop ze ons exclusief konden betrekken.

Met de locatie van de ‘waardevolle’ inhoud moeilijk te bepalen, heeft gebruikers gegenereerde video een brede (hoewel aarzelende) tolerantie genoten van mediaconsumenten met betrekking tot productplaatsing, sponsorslots en de algemene zelfverheerlijking waarin de waardepropositie van een video zo vaak wordt gecoucht. Projecten zoals IV-Sum houden de belofte in dat subfacetten van video-inhoud uiteindelijk korrelig en scheidelijk zullen worden van wat velen beschouwen als de ‘ballast’ van in-houdsadvertenties en niet-inhouds improvisatie.

 

First published 16th augustus 2022. Bijgewerkt op 2.52pm 16th August, removed duplicate phrase.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai