Andersons vinkel

Brug af AI til at sammenfatte lange ‘How To’-videoer

mm
Føj Unite.AI til dine foretrukne kilder på Google

Hvis du er den type, der øger hastigheden på en YouTube-“how-to”-video for at komme til den information, du faktisk ønsker; konsulterer videoens transskript for at få den væsentlige information, der er skjult i de lange og ofte sponsorbelagte kørsler; eller håber, at WikiHow har lavet en mindre tidskrævende version af informationen i den instruktionsvideo, så kan et nyt projekt fra UC Berkeley, Google Research og Brown University være af interesse for dig.

Projektet har titlen TL;DW? Summarizing Instructional Videos with Task Relevance & Cross-Modal Saliency, og den nye artikel beskriver udviklingen af et AI-baseret video-sammenfatningssystem, der kan identificere relevante trin fra videoen og kassere alt andet, hvilket resulterer i korte sammenfatninger, der hurtigt kommer til sagen.

WikiHow's udnyttelse af eksisterende lange videooptagelser til både tekst og videoinformation bruges af IV-Sum-projektet til at generere falske sammenfatninger, der giver grundsandhed til at træne systemet. Kilde: https://arxiv.org/pdf/2208.06773.pdf

WikiHow’s udnyttelse af eksisterende lange videooptagelser til både tekst og videoinformation bruges af IV-Sum-projektet til at generere falske sammenfatninger, der giver grundsandhed til at træne systemet. Kilde: https://arxiv.org/pdf/2208.06773.pdf

De resulterende sammenfatninger har en brøkdel af den oprindelige video’s køretid, mens multimodale (dvs. tekstbaserede) oplysninger også optages under processen, så fremtidige systemer potentielt kan automatisere oprettelsen af WikiHow-lignende blogindlæg, der kan parse en prolix “how-to”-video til en kort og søgbart artikel, komplet med illustrationer, hvilket potentielt kan spare tid og frustration.

Det nye system kaldes IV-Sum (‘Instructional Video Summarizer’), og bruger det åbne ResNet-50 computer vision recognition-algoritme, blandt andre teknikker, til at individuere relevante rammer og segmenter af en længere kildevideo.

Det konceptuelle arbejdsgang for IV-Sum.

Det konceptuelle arbejdsgang for IV-Sum.

Systemet er trænet på pseudo-sammenfatninger genereret fra indholdsstrukturen på WikiHow-webstedet, hvor rigtige mennesker ofte udnytter populære instruktionsvideoer til en fladere, tekstbaseret multimedieform, ofte ved hjælp af korte klip og animerede GIF’er taget fra kilde-instruktionsvideoer.

Ved at diskutere projektets brug af WikiHow-sammenfatninger som kilde til grundsandhedsdata for systemet, skriver forfatterne:

‘Hvert artikel på WikiHow Videos-webstedet består af en hovedinstruktionsvideo, der demonstrerer en opgave, der ofte inkluderer reklameindhold, klip af instruktøren, der taler til kameraet uden visuel information om opgaven, og trin, der ikke er afgørende for opgaven.

‘Seere, der ønsker en oversigt over opgaven, ville foretrække en kortere video uden alt det ovennævnte irrelevante information. WikiHow-artiklerne (f.eks. se How to Make Sushi Rice) indeholder netop dette: tilhørende tekst, der indeholder alle vigtige trin i videoen, listede med tilhørende billeder/klip, der illustrerer de forskellige trin i opgaven.’

Det resulterende database fra denne web-skrapning kaldes WikiHow Summaries. Databasen består af 2.106 inputvideoer og deres relaterede sammenfatninger. Dette er en bemærkelsesværdigt større størrelse af dataset end normalt er tilgængeligt for video-sammenfatningsprojekter, der normalt kræver dyre og arbejdskrævende manuel mærkning og annotation – en proces, der i stor udstrækning er automatiseret i det nye arbejde, takket være den mere begrænsede omfang af at sammenfatte instruktionsvideoer (i stedet for generelle videoer).

IV-Sum udnytter tidsmæssige 3D convolutionelle neurale netværksrepræsentationer, i stedet for de rammebaserede repræsentationer, der kendetegner tidligere lignende arbejder, og en ablationsstudie, der er beskrevet i artiklen, bekræfter, at alle komponenterne i denne tilgang er essentielle for systemets funktionalitet.

IV-Sum testede positivt mod forskellige sammenlignelige rammer, herunder CLIP-It (som flere af artiklens forfattere også arbejdede på).

IV-Sum scorer godt mod sammenlignelige metoder, muligvis på grund af dens mere begrænsede anvendelsesområde, i sammenligning med den generelle række af video-sammenfatningsinitiativer. Detaljer om metrikker og scoremetoder længere nede i denne artikel.

IV-Sum scorer godt mod sammenlignelige metoder, muligvis på grund af dens mere begrænsede anvendelsesområde, i sammenligning med den generelle række af video-sammenfatningsinitiativer. Detaljer om metrikker og scoremetoder længere nede i denne artikel.

Metode

Den første fase i sammenfatningsprocessen indebærer brug af en relativt lav-anstrengende, svagt-overvåget algoritme til at oprette pseudo-sammenfatninger og rammevis vigtighedsscore for et stort antal web-skrapede instruktionsvideoer, med kun ét enkelt opgavelabel i hver video.

Derefter trænes et instruktions-sammenfatningsnetværk på denne data. Systemet tager auto-transkriberet tale (f.eks. YouTubes eget AI-genererede undertekster til videoen) og kildevideoen som input.

Netværket består af en video-encoder og en segment-scoring-transformer (SST), og træningen guidet af vigtighedsscorene tildelt i pseudo-sammenfatningerne. Den endelige sammenfatning oprettes ved at konkatenerere segmenter, der opnåede en høj vigtighedsscore.

Fra artiklen:

‘Den primære intuition bag vores pseudo-sammenfatnings-genereringspipeline er, at givet mange videoer af en opgave, trin, der er afgørende for opgaven, er sandsynligvis til stede på tværs af multiple videoer (opgave-relevans).

‘Desuden, hvis et trin er vigtigt, er det typisk for demonstratoren at tale om dette trin enten før, under eller efter udførelse af det. Derfor vil underteksterne for videoen, der er opnået ved hjælp af automatisk talegenkendelse (ASR), sandsynligvis reference disse nøgletrin (cross-modale saliency).’

Til at generere pseudo-sammenfatningen, partitioneres videoen først jævnt i segmenter, og segmenterne grupperes baseret på deres visuelle lighed i 'trin' (forskellige farver i billedet ovenfor). Disse trin tildeles derefter vigtighedsscore baseret på 'opgave-relevans' og 'cross-modale saliency' (dvs. korrelationen mellem ASR-tekst og billeder). Højtscorende trin vælges derefter til at repræsentere stadier i pseudo-sammenfatningen.

Til at generere pseudo-sammenfatningen, partitioneres videoen først jævnt i segmenter, og segmenterne grupperes baseret på deres visuelle lighed i ‘trin’ (forskellige farver i billedet ovenfor). Disse trin tildeles derefter vigtighedsscore baseret på ‘opgave-relevans’ og ‘cross-modale saliency’ (dvs. korrelationen mellem ASR-tekst og billeder). Højtscorende trin vælges derefter til at repræsentere stadier i pseudo-sammenfatningen.

Systemet bruger Cross-Modal Saliency til at hjælpe med at etablere relevansen af hvert trin, ved at sammenligne den fortolkede tale med billeder og handlinger i videoen. Dette opnås ved hjælp af et forudtrænet video-tekst-model, hvor hvert element er trænet sammen under MIL-NCE-tab, ved hjælp af en 3D CNN video-encoder udviklet af, blandt andre, DeepMind.

En generel vigtighedsscore opnås derefter fra en beregnet gennemsnit af disse opgave-relevans- og cross-modale analysefaser.

Data

En initial pseudo-sammenfatnings-dataset blev genereret til processen, bestående af det meste af indholdet af to tidligere datasets – COIN, en 2019-samling indeholdende 11.000 videoer relateret til 180 opgaver; og Cross-Task, som indeholder 4.700 instruktionsvideoer, hvoraf 3.675 blev brugt i forskningen. Cross-Task indeholder 83 forskellige opgaver.

Ovenfor, eksempler fra COIN; nedenfor, fra Cross-Task. Kilder, henholdsvis: https://arxiv.org/pdf/1903.02874.pdf og https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

Ovenfor, eksempler fra COIN; nedenfor, fra Cross-Task. Kilder, henholdsvis: https://arxiv.org/pdf/1903.02874.pdf og https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

Ved at bruge videoer, der kun var med i begge datasets én gang, kunne forskerne således opnå 12.160 videoer, der dækkede 263 forskellige opgaver, og 628,53 timers indhold til deres dataset.

Til at befolke WikiHow-baseret dataset og til at give grundsandheden for systemet, skrabede forfatterne WikiHow Videos for alle lange instruktionsvideoer, sammen med deres billeder og video-klip (dvs. GIF’er) associeret med hvert trin. Således skulle strukturen af WikiHow’s afledte indhold fungere som en skabelon for individuationen af trin i det nye system.

Funktioner, der blev udtrukket via ResNet50, blev brugt til at krydsmatche de udvalgte dele af videoen i WikiHow-billeder og til at udføre lokalisation af trinnene. Det mest lignende opnåede billede inden for en 5-sekunders video-vindue blev brugt som ankerpunktet.

Disse kortere klip blev derefter syet sammen til videoer, der ville udgøre grundsandheden for træningen af modellen.

Mærker blev tildelt til hver ramme i input-videoen for at erklære, om de tilhørte input-sammenfatningen eller ej, og hver video modtog fra forskerne en ramme-niveau binær mærke og en gennemsnitlig sammenfatningsscore, der blev opnået via vigtighedsscorene for alle rammer i segmentet.

På dette stadium var ‘trinene’ i hver instruktionsvideo nu associeret med tekstbaserede data og mærket.

Træning, Tests og Metrikker

Den endelige WikiHow-dataset blev inddelt i 1.339 testvideoer og 768 valideringsvideoer – en bemærkelsesværdig øgning i forhold til den gennemsnitlige størrelse af ikke-raw-datasets til videoanalyse.

Video- og tekst-encoderne i det nye netværk blev trænet sammen på et S3D netværk med vægte lastet fra et forudtrænet HowTo100M model under MIL-NCE-tab.

Modellen blev trænet med Adam-optimizeren ved en læringsrate på 0,01 og en batch-størrelse på 24, med Distributed Data Parallel linking, der spreder træningen over otte NVIDIA RTX 2080 GPU’er, for i alt 24 GB distribueret VRAM.

IV-Sum blev derefter sammenlignet med forskellige scenarier for CLIP-It i overensstemmelse med lignende tidligere arbejder, herunder en studie om CLIP-It. Metrikkerne, der blev brugt, var Præcision, Genkald og F-Score-værdier på tværs af tre usupervisede baseline (se artiklen for detaljer).

Resultaterne er nævnt i det tidligere billede, men forskerne bemærker desuden, at CLIP-It mangler en række mulige trin på forskellige stadier i testene, som IV-Sum ikke gør. De tilskriver dette til, at CLIP-It er blevet trænet og udviklet ved hjælp af bemærkelsesværdigt mindre datasets end det nye WikiHow-korpus.

Implikationer

Den langsigtede værdi af denne type forskning (som IV-Sum deler med den bredere udfordring i videoanalyse) kunne være at gøre instruktionsvideo-klip mere tilgængelige for konventionel søgemaskine-indeksering og at muliggøre den type reductive ‘snippet’ for videoer, som Google ofte ekstraherer fra en længere konventionel artikel.

Det er åbenlyst, at udviklingen af enhver AI-baseret proces, der reducerer vores forpligtelse til at anvende lineær og eksklusiv opmærksomhed på videoindhold, kunne have ramifikationer for appel til en generation af markedsførere, for hvem videoens uigennemsigtighed måske var den eneste måde, de følte, de kunne eksklusivt engagere os.

Med lokalisationen af ‘værdifuld’ indhold svær at fastslå, har bruger-genereret video nydt en bred (omend uvillig) tolerance fra medieforbrugere i forhold til produktplacering, sponsorpladser og den generelle selvforherligelse, hvori en videos værdiproposition ofte er omgivet. Projekter som IV-Sum holder løftet om, at underfacetter af videoindhold vil blive granulære og adskilte fra, hvad mange betragter som ‘ballast’ af in-content-reklame og ikke-indholdsekstemporisation.

 

Offentliggjort første gang den 16. august 2022. Opdateret kl. 14:52 den 16. august, fjernet duplikeret frase.

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai