Andersons vinkel

Brug af AI til at sammenfatte lange ‘How To’-videoer

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Hvis du er den type, der Ãļger hastigheden pÃĨ en YouTube-“how-to”-video for at komme til den information, du faktisk Ãļnsker; konsulterer videoens transskript for at fÃĨ den vÃĶsentlige information, der er skjult i de lange og ofte sponsorbelagte kÃļrsler; eller hÃĨber, at WikiHow har lavet en mindre tidskrÃĶvende version af informationen i den instruktionsvideo, sÃĨ kan et nyt projekt fra UC Berkeley, Google Research og Brown University vÃĶre af interesse for dig.

Projektet har titlen TL;DW? Summarizing Instructional Videos with Task Relevance & Cross-Modal Saliency, og den nye artikel beskriver udviklingen af et AI-baseret video-sammenfatningssystem, der kan identificere relevante trin fra videoen og kassere alt andet, hvilket resulterer i korte sammenfatninger, der hurtigt kommer til sagen.

WikiHow's udnyttelse af eksisterende lange videooptagelser til bÃĨde tekst og videoinformation bruges af IV-Sum-projektet til at generere falske sammenfatninger, der giver grundsandhed til at trÃĶne systemet. Kilde: https://arxiv.org/pdf/2208.06773.pdf

WikiHow’s udnyttelse af eksisterende lange videooptagelser til bÃĨde tekst og videoinformation bruges af IV-Sum-projektet til at generere falske sammenfatninger, der giver grundsandhed til at trÃĶne systemet. Kilde: https://arxiv.org/pdf/2208.06773.pdf

De resulterende sammenfatninger har en brÃļkdel af den oprindelige video’s kÃļretid, mens multimodale (dvs. tekstbaserede) oplysninger ogsÃĨ optages under processen, sÃĨ fremtidige systemer potentielt kan automatisere oprettelsen af WikiHow-lignende blogindlÃĶg, der kan parse en prolix “how-to”-video til en kort og sÃļgbart artikel, komplet med illustrationer, hvilket potentielt kan spare tid og frustration.

Det nye system kaldes IV-Sum (‘Instructional Video Summarizer’), og bruger det ÃĨbne ResNet-50 computer vision recognition-algoritme, blandt andre teknikker, til at individuere relevante rammer og segmenter af en lÃĶngere kildevideo.

Det konceptuelle arbejdsgang for IV-Sum.

Det konceptuelle arbejdsgang for IV-Sum.

Systemet er trÃĶnet pÃĨ pseudo-sammenfatninger genereret fra indholdsstrukturen pÃĨ WikiHow-webstedet, hvor rigtige mennesker ofte udnytter populÃĶre instruktionsvideoer til en fladere, tekstbaseret multimedieform, ofte ved hjÃĶlp af korte klip og animerede GIF’er taget fra kilde-instruktionsvideoer.

Ved at diskutere projektets brug af WikiHow-sammenfatninger som kilde til grundsandhedsdata for systemet, skriver forfatterne:

‘Hvert artikel pÃĨ WikiHow Videos-webstedet bestÃĨr af en hovedinstruktionsvideo, der demonstrerer en opgave, der ofte inkluderer reklameindhold, klip af instruktÃļren, der taler til kameraet uden visuel information om opgaven, og trin, der ikke er afgÃļrende for opgaven.

‘Seere, der Ãļnsker en oversigt over opgaven, ville foretrÃĶkke en kortere video uden alt det ovennÃĶvnte irrelevante information. WikiHow-artiklerne (f.eks. se How to Make Sushi Rice) indeholder netop dette: tilhÃļrende tekst, der indeholder alle vigtige trin i videoen, listede med tilhÃļrende billeder/klip, der illustrerer de forskellige trin i opgaven.’

Det resulterende database fra denne web-skrapning kaldes WikiHow Summaries. Databasen bestÃĨr af 2.106 inputvideoer og deres relaterede sammenfatninger. Dette er en bemÃĶrkelsesvÃĶrdigt stÃļrre stÃļrrelse af dataset end normalt er tilgÃĶngeligt for video-sammenfatningsprojekter, der normalt krÃĶver dyre og arbejdskrÃĶvende manuel mÃĶrkning og annotation – en proces, der i stor udstrÃĶkning er automatiseret i det nye arbejde, takket vÃĶre den mere begrÃĶnsede omfang af at sammenfatte instruktionsvideoer (i stedet for generelle videoer).

IV-Sum udnytter tidsmÃĶssige 3D convolutionelle neurale netvÃĶrksreprÃĶsentationer, i stedet for de rammebaserede reprÃĶsentationer, der kendetegner tidligere lignende arbejder, og en ablationsstudie, der er beskrevet i artiklen, bekrÃĶfter, at alle komponenterne i denne tilgang er essentielle for systemets funktionalitet.

IV-Sum testede positivt mod forskellige sammenlignelige rammer, herunder CLIP-It (som flere af artiklens forfattere ogsÃĨ arbejdede pÃĨ).

IV-Sum scorer godt mod sammenlignelige metoder, muligvis pÃĨ grund af dens mere begrÃĶnsede anvendelsesomrÃĨde, i sammenligning med den generelle rÃĶkke af video-sammenfatningsinitiativer. Detaljer om metrikker og scoremetoder lÃĶngere nede i denne artikel.

IV-Sum scorer godt mod sammenlignelige metoder, muligvis pÃĨ grund af dens mere begrÃĶnsede anvendelsesomrÃĨde, i sammenligning med den generelle rÃĶkke af video-sammenfatningsinitiativer. Detaljer om metrikker og scoremetoder lÃĶngere nede i denne artikel.

Metode

Den fÃļrste fase i sammenfatningsprocessen indebÃĶrer brug af en relativt lav-anstrengende, svagt-overvÃĨget algoritme til at oprette pseudo-sammenfatninger og rammevis vigtighedsscore for et stort antal web-skrapede instruktionsvideoer, med kun ÃĐt enkelt opgavelabel i hver video.

Derefter trÃĶnes et instruktions-sammenfatningsnetvÃĶrk pÃĨ denne data. Systemet tager auto-transkriberet tale (f.eks. YouTubes eget AI-genererede undertekster til videoen) og kildevideoen som input.

NetvÃĶrket bestÃĨr af en video-encoder og en segment-scoring-transformer (SST), og trÃĶningen guidet af vigtighedsscorene tildelt i pseudo-sammenfatningerne. Den endelige sammenfatning oprettes ved at konkatenerere segmenter, der opnÃĨede en hÃļj vigtighedsscore.

Fra artiklen:

‘Den primÃĶre intuition bag vores pseudo-sammenfatnings-genereringspipeline er, at givet mange videoer af en opgave, trin, der er afgÃļrende for opgaven, er sandsynligvis til stede pÃĨ tvÃĶrs af multiple videoer (opgave-relevans).

‘Desuden, hvis et trin er vigtigt, er det typisk for demonstratoren at tale om dette trin enten fÃļr, under eller efter udfÃļrelse af det. Derfor vil underteksterne for videoen, der er opnÃĨet ved hjÃĶlp af automatisk talegenkendelse (ASR), sandsynligvis reference disse nÃļgletrin (cross-modale saliency).’

Til at generere pseudo-sammenfatningen, partitioneres videoen fÃļrst jÃĶvnt i segmenter, og segmenterne grupperes baseret pÃĨ deres visuelle lighed i 'trin' (forskellige farver i billedet ovenfor). Disse trin tildeles derefter vigtighedsscore baseret pÃĨ 'opgave-relevans' og 'cross-modale saliency' (dvs. korrelationen mellem ASR-tekst og billeder). HÃļjtscorende trin vÃĶlges derefter til at reprÃĶsentere stadier i pseudo-sammenfatningen.

Til at generere pseudo-sammenfatningen, partitioneres videoen fÃļrst jÃĶvnt i segmenter, og segmenterne grupperes baseret pÃĨ deres visuelle lighed i ‘trin’ (forskellige farver i billedet ovenfor). Disse trin tildeles derefter vigtighedsscore baseret pÃĨ ‘opgave-relevans’ og ‘cross-modale saliency’ (dvs. korrelationen mellem ASR-tekst og billeder). HÃļjtscorende trin vÃĶlges derefter til at reprÃĶsentere stadier i pseudo-sammenfatningen.

Systemet bruger Cross-Modal Saliency til at hjÃĶlpe med at etablere relevansen af hvert trin, ved at sammenligne den fortolkede tale med billeder og handlinger i videoen. Dette opnÃĨs ved hjÃĶlp af et forudtrÃĶnet video-tekst-model, hvor hvert element er trÃĶnet sammen under MIL-NCE-tab, ved hjÃĶlp af en 3D CNN video-encoder udviklet af, blandt andre, DeepMind.

En generel vigtighedsscore opnÃĨs derefter fra en beregnet gennemsnit af disse opgave-relevans- og cross-modale analysefaser.

Data

En initial pseudo-sammenfatnings-dataset blev genereret til processen, bestÃĨende af det meste af indholdet af to tidligere datasets – COIN, en 2019-samling indeholdende 11.000 videoer relateret til 180 opgaver; og Cross-Task, som indeholder 4.700 instruktionsvideoer, hvoraf 3.675 blev brugt i forskningen. Cross-Task indeholder 83 forskellige opgaver.

Ovenfor, eksempler fra COIN; nedenfor, fra Cross-Task. Kilder, henholdsvis: https://arxiv.org/pdf/1903.02874.pdf og https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

Ovenfor, eksempler fra COIN; nedenfor, fra Cross-Task. Kilder, henholdsvis: https://arxiv.org/pdf/1903.02874.pdf og https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

Ved at bruge videoer, der kun var med i begge datasets ÃĐn gang, kunne forskerne sÃĨledes opnÃĨ 12.160 videoer, der dÃĶkkede 263 forskellige opgaver, og 628,53 timers indhold til deres dataset.

Til at befolke WikiHow-baseret dataset og til at give grundsandheden for systemet, skrabede forfatterne WikiHow Videos for alle lange instruktionsvideoer, sammen med deres billeder og video-klip (dvs. GIF’er) associeret med hvert trin. SÃĨledes skulle strukturen af WikiHow’s afledte indhold fungere som en skabelon for individuationen af trin i det nye system.

Funktioner, der blev udtrukket via ResNet50, blev brugt til at krydsmatche de udvalgte dele af videoen i WikiHow-billeder og til at udfÃļre lokalisation af trinnene. Det mest lignende opnÃĨede billede inden for en 5-sekunders video-vindue blev brugt som ankerpunktet.

Disse kortere klip blev derefter syet sammen til videoer, der ville udgÃļre grundsandheden for trÃĶningen af modellen.

MÃĶrker blev tildelt til hver ramme i input-videoen for at erklÃĶre, om de tilhÃļrte input-sammenfatningen eller ej, og hver video modtog fra forskerne en ramme-niveau binÃĶr mÃĶrke og en gennemsnitlig sammenfatningsscore, der blev opnÃĨet via vigtighedsscorene for alle rammer i segmentet.

PÃĨ dette stadium var ‘trinene’ i hver instruktionsvideo nu associeret med tekstbaserede data og mÃĶrket.

TrÃĶning, Tests og Metrikker

Den endelige WikiHow-dataset blev inddelt i 1.339 testvideoer og 768 valideringsvideoer – en bemÃĶrkelsesvÃĶrdig Ãļgning i forhold til den gennemsnitlige stÃļrrelse af ikke-raw-datasets til videoanalyse.

Video- og tekst-encoderne i det nye netvÃĶrk blev trÃĶnet sammen pÃĨ et S3D netvÃĶrk med vÃĶgte lastet fra et forudtrÃĶnet HowTo100M model under MIL-NCE-tab.

Modellen blev trÃĶnet med Adam-optimizeren ved en lÃĶringsrate pÃĨ 0,01 og en batch-stÃļrrelse pÃĨ 24, med Distributed Data Parallel linking, der spreder trÃĶningen over otte NVIDIA RTX 2080 GPU’er, for i alt 24 GB distribueret VRAM.

IV-Sum blev derefter sammenlignet med forskellige scenarier for CLIP-It i overensstemmelse med lignende tidligere arbejder, herunder en studie om CLIP-It. Metrikkerne, der blev brugt, var PrÃĶcision, Genkald og F-Score-vÃĶrdier pÃĨ tvÃĶrs af tre usupervisede baseline (se artiklen for detaljer).

Resultaterne er nÃĶvnt i det tidligere billede, men forskerne bemÃĶrker desuden, at CLIP-It mangler en rÃĶkke mulige trin pÃĨ forskellige stadier i testene, som IV-Sum ikke gÃļr. De tilskriver dette til, at CLIP-It er blevet trÃĶnet og udviklet ved hjÃĶlp af bemÃĶrkelsesvÃĶrdigt mindre datasets end det nye WikiHow-korpus.

Implikationer

Den langsigtede vÃĶrdi af denne type forskning (som IV-Sum deler med den bredere udfordring i videoanalyse) kunne vÃĶre at gÃļre instruktionsvideo-klip mere tilgÃĶngelige for konventionel sÃļgemaskine-indeksering og at muliggÃļre den type reductive ‘snippet’ for videoer, som Google ofte ekstraherer fra en lÃĶngere konventionel artikel.

Det er ÃĨbenlyst, at udviklingen af enhver AI-baseret proces, der reducerer vores forpligtelse til at anvende lineÃĶr og eksklusiv opmÃĶrksomhed pÃĨ videoindhold, kunne have ramifikationer for appel til en generation af markedsfÃļrere, for hvem videoens uigennemsigtighed mÃĨske var den eneste mÃĨde, de fÃļlte, de kunne eksklusivt engagere os.

Med lokalisationen af ‘vÃĶrdifuld’ indhold svÃĶr at fastslÃĨ, har bruger-genereret video nydt en bred (omend uvillig) tolerance fra medieforbrugere i forhold til produktplacering, sponsorpladser og den generelle selvforherligelse, hvori en videos vÃĶrdiproposition ofte er omgivet. Projekter som IV-Sum holder lÃļftet om, at underfacetter af videoindhold vil blive granulÃĶre og adskilte fra, hvad mange betragter som ‘ballast’ af in-content-reklame og ikke-indholdsekstemporisation.

 

Offentliggjort fÃļrste gang den 16. august 2022. Opdateret kl. 14:52 den 16. august, fjernet duplikeret frase.

Forfatter til maskinlÃĶringsartikler, domÃĶneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold pÃĨ Metaphysic.ai, indtil oplÃļsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]