Unghiul lui Anderson
Utilizarea inteligenței artificiale pentru a rezuma videoclipurile lungi “Cum se face”

Dacă sunteți genul de persoană care accelerează viteza unui videoclip de pe YouTube pentru a ajunge la informațiile pe care le doriți; consultați transcrierea videoclipului pentru a obține informațiile esențiale ascunse în timpul de rulare lung și adesea plin de sponsorizări; sau sperați că WikiHow a creat o versiune mai puțin consumatoare de timp a informațiilor din videoclipul instructiv; atunci un nou proiect de la UC Berkeley, Google Research și Brown University poate fi de interes pentru dvs.
Intitulat TL;DW? Rezumarea videoclipurilor instructive cu relevanță pentru sarcină și saliență cross-modală, noul articol descrie crearea unui sistem de rezumare a videoclipurilor asistat de inteligență artificială care poate identifica pașii pertinenți din videoclip și elimina tot restul, rezultând în rezumate concise care ajung rapid la esența problemei.

Exploatarea de către WikiHow a clipurilor video lungi existente atât pentru text, cât și pentru informații video este utilizată de proiectul IV-Sum pentru a genera rezumate false care oferă adevărul de bază pentru a antrena sistemul. Sursă: https://arxiv.org/pdf/2208.06773.pdf
Rezumatele rezultate au o fracțiune din timpul de rulare al videoclipului original, în timp ce informațiile multi-modale (adică textuale) sunt înregistrate și ele în timpul procesului, astfel încât sistemele viitoare ar putea potențial automatiza crearea de articole de blog în stil WikiHow care pot analiza automat un videoclip instructiv lung într-un articol scurt și căutabil, complet cu ilustrații, ceea ce ar putea economisi timp și frustrare.
Noul sistem se numește IV-Sum (‘Rezumator de videoclipuri instructive’), și utilizează algoritmul de recunoaștere a viziunii computerizate ResNet-50, printre alte tehnici, pentru a individua cadre și segmente pertinente ale unui videoclip sursă lung.
Sistemul este antrenat pe pseudo-rezumate generate din structura de conținut a site-ului WikiHow, unde oameni reali folosesc adesea videoclipuri instructive populare într-o formă multimedia plată, textuală, utilizând frecvent clipuri scurte și imagini animate GIF extrase din videoclipurile instructive sursă.
Discutând despre utilizarea de către proiect a rezumatelor WikiHow ca sursă de date de adevăr pentru sistem, autorii afirmă:
‘Fiecare articol de pe site-ul WikiHow Videos conține un videoclip instructiv principal care demonstrează o sarcină care adesea include conținut promoțional, clipuri ale instructorului care vorbește cu camera fără nicio informație vizuală a sarcinii și pași care nu sunt esențiali pentru realizarea sarcinii.
‘Vizualizatorii care doresc o prezentare generală a sarcinii ar prefera un videoclip mai scurt, fără toate informațiile irelevante menționate anterior. Articolele WikiHow (de exemplu, a se vedea Cum se face orez pentru sushi) conțin exact acest lucru: text care conține toți pașii importanți din videoclip, listați împreună cu imagini/clipuri care ilustrează diferitele pași ai sarcinii.’
Baza de date rezultată din acest web-scraping se numește Rezumate WikiHow. Baza de date conține 2.106 de videoclipuri de intrare și rezumatele lor. Acesta este un set de date mai mare decât cel obișnuit disponibil pentru proiectele de rezumare a videoclipurilor, care de obicei necesită etichetare și anotare manuală, un proces care a fost în mare măsură automatizat în lucrarea nouă, datorită sferei mai restrânse a rezumării videoclipurilor instructive (și nu a videoclipurilor generale).
IV-Sum utilizează reprezentări neuronale convolutive tridimensionale temporale, și nu reprezentări bazate pe cadre, care caracterizează lucrările anterioare similare, și un studiu de ablație detaliat în articol confirmă că toate componentele acestei abordări sunt esențiale pentru funcționalitatea sistemului.
IV-Sum a fost testat favorabil împotriva diverselor cadre comparabile, inclusiv CLIP-It (la care mai mulți dintre autorii articolului au lucrat).

IV-Sum obține rezultate bune împotriva metodelor comparabile, posibil datorită sferei sale de aplicare mai restrânse, în comparație cu inițiativele generale de rezumare a videoclipurilor. Detalii despre metrice și metode de notare mai jos în acest articol.
Metodă
Prima etapă în procesul de rezumare implică utilizarea unui algoritm slab supervizat, cu efort relativ scăzut, pentru a crea pseudo-rezumate și scoruri de importanță la nivel de cadru pentru un număr mare de videoclipuri instructive web-scrapate, cu o singură etichetă de sarcină în fiecare videoclip.
Următoarea etapă constă în antrenarea unei rețele de rezumare instructivă pe aceste date. Sistemul ia ca intrare transcrierea automată a vorbirii (de exemplu, subtitlurile generate de inteligență artificială ale YouTube pentru videoclip) și videoclipul sursă.
Rețeaua este compusă dintr-un encoder de videoclip și un transformator de scorare a segmentelor (SST), iar antrenamentul este ghidat de scorurile de importanță atribuite în pseudo-rezumate. Rezumatul final este creat prin concatenarea segmentelor care au obținut un scor de importanță ridicat.
Din articol:
‘Principala intuiție din spatele pipeline-ului nostru de generare a pseudo-rezumatelor este că, dat fiind multe videoclipuri ale unei sarcini, pașii care sunt cruciali pentru sarcină sunt probabil să apară în mai multe videoclipuri (relevanță pentru sarcină).
‘În plus, dacă un pas este important, este tipic ca demonstratorul să vorbească despre acest pas, fie înainte, în timpul sau după efectuarea lui. Prin urmare, subtitlurile pentru videoclipul obținute utilizând recunoașterea automată a vorbirii (ASR) vor face probabil referire la acești pași cheie (saliency cross-modal).’

Pentru a genera pseudo-rezumatul, videoclipul este mai întâi împărțit uniform în segmente, iar segmentele sunt grupate pe baza similarității vizuale în ‘pași’ (culori diferite în imaginea de mai sus). Acești pași sunt apoi atribuiți scoruri de importanță pe baza ‘relevanței pentru sarcină’ și ‘salienței cross-modale’ (adică corelația dintre textul ASR și imagini). Pașii cu scoruri ridicate sunt apoi selectați pentru a reprezenta etape în pseudo-rezumat.
Sistemul utilizează Saliency cross-modală pentru a ajuta la stabilirea relevanței fiecărui pas, prin compararea vorbirii interpretate cu imaginile și acțiunile din videoclip. Acest lucru se realizează prin utilizarea unui model video-text preantrenat, în care fiecare element este antrenat împreună sub pierderea MIL-NCE, utilizând un encoder de videoclip 3D CNN dezvoltat de DeepMind, printre alții.
Un scor de importanță general este obținut apoi dintr-o medie calculată a acestor etape de relevanță pentru sarcină și analiză cross-modală.
Date
O bază de date inițială de pseudo-rezumate a fost generată pentru proces, cuprinzând majoritatea conținutului a două seturi de date anterioare – COIN, un set din 2019 care conține 11.000 de videoclipuri legate de 180 de sarcini; și Cross-Task, care conține 4.700 de videoclipuri instructive, dintre care 3.675 au fost utilizate în cercetare. Cross-Task prezintă 83 de sarcini diferite.

Mai sus, exemple din COIN; mai jos, din Cross-Task. Surse, respectiv: https://arxiv.org/pdf/1903.02874.pdf și https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf
Utilizând videoclipuri care au apărut în ambele seturi de date doar o singură dată, cercetătorii au putut obține astfel 12.160 de videoclipuri care acoperă 263 de sarcini diferite și 628,53 de ore de conținut pentru setul de date lor.
Pentru a popula baza de date bazată pe WikiHow și pentru a oferi adevărul de bază pentru sistem, autorii au extras videoclipuri instructive lungi de pe WikiHow Videos, împreună cu imaginile și clipurile video asociate fiecărui pas. Astfel, structura conținutului derivat de WikiHow a servit ca șablon pentru individuarea pașilor în noul sistem.
Caracteristicile extrase prin ResNet50 au fost utilizate pentru a face corespondența secțiunilor selectate de videoclip în imaginile WikiHow și pentru a efectua localizarea pașilor. Imaginea cea mai similară obținută într-o fereastră de videoclip de 5 secunde a fost utilizată ca punct de ancoră.
Clipurile mai scurte au fost apoi asamblate în videoclipuri care ar constitui adevărul de bază pentru antrenarea modelului.
Etichete au fost atribuite fiecărui cadru din videoclipul de intrare, pentru a declara dacă aparțineau rezumatului de intrare sau nu, fiecărui videoclip primind de la cercetători o etichetă binară la nivel de cadru și un scor de rezumat mediat obținut prin scorurile de importanță pentru toate cadrele din segment.
La acest stadiu, ‘pașii’ din fiecare videoclip instructiv erau acum asociați cu date textuale și etichetați.
Antrenament, Teste și Metrice
Baza de date finală WikiHow a fost împărțită în 1.339 de videoclipuri de test și 768 de videoclipuri de validare – o creștere notabilă față de dimensiunea medie a seturilor de date nebrute dedicate analizei videoclipurilor.
Encoderul de videoclip și text din noua rețea au fost antrenați împreună pe o rețea S3D cu greutăți încărcate dintr-un model HowTo100M preantrenat sub pierderea MIL-NCE.
Modelul a fost antrenat cu optimizerul Adam la o rată de învățare de 0,01, la o dimensiune de batch de 24, cu Distributed Data Parallel care a distribuit antrenamentul pe opt GPU-uri NVIDIA RTX 2080, pentru un total de 24 GB de VRAM distribuit.
IV-Sum a fost apoi comparat cu diverse scenarii pentru CLIP-It, în conformitate cu lucrări anterioare similare, inclusiv un studiu pe CLIP-It. Metricile utilizate au fost valorile Precizie, Recal și F-Score, pe trei linii de bază nesupervizate (a se vedea articolul pentru detalii).
Rezultatele sunt listate în imaginea anterioară, dar cercetătorii notează, de asemenea, că CLIP-It ratează un număr de pași posibili la diverse etape în testele pe care IV-Sum nu le ratează. Ei atribuie acest lucru faptului că CLIP-It a fost antrenat și dezvoltat utilizând seturi de date mult mai mici decât noul corpus WikiHow.
Implicații
Valoarea pe termen lung a acestei direcții de cercetare (pe care IV-Sum o împărtășește cu provocarea mai largă a analizei videoclipurilor) ar putea fi să facă videoclipurile instructive mai accesibile pentru indexarea motoarelor de căutare convenționale și să permită extragerea unor ‘fragment’e de rezultate pentru videoclipuri, așa cum face Google adesea pentru articolele lungi.
Este evident că dezvoltarea oricărui proces asistat de inteligență artificială care reduce obligația noastră de a aplica atenție liniară și exclusivă conținutului videoclipurilor ar putea avea implicații pentru atracția mediului pentru o generație de marketeri pentru care opacitatea videoclipurilor a fost, poate, singurul mod în care se simțeau capabili să ne angajeze în mod exclusiv.
Întrucât localizarea ‘conținutului valoros’ este greu de stabilit, videoclipurile create de utilizatori au beneficiat de o indulgență largă (deși reticentă) din partea consumatorilor de media în ceea ce privește plasarea produselor, sloturile de sponsorizare și auto-promovarea generală în care propunerea de valoare a unui videoclip este adesea încorporată. Proiecte precum IV-Sum promit că, în cele din urmă, sub-facete ale conținutului videoclipurilor vor deveni granulare și separabile de ceea ce mulți consideră a fi ‘balastul’ publicității în conținut și al extemporizării non-conținut.
Publicat pentru prima dată pe 16 august 2022. Actualizat la 14:52 pe 16 august, s-a eliminat fraza duplicat.













