Angolo di Anderson
Utilizzare l’AI per riassumere lunghi video “Come fare”

Se sei il tipo di persona che aumenta la velocità di un video tutorial di YouTube per ottenere le informazioni che desideri; consulta la trascrizione del video per ottenere le informazioni essenziali nascoste nella lunga e spesso sponsorizzata durata; o spera che WikiHow abbia creato una versione meno lunga e più concisa delle informazioni presenti nel video istruzionale; allora un nuovo progetto dell’Università di Berkeley, Google Research e Brown University potrebbe essere di tuo interesse.
Intitolato TL;DW? Riassumere video istruzionali con rilevanza delle attività e salienza cross-modale, il nuovo articolo descrive la creazione di un sistema di riassunto di video aiutato dall’AI che può identificare i passaggi pertinenti del video e scartare tutto il resto, risultando in riassunti brevi che arrivano rapidamente al punto.

L’utilizzo di WikiHow di clip video esistenti a lungo per entrambe le informazioni testuali e video è utilizzato dal progetto IV-Sum per generare riassunti finti che forniscono la verità di base per addestrare il sistema. Fonte: https://arxiv.org/pdf/2208.06773.pdf
I riassunti risultanti hanno una frazione della durata originale del video, mentre le informazioni multi-modalità (ad esempio, basate sul testo) vengono registrate durante il processo in modo che i sistemi futuri possano potenzialmente automatizzare la creazione di post di blog nello stile di WikiHow in grado di analizzare automaticamente un video istruzionale prolisso in un articolo breve e ricercabile, completo di illustrazioni, potenzialmente risparmiando tempo e frustrazione.
Il nuovo sistema si chiama IV-Sum (‘Riassuntore di video istruzionali’), e utilizza l’algoritmo di riconoscimento di visione computerizzata open source ResNet-50, tra altre tecniche, per individuare i frame e i segmenti pertinenti di un video sorgente lungo.
Il sistema è addestrato su pseudo-riassunti generati dalla struttura del contenuto del sito web di WikiHow, dove le persone reali spesso utilizzano video istruzionali popolari per creare una forma multimediale più piatta e basata sul testo, utilizzando frequentemente clip brevi e GIF animate prese da video istruzionali sorgente.
Discutendo l’utilizzo del progetto di riassunti di WikiHow come fonte di dati di verità per il sistema, gli autori affermano:
‘Ogni articolo sul sito web WikiHow Video consiste in un video istruzionale principale che dimostra una attività che spesso include contenuto promozionale, clip dell’istruttore che parla alla telecamera senza informazioni visive dell’attività e passaggi che non sono cruciali per l’esecuzione dell’attività.
‘Gli spettatori che desiderano una panoramica dell’attività preferirebbero un video più breve senza tutte le informazioni irrilevanti sopra menzionate. Gli articoli di WikiHow (ad esempio, vedi Come fare il riso per sushi) contengono proprio questo: testo che contiene tutti i passaggi importanti nel video elencati con immagini/clip che illustrano i vari passaggi nell’attività.’
Il database risultante da questo web-scraping si chiama Riassunti di WikiHow. Il database consiste in 2.106 video di input e relative somme. Questo è un dataset notevolmente più grande di quanto sia comunemente disponibile per progetti di riassunto di video, che normalmente richiedono un’etichettatura e un’annotazione manuali costose e laboriose – un processo che è stato in gran parte automatizzato nel nuovo lavoro, grazie all’ambito più ristretto di riassunto di video istruzionali (piuttosto che generali).
IV-Sum sfrutta le rappresentazioni di reti neurali convoluzionali 3D temporali, piuttosto che le rappresentazioni basate su frame che caratterizzano lavori simili precedenti, e uno studio di ablazione dettagliato nel documento conferma che tutti i componenti di questo approccio sono essenziali per la funzionalità del sistema.
IV-Sum è stato testato con successo contro vari framework comparabili, tra cui CLIP-It (su cui alcuni degli autori del documento hanno anche lavorato).

IV-Sum ottiene buoni risultati contro metodi comparabili, forse a causa del suo ambito di applicazione più ristretto, in confronto con la generale gamma di iniziative di riassunto di video. Dettagli sui metriche e metodi di punteggio più avanti in questo articolo.
Metodo
La prima fase del processo di riassunto consiste nell’utilizzare un algoritmo debolmente supervisionato a basso sforzo per creare pseudo-riassunti e punteggi di importanza dei frame per un gran numero di video istruzionali web-scraped, con un solo label di attività in ogni video.
Successivamente, una rete di riassunto istruzionale viene addestrata su questi dati. Il sistema prende in input la trascrizione automatica del discorso (ad esempio, i sottotitoli generati dall’AI di YouTube per il video) e il video sorgente.
La rete comprende un encoder video e un trasformatore di punteggio dei segmenti (SST), e l’addestramento è guidato dai punteggi di importanza assegnati nei pseudo-riassunti. Il riassunto finale viene creato concatenando i segmenti che hanno ottenuto un punteggio di importanza alto.
Dal documento:
‘L’intuizione principale dietro la nostra pipeline di generazione di pseudo-riassunti è che, dato molti video di un’attività, i passaggi cruciali per l’attività sono probabilmente presenti in più video (rilevanza dell’attività).
‘Inoltre, se un passaggio è importante, è tipico che il dimostratore parli di questo passaggio prima, durante o dopo averlo eseguito. Pertanto, i sottotitoli del video ottenuti utilizzando il riconoscimento automatico del discorso (ASR) probabilmente faranno riferimento a questi passaggi chiave (salienza cross-modale).’

Per generare il pseudo-riassunto, il video viene prima suddiviso uniformemente in segmenti, e i segmenti vengono raggruppati in base alla loro somiglianza visiva in ‘passaggi’ (colori diversi nell’immagine sopra). Questi passaggi vengono quindi assegnati punteggi di importanza in base alla ‘rilevanza dell’attività’ e alla ‘salienza cross-modale’ (ad esempio, la correlazione tra il testo ASR e le immagini). I passaggi con punteggio alto vengono quindi selezionati per rappresentare le fasi del pseudo-riassunto.
Il sistema utilizza la salienza cross-modale per aiutare a stabilire la rilevanza di ogni passaggio, confrontando il discorso interpretato con le immagini e le azioni nel video. Ciò viene realizzato utilizzando un modello video-testo pre-addestrato in cui ogni elemento è addestrato congiuntamente sotto la perdita MIL-NCE, utilizzando un encoder video 3D CNN sviluppato, tra gli altri, da DeepMind.
Un punteggio di importanza generale viene quindi ottenuto da una media calcolata di queste fasi di rilevanza dell’attività e di analisi cross-modale.
Dati
Un dataset iniziale di pseudo-riassunti è stato generato per il processo, comprendente la maggior parte del contenuto di due dataset precedenti – COIN, un set del 2019 contenente 11.000 video relativi a 180 attività; e Cross-Task, che contiene 4.700 video istruzionali, di cui 3.675 sono stati utilizzati nella ricerca. Cross-Task presenta 83 diverse attività.

Sopra, esempi da COIN; sotto, da Cross-Task. Fonti, rispettivamente: https://arxiv.org/pdf/1903.02874.pdf e https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf
Utilizzando video che figurano in entrambi i dataset solo una volta, i ricercatori sono stati in grado di ottenere 12.160 video che coprono 263 diverse attività, e 628,53 ore di contenuto per il loro dataset.
Per popolare il dataset basato su WikiHow, e per fornire la verità di base per il sistema, gli autori hanno web-scraped WikiHow Video per tutti i video istruzionali lunghi, insieme alle loro immagini e clip video (ad esempio, GIF) associate a ogni passaggio. Quindi, la struttura del contenuto derivato da WikiHow è servita come modello per l’individuazione dei passaggi nel nuovo sistema.
Le caratteristiche estratte tramite ResNet50 sono state utilizzate per cross-matchare le sezioni selezionate del video nelle immagini di WikiHow e eseguire la localizzazione dei passaggi. L’immagine più simile ottenuta all’interno di una finestra di video di 5 secondi è stata utilizzata come punto di ancoraggio.
Questi clip più brevi sono stati quindi cuciti insieme per creare video che sarebbero composti la verità di base per l’addestramento del modello.
Etichette sono state assegnate a ogni frame nel video di input, per dichiarare se appartenevano al riassunto di input o no, con ogni video che ha ricevuto dai ricercatori un’etichetta binaria a livello di frame e un punteggio di riassunto medio ottenuto tramite i punteggi di importanza per tutti i frame nel segmento.
A questo punto, i ‘passaggi’ in ogni video istruzionale erano ora associati a dati testuali e etichettati.
Addestramento, test e metriche
Il dataset finale di WikiHow è stato diviso in 1.339 video di test e 768 video di convalida – un aumento notevole rispetto alla dimensione media dei dataset non grezzi dedicati all’analisi del video.
I codificatori video e testo nella nuova rete sono stati addestrati congiuntamente su una rete S3D con pesi caricati da un modello HowTo100M pre-addestrato sotto la perdita MIL-NCE.
Il modello è stato addestrato con l’ottimizzatore Adam a una velocità di apprendimento di 0,01 e una dimensione del batch di 24, con Distributed Data Parallel che collega l’addestramento a otto GPU NVIDIA RTX 2080, per un totale di 24 GB di VRAM distribuita.
IV-Sum è stato quindi confrontato con vari scenari per CLIP-It in conformità con lavori precedenti simili, tra cui uno studio su CLIP-It. Le metriche utilizzate sono state precisione, richiamo e valori F-Score, su tre baseline non supervisionate (vedere il documento per i dettagli).
I risultati sono elencati nell’immagine precedente, ma i ricercatori notano inoltre che CLIP-It perde un certo numero di passaggi possibili in varie fasi dei test che IV-Sum non perde. Attribuiscono ciò al fatto che CLIP-It è stato addestrato e sviluppato utilizzando dataset notevolmente più piccoli del nuovo corpus WikiHow.
Implicazioni
Il valore a lungo termine di questa linea di ricerca (che IV-Sum condivide con la sfida più ampia dell’analisi del video) potrebbe essere quello di rendere i video istruzionali più accessibili all’indicizzazione dei motori di ricerca convenzionali e di abilitare il tipo di riassunto ‘snippet’ nei risultati per i video che Google spesso estrae da un articolo più lungo.
È ovvio che lo sviluppo di qualsiasi processo aiutato dall’AI che riduce la nostra obbligazione di applicare un’attenzione lineare ed esclusiva al contenuto video potrebbe avere ramificazioni per l’appeal del mezzo per una generazione di marketer per i quali l’opacità del video era forse l’unico modo in cui si sentivano di poterci esclusivamente coinvolgere.
Con la localizzazione del contenuto ‘prezioso’ difficile da individuare, i video contribuiti dagli utenti hanno goduto di un’ampia (seppur riluttante) indulgenza da parte dei consumatori di media in relazione alla posizionamento di prodotti, slot di sponsorizzazione e all’autopromozione generale in cui la proposta di valore di un video è spesso inserita. Progetti come IV-Sum offrono la promessa che eventualmente i sottofacetti del contenuto video diventeranno granulari e separabili da ciò che molti considerano il ‘zavorra’ della pubblicità nel contenuto e dell’estemporizzazione non di contenuto.
Pubblicato per la prima volta il 16 agosto 2022. Aggiornato alle 14:52 del 16 agosto, rimossa la frase duplicata.













