Modèles et plateformes d’IA

Nouvel outil alimenté par l’IA permettant l’édition de vidéos à partir de documents texte thématiques

mm
Ajouter Unite.AI à vos sources préférées sur Google

Une équipe de chercheurs en informatique de l’Université Tsinghua et de l’Université Beihand en Chine, de l’IDC Herzilya en Israël et de l’Université Harvard ont récemment créé un outil qui génère des vidéos éditées à partir d’une description texte et d’un référentiel de clips vidéo.

Des quantités massives de footage vidéo sont enregistrées chaque jour par des professionnels, des amateurs et des personnes ordinaires. Cependant, éditer ces vidéos pour en faire une présentation qui a du sens est toujours un investissement de temps coûteux, souvent nécessitant l’utilisation d’outils de montage complexes qui peuvent manipuler les rushes. L’équipe internationale de chercheurs a récemment développé un outil qui prend des descriptions texte thématiques et génère des vidéos à partir de celles-ci. L’outil est capable d’examiner les clips vidéo dans un référentiel et de sélectionner les clips qui correspondent au texte de description de l’histoire. L’objectif est que l’outil soit convivial et suffisamment puissant pour produire des vidéos de qualité sans nécessiter des compétences en édition vidéo étendues ou des logiciels de montage vidéo coûteux.

Alors que les plateformes d’édition vidéo actuelles nécessitent des connaissances en techniques d’édition vidéo, l’outil créé par les chercheurs permet aux novices de créer des compositions qui racontent des histoires de manière plus naturelle et intuitive. « Write-A-Video », comme l’ont baptisé ses créateurs, permet aux utilisateurs d’éditer des vidéos en éditant simplement le texte qui accompagne la vidéo. Si un utilisateur supprime du texte, ajoute du texte ou déplace des phrases, ces modifications seront reflétées dans la vidéo. Les plans correspondants seront coupés ou ajoutés à mesure que l’utilisateur manipule le texte et la vidéo finale sera adaptée à la description de l’utilisateur.

Ariel Shamir, le doyen de l’École des sciences informatiques Efi Arazi de l’IDC Herzliya, a expliqué que l’outil Write-A-Video permet à l’utilisateur d’interagir avec la vidéo principalement à travers le texte, en utilisant des techniques de traitement du langage naturel pour faire correspondre les plans vidéo en fonction de la signification sémantique fournie. Un algorithme d’optimisation est ensuite utilisé pour assembler la vidéo en coupant et en échangeant des plans. L’outil permet également aux utilisateurs d’expérimenter différents styles visuels, en ajustant la façon dont les scènes sont présentées en utilisant des idiomes de film spécifiques qui accélèrent ou ralentissent l’action, ou font plus ou moins de coupes.

Le programme sélectionne les plans possibles en fonction de leur attrait esthétique. Le programme tient compte de la façon dont les plans sont cadrés, mis au point et éclairés pour déterminer l’attrait esthétique. L’outil sélectionnera des plans qui sont mieux mis au point, plutôt que flous ou instables, et il donnera également la priorité aux plans qui sont bien éclairés. Selon les créateurs de Write-A-Video, l’utilisateur peut rendre la vidéo générée à tout moment et la prévisualiser avec une narration vocale qui décrit le texte utilisé pour sélectionner les clips.

Selon l’équipe de recherche, leur expérience a démontré que les techniques numériques qui combinent des aspects de la vision par ordinateur et du traitement du langage naturel peuvent aider les utilisateurs dans des processus créatifs tels que l’édition de vidéos.

« Notre travail démontre le potentiel de la correspondance visuelle-sémantique automatique dans l’édition computationnelle basée sur les idiomes, offrant une façon intelligente de rendre la création de vidéos plus accessible aux non-professionnels », a expliqué Shamir à TechXplore.

Les chercheurs ont testé leur outil sur différents référentiels de vidéos combinés avec des documents texte thématiques. Des études d’utilisateurs et des évaluations quantitatives ont été réalisées pour interpréter les résultats de l’expérience. Les résultats des études d’utilisateurs ont montré que les non-professionnels pouvaient parfois produire des vidéos éditées de haute qualité en utilisant l’outil plus rapidement que les professionnels en utilisant des logiciels d’édition basés sur les cadres. Comme le rapporte TechXplore, l’équipe présentera son travail dans quelques jours à la conférence ACM SIGGRAPH Asia qui se tiendra en Australie. D’autres entités utilisent également l’IA pour améliorer l’édition de vidéos. Adobe (ADBE ) a également travaillé sur ses propres extensions alimentées par l’IA pour Premiere Pro, sa plateforme d’édition. L’outil aide les gens à s’assurer que les changements de ratio d’aspect ne coupent pas les parties importantes de la vidéo.

Blogueur et programmeur avec des spécialités en Machine Learning et Deep Learning sujets. Daniel espère aider les autres à utiliser le pouvoir de l'IA pour le bien social.