Anderson’un Açısı

Uzun ‘Nasıl Yapılır’ Videolarını Özetlemek için AI Kullanma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Eğer bir YouTube nasıl yapılır videosunun hızını artırmak için oynatma hızını artırarak bilgiye ulaşmaya çalışıyorsanız; videonun metnini inceleyerek uzun ve genellikle sponsorlu olan çalışma zamanlarında gizlenen önemli bilgileri çıkarmak için; ya da WikiHow’un bu bilgileri daha az zaman alan bir versiyonunu oluşturup oluşturmadığını umuyorsanız; o zaman Kaliforniya Üniversitesi, Berkeley, Google Araştırma ve Brown Üniversitesi’nden yeni bir proje ilginizi çekebilir.

Adı TL;DW? Talimatlı Videoları Görevle İlgili ve Çapraz Mod Saliency ile Özetleme olan yeni makale, videoyu önemli adımlardan oluşan kısa bir özetle sonuçlandırabilen bir AI destekli video özetleme sistemi oluşturulmasını anlatıyor.

WikiHow'un mevcut uzun video kliplerini metin ve video bilgileri için kullanması, IV-Sum projesi tarafından sahte özetler oluşturmak ve sistemi eğitmek için kullanılan gerçek verileri sağlar. Kaynak: https://arxiv.org/pdf/2208.06773.pdf

WikiHow’un mevcut uzun video kliplerini metin ve video bilgileri için kullanması, IV-Sum projesi tarafından sahte özetler oluşturmak ve sistemi eğitmek için kullanılan gerçek verileri sağlar. Kaynak: https://arxiv.org/pdf/2208.06773.pdf

Elde edilen özetler, orijinal videonun çalışma zamanının yalnızca bir kısmına sahiptir ve çok modlu (yani metin tabanlı) bilgiler de işleme sırasında kaydedilir, böylece gelecekteki sistemler, uzun bir nasıl yapılır videosunu otomatik olarak kısa ve aranabilir bir makaleye dönüştürebilir.

Yeni sistem IV-Sum (‘Talimatlı Video Özetleyici’) olarak adlandırılmaktadır ve önemli kareleri ve video segmentlerini belirlemek için açık kaynaklı ResNet-50 bilgisayar görüşü tanıma algoritması da dahil olmak üzere çeşitli teknikleri kullanır.

IV-Sum için kavramsal iş akışı.

IV-Sum için kavramsal iş akışı.

Sistem, WikiHow websitesinin içerik yapısından elde edilen pseudo-özetler üzerinde eğitilir, burada gerçek insanlar genellikle popüler talimatlı videoları daha düz ve metin tabanlı bir çokluortam forma dönüştürür.

Projenin WikiHow özetlerini sistem için gerçek veri kaynağı olarak kullanımını tartışan yazarlar şunları söylemektedir:

‘Her bir WikiHow Videosu websitesindeki her bir makale, genellikle görevi gösteren bir ana talimat videosu içerir ve bu video, sık sık tanıtım içeriği, öğretmenin kamera karşısında konuşurken görevle ilgili hiçbir görsel bilgi içermeyen kısımlar ve görevi gerçekleştirmek için kritik olmayan adımlar içerir. ‘

‘Görevin bir özeti isteyen izleyiciler, tüm bu yukarıda belirtilen alakasız bilgileri içermeyen daha kısa bir video tercih edeceklerdir. WikiHow makaleleri (örneğin, How to Make Sushi Rice), tam da bunu içerir: önemli tüm adımları listeleyen metin ve görevin çeşitli adımlarını gösteren resimler/kliplerle birlikte.’

Elde edilen veritabanı WikiHow Özetleri olarak adlandırılmaktadır. Veritabanı, 2.106 girdi videosu ve ilgili özetlerini içerir. Bu, video özetleme projeleri için genellikle mevcut olan veri setlerinden önemli ölçüde daha büyüktür.

IV-Sum, önceki benzer çalışmaların karakterize ettiği kare tabanlı temsil yerine zaman içinde 3D konvolüsyonel sinir ağı temsilini kullanır ve makalede ayrıntılı olarak belirtilen bir soykırım çalışması, bu yaklaşımın tüm bileşenlerinin sistemin işlevselliği için gerekli olduğunu doğrular.

IV-Sum, çeşitli karşılaştırılabilir çerçevelerle, CLIP-It dahil olmak üzere olumlu bir şekilde test edilmiştir.

IV-Sum, genel video özetleme girişimlerinin çoğuna kıyasla daha kısıtlı uygulama kapsamına sahip olabileceğinden, karşılaştırılabilir yöntemlerle iyi bir şekilde çalışır. Bu makalenin ilerleyen kısımlarında metrikler ve puanlama yöntemleri hakkında daha fazla bilgi bulunabilir.

IV-Sum, genel video özetleme girişimlerinin çoğuna kıyasla daha kısıtlı uygulama kapsamına sahip olabileceğinden, karşılaştırılabilir yöntemlerle iyi bir şekilde çalışır. Bu makalenin ilerleyen kısımlarında metrikler ve puanlama yöntemleri hakkında daha fazla bilgi bulunabilir.

Yöntem

Özetleme sürecinin ilk aşaması, bir dizi web tarayıcı talimatlı videosu için göreceli olarak düşük çaba gerektiren, zayıf bir şekilde denetlenen algoritma kullanarak pseudo-özetler ve kare bazında önem puanları oluşturmayı içerir.

Sonra, bu veriler üzerinde eğitilen bir talimatlı özetleme ağı kullanılır. Sistem, otomatik olarak oluşturulmuş alt yazılar (örneğin, YouTube’ın kendi AI tarafından oluşturulan alt yazıları) ve kaynak videosu alır.

Ağ, bir video kodlayıcısı ve bir segment puanlama dönüştürücüsünden (SST) oluşur ve eğitim, pseudo-özetlerde atanan önem puanları tarafından yönlendirilir. Nihai özet, yüksek bir önem puanı alan segmentleri birleştirmek suretiyle oluşturulur.

Makaleden:

‘Sahte özet oluşturma pipeline’mizin arkasındaki ana sezgi, birçok videonun bir görevi göstermesi durumunda, görev için kritik adımların muhtemelen birden fazla videoda görünmesidir (görevle ilgili). ‘

‘Ek olarak, bir adım önemli ise, genellikle demonstratörün bu adımı gerçekleştirmeden, gerçekleştirirken veya gerçekleştirdikten sonra konuşması gerekir. Bu nedenle, video için Otomatik Konuşma Tanıma (ASR) kullanılarak elde edilen altyazılar, muhtemelen bu ana adımlara atıfta bulunacaktır (çapraz mod saliency).’

Sahte özet oluşturmak için, video önce eşit olarak bölünür ve segmentler görsel benzerliklerine göre 'adım'lar (yukarıdaki resimde farklı renkler) olarak gruplandırılır. Bu adımlar daha sonra 'görevle ilgili' ve 'çapraz mod saliency' (yani ASR metni ve resim arasındaki korelasyon) temelinde önem puanları atanır. Yüksek puan alan adımlar, sahte özetin aşamalarını temsil etmek için seçilir.

Sahte özet oluşturmak için, video önce eşit olarak bölünür ve segmentler görsel benzerliklerine göre ‘adım’lar (yukarıdaki resimde farklı renkler) olarak gruplandırılır. Bu adımlar daha sonra ‘görevle ilgili’ ve ‘çapraz mod saliency’ (yani ASR metni ve resim arasındaki korelasyon) temelinde önem puanları atanır. Yüksek puan alan adımlar, sahte özetin aşamalarını temsil etmek için seçilir.

Sistem, her bir adımı için ilgiliğini belirlemek amacıyla Çapraz Mod Saliency kullanır ve bu, konuşulan metni videodaki resimlerle ve eylemlerle karşılaştırmak suretiyle gerçekleştirilir.

Her bir görevle ilgili ve çapraz mod analiz aşamasından hesaplanan ortalama bir genel önem puanı elde edilir.

Veri

İlk olarak, pseudo-özetler verisi oluşturuldu. Bu veri seti, büyük ölçüde iki önceki veri setinin içeriğini içerir – COIN, 180 görevle ilgili 11.000 video içeren 2019 yılına ait bir veri seti ve Cross-Task, 4.700 talimatlı video içeren bir veri seti (araştırmada 3.675 tanesi kullanılmıştır). Cross-Task, 83 farklı görevi içerir.

Üstte, COIN'den örnekler; aşağıda, Cross-Task'ten örnekler. Kaynaklar sırasıyla: https://arxiv.org/pdf/1903.02874.pdf ve https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

Üstte, COIN’den örnekler; aşağıda, Cross-Task’ten örnekler. Kaynaklar sırasıyla: https://arxiv.org/pdf/1903.02874.pdf ve https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

Araştırmacılar, her iki veri setinde de yer alan videoları yalnızca bir kez kullanarak, 12.160 video ve 263 farklı görevi kapsayan ve 628,53 saatlik içeriği olan bir veri seti elde edebildiler.

WikiHow tabanlı veri setini oluşturmak ve sistemi eğitmek için gerçek verileri sağlamak amacıyla, araştırmacılar WikiHow Videosu’ndaki tüm uzun talimatlı videoları, resimleri ve her adıma ait video kliplerini (yani GIF’leri) çıkardılar.

ResNet50 tarafından çıkarılan özellikler, WikiHow resimlerinde seçilen video kısımlarını eşleştirmek ve adımların konumlarını belirlemek için kullanıldı.

En benzer elde edilen resim, 5 saniyelik bir video penceresi içinde kullanıldı.

Bu daha kısa klipler daha sonra, modelin eğitimi için gerçek verileri oluşturmak amacıyla videolara dönüştürüldü.

Her bir girdi videosunun her bir karesine, giriş özetinin bir parçası olup olmadığını belirten bir ikili etiket atanmıştır.

Eğitim, Testler ve Metrikler

Nihai WikiHow veri seti, 1.339 test videosu ve 768 doğrulama videosu olarak bölündü.

Video ve metin kodlayıcıları, S3D ağı üzerinde ortak olarak eğitildi ve önceden eğitilmiş HowTo100M modelinin ağırlıkları yüklendi.

Model, 0,01’lik öğrenme hızında ve 24’lük bir toplu işlemin boyutunda Adam optimizatörü ile eğitildi ve sekiz NVIDIA RTX 2080 GPU’si üzerinden Dağıtılmış Veri Paralel Bağlantısı kullanılarak eğitimi dağıtıldı.

IV-Sum, çeşitli senaryolarda benzer önceki çalışmalarda olduğu gibi CLIP-It ile karşılaştırıldı.

Sonuçlar daha önce gösterilen resimdedir, ancak araştırmacılar ayrıca CLIP-It’in testlerin çeşitli aşamalarında IV-Sum’un kaçırmadığı olası adımları kaçırdığını not ederler. Bunu, CLIP-It’in yeni WikiHow korpusundan önemli ölçüde daha küçük veri setleri kullanılarak eğitilmiş olmasına bağlarlar.

Ön Görüler

Bu araştırma alanının (IV-Sum ile paylaştığı) uzun vadeli değeri, talimatlı video kliplerini geleneksel arama motoru dizinlemesine daha erişilebilir hale getirmek ve videolar için Google’ın genellikle daha uzun bir makaleden çıkardığı türden indirgenmiş ‘parça’ları etkinleştirmek olabilir.

Herhangi bir AI destekli sürecin, video içeriğine karşı lineer ve độcak attention uygulama zorunluluğumuzu azaltabilmesi, video içeriğinin bir nesli için pazarlamacıların ilgisini etkileyebilir.

Değerli içeriğin konumunu belirlemek zor olduğundan, kullanıcı tarafından oluşturulan video, ürün yerleştirme, sponsorlu reklamlar ve video değer önerisinin genellikle sunulduğu self-aggrandizement için geniş bir (fakat isteksiz) hoşgörüye sahip oldu.

IV-Sum gibi projeler, video içeriğinin alt bileşenlerinin, birçok kişinin in-content reklamcılık ve içerik dışı konuşmanın ‘topallığı’ndan ayrılarak granüler ve ayrılmaz hale gelme vaadini taşır.

 

İlk olarak 16 Ağustos 2022’de yayınlandı. 16 Ağustos saat 14:52’de güncellendi, yinelenen ifade kaldırıldı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai