Anderson’un Açısı

1970’li Yılların Enerji-Koruyucu AI İzleme Vibe’i

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Excerpts from a video simulating a grayscale video stream activated by object detection – source: https://videos.pexels.com/video-files/36553218/15498630_2560_1440_25fps.mp4

Yeni araştırmalar, çoğu video AI’nin renk ihtiyacı olmadığını, yalnızca kritik anlarda renkleri açtığını ve veri kullanımını %90’dan fazla azaltırken doğrulukta küçük bir kayıp yaşandığını gösteriyor.

 

Uzaktan akışlı kameralar ve diğer kablosuz, pil gücüyle çalışan video cihazları, ideal olarak kimsenin bulunmadığı durumlarda bile insan müdahalesi gerektirebilecek veya periyodik olarak şarj edilmesi gereken kararsız güç kaynaklarına bağlı olabilir. Bu nedenle, bu tür cihazlar için sıkı bir şekilde optimize edilmiş izleme ayarlarına ihtiyaç duyulur.

Bu araştırmayla paralel olarak, kamera ekli giyilebilir cihazlara olan ilgi de artmıştır (bu cihazlar zaten güç ve hesaplama sınırlamalarıyla sıkı bir şekilde sınırlandırılmış olsa da), çünkü kenar AI, bu cihazları önemli ölçüde daha kullanışlı hale getirmeyi vaat ediyor.

Bu dikkate almaların ötesinde, kenar AI ve izleme maliyetlerini azaltma konusundaki uzun vadeli teşvik, özellikle bu tasarrufların müşteriye aktarılmaması gereken durumlarda, enerji koruma yaklaşımlarında yenilikler için güçlü bir argüman oluşturur.

Sesli Alarm

Akışlı video-anlama alanında, kaynakları kısıtlı kenar izleme cihazları, “ilginç” olayları izlemek için mümkün olan en az enerjiyi kullanmalıdır; bu noktada, daha fazla kaynak harcamaya değer olacaktır.

Esasen, bu, hareketle çalışan aydınlatmaların kullanım amacına benzer; bu aydınlatmalar, düşük enerji tüketimi olan sensörler tarafından birinin orada olduğunu tespit ettiğinde aydınlatma sağlar.

Ses izleme ve sıkıştırma, videoya göre önemli ölçüde daha az kaynak yoğun olduğu için, son yıllarda several yaklaşım, kısıtlı sistemlerde “dikkat” çekmek için sesle tetiklenen ipuçlarına başvurmuştur; Listen to Look ve Egotrigger gibi çerçeveler:

Egotrigger sisteminde, sesle tetiklenen görüntü yakalama, el-nesne etkileşimi ipuçlarından seçilerek, yinelenen çerçeveleri azaltırken, kaynak kısıtlı akıllı gözlük sistemlerinde epizodik bellek performansını korur. Kaynak - https://arxiv.org/pdf/2508.01915

Egotrigger sisteminde, sesle tetiklenen görüntü yakalama, el-nesne etkileşimi ipuçlarından seçilerek, yinelenen çerçeveleri azaltırken, kaynak kısıtlı akıllı gözlük sistemlerinde epizodik bellek performansını korur. Kaynak

Açıkça, ses, görsel olayları aramak için ideal bir ortam değildir, çünkü birçok önemli olay sesli bir ipucu olmayabilir veya kenar mikrofonlarının menzili dışında olabilir.

Hafif Uyuyan

Yeni bir makale, daha iyi olabilecek bir şeyin, AI ile birlikte çalışabilen bir video akışı olabileceğini öne sürüyor. Aşağıdaki simülasyon, bu kavramın genel bir fikrini verir – düşük çözünürlüklü izleme, minimum sinyal seviyesinde korunur. Nesne algılama çerçevelerinin çalışması için gereken seviyede ve sisteme bir olayın tetiklenmesiyle ilgili bilgi verir:

İstenen davranışın bir simülasyonu – akış ve analiz, varsayılan olarak en düşük kaynak tüketimi seviyesinde çalışır; yalnızca “ilginç” veya aranan olaylar algılandığında daha fazla kaynak tüketimi yapılır. Siyah-beyaz gözetim stili biraz “retro” olabilir, ancak gelecekteki şeylerin bir işareti olabilir. Bu video, makalenin temel fikirlerini okuyucu için açıklamak amacıyla yazar tarafından oluşturulmuştur. Kaynak:

Yeni çalışma, çeşitli İngiltere kurumları ve Huawei arasındaki bir akademik işbirliği olarak, kenar izleme için tasarlanmış, eğitim gerektirmeyen, AI destekli, her zaman gri tonlama, renk istediğinde şemasını önerir ve “ilginç” olaylar gerçekleşmediğinde düşük token kullanımını ve yalnızca olay süresince tüketimi artırmasını sağlar.

Akışlı video-anlama standartlarında, yeni sistem, ColorTrigger olarak adlandırılır ve tam renkli referans performansının %91.6’sını yalnızca %8.1 RGB çerçevesi kullanarak elde eder:

Renkli çerçeve görüntülenmediğinde, model önemli ayrıntıları karıştırır ve yanlış cevaplar verir; ancak renkleri doğru anda tetiklediğinde, görüntüyü netleştirir ve renk bağımlı görevlerdeki hataları düzeltir.

Renkli çerçeve görüntülenmediğinde, model önemli ayrıntıları karıştırır ve yanlış cevaplar verir; ancak renkleri doğru anda tetiklediğinde, görüntüyü netleştirir ve renk bağımlı görevlerdeki hataları düzeltir. Kaynak

Makale, Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing olarak adlandırılır ve Queen Mary University of London, Durham University, Imperial College London ve Huawei Noah’s Ark Lab’dan sekiz araştırmacı tarafından yazılmıştır. Makaleye ayrıca bir proje sayfası eşlik eder.

Yöntem

Zamanlı yapıyı korumak için, ColorTrigger sürekli düşük bant genişliği gri tonlama gözetimini korur. Bir neden-sonuç ilişkisi olan bir tetikleyici, düşük çözünürlüklü akışın bir sliding window analizini gerçekleştirir (yani, belirli bir zaman etrafındaki esnek artı veya eksi çerçeve aralığı, örneğin bir olay tetikleyicisinin algılanması):

Sürekli yüksek çözünürlüklü RGB yakalama, hızlı bir şekilde güç tüketir, bu nedenle kayıt erken durur ve önemli anlar kaçırılabilir. Buna karşılık, ColorTrigger her zaman düşük güçte gri tonlama akışı tutar ve yalnızca seçilen anlarda RGB kamerayı etkinleştirir - kayıt süresini uzatarak, aynı zamanda sonraki sorgulara必要 görsel ayrıntıları yakalar.

Sürekli yüksek çözünürlüklü RGB yakalama, hızlı bir şekilde güç tüketir, bu nedenle kayıt erken durur ve önemli anlar kaçırılabilir. Buna karşılık, ColorTrigger her zaman düşük güçte gri tonlama akışı tutar ve yalnızca seçilen anlarda RGB kamerayı etkinleştirir – kayıt süresini uzatarak, aynı zamanda sonraki sorgulara gerekli görsel ayrıntıları yakalar. Kaynak

Sistem “pasif” moda iken (yani, henüz bir tetikleyici olayı tespit etmediyse), dinamik token yönlendirici, sınırlı kapasiteyi asimetrik bir dekoder’e ayırır, her zaman artıklık ve olayları gösteren yenilik arar ve kapasite önceliklendirmesini sıkıştırma üzerinde gerçekleştirir:

ColorTrigger şeması. Sistem, yakın zamanda alınan çerçevelerin bir slayt penceresi analizini gerçekleştirir, artıklık ve değişimi tespit eder ve yalnızca gerekli olduğunda yüksek çözünürlüklü RGB yakalamayı tetikler, bir kredi tabanlı bütçe altında. Dinamik token yönlendirici, gri tonlama girişlerine daha az token ve seçilen RGB çerçevelerine daha fazla token ayırır, Multimodal Large Language Model (MLLM) işlemleri için zamanlı sırayı korur.

ColorTrigger şeması. Sistem, yakın zamanda alınan çerçevelerin bir slayt penceresi analizini gerçekleştirir, artıklık ve değişimi tespit eder ve yalnızca gerekli olduğunda yüksek çözünürlüklü RGB yakalamayı tetikler, bir kredi tabanlı bütçe altında. Dinamik token yönlendirici, gri tonlama girişlerine daha az token ve seçilen RGB çerçevelerine daha fazla token ayırır, Multimodal Large Language Model (MLLM) işlemleri için zamanlı sırayı korur.

Her çerçevenin, yeni bilgiler içerip içermediğini ve renkli olarak yakalanmaya değer olup olmadığını belirlemek için, sistem her bir kareyi bir öznitelik temsiline dönüştürür ve bu öznitelikleri birbirleriyle karşılaştırarak, karelerin birbirlerine ne kadar benzer veya farklı olduklarını ölçer.

Bu karşılaştırma, her karenin diğer karelerle ne kadar örtüştüğünü özetleyen bir yapıya organize edilir, böylece sahnenin tekrarlanıp tekrarlanmadığını veya değişip değişmediğini belirler. Bir hafif optimizasyon adımı, her kareye bir önem puanı atar, yeniliği tercih eder.

Renk Dengeleme

Renkli kullanımını aşırı şekilde sınırlamak için, bir “kredi sistemi” vardır. Krediler yavaş yavaş birikir ve renk istenildiğinde kullanılır, böylece faaliyet patlamalarına izin verilir, ancak genel kullanım kontrol altında kalır. Bir kare, yalnızca bilgilendirici olduğu ve yeterli kredi olduğu takdirde “renklendirilir”.

Dinamik Token Yönlendirici, her kareye verilen ayrıntıyı kontrol eder, her kareyi tam kalitede işlemek yerine. Hiçbir önemli şey tespit edilmediğinde, gri tonlama karesi düşük çözünürlüğe indirgenir ve küçük, sıkıştırılmış bir token kümesine dönüştürülür. Önemli bir an tespit edildiğinde, sistem renge geçer ve kareyi daha yüksek çözünürlükte işler, daha zengin ve ayrıntılı bir temsil sunar.

Her iki tür kare de aynı modele girer, ancak gri tonlama kareleri daha hafif bir şekilde işlenir, seçilen renkli kareler ise daha fazla dikkat alır. Çıktılar orijinal sıralarına göre birleştirilir ve modele sürekli bir akış olarak gönderilir.

Çoğu karenin hafif kalması ve yalnızca birkaçının “renklendirilmesi” nedeniyle, sistem önemli miktarda hesaplama tasarrufu sağlar, ancak önemli ayrıntıları yakalar:

Makaleden başka bir örnek, sistemde geçici olarak kaynakları artırmak için renk ayırt ediliyor.

Makaleden başka bir örnek, sistemde geçici olarak kaynakları artırmak için renk ayırt ediliyor.

Veri ve Testler

Sistemi test etmek için araştırmacılar, StreamingBench ve OVO-Bench video benchmark’lerini kullandılar, gelecekteki içeriğin işlenmesinden (bu, offline testlerde potansiyel bir tehlike olabilir) kaçındılar.

Kullanılan dondurulmuş Multimodal Large Language Model (MLLM), InternVL3.5-8B-Instruct idi ve neden-sonuç ilişkisi tetikleyicisi CLIP ViT-B/16 aracılığıyla uygulanmıştır.

Gri tonlama akışı, CIELAB renk uzayındaki lüminans kanalına indirgendi, önceki çalışmalara uygun olarak ve sonuçta oluşan gri tonlama kareleri, parçalama öncesi 224x224px’ye yeniden boyutlandırıldı.

RGB kareleri, daha yüksek bir bitrate ile işlendi ve 448x448px’de işlenerek 256 token üretildi, gri tonlama kareleri için üretilen 64 token’e kıyasla.

Karar verme için ortak optimizasyon araçları kullanıldı: CVXPY (Python’da optimizasyon problemlerini oluşturmak için bir kütüphane) ve OSQP Solver (renk tetiklemesi için hesaplayan hızlı bir algoritma).

Video, 1 fps’de işlendi ve her klip için 128 kare sınırı konuldu, böylece hesaplaması düşük tutuldu.

Test edilen özel sistemler Gemini 1.5 Pro; GPT-4o; ve Claude 3.5 Sonnet idi. Test edilen açık kaynaklı video MLLM’ler LLaVA-OneVision-7B; Video-LLaMA2-7B; ve Qwen2.5-VL-7B idi.

Akışlı MLLM’ler Flash-VStream-7B; VideoLLM-online-8B; Dispider-7B; ve TimeChat-Online-7B idi.

InternVL-3.5-8B ve Qwen3-VL-8B, StreamingBench ile ilgili ilk sonuç tablosunda ayrıntılı olarak açıklanan çeşitli konfigürasyonlarda test edildi:

StreamingBench'de gerçek zamanlı görsel anlama görevleri için performans, farklı renk bütçelerindeki özel, açık kaynaklı ve akışlı MLLM'ler ile karşılaştırıldı. RGB (%) ifadesi, tetiklemenin ardından renkli olarak tutulan karelerin oranını gösterir, burada %100 tam renk ve %0 gri tonlama girişini ifade eder. ColorTrigger, %8.1 ve %34.3 renkli kareleri koruyarak iki işletim noktasında değerlendirildi ve gri tonlama InternVL-3.5-8B temel çizgisine kıyasla genel doğruluğu iyileştirdi ve tam renkli ayarlarla kıyaslandığında renk kullanımını önemli ölçüde azalttı.

StreamingBench’de gerçek zamanlı görsel anlama görevleri için performans, farklı renk bütçelerindeki özel, açık kaynaklı ve akışlı MLLM’ler ile karşılaştırıldı. RGB (%) ifadesi, tetiklemenin ardından renkli olarak tutulan karelerin oranını gösterir, burada %100 tam renk ve %0 gri tonlama girişini ifade eder. ColorTrigger, %8.1 ve %34.3 renkli kareleri koruyarak iki işletim noktasında değerlendirildi ve gri tonlama InternVL-3.5-8B temel çizgisine kıyasla genel doğruluğu iyileştirdi ve tam renkli ayarlarla kıyaslandığında renk kullanımını önemli ölçüde azalttı.

Burada yazarlar şunları belirtir:

‘ColorTrigger, StreamingBench’deki Gerçek Zamanlı Görsel Anlama alt görevinde rekabetçi bir performans gösterir.

‘%34.3 RGB kareleriyle modelimiz, 75.24 puanla, son zamanlardaki Dispider-7B ve TimeChat-Online-7B’ye (75.69) benzer bir performans gösterir ve özel modeller gibi Gemini 1.5 Pro’dan (75.69) daha iyi ve GPT-4o (73.28) ile Claude 3.5 Sonnet’ten (72.44) daha iyidir.’

InternVL-3.5-8B, tam renkli olarak %77.20 puan alırken, ColorTrigger %65.7 daha az RGB kareleri kullanarak %75.24 puan elde etti ve yalnızca %8.1 renkli karelerle %62.08’in üzerinde %8.64 puan daha iyi bir performans gösterdi ve diğer akışlı modellerle rekabetçi kaldı.

Sonra OVO-Bench test edildi:

OVO-Bench'de Gerçek Zamanlı Görsel Algılama, Geri İzleme ve İleri Aktif Yanıt gibi üç kategori için performans, farklı renk bütçelerindeki özel, açık kaynaklı ve akışlı MLLM'ler ile karşılaştırıldı. RGB (%) ifadesi, tetiklemenin ardından renkli olarak tutulan karelerin oranını gösterir, burada %100 tam renk ve %0 gri tonlama girişini ifade eder. ColorTrigger, %7.1 ve %33.1 renkli kareleri koruyarak iki işletim noktasında değerlendirildi ve gri tonlama InternVL-3.5-8B temel çizgisine kıyasla genel doğruluğu iyileştirdi ve tam renkli ayarlarla kıyaslandığında renk kullanımını önemli ölçüde azalttı.

OVO-Bench’de Gerçek Zamanlı Görsel Algılama, Geri İzleme ve İleri Aktif Yanıt gibi üç kategori için performans, farklı renk bütçelerindeki özel, açık kaynaklı ve akışlı MLLM’ler ile karşılaştırıldı. RGB (%) ifadesi, tetiklemenin ardından renkli olarak tutulan karelerin oranını gösterir, burada %100 tam renk ve %0 gri tonlama girişini ifade eder. ColorTrigger, %7.1 ve %33.1 renkli kareleri koruyarak iki işletim noktasında değerlendirildi ve gri tonlama InternVL-3.5-8B temel çizgisine kıyasla genel doğruluğu iyileştirdi ve tam renkli ayarlarla kıyaslandığında renk kullanımını önemli ölçüde azalttı.

Bu sonuçlar hakkında yazarlar şunları belirtir:

‘Modelimiz %33.1 RGB kareleriyle, 52.5 puanla neredeyse tüm mevcut açık kaynaklı akışlı MLLM’leri geride bırakıyor.

‘Tam RGB girişine sahip temel model InternVL-3.5-8B (57.7) ile karşılaştırıldığında, ColorTrigger %52.5 puanla, RGB kare kullanımını %66.9 oranında azaltırken, yalnızca %5.2’lik bir performans düşüşü gösterir ve bu, nossa adaptif yönlendirme stratejisinin etkinliğini gösterir.’

Gerçek Zamanlı Görsel Algılama, %65.2 puanla gri tonlama yalnızca temel çizgisinin %53.8 puanının üzerinde %11.4 puanlık bir kazanç elde etti. Sadece %7.1 RGB kareleriyle sınırlı olsa bile, ColorTrigger genel puanı %50.4 olarak korudu ve gri tonlama ayarını %2.5 puan iyileştirdi.

Son olarak, araştırmacılar bir offline video görevine (gecikme veya diğer “canlı” çevre koşullarını test etmeyen bir analitik görev) karşı bir test gerçekleştirdiler, Video-MME uzun süreli video anlama benchmark’ünü kullandılar:

Video-MME benchmark'ünde test edilen sistemlerin performansı.

Video-MME benchmark’ünde test edilen sistemlerin performansı.

Bu testte, model %37.6 RGB kareleri kullanarak %66.1 puan elde etti ve tam renkli InternVL-3.5-8B temel çizgisinin %65.6 puanını, %62.4 daha az renkli kare kullanarak aştı.

Yazarlar şunları belirtir:

‘Bu, adaptif tetikleme mekanizmamızın yalnızca hesaplama maliyetini azaltmadığı, aynı zamanda kritik anlarda RGB kapasitesini odaklayarak performansı gerçekten iyileştirebileceğini gösterir.

‘Özellikle, ColorTrigger TimeChat-Online-7B (%62.4) ve Dispider-7B (%57.2)’yi geçen tüm mevcut akışlı MLLM’leri geride bırakarak, sürekli gri tonlama bağlamı ile seçici RGB edinimin birleştirilmesinin uzun süreli video anlama için etkinliğini onaylar.’

Sonuç

Bu tür yenilikleri görmek her zaman hoşuma gidiyor, çünkü AI’ın yüksek ve her geçen gün artan elektrik gücü ihtiyacı, uzun süredir kötü haberler üretiyor ve enerji kullanımını dolaylı olarak ele alan araştırmaları görmek güzel.

İnovasyonun, kısa vadeli siyasi kararlarla daha az ilgili olan ticari nedenlerle motive edilmesi, enerji koruma ve küresel ısınma konusundaki daha soylu ancak daha savunmasız endişelerden daha az etkilenmesiyle ilgili olarak, bu tür tasarrufların yapılmasının hoş bir tarafı var. Neyse ki, aynı sonuç farklı nedenlerle elde ediliyor.

 

* Yazar tarafından, makalenin fikirlerini okuyucu için özetlemek amacıyla oluşturuldu.

İlk olarak 26 Mart 2026 Perşembe günü yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai