Andersons vinkel

En 1970-talskänsla för energibesparande AI-övervakning

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Excerpts from a video simulating a grayscale video stream activated by object detection – source: https://videos.pexels.com/video-files/36553218/15498630_2560_1440_25fps.mp4

Nya studier visar att de flesta videor med AI inte behöver färg alls, utan endast aktiverar färg vid viktiga ögonblick och minskar dataanvändningen med över 90 % med liten förlust av noggrannhet.

 

Remote streamingkameror och andra trådlösa, batteridrivna videenheter kräver optimala övervakningskonfigurationer, eftersom de kan bero på instabila strömkällor – såsom solceller – eller kräva periodisk omladdning, eller andra former av mänsklig inblandning, i situationer där det, i idealfallet, inte borde behövas någon.

I samband med denna forskning har intresset för kamerautrustade wearables också ökat (även om sådana enheter redan var hårt begränsade av effekt- och beräkningsbegränsningar), eftersom edge-AI nu lovar att göra dem betydligt mer användbara.

Utöver dessa överväganden gör den långsiktiga drivkraften att minska edge-AI- och övervakningskostnader (särskilt i fall där sådana besparingar inte behöver föras vidare till kunden) ett starkt fall för innovation inom energibesparande metoder för “edge”-användningsfall.

Ljud av

Inom området strömmande videoavkänning måste resursfattiga edge-övervakningsenheter använda så lite energi som möjligt, samtidigt som de måste använda tillräckligt med kraft för att övervaka “intressanta” händelser – vid vilka tillfällen det kommer att vara värt att använda mer resurser.

Effektivt sett är detta ett liknande användningsfall som rörelsestyrda lampor, som tillhandahåller belysning endast när lågströmsdränerande sensorer bestämmer att det finns någon där för att uppskatta det.

Eftersom ljudövervakning och komprimering är betydligt mindre resurskrävande än video, har flera tillvägagångssätt under de senaste åren försökt att använda ljudstyrda signaler för att “aktivera” uppmärksamhet i begränsade system; ramverk som Lyssna på att titta och Egotrigger:

I Egotrigger-systemet aktiverar ljudstyrning selektivt bildinspelning från hand-objektinteraktionssignaler, minskar redundanta ramar och bevarar episodisk minnesprestanda i resursbegränsade smarta glasögonsystem. Källa - https://arxiv.org/pdf/2508.01915

I Egotrigger-systemet aktiverar ljudstyrning selektivt bildinspelning från hand-objektinteraktionssignaler, minskar redundanta ramar och bevarar episodisk minnesprestanda i resursbegränsade smarta glasögonsystem. Källa

Det är uppenbart att ljud inte är det idealiska mediet för att söka efter visuella händelser, eftersom många väsentliga sådana händelser kan sakna ljudsignal eller kan inträffa utanför edge-mikrofonernas räckvidd.

Ljus sömnare

Vad som kan vara bättre, föreslår en ny rapport, är en videostream som kan arbeta tillsammans med AI för att öka resurser så snart en övervakad händelse inträffar. Simuleringen nedan* ger en allmän idé om konceptet – lågupplösningsövervakning upprätthålls på den lägsta signalnivå som krävs för objektdetektionsramverk för att fungera, och för att berätta för systemet att öka upplösningen på grund av utlösning av en händelse:

En simulering av det önskade beteendet – att strömning och analys fungerar på sin lägsta nivå av resursförbrukning som standard; bara tillräckligt för att utlösa högre resursförbrukning när “intressanta” eller sökta händelser upptäcks i gråskaleströmmen. Den svartvita övervakningsstilen kan vara ganska “retro”, men den kan vara ett tecken på vad som komma skall. Denna video skapades av författaren enbart i illustrativt syfte i relation till de centrala idéerna i den nya rapporten. Källa

Den nya forskningen, ett akademiskt samarbete mellan olika brittiska institutioner och Huawei, föreslår ett utbildningsfritt, AI-understött, gråskala alltid, färg på begäran-schema för edge-övervakning – utformat för att fungera på låg tokenanvändning när inga “nyckelhändelser” äger rum, och för att öka förbrukningen endast för händelsens varaktighet.

I strömmande videoförståelsebenchmarks kunde det nya systemet, som kallas ColorTrigger, uppnå 91,6 % av fullfärgbaslinje-prestanda medan det endast använde 8,1 % av RGB-ramarna i dessa standarder:

När modellen endast ser gråskalevideo, förvirrar den viktiga detaljer och ger fel svar; men utlösning av färg vid rätt ögonblick förtydligar bilden och rättar till misstag som utlöses av uppgifter som beror på färg. Källa - https://lvgd.github.io/ColorTrigger/

När modellen endast ser gråskalevideo, förvirrar den viktiga detaljer och ger fel svar; men utlösning av färg vid rätt ögonblick förtydligar bilden och rättar till misstag som utlöses av uppgifter som beror på färg. Källa

Den nya rapporten har titeln Färg när det behövs: Gråskale-styrd online-utlösning för alltid-på-strömmande videoavkänning, och kommer från åtta forskare på Queen Mary University of London, Durham University, Imperial College London och Huawei Noah’s Ark Lab. Rapporten har också en tillhörande projektsida.

Metod

För att bevara den temporala strukturen i det nya systemet upprätthåller ColorTrigger konstant lågbandviddsgråskaleövervakning. En kausalt online-utlösare analyserar en glidande fönster (dvs. ett flexibelt plus-minus-intervall av ramar runt en viss tid, såsom upptäckten av en händelseutlösare) av den lågupplösningsströmmen:

Kontinuerlig högupplösnings-RGB-inspelning dränerar snabbt kraft, så inspelningen avslutas tidigt och viktiga ögonblick kan missas. Däremot håller ColorTrigger en lågeffektgråskaleström igång hela tiden och aktiverar endast RGB-kameran vid utvalda ögonblick – vilket förlänger inspelningstiden, samtidigt som det fortfarande fångar de visuella detaljerna som behövs för att besvara senare frågor. Källa - https://arxiv.org/pdf/2603.22466

Kontinuerlig högupplösnings-RGB-inspelning dränerar snabbt kraft, så inspelningen avslutas tidigt och viktiga ögonblick kan missas. Däremot håller ColorTrigger en lågeffektgråskaleström igång hela tiden och aktiverar endast RGB-kameran vid utvalda ögonblick – vilket förlänger inspelningstiden, samtidigt som det fortfarande fångar de visuella detaljerna som behövs för att besvara senare frågor. Källa

När systemet är i “passiv” läge (dvs. det har inte identifierat en utlösarhändelse ännu), allokerar dess dynamiska token-router begränsad kapacitet till en asymmetrisk avkodare, som alltid letar efter redundans och händelser som indikerar nyhet, vid vilka tillfällen tokenflödet omprioriterar kapacitet över komprimering:

Schema för ColorTrigger. Systemet övervakar en glidande fönsteranalys av nyliga ramar för att upptäcka redundans och förändring, och utlöser högupplösnings-RGB-inspelning endast när det behövs, under en kreditbaserad budget. En dynamisk token-router allokerar färre token till gråskaleinmatningar och fler till utvalda RGB-ramar, och bevarar den temporala ordningen för efterföljande Multimodal Large Language Model (MLLM)-bearbetning.

Schema för ColorTrigger. Systemet övervakar en glidande fönsteranalys av nyliga ramar för att upptäcka redundans och förändring, och utlöser högupplösnings-RGB-inspelning endast när det behövs, under en kreditbaserad budget. En dynamisk token-router allokerar färre token till gråskaleinmatningar och fler till utvalda RGB-ramar, och bevarar den temporala ordningen för efterföljande Multimodal Large Language Model (MLLM)-bearbetning.

På en ram-för-ram-basis måste systemet bestämma om det aktuella ögonblicket innehåller ny information som är värd kostnaden för att fånga färg. Den korta nyliga historiken av gråskale-ramar i glidande fönstret tillåter ColorTrigger att jämföra den aktuella ramen med dess omedelbara förflutna. Varje ram omvandlas till en komprimerad funktionell representation, och dessa funktioner jämförs med varandra för att mäta hur lika eller olika deras värd-ramar är.

Denna jämförelseprocess organiseras i en struktur som sammanfattar hur mycket varje ram överlappar med de andra, vilket effektivt fångar om scenen upprepas eller förändras. En lätt optimeringssteg tilldelar en viktighetspoäng till varje ram i fönstret, som föredrar nyhet.

Färgbalans

För att förhindra överdriven användning av färg begränsar ett enkelt “kreditsystem” hur ofta färg kan utlösas över tiden. Krediter ackumuleras gradvis och används när färg begärs, vilket säkerställer att aktivitetstoppar tillåts, men den totala användningen förblir kontrollerad. En ram “uppgraderas” endast till färg om den är både informativ och om det finns tillräckligt med krediter tillgängliga.

Den dynamiska token-routern kontrollerar hur mycket detalj varje ram får, snarare än att bearbeta varje ram i full kvalitet. När ingenting viktigt upptäcks hålls gråskale-ramen lågupplöst och omvandlas till en liten, komprimerad uppsättning token. När ett viktigt ögonblick upptäcks växlar systemet till färg och bearbetar ramen i högre upplösning, vilket ger en rikare och mer detaljerad representation.

Båda typerna av ramar bearbetas av samma modell, men gråskale-ramar hanteras på ett lättare sätt, medan utvalda färg-ramar ges mer uppmärksamhet. Utdata kombineras i sin ursprungliga ordning och skickas till modellen som en kontinuerlig ström.

Eftersom de flesta ramar förblir lätta och endast ett fåtal “uppgraderas”, sparar systemet en stor mängd beräkning samtidigt som det fortfarande fångar de viktiga detaljerna när de är viktiga:

Från rapporten, ett annat exempel där systemet kräver att tillfälligt öka resurser för att skilja på en färg.

Från rapporten, ett annat exempel där systemet kräver att tillfälligt öka resurser för att skilja på en färg.

Data och tester

För att testa systemet utvärderade forskarna det mot StreamingBench och OVO-Bench videobenchmarks, och undvek bearbetning av framtida innehåll (vilket är en potentiell fara i offline-tester).

Den frysta Multimodal Large Language Model (MLLM) som användes var InternVL3.5-8B-Instruct, med den kausala utlösaren implementerad via CLIP ViT-B/16.

Gråskale-strömmen begränsades till luminanskanalen i CIELAB-färgrymden, i enlighet med tidigare arbete, och de resulterande gråskale-ramarna återstorleks till 224x224px före patchifiering (uppdelning av en bild i små, fasta block, så att varje block kan bearbetas som en separat enhet av modellen).

RGB-ramarna, å andra sidan, hade en högre bitrate och bearbetades i 448x448px, vilket resulterade i 256 token, till skillnad från de 64 token som producerades för gråskale-ramarna.

Vanliga optimeringsverktyg användes för att fatta systemets beslut: CVXPY (ett Python-bibliotek för att ställa in optimeringsproblem), och OSQP Solver (en snabb algoritm som beräknar när färg ska utlösas).

Video bearbetades i 1 fps, med en gräns på 128 ramar per klipp, för att hålla beräkningen låg.

Proprietära system som testades var Gemini 1.5 Pro; GPT-4o; och Claude 3.5 Sonnet. Öppen källkods-video-MLLM som testades var LLaVA-OneVision-7B; Video-LLaMA2-7B; och Qwen2.5-VL-7B.

Strömmande MLLM som testades var Flash-VStream-7B; VideoLLM-online-8B; Dispider-7B; och TimeChat-Online-7B.

InternVL-3.5-8B och Qwen3-VL-8B testades i olika konfigurationer, som detaljerats i den första resultattabellen nedan, gällande StreamingBench:

Prestanda på StreamingBench för realtidsvisuell förståelse, jämförande proprietära, öppen källkods- och strömmande MLLM under olika färgbudgetar. RGB (%) anger andelen ramar som behålls i färg efter utlösning, där 100 betyder full färg och 0 betyder gråskale-endast inmatning. ColorTrigger utvärderas vid två driftspunkter, med 8,1 % och 34,3 % färg-ramar, och visar förbättrad total noggrannhet jämfört med gråskale-InternVL-3.5-8B-baslinjen, samtidigt som den väsentligt minskar färganvändning jämfört med fullfärgsinställningen.

Prestanda på StreamingBench för realtidsvisuell förståelse, jämförande proprietära, öppen källkods- och strömmande MLLM under olika färgbudgetar. RGB (%) anger andelen ramar som behålls i färg efter utlösning, där 100 betyder full färg och 0 betyder gråskale-endast inmatning. ColorTrigger utvärderas vid två driftspunkter, med 8,1 % och 34,3 % färg-ramar, och visar förbättrad total noggrannhet jämfört med gråskale-InternVL-3.5-8B-baslinjen, samtidigt som den väsentligt minskar färganvändning jämfört med fullfärgsinställningen.

Här kommenterar författarna:

‘ColorTrigger uppnår konkurrenskraftig prestanda på den realtidsvisuella förståelse-uppgiften i StreamingBench.

‘Vår modell med 34,3 % RGB-ramar uppnår en poäng på 75,24, vilket överträffar den nyligen publicerade online-modellen Dispider-7B och är nära TimeChat-Online-7B, samtidigt som den är jämförbar med proprietära modeller som Gemini 1.5 Pro (75,69) och överträffar GPT-4o (73,28) och Claude 3.5 Sonnet (72,44).’

InternVL-3.5-8B uppnådde en poäng på 77,20 med full färg, medan ColorTrigger nådde 75,24 med 65,7 % färre RGB-ramar – och även med endast 8,1 % färg-ramar uppnådde den en poäng på 70,72, vilket överträffade gråskale-baslinjen på 62,08 med 8,64 %, och förblev konkurrenskraftig med andra strömmande modeller.

Därefter testades OVO-Bench:

Prestanda på OVO-Bench över tre kategorier: realtidsvisuell perception, bakåtriktad spårning och framåtriktad aktiv svar, jämförande proprietära, öppen källkods- och strömmande MLLM under olika färgbudgetar. RGB (%) anger andelen ramar som behålls i färg efter utlösning, där 100 betyder full färg och 0 betyder gråskale-endast inmatning. ColorTrigger utvärderas vid två driftspunkter, med 7,1 % och 33,1 % färg-ramar, och visar förbättrad total noggrannhet jämfört med gråskale-InternVL-3.5-8B-baslinjen, samtidigt som den väsentligt minskar färganvändning jämfört med fullfärgsinställningen.

Prestanda på OVO-Bench över tre kategorier: realtidsvisuell perception, bakåtriktad spårning och framåtriktad aktiv svar, jämförande proprietära, öppen källkods- och strömmande MLLM under olika färgbudgetar. RGB (%) anger andelen ramar som behålls i färg efter utlösning, där 100 betyder full färg och 0 betyder gråskale-endast inmatning. ColorTrigger utvärderas vid två driftspunkter, med 7,1 % och 33,1 % färg-ramar, och visar förbättrad total noggrannhet jämfört med gråskale-InternVL-3.5-8B-baslinjen, samtidigt som den väsentligt minskar färganvändning jämfört med fullfärgsinställningen.

Av dessa resultat säger författarna:

‘Vår modell med 33,1 % RGB-ramar uppnår en total poäng på 52,5, vilket överträffar nästan alla befintliga öppen källkods-online-MLLM. Jämfört med basmodellen InternVL-3.5-8B med full RGB-inmatning (57,7) uppnår ColorTrigger en poäng på 52,5, samtidigt som den minskar RGB-ramanvändning med 66,9 %, vilket representerar enbart en 5,2-poängs minskning av total prestanda.

‘Denna blygsamma försämring åtföljs av betydande vinster i effektivitet, vilket visar effektiviteten i vår adaptiva routningsstrategi.’

Realtidsvisuell perception nådde 65,2 – en 11,4-poängs vinst jämfört med gråskale-baslinjen på 53,8. Även när den begränsades till endast 7,1 % RGB-ramar (en 92,9 % minskning) upprätthöll ColorTrigger en total poäng på 50,4, vilket förbättrade gråskale-inställningen med 2,5 poäng.

Slutligen genomförde forskarna ett test mot en offline-videouppgift (en analytisk uppgift som inte är utformad för att testa fördröjning eller andra “levande” miljöförhållanden, med Video-MME långformad videoförståelse-benchmark:

Prestandajämförelse mellan de testade systemen på Video-MME-benchmark.

Prestandajämförelse mellan de testade systemen på Video-MME-benchmark.

I detta test uppnådde modellen en total poäng på 66,1, medan den använde 37,6 % RGB-ramar, vilket överträffade fullfärg-InternVL-3.5-8B-baslinjepoängen på 65,6, trots att den använde 62,4 % färre färg-ramar.

Författarna kommenterar:

‘Detta visar att vår adaptiva utlösarmekanism inte bara minskar beräkningskostnaden, utan också kan förbättra prestanda genom att fokusera RGB-kapacitet på semantiskt kritiska ögonblick.

‘Notabelt överträffar ColorTrigger alla befintliga online-MLLM, inklusive TimeChat-Online-7B på 62,4 och Dispider-7B på 57,2, vilket bekräftar effektiviteten i att kombinera kontinuerlig gråskalekontext med selektiv RGB-förvärv för långformad videoförståelse.’

Slutsats

Jag tycker alltid om att se innovationer av det här slaget, inte minst för att AI:s höga och ständigt ökande behov av (elektrisk) kraft har producerat dystra rubriker under lång tid, och det är bra att se forskning som åtminstone indirekt adresserar problemet.

Det är cyniskt trösterikt att veta att energibesparingarna som görs i sådana företag är motiverade av kommersiella överväganden, eftersom dessa är mindre benägna att påverkas av kortvariga politiska beslut än de mer ädla, men mer angreppbara bekymren över energibesparing och global uppvärmning. Lyckligtvis uppnås samma mål, av olika skäl.

 

* Skapad av mig, enbart för att sammanfatta rapportens idé för läsaren.

Publicerad första gången torsdagen den 26 mars 2026

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai