Andersons vinkel

En 1970’er-vibe til energibesparende AI-overvågning

mm
Føj Unite.AI til dine foretrukne kilder på Google
Excerpts from a video simulating a grayscale video stream activated by object detection – source: https://videos.pexels.com/video-files/36553218/15498630_2560_1440_25fps.mp4

Nyt forskning viser, at de fleste video-AI ikke har brug for farver overhovedet, men kun aktiverer farver i nøgleøjeblikke og reducerer dataforbruget med over 90% med kun lidt tab i nøjagtighed.

 

Fjernstreaming-kameraer og andre ubundne, batteridrevne videoenheder kræver tæt optimerede overvågningsopsætninger, da de kan afhænge af ustabile strømkilder – såsom solceller – eller kræve periodisk opladning eller andre former for menneskelig indgriben, i situationer hvor det idealt set ikke skulle være nødvendigt for nogen at være til stede.

I forbindelse med denne forskningsretning er interessen for kameraudstyr også vokset (selv om sådanne enheder allerede var tæt begrænsede af strøm- og beregningsbegrænsninger), fordi kant-AI nu lover at gøre dem betydeligt mere nyttige.

Uden for disse overvejelser giver den langsigtige impuls til at reducere kant-AI- og overvågningsomkostninger (især i tilfælde, hvor sådanne besparelser ikke behøver at overføres til kunden) en overbevisende sag for innovation i energibesparende tilgange til ‘kant’-brugssteder.

Lyd Af

I feltet streaming video-sensing skal ressource-deprived kant-overvågningsenheder bruge den mindst mulige energi, mens de samtidig bruger nok strøm til at overvåge ‘interessante’ begivenheder – på det tidspunkt vil det være værd at bruge flere ressourcer.

Effektivt er dette en lignende brugsanvisning som bevægelsesdrevne lys, der kun giver lys, når lavstrømsforbrugssensorer bestemmer, at der er nogen til stede for at værdsætte det.

Siden lydovervågning og kompression er bemærkelsesværdigt mindre ressourcekrævende end video, har flere tilgange i de senere år forsøgt at bruge lyddrevne signaler til at ‘aktivere’ opmærksomhed i begrænsede systemer; rammer som Listen to Look og Egotrigger:

I Egotrigger-systemet aktiverer lyddrevne signaler selektivt billedindsamling fra hånd-objektinteraktionssignaler, reducerer redundante rammer og bevarende episodiske hukommelsespræstationer i ressource-begrænsede smart-glasses-systemer. Kilde - https://arxiv.org/pdf/2508.01915

I Egotrigger-systemet aktiverer lyddrevne signaler selektivt billedindsamling fra hånd-objektinteraktionssignaler, reducerer redundante rammer og bevarende episodiske hukommelsespræstationer i ressource-begrænsede smart-glasses-systemer. Kilde

Det er tydeligt, at lyd ikke er det ideelle medium til at søge efter visuelle begivenheder, da mange essentielle sådanne begivenheder kan have ingen tilhørende lydsignal eller kan forekomme uden for rækkevidde af kant-mikrofoner.

Lys Søvnig

Hvad der måske er bedre, foreslår en ny artikel, er en videostrøm, der kan arbejde sammen med AI til at øge ressourcer, så snart en overvåget begivenhed indtræffer. Simulationen nedenfor* giver en generel idé om konceptet – lavopløsnings-overvågning vedligeholdes på det laveste signalniveau, der er nødvendigt for objektdetektions-rammer til at fungere, og for at fortælle systemet at øge opløsningen på grund af udløsning af en begivenhed:

En simulation af det ønskede adfærd – at streaming og analyse opererer på deres laveste niveau for ressourceforbrug som standard; kun nok til at udløse højere ressourceforbrug, når ‘interessante’ eller søgte begivenheder detekteres i gråtonestrømmen. Den sorte-hvide overvågningsstil kan være ret ‘retro’, men det kan være et tegn på, hvad der kommer. Kilde

Det nye arbejde, et akademisk samarbejde mellem forskellige britiske institutioner og Huawei, foreslår en træningsfri, AI-faciliteret, gråton-altid, farve-på-krav-skema for kant-overvågning – designet til at fungere ved lav token-forbrug, når der ikke sker nogen ‘nøglebegivenheder’, og kun til at øge forbruget for begivenhedens varighed.

I streaming video-forståelsesbenchmarks kunne det nye system, kaldet ColorTrigger, opnå 91,6% af fuld farve-baseline-præstation, mens det kun brugte 8,1% af de RGB-rammer i disse standarder:

Når modellen kun ser gråtonestrøm, forvirrer den nøgledeataljer og giver forkerte svar; men udløsning af farve på de rette tidspunkter afklarer billedet og retter fejl, der udløses af opgaver, der afhænger af farve.

Når modellen kun ser gråtonestrøm, forvirrer den nøgledeataljer og giver forkerte svar; men udløsning af farve på de rette tidspunkter afklarer billedet og retter fejl, der udløses af opgaver, der afhænger af farve. Kilde

Den nye artikel hedder Farve, når det tæller: Gråton-guidet online-udløsning for altid-på-streaming video-sensing og kommer fra otte forskere på Queen Mary University of London, Durham University, Imperial College London og Huawei Noah’s Ark Lab. Artiklen har også en tilhørende projektside.

Metode

For at bevare den tidsmæssige struktur i det nye system, vedligeholder ColorTrigger konstant lav-båndbredde-gråton-overvågning. En kausal online-udløser analyserer en glidende vindue (dvs. et fleksibelt plus-minus-række af rammer omkring et bestemt tidspunkt, såsom opdækkelsen af en begivenhedsudløser) af den lavopløsningsstrøm:

Kontinuerlig højopløsnings-RGB-optagelse dræner hurtigt strøm, så optagelsen stopper tidligt, og nøgleøjeblikke kan gå tabt. Omvendt holder ColorTrigger en lavstrøms-gråtonstrøm kørende hele tiden og aktiverer kun RGB-kameraet i udvalgte øjeblikke - hvilket udvider optagelsestiden, mens det stadig indfanger de visuelle detaljer, der er nødvendige for at besvare senere spørgsmål.

Kontinuerlig højopløsnings-RGB-optagelse dræner hurtigt strøm, så optagelsen stopper tidligt, og nøgleøjeblikke kan gå tabt. Omvendt holder ColorTrigger en lavstrøms-gråtonstrøm kørende hele tiden og aktiverer kun RGB-kameraet i udvalgte øjeblikke – hvilket udvider optagelsestiden, mens det stadig indfanger de visuelle detaljer, der er nødvendige for at besvare senere spørgsmål. Kilde

Mens systemet er i ‘passiv’ tilstand (dvs. det har ikke identificeret en udløserbegivenhed endnu), allokerer dens dynamiske token-router begrænset kapacitet til en asymmetrisk decoder, der altid søger efter redundans og begivenheder, der indikerer nyt, hvorefter token-flowet prioriterer kapacitet over kompression:

Skema for ColorTrigger. Systemet overvåger en glidende vindue-analyse af nærliggende rammer for at detektere redundans og ændring, og udløser kun højopløsnings-RGB-optagelse, når det er nødvendigt, under en kreditbaseret budget. En dynamisk token-router allokerer færre tokens til gråton-indgange og flere til udvalgte RGB-rammer, og bevarende tidsorden for efterfølgende Multimodal Large Language Model (MLLM)-behandling.

Skema for ColorTrigger. Systemet overvåger en glidende vindue-analyse af nærliggende rammer for at detektere redundans og ændring, og udløser kun højopløsnings-RGB-optagelse, når det er nødvendigt, under en kreditbaseret budget. En dynamisk token-router allokerer færre tokens til gråton-indgange og flere til udvalgte RGB-rammer, og bevarende tidsorden for efterfølgende Multimodal Large Language Model (MLLM)-behandling.

På en ramme-for-ramme-basis skal systemet afgøre, om det aktuelle øjeblik indeholder ny information, der er værd at betale prisen for at indfange farve. Den korte, nærliggende historie af gråton-rammer i glidende vindue giver ColorTrigger mulighed for at sammenligne den aktuelle ramme med dens umiddelbare fortid. Hver ramme konverteres til en kompakt funktionrepræsentation, og disse funktioner sammenlignes med hinanden for at måle, hvor meget eller lidt deres værtsrammer ligner.

Denne sammenligningsproces er organiseret i en struktur, der summerer hvor meget hver ramme overlapper med de andre, og effektivt indfanger, om scenen gentager eller ændrer sig. En let optimeringsproces tildeler en vigtighedsscore til hver ramme i vinduet, der favoriserer nyt.

Farvebalance

For at forhindre overudnyttelse af farve begrænser et simpelt ‘kreditsystem’ hvor ofte farve kan udløses over tid. Kreditter akkumulerer langsomt og forbruges, når farve anmodes om, og sikrer, at aktivitetsudbrud er tilladt, men samlet brug forbliver kontrolleret. En ramme ‘opgraderes’ kun til farve, hvis den er både informativ og hvis der er nok kreditter til rådighed.

Den dynamiske token-router kontrollerer, hvor meget detalje hver ramme modtager, i stedet for at behandle hver ramme i fuld kvalitet. Når der ikke detekteres noget vigtigt, beholdes gråton-rammen i lav opløsning og omdannes til en lille, komprimeret samling af tokens. Når et vigtigt øjeblik detekteres, skifter systemet til farve og behandler rammen i højere opløsning, og tilbyder en rigere og mere detaljeret repræsentation.

Begge typer rammer går gennem samme model, men gråton-rammer behandles på en lettere måde, mens udvalgte farve-rammer får mere opmærksomhed. Udgangene kombineres derefter i deres oprindelige rækkefølge og sendes til modellen som en kontinuerlig strøm.

Fordi de fleste rammer forbliver letvægts- og kun få opgraderes, sparer systemet en stor mængde beregning, mens det stadig indfanger de nøgledeataljer, når det er nødvendigt:

Fra artiklen, et andet eksempel, hvor systemet kræver midlertidigt at øge ressourcer for at skelne en farve.

Fra artiklen, et andet eksempel, hvor systemet kræver midlertidigt at øge ressourcer for at skelne en farve.

Data og Tests

For at teste systemet evaluerede forskerne det mod StreamingBench og OVO-Bench video-benchmarks, og undgik behandlingen af future indhold (som er en potentiel fare i offline-tests).

Den frosne Multimodal Large Language Model (MLLM) brugt var InternVL3.5-8B-Instruct, med den kausale udløser implementeret via CLIP ViT-B/16.

Gråton-strømmen var begrænset til luminanskanalen i CIELAB-farverummet, i overensstemmelse med tidligere arbejde, og de resulterende gråton-rammer var omskaleret til 224x224px før patchificering (opdeling af et billede i små faststørrelses-blokke, så hver blok kan behandles som en separat enhed af modellen).

RGB-rammerne, omvendt, havde en højere bitrate og blev behandlet i 448x448px, og producerede 256 tokens, i modsætning til de 64 tokens, der blev produceret for gråton-rammerne.

Almindelige optimeringsværktøjer blev brugt til at træffe systemets beslutninger: CVXPY (en Python-bibliotek til oprettelse af optimeringsproblemer) og OSQP Solver (en hurtig algoritme, der beregner, hvornår farve skal udløses).

Video blev behandlet i 1fps, med en grænse på 128 rammer per klip, for at holde beregningen lav.

Proprietære systemer, der blev testet, var Gemini 1.5 Pro; GPT-4o; og Claude 3.5 Sonnet. Åbne kildevideo-MLLM’er, der blev testet, var LLaVA-OneVision-7B; Video-LLaMA2-7B; og Qwen2.5-VL-7B.

Streaming MLLM’er, der blev testet, var Flash-VStream-7B; VideoLLM-online-8B; Dispider-7B; og TimeChat-Online-7B.

InternVL-3.5-8B og Qwen3-VL-8B blev testet i forskellige konfigurationer, som er detaljeret i den første resultattabel nedenfor, vedrørende StreamingBench:

Præstation på StreamingBench for realtids-visuel-forståelsesopgaver, sammenligning af proprietære, åbne kilde- og streaming-MLLM'er under forskellige farvebudgetter. RGB (%) angiver proportionen af rammer, der beholdes i farve efter udløsning, hvor 100 angiver fuld farve og 0 angiver gråton-kun-indgang. ColorTrigger blev evaluueret ved to driftspunkter, der beholdt 8,1% og 34,3% farve-rammer, og demonstrerede forbedret overall-nøjagtighed i forhold til gråton-InternVL-3.5-8B-basen, mens det samtidig reducerede farveforbruget betydeligt i forhold til fuld farve-indstillingen.

Præstation på StreamingBench for realtids-visuel-forståelsesopgaver, sammenligning af proprietære, åbne kilde- og streaming-MLLM’er under forskellige farvebudgetter. RGB (%) angiver proportionen af rammer, der beholdes i farve efter udløsning, hvor 100 angiver fuld farve og 0 angiver gråton-kun-indgang. ColorTrigger blev evaluueret ved to driftspunkter, der beholdt 8,1% og 34,3% farve-rammer, og demonstrerede forbedret overall-nøjagtighed i forhold til gråton-InternVL-3.5-8B-basen, mens det samtidig reducerede farveforbruget betydeligt i forhold til fuld farve-indstillingen.

Her kommenterer forfatterne:

‘ColorTrigger opnår konkurrencedygtig præstation på Real-time Visual Understanding-underopgaven på StreamingBench.

‘Vores model med 34,3% RGB-rammer scorer 75,24, overgår den seneste online-model Dispider-7B og er tæt på TimeChat-Online-7B, mens den er sammenlignelig med proprietære modeller som Gemini 1.5 Pro (75,69) og overgår GPT-4o (73,28) og Claude 3.5 Sonnet (72,44).’

InternVL-3.5-8B opnåede en score på 77,20 ved brug af fuld farve, mens ColorTrigger nåede en score på 75,24 ved brug af 65,7% færre RGB-rammer – og selv med kun 8,1% farve-rammer opnåede den en score på 70,72, overgående gråton-basen på 62,08 med 8,64%, og forblev konkurrencedygtig med andre streaming-modeller.

Herefter blev OVO-Bench testet:

Præstation på OVO-Bench over tre kategorier: Real-Time Visual Perception, Backward Tracing og Forward Active Responding, sammenligning af proprietære, åbne kilde- og streaming-MLLM'er under forskellige farvebudgetter. RGB (%) angiver proportionen af rammer, der beholdes i farve efter udløsning, hvor 100 angiver fuld farve og 0 angiver gråton-kun-indgang. ColorTrigger blev evaluueret ved to driftspunkter, der beholdt 7,1% og 33,1% farve-rammer, og viste forbedret overall-nøjagtighed i forhold til gråton-InternVL-3.5-8B-basen, mens det samtidig reducerede farveforbruget betydeligt i forhold til fuld farve-indstillingen.

Præstation på OVO-Bench over tre kategorier: Real-Time Visual Perception, Backward Tracing og Forward Active Responding, sammenligning af proprietære, åbne kilde- og streaming-MLLM’er under forskellige farvebudgetter. RGB (%) angiver proportionen af rammer, der beholdes i farve efter udløsning, hvor 100 angiver fuld farve og 0 angiver gråton-kun-indgang. ColorTrigger blev evaluueret ved to driftspunkter, der beholdt 7,1% og 33,1% farve-rammer, og viste forbedret overall-nøjagtighed i forhold til gråton-InternVL-3.5-8B-basen, mens det samtidig reducerede farveforbruget betydeligt i forhold til fuld farve-indstillingen.

Om disse resultater siger forfatterne:

‘Vores model med 33,1% RGB-rammer opnår en samlet score på 52,5, overgår næsten alle eksisterende åbne kilde-online-MLLM’er. I forhold til basemodellen InternVL-3.5-8B med fuld RGB-indgang (57,7) scorer ColorTrigger 52,5, mens det reducerer RGB-rammebrug med 66,9%, hvilket kun repræsenterer en 5,2-point nedgang i overall-præstation.

‘Denne beskedne nedgang er ledsaget af betydelige gevinster i effektivitet, hvilket demonstrerer effektiviteten af vores adaptive routing-strategi.’

Real-Time Visual Perception nåede en score på 65,2 – en 11,4-point forbedring i forhold til gråton-basen på 53,8. Selv med kun 7,1% RGB-rammer (en 92,9% reduktion) opretholdt ColorTrigger en samlet score på 50,4, hvilket forbedrede gråton-indstillingen med 2,5 point.

Til sidst udførte forskerne en test mod en offline video-opgave (en analytisk opgave, der ikke er designet til at teste latency eller andre ‘live’ miljøbetingelser, ved brug af Video-MME lang-form video-forståelses-benchmark:

Præstations-sammenligning af de testede systemer på Video-MME-benchmark.

Præstations-sammenligning af de testede systemer på Video-MME-benchmark.

I denne test opnåede modellen en samlet score på 66,1, mens den brugte 37,6% RGB-rammer, overgående fuld farve-InternVL-3.5-8B-basen på 65,6, selv om den brugte 62,4% færre farve-rammer.

Forfatterne kommenterer:

‘Dette demonstrerer, at vores adaptive udløsningsmekanisme ikke kun reducerer beregningsomkostninger, men også kan forbedre præstationen ved at fokusere RGB-kapacitet på semantisk kritiske øjeblikke.

‘Bemærkelsesværdigt overgår ColorTrigger alle eksisterende online-MLLM’er, herunder TimeChat-Online-7B på 62,4 og Dispider-7B på 57,2, hvilket bekræfter effektiviteten af at kombinere kontinuerlig gråton-kontekst med selektiv RGB-optagelse til lang-form video-forståelse.’

Konklusion

Jeg nyder altid at se innovationer af denne type, ikke mindst fordi AI’s høje og voksende behov for (elektrisk) strøm har produceret dystre overskrifter i lang tid, og det er godt at se forskning, der i det mindste indirekte adresserer problemet.

Det er cynisk trøst at vide, at strømsparelserne, der opnås i sådanne forsøg, er motiveret af kommercielle overvejelser, da disse er mindre sandsynlige at blive påvirket af kortvarige politiske beslutninger end de mere ophøjede, men mere angribelige bekymringer over energibesparelse og global opvarmning. Heldigvis opnås det samme mål, af forskellige årsager.

 

* Oprettet af mig, kun for at indkapsle artiklens idé for læseren.

Først publiceret torsdag, 26. marts 2026

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai