Andersons vinkel

Vil AI Til Sidst Blomstre Udenfor Muren?

mm
Føj Unite.AI til dine foretrukne kilder på Google
A cartoon image of a SIMs-style game where a Scottish Laird in his castle is regarding the thriving villagers beyond his moat with puzzlement. GPT-1.5.

Big AI’s omkostninger og begrænsninger samt dets indflydelse på hardwareomkostninger tvinger brugerne til at bygge deres egne systemer – ligesom stigende regulering truer med at lukke denne ‘skygge-AI-økonomi’ ned.

 

Opinion Among de mange ‘gotchas’, der dukker op i videnskabelige forskningsartikler, er en af de hyppigste, at problemet, artiklen beskæftiger sig med, allerede var løst andre steder, og at den nye forsknings bidrag kun er tilfældigt eller inkrementalt.

Dette kan ske af en række årsager: forskerne håbede på et kvantespring, men fik i stedet et quasi-hop; tidligere løsninger af problemet var mere ressourcekrævende end den nye tilbud; eller blot, at projektets mål fejlede fuldstændigt, men at ‘publicer-eller-forfald’-kulturen i akademisk forskning tvang holdet til at udgive det alligevel (ofte begravet mellem en lavine af en portals travleste udgivelsesdag).

I maskinlæringslitteraturen er der dog en relativt ny og ikke-apologetisk årsag, der bliver mere hyppig: at funktionen eller funktionaliteten kun er tilgængelig gennem lukkede, API-bundne porte.

Jeg overvejede en sådan artikel tidligere på dagen – et samarbejde mellem kinesiske universiteter og Amazon, der beskæftiger sig med det gentagne problem med objekt-fjernelsesfejl i diffusion-baserede billedredigerings-systemer, der ofte blot ‘genopfylder’ målområdet med et lignende objekt i stedet:

Til venstre er det originale billede; til højre for det, den røde segmenteringsmaske, der fortæller AI, hvilken del af billedet der skal fjernes; herefter 'Vores', viser en succesfuld objekt-fjernelses-tilgang – og de to sidste billeder viser lignende systemer, der i stedet for at fjerne bussen, blot indsætter en anden bus i stedet. Kilde - https://arxiv.org/pdf/2603.27599v1

Til venstre er det originale billede; til højre for det, den røde segmenteringsmaske, der fortæller AI, hvilken del af billedet der skal fjernes; herefter ‘Vores’, viser en succesfuld objekt-fjernelses-tilgang – og de to sidste billeder viser lignende systemer, der i stedet for at fjerne bussen, blot indsætter en anden bus i stedet. Kilde

I eksemplet ovenfor viser billedet i midten den nye tilgang, der succesfuldt fjerner bussen og indsætter en plausibel baggrund, vs. de to tidligere metoder (de to venstre billeder), der hver fjerner bussen, men derefter indsætter en anden bus i billedet!

Gotcha!

Lad os se bort fra årsagerne til og konsekvenserne af denne udfordring for nu (og det er et interessant emne ), så jeg fik øje på en klassisk ‘gotcha’, da jeg læste den nye artikel: forfatternes medgivelse af, at dyre, proprietære systemer allerede kan udføre denne opgave meget pålideligt – noget, som jeg ved fra nogle års brug af Adobe Firefly i Photoshop, blandt andre lukkede systemer:

‘[Diffusion-baserede] metoder hallucinerer ofte ved at indsætte uventede objekter efter at have fjernet de målrettede objekter, hvilket fører til kontekstuelt inkonsistente [resultater].

‘På den anden side er nyere lukkede multimodale modeller som ChatGPT og Nano Banana mere kraftfulde i objekt-fjernelse, men involverer store parameterantal og høj beregnings-overhead, hvilket hindrer deres praktiske udvikling på edge-enheder.

‘Derfor er det meget nødvendigt at udvikle en dedikeret objekt-fjernelsesmodel, der ikke kun kan give bedre fjernelsespræstation, men også nyder lav inferens-forsinkelse og betydeligt færre parametre.’

Denne forklaring, der fokuserer på de tekniske hindringer, udelader den åbenlyse kendsgerning, at lukkede arkitekturer som ChatGPT og Nano Banana ikke er tilgængelige overhovedet for lokal installation. Selv om disse systemers evne til at producere kontroversielt materiale har givet deres gate-keeping ekstra offentlig retfærdiggørelse i det sidste år, er porte af denne type primært proprietære på grund af kommercielle imperativer.

I essensen antyder den nye artikel, at selv om det målrettede problem er løst i kommercielle systemer, kan dette være irrelevant for os andre, der har brug for at lære, hvordan vi kan løse det i den ‘rigtige verden’ – dvs. i åbne systemer, uanset om de realistisk kan installeres lokalt eller ej.

Parallel Udvikling

Men hvorfor løse et problem, der stadig afhænger af et betalt system, ikke på grund af proprietære begrænsninger, men fordi det nødvendige GPU-compute overstiger, hvad nogen lokal opsætning realistisk kan holde til? De fleste nye ‘åbne’ artikler og kode-repositorier har trænings-/inference-opsætninger med skandaløse ressourcekrav, såsom clusters af A100s.

Nu afhænger det af, hvad man mener, at alle disse ventende, økonomi-bustende AI-datacenter skal opfylde, når de endelig kommer online. Almuenes frygt og elittens håb forestiller sig befæstede, proprietære systemer, der kan erstatte job, mens de konstant øger abonnementspriser og sænker serviceniveauer for at tilfredsstille den tidlige venturekapital, der måtte vente 3-5 år for at operationalisere.

Men en voksende tendens i litteraturen synes at støtte en alternativ fremtid, og ‘go-it-alone’-ånden i mange online-communities som f.eks. r/stablediffusion-subreddit, der i øjeblikket har 920.000 brugere, og som har længe siden forbudt indlæg om lukkede systemer til billed-/video-generering.

I denne alternative fremtid vil den nye globale tilførsel af AI-datacenter facilitere rå-compute til bruger-konfigurerede, bruger-definerede systemer, snarere end at imødekomme kravene fra monumentale ‘black box’-rammer som ChatGPT og Adobe Firefly.

Overflade-Friktion

Når man ser på de komplekse, Patreon-minede fjern-GPU-gennemgange på r/stablediffusion, synes det hele umuligt lige nu: modellerne ændrer konstant målstenene med hver opdatering; de er svære at deployere lokalt, selv i de letteste og mest brugervenlige rammer; og generelt antyder mængden af friktion, der er involveret, en forfølgelse, der er strengt for geek-hobbyister og for den mere eventyrlige type virksomheder, der ikke er direkte involveret i AI, men som ønsker at udvikle og vedligeholde deres egne lokale systemer, snarere end at leje sådanne evner.

Men over de sidste 30 år er hver teknologi, hvor der har været stor efterspørgsel efter åben og demokratisk forenkling og kommercialisering, blevet det, med de mest-udbredte løsninger, der normalt opstår fra spændingerne mellem kommercielle systemer og åbne-kilde-alternativer og -initiativer.

Forfølgelser, der engang var specialiserede ‘nerd’-enklaver, såsom internet-forbindelser, indholdsstyringssystemer og blog-rammer, samt internet-sikkerhed, fotografering og medie-styring, er alle udviklet fra forvirrende kompleksitet mod enkelthed og nytte.

Derfor kan den senere AI-landskab være mere varieret og fuld af mindre og ægte konkurrerende spillere end det nuværende AI-markedsledere måske ønsker.

Selv-Realisering, Af Nødvendighed

Ironisk nok bidrager ‘Big AI’ væsentligt til en fremvoksende ånd af uafhængighed blandt slutbrugere ved at suge alle computer-komponenter – især DRAM – der ellers ville være gået til ‘almindelige’ forbrugere.

Følgelig forestiller mange sig en fremtid, hvor lukkede ‘global AI’-ressourcer tilgås via underpowered thin clients, og udvikler en voksende interesse i at vedligeholde deres eksisterende udstyr.

AI’s angreb på teknologi-udbuds-kæder har også fået teknologi-tjeneste-udbydere til at øge deres priser i de sidste 3-6 måneder, enten fordi mindre virksomheder virkelig er blevet klemt af hardware-mangelen, eller blot fordi AI.

Dette har ført til en voksende interesse i selv-værtning og på-prem – herunder selv-værtning af maskinlærings-netværk.

Jeg blev selv fanget i dette for nylig, da jeg skiftede til lokal LAN-lagring af billeder og videoer, samt fil-bakuper. For det sidste har jeg brugt den gratis og åbne Immich multi-platform medie-server, hvilket hjælper mig med at flytte væk fra prisstigningerne (og andre bekymringer) omkring iCloud og andre cloud-lagring-udbydere:

Den gratis Immich-platform kan holde dine medier på dit udstyr og private til dine egne kanaler. I dette tilfælde bruger jeg også Immich på Docker til at servere min NVIDIA 3090 GPU over LAN, hvor billederne og videoerne er gemt, så den kraftigere GPU kan håndtere tung billed-/video-behandling.

Den gratis Immich-platform kan holde dine medier på dit udstyr og private til dine egne kanaler. I dette tilfælde bruger jeg også Immich på Docker til at servere min NVIDIA 3090 GPU over LAN, hvor billederne og videoerne er gemt, så den kraftigere GPU kan håndtere tung billed-/video-behandling.

Hvis min egen oplevelse er nogen repræsentativ indication, vibe-coding – som i øjeblikket er forbandet i mange engang-‘rene’ online-communities – er med til at fremme denne bølge af uafhængighed (selv om det kan true den åbne kilde-repositorier, det hviler på).

For eksempel har netværk altid været mit svage punkt i computing, så AI-assistance var afgørende for mig for at få en sikker VPS kørende, til at støtte en række nye selv-værtnings-tjenester.

På denne måde er ‘Big AI’ sandsynligvis med til at styrke ‘small AI’; derfor kan vi måske betragte det nuværende opsving i hyperskala-, hyper-værdi-AI-virksomheder som en nødvendig, men kun overgangsstat, før en mere demokratisk og bruger-empoweret AI-samfund opstår, der afviser moat-søgende, rent-søgende korporationer som brugte booster-raketter – ligesom dot-com-busten i 2000 efterlod udnytteligt infrastruktur, der ville accelerere nettet langt efter, at virksomhederne, der havde betalt for det, var kollapset.

Overholdelsesalderen

Nå, det er sandsynligvis ikke gået tilbage denne gang.

Selv hvis vi er tilbøjelige til at danne en slags ex-moat-fringe-samfund, synes regulering omkring AI, kombineret med den nuværende globale tendens mod alders-verificering, sandsynligvis at forhindre og blokere disse udviklingsveje.

Forankringen til at forhindre en ‘skygge-AI-økonomi’ er regulering. Allerede kræver centrale repositorier som GitHub og Hugging Face ofte online-login, før de tillader brugere at klone repositorier lokalt, afhængigt af repo-indstillingerne.

Derfor findes mekanismerne allerede til at gennemtvinge overvågning af AI-rammer mere omfattende end nuværende praksis; og viljen til at øge sådan overvågning konsoliderer nu fra individuelle regerings-initiativer til en global impetus.

Så, hvis markedskræfter og FOSS-bevægelsens ingeniøritænkning fjerner friktionen fra casual AI-udvikling, synes vejspærringer at være på vej tilbage i form af overholdelseskrav: overholdelseskrav, der, selv om de er besværlige, er værdifulde for virksomheder, men måske ikke for enkelt-personer – ligesom den friktion, der er blevet tilføjet forbruger-niveau-online-betalingssystemer, siden den gyldne alder for PayPal i 2000’erne.

Enten har Meta brugt 2 milliarder dollars på lobbyvirksomhed for OS-niveau-alder-kontrol på grund af deres betydelige AI-investering eller deres data-indsamling-interesser, så udfaldet af big techs støtte til alders-kontrol er, at ‘lokal’ AI kan blive lige så reguleret som en klasse-A-stof; og ligesom DMCA var designet til at kriminalisere intention snarere end nogen bestemt copyright-evasion-mekanisme, kan internationale AI-reguleringer i så fald gøre al ikke-overholdt brug af maskinlærings-tilgang til en kriminaliseret handling, med meget lille aktiv overvågning.

Dette kunne have set ud som en overordentligt dystopisk tilgang for et år siden – men det var før Californien og systemd fik baggrund for idéen om hardware-niveau-alder-verificering, som i øjeblikket ses af mange som en proxy for en CCP-stil forbud mod online-anonymitet.

Konklusion

Så, mens den lovgivningsmæssige og lovgivningsmæssige baggrund måske er ved at forberede sig på at inkorporere AI i et højt reguleret område, så kan brugerne ikke længere ‘brygge deres egen’ mere end de kan dyrke eller fermentere regulerede stoffer uden tilladelse, fastholder forskningssektoren sin mere optimistiske holdning – at AI vil blive en demokratiseret og nyttig kraft i samfundet som helhed, snarere end kun for tilhængerne af den mest populære lukkede kilde-udbyder i dag.

Mange ting afhænger af, hvordan ruinernes disposition ser ud efter, at AI-boblen brister – i det mindste i den udstrækning, som udbydere enten konsoliderer eller markedet sætter sig til at blive i langvarig balkanisering – hvilket sandsynligvis ville kræve en mere mild reguleringstouch.

 

Offentliggjort første gang onsdag, 1. april 2026

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai