Andersons vinkel

Kommer AI att blomstra utanför vallgraven?

mm
Lägg till Unite.AI bland dina föredragna källor på Google
A cartoon image of a SIMs-style game where a Scottish Laird in his castle is regarding the thriving villagers beyond his moat with puzzlement. GPT-1.5.

Stor AI:s kostnader och begränsningar, samt dess påverkan på hårdvarukostnader, tvingar användare att bygga sina egna system – precis som den ökande regleringen hotar att stänga av den “skugg-AI-ekonomin”.

 

Åsikt Bland de många “gotchas” som dyker upp i vetenskapliga forskningsartiklar, är en av de vanligaste att problemet som artikeln behandlar redan har lösts någon annanstans, och att den nya forskningens bidrag bara är tillfälligt eller inkrementellt.

Detta kan hända av flera skäl: forskarna hoppades på ett kvantsteg, men fick ett quasi-hopp istället; att problemets tidigare lösningar var mer resurskrävande än det nya erbjudandet; eller helt enkelt att projektets mål misslyckades helt, men den “publicera-eller-försvinna”-kulturen inom akademisk forskning tvingade teamet att publicera det ändå (ofta begravt bland en lavin av en portals mest publicerade dag).

I maskinläringslitteraturen, däremot, har en relativt ny och icke-apologetisk anledning blivit vanligare: att funktionen eller funktionaliteten som erbjuds bara för närvarande är tillgänglig via stängda, API-bundna portaler.

Jag övervägde en sådan artikel tidigare idag – ett samarbete mellan kinesiska universitet och Amazon (AMZN ), som behandlar det återkommande problemet med objektborttagningsfel i diffusionsbaserade bildredigeringsystem, som ofta helt enkelt “återfyller” målområdet med ett liknande objekt istället:

Till vänster är den ursprungliga bilden; till höger om den, den röda segmenteringsmasken som talar om för AI vilken del av bilden som ska tas bort; nästa, 'Vår', visar en lyckad objektborttagningsmetod – och de två sista bilderna visar liknande system som, istället för att ta bort bussen, sätter in en annan buss istället. Källa - https://arxiv.org/pdf/2603.27599v1

Till vänster är den ursprungliga bilden; till höger om den, den röda segmenteringsmasken som talar om för AI vilken del av bilden som ska tas bort; nästa, ‘Vår’, visar en lyckad objektborttagningsmetod – och de två sista bilderna visar liknande system som, istället för att ta bort bussen, sätter in en annan buss istället. Källa

I exemplet ovan visar den mittersta bilden den nya metoden som lyckas ta bort bussen och sätter in en trovärdig bakgrund, till skillnad från de två tidigare metoderna (de två vänstra bilderna), som tar bort bussen men sedan sätter in en annan buss i bilden!

Gotcha!

Om man lägger åt sidan varför och hur denna utmaning uppstår för tillfället (och det är ett intressant ämne ), så kom jag sedan över en klassisk “gotcha” när jag läste den nya artikeln: författarnas medgivande att dyra, proprietära system redan kan utföra denna uppgift ganska tillförlitligt – något som jag vet, från ett par års användning av Adobe Firefly i Photoshop, bland andra stängda system:

‘[Diffusionsbaserade] metoder hallucinerar ofta genom att infoga oavsiktliga objekt efter att ha tagit bort målobjekten, vilket leder till kontextuellt oförenliga [resultat].

‘Å andra sidan är de senaste stängda, multimodala modellerna, såsom ChatGPT och Nano Banana, mer kraftfulla när det gäller objektborttagning, men kräver stora parameterantal och hög beräkningsbelastning, vilket hindrar deras praktiska distribution på kantenheter.

‘Därför är det ganska nödvändigt att utveckla en dedikerad objektborttagningsmodell som inte bara möjliggör överlägsen borttagningsprestanda utan också åtnjuter låg inferensfördröjning och betydligt färre parametrar.’

Denna förklaring, som fokuserar på de tekniska hindren, utelämnar den uppenbara faktum att stängda arkitekturer som ChatGPT och Nano Banana inte är tillgängliga alls för lokal installation. Även om sådana system förmåga att producera kontroversiellt material har gett deras grindvaktning extra allmän rättfärdigande under det senaste året, är portalerna av detta slag proprietära främst på grund av kommersiella imperativ.

I princip implicerar den nya artikeln att även om målproblemet är löst i kommersiella system, kan detta vara irrelevant för resten av oss, som behöver lära sig att lösa det i den “verkliga världen” – d.v.s. i öppen källkod, oavsett om dessa realistiskt kan installeras lokalt eller inte.

Parallell utveckling

Men varför lösa ett problem som fortfarande beror på ett betalt system, inte på grund av proprietära begränsningar, utan för att den erforderliga GPU-beräkningen överstiger vad som helst lokalt setup kan realistiskt upprätthålla? De flesta sådana nya “öppna” artiklar och kodrepositoryn presenterar utbildnings/inferenssetup med skandalösa resurskrav, såsom kluster av A100.

Ja, det beror på vad man tror att alla dessa väntande, ekonomiförstörande AI-datacenter kommer att uppfylla när de slutligen kommer online. Gemene mans rädsla och eliter nas förhoppningar ser moatade, proprietära system som ChatGPT-nivå som förskjuter jobb, medan de ständigt höjer prenumerationskostnader och sänker servicenivåer, för att tillfredsställa den tidiga VC-kapital som måste vänta 3-5 år för att operationalisera.

Men en växande trend i litteraturen tycks stödja en alternativ framtid, och den “gå-ensam”, marginella andan i många online-samhällen som r/stablediffusion-subreddit, som för närvarande har 920 000 användare, och som har länge förbjudit inlägg relaterade till stängda källkods bild-/videogenereringssystem.

I denna alternativa framtid kommer den nya globala tillförseln av AI-datacenter att underlätta råberäkning för användarkonfigurerade, användardefinierade system, snarare än att möta kraven från monumentala “svarta låda”-ramverk som ChatGPT och Adobe Firefly.

Ytfriction

När man tittar på de komplexa, Patreon-grävda, fjärr-GPU-genomgångarna på r/stablediffusion, verkar allt omöjligt just nu: modellerna ändrar målstenarna med varje uppdatering; de är svåra att distribuera lokalt, även i de enklaste och mest användarvänliga ramverken; och i allmänhet antyder den mängd friktion som är inblandad att det är en strävan som är strikt för “nörd”-hobbyister, och för den mer äventyrliga stammen av företag som inte är direkt involverade i AI, men som vill utveckla och underhålla sina egna lokala system, snarare än att hyra sådana funktioner.

Men under de senaste trettio åren har varje teknik där det fanns ett stort behov av öppen och demokratisk förenkling och kommersialisering tendensen att få det, med de mest spridda lösningarna som vanligtvis dyker upp från spänningarna mellan kommersiella system och öppen källkodsalternativ och initiativ.

Strävanden som en gång var specialiserade “nörd”-enklaver, såsom internetanslutningar, innehållshanteringssystem och blogg-ramverk, samt internet-säkerhet, fotografering och mediehantering, har alla utvecklats från förvirrande komplexitet till enkelhet och användbarhet.

Därför kan den senare AI-landskapet vara mer varierat och fullt av mindre och genuint konkurrerande aktörer än den nuvarande AI-marknadsledarna kanske föredrar.

Självförverkligande, av nödvändighet

Ironiskt nog bidrar “Stor AI” mycket till en framväxande ande av oberoende bland slutanvändare, genom att suga upp alla datorkomponenter – särskilt DRAM – som annars skulle ha gått till “vanliga” konsumenter.

Följaktligen ser många en framtid där stängda källkods “globala AI-resurser” kommer att nås via underpowered tunna klienter och utvecklar ett växande intresse för att underhålla sin befintliga utrustning.

AI:s angrepp på teknikförsörjningskedjor har också fått teknikserviceleverantörer att höja sina priser under de senaste 3-6 månaderna, antingen för att mindre företag verkligen pressas av hårdvarubristen, eller bara för att AI.

Detta har lett till en tillväxt av intresse för självvärd och på plats – inklusive självvärd maskinlärningsnätverk.

Jag blev själv indragen i detta nyligen, genom att flytta till lokal LAN-lagring för foton och videor, samt filbakup. För det första har jag använt den fria och öppna källkods-Immich-plattformen för flera plattformar, som hjälper mig att flytta bort från prisökningarna (och andra problem) hos iCloud och andra molnlagringsleverantörer:

Den fria Immich-plattformen kan hålla dina medier på din utrustning och privata för dina egna kanaler. I det här fallet använder jag också Immich på Docker för att betjäna min NVIDIA 3090 GPU över LAN till där foton och videor sparas, så att den kraftfullare GPU:n kan hantera tung bild-/videobehandling.

Den fria Immich-plattformen kan hålla dina medier på din utrustning och privata för dina egna kanaler. I det här fallet använder jag också Immich på Docker för att betjäna min NVIDIA 3090 GPU över LAN till där foton och videor sparas, så att den kraftfullare GPU:n kan hantera tung AI-bild-/videobehandling.

Om min egen erfarenhet är någon representativ indikation, vibe-kodning – som för närvarande är förbannad i många en gång “rena” online-samhällen – driver denna våg av oberoende (även om det kan hota de öppna källkods-repo som den lutar sig mot).

Till exempel har nätverk alltid varit min svaga punkt i datorkunskap, så AI-assistans var avgörande för mig att få en säker VPS att köra, för att stödja en serie självvärdade tjänster.

På detta sätt är “Stor AI” möjligtvis kraftfullt “Liten AI”; därför kanske vi kan betrakta den nuvarande uppgången av hyperskala, hyper-värderade AI-företag som en nödvändig men bara övergående tillstånd innan ett mer demokratiskt och användar-empowerat AI-samhälle uppstår, som kastar bort moat-sökande, hyres-sökande företag som använda raketsteg – precis som 2000 års dot-com-krasch lämnade exploaterbart infrastruktur som skulle accelerera webben långt efter att företagen som betalade för det hade kollapsat.

Åldern för efterlevnad

Nåväl, det är troligen inte så att det kommer att upprepa sig den här gången.

Även om vi är benägna att bilda någon form av ex-moat rand-samhälle, verkar reglering kring AI, i kombination med den nuvarande globala trenden mot åldersverifiering, sannolikt att förutse och blockera dessa utvecklingsvägar.

Ankaret för att förhindra en “skugg-AI-ekonomi” är reglering. Redan kräver centrala repository som GitHub och Hugging Face ofta online-inloggning innan de tillåter användare att klona repository lokalt, beroende på repo-inställningarna.

Därför finns redan mekanismer för att verkställa övervakning av AI-ramverk mer omfattande än vad som är nuvarande praxis; och viljan att öka sådan tillsyn konsolideras nu från enskilda regeringsinitiativ till en global impuls.

Så, om marknadskrafterna och FOSS-rörelsens skarpsinne skulle ta bort friktionen från avslappnad AI-distribution, verkar det som att vägspärrar kommer att återvända i form av styrningskrav: efterlevnadskrav som, medan de är betungande, är värda för företag, men kanske inte för individer – liknande den friktion som har lagts till konsumentnivåns onlinebetalningssystem sedan den gyllene åldern för PayPal (PYPL ) på 2000-talet.

Om Meta spenderade 2 miljarder dollar på lobbyverksamhet för OS-nivå ålderskontroll på grund av deras betydande AI-investering, eller deras datainsamling, är resultatet av stor tekniks stöd för ålderskontroll att “lokalt” AI kan bli lika reglerat som en klass-A-substans; och, liksom DMCA var utformad för att kriminalisera avsikt snarare än någon specifik upphovsrättskränkande mekanism, internationella AI-regler kan, i en sådan scenario, göra all icke-efterlevnad av maskinlärning till en kriminell handling, till mycket liten kostnad (i termer av aktiv tillsyn).

Detta kan ha verkat som en överdrivet dystopisk syn ett år sedan – men det var innan Kalifornien och systemd stödde idén om hårdvarunivååldersverifiering, som för närvarande ses av många som en proxy för en CCP-stil förbud mot online-anonymitet.

Slutsats

Så, medan den juridiska och lagstiftningsmässiga bakgrunden förbereder sig för att eventuellt inkorporera AI i ett starkt reglerat utrymme, så att oavsiktliga användare inte kan “brygga sin egen” mer än de kan odla eller fermentera reglerade ämnen utan tillstånd, underhåller forskningssektorn sin mer optimistiska hållning – att AI kommer att bli en demokratiserad och gynnsam kraft i ett bredare samhälle än bara de mest populära stängda källkodsleverantörerna.

Much beror på hur rasmassan efter AI-bubblan brister – åtminstone i den utsträckning som leverantörer antingen konsoliderar eller marknaden bosätter sig i långsiktig balkanisering – vilket sannolikt skulle kräva en mildare reglering.

 

Publicerad första gången onsdag, 1 april 2026

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai