Andersons vinkel

PiedPiper-Style Decentralized Inference Services til AI?

mm
Føj Unite.AI til dine foretrukne kilder på Google
AI-generated image (GPT-1.5): An esoteric visualization of an AI mesh network. Inset: publicity photo from HBO's 'Silicon Valley', via https://www.hollywoodreporter.com/tv/tv-reviews/silicon-valley-review-1250092/

Er ‘BitTorrent for AI’ en forestående mulighed?

 

Opinion Da jeg lige havde afsluttet en genvisning af Mike Judges underholdende og bidende tech-bro satire Silicon Valley – hvor en gruppe sociale udfordrede geek-geniuer forsøger at skabe et ‘nyt internet’ kaldet PiedPiper via et mesh-netværk installeret på alle mobiltelefoner – var jeg interesseret i at se, hvordan HN-samfundet engagerede sig i et nyt tilbud af samme natur.

Eigen Labs’ DarkBloom befinder sig et sted mellem den egalitære idé om et decentraliseret mesh-netværk til AI-inferens og krypto-mining-motiver, der tillader ejerne af Apple Silicon Mac-systemer at omdanne deres udstyr til en inferensnode:

Fra indtægtssektionen på DarkBloom-webstedet kan brugere vælge, hvilket udstyr de ønsker at leje ud, og hvilke AI-modeller de ønsker at støtte. Kilde: https://darkbloom.dev/

Fra indtægtssektionen på DarkBloom-webstedet kan brugere vælge, hvilket udstyr de ønsker at leje ud, og hvilke AI-modeller de ønsker at støtte. Kilde

Systemet koncentrerer sig i øjeblikket om tekstbaserede modeller som den agente Trinity Mini (3B) og Cohere Transcribe, selvom det også tilbyder diverse billedgenererende modeller som FLUX 2 Klein 4B:

Udvalget af modeller, som 'landlord' kan vælge at leje ud, sammen med månedlige projekterede indtægter.

Udvalget af modeller, som ‘landlord’ kan vælge at leje ud, sammen med månedlige projekterede indtægter.

Brugere, der deltar i ordningen, kan tilsyneladende tjene nok penge i en solid måned med inferensforsyning til at kunne købe en ny Mac til en stadig voksende kæde, indtil de i teorien kan tjene en fuldstændig inferensfarm.

I virkeligheden kan en ordning af denne type, der virkelig ville vinde popularitet (den har i øjeblikket et kold start-problem), måske sætte begejstrede amatørbrugere tilbage i en hardware-søgende position, som under den sidste store kryptocurrency-boom (og efterfølgende krak).

Ikke så hurtigt

Men for de små spillere kan båden måske være sejlet. Ud over AI’s apokalyptiske behov for RAM, stiger efterspørgslen efter globale AI-aktiverede datacenter-udstyr fortsat og øger hardware- og services-omkostningerne for den almindelige forbruger, der tidligere havde kunnet monopolisere RAM til krypto-mining på grund af aktiviteten peripherals natur samt regulatorisk usikkerhed, der holdt erhvervsinteresser tilbageholdne med hensyn til krypto.

mens den super-billige MacBook Neo er dukket op som en crunch-beating alternativ til stadig stigende hardware, kan dens A18-mobiltelefon-chip og 8 GB VRAM ikke bringe den i alvorlig konkurrence som en inferensmaskine.

Men selv hvis slutbrugeren ikke søger at starte en fuldstændig inferensfarm, og kun ønsker at leje ud sin nuværende ubenyttede M[n]-kapacitet, synes de potentielle indtægter betydelige, hvis kold-start-problemet hurtigt løses, og hvis platformen begynder at reklamere for sig selv som noget mere end et nysgerrigt eksperiment i potentiel efterspørgsel.

Inferens forskellig

Selvom en række kommentatorer har genkendt en PiedPiper/Torrent-lignende demokrati i DarkBlooms ordning, er inferenstasks ikke så lette at dele som at fragmentere en filmfil i multiple hashede skiver, så den kan senere samles igen i en torrent-klient.

DarkBloom-modellen foreslår ikke, at en deltagerens M[n]-chip håndterer x% af en inferenstask. I almindelig brug kan kun et lille antal rammer eller metoder opnå denne type cross-GPU-udnyttelse på en enkelt inferenstask, herunder NVIDIAs TensorRT LLM, der bruger pipeline-parallellisme; og DeepSpeeds sharded inference, der udnytter model-parallellisme (MP).

I stedet vil din DarkBloom-aktiverede Mac downloade og starte en af de nævnte modeller og udføre 100% af inferensen for betalende brugere, med end-to-end-kryptering og med prompts dekrypteret kun på hardware-attesterede noder, hvilket betyder, at udbydere ikke kan læse data under udførelse. Arbejdsbelastningen selv ville udgøre en eller flere tekstbaserede inferenser eller mindst ét komplet billede.

Det er ikke klart, hvor omfattende en enkelt brugersession ville være; som det er nu, er AI-hobbyister vant til at sikre en GPU via inferensfarme som RunPod; selvom det kan tage lidt tid at sikre den ønskede GPU ved toppen af brugen, får brugeren lov til at monopolisere den, så længe sessionen ikke er tilladt at udløbe.

Så det er muligt, at en enkelt betalende bruger kunne ende med at bruge en enkelt lejet DarkBloom Macs M-serie AI-kapaciteter i en meget lang session, medmindre der er en logistisk eller compliance-fordel i at skifte klienterne mellem anmodninger.

Mac’er er blevet udvalgt til denne tilgang, åbenbart, fordi der kun er et begrænset antal tekniske konfigurationer for en deltager, og det er derfor let at tildele passende store modeller til en klient.

Dertil kommer, at Mac’er, der kan bidrage til et DarkBloom-netværk, har en hardware sikker enclave, der garanterer en mur mellem brugeren og leverandøren.

Disse er alle faktorer, der ikke er så lette at rationalisere på tværs af mere generiske, tilpassede opsætninger og på tværs af de hundredvis eller tusindvis af kendte laptop/desktop Windows- og Linux-maskiner, der er tilgængelige over de sidste 6-7 år.

Men det må være åbenbart, at den langt større ikke-Mac-hardware-pool kunne rumme enorm efterspørgsel, hvis deres diverse karakteristika kunne rationaliseres, i stedet for – som med DarkBloom – at køre med Apple’s begrænsede spec-sæt, hvilket gør det til en let forretningsmulighed og en (formodentlig) langt lettere arkitektonisk tilgang.

Retlig tilsyn?

Måske det største problem, der møder en ‘demokratisk’ løsning af denne type, er den lukkede natur af den foreslåede proces; regeringer verden over er i øjeblikket engageret i nye love, der ville effektivt afslutte internet-anonymitet hvor som helst, og er åbenbart ikke i en pro-privacy-sind i denne periode.

Derfor synes udsigten til tilfældig AI-inferens, der udføres uden filtre, kontroller eller balance, på tværs af et distribueret netværk (hvis man kan kalde DarkBloom det – det er mere af en inferensmarked), ironisk nok fjern.

Det er muligt, at DarkBloom eller andre efterfølgende mesh-inferensordninger vil være nødt til at acceptere bagdøre, der effektivt begrænser privatlivet til værten, der ikke vil kunne se klientjob kører; i stedet ville den returnerede inferensdata blive gjort tilgængelig gennem regeringsagenturer man-in-the-middle (MiTM)-strukturer, der holder alle inferenser auditable.

Formodentlig, hvis den række nye love forslag om OS-niveau-identitetskontrol nogensinde opnår bred accept, kan sådanne foranstaltninger måske blive overflødige. Men uden dem ville en DarkBloom-lignende netværk sandsynligvis blive betragtet som en AI ‘darknet’, hvor ulovlige AI-baserede aktiviteter kunne foregå i hemmelighed.

Split tests

Indtil nu er der overraskende få rigtige forsøg på at gøre, hvad en ‘PiedPiper-stil’-system antyder; i sig selv befinder DarkBloom sig på den ene ende, hvor komplette job distribueres til enkeltmaskiner i stedet for at forsøge at fragmentere dem på tværs af et netværk, mens de fleste produktionsystemer simpelthen undgår problemet helt ved at holde inferensen på en enkelt vært.

Der er dog en håndfuld projekter, der repræsenterer noget, der ligner ‘delte udførelse’.

Petals, der aktivt beskriver sig selv som et ‘BitTorrent-lignende’ netværk, distribuerer transformator-blokke på tværs af multiple internet-forbundne noder, der passerer mellemstatsstater mellem dem:

En typisk Petals-arbejdsgang, hvor en enkelt inferensanmodning dirigeres på tværs af multiple fjerntliggende GPU'er, hver med en undermængde af model-lag; i modsætning til DarkBloom udføres udførelsen fragmenteret på tværs af netværket, med mellemstatsstater passeret mellem uafhængigt opererede noder, hvilket øger latency og eksponering ved hver hop, mens det approksimerer et sandt mesh-lignende system. Kilde - https://github.com/bigscience-workshop/petals

En typisk Petals-arbejdsgang, hvor en enkelt inferensanmodning dirigeres på tværs af multiple fjerntliggende GPU’er, hver med en undermængde af model-lag; i modsætning til DarkBloom udføres udførelsen fragmenteret på tværs af netværket, med mellemstatsstater passeret mellem uafhængigt opererede noder, hvilket øger latency og eksponering ved hver hop, mens det approksimerer et sandt mesh-lignende system. Kilde

Hivemind eksperimenterer med lignende peer-to-peer-koordination og ekspert-routing, selvom det er i service of træning af modeller i stedet for inferens fra allerede trænede modeller; og Lattica fokuserer på det underliggende netværkslag, der er nødvendigt for at gøre sådanne systemer livskraftige:

En skematisk fremstilling af Lattica, der viser et lavere niveau peer-to-peer-substrat, der håndterer NAT-traversal, indholdsdistribution og DHT-baseret koordination, med sharded inference, der kun opstår som en mulig applikationslag; i modsætning til DarkBloom eller Petals definerer Lattica ikke selv et inferenssystem, men tilbyder de nødvendige netværks- og synkroniseringsprimitiver til at bygge et sådant.

En skematisk fremstilling af Lattica, der viser et lavere niveau peer-to-peer-substrat, der håndterer NAT-traversal, indholdsdistribution og DHT-baseret koordination, med sharded inference, der kun opstår som en mulig applikationslag; i modsætning til DarkBloom eller Petals definerer Lattica ikke selv et inferenssystem, men tilbyder de nødvendige netværks- og synkroniseringsprimitiver til at bygge et sådant. Kilde

Alle disse modeller nærmer sig mesh-idealet, men til en pris af latency, ustabilitet og eksponering.

Exo holder inferensen inden for en lokal cluster, der bruger hurtige interconnects til at dele arbejdsbelastninger på tværs af GPU’er, uden at afhænge af det offentlige internet. I praksis opfører en sådan opsætning sig mere som en enkelt udvidet maskine end som et distribueret mesh, selvom der er en klar mulighed for at udvide denne tilgang over et bredere netværk:

En cluster-visning fra exo, der viser en lille ring af lokale Apple Silicon-maskiner, der sammen holder en enkelt model, med pipeline eller tensor-sharding, der distribuerer lag på tværs af noder; i modsætning til WAN-baserede systemer afhænger exo af hurtige lokale interconnects, der effektivt omdanner multiple enheder til en enkelt komposit-inferensmaskine. Kilde - https://github.com/exo-explore/exo?tab=readme-ov-file

En cluster-visning fra exo, der viser en lille ring af lokale Apple Silicon-maskiner, der sammen holder en enkelt model, med pipeline eller tensor-sharding, der distribuerer lag på tværs af noder; i modsætning til WAN-baserede systemer afhænger exo af hurtige lokale interconnects, der effektivt omdanner multiple enheder til en enkelt komposit-inferensmaskine. Kilde

Til sidst er der flere almindeligt citerede tilgange, der ikke behandler inferens overhovedet: det nu-venerable (2016) Google FedAvg; MIT’s 2018-udgave SplitNN; og den australske tilbud fra 2020 SplitFed, der beskæftiger sig med træningsdistribution eller privat-preserverende dataudveksling, i stedet for at betjene live-inferensanmodninger.

Da træning er et langt mere ressourcekrævende perspektiv end inferens, kan enhver netværk, der kan distribuere en sådan belastning effektivt på tværs af cluster eller noder, have en ubalance af hobby- og erhvervsinteresse senere.

Konklusion

Fordi meget af teknologien i Silicon Valley var vild opfindelse, ved vi ikke, om PiedPiper virkelig var hash-drevet (dvs. opdeling og distribution af data i stykker, torrent-stil), eller om den ‘afsluttede’ en opgave eller selv en session på en enkelt node på et tidspunkt, hvilket er, hvad DarkBloom gør.

Men den nuværende kapløb for at levere trænings- og inferenshardware på datacenter-niveau antyder, at leveringssektoren enten forventer at betjene alle, RunPod-stil, eller er ved at forberede sig til den mest lukrative erhvervsniveau-levering – en fristende udsigt, der bliver undermineret af den generelle manglende mure i AI-udvikling.

Hvis mesh-inferens bliver en realitet, er det rimeligt at forvente, at blandt de første forsøg på at udnytte det vil være fra de eksisterende, som OpenAI og Anthropic, der enten kan udrulle dedikerede systemer inden for en massiv eksisterende app-installationsbase eller samarbejde om åbne kilde-systemer, der er lette at installere (da selskaber af denne størrelse og rækkevidde har pengene og motivationen til at strømline svære installationer af denne type).

Om en mere demokratisk, bruger-dreven mesh-netværk kan opstå, en sand AI-lignende til BitTorrent – en række faktorer er rettet mod det.

Først og fremmest er den nuværende globale kamp mod kryptering og anonymitet kan fjerne eller underminere mange af de mekanismer, der gør systemer som BitTorrent anonyme, såsom end-to-end-kryptering og VPN’er. Når de ‘generiske’ krypterede strømme, der skjuler sådanne protokoller, er åbne for inspektion, bliver nye lag af tilsyn og forbud mulige, og dette kan underminere appel af en DarkBloom-lignende ordning.

For det andet betyder fremvoksende eller foreslåede reguleringsforslag mod ‘misbrug’ af AI eller mod anonym drift af åbne kilde-rammer, at omkostningerne ved overholdelse – ubetydelige på erhvervsniveau – sandsynligvis vil tage de mindre spillere af markedet.

Til sidst – den store sektors aktørers evne til at omfavne, udvide og udrydde (EEE, som Facebook og Twitter sandsynligvis gjorde med mere ad hoc-internetsamfund), betyder, at de nuværende store spillere kan operationalisere og strømline mesh-modellen til deres egen fordel, på et marked, hvor slutbrugere er næsten fuldstændigt intolerante over for enhver friktion i adoption.

 

Offentliggjort torsdag, 16. april 2026

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai