Andersons Blickwinkel

Wird kÞnstliche Intelligenz (KI) letztendlich außerhalb der Burgmauer gedeihen?

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen
A cartoon image of a SIMs-style game where a Scottish Laird in his castle is regarding the thriving villagers beyond his moat with puzzlement. GPT-1.5.

Die Kosten und EinschrÃĪnkungen von Big AI sowie deren Einfluss auf die Hardwarekosten zwingen die Nutzer dazu, eigene Systeme zu bauen – genau wie die zunehmende Regulierung droht, diese “Schatten-KI-Wirtschaft” zu schließen.

 

Meinung Unter den vielen “Gotchas”, die in wissenschaftlichen Forschungsarbeiten auftauchen, ist eine der hÃĪufigsten, dass das Problem, das die Arbeit zu lÃķsen versucht, bereits woanders gelÃķst wurde und dass der Beitrag der neuen Forschung lediglich incidentell oder inkrementell ist.

Dies kann aus verschiedenen GrÞnden passieren: Die Forscher hofften auf einen Quantensprung, aber bekamen stattdessen einen Quasi-Hop; die frÞheren LÃķsungen des Problems waren ressourcenintensiver als das neue Angebot; oder einfach, dass die Ziele des Projekts vollstÃĪndig fehlgeschlagen sind, aber die “Publizieren-oder-Untergehen”-Kultur der akademischen Forschung die Mannschaft zwang, es dennoch zu verÃķffentlichen (oft vergraben unter dem Lawinenabgang eines Portals an seinem verkehrsreichsten VerÃķffentlichungstag).

In der Literatur zum maschinellen Lernen ist jedoch ein relativ neuer und unapologetischer Grund hÃĪufiger zu finden: dass die Funktion oder FunktionalitÃĪt, die angeboten wird, nur derzeit Þber geschlossene, API-gebundene Portale verfÞgbar ist.

Ich habe heute Morgen Þber ein solches Papier nachgedacht – eine Zusammenarbeit zwischen chinesischen UniversitÃĪten und Amazon, die das wiederkehrende Problem des Objektentfernungsfehlers in diffusionbasierten Bildbearbeitungssystemen anspricht, die hÃĪufig einfach den Zielbereich mit einem ÃĪhnlichen Objekt auffÞllen anstelle der Entfernung:

Auf der ÃĪußersten linken Seite ist das Originalbild; rechts davon die rote Segmentierungsmaske, die der KI sagt, welchen Teil des Bildes zu entfernen ist; als nÃĪchstes zeigt “Unser Ansatz” einen erfolgreichen Objektentfernungsansatz – und die beiden verbleibenden Bilder zeigen ÃĪhnliche Systeme, die anstelle der Entfernung des Busses einfach einen anderen Bus einfÞgen. Quelle

Im obigen Beispiel zeigt das mittlere Bild den neuen Ansatz, der erfolgreich den Bus entfernt und einen plausiblen Hintergrund einfÞgt, im Gegensatz zu den beiden vorherigen Methoden (den beiden linken Bildern), die den Bus entfernen, aber dann einen anderen Bus in das Bild einfÞgen!

Gotcha!

Wenn man die Warums und Wies des Herausforderungen fÞr eine andere Zeit beiseite legt (und es ist ein interessantes Thema ), dann kam ich auf ein klassisches “Gotcha”, als ich durch das neue Papier las: die Autoren rÃĪumen ein, dass teure, proprietÃĪre Systeme diese Aufgabe bereits zuverlÃĪssig ausfÞhren kÃķnnen – etwas, das ich aus einigen Jahren Nutzung von Adobe Firefly in Photoshop und anderen geschlossenen Systemen weiß:

‘[Diffusionsbasierte] Methoden halluzinieren oft, indem sie ungewollte Objekte einfÞgen, nachdem sie die Zielobjekte entfernt haben, was zu kontextuell inkonsistenten [Ergebnissen] fÞhrt.

‘Andererseits sind kÞrzlich verÃķffentlichte geschlossene Multimodal-Modelle wie ChatGPT und Nano Banana zwar leistungsfÃĪhiger bei der Objektentfernung, aber sie erfordern eine große Anzahl von Parametern und einen hohen Rechenaufwand, was ihre praktische Einsetzbarkeit auf Edge-GerÃĪten behindert.

‘Daher ist es notwendig, ein dediziertes Objektentfernungsmodell zu entwickeln, das nicht nur eine Þberlegene Entfernungsfunktion ermÃķglicht, sondern auch eine geringe InferenzverzÃķgerung und deutlich weniger Parameter aufweist.’

Diese ErklÃĪrung, die sich auf die technischen Hindernisse konzentriert, lÃĪsst die offensichtliche Tatsache außer Acht, dass geschlossene Architekturen wie ChatGPT und Nano Banana Þberhaupt nicht fÞr die lokale Installation verfÞgbar sind. Obwohl die FÃĪhigkeit dieser Systeme, umstrittenes Material zu produzieren, in den letzten zwÃķlf Monaten eine Ãķffentliche Rechtfertigung fÞr ihre Gate-Keeping erhalten hat, sind Portale dieser Art hauptsÃĪchlich aus kommerziellen GrÞnden proprietÃĪr.

Im Wesentlichen impliziert das neue Papier, dass, obwohl das Zielproblem in kommerziellen Systemen gelÃķst ist, dies fÞr den Rest von uns mÃķglicherweise irrelevant ist, die lernen mÞssen, es in der “realen Welt” zu lÃķsen – d. h. in Open-Source-Systemen, unabhÃĪngig davon, ob diese realistischerweise lokal installiert werden kÃķnnen oder nicht.

Parallele Entwicklung

Warum jedoch ein Problem lÃķsen, das noch von einem bezahlten System abhÃĪngt, nicht wegen proprietÃĪrer EinschrÃĪnkungen, sondern weil die erforderliche GPU-Rechenleistung diejenige Þbersteigt, die ein lokales Setup realistischerweise aufrechterhalten kann? Die meisten neuen “offenen” Papiere und Code-Repositorys verfÞgen Þber Trainings-/Inferenz-Setups mit enormen Ressourcenanforderungen, wie z. B. Cluster von A100s.

Nun, das hÃĪngt davon ab, was man glaubt, dass all diese ausstehenden, wirtschaftszerstÃķrenden AI-Rechenzentren erfÞllen werden, wenn sie schließlich online gehen. Die Ängste der einfachen Leute und die Hoffnungen der Eliten stellen sich gleichermaßen vor, dass moatierte, proprietÃĪre Systeme wie ChatGPT ArbeitsplÃĪtze verdrÃĪngen, wÃĪhrend sie stÃĪndig die Abonnementskosten erhÃķhen und das Dienstniveau senken, um das frÞhe VC-Kapital zu befriedigen, das 3-5 Jahre warten musste, um zu operationalisieren.

Es gibt jedoch einen wachsenden Trend in der Literatur, der eine alternative Zukunft unterstÞtzt, und den “go-it-alone”-, marginalen Geist vieler Online-Communities wie dem r/stablediffusion-Subreddit, das derzeit 920.000 Nutzer hat und seit Langem BeitrÃĪge zu geschlossenen Bild-/Video-Generierungssystemen verboten hat.

In dieser alternativen Zukunft wird die neue globale Versorgung mit AI-Rechenzentren rohe Rechenleistung fÞr benutzerkonfigurierte, benutzerdefinierte Systeme bereitstellen, anstatt die Anforderungen monumentaler “Black-Box”-Frameworks wie ChatGPT und Adobe Firefly zu erfÞllen.

OberflÃĪchenreibung

Wenn man durch die komplexen, Patreon-minierten Remote-GPU-Anleitungen auf r/stablediffusion blÃĪttert, scheint alles unmÃķglich: Die Modelle ÃĪndern stÃĪndig die Ziele mit jedem Update; sie sind schwierig zu deployen, selbst in den einfachsten und benutzerfreundlichsten Frameworks; und im Allgemeinen legt die Menge an Reibung nahe, dass dies ein Streben ist, das sich strikt fÞr Geek-Hobbyisten und fÞr jene abenteuerlustigen Unternehmen eignet, die nicht direkt in die KI involviert sind, aber ihre eigenen lokalen Systeme entwickeln und warten mÃķchten, anstatt diese FÃĪhigkeiten zu mieten.

Im Laufe der letzten dreißig Jahre hat jedoch jede Technologie, bei der es eine enorme Nachfrage nach offener und demokratischer Vereinfachung und Kommodifizierung gab, tendiert, diese zu erhalten, wobei die am weitesten verbreiteten LÃķsungen in der Regel aus den Spannungen zwischen kommerziellen Systemen und Open-Source-Alternativen und -Initiativen hervorgegangen sind.

Verfolgungen, die einst spezialisierte “Nerd”-Enklaven waren, wie Internetverbindungen, Content-Management-Systeme und Blogging-Frameworks sowie Internet-Sicherheit, Fotografie und Medienmanagement, haben sich alle von verwirrender KomplexitÃĪt hin zu Einfachheit und NÞtzlichkeit entwickelt.

Daher kann die spÃĪtere KI-Landschaft mÃķglicherweise vielfÃĪltiger und voller kleinerer und wirklich konkurrierender Spieler sein als die derzeitigen KI-MarktfÞhrer es bevorzugen mÃķgen.

Selbstverwirklichung, aus Notwendigkeit

Ironischerweise trÃĪgt “Big AI” viel zu einem aufkommenden Geist der UnabhÃĪngigkeit bei den Endnutzern bei, indem sie alle Computerkomponenten fÞr ihre Rechenzentren aufsaugt – insbesondere DRAM –, die sonst “normalen” Verbrauchern zur VerfÞgung gestanden wÃĪren.

Als Folge davon stellen viele sich eine Zukunft vor, in der geschlossene “globale KI”-Ressourcen Þber unterbetriebene Thin-Clients abgerufen werden und ein wachsendes Interesse an der Aufrechterhaltung ihrer bestehenden GerÃĪte entwickeln.

Der Angriff der KI auf die Technik-Lieferketten hat auch dazu gefÞhrt, dass Technik-Dienstleister ihre Preise in den letzten 3-6 Monaten erhÃķht haben, entweder weil kleinere Unternehmen tatsÃĪchlich von der Hardware-DÞrre gequetscht werden oder einfach nur weil KI.

Dies hat zu einem Anstieg des Interesses an Self-Hosting und On-Prem gefÞhrt – einschließlich Self-Hosting von maschinellen Lernnetzwerken.

Ich selbst bin davon betroffen, indem ich mich zu lokalen LAN-Speicher fÞr Fotos und Videos sowie Dateisicherungen begebe. FÞr ersteres verwende ich den kostenlosen und Open-Source-Immich-Multiplattform-Mediaserver, der mir hilft, mich von den PreiserhÃķhungen (und anderen besorgniserregenden Problemen) von iCloud und anderen Cloud-Speicheranbietern zu lÃķsen:

Die kostenlose Immich-Plattform kann Ihre Medien auf Ihrem GerÃĪt und privat auf Ihren eigenen KanÃĪlen halten. In diesem Fall verwende ich auch Immich auf Docker, um meinen NVIDIA 3090 GPU Þber das LAN zu servieren, wo die Fotos und Videos gespeichert sind, damit der leistungsstÃĪrkere GPU die AI-Lasten bei der Bild-/Videoverarbeitung Þbernehmen kann.

Die kostenlose Immich-Plattform kann Ihre Medien auf Ihrem GerÃĪt und privat auf Ihren eigenen KanÃĪlen halten. In diesem Fall verwende ich auch Immich auf Docker, um meinen NVIDIA 3090 GPU Þber das LAN zu servieren, wo die Fotos und Videos gespeichert sind, damit der leistungsstÃĪrkere GPU die AI-Lasten bei der Bild-/Videoverarbeitung Þbernehmen kann.

Wenn meine eigene Erfahrung ein reprÃĪsentativer Hinweis ist, ist Vibe-Coding – derzeit verflucht in vielen einst “reinen” Online-Communities – der Treiber dieser UnabhÃĪngigkeitswelle (auch wenn es die Open-Source-Repositorys bedroht, auf die es angewiesen ist).

Beispielsweise ist Netzwerken immer mein schwacher Punkt in der Computertechnik, also war die KI-UnterstÞtzung fÞr mich unerlÃĪsslich, um einen sicheren VPS zum Laufen zu bringen, um eine Reihe neuer Self-Hosting-Dienste zu unterstÞtzen.

Auf diese Weise ist “Big AI” mÃķglicherweise “Small AI” zu ermÃķglichen; daher kÃķnnen wir die derzeitige Zunahme von Hyperscale-, hyperbewerteten KI-Unternehmen als notwendigen, aber nur vorÞbergehenden Zustand vor einer demokratischeren und benutzer-empowerten KI-Gesellschaft betrachten, die moat-suchende, rent-suchende Konzerne wie abgeworfene Booster-Raketen abwirft – ÃĪhnlich wie der Dot-Com-Crash von 2000 ausbeutbare Infrastruktur hinterließ, die den Web long nach dem Zusammenbruch der Unternehmen, die sie finanzierten, stark beschleunigen wÞrde.

Das Zeitalter der Einhaltung

Nun, das wird wahrscheinlich nicht wieder passieren.

Wenn wir doch geneigt sind, eine Art Ex-Moat-Randgesellschaft zu bilden, scheint die Regulierung um KI, kombiniert mit der aktuellen globalen Trend zur Altersverifizierung, wahrscheinlich, diese Entwicklungspfade zu antizipieren und zu blockieren.

Der Anker zur Verhinderung einer “Schatten-KI-Wirtschaft” ist die Regulierung. Bereits zentrale Repositorys wie GitHub und Hugging Face erfordern oft eine Online-Anmeldung, bevor sie Benutzern erlauben, Repositorys lokal zu klonen, abhÃĪngig von den Einstellungen des Repositorys.

Daher existieren bereits Mechanismen, um die Überwachung von KI-Frameworks weiter zu verfolgen, als dies derzeit der Fall ist; und der Wille, diese Überwachung zu erhÃķhen, konsolidiert sich derzeit von einzelnen Regierungsinitiativen in einen globalen Impuls.

Wenn also MarktkrÃĪfte und die IngeniositÃĪt der FOSS-Bewegung die Reibung von der beilÃĪufigen KI-Entwicklung entfernen, scheinen Straßensperren in Form von Regierungsanforderungen zurÞckzukehren: Einhaltungsanforderungen, die zwar belastend sind, aber fÞr Unternehmen lohnenswert sind, mÃķglicherweise jedoch nicht fÞr Einzelpersonen – ÃĪhnlich wie die Reibung, die dem Verbraucher-Online-Zahlungssystem seit dem goldenen Zeitalter von PayPal in den 2000er Jahren hinzugefÞgt wurde.

Ob Meta 2 Milliarden Dollar fÞr die Lobbyarbeit fÞr OS-Ebene-Alterskontrolle ausgegeben hat, weil sie in KI investiert hat oder wegen ihrer Interessen an der Datenerfassung, die Folge der UnterstÞtzung von Big Tech fÞr die Alterskontrolle ist, dass “lokale” KI so reguliert werden kann wie eine Klasse-A-Substanz; und ebenso wie die DMCA entworfen wurde, um Absicht zu kriminalisieren, anstatt ein bestimmtes Urheberrechtsverletzungsmechanismus, kÃķnnten internationale KI-Regulierungen in einem solchen Szenario alle nicht konformen Nutzung von maschinellem Lernen zu einem verbotenen Akt machen, bei sehr geringen Kosten (in Bezug auf aktive Überwachung).

Dies kÃķnnte vor einem Jahr noch als ÞbermÃĪßig dystopisch erschienen sein – aber das war, bevor Kalifornien und systemd sich hinter die Idee der Hardware-Ebene-Altersverifizierung stellten, die derzeit von vielen als Stellvertreter fÞr ein Verbot auf Online-AnonymitÃĪt angesehen wird.

Schlussfolgerung

WÃĪhrend also die rechtliche und legislative Grundlage mÃķglicherweise darauf vorbereitet ist, KI in einen hoch regulierten Raum zu integrieren, sodass beilÃĪufige Nutzer ihre eigene KI nicht mehr “brauen” kÃķnnen, als wenn sie regulierte Substanzen ohne Erlaubnis anbauen oder fermentieren, hÃĪlt der Forschungssektor seine optimistischere Haltung aufrecht – dass KI eine demokratisierte und vorteilhafte Kraft in der breiteren Gesellschaft als nur den AnhÃĪngern des beliebtesten geschlossenen Anbieters des Tages wird.

Viel hÃĪngt von der Entscheidung Þber die TrÞmmer ab, nachdem die KI-Blase geplatzt ist – zumindest in dem Maße, in dem Anbieter entweder konsolidieren oder der Markt in eine langfristige Balkanisierung eintritt – was wahrscheinlich eine sanftere Regulierungstouch erfordern wÞrde.

 

ErstverÃķffentlichung am Mittwoch, den 1. April 2026

Schriftsteller Þber maschinelles Lernen, DomÃĪnen-Spezialist fÞr menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen AuflÃķsung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: [email protected]