Kąt Andersona

Czy AI ostatecznie prosperować będzie poza fosą?

mm
Dodaj Unite.AI do preferowanych źródeł w Google
A cartoon image of a SIMs-style game where a Scottish Laird in his castle is regarding the thriving villagers beyond his moat with puzzlement. GPT-1.5.

Koszty i ograniczenia dużych firm AI, a także ich wpływ na koszty sprzętu, zmuszają użytkowników do budowania własnych systemów – podobnie jak rosnące regulacje zagrażają zamknięciem tej “cieniowej gospodarki AI”.

 

Opinia Wśród wielu “pułapek”, które pojawiają się w artykułach naukowych, jedną z najczęstszych jest to, że problem, który artykuł stara się rozwiązać, już został rozwiązany gdzie indziej, a nowe badanie wnosi tylko nieznaczny lub przytłaczający wkład.

Może to nastąpić z wielu powodów: badacze liczyli na skok kwantowy, ale dostali półskok; wcześniejsze rozwiązania problemu były bardziej zasobożerne niż nowa oferta; lub po prostu cele projektu nie powiodły się w ogóle, ale kultura “publikuj lub zgiń” w badaniach akademickich zmusiła zespół do opublikowania go i tak (często pogrzebionego pod lawiną najbardziej publikowanych dni portalu).

W literaturze związanej z uczeniem maszynowym nowy, nieprzepraszający powód staje się coraz częstszy: cecha lub funkcjonalność oferowana jest tylko dostępna za pośrednictwem zamkniętych, API-związanych portali.

Rozważałem jeden z takich artykułów rano – współpracę między chińskimi uniwersytetami a Amazonem, dotyczącą powtarzającego się problemu awarii usuwania obiektów w systemach edycji obrazu opartych na dyfuzji, które często po prostu “ponownie wypełniają” przestrzeń docelową podobnym obiektem:

Z lewej strony jest oryginalny obraz; po prawej stronie, czerwona maska segmentacji, która mówi AI, jaki część obrazu usunąć; następnie, “Nasze”, pokazuje udane podejście do usuwania obiektu – a pozostałe dwa obrazy pokazują podobne systemy, które zamiast usuwać autobus, wstawiają inny autobus zamiast. Źródło

W powyższym przykładzie, środkowy obraz pokazuje nowe podejście, które z powodzeniem usuwa autobus i wstawia wiarygodne tło, w przeciwieństwie do dwóch poprzednich metod (dwóch lewych obrazów), które każda usuwa autobus, ale potem wstawia inny autobus z powrotem do obrazu!

Pułapka!

Odkładając na bok dlaczego i jak tego problemu, przyszedłem na to, że nowy artykuł ma klasyczną “pułapkę”, czytając przez nowy artykuł: autorzy przyznają, że drogie, własnościowe systemy mogą już wykonywać tę zadanie dość niezawodnie – co wiem, dzięki kilku latom korzystania z Adobe Firefly w Photoshopie, a także innych zamkniętych systemów:

‘[Metody oparte na dyfuzji] często halucynują, wstawiając niezamierzone obiekty po usunięciu obiektów docelowych, prowadząc do wyników niezgodnych z kontekstem.

‘Z drugiej strony, niedawne zamknięte modele wielomodalne, takie jak ChatGPT i Nano Banana, są bardziej potężne w usuwaniu obiektów, ale wymagają dużych liczb parametrów i wysokiej obciążenia obliczeniowego, utrudniając ich praktyczne wdrożenie na urządzeniach krawędziowych.

‘Stąd jest zupełnie konieczne opracowanie dedykowanego modelu usuwania obiektów, który nie tylko umożliwia lepsze usuwanie, ale także cieszy się niską latencją inferencji i znacznie mniej parametrów.’

To wyjaśnienie, koncentrujące się na technicznych przeszkodach, pomija oczywisty fakt, że zamknięte architektury, takie jak ChatGPT i Nano Banana, nie są dostępne w ogóle do lokalnej instalacji. Chociaż zdolność tych systemów do produkcji kontrowersyjnych materiałów dała ich bramkarzom dodatkowe publiczne uzasadnienie w ciągu ostatniego roku, portale tego rodzaju są własnościowe głównie z powodów komercyjnych.

Podstawowo, nowy artykuł sugeruje, że chociaż problem docelowy jest rozwiązany w komercyjnych systemach, to może być nieistotne dla reszty z nas, którzy muszą nauczyć się, jak to rozwiązać w “prawdziwym świecie” – czyli w systemach open source, niezależnie od tego, czy mogą być one realistycznie zainstalowane lokalnie czy nie.

Rozwój równoległy

Jednak dlaczego rozwiązywać problem, który nadal zależy od płatnego systemu, nie z powodu ograniczeń własnościowych, ale dlatego, że wymagane obliczenia GPU przekraczają to, co lokalne ustawienie może realistycznie utrzymać? Większość nowych “otwartych” artykułów i repozytoriów kodu zawiera ustawienia szkolenia/inferencji z rażącymi wymogami zasobów, takimi jak klastry A100.

No, to zależy od tego, co myślimy, że wszystkie te poczekające, gospodarkę-burzące centra danych AI będą spełniać, gdy w końcu zostaną uruchomione. Strach ludzi i nadzieje elit wyobrażają sobie umocnione, własnościowe systemy AI, które wypierają pracę, podczas gdy stale zwiększają koszty subskrypcji i obniżają poziom usług, aby zadowolić wczesny kapitał VC, który musiał czekać 3-5 lat, aby się urzeczywistnić.

Ale rosnący trend w literaturze wydaje się wspierać alternatywną przyszłość, a “idź-sam” i marginalny duch wielu społeczności internetowych, takich jak subreddit r/stablediffusion, który obecnie ma 920 000 użytkowników i który od dawna zakazał postów dotyczących zamkniętych systemów generacji obrazu/wideo.

W tej alternatywnej przyszłości nowy globalny dostęp do centrów danych AI ułatwi surowe obliczenia dla systemów konfigurowanych przez użytkowników, zdefiniowanych przez użytkowników, zamiast spełniania wymagań monumentalnych “czarnych skrzynek” frameworków, takich jak ChatGPT i Adobe Firefly.

Tarcie powierzchniowe

Przeglądając złożone, zdalne przewodniki GPU w r/stablediffusion, wszystko wydaje się niemożliwe na razie: modele zmieniają cele z każdą aktualizacją; są trudne do wdrożenia lokalnie, nawet w najłatwiejszych i najbardziej przyjaznych frameworkach; i ogólnie, ilość tarcia zaangażowanego sugeruje, że jest to zajęcie ściśle dla geeków-hobbyistów i dla tej bardziej awanturniczej odmiany firm, które nie są bezpośrednio zaangażowane w AI, ale które chcą rozwijać i utrzymywać własne lokalne systemy, zamiast wynajmować takie możliwości.

Jednak w ciągu ostatnich trzydziestu lat każda technologia, w której było duże zapotrzebowanie na otwarte i demokratyczne uproszczenie i komodyfikację zazwyczaj ją otrzymywało, a najbardziej rozpowszechnione rozwiązania zwykle pochodziły z napięć między komercyjnymi systemami a alternatywami i inicjatywami open-source.

Podejścia, które kiedyś były specjalistycznymi “nerd” enklawami, takimi jak połączenia internetowe, systemy zarządzania treścią i frameworki blogowe, a także bezpieczeństwo internetowe, fotografia i zarządzanie mediami, wszystkie ewoluowały z zaskakującej złożoności w kierunku prostoty i użyteczności.

Dlatego późniejszy krajobraz AI może być bardziej urozmaicony i pełen mniejszych i prawdziwie konkurujących graczy niż obecni liderzy rynku AI mogliby preferować.

Samourzeczywistnienie, z konieczności

Ironicznie, “Duże AI” przyczynia się wiele do powstającego ducha niezależności wśród użytkowników końcowych, pochłaniając dla swoich centrów danych wszystkie komponenty komputera – szczególnie DRAM – które w przeciwnym razie poszłyby do “zwykłych” konsumentów.

W związku z tym wiele osób wyobraża sobie przyszłość, w której zamknięte “globalne” zasoby AI są dostępne za pośrednictwem słabych klientów cienkich i rozwijają rosnące zainteresowanie utrzymaniem swojego istniejącego sprzętu.

Atak AI na łańcuchy dostaw technologicznych również spowodował, że dostawcy usług technologicznych podnieśli swoje ceny w ciągu ostatnich 3-6 miesięcy, albo dlatego, że mniejsze firmy są naprawdę ściskane przez suszę sprzętową, albo po prostu dlatego, że AI.

To doprowadziło do wzrostu zainteresowania hostowaniem własnym i na miejscu – w tym hostowaniem sieci uczenia maszynowego.

Zaangażowałem się w to sam, przenosząc się do lokalnego magazynu LAN dla zdjęć i filmów, a także kopii zapasowych plików. Dla pierwszego z nich używałem bezpłatnego i otwartoźródłowego serwera multimedialnego Immich, który pomaga mi odejść od podwyżek cen (i innych niepokojących problemów) dostawców usług chmury, takich jak iCloud:

Bezpłatna platforma Immich może przechowywać Twoje media na Twoim sprzęcie i utrzymywać je prywatne na Twoich kanałach. W tym przypadku używam również Immich na Docker, aby obsługiwać mój NVIDIA 3090 GPU przez LAN, gdzie są zapisywane zdjęcia i filmy, aby mógł obsłużyć każde ciężkie przetwarzanie obrazu/wideo.

Bezpłatna platforma Immich może przechowywać Twoje media na Twoim sprzęcie i utrzymywać je prywatne na Twoich kanałach. W tym przypadku używam również Immich na Docker, aby obsługiwać mój NVIDIA 3090 GPU przez LAN, gdzie są zapisywane zdjęcia i filmy, aby mógł obsłużyć każde ciężkie przetwarzanie obrazu/wideo.

Jeśli moje własne doświadczenie jest jakimś reprezentatywnym wskaźnikiem, vibe-coding – obecnie przeklęty w wielu kiedyś “czystych” społecznościach internetowych – napędza tę falę niezależności (nawet jeśli może zagrażać repozytoriom open source, na które się opiera).

Na przykład, sieciowanie zawsze było moim słabym punktem w komputerze, więc asysta AI była niezbędna, aby uzyskać bezpieczne VPS, aby wesprzeć serię nowych usług hostowanych samodzielnie.

W ten sposób “Duże AI” można uznać za empowerment “małego AI”; dlatego być może możemy rozważyć obecny wzrost firm AI o wysokiej wartości jako konieczny, ale tylko przejściowy stan przed bardziej demokratycznym i uprawnionym społeczeństwem AI, które porzuci korporacje szukające renty i fosy jak zużyte rakiety nośne – podobnie jak krach na rynku internetowym w 2000 roku pozostawił infrastrukturę, która znacznie przyspieszyła sieć długo po tym, jak firmy, które za nią zapłaciły, upadły.

Wiek zgodności

Cóż, to prawdopodobnie nie powtórzy się tym razem.

Even if we są skłonni utworzyć pewnego rodzaju ex-moat społeczność brzegową, regulacje dotyczące AI, w połączeniu z bieżącym globalnym trendem w kierunku weryfikacji wieku, wydają się prawdopodobne, aby przewidzieć i zablokować te ścieżki rozwoju.

Kotwicą do zapobiegania “cieniowej gospodarce AI” jest regulacja. Już teraz centralne repozytoria, takie jak GitHub i Hugging Face, często wymagają logowania online przed zezwoleniem użytkownikom na klonowanie repozytoriów lokalnie, w zależności od ustawień repozytorium.

W związku z tym mechanizmy już istnieją, aby egzekwować monitorowanie frameworków AI szerzej niż jest to obecnie praktykowane; i wola do zwiększenia takiego nadzoru konsoliduje się z indywidualnych inicjatyw rządowych w kierunku globalnego impetu.

Więc, jeśli siły rynkowe i pomysłowość ruchu FOSS usuną tarcie z casualnym wdrożeniem AI, przeszkody wydają się powrócić w postaci wymagań dotyczących zarządzania: wymagań zgodności, które, choć uciążliwe, są warte dla firm, ale być może nie dla osób fizycznych – podobnie jak tarcie, które zostało dodane do systemów płatności online na poziomie konsumenckim od “złotego wieku” PayPal w latach 2000.

Czy Meta wydała 2 miliardy dolarów na lobbing w sprawie kontroli wieku na poziomie systemu operacyjnego z powodu swojej znacznej inwestycji w AI, czy z powodu swoich interesów w zbieraniu danych, skutek wsparcia dużych firm technologicznych dla kontroli wieku jest taki, że “lokalne” AI może stać się tak uregulowane, jak substancja klasy A; i tak jak DMCA został zaprojektowany, aby z karać zamiar zamiast konkretnego mechanizmu unikania prawa autorskiego, międzynarodowe regulacje AI mogą, w takim scenariuszu, uczynić wszystkie niezgodne z prawem użycie uczenia maszynowego przestępstwem, przy niewielkim koszcie (w zakresie aktywnego nadzoru).

To mogło wydawać się zbyt dystopijne rok temu – ale to było przed tym, jak Kalifornia i systemd poparły pomysł weryfikacji wieku na poziomie sprzętu, obecnie postrzeganą przez wielu jako pełnomocnik dla zakazu anonimowości online w stylu CCP.

Podsumowanie

Więc, podczas gdy tło prawne i legislacyjne przygotowuje się, być może, do włączenia AI do wysoko uregulowanego obszaru, tak aby użytkownicy końcowi nie mogli “warzyć własnego” AI, tak jak nie mogą uprawiać lub fermentować regulowanych substancji bez pozwolenia, sektor badawczy utrzymuje bardziej optymistyczne stanowisko – że AI stanie się demokratyczną i korzystną siłą w szerszym społeczeństwie niż tylko zwolenników najpopularniejszego dostawcy zamkniętego AI dnia.

Wiele zależy od rozwiązania problemu, jaki powstaje po tym, jak bańka AI pęknie – przynajmniej w takim stopniu, w jakim dostawcy albo konsolidują się, albo rynek ustabilizuje się w długoterminową balkanizację – co prawdopodobnie wymagałoby łagodniejszego dotyku regulacyjnego.

 

Pierwotnie opublikowane w środę, 1 kwietnia 2026

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]