Liderzy opinii
Chińskie złudzenie AI: Jak “otwarte oprogramowanie” ukrywa to, co najważniejsze

Z dużymi graczami z branży technologicznej, takimi jak Google, Microsoft (MSFT ) i Meta, walczącymi o dominację na rynku AI, chińscy giganci, tacy jak Baidu, Moonshot i Alibaba, zrobili furorę, wydając swoje modele językowe DeepSeek, ERNIE 4.5, Kimi K2 i Qwen3 jako otwarte oprogramowanie. Ten zwrot w stronę otwartego oprogramowania został przyjęty jako znak, że chińska branża AI przyjmuje moc otwartego oprogramowania, aby demokratyzować rozwój AI i pobudzać innowacje.
Jednak, podobnie jak wielu graczy, którzy określają swoje oferty jako otwarte oprogramowanie, nawet umieszczając to w nazwach swoich firm, High Flyer, Baidu i Moonshot nie udostępniły krytycznych elementów, takich jak zestawy danych, które leżą u podstaw ich modeli. Gdy te duże modele próbują stać się towarami, na których opierają się deweloperzy, przejrzystość prawdziwego otwartego oprogramowania, które można przetestować, zbadać i iterować, jest kluczowa dla tworzenia niezależnej, etycznej i korzystnej technologii, którą wszyscy możemy zaufać. Wszystkie te “otwarte” modele są tak naprawdę “otwartymi wagami”, co oznacza, że można je pobrać i używać, ale nie można ich w żaden sposób zbadać bez danych.
Ponieważ amerykańscy gracze, tacy jak Open AI i Meta, zdają się oddalać od otwartego oprogramowania, otwarte zaproszenie Baidu do wykorzystania jego bezpłatnego zestawu modeli ERNIE 4.5 może rzeczywiście pobudzić innowacje i współpracę z deweloperami, którzy chcą tworzyć mniejsze, potężne aplikacje. Jednocześnie firma, która jest podobna do chińskiego Google, dała sobie przewagę konkurencyjną, zachęcając do przyjęcia i umocnienia swoich modeli w rozwijającym się ekosystemie AI.
To samo można powiedzieć o DeepSeek, tanim Kimi K2 i zaktualizowanym Qwen3, który ma benchmarki, wyzwania dla zamkniętych modeli, takich jak Claude Opus 4 i GPT-4o-0327.
Ci gracze AI umieścili się dobrze w wyścigu, aby stać się modelem towarowym wyboru, a najnowsza innowacyjna aktualizacja Qwen3 została nawet zainspirowana opiniami społeczności otwartego oprogramowania.
Jednak, podobnie jak wielu, którzy określają swoje duże modele AI jako otwarte oprogramowanie, chińska społeczność AI nie udostępnia danych ani innych krytycznych elementów swoich systemów AI. Zamiast tego, proszą globalnych deweloperów, aby zaufali modelem, których nie mogą prawdziwie zrozumieć ani zbadać.
Zabierając udział w przyszłości z otwartym oprogramowaniem towarowym AI
Gdy iPhone pojawił się na rynku w 2007 roku, niektórzy zakładali, że Mac będzie rządził grą na smartfonach z iOS, ale udział w otwartym oprogramowaniu jest integralny dla startupów, a także pobudza przedsiębiorczość i wzrost gospodarczy na całym świecie – a Android, startup, który został zakupiony przez Google w 2005 roku, podążał tą ścieżką do zwycięstwa.
Poprzez wydanie otwartego oprogramowania, które można było wyświetlić, modyfikować, przyjmować i udostępniać, Android zaprosił akademików, deweloperów i nawet konkurentów do współpracy nad oprogramowaniem. To przyspieszyło proces innowacji, zdemokratyzowało pole gry i ostatecznie obniżyło ceny. Android pojawił się na rynku rok po pierwszym iPhone i na początek tego roku posiadał 71,88% udziału w globalnym rynku w stosunku do 27,65% iOS.
W rewolucji technologicznej, która wydawała się dziać przez noc, smartfony stały się powszechnymi, a nawet gdy poprawki oprogramowania, sprzętu i interfejsu użytkownika nadal trwają, branża rozrosła się daleko poza próby rewolucjonizowania sposobu, w jaki smartfony działają. Z telefonami komórkowymi, które są teraz towarem, innowacja, która jest teraz przed nami, dotyczy aplikacji, które działają na nich, a aby być konkurentami, dostawcy smartfonów muszą utrzymywać ekosystem, który zaprasza deweloperów.
Niecałe trzy lata po premierze ChatGPT, branża AI znajduje się na podobnym progu. Każdy gracz w globalnej branży AI stara się, aby jego modele stały się następnym Androidem lub nawet iOS, a poprzez udostępnienie otwartego oprogramowania modeli DeepSeek, ERNIE 4.5 i Kimi K2, chińscy innowatorzy starają się zająć swoje miejsce w rozwijającym się ekosystemie.
Jednak, chociaż to może zadziałać na ich korzyść, nie pobudza to prawdziwej przejrzystości otwartego oprogramowania, która była niezbędna nie tylko do tworzenia innowacji, ale także innowacji, której możemy zaufać.
Dane są brakującym elementem w większości otwartego oprogramowania AI
Z modelem AI znacznie bardziej skomplikowanym do stworzenia i udostępnienia niż tradycyjne oprogramowanie, wezwanie do pełnego otwartego oprogramowania AI nie jest małym zamówieniem. Zamiast prostego kodu źródłowego, systemy AI składają się z siedmiu elementów – w tym kodu źródłowego, parametrów modelu, zestawu danych, hiperparametrów, kodu źródłowego szkolenia, generacji liczb losowych i ram oprogramowania.
Każdy element musi działać w harmonii, aby model mógł dostarczyć pożądane wyniki, co oznacza, że deweloperzy potrzebują pełnej widoczności, aby udostępnić, modyfikować i przyjąć system i zrozumieć, co się dzieje. Z powtarzalnością jako podstawą metody naukowej, branża AI ma zwyczaj używania terminu “otwarte oprogramowanie” w odniesieniu do bezpłatnych lub tanich wydań, które są dostępne z dostępem do kilku elementów układanki.
Baidu, na przykład, udostępniło bezpłatnie dziesięć modeli ERNIE 4.5. Wraz z udostępnieniem modelu i parametrów, firma również udostępniła otwarte oprogramowanie ERNIEKit i narzędzia wdrożeniowe FastDeploy. Te umożliwiają deweloperom tworzenie potężnych aplikacji AI, zapewniając możliwości przemysłowe, efektywne szkolenie i przetwarzanie, a także kompatybilność z wieloma urządzeniami.
Innymi słowy, Baidu zapewniło deweloperom ekscytujące narzędzia, które umożliwiają im szybciej wyzwalać innowacje, co, jak się spodziewają, zachęci ich do wyboru ERNIE 4.5 zamiast konkurencji.
Deweloperzy, którzy wykorzystują ERNIE 4.5, są jednak proszeni o ślepe zaufanie modelowi, ponieważ Baidu ukryło wiele, w tym zestawy danych, które informują i uczą jego modeli.
Moc przejrzystych modeli AI otwartego oprogramowania
Chociaż każdy element układanki AI jest kluczowy dla działania modelu, 80% projektów AI kończy się niepowodzeniem, a dane są w centrum problemu. Niedokładne, niepełne i tendencyjne zestawy danych prowadzą do modeli, które nie zachowują się w sposób przewidywalny lub pożądany.
Niedawno opublikowany film z fatalnym wypadkiem Tesla Full-Self-Driving (FSD) z 2023 roku (TSLA ) to przykład najgorszego scenariusza, co może się wydarzyć, gdy zestaw danych i model nie spełniają oczekiwań. Gdy Tesla Model Y przyspieszyła w stronę jasnego, zachodzącego słońca, półautomatyczny system nie mógł zrozumieć ani zareagować odpowiednio na to, co widziały jego kamery – lub nie widziały. Podczas gdy samochody prowadzone przez ludzi zwolniły i zatrzymały się, zamieszanie FSD doprowadziło do śmierci kobiety.
Ten tragiczny błąd odzwierciedlał niepełne dane wizualne, a także brak mechanizmu bezpieczeństwa, który uwzględniał takie punkty ślepe. Gdy deweloperzy nie mają widoczności swoich danych, nie mogą zobaczyć, jak wchodzą w interakcję z modelem, co oznacza, że nie mogą wykryć takich błędów i iterować w celu uzyskania solidnych wyników.
Jeszcze bardziej niepokojące jest to, że bez danych, które napędzają model, są zmuszeni mu zaufać ślepo.
Gdy zestawy danych są otwarte, społeczność AI udowodniła, że wykorzeni problemy, tak jak to zrobiła, odkrywając ponad 1000 adresów URL zawierających zweryfikowany materiał wykorzystujący dzieci w LAION 5B. Z zestawem danych używanym do modeli generowania obrazu AI, które są podstawą w tworzeniu aplikacji, takich jak Stable Diffusion i Midjourney, byłoby to katastrofalne dla branży AI, gdyby użytkownicy zaczęli tworzyć nielegalne, fotorealistyczne obrazy. Zamiast tego, otwarta natura tego zestawu danych pozwoliła społeczności na wykrycie niebezpiecznych treści i motywowanie do naprawy, Liaison B.
Ponadto, wiele z tych pierwszych danych pochodziło z web scrapingu przeprowadzonego przez ogromny Common Crawl, który został również wykorzystany do modeli ChatGPT i LLAMA. Chociaż pączki AI nadal budzą obawy dotyczące praw autorskich, prywatności i tendencyjnych i rasistowskich etykiet, deweloperzy w społeczności AI pracują nad sposobami oczyszczania części rosnącego, otwartego zestawu danych Common Crawl do bezpieczniejszego użycia.
Gdy deweloperzy starają się nie tylko tworzyć potężne AI, ale także AI, której możemy zaufać, zarówno użytkownicy, jak i branża są chronieni przez przejrzystość i współpracę prawdziwego otwartego oprogramowania.
Przyjmowanie ścieżki otwartego oprogramowania
Z wieloma osobami, które są nadal niepewne co do tej nowej technologii, wyścig, aby stać się iOS lub Androidem dużych modeli AI, jest w toku – a gdy globalna społeczność AI dosłownie buduje to, co stanie się standardem dla przyszłości, a systemy AI już prowadzą samochody i oferują oceny medyczne, ustanowienie zaufania przez tworzenie niezależnych, niezawodnych i bezpiecznych AI jest teraz bardziej krytyczne niż kiedykolwiek.
Z chińską społecznością AI, która próbuje przedstawić się jako mistrzowie innowacji otwartych, ścieżka do bezpiecznego AI jest tylko w przejrzystości prawdziwego otwartego oprogramowania, które zostało udowodnione przez dziesięciolecia innowacji oprogramowania. Rzucanie terminu na systemy, które nie udostępniają krytycznych elementów, takich jak dane, nie pozwala deweloperom na badanie, powtarzanie i iterację. Chociaż atrakcja gotowych modeli, takich jak DeepSeek, ERNIE 4.5, Kimi K2 i Qwen3, jest niezaprzeczalna, deweloperzy, którzy je wykorzystują, wymieniają przejrzystość, która pobudza współpracę i innowacje, na wygodę.
Społeczność AI musi wybrać: przyjąć radykalną przejrzystość poprzez prawdziwe otwarte oprogramowanie lub ryzykować budowanie jutrzejszych krytycznych systemów na dzisiejszych czarnych skrzynkach.












