Myslitelé
Přemýšlení o open source v éře generativního AI

Otevřený model – software development ethos, ve kterém je zdroj kódu volně dostupný pro veřejnou redistribuci nebo modifikaci – byl po dlouhou dobu katalyzátorem inovace. Ideál se zrodil v roce 1983, kdy Richard Stallman, software developer, byl frustrován uzavřenou povahou svého uzavřeného tiskárny.
Jeho vize vyvolala hnutí free software, které připravilo cestu pro otevřenou komunitu, která pohání velkou část dnešního internetu a software inovací.
Ale to bylo před více než 40 lety.
Dnes, Generativní AI, s jeho jedinečnými technickými a etickými výzvami, mění význam “otevřenosti”, vyžaduje, aby jsme přehodnotili a přizpůsobili otevřený model – ne aby jsme ho opustili, ale aby jsme ho přizpůsobili.
AI a otevřené svobody
Čtyři základní svobody otevřeného software – schopnost spuštění, studia, modifikace a redistribuce libovolného software kódu – jsou v rozporu s povahou generativního AI několika způsoby:
- Spuštění: AI modely často vyžadují velmi vysoké infrastruktury a výpočetní náklady, které omezují přístup kvůli omezením zdrojů.
- Studium a modifikace: AI modely jsou neuvěřitelně komplexní, takže porozumění a modifikace bez přístupu k both kódu a datům, která je informují, je významnou výzvou.
- Redistribuce: Mnoho AI modelů omezuje redistribuci podle designu, zejména ty s trénovanými váhami a proprietárními datovými sadami vlastněnými poskytovatelem platformy.
Eroze těchto základních principů není způsobena zlým úmyslem, ale spíše obrovskou složitostí a náklady moderních AI systémů. Skutečně, finanční nároky na trénování špičkových AI modelů dramaticky vzrostly v posledních letech – OpenAI’s GPT-4 údajně měl trénovací náklady až 78 milionů dolarů, včetně mzdy zaměstnanců, s celkovými výdaji přesahující 100 milionů dolarů.
Složitost “otevřeného” AI
Pravděpodobně otevřený AI model by vyžadoval úplnou transparentnost zdrojového kódu inference, trénovacího zdrojového kódu, modelových vah a trénovacích dat. Nicméně, mnoho modelů označených jako “otevřené” bude uvolňovat pouze inference kód nebo částečné váhy, zatímco jiné nabízejí omezené licencování nebo omezují komerční použití úplně.
Tato nestranná otevřenost vytváří iluzi otevřených principů, zatímco ve skutečnosti selhává.
Zvažte, že analýza Open Source Initiative (OSI) našla, že několik populárních velkých jazykových modelů tvrdících, že jsou otevřené – včetně Llama2 a Llama 3.x (vyvinutých Meta), Grok (X), Phi-2 (Microsoft) a Mixtral (Mistral AI) – jsou strukturálně neslučitelné s otevřenými principy.
Údržba a motivace výzev
Většina otevřeného software byla postavena na dobrovolnických nebo grantových úsilích, spíše než na nákladné infrastruktury. AI modely, na druhé straně, jsou drahé na trénování a údržbu, a náklady se očekávají, že porostou. CEO Anthropic, Dario Amodei, předpovídá, že by mohlo nakonec stát $100 miliard na trénování špičkového modelu.
Bez udržitelného modelu financování nebo struktury motivace, vývojáři čelí volbě mezi omezením přístupu prostřednictvím uzavřeného zdrojového kódu nebo nekomerčních licencí nebo rizikem finančního kolapsu.
Nedorozumění kolem “otevřených vah” a licencování
Dostupnost AI modelů se stala stále více zmatenou, s mnoha platformami, které se označují jako “otevřené”, zatímco ukládají omezení, která fundamentálně odporují skutečným otevřeným principům. Tato “sleight-of-hand” se projevuje několika způsoby:
- Modely označené jako “otevřené váhy” mohou zakazovat komerční použití úplně, udržují je více jako akademické kuriozity než praktické obchodní nástroje pro veřejnost.
- Někteří poskytovatelé nabízejí přístup k předtrénovaným modelům, ale horlivě střeží svá trénovací data a metodologie, což znemožňuje reprodukovat nebo ověřit jejich zjištění smysluplně.
- Mnohé platformy ukládají omezení redistribuce, která brání vývojářům ve stavbě nebo zlepšování modelů pro své komunity, i když mohou plně “přístup” kódu.
V těchto případech je “otevřeno pro výzkum” pouze dvojsmyslný výraz pro “uzavřeno pro podnikání”. Výsledkem je neupřímná forma vendor lock-in, kde organizace investují čas a zdroje do platform, které se zdají být otevřeně přístupné, pouze aby objevily kritické omezení, když se pokusí škálovat nebo komerčně využít aplikace.
Výsledující zmatení neonly frustruje vývojáře, ale také aktivně podkopává důvěru v AI ekosystému. To vytváří nerealistické očekávání mezi stakeholdery, kteří rozumně předpokládají, že “otevřené” AI je srovnatelné s otevřenými softwaremi, kde je transparentnost, práva modifikace a komerční svoboda dodržována.
Právní prodleva
Rychlý pokrok GenAI již překračuje vývoj vhodných právních rámců, vytváří složitou síť intelektuálních vlastnických výzev, které se sčítají s předchozími obavami.
První hlavní právní bitva se soustředí na použití trénovacích dat. Deep learning modely získávají velké datové sady z internetu, jako jsou veřejně dostupné obrázky a texty webových stránek. Tato masivní sbírka dat vyvolala vášnivé debaty o intelektuálních vlastnických právech. Technické společnosti argumentují, že jejich AI systémy studují a učí se z autorsky chráněných materiálů, aby vytvořily nové, transformační obsahy. Autorská práva, nicméně, tvrdí, že tyto AI společnosti nezákonně kopírují jejich díla, generují konkurenční obsah, který ohrožuje jejich živobytí.
Vlastnictví AI-generovaných derivátů představuje další právní nejasnost. Nikdo není úplně jistý, jak klasifikovat AI-generovaný obsah, kromě U.S. Copyright Office, který uvádí, že “pokud AI zcela generuje obsah, nemůže být chráněn autorským právem.”
Právní nejistota kolem GenAI – zejména s ohledem na autorská práva, vlastnictví AI-generovaných děl a neлицenzovaná data ve trénovacích datech – se stává ještě více složitou, když se základní AI modely stanou nástroji geopolitického významu: Národy, které závodí o vývoj lepších AI schopností, mohou být méně nakloněny omezit přístup k datům, což může uvést země s přísnějšími ochranami duševního vlastnictví do konkurenční nevýhody.
Co se musí stát z open source v éře AI
GenAI vlak již opustil stanici a neukazuje žádné známky zpomalení. Doufáme, že postavíme budoucnost, kde AI podporuje spíše než brání inovace. V tomto případě technologičtí lídři potřebují rámec, který zajišťuje bezpečné a transparentní komerční použití, podporuje odpovědnou inovaci, řeší vlastnictví dat a licencování a rozlišuje mezi “otevřeným” a “volným”.
Emergentní koncept, Open Commercial Source License, může nabídnout cestu vpřed, navrhuje volný přístup pro nekomerční použití, licencovaný přístup pro komerční použití a uznání a respektování původu a vlastnictví dat.
Aby se přizpůsobili této nové realitě, otevřená komunita musí vyvinout AI-specifické otevřené licenční modely, vytvořit veřejně-privátní partnerství, aby financovala tyto modely, a stanovit důvěryhodné standardy pro transparentnost, bezpečnost a etiku.
Otevřený zdroj změnil svět jednou. Generativní AI mění ho znovu. Abychom zachovali ducha otevřenosti, musíme přizpůsobit písmo jeho zákona, uznávající jedinečné nároky AI a řešící výzvy přímo, abychom vytvořili inkluzivní a udržitelný ekosystém.












