Modely a platformy AI

Bitva otevřeného zdroje proti uzavřeného zdroje jazykových modelů: Technická analýza

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Velké jazykové modely (LLM) v posledních letech okouzluje komunitu umělé inteligence a stojí za průlomovými objevy v oblasti zpracování přirozeného jazyka. Za touto hysterií se skrývá složitá debata – měly by tyto mocné modely být otevřeného zdroje nebo uzavřeného zdroje?

V tomto příspěvku analyzujeme technické rozdíly mezi těmito přístupy, abychom pochopili příležitosti a omezení, které každý z nich nabízí. Projdeme následující klíčové aspekty:

  • Definice otevřeného zdroje vs uzavřeného zdroje LLM
  • Architektonická transparentnost a přizpůsobitelnost
  • Testování výkonu
  • Požadavky na výpočetní zdroje
  • Aplikační všestrannost
  • Přístupnost a licencování
  • Ochrana osobních údajů a důvěrnost
  • Komerční podpora a záruka

Na konci budete mít informovaný pohled na technické kompromisy mezi otevřeným zdrojem a uzavřeným zdrojem LLM, abyste mohli vést svou vlastní strategii AI. Pojďme se ponořit!

Definice otevřeného zdroje vs uzavřeného zdroje LLM

Otevřené zdroje LLM mají veřejně přístupné architektury modelů, zdrojový kód a parametry váhy. To umožňuje výzkumníkům prohlížet vnitřní části, vyhodnocovat kvalitu, reprodukovat výsledky a vytvářet vlastní varianty. Vedoucími příklady jsou Anthropic’s ConstitutionalAI, Meta’s LLaMA a EleutherAI’s GPT-NeoX.

Naopak, uzavřené zdroje LLM považují architekturu modelu a váhy za proprietární majetek. Komerční subjekty, jako je Anthropic, DeepMind a OpenAI, je vyvíjejí interně. Bez přístupu ke kódu nebo návrhovým podrobnostem je reprodukovatelnost a přizpůsobitelnost omezená.

Architektonická transparentnost a přizpůsobitelnost

Přístup k vnitřním částem otevřených zdrojů LLM odemyká příležitosti pro přizpůsobení, které jsou jednoduše nemožné u uzavřených zdrojů.

Průměrem úprav architektury modelu mohou výzkumníci zkoumat techniky, jako je zavedení řídké konektivity mezi vrstvami nebo přidání speciálních klasifikačních tokenů pro zlepšení výkonu na úzkých úkolech. S přístupem k parametrům váhy mohou vývojáři přenést existující reprezentace nebo inicializovat varianty s předem trénovanými stavebními bloky, jako jsou T5 a BERT.

Tato přizpůsobitelnost umožňuje otevřeným zdrojům LLM lépe sloužit specializovaným oblastem, jako je biomedicínský výzkum, generování kódu a vzdělávání. Nicméně, odborné znalosti vyžadované pro to mohou zvýšit bariéru pro dodání kvalitních implementací.

Uzavřené zdroje LLM nabízejí omezenou přizpůsobitelnost, protože jejich technické podrobnosti zůstávají proprietární. Nicméně, jejich podporovatelé poskytují rozsáhlé zdroje pro interní výzkum a vývoj. Výsledné systémy rozšiřují hranice toho, co je možné s obecnou architekturou LLM.

I když jsou méně flexibilní, uzavřené zdroje LLM vynikají v široce aplikovatelných úkolech přirozeného jazyka. Také zjednodušují integraci tím, že se přizpůsobují zavedeným rozhraním, jako je standard OpenAPI.

Testování výkonu

Navzdory architektonické transparentnosti měření výkonu otevřených zdrojů LLM představuje výzvy. Jejich flexibilita umožňuje nekonečné možné konfigurace a strategie ladění. Také umožňuje modelům označeným jako „otevřené zdroje“ zahrnovat proprietární techniky, které zkreslují srovnání.

Uzavřené zdroje LLM se chlubí jasně definovanými cíli výkonu, protože jejich podporovatelé měří a propagují konkrétní prahové hodnoty metrik. Například, Anthropic zveřejňuje přesnost ConstitutionalAI na kurátorovaných sadách problémů NLU. Microsoft (MSFT ) zdůrazňuje, jak GPT-4 překonává lidské hranice na nástroji SuperGLUE pro porozumění jazyka.

Říká se, že tyto úzce definované testy čelily kritice za přehánění výkonu v reálných úkolech a podhodnocení neúspěchů. Skutečně nezaujaté hodnocení LLM zůstává otevřenou výzkumnou otázkou – pro oba otevřené i uzavřené přístupy.

Požadavky na výpočetní zdroje

Školení velkých jazykových modelů vyžaduje rozsáhlé výpočetní zdroje. OpenAI utratila miliony za školení GPT-3 na cloudové infrastruktuře, zatímco Anthropic spotřebovala více než 10 milionů dolarů za GPU pro ConstitutionalAI.

Cena za takové modely vylučuje většinu jednotlivců a malých týmů z komunity otevřeného zdroje. Ve skutečnosti, EleutherAI musela odstranit model GPT-J z veřejného přístupu kvůli explozivním nákladům na hostování.

Bez hlubokých kapes, úspěchy otevřeného zdroje LLM využívají darované výpočetní zdroje. LAION kurátoroval svůj technicky zaměřený model LAION-5B pomocí crowdsourcových dat. Projekt Anthropic ConstitutionalAI využil dobrovolnické výpočetní zdroje.

Velké technologické firmy, jako jsou Google (GOOGL ), Meta a Baidu, poskytují uzavřeným zdrojům potřebné finanční palivo pro industrializaci vývoje LLM. To umožňuje škálovat na délky, které jsou nepředstavitelné pro komunitní iniciativy – podívejte se na model Gopher od DeepMind s 280 miliardami parametrů.

Aplikační všestrannost

Přizpůsobitelnost otevřených zdrojů LLM umožňuje řešit vysoce specializované použití. Výzkumníci mohou agresivně upravovat vnitřní části modelu, aby zlepšili výkon na úzkých úkolech, jako je předpověď struktury proteinů, generování dokumentace kódu a ověření matematických důkazů.

To řečeno, schopnost přístupu a úpravy kódu nezajišťuje efektivní řešení specifické domény bez správných trénovacích dat. Komplexní trénovací sady pro úzké aplikace vyžadují značné úsilí pro kurátorování a aktualizaci.

Zde uzavřené zdroje LLM těží z přístupu k interním repozitářům a komerčním partnerům pro získání trénovacích dat. Například, DeepMind licencuje databáze, jako je ChEMBL pro chemii a UniProt pro proteiny, aby rozšířil dosah aplikací. Průmyslový přístup k datům umožňuje modelům, jako je Gopher, dosáhnout pozoruhodné všestrannosti, navzdory architektonické neprůhlednosti.

Přístupnost a licencování

Permisivní licencování otevřených zdrojů LLM podporuje bezplatný přístup a spolupráci. Modely, jako je GPT-NeoX, LLaMA a Jurassic-1 Jumbo, používají dohody, jako je Creative Commons a Apache 2.0, aby umožnily nekomerční výzkum a spravedlivé komerční využití.

Naopak, uzavřené zdroje LLM nesou restriktivní licence, které omezují dostupnost modelu. Komerční subjekty pečlivě kontrolují přístup, aby chránily potenciální příjmy z předpovědních API a podnikových partnerství.

Organizace, jako je Anthropic a Cohere, účtují za přístup k rozhraním ConstitutionalAI a Cohere-512. Nicméně, to riskuje vyloučení důležitých výzkumných oblastí a zkreslení vývoje ve prospěch dobře financovaných odvětví.

Otevřené licencování klade výzvy, zejména kolem atributů a odpovědnosti. Pro výzkumné použití však svobody poskytnuté otevřeným zdrojem nabízejí jasné výhody.

Ochrana osobních údajů a důvěrnost

Trénovací sady pro LLM obvykle agregují obsah z různých online zdrojů, jako jsou webové stránky, vědecké články a diskuzní fóra. To riskuje, že se v výstupech modelu objeví osobní nebo jinak citlivé informace.

Pro otevřené zdroje LLM poskytuje kontrola složení trénovacích dat nejlepší záruku proti problémům s důvěrností. Hodnocení zdrojů dat, filtrů a dokumentování problematických příkladů nalezených během testování může pomoci identifikovat zranitelnosti.

Bohužel, uzavřené zdroje LLM vylučují takovouto veřejnou kontrolu. Místo toho se spotřebitelé musí spolehnout na rigor interního přezkumu na základě oznámených politik. Například, Azure Cognitive Services slibuje filtrovat osobní údaje, zatímco Google specifikuje formální přezkumy ochrany osobních údajů a označení dat.

Celkově, otevřené zdroje LLM umožňují proaktivnější identifikaci rizik důvěrnosti v systémech AI, než se tyto slabiny projeví ve velkém měřítku. Uzavřené protějšky nabízejí relativně omezenou transparentnost do postupů zpracování dat.

Komerční podpora a záruka

Potenciál komerčního využití uzavřených zdrojů LLM motivuje významné komerční investice do vývoje a údržby. Například, očekávající lukrativní návraty z portfolia Azure AI, Microsoft souhlasil s více miliardovými partnery s OpenAI kolem modelů GPT.

Naopak, otevřené zdroje LLM spoléhají na dobrovolníky, kteří věnují osobní čas pro údržbu, nebo na granty, které poskytují omezené financování. Tento asymetrický přístup k zdrojům riskuje kontinuitu a dlouhodobou životaschopnost otevřených zdrojových projektů.

Nicméně, bariéry pro komerční využití také osvobozují otevřené zdrojové komunity, aby se soustředily na vědecký pokrok nad zisk. A decentralizovaná povaha otevřených ekosystémů zmírňuje závislost na udržitelném zájmu jediného podporovatele.

Nakonec, každý přístup nese kompromisy kolem zdrojů a motivací. Uzavřené zdroje LLM si těší větší bezpečnost financování, ale koncentrují vliv. Otevřené ekosystémy podporují rozmanitost, ale trpí zvýšenou nejistotou.

Navigace v krajině otevřeného zdroje vs uzavřeného zdroje LLM

Rozhodnutí mezi otevřeným zdrojem nebo uzavřeným zdrojem LLM vyžaduje sladění priorit organizace, jako je přizpůsobitelnost, přístupnost a škálovatelnost, s možnostmi modelu.

Pro výzkumníky a startupy, otevřené zdroje poskytují větší kontrolu pro úpravu modelů pro specifické úkoly. Licencování také usnadňuje bezplatné sdílení poznatků mezi spolupracovníky. Nicméně, břemeno zdrojů trénovacích dat a infrastruktury může podkopat reálnou životaschopnost.

Naopak, uzavřené zdroje LLM slibují značné zlepšení kvality díky dostatečnému financování a datům. Nicméně, omezení kolem přístupu a úprav limitují vědeckou transparentnost, zatímco váží nasazení na roadmapy dodavatelů.

V praxi, otevřené standardy kolem specifikací architektury, kontrolních bodů modelu a vyhodnocovacích dat mohou pomoci kompenzovat nevýhody obou přístupů. Společné základy, jako je Google’s Transformer nebo Oxford’s REALTO, zlepšují reprodukovatelnost. Standardy interoperability, jako je ONNX, umožňují míchání komponent z otevřených a uzavřených zdrojů.

Nakonec, co záleží, je výběr spráright nástroje – otevřeného zdroje nebo uzavřeného zdroje – pro danou úlohu. Komerční subjekty, které podporují uzavřené zdroje LLM, mají nezpochybnitelný vliv. Ale vášeň a zásady otevřené vědy budou pokračovat ve hře klíčové role při pohánění pokroku AI.

Já pět let se ponořím do fascinujícího světa strojového učení a hlubokého učení. Mé vášně a odborné znalosti mě vedly k tomu, abych se podílel na více než 50 různých projektech softwarového inženýrství, se zvláštním zaměřením na AI/ML. Mé pokračující zvědavosti mě také přivedly k přirozenému jazykovému zpracování, oblasti, kterou jsem ochoten prozkoumat dále.