Myslitelé
Přizpůsobené LLM pro každou firmu? DeepSeek ukazuje cestu

Dříve byla technologií výzva „mobilní telefony pro každého“ – a skutečně mobilní komunikace změnily podnikání (a svět). Dnes je ekvivalentem této výzvy poskytnout každému přístup k umělým inteligencím. Ale skutečná síla umělé inteligence spočívá v jejím využití pro specifické potřeby podniků a organizací. Cesta, kterou prokázal čínský startup DeepSeek, ukazuje, jak lze umělou inteligenci skutečně využít každým, zejména těmi s omezeným rozpočtem, aby splnili své specifické potřeby. Skutečně příchod levnější umělé inteligence slibuje změnit hluboce zakořeněný vzorec, kdy řešení umělé inteligence často zůstávají mimo dosah mnoha malých podniků a organizací kvůli nákladovým požadavkům.
LLM jsou – nebo byly – drahým podnikem, vyžadujícím přístup k velkým množství dat, velkému počtu výkonných počítačů pro zpracování dat a času a zdrojů investovaných do školení modelu. Ale tyto pravidla se mění. DeepSeek, který funguje na minimálním rozpočtu, vyvinul svůj vlastní LLM a aplikaci typu ChatGPT pro dotazy – s mnohem menším investičním výdajem než podobné systémy postavené americkými a evropskými společnostmi. Přístup DeepSeeku otevírá okno do vývoje LLM pro menší organizace, které nemají miliardy na utratu. Skutečně den, kdy většina malých organizací bude moci vyvinout své vlastní LLM pro své specifické účely, poskytující obvykle účinnější řešení než obecné LLM, jako je ChatGPT, nemusí být daleko.
Zatímco debata zůstává o skutečných nákladech DeepSeeku, není to prostě cena, která ho a podobné modely odlišuje: Je to skutečnost, že spoléhal na méně pokročilé čipy a více zaměřený přístup ke školení. Jako čínská společnost podléhající americkým vývozním omezením, DeepSeek neměl přístup k pokročilým čipům Nvidia, které se obecně používají pro náročné výpočetní operace vyžadované pro vývoj LLM, a byl proto nucen použít méně výkonné čipy Nvidia H-800 (NVDA ), které nemohou zpracovávat data tak rychle nebo efektivně.
Aby kompenzoval tuto absenci výkonu, DeepSeek přijal jiný, více zaměřený a přímý přístup ke svému vývoji LLM. Místo toho, aby házel hory dat na model a spoléhal na výpočetní sílu k označení a aplikaci dat, DeepSeek zúžil školení, využívající malé množství vysoce kvalitních “cold-start” dat a aplikující IRL (iterativní učení s posilováním, s algoritmem aplikujícím data na různé scénáře a učícím se z nich). Tento zaměřený přístup umožňuje modelu učit se rychleji, s méně chybami a méně zbytečným výpočetním výkonem.
Podobně jako rodiče mohou vést specifické pohyby dítěte, pomáhají mu úspěšně převalit se poprvé – spíše než nechat dítě, aby to vypořádalo samo, nebo učit dítě širšímu spektru pohybů, které by teoreticky mohly pomoci s převalením – data scientists školení těchto více zaměřených modelů umělých inteligencí se zaměřují na to, co je nejpotřebnější pro určité úkoly a výsledky. Takové modely pravděpodobně nemají tak široké spolehlivé použití jako větší LLM, jako je ChatGPT, ale lze na ně spolehnout pro specifické aplikace, a provádět je s přesností a efektivitou. I kritici DeepSeeku přiznávají, že jeho zjednodušený přístup ke vývoji významně zvýšil efektivitu, umožnil jim dělat více s mnohem méně.
Tento přístup je o tom, aby umělá inteligence dostala nejlepší vstupy, aby mohla dosáhnout svých milníků nejchytřejším a nejefektivnějším způsobem, a může být cenný pro jakoukoli organizaci, která chce vyvinout LLM pro své specifické potřeby a úkoly. Takový přístup je stále cennější pro malé podniky a organizace. První krok spočívá v začínání s pravými daty. Například společnost, která chce použít umělou inteligenci, aby pomohla svým prodejním a marketingovým týmům, by měla vyškolit svůj model na pečlivě vybrané datové sadě, která se zaměřuje na prodejní konverzace, strategie a metriky. To udržuje model od plýtvání časem a výpočetním výkonem na irelevantních informacích. Kromě toho školení musí být strukturováno ve fázích, zajišťujících, že model zvládne každý úkol nebo koncept, než přechází na další.
To má také paralely ve výchově dítěte, jak jsem sám zjistil, od té doby, co jsem se stal otcem před několika měsíci. V obou scénářích zajišťuje řízený, krok za krokem přístup, že se neztratí zdroje a snižuje se tření. Nakonec takový přístup u modelů umělých inteligencí i u lidských dětí vede k iterativnímu zlepšování. Jak dítě roste, nebo model se učí více, jeho schopnosti se zlepšují. To znamená, že modely lze upravit a vylepšit, aby lépe zvládaly reálné situace.
Tento přístup snižuje náklady, brání tomu, aby se projekty umělé inteligence staly zdrojovým odsáváním, a činí je přístupnějšími pro menší týmy a organizace. Také vede k lepšímu výkonu modelů umělé inteligence rychleji; a protože modely nejsou přetíženy zbytečnými daty, lze je také upravit, aby se přizpůsobily novým informacím a měnícím se obchodním potřebám – klíčovým v konkurenčních trzích.
Příchod DeepSeeku a světa levnější a efektivnější umělé inteligence – ačkoli to最初 šířil paniku po celém světě umělé inteligence a trzích – je celkově pozitivní vývoj pro sektor umělé inteligence. Greater efektivita a nižší náklady na umělou inteligenci, alespoň pro některé zaměřené aplikace, nakonec povedou k většímu využití umělé inteligence obecně, což pohání růst pro všechny, od vývojářů po výrobce čipů až po koncové uživatele. Skutečně DeepSeek ilustruje Jevonsův paradox – kde větší efektivita pravděpodobně povede k většímu využití zdroje, ne menšímu. Jak tento trend vypadá, že bude pokračovat, malé podniky, které se zaměřují na využití umělé inteligence, aby splnily své specifické potřeby, budou také lépe vybaveny pro růst a úspěch.












