Modely a platformy AI

První výročí ChatGPT: Přetvoření budoucnosti interakce s umělou inteligencí

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Při zpětném pohledu na první rok ChatGPT je zřejmé, že tento nástroj významně změnil scénu umělé inteligence. Spuštěn na konci roku 2022, ChatGPT vynikal kvůli svému uživatelsky přátelskému, konverzačnímu stylu, který dělal interakci s umělou inteligencí podobnější rozhovoru s osobou než se strojem. Tento nový přístup rychle upoutal pozornost veřejnosti. Již pět dní po svém vydání měl ChatGPT přilákaný milion uživatelů. Na počátku roku 2023 se toto číslo rozrostlo na zhruba 100 milionů měsíčních uživatelů a do října platforma lákala kolem 1,7 miliardy návštěv po celém světě. Tyto čísla mluví o jeho popularitě a užitečnosti.

Během uplynulého roku uživatelé našli spoustu kreativních způsobů, jak použít ChatGPT, od jednoduchých úkolů, jako je psaní e-mailů a aktualizace životopisů, až po zahájení úspěšných podniků. Ale nejde jen o to, jak lidé jej používají; sama technologie se vyvinula a zlepšila. Zpočátku byl ChatGPT bezplatnou službou, která nabízela podrobné textové odpovědi. Nyní existuje ChatGPT Plus, který zahrnuje ChatGPT-4. Tato aktualizovaná verze je školená na více datech, poskytuje méně chybných odpovědí a lépe rozumí složitým pokynům.

Jednou z největších aktualizací je, že ChatGPT může nyní interagovat několika způsoby – může poslouchat, mluvit a dokonce zpracovávat obrázky. To znamená, že můžete s ním mluvit prostřednictvím jeho mobilní aplikace a ukázat mu obrázky, aby získal odpovědi. Tyto změny otevřely nové možnosti pro umělou inteligenci a změnily, jak lidé vnímají a myslí o roli umělé inteligence v našich životech.

Od svých počátků jako technologické demo až po současný status jako hlavní hráč ve světě technologií je cesta ChatGPT quite působivá. Zpočátku byl považován za způsob, jak otestovat a vylepšit technologii získáním zpětné vazby od veřejnosti. Ale brzy se stal nezbytnou součástí scény umělé inteligence. Tento úspěch ukazuje, jak efektivní je jemné ladění velkých jazykových modelů (LLM) se supervizovaným učením a zpětnou vazbou od lidí. Jako výsledek, ChatGPT může zvládnout širokou škálu otázek a úkolů.

Soutěž na vývoj nejvhodnějších a nejuniverzálnějších systémů umělé inteligence vedla k proliferaci jak open-source, tak proprietárních modelů, jako je ChatGPT. Porozumění jejich obecným schopnostem vyžaduje komplexní benchmarky napříč širokým spektrem úkolů. Tato sekce prozkoumává tyto benchmarky, vrhající světlo na to, jak se různé modely, včetně ChatGPT, vyrovnávají proti sobě.

Vyhodnocení LLM: Benchmarky

  1. MT-Bench: Tento benchmark testuje konverzační a pokynové schopnosti napříč osmi doménami: psaní, roleplay, extrakce informací, rozumění, matematika, kódování, STEM znalosti a humanitní a sociální vědy. Silnější LLM, jako je GPT-4, se používají jako vyhodnocovatelé.
  2. AlpacaEval: Založený na AlpacaFarm vyhodnocovací sadě, tento LLM-založený automatický vyhodnocovatel benchmarkuje modely proti odpovědím z pokročilých LLM, jako je GPT-4 a Claude, počítající výherní poměr kandidátských modelů.
  3. Otevřený LLM Leaderboard

    : Používající Language Model Evaluation Harness, tento leaderboard vyhodnocuje LLM na sedmi klíčových benchmarcích, včetně rozumění a obecných znalostních testů, v obou zero-shot a few-shot nastaveních.

  4. BIG-bench: Tento kolektivní benchmark pokrývá přes 200 nových jazykových úkolů, sahajících přes širokou škálu témat a jazyků. Cílem je prozkoumat LLM a předpovědět jejich budoucí schopnosti.
  5. ChatEval: Víceagentní debatní rámec, který umožňuje týmům autonomně diskutovat a vyhodnocovat kvalitu odpovědí z různých modelů na otevřené otázky a tradiční úkoly generování přirozeného jazyka.

Komparativní výkon

Z hlediska obecných benchmarků open-source LLM prokázaly pozoruhodný pokrok. Llama-2-70B, například, dosáhla působivých výsledků, zejména po jemném ladění s instrukčními daty. Její varianta, Llama-2-chat-70B, vynikla v AlpacaEval s 92,66% výherním poměrem, překonala GPT-3.5-turbo. Nicméně, GPT-4 zůstává lídrem s 95,28% výherním poměrem.

Zephyr-7B, menší model, prokázal schopnosti srovnatelné s většími 70B LLM, zejména v AlpacaEval a MT-Bench. Mezitím WizardLM-70B, jemně laděný s rozmanitou škálou instrukčních dat, dosáhl nejvyššího skóre mezi open-source LLM na MT-Bench. Nicméně, stále zaostával za GPT-3.5-turbo a GPT-4.

Zajímavý vstup, GodziLLa2-70B, dosáhl konkurenčního skóre na Open LLM Leaderboard, demonstrující potenciál experimentálních modelů kombinujících rozmanité datové sady. Podobně, Yi-34B, vyvinutý od začátku, vynikl se skóre srovnatelným s GPT-3.5-turbo a pouze mírně za GPT-4.

UltraLlama, s jemným laděním na rozmanitých a kvalitních datech, odpovídal GPT-3.5-turbo ve svých navrhovaných benchmarcích a dokonce jej překonal v oblastech světových a profesních znalostí.

Škálování: Vzestup obřích LLM

LLM modely

Top LLM modely od roku 2020

Značná tendence ve vývoji LLM byla škálování modelových parametrů. Modely, jako je Gopher, GLaM, LaMDA, MT-NLG a PaLM, posunuly hranice, vyvrcholící v modelech s až 540 miliardami parametrů. Tyto modely prokázaly výjimečné schopnosti, ale jejich uzavřená povaha omezila jejich širší aplikaci. Tento limit vyvolal zájem o vývoj open-source LLM, trend, který získává na síle.

V paralele se škálováním modelových velikostí, výzkumníci prozkoumali alternativní strategie. Místo toho, aby pouze dělali modely větší, zaměřili se na vylepšení předškolního vzdělávání menších modelů. Příklady zahrnují Chinchilla a UL2, které prokázaly, že více není vždy lepší; chytré strategie mohou vést k efektivnímu výsledku. Kromě toho, byla věnována značná pozornost instrukčnímu ladění jazykových modelů, s projekty, jako je FLAN, T0 a Flan-T5, které významně přispěly do této oblasti.

Katalyzátor ChatGPT

Zavedení OpenAI ChatGPT označilo zlomový bod ve výzkumu NLP. Aby soutěžili s OpenAI, společnosti, jako je Google (GOOGL ) a Anthropic, spustily své vlastní modely, Bard a Claude, resp. Zatímco tyto modely prokázaly srovnatelný výkon s ChatGPT v mnoha úkolech, stále zaostávají za nejnovějším modelem OpenAI, GPT-4. Úspěch těchto modelů je primárně přisuzován posilování učení z lidské zpětné vazby (RLHF), technice, která získává zvýšenou výzkumnou pozornost pro další vylepšení.

Pověsti a spekulace kolem OpenAI Q* (Q-Star)

Nedávné zprávy naznačují, že výzkumníci v OpenAI možná dosáhli významného pokroku v oblasti umělé inteligence s vývojem nového modelu nazvaného Q* (čteno jako Q hvězda). Údajně Q* má schopnost vykonávat úkoly na úrovni základní školy, činem, který vyvolal diskuse mezi odborníky o jeho potenciálu jako milníku směrem k umělé obecné inteligenci (AGI). Zatímco OpenAI nekomentoval tyto zprávy, údajné schopnosti Q* vyvolaly značný zájem a spekulace na sociálních médiích a mezi nadšenci umělé inteligence.

Vývoj Q* je pozoruhodný, protože existující jazykové modely, jako je ChatGPT a GPT-4, zatímco schopné některých matematických úkolů, nejsou zvláště dobré v jejich spolehlivém zvládnutí. Výzva spočívá v potřebě umělé inteligence, aby nejen rozpoznala vzory, jako to dělají současné hluboké učení a transformátory, ale aby také rozuměla a zpracovávala abstraktní koncepty. Matematika, jakožto benchmark pro rozumění, vyžaduje, aby umělá inteligence plánovala a vykonávala multiple kroky, demonstrující hluboké pochopení abstraktních konceptů. Tato schopnost by znamenala významný skok v schopnostech umělé inteligence, potenciálně sahající za hranice matematiky do dalších komplexních úkolů.

Nicméně, odborníci varují před přeháněním tohoto vývoje. Zatímco systém umělé inteligence, který spolehlivě řeší matematické problémy, by byl působivým úspěchem, nutně neznamená příchod superinteligentní umělé inteligence nebo AGI. Současný výzkum umělé inteligence, včetně snah OpenAI, se zaměřil na elementární problémy, s různou mírou úspěchu v komplexnějších úkolech.

Potenciální aplikace pokroků, jako je Q*, jsou rozsáhlé, sahající od personalizovaného vzdělávání až po pomoc ve vědeckém výzkumu a inženýrství. Nicméně, je také důležité spravovat očekávání a uznat omezení a bezpečnostní obavy spojené s takovými pokroky. Obavy o existenční rizika umělé inteligence, základní obavy OpenAI, zůstávají relevantní, zejména když systémy umělé inteligence začínají více interagovat se skutečným světem.

Otevřené hnutí LLM

Pro posílení výzkumu open-source LLM, Meta vydala Llama série modelů, spustivši vlnu nových vývojů založených na Llama. To zahrnuje modely jemně laděné s instrukčními daty, jako je Alpaca, Vicuna, Lima a WizardLM. Výzkum také expanduje do vylepšování agentních schopností, logického rozumění a modelování dlouhých kontextů v rámci Llama-based rámce.

Kromě toho, existuje rostoucí trend vývoje mocných LLM ze začátku, s projekty, jako je MPT, Falcon, XGen, Phi, Baichuan, Mistral, Grok a Yi. Tyto snahy odrážejí závazek demokratizovat schopnosti uzavřených LLM, činící pokročilé nástroje umělé inteligence dostupnějšími a efektivnějšími.

Dopad ChatGPT a open-source modelů v zdravotnictví

Hledíme se na budoucnost, kde LLM pomohou při klinickém zápisu, vyplňování formulářů pro úhrady a při podpoře lékařů v diagnostice a plánování léčby. To upoutalo pozornost jak technologických gigantů, tak zdravotnických institucí.

Microsoftova diskuze s Epic, předním poskytovatelem softwaru pro elektronické zdravotnické záznamy, signalizuje integraci LLM do zdravotnictví. Iniciativy jsou již v místě v UC San Diego Health a Stanford University Medical Center. Podobně, Googleova partnerství s Mayo Clinic a spuštění Amazon (AMZN ) Web Services HealthScribe, služby pro klinickou dokumentaci s umělou inteligencí, označují významné kroky v tomto směru.

Nicméně, tyto rychlé nasazení vyvolávají obavy o předání kontroly nad medicínou korporativním zájmům. Uzavřená povaha těchto LLM činí je obtížně vyhodnotitelnými. Jejich případná modifikace nebo ukončení z důvodu ziskovosti by mohlo ohrozit péči o pacienty, soukromí a bezpečnost.

Okamžité potřeba je pro otevřený a inkluzivní přístup k vývoji LLM ve zdravotnictví. Zdravotnické instituce, výzkumníci, lékaři a pacienti by měli spolupracovat globálně, aby vyvinuli open-source LLM pro zdravotnictví. Tento přístup, podobný Trillion Parameter Consortium, by umožnil sdílení výpočetních, finančních zdrojů a odborných znalostí.

Já pět let se ponořím do fascinujícího světa strojového učení a hlubokého učení. Mé vášně a odborné znalosti mě vedly k tomu, abych se podílel na více než 50 různých projektech softwarového inženýrství, se zvláštním zaměřením na AI/ML. Mé pokračující zvědavosti mě také přivedly k přirozenému jazykovému zpracování, oblasti, kterou jsem ochoten prozkoumat dále.