Modely a platformy AI
Vícemodalní umělá inteligence se vyvíjí, jakmile ChatGPT získá zrak s GPT-4V(ize)
V rámci probíhajícího úsilí o to, aby byla umělá inteligence podobná lidem, modely GPT od OpenAI neustále rozšiřují hranice. GPT-4 je nyní schopen přijímat podněty obou textů a obrázků.
Vícemodalita v generativní umělá inteligence označuje schopnost modelu produkovat různé výstupy, jako je text, obrázky nebo audio, na základě vstupu. Tyto modely, které byly vyškoleny na specifických datech, se naučily základní vzory, aby generovaly podobná nová data, a obohacovaly tak aplikace umělé inteligence.
Poslední pokroky ve vícemodalní umělá inteligence
Poslední významný skok v tomto oboru je vidět při integraci DALL-E 3 do ChatGPT, což je významné vylepšení technologie text-to-image od OpenAI. Tento mix umožňuje hladší interakci, kde ChatGPT pomáhá při vytváření přesných podnětů pro DALL-E 3, a přeměňuje tak nápady uživatelů na jasná umělecká díla vytvořená umělou inteligencí. Zatímco uživatelé mohou přímo interagovat s DALL-E 3, přítomnost ChatGPT v tomto procesu činí proces vytváření uměleckých děl umělou inteligencí mnohem uživatelsky přívětivějším.
Přečtěte si více o DALL-E 3 a jeho integraci s ChatGPT zde. Tato spolupráce nejen ukazuje pokrok ve vícemodalní umělá inteligence, ale také činí vytváření uměleckých děl umělou inteligencí mnohem jednodušší pro uživatele.
Google’s health na druhé straně představil Med-PaLM M v červnu tohoto roku. Jedná se o vícemodalitní generativní model, který je schopen kódovat a interpretovat různé biomedicínské údaje. To bylo dosaženo fine-tunováním PaLM-E, jazykového modelu, pro lékařské domény pomocí otevřeného benchmarku, MultiMedBench. Tento benchmark sestává z více než 1 milionu vzorků napříč 7 biomedicínskými typy dat a 14 úkoly, jako je lékařská otázka a generace radiologických zpráv.
Různé odvětví přijímají inovativní vícemodalitní nástroje umělé inteligence, aby poháněly obchodní expanzi, optimalizovaly operace a zvyšovaly zákaznickou angažovanost. Pokrok ve schopnostech umělé inteligence v oblasti hlasu, videa a textu pohání růst vícemodalitní umělé inteligence.
Podniky hledají aplikace vícemodalitní umělé inteligence, které jsou schopné transformovat obchodní modely a procesy, otevírající tak růstové příležitosti napříč ekosystémem generativní umělé inteligence, od nástrojů pro zpracování dat po vznikající aplikace umělé inteligence.
Po uvedení GPT-4 na trh v březnu někteří uživatelé pozorovali pokles kvality odpovědí v čase, což je obava, která byla vyjádřena i známými vývojáři a na fórech OpenAI. Zpočátku to OpenAI odmítlo, ale pozdější studie potvrdila problém. Ukázalo se, že došlo k poklesu přesnosti GPT-4 z 97,6 % na 2,4 % mezi březnem a červnem, což naznačuje pokles kvality odpovědí s následnými aktualizacemi modelu.
Hype kolem Open AI’s ChatGPT je zpět. Nyní přichází s funkcí zraku GPT-4V, která umožňuje uživatelům nechat GPT-4 analyzovat obrázky, které jim poskytují. Jedná se o nejnovější funkci, která byla zpřístupněna uživatelům.
Přidání analýzy obrázků do velkých jazykových modelů (LLM) jako GPT-4 je některými považováno za velký krok vpřed ve výzkumu a vývoji umělé inteligence. Tento typ vícemodalitního LLM otevírá nové možnosti, přesahuje jazykové modely za text a nabízí nové rozhraní a řeší nové typy úkolů, vytváří tak nové zkušenosti pro uživatele.
Školení GPT-4V bylo dokončeno v roce 2022, s časným přístupem spuštěným v březnu 2023. Vizuální funkce v GPT-4V je poháněna technologií GPT-4. Proces školení zůstal stejný. Zpočátku byl model školen na předpověď následujícího slova v textu pomocí obrovské datové sady textů a obrázků z různých zdrojů, včetně internetu.
Později byl model fine-tunován s více daty, využívajíc metodu nazvanou učení s posilováním z lidské zpětné vazby (RLHF), aby generoval výstupy, které lidé preferovali.
GPT-4 Vize Mechanika
Vynikající schopnosti GPT-4 v oblasti jazyka a vize, ačkoli působivé, mají podkladové metody, které zůstávají na povrchu.
Prozkoumání této hypotézy byl představen nový model jazyka a vize, MiniGPT-4 , který využívá pokročilý LLM nazvaný Vicuna. Tento model používá vizuální encoder s předem naučenými komponenty pro vizuální vnímání, které zarovnávají zakódované vizuální funkce s modelem Vicuna prostřednictvím jediné projekční vrstvy. Architektura MiniGPT-4 je jednoduchá, ale efektivní, se zaměřením na zarovnání vizuálních a jazykových funkcí pro zlepšení vizuálních konverzačních schopností.

Architektura MiniGPT-4 zahrnuje vizuální encoder s předem naučenými ViT a Q-Former, jednu lineární projekční vrstvu a pokročilý jazykový model Vicuna.
Trend autoregresivních jazykových modelů ve vizuálních úkolech se také zvýšil, využívající křížově-modalitní přenos pro sdílení znalostí mezi jazykovými a více-modalitními doménami.
MiniGPT-4 mostí vizuální a jazykové domény, zarovnávající vizuální informace z předem naučeného vizuálního encoderu s pokročilým LLM. Model využívá Vicuna jako jazykový dekodér a následuje dvoufázový tréninkový přístup. Zpočátku je školen na velké datové sadě obrazových párů, aby získal znalosti o vize a jazyce, následované fine-tunováním na menší, vysoce kvalitní datové sadě pro zlepšení spolehlivosti a použitelnosti generovaných jazykových výstupů.
Pro zlepšení přirozenosti a použitelnosti generovaných jazykových výstupů v MiniGPT-4, výzkumníci vyvinuli dvoufázový proces zarovnání, který řeší nedostatek adekvátních dat pro zarovnání vize a jazyka. Pro tento účel byl vytvořen specializovaný datový soubor.
Zpočátku model generoval podrobné popisy vstupních obrázků, zlepšující detaily pomocí konverzačního podnětu zarovnaného s formátem jazykového modelu Vicuna. Tento stupeň měl za cíl generovat komplexnější popisy obrázků.
Početné Image Description Prompt:
###Human: <Img><ImageFeature></Img>Popište tento obrázek podrobně. Dejte tolik detailů, kolik je možné. Řekněte všechno, co vidíte. ###Assistant:
Pro zpracování dat po zpracování byly jakékoliv nesrovnalosti nebo chyby v generovaných popisech opraveny pomocí ChatGPT, následované manuální verifikací, aby se zajistila vysoká kvalita.
Druhá fáze fine-tunování Prompt:
###Human: <Img><ImageFeature></Img><Instruction>###Assistant:
Toto prozkoumání otevírá okno do porozumění mechanismům více-modalitních generativních modelů umělé inteligence, jako je GPT-4, a osvětlí, jak lze vizuální a jazykové modality efektivně integrovat, aby se generovaly koherentní a kontextuálně bohaté výstupy.
Prozkoumání GPT-4 Vize
Určení původu obrázků s ChatGPT
GPT-4 Vize zlepšuje schopnost ChatGPT analyzovat obrázky a určit jejich geografický původ. Tato funkce přechází uživatelské interakce z čistě textových na kombinaci textů a vizuálů, stává se tak užitečným nástrojem pro ty, kteří jsou zvědaví na různé místa prostřednictvím dat z obrázků.
Složitá matematická pojmy
GPT-4 Vize vyniká ve zkoumání složitých matematických pojmů analýzou grafických nebo rukopisných výrazů. Tato funkce slouží jako užitečný nástroj pro osoby, které se snaží řešit složité matematické problémy, čímž se GPT-4 Vize stává pozoruhodnou pomocí ve vzdělávacích a akademických oblastech.
Převod rukopisného vstupu na LaTeX kódy
Jedna z pozoruhodných schopností GPT-4V je jeho schopnost převést rukopisné vstupy na LaTeX kódy. Tato funkce je požehnáním pro výzkumné pracovníky, akademiky a studenty, kteří často potřebují převést rukopisné matematické výrazy nebo jiné technické informace do digitální formy. Převod z rukopisného na LaTeX rozšiřuje horizont digitalizace dokumentů a zjednodušuje proces technického psaní.
Extrahování detailů z tabulek
GPT-4V předvádí dovednost při extrahování detailů z tabulek a zodpovídání souvisejících dotazů, což je důležitý nástroj pro analýzu dat. Uživatelé mohou využívat GPT-4V, aby procházeli tabulkami, shromažďovali klíčové poznatky a řešili otázky, čímž se stává robustním nástrojem pro analytiky dat a další odborníky.
Porozumění vizuálním ukazatelům
Unikátní schopnost GPT-4V porozumět vizuálním ukazatelům přidává novou dimenzi uživatelské interakce. Porozuměním vizuálním signálům může GPT-4V reagovat na dotazy s vyšším kontextovým porozuměním.
Vytvoření jednoduchých webových stránek pomocí kresby
Inspirován tímto tweetem, jsem se pokusil vytvořit návrh pro webové stránky unite.ai.
Zatímco výsledek nebyl úplně takový, jaký jsem si původně představoval, zde je výsledek, kterého jsem dosáhl.
Omezení a slabiny GPT-4V(ize)
Pro analýzu GPT-4V provedl tým Open AI kvalitativní a kvantitativní hodnocení. Kvalitativní hodnocení zahrnovala interní testy a externí odborné recenze, zatímco kvantitativní hodnocení měřila odmítnutí modelu a přesnost v různých scénářích, jako je identifikace škodlivého obsahu, rozpoznání demografie, obavy o soukromí, geolokace, kybernetická bezpečnost a více-modalitní jailbreaky.
Přestože model není dokonalý.
Článek článku zdůrazňuje omezení GPT-4V, jako jsou nesprávné odhady a chybějící text nebo znaky v obrazech. Může halucinovat nebo vynalézat fakta. Zvláště není vhodný pro identifikaci nebezpečných látek na obrazech, často je špatně identifikuje.
V medicínském zobrazování může GPT-4V poskytovat nekonzistentní odpovědi a postrádá povědomí o standardních postupech, což může vést k potenciálním nesprávným diagnózám.

Nespolehlivý výkon pro lékařské účely (Zdroj)
Také selhává v pochopení nuancí určitých symbolů nenávisti a může generovat nevhodný obsah na základě vizuálních vstupů. OpenAI doporučuje proti použití GPT-4V pro kritické interpretace, zejména v lékařských nebo citlivých kontextech.
Závěr

Vytvořeno pomocí Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl
Příchod GPT-4 Vize (GPT-4V) přináší řadu nových možností a překážek. Předtím, než byl spuštěn, byla věnována spousta úsilí tomu, aby se minimalizovala rizika, zejména pokud jde o obrázky lidí. Je působivé vidět, jak GPT-4V pokročil, ukazuje velký potenciál v obtížných oblastech, jako je medicína a věda.
Nyní jsou na stole některé velké otázky. Například, zda by tyto modely měly být schopny identifikovat slavné lidi z fotografií? Měly by odhadovat pohlaví, rasu nebo pocity osoby z obrázku? A měly by být provedeny speciální úpravy, aby pomohly osobám se zrakovým postižením? Tyto otázky otevírají plechovku červů o soukromí, spravedlnosti a o tom, jak by měla umělá inteligence zapadat do našich životů, což je něco, co by měli mít všichni možnost vyjádřit.




















