Prompt engineering
Podrobnější pohled na DALL-E 3 od OpenAI

V světě Generative AI je důležité držet krok s nejnovějším vývojem. A když jde o generování obrázků, Stable Diffusion a Midjourney byly platformami, o kterých se všichni bavili – až do teď.
OpenAI, podporovaný technologickým gigantem Microsoftem, představil DALL·E 3 20. září 2023.
DALL-E 3 není jen o vytváření obrázků; je o tom, aby vaše nápady byly skutečné, přesně tak, jak je jste si je představovali. A nejlepší část? Je to rychlé, opravdu rychlé. Máte nápad, zadáte ho do DALL-E 3 a hned je váš obrázek připraven.
Takže v tomto článku se budeme podrobněji zabývat tím, co je DALL-E 3. Budeme mluvit o tom, jak funguje, co ho odlišuje od ostatních a proč by mohl být právě tím nástrojem, který jste potřebovali. Bez ohledu na to, zda jste designér, umělec nebo někdo s mnoha cool nápady, budete chtít zůstat zde. Pojďme začít.
Co je nového u DALL·E 3, je to, že lépe chápe kontext než DALL·E 2. Předchozí verze mohly někdy vynechat některé detaily nebo ignorovat některé detaily, ale DALL·E 3 je přesný. Získá přesně ty detaily, které jste požadovali, a poskytne vám obrázek, který je bližší tomu, co jste si představovali.
Co je cool? DALL·E 3 a ChatGPT jsou nyní integrovány dohromady. Pracují společně, aby vám pomohly vylepšit vaše nápady. Zadáte koncept, ChatGPT vám pomůže upravit prompt, a DALL·E 3 ho přenese do reality. Pokud vám obrázek nevyhovuje, můžete požádat ChatGPT, aby upravil prompt a DALL·E 3 ho zkuste znovu. Za měsíční poplatek 20 $ získáte přístup k GPT-4, DALL·E 3 a mnoha dalším funkcím.
Microsoftova Bing Chat získala přístup k DALL·E 3 dokonce dříve než OpenAIho ChatGPT, a nyní to není jen velké podniky, které s ním mohou pracovat, ale každý, kdo si ho může zdarma vyzkoušet. Integrace do Bing Chat a Bing Image Creator usnadňuje jeho použití pro každého.
Vzestup difuzních modelů
V posledních třech letech světem počítačového vidění prošla vlna difuzních modelů, která učinila významný skok vpřed, zejména v oblasti generování obrázků. Před difuzními modely byly Generative Adversarial Networks (GANs) technologií číslo jedna pro generování realistických obrázků. (MSFT )
Jedoch měly své výzvy, včetně potřeby velkého množství dat a výpočetního výkonu, což je často dělalo obtížně ovladatelnými.
Vstoupily difuzní modely. Tyto modely se staly stabilnější a efektivnější alternativou k GANs. Na rozdíl od GANs difuzní modely fungují tak, že přidávají šum k datům, zakrývají je, dokud nezůstane pouze náhodnost. Poté pracují zpětně, aby tento proces zrušily, a rekonstruují smysluplná data ze šumu. Tento proces se ukázal jako efektivní a méně náročný na zdroje, což dělá difuzní modely horkým tématem v komunitě AI.
Skutečný zlom nastal kolem roku 2020, kdy vyšly inovativní články a byla představena OpenAIho CLIP technologie, která výrazně pokročila v difuzních modelech. To udělalo difuzní modely výjimečně dobrými v text-to-image syntéze, umožňující jim generovat realistické obrázky z textových popisů. Tyto průlomy nebyly pouze v oblasti generování obrázků, ale také v oblastech, jako je hudba a biomedicínský výzkum.
Dnes nejsou difuzní modely pouze tématem akademického zájmu, ale jsou používány v praktických, reálných scénářích.
Generativní modelování a samo-pozornostní vrstvy: DALL-E 3
Jedním z kritických pokroků v tomto oboru je vývoj generativního modelování, se vzorkovacími přístupy, jako je autoregresivní generativní modelování a difuzní procesy, které vedou cestu. Tyto modely transformovaly text-to-image modely, vedoucí k dramatickým zlepšením výkonu. Rozdělováním generování obrázků na diskrétní kroky se tyto modely staly více zpracovatelnými a snáze se učí pro neuronové sítě.
Souběžně sehrála samo-pozornostní vrstvy kritickou roli. Tyto vrstvy, navržené dohromady, pomohly generovat obrázky bez implicitních prostorových偏见, což je běžný problém s konvolucemi. Tento posun umožnil text-to-image modelům škálovat a zlepšovat se spolehlivě, díky dobře pochopitelným škálovacím vlastnostem transformátorů.
Výzvy a řešení v generování obrázků
Navzdory těmto pokrokům zůstává ovladatelnost generování obrázků výzvou. Problémy, jako je dodržování promptů, kde model nemusí přesně dodržovat vstupní text, přetrvávají. Pro řešení těchto problémů byly navrženy nové přístupy, jako je zlepšení popisků, zaměřené na zlepšení kvality textových a obrazových párů ve výcvikových datech.
Zlepšení popisků: Nový přístup
Zlepšení popisků zahrnuje generování lepších kvalitních popisků pro obrázky, což pomáhá při výcviku přesnějších text-to-image modelů. To je dosaženo robustním obrazovým popiskem, který produkuje podrobné a přesné popisky obrázků. Díky výcviku na těchto vylepšených popiscích DALL-E 3 dosáhly pozoruhodných výsledků, které se blíží fotografiím a uměleckým dílům vytvořeným lidmi.
Školení na syntetických datech
Koncept školení na syntetických datech není nový. Avšak zde je jedinečný příspěvek v tvorbě nového, popisného obrazového popiskového systému. Dopad používání syntetických popisků pro školení generativních modelů byl podstatný, vedoucí ke zlepšení schopnosti modelu přesně dodržovat prompty.
Hodnocení DALL-E 3
Prostřednictvím多ných hodnocení a srovnání s předchozími modely, jako je DALL-E 2 a Stable Diffusion XL, DALL-E 3 prokázala lepší výkon, zejména v úkolech souvisejících s dodržováním promptů.
Použití automatizovaných hodnocení a benchmarků poskytlo jasný důkaz jejích schopností, upevňující její pozici jako špičkového text-to-image generátoru.
DALL-E 3 Prompty a schopnosti
DALL-E 3 nabízí více logický a rafinovaný přístup k vytváření vizuálů. Jak budete procházet, všimnete si, jak DALL-E vytváří každý obrázek, s kombinací přesnosti a fantazie, která rezonuje s daným promptem.
Na rozdíl od své předchůdkyně vyniká tato vylepšená verze v uspořádání objektů přirozeně ve scéně a v přesném zobrazení lidských rysů, až po správný počet prstů na ruce. Vylepšení se rozšiřují na jemnější detaily a jsou nyní k dispozici v vyšší rozlišení, zajišťující více realistický a profesionální výstup.
Textové vykreslovací schopnosti také prošly podstatným zlepšením. Zatímco předchozí verze DALL-E produkovaly nesmyslný text, DALL-E 3 může nyní generovat čitelný a profesionálně stylizovaný text (někdy), a dokonce i čisté loga občas.
Modelovo pochopení složitých a nuancovaných požadavků na obrázky se významně zlepšilo. DALL-E 3 může nyní přesně dodržovat podrobné popisky, dokonce i v scénářích s několika prvky a specifickými instrukcemi, prokazující svou schopnost produkovat soudržné a dobře komponované obrázky. Pojďme prozkoumat některé prompty a odpovídající výstup, který jsme získali:
Například návrh balení pro řadu biočajů. Zahrňte prostor pro název produktu a popis.
Vytvořte webový banner, který propaguje letní prodej venkovního nábytku. Obrázek by měl zobrazovat plážové prostředí s různými kusy venkovního nábytku a textem, který oznamuje 'Huge Summer Savings!'
Retromoderní cestovní plakát Paříže s velkým a stylizovaným textem, říkajícím 'Visit Paris' dole.
Design the packaging for a line of organic teas. Include space for the product name and description.Společnost také pracuje na způsobech, jak odlišit AI-generované obrázky od těch, které vytvořili lidé, což odráží jejich závazek k transparentnosti a odpovědnému použití AI.
DALL-E 3, nejnovější verze, bude k dispozici ve fázích, počínaje specifickými zákaznickými skupinami a později se rozšíří do výzkumných laboratoří a API služeb. Avšak datum veřejné verze nebylo dosud potvrzeno.
OpenAI skutečně nastavuje nový standard v oblasti AI s DALL-E 3, spojující komplexní technické schopnosti a uživatelsky přívětivé rozhraní. Integrace DALL-E 3 do široce používaných platforem, jako je Bing, odráží posun od specializovaných aplikací k širším, přístupnějším formám zábavy a užitku.
Skutečným tahounem v následujících letech bude pravděpodobně rovnováha mezi inovací a uživatelskou empowerací. Společnosti, které uspějí, budou ty, které nejenže budou tlačit hranice toho, co může AI dosáhnout, ale také poskytnou uživatelům autonomii a kontrolu, kterou požadují. OpenAI, se svým závazkem k etickému AI, se této cesty pečlivě drží. Cílem je jasný: vytvořit AI nástroje, které nejsou pouze mocné, ale také důvěryhodné a inkluzivní, zajišťující, že výhody AI jsou dostupné všem.




















