Yapay Zekâ Araçları 101

Black Forest Labs tarafından geliştirilen Flux: Metin-Resim Modellerinde Bir Devrim. Midjourney’den daha iyi mi?

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Black Forest Labs Open-Source FLUX.1: A 12 Billion Parameter Transformer Capable of Generating Images

Black Forest Labs, Stable Diffusion modelinin arkasındaki ekip, Flux adlı bir dizi state-of-the-art modeli piyasaya sürdü – bu, AI tarafından üretilen görsellerin yeteneklerini yeniden tanımlamak için tasarlandı. Ancak Flux gerçekten bu alanda bir adım öne mi çıkıyor ve endüstri liderleri gibi Midjourney ile nasıl karşılaştırılabiliyor? Flux’un dünyasına derinlemesine dalalım ve AI tarafından üretilen sanat ve medya geleceğini yeniden şekillendirmek için potansiyelini keşfedin.

Black Forest Labs’in Doğuşu

Black Forest Labs sadece başka bir AI şirketi değil; temel generatif AI modelleri geliştiren yeteneklerin bir güç merkezi. Ekibe VQGAN, Latent Diffusion ve Stable Diffusion ailesinin yaratıcıları dahildir – bunlar AI sanat dünyasını fırtınaya sürükledi.

Black Forest Labs Açık Kaynak FLUX.1

Black Forest Labs Açık Kaynak FLUX.1

Andreessen Horowitz liderliğindeki 31 milyon dolarlık bir Series Seed finansman turu ve著名 melek yatırımcıların desteğiyle, Black Forest Labs kendini generatif AI araştırmalarının ön saflarına yerleştirdi. Misyonları net: medya gibi görüntüler ve videolar için state-of-the-art generatif derin öğrenme modellerini geliştirmek ve yaratıcılık, verimlilik ve çeşitlilik sınırlarını zorlamak.

Flux Model Ailesinin Tanıtımı

Black Forest Labs, FLUX.1 metin-görsel modelleri sunuyor – bunlar görüntüdeki ayrıntı,.prompt uyumu, stil çeşitliliği ve sahne karmaşıklığı açısından yeni standartlar koymak için tasarlandı. Flux ailesi, her biri farklı kullanım durumları ve erişilebilirlik seviyeleri için uyarlanmış üç varyanta sahiptir:

  1. FLUX.1 [pro]: Bayrak gemisi modeli, görüntü oluşturma performansı açısından üst düzey performans sunuyor ve üstün prompt takibi, görsel kalite, görüntü ayrıntısı ve çıktı çeşitliliği sunuyor. Bir API aracılığıyla sunuluyor ve profesyonel ve kurumsal kullanım için premium seçenek olarak konumlandırılmıştır.
  2. FLUX.1 [dev]: Ticari olmayan uygulamalar için açık ağırlıklı, rehberle damıtılmış bir model. Pro sürümüne benzer kalite ve prompt uyumu yeteneklerine sahip olmakla birlikte daha verimlidir.
  3. FLUX.1 [schnell]: Suite’deki en hızlı model, yerel geliştirme ve kişisel kullanım için optimize edilmiştir. Apache 2.0 lisansı altında açık kaynak olarak sunulmaktadır ve geniş bir uygulama ve deneyler yelpazesi için erişilebilir durumdadır.

FLUX.1’in yeteneklerini gösteren bazı benzersiz ve yaratıcı prompt örnekleri sunacağım. Bu prompt’ler, metin oluşturma, karmaşık kompozisyonlar ve zorlu öğeler gibi ellerdeki gibi konularda modelin güçlü yanlarını vurgulayacaktır.

  • Sanatsal Stil Karışımı ile Metin: “Vincent van Gogh’un imza stilindeki bir portresini yaratın, ancak sakalını ‘Starry Night’ cümlesini oluşturan kıvranan fırça darbeleriyle değiştirin.”
Black Forest Labs Açık Kaynak FLUX.1

Black Forest Labs Açık Kaynak FLUX.1

  • Dinamik Aksiyon Sahnesi ile Metin Entegrasyonu: “Bir süper kahraman, bir çizgi roman sayfasından fırlıyor. Aksiyon çizgileri ve ses efektleri, ‘FLUX FORCE’ adını kalın, dinamik bir tipografi ile oluşturmalıdır.”
Black Forest Labs Açık Kaynak FLUX.1

Black Forest Labs Açık Kaynak FLUX.1

  • Sürreal Konsept ile Kesin Nesne Yerleştirme: “Pencere ışığında kahverengi ve beyaz renkli bir kedinin yakın çekimi. Göz dokusu ve rengi üzerinde net odaklanma. Doğal aydınlatma ile gerçekçi göz parıltısı ve derinlik yakalamak için.”
Black Forest Labs Açık Kaynak FLUX.1

Black Forest Labs Açık Kaynak FLUX.1

Bu prompt’ler, FLUX.1’in metin oluşturma, karmaşık sahne kompozisyonu ve ayrıntılı nesne oluşturma yeteneklerini sergilemekle birlikte, yaratıcı ve benzersiz görüntü oluşturma yeteneklerini de vurgulamaktadır.

Flux’in Arkasındaki Teknik Yenilikler

Flux’in etkileyici yeteneklerinin temelinde, onu seleflerinden ve çağdaşlarından ayıran bir dizi teknik yenilik yatmaktadır:

Transformer Güçlü Akış Modelleri Ölçeğinde

Tüm kamu FLUX.1 modelleri, çok modlu ve paralel difüzyon transformer bloklarını birleştiren melez bir mimari üzerine kuruludur ve 12 milyar parametreye kadar ölçeklenmiştir. Bu, birçok mevcut metin-görsel modeline kıyasla önemli bir model büyüklüğü ve karmaşıklık artışıdır.

Flux modelleri, akış eşleştirmeyi entegre ederek, önceki state-of-the-art difüzyon modellerini geliştirir – bu, generatif modelleri eğitimi için genel ve kavramsal olarak basit bir yöntemdir. Akış eşleştirmesi, difüzyon modellerinin özel bir durumu olan daha esnek bir çerçeve sağlar.

Model performansı ve donanım verimliliğini artırmak için, Black Forest Labs, döner konumlandırıcı gömme ve paralel dikkat katmanlarını entegre etti. Bu teknikler, görüntülerdeki mekansal ilişkilerin daha iyi işlenmesine ve büyük ölçekli verilerin daha verimli işlenmesine olanak tanır.

Mimari Yenilikler

Flux’in performansına katkıda bulunan bazı ana mimari unsurları inceleyelim:

  1. Melez Mimari: Çok modlu ve paralel difüzyon transformer bloklarını birleştirerek, Flux hem metinsel hem de görsel bilgileri etkili bir şekilde işleyebilir, bu da prompt’ler ve oluşturulan görüntüler arasında daha iyi bir uyum sağlar.
  2. Akış Eşleştirmesi: Bu yaklaşım, generatif modellerin daha esnek ve verimli eğitimi sağlar. Difüzyon modellerini ve diğer generatif teknikleri kapsayan birleşik bir çerçeve sunar, bu da daha güçlü ve çok yönlü görüntü oluşturmasına yol açabilir.
  3. Döner Konumlandırıcı Gömmeler: Bu gömmeler, görüntülerdeki mekansal ilişkileri daha iyi anlamak ve korumak için yardımcı olur, bu da tutarlı ve ayrıntılı görsel içeriğin oluşturulması için kritiktir.
  4. Paralel Dikkat Katmanları: Bu teknik, dikkat mekanizmalarının daha verimli işlenmesine olanak tanır, bu da hem metin prompt’lerinde hem de oluşturulan görüntülerdeki farklı öğeler arasındaki ilişkileri anlamak için kritiktir.
  5. 12 Milyar Parametreye Ölçeklendirme: Modelin büyüklüğü, daha karmaşık kalıpları ve ilişkileri yakalamak ve sentezlemek için daha fazla kapasite sağlar, bu da daha yüksek kaliteli ve çeşitli çıktılara yol açabilir.

Flux’in Test Edilmesi: Görüntü Sentezinde Yeni Bir Standard

https://blackforestlabs.ai/announcing-black-forest-labs/

https://blackforestlabs.ai/announcing-black-forest-labs/

Black Forest Labs, FLUX.1’in Midjourney v6.0, DALL·E 3 (HD) ve SD3-Ultra gibi popüler modelleri several ana alanda aşan yeni standartlar koyduğunu iddia ediyor:

  1. Görsel Kalite: Flux, daha yüksek doğrulukta, daha gerçekçi ayrıntılarda ve genel olarak daha iyi estetik çekicilikte görüntüler üretmeyi hedefliyor.
  2. Prompt Uyumluğu: Model, verilen metin prompt’lerine daha yakın bir şekilde uymak için tasarlandı, böylece kullanıcıların niyetlerini daha doğru bir şekilde yansıtan görüntüler oluşturur.
  3. Boyut/Oran Değişkenliği: Flux, 0.1 ila 2.0 megapiksel arasında değişen çeşitli en boy oranları ve çözünürlükleri destekler, bu da çeşitli kullanım durumları için esneklik sağlar.
  4. Tipografi: Model, görüntüler içinde metin oluşturma ve işleme yeteneğini geliştirdi, bu da birçok metin-görsel modeli için ortak bir zorluktur.
  5. Çıktı Çeşitliliği: Flux, ön eğitimden tüm çıktı çeşitliliğini korumak için özel olarak ayarlandı, bu da daha geniş yaratıcı olanaklar sunar.

Flux vs. Midjourney: Karşılaştırmalı Analiz

https://blackforestlabs.ai/announcing-black-forest-labs/

Şimdi, yanıcı soruyu ele alalım: Flux gerçekten Midjourney’den daha iyi mi? Bunu cevaplamak için several faktörü dikkate almamız gerekiyor:

Görsel Kalite ve Estetik

Hem Flux hem de Midjourney, yüksek kaliteli, görsel olarak şaşırtıcı görüntüler üretme yeteneğiyle bilinir. Midjourney, sanatsal yeteneği ve DISTINCT bir estetik çekiciliğe sahip görüntüler oluşturma yeteneğiyle övgü almıştır. Flux, gelişmiş mimarisi ve daha büyük model boyutu ile bu kalite seviyesini eşleştirebilir veya aşabilir.

Flux’tan erken örnekler, etkileyici ayrıntı, gerçekçi metinler ve güçlü bir ışık ve kompozisyon anlayışını gösterir. Ancak, sanatın öznel doğası, bu alanda kesin bir üstünlük iddia etmesini zorlaştırır. Kullanıcılar, her modelin farklı stiller veya görüntü türlerinde güçlü yanları olabileceğini keşfedebilir.

Prompt Uyumluğu

Flux, prompt uyumu alanında Midjourney’i geçebilir. Black Forest Labs, modelin verilen prompt’lere daha doğru bir şekilde uymasını sağlamak için odaklandıklarını vurguladı. Bu, özellikle karmaşık veya nüanslı talepler için, kullanıcıların niyetlerini daha doğru bir şekilde yansıtan görüntüler oluşturulmasına yol açabilir.

Midjourney, bazen prompt’lere karşı yaratıcı özgürlükler aldığı için eleştirildi – bu, güzel ancak beklenmedik sonuçlara yol açabilir. Flux’un yaklaşımı, oluşturulan çıktılar üzerinde daha kesin bir kontrol sunabilir.

Hız ve Verimlilik

FLUX.1 [schnell]’in tanıtılmasıyla, Black Forest Labs, Midjourney’in bir diğer önemli avantajını hedef alıyor: hız. Midjourney, hızlı üretim süreleri ile bilinir ve bu, iteratif yaratıcı süreçler için popüler olmasını sağlar. Flux, kaliteyi korurken bu hızı eşleştirebilir veya aşarsa, bu önemli bir satış noktası olabilir.

Erişilebilirlik ve Kullanım Kolaylığı

Midjourney, kullanıcı dostu arayüzü ve Discord entegrasyonu sayesinde popülerlik kazanmıştır. Flux, daha yeni olduğu için, benzer şekilde erişilebilir arayüzler geliştirmek için zaman gerekebilir. Ancak, FLUX.1 [schnell] ve [dev] modellerinin açık kaynak doğası, topluluk tarafından geliştirilen çeşitli araçlar ve entegrasyonlara yol açabilir, bu da Midjourney’i esneklik ve özelleştirme seçeneklerinde geçebilir.

Teknik Yetenekler

Flux’in gelişmiş mimarisi ve daha büyük model boyutu, karmaşık prompt’leri anlamak ve ayrıntılı görüntüler oluşturmak için daha ham yeteneklere sahip olabileceğini öne sürer. Akış eşleştirmesi yaklaşımı ve melez mimari, daha geniş bir görev ve daha çeşitli çıktılar yelpazesi ile başa çıkmasına olanak tanır.

Etik Düşünceler ve Önyargı Azaltma

Hem Flux hem de Midjourney, AI tarafından üretilen görüntülerde etik endişelerle karşı karşıya: önyargı, yanlış bilgi ve telif hakkı sorunları gibi. Black Forest Labs’in şeffaflık vurgusu ve modellerin geniş bir şekilde erişilebilir olmasını sağlama taahhüdü, bu konularda daha güçlü topluluk denetimi ve daha hızlı gelişmelere yol açabilir.

Kod Uygulaması ve Dağıtım

Diffusers ile Flux Kullanma

Flux modelleri, Hugging Face Diffusers kütüphanesi kullanılarak mevcut iş akışlarına kolayca entegre edilebilir. FLUX.1 [dev] veya FLUX.1 [schnell] ile Diffusers kullanmak için adım adım bir rehber:

  1. İlk olarak, Diffusers kütüphanesini kurun veya güncelleyin:
!pip install git+https://github.com/huggingface/diffusers.git
  1. Sonra, FluxPipeline kullanarak modeli çalıştırabilirsiniz:
import torch
from diffusers import FluxPipeline

<p># Modeli yükle
pipe = FluxPipeline.from_pretrained("black-forest-labs/FLUX.1-dev", torch_dtype=torch.bfloat16)</p>

<p># CPU offloading'i etkinleştirin (isteğe bağlı)
pipe.enable_model_cpu_offload()</p>

<p># Bir görüntü oluşturun
prompt = "Bir kedinin eline bir tabela tutturulmuş bir görüntü"
image = pipe(
prompt,
height=1024,
width=1024,
guidance_scale=3.5,
output_type="pil",
num_inference_steps=50,
max_sequence_length=512,
generator=torch.Generator("cpu").manual_seed(0)
).images[0]</p>

<p># Oluşturulan görüntüyü kaydedin
image.save("flux-dev.png")

Bu kod parçacığı, FLUX.1 [dev] modelini yüklemeyi, bir metin prompt’inden bir görüntü oluşturmayı ve sonucu kaydetmeyi gösterir.

LitServe ile Flux’u API Olarak Dağıtmak

Flux’u ölçeklenebilir bir API hizmeti olarak dağıtmak isteyenler için, Black Forest Labs LitServe kullanarak bir örnek sunuyor. Dağıtım sürecinin bir açıklaması:

Model Sunucusunu Tanımlayın:

from io import BytesIO
from fastapi import Response
import torch
import time
import litserve as ls
from optimum.quanto import freeze, qfloat8, quantize
from diffusers import FlowMatchEulerDiscreteScheduler, AutoencoderKL
from diffusers.models.transformers.transformer_flux import FluxTransformer2DModel
from diffusers.pipelines.flux.pipeline_flux import FluxPipeline
from transformers import CLIPTextModel, CLIPTokenizer, T5EncoderModel, T5TokenizerFast

<p>class FluxLitAPI(ls.LitAPI):
def setup(self, device):
# Model bileşenlerini yükle
scheduler = FlowMatchEulerDiscreteScheduler.from_pretrained("black-forest-labs/FLUX.1-schnell", subfolder="scheduler")
text_encoder = CLIPTextModel.from_pretrained("openai/clip-vit-large-patch14", torch_dtype=torch.bfloat16)
tokenizer = CLIPTokenizer.from_pretrained("openai/clip-vit-large-patch14", torch_dtype=torch.bfloat16)
text_encoder_2 = T5EncoderModel.from_pretrained("black-forest-labs/FLUX.1-schnell", subfolder="text_encoder_2", torch_dtype=torch.bfloat16)
tokenizer_2 = T5TokenizerFast.from_pretrained("black-forest-labs/FLUX.1-schnell", subfolder="tokenizer_2", torch_dtype=torch.bfloat16)
vae = AutoencoderKL.from_pretrained("black-forest-labs/FLUX.1-schnell", subfolder="vae", torch_dtype=torch.bfloat16)
transformer = FluxTransformer2DModel.from_pretrained("black-forest-labs/FLUX.1-schnell", subfolder="transformer", torch_dtype=torch.bfloat16)</p>

<p># Modeli 8-bit doğruluğa quantize edin
quantize(transformer, weights=qfloat8)
freeze(transformer)
quantize(text_encoder_2, weights=qfloat8)
freeze(text_encoder_2)</p>

<p># Flux pipeline'ini başlatın
self.pipe = FluxPipeline(
scheduler=scheduler,
text_encoder=text_encoder,
tokenizer=tokenizer,
text_encoder_2=None,
tokenizer_2=tokenizer_2,
vae=vae,
transformer=None,
)
self.pipe.text_encoder_2 = text_encoder_2
self.pipe.transformer = transformer
self.pipe.enable_model_cpu_offload()</p>

<p>def decode_request(self, request):
return request["prompt"]</p>

<p>def predict(self, prompt):
image = self.pipe(
prompt=prompt,
width=1024,
height=1024,
num_inference_steps=4,
generator=torch.Generator().manual_seed(int(time.time())),
guidance_scale=3.5,
).images[0]
return image</p>

<p>def encode_response(self, image):
buffered = BytesIO()
image.save(buffered, format="PNG")
return Response(content=buffered.getvalue(), headers={"Content-Type": "image/png"})</p>

<p># Sunucuyu başlatın
if __name__ == "__main__":
api = FluxLitAPI()
server = ls.LitServer(api, timeout=False)
server.run(port=8000)</p>

Bu kod, LitServe kullanarak Flux’u bir API hizmeti olarak dağıtmayı, bir model sunucusu tanımlamayı, istekleri işlemeyi, görüntüler oluşturmayı ve yanıtları kodlamayı gösterir.

Sunucuyu Başlatın:

</pre>
python server.py
<pre>

Model API’sini Kullanın:

API’yi test etmek için basit bir istemci betiği kullanabilirsiniz:

import requests
import json

<p>url = "http://localhost:8000/predict"
prompt = "Bir robota bir masa başında bir resim çizdiriyor, pop sanat"</p>

<p>response = requests.post(url, json={"prompt": prompt})
with open("generated_image.png", "wb") as f:
f.write(response.content)</p>

<p>print("Görüntü oluşturuldu ve generated_image.png olarak kaydedildi")</p>

Dağıtımın Ana Özellikleri

  1. Sunucusuz Mimari: LitServe kurulumu, ölçeklenebilir ve sunucusuz bir dağıtım sağlar ve kullanılmadığında sıfıra kadar ölçeklenebilir.
  2. Özel API: Flux’u kendi altyapınızda özel bir API olarak dağıtabilirsiniz.
  3. Çoklu GPU Desteği: Kurulum, birden fazla GPU ile verimli bir şekilde çalışmak üzere tasarlanmıştır.
  4. Quantization: Kod, modeli 8-bit doğruluğa quantize etmeyi gösterir, bu da daha az güçlü donanımlarda çalışmasına olanak tanır.
  5. CPU Offloading: enable_model_cpu_offload() yöntemi, GPU belleğini korumak için modele bağlı olmayan kısımları CPU’ya offload etmeyi sağlar.

Flux’un Pratik Uygulamaları

Flux’un esnekliği ve gücü, çeşitli endüstrilerde geniş bir uygulama yelpazesi açar:

  1. Yaratıcı Endüstriler: Grafik tasarımcılar, illüstratörler ve sanatçılar, Flux’u hızlıca kavram sanatları, mood board’ları ve görsel ilhamları oluşturmak için kullanabilir.
  2. Pazarlama ve Reklam: Pazarlamacılar, kampanyalar, sosyal medya içeriği ve ürün demo’ları için özel görseller oluşturmak için Flux’u kullanabilir.
  3. Oyun Geliştirme: Oyun tasarımcıları, Flux’u kullanarak hızlıca ortamları, karakterleri ve varlıkları prototip olarak oluşturabilir, böylece ön üretim sürecini hızlandırabilir.
  4. Mimari ve İç Mekan Tasarımı: Mimarlar ve tasarımcılar, metinsel açıklamalara dayalı olarak gerçekçi görselleştirmeler oluşturmak için Flux’u kullanabilir.
  5. Eğitim: Eğitimciler, öğrenme materyallerini zenginleştirmek ve karmaşık kavramları daha erişilebilir hale getirmek için özel görsel yardımlar oluşturmak için Flux’u kullanabilir.
  6. Sinema ve Animasyon: Hikaye board sanatçıları ve animatörler, Flux’u kullanarak sahneleri ve karakterleri hızlıca görselleştirebilir, bu da ön-görselleştirme sürecini hızlandırabilir.

Flux ve Metin-Görsel Oluşturma Geleceği

Black Forest Labs, Flux’un sadece generatif AI alanında ilk adımlarından biri olduğunu belirtti. Rekabetçi generatif metin-görsel sistemleri geliştirmeyi planlıyorlar ve yüksek çözünürlükte ve hızda yaratma ve düzenleme yetenekleri vaat ediyorlar.

Bu yol haritası, Flux’un tek başına bir ürün değil, bir dizi generatif AI aracı ailesinin parçası olduğunu gösteriyor. Teknoloji geliştikçe, şunları görmeyi bekleyebiliriz:

  1. Geliştirilmiş Entegrasyon: Metin-görsel ve metin-video oluşturma arasında sorunsuz iş akışları, daha karmaşık ve dinamik içerik oluşturmayı sağlayacaktır.
  2. Geliştirilmiş Özelleştirme: Oluşturulan içeriği daha ince bir şekilde kontrol edebilme, muhtemelen gelişmiş prompt mühendisliği teknikleri veya kullanıcı dostu arayüzler aracılığıyla.
  3. Gerçek Zamanlı Oluşturma: FLUX.1 [schnell] gibi modellerin geliştirilmesi, gerçek zamanlı görüntü oluşturma yeteneklerine yol açabilir, bu da canlı içerik oluşturma ve etkileşimli medyayı devrimleştirebilir.
  4. Çoklu Modalite Oluşturma: Metin, görüntü, video, ses gibi çeşitli modellerde içerik oluşturma ve manipülasyon yeteneği, tümleşik ve tutarlı bir şekilde.
  5. Etik AI Geliştirme: Güçlü AI modelleri geliştirirken, sorumluluk ve etik firsteli bir yaklaşımın sürdürülmesi.

Sonuç: Flux Midjourney’den Daha İyi mi?

Flux’un Midjourney’den “daha iyi” olup olmadığı sorusuna basit bir evet veya hayır cevabı vermek zor. Her iki model de metin-görsel oluşturma teknolojisinde en son gelişmeleri temsil ediyor ve her biri kendine özgü güçlü yanları ve özelliklere sahip.

Flux, gelişmiş mimarisi ve prompt uyumu vurgusuyla belirli senaryolarda daha kesin kontrol ve muhtemelen daha yüksek kalite sunabilir. Açık kaynak varyantları, geliştiriciler ve araştırmacılar için değerli entegrasyon ve özelleştirme fırsatları sunar.

Midjourney, kanıtlanmış bir geçmişe, büyük ve aktif bir kullanıcı tabanına ve birçok kullanıcı tarafından sevilen DISTINCT bir sanatsal stile sahiptir. Discord ile entegrasyonu ve kullanıcı dostu arayüzü, yaratıcıların tüm teknik beceri seviyeleri için erişilebilir kılmıştır.

Sonuçta, “daha iyi” model, spesifik kullanım durumu, kişisel tercihler ve her platformun gelişen yeteneklerine bağlı olabilir. Flux’un bu alanda önemli bir adım attığı ve generatif AI’de yeni teknikler tanıtarak sınırları zorladığı açıktır.

Son beş yıldır Makine Öğrenimi ve Derin Öğrenme dünyasına kendimi adamış bulunuyorum. Tutkum ve uzmanlığım, özellikle AI/ML'ye odaklanarak 50'den fazla çeşitli yazılım mühendisliği projesine katkıda bulunmama yol açtı. Süregelen meraklılığım da beni Doğal Dil İşleme alanına yöneltti, bu alana daha da derinlemesine girmeye hevesliyim.