أدوات الذكاء الاصطناعي 101

FLUX من قبل Black Forest Labs: القفزة التالية في نماذج النص إلى الصورة. هل هو أفضل من Midjourney؟

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
Black Forest Labs Open-Source FLUX.1: A 12 Billion Parameter Transformer Capable of Generating Images

Black Forest Labs، الفريق وراء نموذج Stable Diffusion الرائد، أطلق Flux – مجموعة من النماذج المتقدمة التي توعد بتحديد معايير جديدة لصور الأيجاد بواسطة الذكاء الاصطناعي. ولكن هل Flux حقًا يمثل قفزة إلى الأمام في هذا المجال، وكيف يقارن بزعماء الصناعة مثل Midjourney؟ دعونا نغوص深ًا في عالم Flux واستكشاف إمكاناته لإعادة تشكيل مستقبل الفن والوسائط التي تم إنشاؤها بواسطة الذكاء الاصطناعي.

ميلاد Black Forest Labs

Black Forest Labs ليس مجرد شركة أبحاث جديدة؛ إنه قوة موهوبة مع سجل حافل بتطوير نماذج الذكاء الاصطناعي التوليدية. الفريق يتضمن منشئي VQGAN و Latent Diffusion و عائلة Stable Diffusion من النماذج التي هزت عالم الفن بواسطة الذكاء الاصطناعي.

Black Forest Labs Open-Source FLUX.1

Black Forest Labs Open-Source FLUX.1

مع جولة تمويل سلسلة بذرة ناجحة بقيمة 31 مليون دولار بقيادة Andreessen Horowitz ودعم من مستثمرين ملاك بارزين، وضعت Black Forest Labs نفسها في طليعة أبحاث الذكاء الاصطناعي التوليدي. مهمتهم واضحة: تطوير وتقدم نماذج الذكاء الاصطناعي التوليدي العميق الحالة من الفئة الأولى لوسائط مثل الصور والفيديو، مع دفع حدود الإبداع والكفاءة والتنوع.

تعريف عائلة نماذج Flux

Black Forest Labs قدمت عائلة نماذج FLUX.1 من النص إلى الصورة، مصممة لتحديد معايير جديدة في تفاصيل الصورة والامتثال للتعليمات والتنوع في الأسلوب و复잡ية المشهد. تتكون عائلة Flux من ثلاثة متغيرات، كل منها مخصص لاستخدامات مختلفة ومستويات الوصول:

  1. FLUX.1 [pro]: النموذج الرئيسي، الذي يقدم أداءًا من الدرجة الأولى في إنشاء الصور مع اتباع تعليمات متفوقة وجودة بصرية وتنوع إخراج.
  2. FLUX.1 [dev]: نموذج مفتوح الوزن، مصمم للاستخدامات غير التجارية.
  3. FLUX.1 [schnell]: أسرع نموذج في العائلة، مُختصر للاستخدام المحلي والشخصي.

سأقدم بعض الأمثلة الفريدة والإبداعية لتعليمات Flux التي تبرز قدراته.

  • مزيج الأسلوب الفني مع النص: “أنشئ صورة لفينسنت فان جوخ بأسلوبه المميز، ولكن استبدل لحيته بضربات فرشاة دوارة تشكل كلمات ‘الليلة النجمية’ بخط متصل.”
Black Forest Labs Open-Source FLUX.1

Black Forest Labs Open-Source FLUX.1

  • مashup动态 للفعل مع دمج النص: “البطل الخارق يندفع من خلال صفحة القصص المصورة. يجب أن تشكل خطوط الحركة وأصوات التأثير اسم ‘FLUX FORCE’ بخط متصل وديناميكي.”
Black Forest Labs Open-Source FLUX.1

Black Forest Labs Open-Source FLUX.1

  • مفهوم خيالي مع وضع كائن دقيق: “قريب من القط مع الألوان البنية والبيضاء تحت ضوء الشمس من النافذة. تركيز حاد على 질 و لون العين. إضاءة طبيعية لالتقاط لمعان العين والعمق الحقيقي.”
Black Forest Labs Open-Source FLUX.1

Black Forest Labs Open-Source FLUX.1

هذه التعليمات مصممة لتحدي Flux في معالجة النص والتركيبات المعقدة والعناصر المتفصلة مثل اليدين.

الابتكارات الفنية وراء Flux

في قلب Flux تقنيات مبتكرة تحدد مكانته عن سلافه ومقارنيه:

نماذج Flux مدعومة بالتحويلات في المقاييس الكبيرة

جميع نماذج FLUX.1 العامة مبنية على هيكل هجين يجمع بين كتل التحويل المتوازي والمتوازي، مع معاملات ضخمة تصل إلى 12 مليار معامل. هذا يمثل قفزة كبيرة في حجم النموذج و複雑ية مقارنة بالعديد من نماذج النص إلى الصورة الحالية.

نماذج Flux تحسن على نماذج التوليد الت散ي الحالية من خلال دمج مطابقة التدفق، وهي طريقة عامة وبسيطة لمعالجة النماذج التوليدية. مطابقة التدفق توفر إطارًا مرنًا لمعالجة النماذج التوليدية، مع نماذج التوليد الت散ي كحالة خاصة ضمن هذا النهج الأوسع.

为了 تحسين أداء النموذج و كفاءة الأجهزة، قامت Black Forest Labs بدمج التضمين الموضعي الدوار والطبقات المتوازية للانتباه. هذه التقنيات تسمح بمعالجة أفضل للعلاقات المكانية في الصور ومعالجة أكثر كفاءة للبيانات على نطاق واسع.

الابتكارات الهيكلية

دعونا نناقش بعض العناصر الهيكلية الرئيسية التي تساهم في أداء Flux:

  1. الهيكل الهجين: من خلال الجمع بين كتل التحويل المتوازي والمتوازي، يمكن Flux معالجة المعلومات النصية والبصرية بشكل فعال، مما يؤدي إلى تحسين الانسجام بين التعليمات والصور المولدة.
  2. مطابقة التدفق: هذا النهج يسمح بمرونة أكبر و كفاءة في تدريب النماذج التوليدية. إنه يوفر إطارًا موحدًا يضم نماذج التوليد الت散ي و تقنيات توليدية أخرى، مما قد يؤدي إلى توليد صور أكثر متانة وتنوعًا.
  3. التضمين الموضعي الدوار: هذه التضمينات تساعد النموذج على فهم والعناية بالعلاقات المكانية داخل الصور، وهو ما يعتبر حاسمًا لإنشاء محتوى بصرية متسقة ومتفصلة.
  4. طبقات الانتباه المتوازية: هذه التقنية تسمح بمعالجة أكثر كفاءة لآليات الانتباه، التي تعتبر حاسمة لفهم العلاقات بين عناصر مختلفة في التعليمات النصية والصور المولدة.
  5. التمكين إلى 12B المعاملات: حجم النموذج الكبير يسمح له بتقاطع أنماط و علاقات أكثر تعقيدًا، مما قد يؤدي إلى جودة أعلى وتنوع أكبر في الإخراج.

اختبار Flux: معيار جديد في 합성 الصور

https://blackforestlabs.ai/announcing-black-forest-labs/

https://blackforestlabs.ai/announcing-black-forest-labs/

تطالب Black Forest Labs أن FLUX.1 يحدد معايير جديدة في 합성 الصور، متجاوزًا نماذج شائعة مثل Midjourney v6.0 و DALL·E 3 (HD) و SD3-Ultra في عدة جوانب رئيسية:

  1. الجودة البصرية: Flux يهدف إلى إنتاج صور بأعلى دقة وأفضلالتفاصيل وأفضل جودة بصرية عامة.
  2. الامتثال للتعليمات: النموذج مصمم للاستجابة بشكل أكثر دقة للتعليمات النصية المحددة، مولداً صورًا تعكس بدقة نوايا المستخدم.
  3. تنوع الحجم والشكل: Flux يدعم مجموعة متنوعة من النسب والدقة، من 0.1 إلى 2.0 ميغابيكسل، مما يوفر مرونة لاستخدامات مختلفة.
  4. الكتابة: النموذج يُظهر قدرات محسنة في توليد وترميز النص داخل الصور، وهو تحدي شائع لنماذج النص إلى الصورة.
  5. تنوع الإخراج: Flux مخطط لتحافظ على كامل تنوع الإخراج من التدريب المسبق، مما يوفر مجموعة أوسع من الإمكانيات الإبداعية.

Flux vs. Midjourney: تحليل مقارن

https://blackforestlabs.ai/announcing-black-forest-labs/

الآن، دعونا نناقش السؤال الحار: هل Flux أفضل من Midjourney؟ للجواب على هذا السؤال، يجب أن ننظر في عدة عوامل:

جودة الصورة والجمال

كلا Flux و Midjourney مشهوران بإنشاء صور عالية الجودة وجميلة بصريًا. Midjourney تمت مدحها لذوقها الفني وقدرتها على إنشاء صور ذات جمال فريد.

النماذج الأولى من Flux تظهر تفاصيل مثيرة للإعجاب وتنوعًا في النصوص وتصورات واقعية للضوء والتركيب. ومع ذلك، الطبيعة الخاضعة للذوق في الفن يجعل من الصعب القول بثقة بأن نموذجًا معينًا يتفوق على الآخر في هذا المجال.

الامتثال للتعليمات

منطقة واحدة حيث Flux قد يتفوق على Midjourney هي في الامتثال للتعليمات. Black Forest Labs أكدت على التركيز على تحسين قدرة النموذج على تفسير التعليمات النصية وتطبيقها بدقة.

Midjourney قد تم انتقاده لاتخاذ بعض الحرية الإبداعية مع التعليمات، مما يؤدي إلى نتائج جميلة ولكن غير متوقعة. Flux قد يوفر التحكم الدقيق في الإخراج المولَّد.

السرعة والكفاءة

مع تقديم FLUX.1 [schnell]، تهدف Black Forest Labs إلى تحقيق واحدة من نقاط القوة الرئيسية ل Midjourney: السرعة. Midjourney مشهور بسرعته في توليد الصور، مما يجعله شائعًا في العمليات الإبداعية التكرارية.

الوصول والسهولة في الاستخدام

Midjourney حصل على شعبية جزئيًا بسبب واجهته المستخدمية وأدمجته مع Discord. Flux، كونه جديدًا، قد يحتاج إلى وقت لتطوير واجهات مماثلة. ومع ذلك، الطبيعة المفتوحة للموديلات FLUX.1 [schnell] و [dev] قد تؤدي إلى مجموعة واسعة من الأدوات والتكاملات التي تم تطويرها من قبل المجتمع، مما قد يفوق Midjourney فيما يتعلق بالمرنة والتخصيص.

القدرات الفنية

هيكل Flux المتقدم وحجم النموذج الأكبر يشيران إلى أنه قد يكون لديه القدرة على فهم تعليمات معقدة وتوليد تفاصيل دقيقة.

الاعتبارات الأخلاقية وتخفيف الانحياز

كلا Flux و Midjourney يواجهان تحديات في معالجة القضايا الأخلاقية في الصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي، مثل الانحياز والمعلومات الخاطئة وقضايا حقوق النشر.

تنفيذ الكود و النشر

استخدام Flux مع Diffusers

يمكن دمج نماذج Flux بسهولة في سير العمل الحالية باستخدام مكتبة Hugging Face Diffusers. هنا دليل خطوة بخطوة لاستخدام FLUX.1 [dev] أو FLUX.1 [schnell] مع Diffusers:

  1. أولاً، قم بتثبيت مكتبة Diffusers أو تحديثها:
!pip install git+https://github.com/huggingface/diffusers.git
  1. ثم، يمكنك استخدام FluxPipeline لتشغيل النموذج:
import torch
from diffusers import FluxPipeline

<p># تحميل النموذج
pipe = FluxPipeline.from_pretrained("black-forest-labs/FLUX.1-dev", torch_dtype=torch.bfloat16)</p>

<p># تمكين الإغلاق على وحدة المعالجة المركزية (اختياري)
pipe.enable_model_cpu_offload()</p>

<p># توليد صورة
prompt = "قطة تحمل لافتة تقول مرحبا بالعالم"
image = pipe(
prompt,
height=1024,
width=1024,
guidance_scale=3.5,
output_type="pil",
num_inference_steps=50,
max_sequence_length=512,
generator=torch.Generator("cpu").manual_seed(0)
).images[0]</p>

<p># حفظ الصورة المولدة
image.save("flux-dev.png")

هذا الشفرة يُظهر كيفية تحميل نموذج FLUX.1 [dev]، توليد صورة من تعليمات نصية، و حفظ النتيجة.

نشر Flux كواجهة برمجة تطبيقات مع LitServe

لأولئك الذين يرغبون في نشر Flux كخدمة واجهة برمجة تطبيقات قابلة للتطوير، توفر Black Forest Labs مثالًا باستخدام LitServe، وهو محرك استدلال عالي الأداء. هنا تفاصيل عملية النشر:

تحديد خادم النموذج:

from io import BytesIO
from fastapi import Response
import torch
import time
import litserve as ls
from optimum.quanto import freeze, qfloat8, quantize
from diffusers import FlowMatchEulerDiscreteScheduler, AutoencoderKL
from diffusers.models.transformers.transformer_flux import FluxTransformer2DModel
from diffusers.pipelines.flux.pipeline_flux import FluxPipeline
from transformers import CLIPTextModel, CLIPTokenizer, T5EncoderModel, T5TokenizerFast

<p>class FluxLitAPI(ls.LitAPI):
def setup(self, device):
# تحميل مكونات النموذج
scheduler = FlowMatchEulerDiscreteScheduler.from_pretrained("black-forest-labs/FLUX.1-schnell", subfolder="scheduler")
text_encoder = CLIPTextModel.from_pretrained("openai/clip-vit-large-patch14", torch_dtype=torch.bfloat16)
tokenizer = CLIPTokenizer.from_pretrained("openai/clip-vit-large-patch14", torch_dtype=torch.bfloat16)
text_encoder_2 = T5EncoderModel.from_pretrained("black-forest-labs/FLUX.1-schnell", subfolder="text_encoder_2", torch_dtype=torch.bfloat16)
tokenizer_2 = T5TokenizerFast.from_pretrained("black-forest-labs/FLUX.1-schnell", subfolder="tokenizer_2", torch_dtype=torch.bfloat16)
vae = AutoencoderKL.from_pretrained("black-forest-labs/FLUX.1-schnell", subfolder="vae", torch_dtype=torch.bfloat16)
transformer = FluxTransformer2DModel.from_pretrained("black-forest-labs/FLUX.1-schnell", subfolder="transformer", torch_dtype=torch.bfloat16)</p>

<p># تحويل إلى 8 بت لتناسب جهاز L4 GPU
quantize(transformer, weights=qfloat8)
freeze(transformer)
quantize(text_encoder_2, weights=qfloat8)
freeze(text_encoder_2)</p>

<p># تهيئة FluxPipeline
self.pipe = FluxPipeline(
scheduler=scheduler,
text_encoder=text_encoder,
tokenizer=tokenizer,
text_encoder_2=None,
tokenizer_2=tokenizer_2,
vae=vae,
transformer=None,
)
self.pipe.text_encoder_2 = text_encoder_2
self.pipe.transformer = transformer
self.pipe.enable_model_cpu_offload()</p>

<p>def decode_request(self, request):
return request["prompt"]</p>

<p>def predict(self, prompt):
image = self.pipe(
prompt=prompt,
width=1024,
height=1024,
num_inference_steps=4,
generator=torch.Generator().manual_seed(int(time.time())),
guidance_scale=3.5,
).images[0]
return image</p>

<p>def encode_response(self, image):
buffered = BytesIO()
image.save(buffered, format="PNG")
return Response(content=buffered.getvalue(), headers={"Content-Type": "image/png"})</p>

<p># بدء الخادم
if __name__ == "__main__":
api = FluxLitAPI()
server = ls.LitServer(api, timeout=False)
server.run(port=8000)</p>

هذا الشفرة يُظهر كيفية تهيئة Flux كخادم واجهة برمجة تطبيقات مع LitServe.

بدء الخادم:

</pre>
python server.py
<pre>

استخدام واجهة برمجة التطبيقات:

يمكن اختبار الواجهة البرمجية باستخدام سكريبت عميل بسيط:

import requests
import json

<p>url = "http://localhost:8000/predict"
prompt = "رجل آلي يجلس على كرسي يرسم صورة على لوحة للعالم المستقبلي، فن البوب آرت"</p>

<p>response = requests.post(url, json={"prompt": prompt})
with open("generated_image.png", "wb") as f:
f.write(response.content)</p>

<p>print("تم توليد الصورة و حفظها باسم generated_image.png")</p>

ميزات رئيسية للنشر

  1. هيكل خادم بدون خادم: إعداد LitServe يسمح بنشر قابل للتطوير ويمكن أن يصل إلى الصفر عند عدم الاستخدام.
  2. واجهة برمجة تطبيقات خاصة: يمكن نشر Flux كواجهة برمجة تطبيقات خاصة على البنية التحتية الخاصة.
  3. دعم متعدد للوحدات المركزية: الإعداد مصمم للعمل بكفاءة عبر وحدات مركزية متعددة.
  4. الquantization: الشفرة تُظهر كيفية تحويل النموذج إلى دقة 8 بت، مما يسمح له بالتشغيل على أجهزة أقل قوة مثل NVIDIA L4 GPUs.
  5. إغلاق على وحدة المعالجة المركزية: طريقة enable_model_cpu_offload() تستخدم لحفظ ذاكرة GPU عن طريق إغلاق أجزاء من النموذج على وحدة المعالجة المركزية عند عدم استخدامها.

التطبيقات العملية ل Flux

المرنة والقوة التي تقدمها Flux تفتح نطاقًا واسعًا من التطبيقات المحتملة عبر مختلف الصناعات:

  1. الصناعات الإبداعية: يمكن لمصممي الجرافيك والرسامين والفنانين استخدام Flux لتوليد فوري للفنون Concept واللوحات والتحفيزات البصرية.
  2. التسويق والإعلان: يمكن للمسوقين إنشاء مواد بصرية مخصصة للحملات ووسائل التواصل الاجتماعي والنمذجة للمنتجات بسرعة وجودة غير مسبوقة.
  3. تطوير الألعاب: يمكن لمصممي الألعاب استخدام Flux لتوليد بسرعة النماذج الأولية للبيئات والشخصيات والعناصر، مما يسرع عملية ما قبل الإنتاج.
  4. الهندسة المعمارية والتصميم الداخلي: يمكن للمهندسين المعماريين والمصممين توليد تصورات واقعية للفضاءات والهياكل بناءً على الوصف النصي.
  5. التعليم: يمكن للمعلمين إنشاء مواد بصرية مخصصة للمساعدة في تعليم المفاهيم المعقدة وجعلها أكثر سهولة ومتعة.
  6. السينما والرسوم المتحركة: يمكن لفنيي القصة والرسامين استخدام Flux لتوليد بسرعة اللوحات والشخصيات، مما يسرع عملية ما قبل الإنتاج.

مستقبل Flux وإنشاء الصور بواسطة النص

Black Forest Labs أعلنت عن خطط لتطوير أنظمة توليدية متنافسة للنص إلى الفيديو، مع وعد بتحقيق دقة عالية وسرعة غير مسبوقة.

هذا الخارطة الطريق يشير إلى أن Flux ليس منتجًا منفردًا، بل جزءًا من نظام أوسع من أدوات الذكاء الاصطناعي التوليدية. مع تطور التكنولوجيا، يمكننا期待:

  1. التكامل المحسّن: سير عمل متكامل بين توليد الصور والفيديو، مما يسمح بإنشاء محتوى أكثر تعقيدًا وديناميكية.
  2. التخصيص المحسّن: التحكم الدقيق hơn في المحتوى المولَّد، ربما من خلال تقنيات هندسة التعليمات المتقدمة أو واجهات مستخدم سهلة الاستخدام.
  3. التوليد في الوقت الفعلي: مع تحسين نماذج مثل FLUX.1 [schnell]، قد نرى khả năng توليد الصور في الوقت الفعلي، مما قد يثور في إنشاء المحتوى الحي والوسائط التفاعلية.
  4. التوليد عبر الوسائط: القدرة على توليد المحتوى وتعديله عبر وسائط متعددة (نص، صورة، فيديو، صوت) بطريقة متسقة ومتكاملة.
  5. تطوير الذكاء الاصطناعي الأخلاقي: الاستمرار في تطوير نماذج الذكاء الاصطناعي التي لا تكون فقط قوية، بل أيضًا مسؤولة و أخلاقية.

الخلاصة: هل Flux أفضل من Midjourney؟

سؤال ما إذا كان Flux “أفضل” من Midjourney ليس سهلًا للإجابة بهذا أو ذاك. كلا النموذجين يمثلان الحد الأقصى لتكنولوجيا إنشاء الصور بواسطة النص، كل مع نقاط قوة فريدة ومميزات.

Flux، مع هيكله المتقدم وتركيزه على اتباع التعليمات، قد يقدم تحكمًا أكثر دقة وربما جودة أعلى في بعض السيناريوهات. إصداراته المفتوحة المصدر توفر فرصًا للتخصيص والتكامل التي قد تفوق Midjourney فيما يتعلق بالمرنة وخيارات المستخدم.

Midjourney، من ناحية أخرى، لديها سجل حافل وجماعة كبيرة ومحبوبة، مع أسلوب فني مميز وواجهة مستخدم友ية. دمجها مع Discord وواجهة المستخدم سهلة الاستخدام جعلتها متاحة لجميع المستويات من المهارات التقنية.

في النهاية، النموذج “الأفضل” قد يعتمد على حالة الاستخدام المحددة والتفضيلات الشخصية والتطور المستمر لكلا المنصتين. ما هو واضح هو أن Flux يمثل خطوة كبيرة إلى الأمام في مجال الذكاء الاصطناعي التوليدي، ويقدم تقنيات مبتكرة ويدفع حدود ما هو ممكن في توليد الصور بواسطة النص.

لقد قمت بإنفاق الخمس سنوات الماضية في غمرة العالم المثير للاهتمام من التعلم الآلي والتعلم العميق. وقد أدت شغفي وخبرتي إلى المساهمة في أكثر من 50 مشروعًا متنوعًا في هندسة البرمجيات، مع التركيز بشكل خاص على الذكاء الاصطناعي والتعلم الآلي. كما أدت فضولي المستمر إلى جذبي نحو معالجة اللغة الطبيعية، وهو مجال أنا متحمس لاستكشافه بشكل أكبر.