Model dan platform AI

Stability AI Merilis Model Text-to-Image DeepFloyd IF

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Stability AI dan laboratorium penelitian AI multimodalnya, DeepFloyd, telah mengumumkan rilis penelitian DeepFloyd IF, model difusi piksel cascaded text-to-image yang canggih. Model ini awalnya dirilis di bawah lisensi non-komersial, tetapi rilis sumber terbuka direncanakan untuk masa depan.

DeepFloyd IF memiliki beberapa fitur luar biasa, termasuk:

  1. Pemahaman prompt teks yang dalam: Model ini menggunakan T5-XXL-1.1 sebagai pengkode teks, dengan banyak lapisan perhatian silang teks-gambar, memastikan keselarasan yang lebih baik antara prompt dan gambar.
  2. Teks yang koheren dan jelas di samping gambar yang dihasilkan: DeepFloyd IF dapat menghasilkan gambar yang mengandung objek dengan berbagai properti dan hubungan spasial.
  3. Tingkat photorealisme yang tinggi: Model ini telah mencapai skor FID nol-shot yang impresif sebesar 6,66 pada dataset COCO.
  4. Perubahan rasio aspek: Model ini dapat menghasilkan gambar dengan rasio aspek non-standar, termasuk vertikal, horizontal, dan standar persegi.
  5. Terjemahan gambar-ke-gambar nol-shot: Model ini dapat memodifikasi gaya, pola, dan detail gambar sambil menjaga bentuk dasarnya.

Berikut beberapa konsep contoh yang dibuat oleh DeepFloyd IF:

Desain difusi piksel cascaded modular DeepFloyd IF terdiri dari beberapa modul neural yang berinteraksi secara sinergis. Model ini bekerja dalam ruang piksel, memproses data resolusi tinggi secara berantai menggunakan model yang dilatih secara individual pada resolusi yang berbeda. Ini melibatkan model dasar yang menghasilkan sampel resolusi rendah dan model super-resolusi yang menghasilkan gambar resolusi tinggi.

Model ini dilatih pada dataset LAION-A kustom yang mengandung 1 miliar pasangan gambar-teks, subset dari bagian bahasa Inggris dataset LAION-5B. Filter kustom DeepFloyd digunakan untuk menghapus konten yang memiliki watermark, NSFW, dan konten yang tidak pantas lainnya.

Proses DeepFloyd IF

Awalnya, DeepFloyd IF dirilis di bawah lisensi penelitian. Peneliti bertujuan untuk mendorong pengembangan aplikasi baru di berbagai domain seperti seni, desain, cerita, realitas virtual, dan aksesibilitas. Untuk menginspirasi penelitian potensial, mereka telah mengusulkan beberapa pertanyaan penelitian teknis, akademis, dan etis.

Pertanyaan penelitian teknis termasuk:

  • Mengoptimalkan model IF untuk meningkatkan kinerja, skalabilitas, dan efisiensi.
  • Meningkatkan kualitas output dengan memperbaiki sampling, mengarahkan, atau memperhalus model.
  • Menggunakan teknik yang digunakan untuk memodifikasi output Stable Diffusion ke DeepFloyd IF.

Pertanyaan penelitian akademis termasuk:

  • Mengexplorasi peran pra-pelatihan untuk pembelajaran transfer.
  • Meningkatkan kontrol model atas generasi gambar.
  • Mengembangkan kemampuan model di luar sintesis teks-ke-gambar dengan mengintegrasikan beberapa modalitas.
  • Mengukur interpretasi model untuk meningkatkan pemahaman fitur visual gambar yang dihasilkan.

Pertanyaan penelitian etis termasuk:

  • Mengidentifikasi dan memitigasi bias pada DeepFloyd IF.
  • Mengukur dampak model pada media sosial dan generasi konten.
  • Mengembangkan detektor gambar palsu yang efektif yang menggunakan model.

Untuk mengakses bobot model, pengguna harus menerima lisensi pada ruang Hugging Face DeepFloyd. Untuk informasi lebih lanjut, Anda dapat mengunjungi situs web model, repo GitHub, demo Gradio, atau bergabung dengan diskusi publik melalui Linktree DeepFloyd.

Alex McFarland adalah seorang jurnalis dan penulis AI yang menjelajahi perkembangan terbaru dalam kecerdasan buatan. Ia telah berkolaborasi dengan berbagai startup dan publikasi AI di seluruh dunia.