Mô hình và nền tảng AI

Stability AI Phát Hành Mô Hình Text-to-Image DeepFloyd IF

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Stability AI và phòng thí nghiệm nghiên cứu trí tuệ nhân tạo đa phương thức của họ, DeepFloyd, đã công bố việc phát hành nghiên cứu của DeepFloyd IF, một mô hình khuếch tán pixel级 tiên tiến. Mô hình này ban đầu được phát hành dưới dạng giấy phép không thương mại, cho phép nghiên cứu, nhưng một phiên bản mã nguồn mở được dự kiến sẽ phát hành trong tương lai.

DeepFloyd IF tự hào với một số tính năng đáng chú ý, bao gồm:

  1. Hiểu biết sâu về lời nhắc văn bản: Mô hình sử dụng T5-XXL-1.1 làm bộ mã hóa văn bản, với nhiều lớp chú ý chéo giữa văn bản và hình ảnh, đảm bảo sự phù hợp tốt hơn giữa lời nhắc và hình ảnh.
  2. Văn bản mạch lạc và rõ ràng cùng với hình ảnh được tạo: DeepFloyd IF có thể tạo ra hình ảnh chứa các đối tượng với các thuộc tính và quan hệ không gian khác nhau.
  3. Độ thực tế cao: Mô hình đã đạt được điểm FID zero-shot ấn tượng là 6.66 trên tập dữ liệu COCO.
  4. Chuyển đổi tỷ lệ khung hình: Mô hình có thể tạo ra hình ảnh với tỷ lệ khung hình không tiêu chuẩn, bao gồm cả tỷ lệ khung hình dọc, ngang và vuông tiêu chuẩn.
  5. Dịch hình ảnh sang hình ảnh không cần huấn luyện trước: Mô hình có thể sửa đổi phong cách, mẫu và chi tiết của hình ảnh trong khi vẫn giữ nguyên hình dạng cơ bản.

Dưới đây là một số khái niệm được tạo bởi DeepFloyd IF:

Thiết kế khuếch tán pixel级级 của DeepFloyd IF bao gồm nhiều mô-đun thần kinh tương tác với nhau. Mô hình hoạt động trong không gian pixel, xử lý dữ liệu độ phân giải cao theo cách cấp bậc bằng các mô hình được đào tạo riêng biệt ở các độ phân giải khác nhau. Điều này bao gồm một mô hình cơ sở tạo ra mẫu thấp và các mô hình siêu phân giải kế tiếp tạo ra hình ảnh độ phân giải cao.

Mô hình được đào tạo trên tập dữ liệu LAION-A tùy chỉnh chất lượng cao chứa 1 tỷ cặp (hình ảnh, văn bản), một tập con của tập dữ liệu LAION-5B tiếng Anh. Bộ lọc tùy chỉnh của DeepFloyd được sử dụng để loại bỏ nội dung bị đóng dấu bản quyền, NSFW và nội dung không phù hợp khác.

Quá trình của DeepFloyd IF

Ban đầu, DeepFloyd IF được phát hành dưới dạng giấy phép nghiên cứu. Các nhà nghiên cứu nhằm mục đích khuyến khích sự phát triển của các ứng dụng mới trong các lĩnh vực như nghệ thuật, thiết kế, kể chuyện, thực tế ảo và khả năng tiếp cận. Để khơi dậy nghiên cứu tiềm năng, họ đã đề xuất một số câu hỏi nghiên cứu kỹ thuật, học thuật và đạo đức.

Câu hỏi nghiên cứu kỹ thuật bao gồm:

  • Tối ưu hóa mô hình IF để tăng hiệu suất, khả năng mở rộng và hiệu quả.
  • Cải thiện chất lượng đầu ra bằng cách tinh chỉnh quá trình lấy mẫu, hướng dẫn hoặc tinh chỉnh mô hình.
  • Áp dụng các kỹ thuật được sử dụng để sửa đổi đầu ra của Stable Diffusion cho DeepFloyd IF.

Câu hỏi nghiên cứu học thuật bao gồm:

  • Khám phá vai trò của việc tiền huấn luyện cho học chuyển giao.
  • Tăng cường khả năng kiểm soát của mô hình đối với việc tạo ra hình ảnh.
  • Mở rộng khả năng của mô hình vượt ra ngoài tổng hợp văn bản-sang-hình ảnh bằng cách tích hợp nhiều phương thức.
  • Đánh giá khả năng giải thích của mô hình để cải thiện sự hiểu biết về các tính năng trực quan của hình ảnh được tạo.

Câu hỏi nghiên cứu đạo đức bao gồm:

  • Xác định và giảm thiểu các thiên vị trong DeepFloyd IF.
  • Đánh giá tác động của mô hình đối với truyền thông xã hội và tạo nội dung.
  • Phát triển một bộ phát hiện hình ảnh giả hiệu quả sử dụng mô hình.

Để truy cập trọng lượng của mô hình, người dùng phải chấp nhận giấy phép trên không gian Hugging Face của DeepFloyd. Để biết thêm thông tin, bạn có thể truy cập trang web của mô hình, kho mã GitHub, bản demo Gradio, hoặc tham gia các cuộc thảo luận công khai thông qua Linktree của DeepFloyd.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.