Mô hình và nền tảng AI
HD-Painter: Tạo ảnh độ phân giải cao dựa trên văn bản với mô hình khuếch tán
Mô hình khuếch tán đã cách mạng hóa ngành AI và ML, với các ứng dụng trong thời gian thực trở thành một phần không thể thiếu trong cuộc sống hàng ngày của chúng ta. Sau khi các mô hình văn bản-sang-ảnh thể hiện khả năng đáng kinh ngạc, các kỹ thuật xử lý ảnh dựa trên khuếch tán, chẳng hạn như tạo ra, tổng hợp ảnh chuyên dụng và cá nhân hóa, chỉnh sửa ảnh cấp độ đối tượng, biến thể điều kiện và chỉnh sửa, đã trở thành chủ đề nghiên cứu nóng do ứng dụng của chúng trong ngành tầm nhìn máy tính.
Tuy nhiên, mặc dù có khả năng ấn tượng và kết quả vượt trội, các框 khổ văn bản-sang-ảnh, đặc biệt là các khung khổ văn bản-sang-ảnh, vẫn còn những lĩnh vực có thể phát triển. Những lĩnh vực này bao gồm khả năng hiểu cảnh toàn cầu, đặc biệt là khi làm sạch ảnh ở các bước khuếch tán cao. Để giải quyết vấn đề này, các nhà nghiên cứu đã giới thiệu HD-Painter, một khung khổ hoàn toàn không cần đào tạo mà tuân theo các hướng dẫn.prompt một cách chính xác và có thể mở rộng đến việc tạo ảnh độ phân giải cao một cách nhất quán. Khung khổ HD-Painter sử dụng một lớp chú ý hướng nội nhận thức.prompt (PAIntA) để tận dụng thông tin.prompt và nâng cao khả năng tạo ra ảnh phù hợp với văn bản.
Để cải thiện sự nhất quán của.prompt, mô hình HD-Painter giới thiệu một phương pháp hướng dẫn lấy mẫu hậu kỳ (RASG). Phương pháp này tích hợp một chiến lược lấy mẫu hậu kỳ vào thành phần DDIM một cách mượt mà, ngăn chặn sự thay đổilatent ngoài phân phối. Ngoài ra, khung khổ HD-Painter còn có một kỹ thuật siêu phân giải chuyên dụng cho việc tạo ảnh, cho phép nó mở rộng đến các quy mô lớn hơn và hoàn thành các vùng bị thiếu trong ảnh với độ phân giải lên đến 2K.
HD-Painter: Tạo ảnh dựa trên văn bản
Các mô hình khuếch tán văn bản-sang-ảnh đã trở thành một chủ đề quan trọng trong ngành AI và ML trong những tháng gần đây, với các mô hình thể hiện khả năng ấn tượng trong các ứng dụng thực tế. Các mô hình tạo ảnh văn bản-sang-ảnh trước đào tạo như DALL-E, Imagen và Stable Diffusion đã chứng minh sự phù hợp của chúng cho việc hoàn thành ảnh bằng cách kết hợp các vùng không rõ ràng (tạo ra) với các vùng đã biết trong quá trình khuếch tán ngược. Mặc dù tạo ra các kết quả hấp dẫn và hài hòa, các mô hình hiện có vẫn gặp khó khăn trong việc hiểu cảnh toàn cầu, đặc biệt là trong quá trình làm sạch ở các bước khuếch tán cao. Bằng cách sửa đổi các mô hình tạo ảnh văn bản-sang-ảnh trước đào tạo để tích hợp thêm thông tin.context, chúng có thể được tinh chỉnh cho việc hoàn thành ảnh dựa trên văn bản.
Ngoài ra, trong các mô hình khuếch tán, việc tạo ảnh dựa trên văn bản và hoàn thành ảnh dựa trên văn bản là những lĩnh vực quan tâm chính của các nhà nghiên cứu. Sự quan tâm này được thúc đẩy bởi thực tế là các mô hình tạo ảnh dựa trên văn bản có thể tạo ra nội dung trong các vùng cụ thể của ảnh đầu vào dựa trên các.prompt văn bản, dẫn đến các ứng dụng tiềm năng như chỉnh sửa các vùng cụ thể của ảnh, thay đổi thuộc tính của đối tượng như màu sắc hoặc quần áo, và thêm hoặc thay thế các đối tượng. Tóm lại, các mô hình tạo ảnh văn bản-sang-ảnh đã đạt được thành công chưa từng có, nhờ vào khả năng tạo ra ảnh thực tế và hấp dẫn.

Tuy nhiên, đa số các khung khổ hiện có thể hiện sự bỏ qua.prompt trong hai kịch bản. Đầu tiên là Background Dominance khi mô hình hoàn thành vùng không rõ ràng bằng cách bỏ qua.prompt trong nền, trong khi kịch bản thứ hai là nearby object dominance khi mô hình truyền播 các đối tượng từ vùng đã biết đến vùng không rõ ràng bằng cách sử dụng khả năng.context thị giác thay vì.prompt đầu vào. Có thể cả hai vấn đề này đều là kết quả của khả năng giải thích.prompt không chính xác hoặc trộn.prompt với thông tin.context từ vùng đã biết.
Để giải quyết những trở ngại này, khung khổ HD-Painter giới thiệu lớp chú ý hướng nội nhận thức.prompt (PAIntA), sử dụng thông tin.prompt để nâng cao khả năng tạo ra ảnh phù hợp với văn bản. PAIntA sử dụng.prompt đầu vào để nâng cao khả năng chú ý tự nhiên, nhằm giảm thiểu ảnh hưởng của thông tin không liên quan từ vùng đã biết và tăng cường đóng góp của các pixel đã biết phù hợp với.prompt. Để cải thiện sự nhất quán của.prompt, khung khổ HD-Painter thực hiện một phương pháp hướng dẫn lấy mẫu hậu kỳ, tận dụng các điểm chú ý chéo. Tuy nhiên, việc thực hiện phương pháp hướng dẫn lấy mẫu hậu kỳ thông thường có thể gây ra sự thay đổilatent ngoài phân phối, dẫn đến sự suy giảm chất lượng của ảnh tạo ra. Để giải quyết vấn đề này, khung khổ HD-Painter thực hiện phương pháp hướng dẫn lấy mẫu hậu kỳ có trọng số (RASG), một phương pháp tích hợp chiến lược lấy mẫu hậu kỳ vào thành phần DDIM một cách mượt mà, cho phép khung khổ tạo ra ảnh có chất lượng cao và phù hợp với.prompt.
Bằng cách triển khai cả hai thành phần RASH và PAIntA trong kiến trúc của mình, khung khổ HD-Painter có lợi thế đáng kể so với các mô hình hiện có, bao gồm cả các mô hình tinh chỉnh, vì nó giải quyết được vấn đề bỏ qua.prompt. Ngoài ra, cả hai thành phần RASH và PAIntA đều cung cấp chức năng plug and play, cho phép chúng tương thích với các mô hình khuếch tán dựa trên ảnh để giải quyết các thách thức trên. Cuối cùng, bằng cách thực hiện công nghệ trộn thời gian và tận dụng khả năng của các mô hình khuếch tán độ phân giải cao, khung khổ HD-Painter có thể hoạt động hiệu quả cho việc tạo ảnh độ phân giải cao lên đến 2K.
Tóm lại, HD-Painter nhằm thực hiện các đóng góp sau trong lĩnh vực:
- Nó nhằm giải quyết vấn đề bỏ qua.prompt của nền và sự thống trị của đối tượng gần đó mà các khung khổ tạo ảnh dựa trên văn bản gặp phải bằng cách triển khai lớp chú ý hướng nội nhận thức.prompt (PAIntA) trong kiến trúc của mình.
- Nó nhằm cải thiện sự nhất quán của.prompt trong ảnh đầu ra bằng cách triển khai phương pháp hướng dẫn lấy mẫu hậu kỳ có trọng số (RASG) trong kiến trúc của mình, cho phép khung khổ HD-Painter thực hiện lấy mẫu hậu kỳ có hướng dẫn trong khi ngăn chặn sự thay đổilatent ngoài phân phối.
- Thiết kế một đường ống hoàn thành ảnh dựa trên văn bản hiệu quả, không cần đào tạo, có thể vượt trội so với các khung khổ hiện có, và sử dụng khung khổ siêu phân giải chuyên dụng cho việc tạo ảnh để thực hiện việc tạo ảnh dựa trên văn bản lên đến độ phân giải 2K.
HD-Painter: Phương pháp và Kiến trúc
Trước khi chúng ta xem xét kiến trúc, điều quan trọng là phải hiểu ba khái niệm cơ bản hình thành nền tảng của khung khổ HD-Painter: Hoàn thành ảnh, Hướng dẫn lấy mẫu hậu kỳ trong các khung khổ khuếch tán, và Các khối kiến trúc chuyên dụng cho việc tạo ảnh.
Hoàn thành ảnh là một phương pháp nhằm lấp đầy các vùng không rõ ràng trong ảnh đồng thời đảm bảo tính hấp dẫn của ảnh tạo ra. Các khung khổ học sâu truyền thống đã thực hiện các phương pháp sử dụng vùng đã biết để truyền播 các tính năng sâu. Tuy nhiên, sự ra đời của các mô hình khuếch tán đã dẫn đến sự tiến hóa của các mô hình hoàn thành ảnh, đặc biệt là các khung khổ tạo ảnh dựa trên văn bản. Thông thường, một mô hình tạo ảnh văn bản-sang-ảnh trước đào tạo sẽ thay thế vùng không rõ ràng của ảnh bằng cách sử dụng phiên bản làm mờ của vùng đã biết trong quá trình lấy mẫu. Mặc dù phương pháp này hoạt động đến một mức độ nhất định, nó làm suy giảm chất lượng của ảnh tạo ra đáng kể vì mạng làm mờ chỉ nhìn thấy phiên bản làm mờ của vùng đã biết. Để giải quyết vấn đề này, một số phương pháp đã được đề xuất để tinh chỉnh mô hình tạo ảnh văn bản-sang-ảnh trước đào tạo để đạt được việc hoàn thành ảnh dựa trên văn bản. Bằng cách thực hiện phương pháp này, khung khổ có thể tạo ra một mặt nạ ngẫu nhiên thông qua việc kết hợp vì mô hình có thể điều kiện quá trình làm mờ dựa trên vùng không bị che khuất.
Di chuyển tiếp, các mô hình học sâu truyền thống đã thực hiện các lớp thiết kế đặc biệt cho việc hoàn thành ảnh hiệu quả, với một số khung khổ có thể trích xuất thông tin một cách hiệu quả và tạo ra ảnh hấp dẫn bằng cách giới thiệu các lớp chú ý.context để giảm thiểu yêu cầu tính toán nặng nề của tất cả các lớp chú ý tự nhiên cho việc tạo ảnh chất lượng cao. Một số khung khổ thậm chí đã thêm một lớp chú ý.context vào kiến trúc của mình để giảm thiểu yêu cầu tính toán nặng nề của tất cả các lớp chú ý tự nhiên cho việc tạo ảnh chất lượng cao.
Cuối cùng, các phương pháp hướng dẫn lấy mẫu hậu kỳ là các phương pháp lấy mẫu khuếch tán ngược hướng dẫn bước tiếp theo của dự đoán latent đến một mục tiêu tối thiểu hóa chức năng. Các phương pháp hướng dẫn lấy mẫu hậu kỳ rất hữu ích khi tạo ra nội dung thị giác, đặc biệt là khi có các ràng buộc thêm. Tuy nhiên, các phương pháp hướng dẫn lấy mẫu hậu kỳ có một hạn chế lớn: chúng có thể dẫn đến sự suy giảm chất lượng ảnh vì chúng có xu hướng thay đổi quá trình tạo ra latent bằng một thuật ngữ gradient.
Đến với kiến trúc của HD-Painter, khung khổ đầu tiên xây dựng vấn đề hoàn thành ảnh dựa trên văn bản, sau đó giới thiệu hai mô hình khuếch tán, cụ thể là Stable Inpainting và Stable Diffusion. Khung khổ HD-Painter sau đó giới thiệu các khối PAIntA và RASG, và cuối cùng, chúng ta có được kỹ thuật siêu phân giải chuyên dụng cho việc tạo ảnh.
Stable Diffusion và Stable Inpainting
Stable Diffusion là một mô hình khuếch tán hoạt động trong không gian latent của một bộ tự mã hóa. Đối với việc tạo ảnh văn bản-sang-ảnh, khung khổ Stable Diffusion thực hiện một.prompt văn bản để hướng dẫn quá trình. Hàm hướng dẫn có cấu trúc tương tự như kiến trúc UNet, và các lớp chú ý chéo điều kiện nó dựa trên các.prompt văn bản. Hơn nữa, mô hình Stable Diffusion có thể thực hiện việc hoàn thành ảnh với một số sửa đổi và tinh chỉnh. Để đạt được điều này, các tính năng của ảnh đã được mã hóa được kết hợp với mặt nạ nhị phân đã được giảm kích thước xuống các latent để tạo ra tensor đầu vào cho kiến trúc UNet và thu được ước tính nhiễu. Khung khổ sau đó khởi tạo các bộ lọc convolution mới được thêm vào bằng cách đặt chúng bằng không, trong khi phần còn lại của kiến trúc UNet được khởi tạo bằng cách sử dụng các điểm kiểm tra trước đào tạo từ mô hình Stable Diffusion.

Hình ảnh trên minh họa tổng quan về khung khổ HD-Painter bao gồm hai giai đoạn. Trong giai đoạn đầu, khung khổ HD-Painter thực hiện việc tạo ảnh dựa trên văn bản, trong khi ở giai đoạn thứ hai, mô hình hoàn thành việc tạo ảnh với siêu phân giải của đầu ra. Để lấp đầy các vùng không rõ ràng và duy trì sự nhất quán với.prompt đầu vào, mô hình lấy một mô hình khuếch tán hoàn thành ảnh trước đào tạo, thay thế các lớp chú ý tự nhiên bằng các lớp PAIntA, và thực hiện cơ chế RASG để thực hiện quá trình khuếch tán ngược. Mô hình sau đó giải mã latent ước tính cuối cùng, tạo ra ảnh đã được hoàn thành. HD-Painter sau đó thực hiện mô hình siêu phân giải ổn định để hoàn thành ảnh với kích thước ban đầu, và thực hiện quá trình khuếch tán ngược của khung khổ Stable Diffusion có điều kiện trên ảnh đầu vào với độ phân giải thấp. Mô hình trộn các dự đoán làm mờ với mã hóa của ảnh gốc trong từng bước ở vùng đã biết và suy ra latent tiếp theo. Cuối cùng, mô hình giải mã latent và thực hiện trộn Poisson để tránh các artifact cạnh.
Prompt Aware Introverted Attention hoặc PAIntA
Các mô hình hoàn thành ảnh hiện có như Stable Inpainting có xu hướng phụ thuộc nhiều vào.context thị giác xung quanh vùng hoàn thành ảnh và bỏ qua các.prompt đầu vào của người dùng. Dựa trên kinh nghiệm của người dùng, vấn đề này có thể được phân loại thành hai loại: sự thống trị của đối tượng gần đó và sự thống trị của nền. Vấn đề về sự thống trị của.context thị giác trên.prompt đầu vào có thể là kết quả của tính chất không gian và không có.prompt của các lớp chú ý tự nhiên. Để giải quyết vấn đề này, khung khổ HD-Painter giới thiệu Prompt Aware Introverted Attention hoặc PAIntA, sử dụng ma trận chú ý chéo và mặt nạ hoàn thành ảnh để kiểm soát đầu ra của các lớp chú ý tự nhiên trong vùng không rõ ràng.
Thành phần Prompt Aware Introverted Attention đầu tiên áp dụng các lớp chiếu để thu được khóa, giá trị và truy vấn cùng với ma trận tương tự. Mô hình sau đó điều chỉnh điểm chú ý của các pixel đã biết để giảm thiểu ảnh hưởng mạnh của vùng đã biết đối với vùng không rõ ràng, và định nghĩa một ma trận tương tự mới bằng cách tận dụng.prompt văn bản.

Reweighting Attention Score Guidance hoặc RASG
Khung khổ HD-Painter áp dụng một phương pháp hướng dẫn lấy mẫu hậu kỳ để nâng cao sự nhất quán của.prompt trong ảnh tạo ra. Cùng với một hàm mục tiêu, phương pháp hướng dẫn lấy mẫu hậu kỳ nhằm tận dụng các tính chất phân khúc từ vựng mở của các lớp chú ý chéo. Tuy nhiên, phương pháp hướng dẫn lấy mẫu hậu kỳ thông thường có thể gây ra sự thay đổilatent ngoài phân phối, dẫn đến sự suy giảm chất lượng của ảnh tạo ra. Để giải quyết vấn đề này, mô hình HD-Painter thực hiện cơ chế hướng dẫn lấy mẫu hậu kỳ có trọng số hoặc RASG, một phương pháp tích hợp chiến lược lấy mẫu hậu kỳ vào thành phần DDIM một cách mượt mà, cho phép khung khổ tạo ra ảnh có chất lượng cao và phù hợp với.prompt.
HD-Painter: Thử nghiệm và Kết quả
Để phân tích hiệu suất của mình, khung khổ HD-Painter được so sánh với các mô hình hiện có, bao gồm Stable Inpainting, GLIDE và BLD hoặc Blended Latent Diffusion trên 10000 mẫu ngẫu nhiên, trong đó.prompt được chọn là nhãn của mặt nạ thể hiện.

Như có thể quan sát được, khung khổ HD-Painter vượt trội so với các khung khổ hiện có trên ba chỉ số khác nhau với một khoảng cách đáng kể, đặc biệt là sự cải thiện 1,5 điểm trên chỉ số CLIP và sự khác biệt về độ chính xác tạo ra khoảng 10% so với các phương pháp tinh chỉnh hiện có.

Tiếp theo, hình ảnh dưới đây minh họa so sánh chất lượng của khung khổ HD-Painter với các khung khổ hoàn thành ảnh khác. Như có thể quan sát được, các mô hình cơ sở khác thường tái tạo các vùng không rõ ràng trong ảnh như một sự tiếp tục của các đối tượng trong vùng đã biết, bỏ qua.prompt, hoặc tạo ra một nền. Mặt khác, khung khổ HD-Painter có thể tạo ra các đối tượng mục tiêu một cách thành công nhờ vào việc triển khai các thành phần PAIntA và RASG trong kiến trúc của mình.

Các Tư duy Cuối cùng
Trong bài viết này, chúng ta đã thảo luận về HD-Painter, một phương pháp tạo ảnh độ phân giải cao dựa trên văn bản không cần đào tạo, giải quyết các thách thức mà các khung khổ hoàn thành ảnh hiện có gặp phải, bao gồm bỏ qua.prompt và sự thống trị của đối tượng gần đó. Khung khổ HD-Painter triển khai một lớp chú ý hướng nội nhận thức.prompt (PAIntA) sử dụng thông tin.prompt để nâng cao khả năng tạo ra ảnh phù hợp với văn bản.
Để cải thiện sự nhất quán của.prompt thậm chí còn hơn, mô hình HD-Painter giới thiệu một phương pháp hướng dẫn lấy mẫu hậu kỳ có trọng số (RASG) tích hợp một chiến lược lấy mẫu hậu kỳ vào thành phần DDIM một cách mượt mà, ngăn chặn sự thay đổilatent ngoài phân phối. Hơn nữa, khung khổ HD-Painter giới thiệu một kỹ thuật siêu phân giải chuyên dụng cho việc tạo ảnh, cho phép nó mở rộng đến các quy mô lớn hơn và hoàn thành các vùng không rõ ràng trong ảnh với độ phân giải lên đến 2K.












