Mô hình và nền tảng AI
EasyPhoto: Trình Tạo Ảnh Cá Nhân Của Bạn Bằng Trí Tuệ Nhân Tạo

Stable Diffusion Web User Interface, hoặc SD-WebUI, là một dự án toàn diện cho các mô hình Stable Diffusion, sử dụng thư viện Gradio để cung cấp giao diện trình duyệt. Hôm nay, chúng ta sẽ nói về EasyPhoto, một plugin WebUI sáng tạo cho phép người dùng cuối tạo ra ảnh chân dung và hình ảnh bằng trí tuệ nhân tạo. Plugin WebUI EasyPhoto tạo ra ảnh chân dung bằng cách sử dụng các mẫu khác nhau, hỗ trợ các phong cách ảnh khác nhau và nhiều sửa đổi. Ngoài ra, để tăng cường khả năng của EasyPhoto, người dùng có thể tạo ra hình ảnh bằng cách sử dụng mô hình SDXL để có kết quả chính xác và đa dạng hơn. Hãy bắt đầu.
Giới Thiệu Về EasyPhoto và Stable Diffusion
Khung Stable Diffusion là một khung tạo ảnh dựa trên sự khuếch tán mạnh mẽ và phổ biến, được các nhà phát triển sử dụng để tạo ra hình ảnh thực tế dựa trên mô tả văn bản đầu vào. Nhờ khả năng của nó, khung Stable Diffusion có nhiều ứng dụng, bao gồm cả việc tạo ảnh ngoài, tạo ảnh trong, và dịch ảnh sang ảnh. Giao diện người dùng Web của Stable Diffusion, hoặc SD-WebUI, nổi bật như một trong những ứng dụng phổ biến và nổi tiếng nhất của khung này. Nó có giao diện trình duyệt được xây dựng trên thư viện Gradio, cung cấp giao diện tương tác và thân thiện với người dùng cho các mô hình Stable Diffusion. Để tăng cường kiểm soát và khả năng sử dụng trong việc tạo ảnh, SD-WebUI tích hợp nhiều ứng dụng Stable Diffusion.
Do sự tiện lợi mà SD-WebUI cung cấp, các nhà phát triển của khung EasyPhoto quyết định tạo ra nó như một plugin Web thay vì một ứng dụng đầy đủ. Khác với các phương pháp hiện có thường gặp phải mất mát danh tính hoặc giới thiệu các tính năng không thực tế vào hình ảnh, khung EasyPhoto tận dụng khả năng tạo ảnh từ ảnh của các mô hình Stable Diffusion để tạo ra hình ảnh chính xác và thực tế. Người dùng có thể dễ dàng cài đặt khung EasyPhoto như một tiện ích mở rộng trong WebUI, tăng cường sự thân thiện với người dùng và khả năng tiếp cận cho nhiều người dùng hơn. Khung EasyPhoto cho phép người dùng tạo ra ảnh chân dung được hướng dẫn bởi danh tính, chất lượng cao và thực tế mà gần giống với danh tính đầu vào.
Trước hết, khung EasyPhoto yêu cầu người dùng tạo ra người đại diện kỹ thuật số của họ bằng cách tải lên một số hình ảnh để đào tạo mô hình LoRA hoặc Low-Rank Adaptation trực tuyến. Khung LoRA nhanh chóng tinh chỉnh các mô hình khuếch tán bằng cách sử dụng công nghệ thích nghi thấp. Quá trình này cho phép mô hình cơ sở hiểu thông tin danh tính của người dùng cụ thể. Các mô hình đã được đào tạo sau đó được hợp nhất và tích hợp vào mô hình Stable Diffusion cơ bản để can thiệp. Hơn nữa, trong quá trình can thiệp, mô hình sử dụng các mô hình khuếch tán ổn định trong một nỗ lực để sơn lại các vùng mặt trong mẫu can thiệp, và sự tương đồng giữa hình ảnh đầu vào và đầu ra được xác minh bằng các đơn vị ControlNet khác nhau.
Khung EasyPhoto cũng triển khai một quá trình khuếch tán hai giai đoạn để giải quyết các vấn đề tiềm ẩn như cácBoundary artifacts và mất mát danh tính, đảm bảo rằng hình ảnh được tạo ra giảm thiểu sự không nhất quán về mặt hình ảnh trong khi vẫn giữ lại danh tính của người dùng. Hơn nữa, đường ống can thiệp trong khung EasyPhoto không chỉ giới hạn ở việc tạo ra ảnh chân dung, mà còn có thể được sử dụng để tạo ra bất cứ thứ gì liên quan đến danh tính của người dùng. Điều này ngụ ý rằng một khi bạn đào tạo mô hình LoRA cho một danh tính cụ thể, bạn có thể tạo ra một loạt các hình ảnh trí tuệ nhân tạo, và do đó nó có thể có ứng dụng rộng rãi bao gồm cả thử nghiệm ảo.
Tóm lại, khung EasyPhoto
- Đề xuất một cách tiếp cận mới để đào tạo mô hình LoRA bằng cách kết hợp nhiều mô hình LoRA để duy trì tính trung thực của khuôn mặt trong hình ảnh được tạo ra.
- Sử dụng các phương pháp học tăng cường để tối ưu hóa mô hình LoRA cho phần thưởng danh tính khuôn mặt, điều này giúp tăng cường sự tương đồng giữa các hình ảnh đào tạo và kết quả được tạo ra.
- Đề xuất một quá trình khuếch tán hai giai đoạn dựa trên việc tạo ảnh để tạo ra ảnh trí tuệ nhân tạo có thẩm mỹ cao và giống hệt.
EasyPhoto: Kiến Trúc & Đào Tạo
Hình dưới đây minh họa quá trình đào tạo của khung EasyPhoto AI.

Như có thể thấy, khung đầu tiên yêu cầu người dùng nhập hình ảnh đào tạo, sau đó thực hiện phát hiện khuôn mặt để phát hiện vị trí khuôn mặt. Khi khung phát hiện khuôn mặt, nó sẽ cắt hình ảnh đầu vào bằng một tỷ lệ cụ thể được định nghĩa trước, tập trung chỉ vào vùng khuôn mặt. Khung sau đó triển khai một mô hình làm đẹp da và phát hiện độ nổi bật để có được hình ảnh đào tạo khuôn mặt sạch sẽ và rõ ràng. Hai mô hình này đóng vai trò quan trọng trong việc tăng cường chất lượng hình ảnh của khuôn mặt và đảm bảo rằng thông tin nền đã được loại bỏ, và hình ảnh đào tạo chủ yếu chứa khuôn mặt. Cuối cùng, khung sử dụng những hình ảnh đã xử lý này và các lời nhắc đầu vào để đào tạo mô hình LoRA, và do đó trang bị cho nó khả năng hiểu các đặc điểm khuôn mặt của người dùng một cách hiệu quả và chính xác hơn.
Hơn nữa, trong giai đoạn đào tạo, khung bao gồm một bước xác thực quan trọng, trong đó khung tính toán khoảng cách danh tính khuôn mặt giữa hình ảnh đầu vào của người dùng và hình ảnh xác thực được tạo ra bởi mô hình LoRA đã được đào tạo. Bước xác thực là một quá trình cơ bản đóng vai trò quan trọng trong việc đạt được sự kết hợp của các mô hình LoRA, cuối cùng đảm bảo rằng khung LoRA đã được đào tạo biến thành một người đại diện, hoặc một biểu diễn kỹ thuật số chính xác của người dùng. Ngoài ra, hình ảnh xác thực có điểm số danh tính khuôn mặt tối ưu sẽ được chọn làm hình ảnh danh tính khuôn mặt, và hình ảnh này sẽ được sử dụng để tăng cường sự tương đồng về danh tính của quá trình tạo ra can thiệp.
Tiếp theo, dựa trên quá trình hợp nhất, khung đào tạo các mô hình LoRA với ước tính khả năng là mục tiêu chính, trong khi việc bảo tồn sự tương đồng về danh tính khuôn mặt là mục tiêu hạ lưu. Để giải quyết vấn đề này, khung EasyPhoto sử dụng các kỹ thuật học tăng cường để tối ưu hóa mục tiêu hạ lưu trực tiếp. Kết quả là, các đặc điểm khuôn mặt mà các mô hình LoRA học được cho thấy sự cải thiện, dẫn đến sự tăng cường về sự tương đồng giữa kết quả được tạo ra và cũng thể hiện sự khái quát hóa trên các mẫu.
Quá Trình Can Thiệp
Hình dưới đây minh họa quá trình can thiệp cho một ID người dùng trong khung EasyPhoto, và được chia thành ba phần
- Xử Lý Khuôn Mặt để có được tham chiếu ControlNet và hình ảnh đầu vào đã được xử lý.
- Khuếch Tán Đầu Tiên giúp tạo ra kết quả thô giống với đầu vào của người dùng.
- Khuếch Tán Thứ Hai giúp sửa chữa các Boundary artifacts, làm cho hình ảnh chính xác và giống thật hơn.

Đối với đầu vào, khung lấy hình ảnh danh tính khuôn mặt (được tạo ra trong quá trình đào tạo xác thực bằng cách sử dụng điểm số danh tính khuôn mặt tối ưu), và một mẫu can thiệp. Đầu ra là một bức chân dung chi tiết, chính xác và thực tế của người dùng, và gần giống với danh tính và ngoại hình độc đáo của người dùng dựa trên mẫu can thiệp. Hãy cùng xem xét kỹ lưỡng các quá trình này.
Xử Lý Khuôn Mặt
Một cách để tạo ra ảnh chân dung dựa trên mẫu can thiệp mà không cần lý luận có ý thức là sử dụng mô hình SD để tạo ảnh trong vùng khuôn mặt của mẫu can thiệp. Ngoài ra, việc thêm khung ControlNet vào quá trình không chỉ tăng cường việc bảo tồn danh tính người dùng, mà còn tăng cường sự tương đồng giữa hình ảnh được tạo ra. Tuy nhiên, việc sử dụng ControlNet trực tiếp cho việc tạo ảnh khu vực có thể giới thiệu các vấn đề tiềm ẩn, bao gồm
- Sự Không Nhất Quán Giữa Hình Ảnh Đầu Vào và Hình Ảnh Được Tạo: Rõ ràng là các điểm chính trong hình ảnh mẫu không tương thích với các điểm chính trong hình ảnh danh tính khuôn mặt, đó là lý do tại sao việc sử dụng ControlNet với hình ảnh danh tính khuôn mặt làm tham chiếu có thể dẫn đến một số sự không nhất quán trong đầu ra.
- Khuyết Tật Trong Vùng Tạo Ảnh: Việc che một khu vực và sau đó tạo ảnh mới cho khu vực đó có thể dẫn đến các khuyết tật đáng chú ý, đặc biệt là dọc theo biên giới của vùng tạo ảnh, điều này không chỉ ảnh hưởng đến tính xác thực của hình ảnh được tạo ra mà còn ảnh hưởng tiêu cực đến tính thực tế của hình ảnh.
- Mất Mát Danh Tính Bởi Control Net: Vì quá trình đào tạo không sử dụng khung ControlNet, việc sử dụng ControlNet trong giai đoạn can thiệp có thể ảnh hưởng đến khả năng của mô hình LoRA đã được đào tạo để bảo tồn danh tính người dùng.
Để giải quyết các vấn đề trên, khung EasyPhoto đề xuất ba thủ tục.
- Dán và Cắt: Bằng cách sử dụng một thuật toán dán khuôn mặt, khung EasyPhoto nhằm giải quyết vấn đề về sự không khớp giữa các điểm mốc khuôn mặt giữa hình ảnh danh tính khuôn mặt và hình ảnh mẫu. Đầu tiên, mô hình tính toán các điểm mốc khuôn mặt của hình ảnh danh tính khuôn mặt và hình ảnh mẫu, sau đó mô hình xác định ma trận biến đổi afin sẽ được sử dụng để căn chỉnh các điểm mốc khuôn mặt của hình ảnh mẫu với hình ảnh danh tính khuôn mặt. Hình ảnh kết quả vẫn giữ lại các điểm mốc của hình ảnh danh tính khuôn mặt và cũng căn chỉnh với hình ảnh mẫu.
- Kết Hợp Khuôn Mặt: Kết Hợp Khuôn Mặt là một phương pháp mới được sử dụng để sửa chữa các Boundary artifacts là kết quả của việc tạo ảnh có mask, và nó liên quan đến việc chỉnh sửa các artifact bằng cách sử dụng khung ControlNet. Phương pháp này cho phép khung EasyPhoto đảm bảo việc bảo tồn các cạnh hài hòa, và do đó hướng dẫn quá trình tạo ảnh. Thuật toán kết hợp khuôn mặt còn kết hợp hình ảnh roop (hình ảnh người dùng thực) và mẫu, cho phép hình ảnh kết hợp kết quả hiển thị sự ổn định tốt hơn của các biên giới cạnh, điều này sau đó dẫn đến đầu ra được cải thiện trong giai đoạn khuếch tán đầu tiên.
- Xác Thực Hướng Dẫn Bởi ControlNet: Vì các mô hình LoRA không được đào tạo bằng cách sử dụng khung ControlNet, việc sử dụng nó trong quá trình can thiệp có thể ảnh hưởng đến khả năng của mô hình LoRA để bảo tồn danh tính. Để tăng cường khả năng khái quát hóa của EasyPhoto, khung xem xét ảnh hưởng của khung ControlNet và tích hợp các mô hình LoRA từ các giai đoạn khác nhau.
Khuếch Tán Đầu Tiên
Giai đoạn khuếch tán đầu tiên sử dụng hình ảnh mẫu để tạo ra một hình ảnh có danh tính duy nhất giống với danh tính người dùng đầu vào. Hình ảnh đầu vào là sự kết hợp của hình ảnh người dùng đầu vào và hình ảnh mẫu, trong khi mặt nạ khuôn mặt đã được hiệu chỉnh là mặt nạ đầu vào. Để tăng cường kiểm soát quá trình tạo ảnh, khung EasyPhoto tích hợp ba đơn vị ControlNet, trong đó đơn vị ControlNet đầu tiên tập trung vào kiểm soát hình ảnh kết hợp, đơn vị ControlNet thứ hai kiểm soát màu sắc của hình ảnh kết hợp, và đơn vị ControlNet cuối cùng là openpose (kiểm soát tư thế người thật thời gian thực) của hình ảnh thay thế, không chỉ chứa cấu trúc khuôn mặt của hình ảnh mẫu mà còn chứa danh tính khuôn mặt của người dùng.
Khuếch Tán Thứ Hai
Trong giai đoạn khuếch tán thứ hai, các Boundary artifacts gần biên giới khuôn mặt được tinh chỉnh và điều chỉnh, cùng với việc cung cấp cho người dùng sự linh hoạt để mask một khu vực cụ thể trong hình ảnh nhằm tăng cường hiệu quả của quá trình tạo ảnh trong khu vực đó. Trong giai đoạn này, khung kết hợp hình ảnh đầu ra từ giai đoạn khuếch tán đầu tiên với hình ảnh roop hoặc kết quả của hình ảnh người dùng, tạo ra hình ảnh đầu vào cho giai đoạn khuếch tán thứ hai. Tổng thể, giai đoạn khuếch tán thứ hai đóng vai trò quan trọng trong việc tăng cường chất lượng tổng thể và chi tiết của hình ảnh được tạo ra.
Nhiều ID Người Dùng
Một trong những điểm nổi bật của EasyPhoto là khả năng tạo ra nhiều ID người dùng, và hình dưới đây minh họa đường ống của quá trình can thiệp cho nhiều ID người dùng trong khung EasyPhoto.

Để hỗ trợ việc tạo ra nhiều ID người dùng, khung EasyPhoto đầu tiên thực hiện phát hiện khuôn mặt trên mẫu can thiệp. Các mẫu can thiệp này sau đó được chia thành nhiều mask, trong đó mỗi mask chứa chỉ một khuôn mặt, và phần còn lại của hình ảnh được mask bằng màu trắng, do đó việc tạo ra nhiều ID người dùng được chia thành một nhiệm vụ đơn giản là tạo ra các ID người dùng riêng lẻ. Khi khung tạo ra hình ảnh ID người dùng, những hình ảnh này được hợp nhất vào mẫu can thiệp, do đó tạo điều kiện cho sự tích hợp liền mạch của các hình ảnh mẫu với các hình ảnh được tạo ra, điều này cuối cùng dẫn đến một hình ảnh chất lượng cao.
Thử Nghiệm và Kết Quả
Bây giờ chúng ta đã hiểu về khung EasyPhoto, đã đến lúc chúng ta khám phá hiệu suất của khung EasyPhoto.

Hình ảnh trên được tạo ra bởi plugin EasyPhoto, và nó sử dụng mô hình SD dựa trên phong cách để tạo ảnh. Như có thể thấy, hình ảnh được tạo ra trông thực tế và khá chính xác.

Hình ảnh trên được tạo ra bởi khung EasyPhoto bằng cách sử dụng mô hình SD dựa trên phong cách truyện tranh. Như có thể thấy, ảnh truyện tranh và ảnh thực tế trông rất thực tế và gần giống với hình ảnh đầu vào dựa trên yêu cầu của người dùng.
Hình ảnh được thêm dưới đây đã được tạo ra bởi khung EasyPhoto bằng cách sử dụng mẫu nhiều người. Như có thể thấy rõ, hình ảnh được tạo ra rõ ràng, chính xác và gần giống với hình ảnh gốc.

Với sự giúp đỡ của EasyPhoto, người dùng hiện có thể tạo ra một loạt các ảnh chân dung trí tuệ nhân tạo, hoặc tạo ra nhiều ID người dùng bằng cách sử dụng các mẫu được bảo tồn, hoặc sử dụng mô hình SD để tạo mẫu can thiệp. Các hình ảnh trên minh họa khả năng của khung EasyPhoto trong việc tạo ra các hình ảnh trí tuệ nhân tạo đa dạng và chất lượng cao.
Kết Luận
Trong bài viết này, chúng ta đã nói về EasyPhoto, một plugin WebUI sáng tạo cho phép người dùng cuối tạo ra ảnh chân dung và hình ảnh bằng trí tuệ nhân tạo. Plugin WebUI EasyPhoto tạo ra ảnh chân dung bằng cách sử dụng các mẫu tùy ý, và các ứng dụng hiện tại của plugin WebUI EasyPhoto hỗ trợ các phong cách ảnh khác nhau và nhiều sửa đổi. Ngoài ra, để tăng cường khả năng của EasyPhoto, người dùng có thể tạo ra hình ảnh bằng cách sử dụng mô hình SDXL để có kết quả hài lòng, chính xác và đa dạng hơn. Khung EasyPhoto sử dụng một mô hình khuếch tán ổn định cơ bản kết hợp với một mô hình LoRA đã được đào tạo trước để tạo ra đầu ra hình ảnh chất lượng cao.
Quan tâm đến các công cụ tạo ảnh? Chúng tôi cũng cung cấp danh sách các công cụ tạo ảnh chân dung trí tuệ nhân tạo tốt nhất và các công cụ tạo ảnh trí tuệ nhân tạo tốt nhất dễ sử dụng và không yêu cầu chuyên môn kỹ thuật.












