Mô hình và nền tảng AI
Pixelmator Mang Tới Siêu Phân Giải Được Điều Khiển Bởi Trí Tuệ Nhân Tạo Cho Người Dùng
Pixelmator gần đây đã cho phép chủ sở hữu của Pixelmator Pro, một ứng dụng chỉnh sửa ảnh, sử dụng công cụ siêu phân giải được điều khiển bởi trí tuệ nhân tạo.
Siêu phân giải cho phép ảnh mờ, độ phân giải thấp được cải thiện và độ phân giải của hình ảnh được nâng cao. Công nghệ siêu phân giải có thể làm sắc nét hình ảnh một cách ấn tượng, thường evoking trope “cải thiện” thường thấy trong các chương trình tội phạm. Pixelmator gần đây đã công bố việc tích hợp công cụ “ML Super Resolution” vào phiên bản Pro của phần mềm chỉnh sửa ảnh. Demonstration của Pixelmator về một số kết quả có thể được xem tại đây.
Thử nghiệm sớm của công cụ này cho thấy nó có thể giảm độ mờ trong nhiều loại hình ảnh, bao gồm văn bản, ảnh chụp và minh họa. Như được báo cáo bởi The Verge, kết quả được tạo ra bởi chương trình cũng dường như tốt hơn các công cụ nâng cấp hình ảnh khác, thường sử dụng các thuật toán như Nearest Neighbors và Bilinear.
Nghiên cứu về siêu phân giải đã được thúc đẩy bởi nhiều công ty công nghệ như Google (GOOGL ), Microsoft (MSFT ) và Nvidia. Nhiều công ty đã thiết kế các thuật toán siêu phân giải của riêng họ, nhưng phương pháp được sử dụng để đào tạo các thiết bị siêu phân giải khác nhau sử dụng các nguyên tắc cơ bản giống nhau.
ML Super Resolution, và các công cụ siêu phân giải khác, được đào tạo sử dụng các cặp hình ảnh độ phân giải thấp và cao. Các hình ảnh độ phân giải thấp thường chỉ là các phiên bản thu nhỏ của hình ảnh độ phân giải cao thông thường. So sánh được thực hiện giữa hình ảnh độ phân giải thấp và cao, và các thuật toán học máy học cách các vùng pixel trong hình ảnh độ phân giải cao khác với hình ảnh độ phân giải thấp. Mục tiêu là các mạng nơ-ron học cách phân biệt các mẫu pixel sẽ dẫn đến hình ảnh có độ phân giải cao hơn. Nó có thể sử dụng các mẫu khác biệt này để dự đoán nơi thêm pixel vào hình ảnh để cải thiện độ phân giải khi nó được trình bày với một hình ảnh chưa xem.
Các ứng dụng siêu phân giải có thể được tạo ra bằng nhiều phương pháp. Ví dụ, một phương pháp siêu phân giải là sử dụng Mạng Đối Nghịch Thế Hệ (GANs). GANs thực sự là hai mạng nơ-ron đối lập với nhau, vay mượn các khái niệm từ Lý thuyết Trò chơi như trò chơi zero-sum và mô hình actor-critic. Về cơ bản, công việc của một mạng nơ-ron là tạo ra hình ảnh giả, trong khi công việc của mạng khác là phát hiện các hình ảnh giả này. Mạng tạo ra hình ảnh giả được gọi là generator, trong khi mạng phát hiện chúng được gọi là discriminator.
Trong trường hợp của công cụ Siêu Phân Giải của Pixelmator, một mạng nơ-ron tích chập được tạo ra cũng thực hiện một “khối phóng to” mà phóng to hình ảnh sau khi 29 lớp tích chập quét hình ảnh. Mảng hình ảnh được phóng to sau đó được xử lý hậu kỳ và chuyển đổi trở lại thành hình ảnh truyền thống với độ phân giải được cải thiện. Mạng cũng chứa các chức năng để loại bỏ tiếng ồn và xử lý các hiện tượng nén, để các khía cạnh của hình ảnh không bị phóng to. Thuật toán của Pixelmator nhỏ hơn nhiều so với các thuật toán được sử dụng trong các môi trường nghiên cứu, để chúng có thể được bao gồm trong ứng dụng Pixelmator Pro và chạy trên nhiều thiết bị. Tập dữ liệu đào tạo khá nhỏ so với các tập dữ liệu khác được sử dụng cho các ứng dụng tương tự, chỉ 15000 mẫu được sử dụng để đào tạo các thuật toán.
Theo The Verge, có các công cụ siêu phân giải khác có sẵn cho người tiêu dùng. Ví dụ, Adobe (ADBE ) cũng có công cụ siêu phân giải của riêng mình trong bộ Adobe Camera, nhưng công cụ của Pixelmator dường như tạo ra hình ảnh chất lượng cao nhất.












