Mô hình và nền tảng AI
InstructIR: Khôi Phục Hình Ảnh Chất Lượng Cao Theo Hướng Dẫn Của Con Người
Một hình ảnh có thể truyền tải nhiều thông tin, nhưng nó cũng có thể bị ảnh hưởng bởi các vấn đề như mờ chuyển động, sương mù, tiếng ồn và phạm vi động thấp. Những vấn đề này, thường được gọi là suy giảm trong tầm nhìn máy tính thấp, có thể phát sinh từ các điều kiện môi trường khó khăn như nhiệt hoặc mưa, hoặc từ các hạn chế của chính máy ảnh. Khôi phục hình ảnh đại diện cho một thách thức cốt lõi trong tầm nhìn máy tính, nhằm mục đích khôi phục một hình ảnh chất lượng cao, sạch sẽ từ một hình ảnh bị suy giảm. Khôi phục hình ảnh là một vấn đề phức tạp vì có thể có nhiều giải pháp khác nhau để khôi phục bất kỳ hình ảnh nào. Một số phương pháp tập trung vào các suy giảm cụ thể, chẳng hạn như giảm tiếng ồn hoặc loại bỏ mờ hoặc sương mù.
Mặc dù những phương pháp này có thể mang lại kết quả tốt cho các vấn đề cụ thể, nhưng chúng thường gặp khó khăn khi tổng quát hóa trên các loại suy giảm khác nhau. Nhiều khuôn khổ sử dụng một mạng nơ-ron chung cho nhiều nhiệm vụ khôi phục hình ảnh, nhưng mỗi mạng nơ-ron được đào tạo riêng biệt. Việc cần có các mô hình riêng biệt cho từng loại suy giảm làm cho phương pháp này tốn thời gian và tốn kém, dẫn đến sự tập trung vào các mô hình khôi phục tất cả trong một gần đây. Những mô hình này sử dụng một mô hình khôi phục hình ảnh mù đơn để giải quyết các loại và mức độ suy giảm khác nhau, thường sử dụng các hướng dẫn hoặc vector hướng dẫn cụ thể để tăng cường hiệu suất. Mặc dù các mô hình tất cả trong một thường cho thấy kết quả đầy hứa hẹn, nhưng chúng vẫn gặp phải những thách thức với các vấn đề nghịch đảo.
InstructIR đại diện cho một phương pháp đột phá trong lĩnh vực này, là khuôn khổ khôi phục hình ảnh đầu tiên được thiết kế để hướng dẫn mô hình khôi phục thông qua hướng dẫn viết bằng tay của con người. Nó có thể xử lý các hướng dẫn ngôn ngữ tự nhiên để khôi phục hình ảnh chất lượng cao từ hình ảnh bị suy giảm, xem xét các loại suy giảm khác nhau. InstructIR thiết lập một tiêu chuẩn mới về hiệu suất cho một loạt các nhiệm vụ khôi phục hình ảnh, bao gồm loại bỏ mưa, giảm tiếng ồn, loại bỏ sương mù, làm sắc nét và tăng cường hình ảnh ánh sáng yếu.
Bài viết này nhằm mục đích giới thiệu khuôn khổ InstructIR một cách sâu sắc, và chúng tôi khám phá cơ chế, phương pháp, kiến trúc của khuôn khổ cùng với so sánh với các khuôn khổ tạo hình ảnh và video hiện đại. Vậy hãy bắt đầu.
InstructIR: Khôi Phục Hình Ảnh Chất Lượng Cao
Khôi phục hình ảnh là một vấn đề cơ bản trong tầm nhìn máy tính vì nó nhằm mục đích khôi phục một hình ảnh chất lượng cao, sạch sẽ từ một hình ảnh bị suy giảm. Trong tầm nhìn máy tính thấp, suy giảm là một thuật ngữ được sử dụng để đại diện cho các hiệu ứng không mong muốn được quan sát trong một hình ảnh như mờ chuyển động, sương mù, tiếng ồn, phạm vi động thấp và nhiều hơn. Lý do tại sao khôi phục hình ảnh là một thách thức nghịch đảo phức tạp là vì có thể có nhiều giải pháp khác nhau để khôi phục bất kỳ hình ảnh nào. Một số khuôn khổ tập trung vào các suy giảm cụ thể như giảm tiếng ồn hoặc loại bỏ mờ, trong khi những khuôn khổ khác có thể tập trung nhiều hơn vào loại bỏ sương mù hoặc làm sắc nét.
Các phương pháp học sâu gần đây đã thể hiện hiệu suất mạnh mẽ và nhất quán hơn so với các phương pháp khôi phục hình ảnh truyền thống. Các mô hình khôi phục hình ảnh dựa trên học sâu đề xuất sử dụng mạng nơ-ron dựa trên Transformer và Mạng nơ-ron tích chập. Những mô hình này có thể được đào tạo độc lập cho các nhiệm vụ khôi phục hình ảnh khác nhau, và chúng cũng có khả năng nắm bắt các tương tác tính năng cục bộ và toàn cầu, và tăng cường chúng, dẫn đến hiệu suất thỏa mãn và nhất quán. Mặc dù một số phương pháp này có thể hoạt động tốt cho các loại suy giảm cụ thể, nhưng chúng thường không tổng quát hóa tốt trên các loại suy giảm khác nhau. Hơn nữa, trong khi nhiều khuôn khổ hiện có sử dụng cùng một mạng nơ-ron cho nhiều nhiệm vụ khôi phục hình ảnh, mỗi mạng nơ-ron được đào tạo riêng biệt. Do đó, rõ ràng là việc sử dụng một mô hình nơ-ron riêng biệt cho từng loại suy giảm là không thực tế và tốn thời gian, đó là lý do tại sao các khuôn khổ khôi phục hình ảnh gần đây đã tập trung vào các mô hình khôi phục tất cả trong một.
Các mô hình khôi phục tất cả trong một hoặc đa suy giảm hoặc đa nhiệm là đang trở nên phổ biến trong lĩnh vực tầm nhìn máy tính vì chúng có khả năng khôi phục nhiều loại và mức độ suy giảm trong một hình ảnh mà không cần đào tạo các mô hình riêng biệt cho từng suy giảm. Các mô hình khôi phục tất cả trong một sử dụng một mô hình khôi phục hình ảnh mù đơn để giải quyết các loại và mức độ suy giảm khác nhau. Các mô hình khác nhau thực hiện các phương pháp khác nhau để hướng dẫn mô hình mù để khôi phục hình ảnh bị suy giảm, chẳng hạn như một mô hình phụ để phân loại suy giảm hoặc các vector hướng dẫn đa chiều hoặc hướng dẫn để giúp mô hình khôi phục các loại suy giảm khác nhau trong một hình ảnh.
Với điều đó được nói, chúng tôi đến với việc xử lý hình ảnh dựa trên văn bản vì nó đã được thực hiện bởi một số khuôn khổ trong những năm gần đây cho việc tạo hình ảnh từ văn bản và các nhiệm vụ chỉnh sửa hình ảnh dựa trên văn bản. Những mô hình này thường sử dụng hướng dẫn văn bản để mô tả các hành động hoặc hình ảnh cùng với các mô hình dựa trên sự khuếch tán để tạo ra các hình ảnh tương ứng. Sự truyền cảm hứng chính cho khuôn khổ InstructIR là khuôn khổ InstructPix2Pix, cho phép mô hình chỉnh sửa hình ảnh bằng cách sử dụng hướng dẫn của người dùng mà hướng dẫn mô hình về hành động cần thực hiện thay vì nhãn văn bản, mô tả hoặc chú thích của hình ảnh đầu vào. Do đó, người dùng có thể sử dụng văn bản viết tự nhiên để hướng dẫn mô hình về hành động cần thực hiện mà không cần cung cấp hình ảnh mẫu hoặc mô tả hình ảnh bổ sung.
Dựa trên những cơ bản này, khuôn khổ InstructIR là mô hình tầm nhìn máy tính đầu tiên sử dụng hướng dẫn viết bằng tay của con người để đạt được khôi phục hình ảnh và giải quyết các vấn đề nghịch đảo. Đối với các hướng dẫn ngôn ngữ tự nhiên, mô hình InstructIR có thể khôi phục hình ảnh chất lượng cao từ hình ảnh bị suy giảm và cũng xem xét các loại suy giảm khác nhau. Khuôn khổ InstructIR có khả năng cung cấp hiệu suất hiện đại trên một loạt các nhiệm vụ khôi phục hình ảnh, bao gồm loại bỏ mưa, giảm tiếng ồn, loại bỏ sương mù, làm sắc nét và tăng cường hình ảnh ánh sáng yếu. Ngược lại với các công việc hiện có đạt được khôi phục hình ảnh bằng cách sử dụng các vector hướng dẫn học được hoặc nhúng hướng dẫn, khuôn khổ InstructIR sử dụng hướng dẫn người dùng thô dưới dạng văn bản. Khuôn khổ InstructIR có khả năng tổng quát hóa để khôi phục hình ảnh bằng cách sử dụng hướng dẫn viết bằng tay của con người, và mô hình tất cả trong một được thực hiện bởi InstructIR bao gồm nhiều nhiệm vụ khôi phục hơn so với các mô hình trước đó. Hình ảnh sau minh họa các mẫu khôi phục đa dạng của khuôn khổ InstructIR.

InstructIR: Phương Pháp và Kiến Trúc
Ở cốt lõi, khuôn khổ InstructIR bao gồm một bộ mã hóa văn bản và một mô hình hình ảnh. Mô hình sử dụng khuôn khổ NAFNet, một mô hình khôi phục hình ảnh hiệu quả theo kiến trúc U-Net, làm mô hình hình ảnh. Hơn nữa, mô hình thực hiện các kỹ thuật định tuyến nhiệm vụ để học nhiều nhiệm vụ bằng cách sử dụng một mô hình đơn độc. Hình ảnh sau minh họa phương pháp đào tạo và đánh giá cho khuôn khổ InstructIR.

Lấy cảm hứng từ mô hình InstructPix2Pix, khuôn khổ InstructIR áp dụng hướng dẫn viết bằng tay của con người làm cơ chế điều khiển vì không cần người dùng cung cấp thông tin bổ sung. Những hướng dẫn này cung cấp một cách tương tác rõ ràng và biểu cảm, cho phép người dùng chỉ ra vị trí chính xác và loại suy giảm trong hình ảnh. Hơn nữa, sử dụng hướng dẫn người dùng thay vì hướng dẫn cụ thể cho suy giảm cố định tăng cường khả năng sử dụng và ứng dụng của mô hình vì nó cũng có thể được sử dụng bởi người dùng thiếu chuyên môn cần thiết. Để trang bị cho khuôn khổ InstructIR khả năng hiểu các hướng dẫn đa dạng, mô hình sử dụng GPT-4, một mô hình ngôn ngữ lớn để tạo yêu cầu đa dạng, với các hướng dẫn không rõ ràng và không chính xác bị loại bỏ sau quá trình lọc.
Bộ Mã Hóa Văn Bản
Một bộ mã hóa văn bản được sử dụng bởi các mô hình ngôn ngữ để ánh xạ các hướng dẫn người dùng đến một biểu diễn vectơ cố định hoặc một vectơ có kích thước cố định. Thông thường, bộ mã hóa văn bản của mô hình CLIP là một thành phần quan trọng cho việc tạo hình ảnh từ văn bản và các mô hình chỉnh sửa hình ảnh dựa trên văn bản để mã hóa các hướng dẫn người dùng vì khuôn khổ CLIP vượt trội trong các hướng dẫn trực quan. Tuy nhiên, hầu hết thời gian, các hướng dẫn người dùng cho tính năng suy giảm có rất ít hoặc không có nội dung trực quan, do đó, làm cho các bộ mã hóa CLIP lớn trở nên vô ích cho những nhiệm vụ này vì nó sẽ làm giảm hiệu suất đáng kể. Để giải quyết vấn đề này, khuôn khổ InstructIR chọn một bộ mã hóa câu văn bản được đào tạo để mã hóa các câu trong một không gian nhúng có ý nghĩa. Các bộ mã hóa câu được đào tạo trước trên hàng triệu ví dụ và vẫn nhỏ gọn và hiệu quả so với các bộ mã hóa văn bản CLIP truyền thống, đồng thời có khả năng mã hóa các ngữ nghĩa của các hướng dẫn người dùng đa dạng.
Hướng Dẫn Văn Bản
Một khía cạnh quan trọng của khuôn khổ InstructIR là việc thực hiện hướng dẫn mã hóa làm cơ chế điều khiển cho mô hình hình ảnh. Dựa trên điều này và lấy cảm hứng từ việc định tuyến nhiệm vụ cho việc học nhiều nhiệm vụ, khuôn khổ InstructIR đề xuất một khối xây dựng hướng dẫn hoặc ICB để cho phép các biến đổi nhiệm vụ cụ thể trong mô hình. Định tuyến nhiệm vụ truyền thống áp dụng các mặt nạ nhị phân cụ thể nhiệm vụ cho các tính năng kênh. Tuy nhiên, vì khuôn khổ InstructIR không biết suy giảm, kỹ thuật này không được thực hiện trực tiếp. Hơn nữa, đối với các tính năng hình ảnh và hướng dẫn mã hóa, khuôn khổ InstructIR áp dụng định tuyến nhiệm vụ và tạo ra mặt nạ bằng cách sử dụng một lớp tuyến tính được kích hoạt bằng hàm sigmoid để tạo ra một tập hợp các trọng số tùy thuộc vào các nhúng văn bản, do đó nhận được một mặt nạ nhị phân c chiều cho mỗi kênh. Mô hình sau đó tăng cường các tính năng có điều kiện bằng cách sử dụng một khối NAFBlock, và sử dụng cả NAFBlock và khối điều kiện hướng dẫn để điều kiện các tính năng tại cả khối mã hóa và khối giải mã.

Mặc dù khuôn khổ InstructIR không điều kiện các bộ lọc mạng nơ-ron một cách rõ ràng, mặt nạ này giúp mô hình chọn các kênh phù hợp nhất dựa trên hướng dẫn hình ảnh và thông tin.
InstructIR: Triển Khai và Kết Quả
Mô hình InstructIR có thể được đào tạo từ đầu đến cuối, và mô hình hình ảnh không cần đào tạo trước. Chỉ có các phép chiếu nhúng văn bản và đầu phân loại cần được đào tạo. Bộ mã hóa văn bản được khởi tạo bằng cách sử dụng một bộ mã hóa BGE, một bộ mã hóa giống BERT được đào tạo trước trên một lượng lớn dữ liệu giám sát và không giám sát cho việc mã hóa câu chung. Khuôn khổ InstructIR sử dụng mô hình NAFNet làm mô hình hình ảnh, và kiến trúc của NAFNet bao gồm một bộ mã hóa và giải mã 4 cấp với số lượng khối khác nhau ở mỗi cấp. Mô hình cũng thêm 4 khối giữa vào giữa bộ mã hóa và giải mã để tăng cường các tính năng. Hơn nữa, thay vì sử dụng phép nối cho các kết nối bỏ qua, bộ giải mã thực hiện phép cộng, và mô hình InstructIR chỉ thực hiện khối điều kiện hướng dẫn hoặc ICB cho việc định tuyến nhiệm vụ chỉ trong bộ mã hóa và giải mã. Tiếp theo, mô hình InstructIR được tối ưu hóa bằng cách sử dụng sự mất mát giữa hình ảnh được khôi phục và hình ảnh sạch sẽ thực sự, và sự mất mát entropy chéo được sử dụng cho đầu phân loại ý định của bộ mã hóa văn bản. Mô hình InstructIR sử dụng bộ tối ưu hóa AdamW với kích thước lô 32 và tốc độ học 5e-4 trong khoảng 500 kỷ, và cũng thực hiện sự giảm tốc độ học theo cosine. Vì mô hình hình ảnh trong khuôn khổ InstructIR chỉ bao gồm 16 triệu tham số, và chỉ có 100 nghìn tham số dự án văn bản được học, khuôn khổ InstructIR có thể được đào tạo dễ dàng trên các GPU tiêu chuẩn, do đó giảm chi phí tính toán và tăng khả năng áp dụng.
Kết Quả Suy Giảm Đa
Đối với các suy giảm đa và khôi phục đa nhiệm, khuôn khổ InstructIR định nghĩa hai thiết lập ban đầu:
- 3D cho các mô hình suy giảm ba để giải quyết các vấn đề suy giảm như loại bỏ sương mù, giảm tiếng ồn và loại bỏ mưa.
- 5D cho các mô hình suy giảm năm để giải quyết các vấn đề suy giảm như giảm tiếng ồn hình ảnh, tăng cường ánh sáng yếu, loại bỏ sương mù, giảm tiếng ồn và loại bỏ mưa.
Hiệu suất của các mô hình 5D được minh họa trong bảng sau và so sánh với các mô hình khôi phục hình ảnh và tất cả trong một hiện đại.

Như có thể quan sát được, khuôn khổ InstructIR với một mô hình hình ảnh đơn giản và chỉ 16 triệu tham số có thể xử lý thành công năm nhiệm vụ khôi phục hình ảnh khác nhau nhờ vào hướng dẫn dựa trên hướng dẫn, và cung cấp kết quả cạnh tranh. Bảng sau minh họa hiệu suất của khuôn khổ trên các mô hình 3D, và kết quả tương đương với kết quả trên.

Điểm nổi bật chính của khuôn khổ InstructIR là khôi phục hình ảnh dựa trên hướng dẫn, và hình ảnh sau minh họa khả năng đáng kinh ngạc của mô hình InstructIR để hiểu một loạt các hướng dẫn cho một nhiệm vụ nhất định. Ngoài ra, đối với một hướng dẫn đối lập, mô hình InstructIR thực hiện một hành động không bị ép buộc.

Đầu Cuối
Khôi phục hình ảnh là một vấn đề cơ bản trong tầm nhìn máy tính vì nó nhằm mục đích khôi phục một hình ảnh chất lượng cao, sạch sẽ từ một hình ảnh bị suy giảm. Trong tầm nhìn máy tính thấp, suy giảm là một thuật ngữ được sử dụng để đại diện cho các hiệu ứng không mong muốn được quan sát trong một hình ảnh như mờ chuyển động, sương mù, tiếng ồn, phạm vi động thấp và nhiều hơn. Trong bài viết này, chúng tôi đã nói về InstructIR, khuôn khổ khôi phục hình ảnh đầu tiên trên thế giới hướng dẫn mô hình khôi phục hình ảnh bằng cách sử dụng hướng dẫn viết bằng tay của con người. Đối với các hướng dẫn ngôn ngữ tự nhiên, mô hình InstructIR có thể khôi phục hình ảnh chất lượng cao từ hình ảnh bị suy giảm và cũng xem xét các loại suy giảm khác nhau. Khuôn khổ InstructIR có khả năng cung cấp hiệu suất hiện đại trên một loạt các nhiệm vụ khôi phục hình ảnh, bao gồm loại bỏ mưa, giảm tiếng ồn, loại bỏ sương mù, làm sắc nét và tăng cường hình ảnh ánh sáng yếu.












