Góc nhìn Anderson
Sử dụng nén JPEG để cải thiện đào tạo mạng nơ-ron

Một bài báo nghiên cứu mới từ Canada đã đề xuất một khuôn khổ mà cố ý giới thiệu nén JPEG vào sơ đồ đào tạo của một mạng nơ-ron, và đã đạt được kết quả tốt hơn – và tốt hơn khả năng chống lại các cuộc tấn công đối thủ.
Đây là một ý tưởng khá cực đoan, vì sự khôn ngoan chung hiện tại là các hiện象 JPEG, được tối ưu hóa cho việc xem của con người, và không phải cho học máy, thường có tác động có hại đối với mạng nơ-ron được đào tạo trên dữ liệu JPEG.

Một ví dụ về sự khác biệt về độ rõ ràng giữa các hình ảnh JPEG được nén ở các mức độ mất khác nhau (mức độ mất cao hơn cho phép kích thước tệp nhỏ hơn, với chi phí của sự phân biệt và băng màu trên các gradient màu, trong số các loại hiện tượng khác). Nguồn: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937
Báo cáo năm 2022 từ Đại học Maryland và Facebook AI khẳng định rằng nén JPEG ‘gây ra một hình phạt hiệu suất đáng kể’ trong đào tạo mạng nơ-ron, mặc dù công việc trước đó cho rằng mạng nơ-ron tương đối bền đối với hiện tượng nén hình ảnh.
Một năm trước khi đó, một dòng suy nghĩ mới đã xuất hiện trong văn học: rằng nén JPEG có thể thực sự được tận dụng để cải thiện kết quả đào tạo mô hình.
Tuy nhiên, mặc dù các tác giả của bài báo đó đã có thể đạt được kết quả tốt hơn trong đào tạo hình ảnh JPEG với các mức chất lượng khác nhau, nhưng mô hình họ đề xuất quá phức tạp và gánh nặng, và không thực tế. Ngoài ra, hệ thống sử dụng các thiết lập tối ưu hóa JPEG mặc định (quantization) đã chứng minh là một rào cản đối với hiệu quả đào tạo.
Một dự án sau này (2023’s JPEG Compliant Compression for DNN Vision) đã thử nghiệm với một hệ thống đã đạt được kết quả tốt hơn từ hình ảnh JPEG được nén với sự sử dụng của một mô hình mạng nơ-ron sâu (DNN) đông lạnh. Tuy nhiên, việc đông lạnh các phần của mô hình trong quá trình đào tạo có xu hướng giảm tính linh hoạt của mô hình, cũng như khả năng chống lại dữ liệu mới.
JPEG-DL
Thay vào đó, công việc mới, có tiêu đề JPEG Inspired Deep Learning, cung cấp một kiến trúc đơn giản hơn, có thể thậm chí được áp dụng cho các mô hình hiện có.
Các nhà nghiên cứu, từ Đại học Waterloo, tuyên bố:
‘Kết quả cho thấy JPEG-DL vượt trội và nhất quán so với tiêu chuẩn DL trên các kiến trúc DNN khác nhau, với sự tăng trưởng nhỏ về độ phức tạp của mô hình.
‘Cụ thể, JPEG-DL cải thiện độ chính xác phân loại lên đến 20,9% trên một số tập dữ liệu phân loại tinh, trong khi chỉ thêm 128 tham số có thể đào tạo vào đường ống DL. Hơn nữa, sự vượt trội của JPEG-DL so với tiêu chuẩn DL được chứng minh thêm bởi sự tăng cường độ bền đối thủ của các mô hình đã học và giảm kích thước tệp của hình ảnh đầu vào.’
Các tác giả cho rằng một mức chất lượng nén JPEG tối ưu có thể giúp mạng nơ-ron phân biệt chủ thể chính của hình ảnh. Trong ví dụ dưới đây, chúng ta thấy kết quả cơ bản (trái) trộn chủ thể vào nền khi các tính năng được thu thập bởi mạng nơ-ron. Ngược lại, JPEG-DL (phải) thành công trong việc phân biệt và phân biệt chủ thể của ảnh.

Thử nghiệm so sánh với các phương pháp cơ bản cho JPEG-DL. Nguồn: https://arxiv.org/pdf/2410.07081
‘Hiện tượng này,’ họ giải thích, ‘được gọi là “nén giúp” trong bài báo năm 2021, được chứng minh bằng thực tế rằng nén có thể loại bỏ tiếng ồn và các tính năng nền gây khó chịu, do đó làm nổi bật đối tượng chính trong hình ảnh, giúp DNN làm dự đoán tốt hơn.’
Phương pháp
JPEG-DL giới thiệu một soft quantizer có thể phân biệt, thay thế cho hoạt động quantization không thể phân biệt trong một quy trình tối ưu hóa JPEG tiêu chuẩn.
Điều này cho phép tối ưu hóa dựa trên gradient của hình ảnh. Điều này không thể thực hiện được trong mã hóa JPEG thông thường, sử dụng một uniform quantizer với một hoạt động làm tròn gần nhất.
Sự phân biệt của sơ đồ JPEG-DL cho phép tối ưu hóa chung cả tham số của mô hình đào tạo và lượng hóa JPEG (nén). Tối ưu hóa chung có nghĩa là cả mô hình và dữ liệu đào tạo được điều chỉnh cho nhau trong quá trình cuối cùng, và không cần thiết phải đông lạnh các lớp.
Cơ bản, hệ thống tùy chỉnh nén JPEG của một tập dữ liệu (tinh khiết) để phù hợp với logic của quá trình tổng quát hóa.

Sơ đồ khái niệm cho JPEG-DL.
Người ta có thể giả định rằng dữ liệu thô sẽ là thức ăn lý tưởng cho đào tạo; sau tất cả, hình ảnh được giải nén hoàn toàn vào một không gian màu đầy đủ khi chúng được chạy trong các lô; vì vậy, sự khác biệt nào mà định dạng ban đầu làm?
Tuy nhiên, vì nén JPEG được tối ưu hóa cho việc xem của con người, nó loại bỏ các khu vực chi tiết hoặc màu sắc theo cách phù hợp với mục tiêu này. Cho một bức tranh của một hồ dưới bầu trời xanh, các mức nén tăng sẽ được áp dụng cho bầu trời, vì nó không chứa ‘chi tiết thiết yếu’.
Mặt khác, một mạng nơ-ron thiếu các bộ lọc kỳ lạ cho phép chúng ta tập trung vào các chủ thể chính. Thay vào đó, nó có khả năng xem các hiện tượng băng màu trong bầu trời như dữ liệu hợp lệ để được tích hợp vào không gian tiềm ẩn của nó.

Mặc dù một người sẽ loại bỏ băng màu trong bầu trời, trong một hình ảnh được nén mạnh (trái), một mạng nơ-ron không có ý tưởng rằng nội dung này nên được loại bỏ, và sẽ cần một hình ảnh chất lượng cao hơn (phải). Nguồn: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/
Vì vậy, một mức nén JPEG duy nhất không thể phù hợp với toàn bộ nội dung của một tập dữ liệu đào tạo, trừ khi nó đại diện cho một miền rất cụ thể. Các bức tranh của đám đông sẽ yêu cầu ít nén hơn so với một bức tranh hẹp của một con chim, ví dụ.
Các tác giả quan sát rằng những người không quen thuộc với các thách thức của lượng hóa, nhưng quen thuộc với các cơ bản của kiến trúc transformer, có thể xem các quá trình này như một hoạt động chú ý, rộng rãi.
Dữ liệu và Thử nghiệm
JPEG-DL đã được đánh giá chống lại các kiến trúc dựa trên transformer và mạng nơ-ron tích chập (CNNs). Các kiến trúc được sử dụng là EfficientFormer-L1; ResNet; VGG; MobileNet; và ShuffleNet.
Các phiên bản ResNet được sử dụng là cụ thể cho tập dữ liệu CIFAR: ResNet32, ResNet56 và ResNet110. VGG8 và VGG13 được chọn cho các thử nghiệm dựa trên VGG.
Đối với CNN, phương pháp đào tạo được dẫn xuất từ công việc năm 2020 Contrastive Representation Distillation (CRD). Đối với EfficientFormer-L1 (dựa trên transformer), phương pháp đào tạo từ Initializing Models with Larger Ones năm 2023 được sử dụng.
Đối với các nhiệm vụ tinh trong các thử nghiệm, bốn tập dữ liệu được sử dụng: Stanford Dogs; Hoa của Đại học Oxford; CUB-200-2011 (Chim CalTech); và Pets (‘Mèo và Chó’, một hợp tác giữa Đại học Oxford và Hyderabad ở Ấn Độ).
Đối với các nhiệm vụ tinh trên CNN, các tác giả đã sử dụng PreAct ResNet-18 và DenseNet-BC. Đối với EfficientFormer-L1, phương pháp được mô tả trong Initializing Models With Larger Ones đã được sử dụng.
Trên các tập dữ liệu CIFAR-100 và tinh, các mức độ lớn của Biến đổi Cosine Discrete (DCT) trong cách tiếp cận nén JPEG được xử lý bằng tối ưu hóa Adam, để điều chỉnh tốc độ học cho lớp JPEG trên các mô hình được thử nghiệm.
Trong các thử nghiệm trên ImageNet-1K, trên tất cả các thử nghiệm, các tác giả đã sử dụng PyTorch, với SqueezeNet, ResNet-18 và ResNet-34 làm mô hình lõi.
Đối với đánh giá tối ưu hóa lớp JPEG, các nhà nghiên cứu đã sử dụng Stochastic Gradient Descent (SGD) thay vì Adam, để có hiệu suất ổn định hơn. Tuy nhiên, đối với các thử nghiệm ImageNet-1K, phương pháp từ Learned Step Size Quantization năm 2019 đã được sử dụng.

Trên độ chính xác xác thực hàng đầu cho cơ bản so với JPEG-DL trên CIFAR-100, với độ lệch chuẩn và độ lệch trung bình được tính trung bình trên ba lần chạy. Dưới, độ chính xác xác thực hàng đầu trên các nhiệm vụ phân loại hình ảnh tinh trên các kiến trúc mô hình khác nhau, một lần nữa, được tính trung bình từ ba lần chạy.
Bình luận về kết quả ban đầu được minh họa ở trên, các tác giả tuyên bố:
‘Trên tất cả bảy mô hình được thử nghiệm cho CIFAR-100, JPEG-DL nhất quán cung cấp cải tiến, với lợi ích lên đến 1,53% trong độ chính xác xác thực hàng đầu. Trong các nhiệm vụ tinh, JPEG-DL cung cấp một sự tăng trưởng hiệu suất đáng kể, với cải tiến lên đến 20,90% trên tất cả các tập dữ liệu sử dụng hai mô hình khác nhau.’
Kết quả cho các thử nghiệm ImageNet-1K được hiển thị dưới đây:

Kết quả độ chính xác xác thực hàng đầu trên ImageNet trên các khung khác nhau.
Bài báo này tuyên bố:
‘Với một sự tăng trưởng nhỏ về độ phức tạp (thêm 128 tham số), JPEG-DL đạt được một lợi ích 0,31% trong độ chính xác xác thực hàng đầu cho SqueezeNetV1.1 so với cơ bản sử dụng một vòng tròn của hoạt động lượng hóa.
‘Bằng cách tăng số lượng vòng tròn lượng hóa lên năm, chúng tôi quan sát thấy một sự cải tiến thêm 0,20%, dẫn đến một lợi ích tổng thể 0,51% so với cơ bản.’
Các nhà nghiên cứu cũng đã thử nghiệm hệ thống bằng cách sử dụng dữ liệu bị tổn thương bởi các phương pháp tấn công đối thủ các cuộc tấn công hình ảnh đối thủ Fast Gradient Signed Method (FGSM) và Projected Gradient Descent (PGD).
Các cuộc tấn công được thực hiện trên CIFAR-100 trên hai mô hình:

Kết quả thử nghiệm cho JPEG-DL, chống lại hai khung tấn công đối thủ tiêu chuẩn.
Các tác giả tuyên bố:
‘Các mô hình JPEG-DL cải thiện đáng kể khả năng chống lại các cuộc tấn công đối thủ so với các mô hình DNN tiêu chuẩn, với lợi ích lên đến 15% cho FGSM và 6% cho PGD.’
Ngoài ra, như đã minh họa trước đó trong bài viết, các tác giả đã thực hiện một so sánh về các bản đồ tính năng được trích xuất bằng GradCAM++ – một khuôn khổ có thể làm nổi bật các tính năng được trích xuất theo cách trực quan.

Một minh họa GradCAM++ cho phân loại hình ảnh cơ bản và JPEG-DL, với các tính năng được trích xuất được làm nổi bật.
Bài báo này lưu ý rằng JPEG-DL tạo ra một kết quả được cải thiện, và rằng trong một trường hợp, nó thậm chí có thể phân loại một hình ảnh mà mô hình cơ bản không thể xác định. Liên quan đến hình ảnh được minh họa trước đó với các con chim, các tác giả tuyên bố:
‘Rõ ràng là các bản đồ tính năng từ mô hình JPEG-DL cho thấy sự tương phản tốt hơn giữa thông tin tiền cảnh (con chim) và nền so với các bản đồ tính năng được tạo ra bởi mô hình cơ bản.
‘Cụ thể, đối tượng tiền cảnh trong các bản đồ tính năng JPEG-DL được bao quanh bởi một đường viền rõ ràng, làm cho nó có thể phân biệt được với nền.
‘Ngược lại, các bản đồ tính năng của mô hình cơ bản cho thấy một cấu trúc trộn lẫn, nơi tiền cảnh chứa năng lượng cao hơn trong các tần số thấp, khiến nó trộn lẫn mịn với nền.’
Kết luận
JPEG-DL được thiết kế để sử dụng trong các tình huống mà dữ liệu thô có sẵn – nhưng nó sẽ rất thú vị khi xem liệu một số nguyên tắc được giới thiệu trong dự án này có thể được áp dụng cho đào tạo tập dữ liệu thông thường, trong đó nội dung có thể có chất lượng thấp hơn (như thường xảy ra với các tập dữ liệu siêu lớn được thu thập từ internet).
Như nó đứng, điều đó chủ yếu vẫn là một vấn đề chú thích, mặc dù nó đã được giải quyết trong nhận dạng hình ảnh dựa trên giao thông, và ở nơi khác.
Được xuất bản lần đầu vào thứ Năm, ngày 10 tháng 10 năm 2024












