Góc nhìn Anderson

Cải Thiện Hiệu Suất Học Máy Tốt Hơn Thông Qua Kỹ Thuật Resize Hình Ảnh Dựa Trên CNN

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Nghiên cứu của Google đã đề xuất một phương pháp mới để cải thiện hiệu quả và độ chính xác của quy trình đào tạo học máy dựa trên hình ảnh bằng cách cải thiện cách thu nhỏ hình ảnh trong giai đoạn tiền xử lý.

Trong bài báo Learning to Resize Images for Computer Vision Tasks, các nhà nghiên cứu Hossein Talebi và Peyman Milanfar đã sử dụng một mạng nơ-ron tích hợp (CNN) để tạo ra một kiến trúc resize hình ảnh mới, mang lại sự cải thiện đáng kể trong kết quả nhận dạng hình ảnh trên bốn tập dữ liệu thị giác máy tính phổ biến.

Khung khổ chung cho nhận dạng và resize hình ảnh. Nguồn: https://arxiv.org/pdf/2103.09950.pdf

Khung khổ chung cho nhận dạng và resize hình ảnh. Nguồn: https://arxiv.org/pdf/2103.09950.pdf

Bài báo chỉ ra rằng các phương pháp resize hiện tại được sử dụng trong các pipeline học máy tự động đã lỗi thời và thường chỉ sử dụng các phương pháp resize cơ bản như bilinear, bicubic và nearest neighbor – những phương pháp này xử lý tất cả các pixel một cách không phân biệt.

Ngược lại, phương pháp mới này tăng cường dữ liệu hình ảnh thông qua một mạng nơ-ron tích hợp (CNN) và kết hợp đầu vào đó vào hình ảnh đã được resize, sẽ đi qua kiến trúc của mô hình.

Ràng Buộc Hình Ảnh Trong Đào Tạo AI

Để đào tạo một mô hình xử lý hình ảnh, một khuôn khổ học máy sẽ bao gồm một giai đoạn tiền xử lý, nơi các hình ảnh đa dạng về kích thước, không gian màu và độ phân giải (sẽ góp phần vào tập dữ liệu đào tạo) sẽ được cắt và resize thành các kích thước nhất quán và định dạng ổn định.

Thông thường, điều này sẽ liên quan đến việc thỏa hiệp dựa trên định dạng PNG, nơi có sự cân bằng giữa thời gian xử lý, tài nguyên, kích thước tệp và chất lượng hình ảnh.

Trong hầu hết các trường hợp, kích thước cuối cùng của hình ảnh đã được xử lý là rất nhỏ. Dưới đây, chúng ta thấy một ví dụ về hình ảnh có độ phân giải 80×80, tại đó một số tập dữ liệu deepfake sớm nhất đã được tạo ra:

Đây là độ phân giải 80x80 tại đó một số tập dữ liệu deepfake sớm nhất đã được tạo ra.

Vì khuôn mặt (và các đối tượng khác) hiếm khi phù hợp với tỷ lệ khung hình yêu cầu, các thanh đen có thể cần được thêm (hoặc không gian bị浪 phí) để đồng bộ hóa các hình ảnh, cắt giảm thêm dữ liệu hình ảnh thực sự có thể sử dụng:

Tại đây, khuôn mặt đã được trích xuất từ một khu vực hình ảnh lớn hơn cho đến khi nó được cắt một cách tiết kiệm nhất có thể để bao gồm toàn bộ khu vực khuôn mặt. Tuy nhiên, như thấy ở bên trái, một lượng lớn khu vực còn lại sẽ không được sử dụng trong quá trình đào tạo, làm tăng thêm tầm quan trọng của chất lượng hình ảnh đã được resize.

Tại đây, khuôn mặt đã được trích xuất từ một khu vực hình ảnh lớn hơn cho đến khi nó được cắt một cách tiết kiệm nhất có thể để bao gồm toàn bộ khu vực khuôn mặt. Tuy nhiên, như thấy ở bên phải, một lượng lớn khu vực còn lại sẽ không được sử dụng trong quá trình đào tạo, làm tăng thêm tầm quan trọng của chất lượng hình ảnh đã được resize.

Khi khả năng của GPU đã được cải thiện trong những năm gần đây, với thế hệ card mới của NVIDIA được trang bị lượng VRAM tăng, kích thước hình ảnh trung bình đã bắt đầu tăng, mặc dù 224×224 pixel vẫn là khá tiêu chuẩn (ví dụ, đó là kích thước của tập dữ liệu ResNet-50).

Một hình ảnh chưa được resize với độ phân giải 224x244 pixel.

Một hình ảnh chưa được resize với độ phân giải 224×244 pixel.

Đặt Batch Vào VRAM

Lý do tại sao các hình ảnh phải có cùng kích thước là vì gradient descent, phương pháp mà mô hình cải thiện theo thời gian, yêu cầu dữ liệu đào tạo thống nhất.

Lý do tại sao các hình ảnh phải nhỏ như vậy là vì chúng phải được tải (đầy đủ giải nén) vào VRAM trong quá trình đào tạo thành các batch nhỏ, thường là từ 6-24 hình ảnh mỗi batch. Quá ít hình ảnh mỗi batch, và không có đủ vật liệu nhóm để tổng quát hóa tốt, ngoài việc kéo dài thời gian đào tạo; quá nhiều, và mô hình có thể không đạt được các đặc điểm và chi tiết cần thiết (xem dưới đây).

Phần ‘tải trực tiếp’ của kiến trúc đào tạo này được gọi là không gian tiềm ẩn. Đây là nơi các tính năng được trích xuất lặp lại từ cùng một dữ liệu (tức là cùng một hình ảnh) cho đến khi mô hình đã hội tụ đến một trạng thái mà nó đã có tất cả kiến thức tổng quát hóa cần thiết để thực hiện các biến đổi trên dữ liệu chưa được xem sau này.

Quá trình này thường mất vài ngày, mặc dù nó có thể mất hơn một tháng đào tạo liên tục và không ngừng nghỉ để đạt được sự tổng quát hóa hữu ích. Sự tăng lên của kích thước VRAM chỉ hữu ích đến một mức độ nhất định, vì ngay cả những tăng nhỏ trong độ phân giải hình ảnh cũng có thể có tác động lớn đến khả năng xử lý, và các tác động liên quan đến độ chính xác có thể không luôn thuận lợi.

Sử dụng khả năng VRAM lớn hơn để chứa các batch lớn hơn cũng là một điều phúc tạp, vì tốc độ đào tạo lớn hơn thu được từ điều này có thể bị bù lại bởi kết quả kém chính xác hơn.

Do đó, vì kiến trúc đào tạo bị hạn chế như vậy, bất cứ điều gì có thể mang lại sự cải thiện trong các hạn chế hiện có của pipeline đều là một thành tựu đáng kể.

Làm Thế Nào Để Downsizing Siêu Phẩm Giúp Được

Chất lượng cuối cùng của hình ảnh sẽ được bao gồm trong tập dữ liệu đào tạo đã được chứng minh là có tác động cải thiện đến kết quả đào tạo, đặc biệt trong các nhiệm vụ nhận dạng đối tượng. Vào năm 2018, các nhà nghiên cứu từ Viện Hệ thống Thông minh Max Planck cho rằng việc chọn phương pháp lấy mẫu có tác động đáng kể đến hiệu suất và kết quả đào tạo.

Ngoài ra, công việc trước đây của Google (đồng tác giả bởi các tác giả của bài báo mới) đã tìm thấy rằng độ chính xác phân loại có thể được cải thiện bằng cách giữ kiểm soát các hiện象 nén trong hình ảnh tập dữ liệu.

Kiến trúc mạng nơ-ron tích hợp cho thuật toán downsampling được đề xuất bởi Google Research.

Kiến trúc mạng nơ-ron tích hợp cho thuật toán downsampling được đề xuất bởi Google Research.

Mô hình mạng nơ-ron tích hợp được xây dựng vào bộ resize mới kết hợp resize bilinear với một tính năng ‘skip connection’ có thể kết hợp đầu ra từ mạng đã được đào tạo vào hình ảnh đã được resize.

Không giống như một kiến trúc mã hóa/đ码 hóa thông thường, đề xuất mới có thể hoạt động không chỉ như một nút thắt cổ chai feed-forward, mà còn như một nút thắt cổ chai ngược cho việc upscale đến bất kỳ kích thước mục tiêu và/hoặc tỷ lệ khung hình nào. Ngoài ra, phương pháp lấy mẫu ‘tiêu chuẩn’ có thể được thay thế bằng bất kỳ phương pháp truyền thống nào khác, như Lanczos.

Chi Tiết Tần Số Cao

Phương pháp mới này tạo ra hình ảnh mà về cơ bản dường như ‘nướng’ các tính năng chính (sẽ được quá trình đào tạo nhận ra cuối cùng) trực tiếp vào hình ảnh nguồn. Về mặt thẩm mỹ, kết quả là không thông thường:

Phương pháp mới được áp dụng trên bốn mạng – Inception V2; DenseNet-121; ResNet-50; và MobileNet-V2. Kết quả của phương pháp resize hình ảnh của Google Research tạo ra hình ảnh với sự tích tụ pixel rõ ràng, dự đoán các tính năng chính sẽ được phân biệt trong quá trình đào tạo.

Phương pháp mới được áp dụng trên bốn mạng – Inception V2; DenseNet-121; ResNet-50; và MobileNet-V2. Kết quả của phương pháp resize hình ảnh của Google Research tạo ra hình ảnh với sự tích tụ pixel rõ ràng, dự đoán các tính năng chính sẽ được phân biệt trong quá trình đào tạo.

Các nhà nghiên cứu lưu ý rằng những thí nghiệm ban đầu này được tối ưu hóa độc quyền cho các nhiệm vụ nhận dạng hình ảnh, và rằng trong các thử nghiệm, bộ resize ‘học được’ dựa trên CNN của họ đã có thể đạt được tỷ lệ lỗi cải thiện trong các nhiệm vụ đó. Các nhà nghiên cứu dự định trong tương lai sẽ áp dụng phương pháp này cho các loại ứng dụng thị giác máy tính dựa trên hình ảnh khác.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai