Mô hình và nền tảng AI

Công Cụ Mới Có Thể Hiện Cho Các Nhà Nghiên Cứu Những Gì GAN Bỏ Qua Trong Một Hình Ảnh

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Gần đây, một nhóm các nhà nghiên cứu từ MIT-IBM Watson AI Lab đã tạo ra một phương pháp để hiển thị những gì một Mạng Đối Thủ Generative (GAN) bỏ qua trong một hình ảnh khi được yêu cầu tạo ra hình ảnh. Nghiên cứu này được đặt tên là Nhìn Thấy Những Gì GAN Không Thể Tạo Ra, và nó đã được trình bày gần đây tại Hội nghị Quốc tế về Thị giác Máy tính.

Mạng Đối Thủ Generative đã trở nên mạnh mẽ, tinh vi và được sử dụng rộng rãi trong vài năm qua. Chúng đã trở nên khá tốt trong việc tạo ra hình ảnh chi tiết, miễn là hình ảnh đó được giới hạn trong một khu vực tương đối nhỏ. Tuy nhiên, khi GAN được sử dụng để tạo ra hình ảnh của các cảnh và môi trường lớn hơn, chúng thường không hoạt động tốt. Trong các tình huống mà GAN được yêu cầu tạo ra hình ảnh của các cảnh đầy đủ các vật thể và đối tượng, như một đường phố đông đúc, GAN thường bỏ qua nhiều khía cạnh quan trọng của hình ảnh.

Theo MIT News, nghiên cứu này được phát triển một phần bởi David Bau, một sinh viên tốt nghiệp tại Bộ phận Điện và Khoa học Máy tính tại MIT. Bau giải thích rằng các nhà nghiên cứu thường tập trung vào việc tinh chỉnh những gì các hệ thống học máy chú ý và phân biệt cách các đầu vào nhất định có thể được ánh xạ đến các đầu ra nhất định. Tuy nhiên, Bau cũng giải thích rằng việc hiểu những dữ liệu nào bị bỏ qua bởi các mô hình học máy thường cũng quan trọng không kém, và nhóm nghiên cứu hy vọng rằng công cụ của họ sẽ khuyến khích các nhà nghiên cứu chú ý đến những dữ liệu bị bỏ qua.

Sự quan tâm của Bau đối với GAN được kích thích bởi thực tế là chúng có thể được sử dụng để điều tra bản chất hộp đen của các mạng nơ-ron và để có được trực giác về cách các mạng có thể đang suy luận. Bau trước đây đã làm việc trên một công cụ có thể xác định các cụm nhân工 cụ thể, dán nhãn chúng là chịu trách nhiệm cho việc đại diện cho các đối tượng thế giới thực như sách, đám mây và cây. Bau cũng đã có kinh nghiệm với một công cụ gọi là GANPaint, cho phép các nghệ sĩ loại bỏ và thêm các tính năng cụ thể từ ảnh bằng cách sử dụng GAN. Theo Bau, ứng dụng GANPaint đã tiết lộ một vấn đề tiềm ẩn với GAN, một vấn đề đã trở nên rõ ràng khi Bau phân tích các hình ảnh. Như Bau đã nói với MIT News:

“Người cố vấn của tôi luôn khuyến khích chúng tôi nhìn vượt ra ngoài con số và kiểm tra các hình ảnh thực tế. Khi chúng tôi nhìn, hiện tượng đó đã nhảy ra ngay: Những người đang bị bỏ qua một cách có chọn lọc.”

Khi các hệ thống học máy được thiết kế để trích xuất mẫu từ hình ảnh, chúng cũng có thể bỏ qua các mẫu liên quan. Bau và các nhà nghiên cứu khác đã thử nghiệm việc đào tạo GAN trên các cảnh trong nhà và ngoài trời khác nhau, nhưng trong tất cả các loại cảnh khác nhau, GAN đã bỏ qua các chi tiết quan trọng trong cảnh như xe hơi, biển báo đường, người, xe đạp, v.v. Điều này đúng ngay cả khi các đối tượng bị bỏ qua là quan trọng đối với cảnh đang được xem.

Đội nghiên cứu đã đưa ra giả thuyết rằng khi GAN được đào tạo trên hình ảnh, GAN có thể tìm thấy nó dễ dàng hơn để nắm bắt các mẫu của hình ảnh mà dễ dàng đại diện, chẳng hạn như các đối tượng tĩnh lớn như phong cảnh và tòa nhà. Nó học các mẫu này hơn các mẫu khó giải thích hơn, chẳng hạn như xe hơi và người. Điều này đã trở thành kiến thức chung rằng GAN thường bỏ qua các chi tiết quan trọng, có ý nghĩa khi tạo ra hình ảnh, nhưng nghiên cứu từ đội MIT có thể là lần đầu tiên GAN đã được chứng minh bỏ qua các lớp đối tượng hoàn chỉnh trong một hình ảnh.

Đội nghiên cứu lưu ý rằng có thể GAN đạt được mục tiêu số của chúng ngay cả khi bỏ qua các đối tượng mà con người quan tâm khi xem hình ảnh. Nếu hình ảnh được tạo ra bởi GAN sẽ được sử dụng để đào tạo các hệ thống phức tạp như xe tự lái, dữ liệu hình ảnh nên được kiểm tra kỹ lưỡng vì có một mối quan ngại thực sự rằng các đối tượng quan trọng như biển báo, người và các xe khác có thể bị bỏ qua trong hình ảnh. Bau giải thích rằng nghiên cứu của họ cho thấy tại sao hiệu suất của một mô hình không nên dựa chỉ trên độ chính xác:

“Chúng tôi cần hiểu những gì các mạng đang làm và không làm để đảm bảo rằng chúng đang đưa ra những lựa chọn mà chúng tôi muốn chúng đưa ra.”

Blogger và lập trình viên với chuyên môn về Machine Learning Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.