Mô hình và nền tảng AI
Các nhà nghiên cứu sử dụng trí tuệ nhân tạo để điều tra cách phản ánh khác với hình ảnh gốc

Các nhà nghiên cứu tại Đại học Cornell gần đây đã sử dụng các hệ thống học máy để điều tra cách phản ánh của hình ảnh khác với hình ảnh gốc. Theo ScienceDaily, các thuật toán được tạo bởi nhóm nghiên cứu đã tìm thấy những dấu hiệu đặc trưng, sự khác biệt từ hình ảnh gốc, cho thấy hình ảnh đã được lật hoặc phản ánh.
Giáo sư phụ tá khoa học máy tính tại Cornell Tech, Noah Snavely, là tác giả chính của nghiên cứu. Theo Snavely, dự án nghiên cứu bắt đầu khi các nhà nghiên cứu trở nên tò mò về cách hình ảnh khác nhau theo những cách rõ ràng và tinh tế khi chúng được phản ánh. Snavely giải thích rằng ngay cả những thứ có vẻ rất đối xứng tại đầu tiên cũng có thể được phân biệt là một phản ánh khi nghiên cứu. “Tôi bị thu hút bởi những khám phá bạn có thể thực hiện với những cách mới để thu thập thông tin,” Snavely nói, theo ScienceDaily.
Các nhà nghiên cứu tập trung vào hình ảnh của con người, sử dụng chúng để đào tạo thuật toán của họ. Điều này được thực hiện vì khuôn mặt không có vẻ rõ ràng không đối xứng. Khi được đào tạo trên dữ liệu phân biệt hình ảnh lật với hình ảnh gốc, trí tuệ nhân tạo đạt được độ chính xác từ 60% đến 90% trên các loại hình ảnh khác nhau.
Nhiều dấu hiệu trực quan của hình ảnh lật mà trí tuệ nhân tạo học được là khá tinh tế và khó khăn cho con người phân biệt khi nhìn vào hình ảnh lật. Để hiểu rõ hơn về các tính năng mà trí tuệ nhân tạo sử dụng để phân biệt giữa hình ảnh lật và hình ảnh gốc, các nhà nghiên cứu đã tạo ra một bản đồ nhiệt. Bản đồ nhiệt cho thấy các vùng của hình ảnh mà trí tuệ nhân tạo tập trung vào. Theo các nhà nghiên cứu, một trong những manh mối phổ biến nhất mà trí tuệ nhân tạo sử dụng để phân biệt hình ảnh lật là văn bản. Điều này không có gì ngạc nhiên, và các nhà nghiên cứu đã loại bỏ hình ảnh chứa văn bản khỏi tập dữ liệu đào tạo của họ để có được ý tưởng tốt hơn về những sự khác biệt tinh tế hơn giữa hình ảnh lật và hình ảnh gốc.
Sau khi loại bỏ hình ảnh chứa văn bản khỏi tập dữ liệu đào tạo, các nhà nghiên cứu đã tìm thấy rằng phân loại trí tuệ nhân tạo tập trung vào các tính năng của hình ảnh như cúc áo, điện thoại di động, đồng hồ đeo tay và khuôn mặt. Một số tính năng này có mẫu rõ ràng và đáng tin cậy mà trí tuệ nhân tạo có thể tập trung vào, chẳng hạn như thực tế là mọi người thường mang điện thoại di động ở tay phải và các nút trên cúc áo thường ở bên trái. Tuy nhiên, các tính năng khuôn mặt thường rất đối xứng với sự khác biệt nhỏ và rất khó cho người quan sát phát hiện.
Các nhà nghiên cứu đã tạo ra một bản đồ nhiệt khác cho thấy các khu vực của khuôn mặt mà trí tuệ nhân tạo tập trung vào. Trí tuệ nhân tạo thường sử dụng mắt, tóc và râu của mọi người để phát hiện hình ảnh lật. Vì lý do không rõ ràng, mọi người thường nhìn slightly sang trái khi họ có ảnh chụp. Về lý do tại sao tóc và râu là chỉ số của hình ảnh lật, các nhà nghiên cứu không chắc chắn nhưng họ suy đoán rằng sự thuận tay của một người có thể được tiết lộ bởi cách họ cạo hoặc chải tóc. Mặc dù những chỉ số này có thể không đáng tin cậy, nhưng bằng cách kết hợp nhiều chỉ số lại với nhau, các nhà nghiên cứu có thể đạt được sự tự tin và chính xác cao hơn.
Cần phải thực hiện nhiều nghiên cứu hơn theo hướng này, nhưng nếu những phát hiện là nhất quán và đáng tin cậy thì nó có thể giúp các nhà nghiên cứu tìm ra những cách hiệu quả hơn để đào tạo các thuật toán học máy. Trí tuệ nhân tạo về tầm nhìn máy tính thường được đào tạo bằng cách sử dụng phản ánh của hình ảnh, vì đó là một cách nhanh chóng và hiệu quả để tăng số lượng dữ liệu đào tạo có sẵn. Có thể rằng phân tích cách phản ánh hình ảnh khác nhau có thể giúp các nhà nghiên cứu về học máy hiểu rõ hơn về những thiên vị hiện diện trong các mô hình học máy có thể gây ra sự phân loại không chính xác hình ảnh.
Khi Snavely được trích dẫn bởi ScienceDaily:
“Điều này dẫn đến một câu hỏi mở cho cộng đồng tầm nhìn máy tính, đó là, khi nào thì việc lật để tăng tập dữ liệu là được phép, và khi nào thì không? Tôi hy vọng điều này sẽ khiến mọi người suy nghĩ nhiều hơn về những câu hỏi này và bắt đầu phát triển các công cụ để hiểu cách nó đang thiên vị thuật toán.”












