Góc nhìn Anderson

Dạy AI hiểu và sử dụng hình ảnh trong đối thoại

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Những nhà nghiên cứu từ Hàn Quốc đã phát triển một bộ dữ liệu được thiết kế để hỗ trợ nghiên cứu về cách AI hiểu cách con người sử dụng hình ảnh trong đối thoại, và giúp các mô hình ngôn ngữ tự nhiên tham gia vào sự phát triển gần đây này trong giao tiếp của con người.

Bài báo này, từ KAIST tại Daedeok Innopolis, lưu ý rằng nghiên cứu về các hệ thống đối thoại đa phương thức trong thập kỷ qua đã bị hạn chế bởi các bộ dữ liệu và phương pháp tập trung vào các lĩnh vực ngoại vi như trả lời câu hỏi hình ảnhtiêu đề hình ảnh.

Trong những cách tiếp cận cũ hơn, hình ảnh được đánh giá ngoài ngữ cảnh của cuộc trò chuyện, không có sự hiểu biết về cách đối thoại được cải thiện và phát triển bởi các phản hồi hình ảnh, và không có lược đồ giữa các lĩnh vực để giải mã các đóng góp của các yếu tố hình ảnh vào diễn ngôn.

Hình ảnh là các mặt hàng đối thoại hạng nhất

Nhiều cách tiếp cận trước đây đã là các sáng kiến hoặc phát triển từ bộ phận nghiên cứu AI của Microsoft, đã khảo sát chủ đề của các cuộc trò chuyện đa phương thức được bắt đầu bởi một hình ảnh, chứ không phải sử dụng hình ảnh tự do như các thành phần của đối thoại.

Để giải quyết sự thiếu hụt dữ liệu nghiên cứu, các nhà nghiên cứu Hàn Quốc đã phát triển một bộ dữ liệu gồm 45.000 trường hợp đối thoại liên quan đến việc sử dụng hình ảnh ad hoc, mà không tập trung vào hình ảnh ‘meme’ lan truyền; những thứ này, mặc dù là một lĩnh vực quan tâm trong nghiên cứu ngôn ngữ, có thể được coi là ít thách thức hơn, vì ý nghĩa của các meme lan truyền có thể được suy luận dễ dàng hơn thông qua hàng nghìn sử dụng trong ngữ cảnh trên các nền tảng truyền thông xã hội.

Phát triển minh họa như một sự thay thế cho văn bản

Để phát triển một phương pháp cho việc chuyển đổi song phương từ từ/viết thành nội dung hình ảnh, các nhà nghiên cứu Hàn Quốc đã đào tạo một hệ thống học máy để thay thế các phần của một cuộc trò chuyện dựa trên văn bản thành nội dung hình ảnh có ý nghĩa ngữ nghĩa.

Kiến trúc của hệ thống Hàn Quốc để tạo ra một bộ dữ liệu cho nghiên cứu đối thoại đa phương thức. Nguồn: https://arxiv.org/pdf/2107.08685.pdf

Kiến trúc của hệ thống Hàn Quốc để tạo ra một bộ dữ liệu cho nghiên cứu đối thoại đa phương thức. Nguồn: https://arxiv.org/pdf/2107.08685.pdf

Trước khi xử lý các cụm từ mục tiêu, việc xóa các từ dừng có thể cản trở việc dự đoán của câu tiếp theo trong cuộc trò chuyện, và việc cắt tỉa các trao đổi chất lượng thấp hơn thông qua các bộ lọc tương đồng ngữ cảnh.

Để kiểm tra tính hữu ích của bộ dữ liệu, các nhà nghiên cứu đã thiết lập một mô-đun để dự đoán lượt tiếp theo trong cuộc trò chuyện trong khi xem xét ngữ cảnh của cuộc trò chuyện và hình ảnh liên quan.

Giao diện người dùng đánh giá được sử dụng trong nghiên cứu.

Giao diện người dùng đánh giá được sử dụng trong nghiên cứu.

Năm bộ dữ liệu ngoài được sử dụng làm tài liệu cơ bản cho bộ dữ liệu 45k (được cung cấp trên GitHub). Ba trong số đó là các yếu tố dựa trên văn bản: DailyDialog, một tập hợp đa lượt dựa trên văn bản được chú thích thủ công từ năm 2017; và Facebook’s EmpatheticDialoguesPersonaChat, cả hai đều từ năm 2018. Hai bộ dữ liệu dựa trên hình ảnh được sử dụng là MS-COCO và Flicker30k.

Cặp hình ảnh/văn bản – lược đồ JSON của các cụm từ trong bộ dữ liệu, được liên kết với hình ảnh (trong ví dụ này) từ cơ sở dữ liệu hình ảnh COCO của Microsoft.

Cặp hình ảnh/văn bản – lược đồ JSON của các cụm từ trong bộ dữ liệu, được liên kết với hình ảnh (trong ví dụ này) từ cơ sở dữ liệu hình ảnh COCO của Microsoft.

Thay thế văn bản bằng hình ảnh cho hệ thống được cung cấp bởi mạng lưới lý luận ngữ nghĩa thị giác (VSRN) được đào tạo trước, được phát triển vào năm 2019 tại Đại học Northeastern tại Boston. VSRN được thiết lập để hoạt động trên các cụm từ được chọn thủ công từ các tập hợp dữ liệu văn bản đóng góp.

Thiết lập sự nhất quán

Sự nhất quán của các bộ dữ liệu nguồn được thiết lập bằng cách phát triển sáu sự kết hợp của mỗi bộ dữ liệu đối thoại, tương quan với các trường hợp trong mỗi bộ dữ liệu hình ảnh, và được đánh giá qua nhiều vòng bởi con người.

Đánh giá của con người dựa trên ba tiêu chí: sự nhất quán với ngữ cảnh của trao đổi; sự liên quan của hình ảnh đến khái niệm cốt lõi mà hình ảnh đang cố gắng thể hiện; và mức độ mà hình ảnh chứa các đối tượng chính từ câu mục tiêu.

Xem xét tiêu chí sau, có thể lập luận rằng lược đồ mà các nhà nghiên cứu quyết định đã phần lớn loại bỏ khả năng của các ý nghĩa hài hước,讽刺, trừu tượng hoặc siêu hình học của hình ảnh có thể được tiêm vào một cuộc trò chuyện văn bản.

Tuy nhiên, đây là một công việc tiên phong, và nó phải bắt đầu từ đâu đó, trong khi những nỗ lực đáng kể đang được thực hiện ở nơi khác trong lĩnh vực Xử lý Ngôn ngữ Tự nhiên (NLP) để lập bản đồ các trường hợp của sự讽刺, trong số các ví dụ ít cụ thể hơn về mối quan hệ hình ảnh/văn bản.

Thử nghiệm

Để thử nghiệm khuôn khổ tạo dữ liệu, các nhà nghiên cứu đã sử dụng một mô hình thu hồi ba phần dựa trên nghiên cứu Image-Chat của Facebook năm 2020. Mô-đun bao gồm Resnext-101 như một bộ mã hóa hình ảnh; BERT của Google cho bộ mã hóa văn bản; và một mô-đun kết hợp tùy chỉnh cho những thứ này.

Hệ thống đã đạt được 50,35 và 14,38 trên nhiệm vụ dự đoán câu hiện tại và câu tiếp theo, cải thiện so với đường cơ sở cho mỗi nhiệm vụ.

Sau đó, hai nhà nghiên cứu đã được giao nhiệm vụ tạo ra 100 cuộc đối thoại đa phương thức bằng cách chèn hình ảnh vào các cuộc trò chuyện một cách thủ công, và chạy hệ thống chống lại những cuộc đối thoại ‘hữu cơ’ đa phương thức này. Hệ thống đã có thể dự đoán các trao đổi hiện tại và lượt tiếp theo với sự nhận thức cao về ngữ cảnh ngay cả đối với những ví dụ ad hoc này.

Kết quả của việc thử nghiệm hệ thống tạo dữ liệu đa phương thức của Hàn Quốc, cho thấy sự tương quan cao giữa sự tương tự hình ảnh/văn bản và điểm số câu hỏi dựa trên con người trên cùng một dữ liệu.

Kết quả của việc thử nghiệm hệ thống tạo dữ liệu đa phương thức của Hàn Quốc, cho thấy sự tương quan cao giữa sự tương tự hình ảnh/văn bản và điểm số câu hỏi dựa trên con người trên cùng một dữ liệu.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai