Góc nhìn Anderson
Các Bộ Dữ Liệu AI Cấp Độ Lớn Không Được Quản Lý Có Thể Tồi Tệ Hơn Chính Mạng Internet?

Những nhà nghiên cứu từ Ireland, Vương quốc Anh và Mỹ đã cảnh báo rằng sự phát triển của các bộ dữ liệu đào tạo AI cấp độ lớn có thể lan truyền những khía cạnh tồi tệ nhất của các nguồn internet, cho rằng một bộ dữ liệu học thuật vừa được phát hành gần đây có chứa ‘hình ảnh và cặp từ gây khó chịu, khiêu dâm, định kiến độc ác, lăng mạ chủng tộc và dân tộc, và các nội dung cực kỳ vấn đề khác’.
Những nhà nghiên cứu tin rằng một làn sóng mới của các bộ dữ liệu đa phương tiện lớn không được quản lý hoặc lọc không chính xác có thể gây hại nhiều hơn trong khả năng củng cố các tác động của nội dung tiêu cực như vậy, vì các bộ dữ liệu này bảo tồn hình ảnh và nội dung khác có thể đã bị xóa khỏi các nền tảng trực tuyến thông qua khiếu nại của người dùng, kiểm duyệt địa phương hoặc thuật toán.
Họ quan sát thêm rằng có thể mất nhiều năm – trong trường hợp của bộ dữ liệu ImageNet hùng mạnh, một thập kỷ – để giải quyết các khiếu nại về nội dung bộ dữ liệu, và những sửa đổi sau này không luôn được phản ánh ngay cả trong các bộ dữ liệu mới được tạo ra từ chúng.
Bài báo, có tựa đề Các bộ dữ liệu đa phương tiện: sự căm ghét, khiêu dâm và định kiến độc ác, đến từ các nhà nghiên cứu tại Đại học College Dublin & Lero, Đại học Edinburgh, và Nhà khoa học trưởng tại nền tảng xác thực UnifyID.
Mặc dù công việc tập trung vào việc phát hành gần đây của bộ dữ liệu CLIP-filtered LAION-400M, các tác giả đang lập luận chống lại xu hướng chung của việc ném ngày càng nhiều dữ liệu vào các khuôn khổ học máy như mô hình ngôn ngữ thần kinh GPT-3, và cho rằng sự thúc đẩy tập trung vào kết quả (và thậm chí hướng tới Trí tuệ Nhân tạo Tổng quát [AGI]), đang dẫn đến việc sử dụng các nguồn dữ liệu có hại một cách tùy tiện với sự giám sát bản quyền thiếu cẩn thận; tiềm năng gây ra và thúc đẩy tổn hại; và khả năng không chỉ duy trì các dữ liệu bất hợp pháp có thể đã biến mất khỏi lĩnh vực công cộng, mà còn thực sự kết hợp các mô hình đạo đức của dữ liệu như vậy vào các triển khai AI hạ nguồn.
LAION-400M
Tháng trước, bộ dữ liệu LAION-400M đã được phát hành, bổ sung vào số lượng ngày càng tăng của các bộ dữ liệu đa phương tiện, ngôn ngữ phụ thuộc vào kho lưu trữ Common Crawl, kho này thu thập internet một cách vô tội vạ và chuyển trách nhiệm lọc và quản lý sang các dự án sử dụng nó. Bộ dữ liệu này chứa 400 triệu cặp văn bản/hình ảnh.
LAION-400M là một biến thể mã nguồn mở của bộ dữ liệu WIT (WebImageText) đóng của Google AI được phát hành vào tháng 3 năm 2021, và có các cặp văn bản-hình ảnh, nơi một hình ảnh trong cơ sở dữ liệu đã được liên kết với văn bản hoặc siêu dữ liệu đi kèm (ví dụ, văn bản thay thế của một hình ảnh trong một thư viện web). Điều này cho phép người dùng thực hiện việc thu hồi hình ảnh dựa trên văn bản, tiết lộ các mối quan hệ mà AI cơ bản đã hình thành về các lĩnh vực này (tức là ‘động vật’, ‘xe đạp’, ‘người’, ‘nam’, ‘nữ’).
Mối quan hệ giữa hình ảnh và văn bản, và sự tương tự cosine có thể nhúng thiên vị vào kết quả truy vấn, là trung tâm của lời kêu gọi cải tiến phương pháp luận của bài báo, vì các truy vấn rất đơn giản đối với cơ sở dữ liệu LAION-400M có thể tiết lộ thiên vị.
Ví dụ, hình ảnh của nữ phi hành gia tiên phong Eileen Collins trong thư viện scitkit-image có hai chú thích liên kết trong LAION-400M: ‘Đây là một bức chân dung của một phi hành gia với lá cờ Mỹ’ và ‘Đây là một bức ảnh của một người phụ nữ微笑 trong bộ đồ màu cam với lá cờ Mỹ’.

Phi hành gia Mỹ Eileen Collins nhận được hai cách hiểu khác nhau về thành tựu của cô khi là người phụ nữ đầu tiên bay vào vũ trụ dưới LAION-400M. Nguồn: https://arxiv.org/pdf/2110.01963.pdf
Những điểm tương đồng cosine được báo cáo mà làm cho bất kỳ chú thích nào trong số đó có khả năng được áp dụng đều rất gần nhau, và các tác giả cho rằng các hệ thống AI sử dụng LAION-400M có khả năng trình bày bất kỳ trong số đó như một chú thích phù hợp.
Khiêu Dâm Lại Tăng
LAION-400M đã tạo ra một giao diện có thể tìm kiếm có sẵn, nơi bỏ chọn nút ‘tìm kiếm an toàn’ tiết lộ mức độ mà hình ảnh khiêu dâm và các mối quan hệ văn bản chi phối các nhãn và lớp. Ví dụ, tìm kiếm ‘nữ tu’ (không an toàn nếu bạn sau đó tắt chế độ an toàn) trong cơ sở dữ liệu trả về kết quả chủ yếu liên quan đến kinh dị, trang phục và trang phục, với rất ít nữ tu thực sự có sẵn.
Tắt Chế độ An toàn trên cùng một tìm kiếm tiết lộ một loạt hình ảnh khiêu dâm liên quan đến thuật ngữ, điều này đẩy bất kỳ hình ảnh không khiêu dâm nào xuống trang kết quả tìm kiếm, tiết lộ mức độ mà LAION-400M đã gán trọng số lớn hơn cho hình ảnh khiêu dâm, vì chúng phổ biến cho thuật ngữ ‘nữ tu’ trong các nguồn trực tuyến.
Chế độ An toàn được kích hoạt mặc định trong giao diện tìm kiếm trực tuyến là lừa đảo, vì nó đại diện cho một lỗi giao diện người dùng, một bộ lọc sẽ không chỉ không nhất thiết được kích hoạt trong các hệ thống AI phái sinh, mà còn đã được tổng quát hóa vào miền ‘nữ tu’ theo cách không dễ dàng lọc hoặc phân biệt với kết quả SFW (an toàn cho công sở) về mặt sử dụng thuật toán.
Bài báo có các ví dụ mờ trên các thuật ngữ tìm kiếm khác nhau trong tài liệu phụ ở cuối. Họ không thể được trình bày ở đây do ngôn ngữ trong văn bản đi kèm với các bức ảnh mờ, nhưng các nhà nghiên cứu lưu ý đến gánh nặng mà việc kiểm tra và làm mờ các hình ảnh đã gây ra cho họ, và thừa nhận thách thức của việc quản lý tài liệu như vậy cho giám sát của con người đối với các cơ sở dữ liệu lớn:
‘Chúng tôi (cũng như các đồng nghiệp đã giúp đỡ chúng tôi) đã trải qua các mức độ khó chịu, buồn nôn và đau đầu khác nhau trong quá trình kiểm tra bộ dữ liệu. Ngoài ra, công việc này gặp phải sự chỉ trích tiêu cực đáng kể trên toàn bộ lĩnh vực học thuật AI khi phát hành, điều này không chỉ thêm một gánh nặng cảm xúc cho nhiệm vụ nặng nề đã изуч và phân tích các bộ dữ liệu như vậy, mà còn ngăn cản công việc tương tự trong tương lai, điều này có hại cho lĩnh vực AI và xã hội nói chung.’
Các nhà nghiên cứu cho rằng trong khi việc quản lý của con người trong vòng lặp là tốn kém và có chi phí cá nhân, các hệ thống lọc tự động được thiết kế để loại bỏ hoặc giải quyết các tài liệu như vậy rõ ràng không đủ cho nhiệm vụ, vì các hệ thống NLP gặp khó khăn trong việc cô lập hoặc tính toán tài liệu xúc phạm có thể chiếm ưu thế trong một bộ dữ liệu thu thập, và sau đó được coi là đáng kể do khối lượng lớn.
Thiết Lập Nội Dung Banned và Loại Bỏ Bảo Vệ Bản Quyền
Bài báo lập luận rằng các bộ dữ liệu không được quản lý như vậy có khả năng cao sẽ lan truyền việc khai thác các cá nhân thiểu số, và giải quyết vấn đề liệu các dự án dữ liệu mã nguồn mở có quyền, về mặt pháp lý hoặc đạo đức, để chuyển trách nhiệm về tài liệu cho người dùng cuối:
‘Cá nhân có thể xóa dữ liệu của họ từ một trang web và giả định rằng nó đã biến mất mãi mãi, trong khi nó vẫn có thể tồn tại trên máy chủ của nhiều nhà nghiên cứu và tổ chức. Có một câu hỏi về việc ai chịu trách nhiệm xóa dữ liệu đó khỏi việc sử dụng trong bộ dữ liệu? Đối với LAION-400M, các nhà tạo ra đã ủy thác nhiệm vụ này cho người dùng bộ dữ liệu. Dữ liệu cho rằng các quy trình này được thực hiện phức tạp và người dùng trung bình thiếu kiến thức kỹ thuật để xóa dữ liệu, liệu đây có phải là một cách tiếp cận hợp lý?’
Họ lập luận thêm rằng LAION-400M có thể không phù hợp để phát hành dưới mô hình giấy phép Creative Common CC-BY 4.0 được áp dụng, mặc dù có tiềm năng lợi ích cho việc dân chủ hóa các bộ dữ liệu lớn, trước đây chỉ thuộc phạm vi của các công ty lớn như Google và OpenAI.

Miền LAION-400M khẳng định rằng hình ảnh trong bộ dữ liệu ‘được bảo vệ bởi bản quyền của riêng họ’ – một cơ chế ‘truyền qua’ chủ yếu được kích hoạt bởi các bản án và hướng dẫn của chính phủ trong những năm gần đây, rộng rãi phê chuẩn việc thu thập web cho mục đích nghiên cứu. Nguồn: https://rom1504.github.io/clip-retrieval/
Các tác giả đề xuất rằng các tình nguyện viên có thể giải quyết một số vấn đề của bộ dữ liệu, và các nhà nghiên cứu có thể phát triển các kỹ thuật lọc cải tiến.
‘Tuy nhiên, quyền của chủ thể dữ liệu vẫn chưa được giải quyết. Đó là một việc bất cẩn và nguy hiểm khi đánh giá thấp những tác hại vốn có trong các bộ dữ liệu lớn như vậy và khuyến khích sử dụng chúng trong các môi trường công nghiệp và thương mại. Trách nhiệm của chương trình giấy phép mà bộ dữ liệu được cung cấp thuộc về nhà tạo ra bộ dữ liệu.’
Các Vấn Đề Của Việc Dân Chủ Hóa Dữ Liệu Cấp Độ Lớn
Bài báo lập luận rằng các bộ dữ liệu visio-ngôn ngữ như LAION-400M trước đây không có sẵn ngoài các công ty công nghệ lớn và số lượng hạn chế các cơ sở nghiên cứu có đủ tài nguyên để thu thập, quản lý và xử lý chúng. Họ chào đón tinh thần của bản phát hành mới, trong khi chỉ trích việc thực hiện.
Những tác giả cho rằng định nghĩa được chấp nhận của ‘dân chủ hóa’, khi áp dụng cho các bộ dữ liệu mã nguồn mở cấp độ lớn, quá hạn chế, và ‘không tính đến quyền, phúc lợi và lợi ích của các cá nhân và cộng đồng dễ bị tổn thương, những người có khả năng sẽ bị ảnh hưởng nặng nề nhất bởi các tác động hạ nguồn của bộ dữ liệu này và các mô hình được đào tạo trên nó’.
Vì sự phát triển của các mô hình mở GPT-3 quy mô được thiết kế để phân phối cho hàng triệu (và bằng proxy, có thể hàng tỷ) người dùng trên toàn thế giới, và vì các dự án nghiên cứu có thể áp dụng các bộ dữ liệu trước khi chúng được chỉnh sửa hoặc thậm chí xóa, lan truyền bất kỳ vấn đề nào được thiết kế để được giải quyết trong các sửa đổi, các tác giả lập luận rằng việc phát hành không cẩn thận các bộ dữ liệu không được quản lý không nên trở thành một tính năng thường xuyên trong học máy mã nguồn mở.
Đặt Genie Trở Lại Vào Chai
Một số bộ dữ liệu đã bị đàn áp lâu sau khi nội dung của chúng đã đi qua, có thể không thể tách rời, vào các dự án AI dài hạn, đã bao gồm bộ dữ liệu Duke MTMC (Đa Mục Tiêu, Đa Máy Ảnh), cuối cùng đã bị rút lại do lo lắng lặp đi lặp lại từ các tổ chức nhân quyền về việc sử dụng của chúng bởi các chính quyền đàn áp ở Trung Quốc; Microsoft Celeb (MS-Celeb-1M), một bộ dữ liệu 10 triệu hình ảnh ‘người nổi tiếng’ mặt, đã phát hiện ra bao gồm các nhà báo, nhà hoạt động, nhà hoạch định chính sách và nhà văn, những người đã bị chỉ trích nặng nề vì việc phơi bày dữ liệu sinh trắc học trong bản phát hành; và bộ dữ liệu Tiny Images, đã bị rút lại vào năm 2020 vì ‘thiên vị, hình ảnh và ngôn từ xúc phạm’.
Về các bộ dữ liệu đã được sửa đổi thay vì bị rút lại sau khi bị chỉ trích, các ví dụ bao gồm bộ dữ liệu ImageNet phổ biến, mà các nhà nghiên cứu lưu ý, đã mất mười năm (2009-2019) để giải quyết các chỉ trích lặp đi lặp lại về quyền riêng tư và các lớp không có hình ảnh.
Bài báo quan sát rằng LAION-400M thực sự đặt thậm chí những cải tiến chậm chạp này trở lại, bằng cách ‘phần lớn bỏ qua’ những sửa đổi được đề cập trong đại diện của ImageNet trong bản phát hành mới, và nghi ngờ một xu hướng rộng lớn hơn trong khía cạnh này*:
‘Điều này được nhấn mạnh trong sự xuất hiện của các bộ dữ liệu lớn hơn như bộ dữ liệu hình ảnh ML của Tencent (vào tháng 2 năm 2020) bao gồm hầu hết các lớp không có hình ảnh này, sự sẵn có liên tục của các mô hình được đào tạo trên toàn bộ bộ dữ liệu ImageNet-21k trong các kho lưu trữ như TF-hub, việc sử dụng liên tục bộ dữ liệu ImageNet-21k không được lọc trong các mô hình SotA mới nhất (như EfficientNetV2 và mô hình CoAtNet của Google) và các thông báo rõ ràng cho phép sử dụng bộ dữ liệu ImageNet-21k không được lọc trong các cuộc thi uy tín như Thử thách LVIS 2021.
‘Chúng tôi nhấn mạnh quan sát quan trọng này: Một đội có uy tín như ImageNet quản lý ít hơn 15 triệu hình ảnh đã gặp khó khăn và thất bại trong những nỗ lực giải độc như vậy cho đến nay.
‘Quy mô của những nỗ lực cẩn thận cần thiết để giải độc hoàn toàn bộ dữ liệu đa phương tiện khổng lồ này và các mô hình hạ nguồn được đào tạo trên bộ dữ liệu này, bao gồm hàng tỷ cặp hình ảnh-văn bản, sẽ vô cùng khổng lồ.’
* Tôi đã chuyển đổi các chú thích nội dòng của tác giả thành liên kết.












