Mô hình và nền tảng AI

Bộ Dữ Liệu Web-Scraped cho Trí Tuệ Nhân Tạo và Quyền Riêng Tư: Tại Sao CommonPool xứng Đáng được Chú Ý

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Web-Scraped AI Datasets and Privacy: Why CommonPool Deserves a Look

Trí Tuệ Nhân Tạo (AI) đã trở thành một phần của cuộc sống hàng ngày. Nó được thể hiện trong các chương trình chatbot y tế hướng dẫn bệnh nhân và trong các công cụ tạo ra giúp đỡ nghệ sĩ, nhà văn và nhà phát triển. Những hệ thống này dường như tiên tiến, nhưng chúng phụ thuộc vào một nguồn tài nguyên thiết yếu: dữ liệu.

Phần lớn dữ liệu được sử dụng để đào tạo các hệ thống AI đến từ internet công cộng. Các chương trình tự động thu thập lượng lớn văn bản, hình ảnh và âm thanh từ các nền tảng trực tuyến. Những bộ sưu tập này tạo thành nền tảng của các mô hình nổi tiếng như GPT-4, Stable Diffusion và nhiều mô hình khác. Tuy nhiên, việc thu thập này lại gây ra những lo ngại chưa được giải quyết về quyền riêng tư, sở hữu và sự đồng ý.

Thị trường dữ liệu đào tạo phản ánh quy mô của hoạt động này. Hiện tại, giá trị toàn cầu của các bộ dữ liệu AI được ước tính là 3,2 tỷ đô la. Theo dự báo, nó có thể tăng lên 16,3 tỷ đô la vào năm 2034, với tốc độ tăng trưởng hàng năm là 20,5%. Đằng sau những con số này là một thách thức quan trọng. Một phần đáng kể của vật liệu thu thập được không có sự cho phép rõ ràng. Nó thường chứa thông tin cá nhân, tác phẩm có bản quyền và các nội dung nhạy cảm khác không được tạo ra cho các hệ thống máy học.

Để đáp ứng những vấn đề này, các phương pháp tiếp cận thay thế về quản trị dữ liệu đang được khám phá. Một ví dụ là CommonPool, được phát hành vào tháng 4 năm 2023 như một phần của DataComp benchmark. Nó là một bộ dữ liệu lớn gồm 12,8 tỷ cặp hình ảnh-văn bản được thiết kế cho nghiên cứu trí tuệ đa phương thức. Không giống như các nỗ lực thu thập dữ liệu truyền thống, nó áp dụng các phương pháp lọc, nhấn mạnh tính minh bạch và bao gồm sự tham gia của cộng đồng trong quá trình phát triển. Mặc dù nó vẫn còn gây tranh cãi, CommonPool cho thấy một nỗ lực nhằm xây dựng các thực tiễn và quy trình dữ liệu đào tạo AI có trách nhiệm và có thể kiểm toán hơn. Những sáng kiến như vậy nhấn mạnh nhu cầu về các tiêu chuẩn đạo đức trong tương lai của trí tuệ nhân tạo.

Vai Trò Của Dữ Liệu Web-Scraped Trong Việc Phát Triển Trí Tuệ Nhân Tạo

Dữ liệu là trung tâm của AI, với hiệu suất của hệ thống gắn liền với lượng và sự đa dạng của thông tin có sẵn cho đào tạo. Trong những năm gần đây, việc thu thập dữ liệu từ web đã trở thành một phương pháp tiêu chuẩn để xây dựng các bộ dữ liệu lớn với quy mô. Bằng cách thu thập nội dung trực tuyến có sẵn công khai, các nhà nghiên cứu và nhà phát triển đã có được các nguồn tài nguyên dữ liệu đa dạng và rộng lớn.

Một ví dụ phổ biến là Common Crawl, đã lưu trữ petabyte văn bản thu thập thông qua các lần thu thập hàng tháng của hơn 250 terabyte mỗi lần. Bộ dữ liệu này được sử dụng rộng rãi để đào tạo các mô hình AI dựa trên văn bản. Một ví dụ khác là LAION-5B, chứa khoảng 5,85 tỷ cặp hình ảnh-văn bản. Nó đã được sử dụng trong các ứng dụng như Stable Diffusion, có thể tạo ra hình ảnh thực tế từ các lệnh văn bản.

Các bộ dữ liệu này có giá trị vì chúng tăng cường độ chính xác của mô hình, cải thiện sự tổng quát hóa thông qua nội dung đa dạng và cho phép các nhóm nhỏ hơn, bao gồm cả các trường đại học, tham gia vào việc phát triển AI. Chỉ số AI của Stanford năm 2025 cho thấy rằng hầu hết các mô hình tiên tiến vẫn phụ thuộc vào dữ liệu thu thập, với các bộ dữ liệu đang tăng trưởng nhanh về quy mô. Sự đầu tư này cũng đã thúc đẩy sự đầu tư mạnh mẽ, đạt hơn 57 tỷ đô la vào năm 2024 cho các trung tâm dữ liệu và năng lực tính toán.

Tuy nhiên, việc thu thập dữ liệu từ web không miễn phí khỏi các thách thức. Nó đặt ra các câu hỏi về quyền riêng tư, sở hữu và quyền pháp lý, vì nhiều nội dung thu thập không được tạo ra ban đầu cho sử dụng máy. Các vụ việc tại tòa án và các cuộc thảo luận về chính sách cho thấy rằng những thách thức này đang trở nên cấp thiết hơn. Tương lai của việc thu thập dữ liệu AI sẽ phụ thuộc vào việc tìm kiếm sự cân bằng giữa tiến bộ và trách nhiệm đạo đức.

Vấn Đề Quyền Riêng Tư Với Dữ Liệu Thu Thập

Các công cụ thu thập dữ liệu từ web thu thập thông tin mà không có sự phân biệt rõ ràng giữa nội dung chung và chi tiết nhạy cảm. Cùng với văn bản và hình ảnh, chúng thường thu thập Thông Tin Cá Nhân (PII) như tên, địa chỉ email và ảnh chụp khuôn mặt.

Một kiểm toán của bộ dữ liệu CommonPool vào tháng 7 năm 2025 đã tiết lộ rằng ngay cả sau khi lọc, 0,1% mẫu vẫn chứa khuôn mặt không bị mờ, giấy tờ tùy thân và tài liệu như sơ yếu lý lịch và hộ chiếu. Mặc dù tỷ lệ này có vẻ nhỏ, nhưng ở quy mô tỷ tỷ bản ghi, nó tương đương với hàng trăm triệu cá nhân bị ảnh hưởng. Các đánh giá và kiểm toán an toàn xác nhận rằng sự hiện diện của loại vật liệu này không phải là bất thường, và rủi ro bao gồm việc đánh cắp danh tính, quấy rối nhắm vào và việc tiết lộ không mong muốn dữ liệu riêng tư.

Các vụ việc pháp lý cũng đang tăng lên khi lo ngại về quyền sở hữu và sử dụng công bằng di chuyển vào các tòa án. Giữa năm 2023 và 2024, các công ty như OpenAI và Stability AI phải đối mặt với các vụ kiện về việc sử dụng dữ liệu cá nhân và có bản quyền mà không có sự đồng ý. Vào tháng 2 năm 2025, một tòa án liên bang Hoa Kỳ đã phán quyết rằng việc đào tạo AI trên thông tin cá nhân không được cấp phép được coi là vi phạm bản quyền. Quyết định này đã khuyến khích nhiều vụ kiện tập thể hơn. Bản quyền là một vấn đề lớn khác. Nhiều bộ dữ liệu thu thập chứa sách, bài viết, nghệ thuật và mã code. Các nhà văn và nghệ sĩ cho rằng công việc của họ đang được sử dụng mà không có sự chấp thuận hoặc thanh toán. Vụ việc New York Times v. OpenAI đang đặt câu hỏi liệu các hệ thống AI có sao chép nội dung được bảo vệ một cách bất hợp pháp hay không. Các nghệ sĩ trực quan cũng đã đưa ra các khiếu nại tương tự, cho rằng AI sao chép phong cách cá nhân của họ. Vào tháng 6 năm 2025, một tòa án Hoa Kỳ đã ủng hộ một công ty AI theo quy định về sử dụng công bằng, nhưng các chuyên gia cho biết các quyết định vẫn không nhất quán và khuôn khổ pháp lý vẫn chưa rõ ràng.

Sự thiếu đồng ý trong đào tạo AI đã làm suy yếu niềm tin của công chúng. Nhiều người phát hiện ra rằng blog, tác phẩm sáng tạo hoặc mã code của họ được bao gồm trong các bộ dữ liệu mà không có kiến thức của họ. Điều này đã gây ra các lo ngại về mặt đạo đức và kêu gọi sự minh bạch hơn. Để đáp ứng, các chính phủ đang chuyển hướng tới việc giám sát chặt chẽ hơn thông qua các luật thúc đẩy sự phát triển công bằng của các mô hình AI và sử dụng dữ liệu cẩn thận.

Tại Sao Các Bộ Dữ Liệu Thu Thập Lại Khó Thay Thế

Mặc dù có những lo ngại về quyền riêng tư và đồng ý, các bộ dữ liệu thu thập vẫn cần thiết cho việc đào tạo AI. Lý do là quy mô. Các mô hình AI hiện đại yêu cầu hàng tỷ token từ văn bản, hình ảnh và các phương tiện khác. Việc xây dựng các bộ dữ liệu như vậy chỉ thông qua các nguồn được cấp phép hoặc kiểm duyệt sẽ tốn hàng trăm triệu đô la. Điều này không thực tế cho hầu hết các công ty khởi nghiệp hoặc trường đại học.

Chi phí cao không phải là thách thức duy nhất với các bộ dữ liệu được kiểm duyệt. Chúng thường thiếu sự đa dạng và tập trung vào các ngôn ngữ, khu vực hoặc cộng đồng cụ thể. Sự che phủ hẹp này làm cho các mô hình AI kém cân bằng hơn. Ngược lại, dữ liệu thu thập, mặc dù có tiếng ồn và không hoàn hảo, nhưng lại thu được một phạm vi rộng lớn hơn của các nền văn hóa, chủ đề và quan điểm. Sự đa dạng này cho phép các hệ thống AI hoạt động tốt hơn khi được áp dụng vào các tình huống thực tế.

Rủi ro, tuy nhiên, là các quy định nghiêm ngặt có thể hạn chế quyền truy cập vào dữ liệu thu thập. Nếu điều này xảy ra, các tổ chức nhỏ hơn có thể gặp khó khăn trong việc cạnh tranh. Các công ty lớn với các bộ dữ liệu riêng hoặc độc quyền, như Google (GOOGL ) hoặc Meta, sẽ tiếp tục tiến bộ. Sự mất cân bằng này có thể làm giảm cạnh tranh và làm chậm sự đổi mới mở trong AI.

Hiện tại, các bộ dữ liệu thu thập vẫn là trung tâm của nghiên cứu AI. Đồng thời, các dự án như CommonPool đang khám phá các cách để xây dựng các bộ sưu tập rộng lớn, có nguồn gốc đạo đức. Những nỗ lực này là cần thiết để giữ cho hệ sinh thái AI trở nên cởi mở, công bằng và có trách nhiệm hơn.

CommonPool: Hướng Đến Kỹ Thuật Dữ Liệu Lớn Quy Mô Có Trách Nhiệm

CommonPool là một trong những nỗ lực kỹ thuật tham vọng nhất nhằm xây dựng một bộ dữ liệu đa phương thức mở và lớn. Với khoảng 12,8 tỷ cặp hình ảnh-văn bản, nó khớp với quy mô của LAION-5B nhưng tích hợp các cơ chế kỹ thuật và quản trị mạnh mẽ hơn. Mục tiêu thiết kế chính không chỉ là tối đa hóa quy mô mà còn phù hợp với các nguyên tắc về tính tái tạo, nguồn gốc dữ liệu và tuân thủ quy định.

Quá trình xây dựng bộ dữ liệu CommonPool tuân theo một đường ống ba giai đoạn có cấu trúc. Giai đoạn đầu tiên liên quan đến việc trích xuất các mẫu thô từ các bản chụp Common Crawl thu thập giữa năm 2014 và 2022. Cả hình ảnh và văn bản liên quan, chẳng hạn như chú thích hoặc đoạn văn xung quanh, đều được thu thập. Để đánh giá sự tương đồng ngữ nghĩa, các nhà bảo trì áp dụng điểm số tương đồng dựa trên CLIP, loại bỏ các cặp có sự tương đồng yếu giữa hình ảnh và văn bản. Giai đoạn lọc sớm này giảm đáng kể tiếng ồn so với các đường ống thu thập thô.

Giai đoạn thứ hai, bộ dữ liệu trải qua quá trình loại bỏ trùng lặp lớn. Các kỹ thuật băm nhận thức và MinHash được sử dụng để xác định và loại bỏ các hình ảnh gần giống, ngăn chặn sự dư thừa trong quá trình đào tạo mô hình. Các bộ lọc bổ sung được áp dụng để loại bỏ các tệp bị hỏng, liên kết bị hỏng và hình ảnh có độ phân giải thấp. Tại thời điểm này, đường ống cũng bao gồm việc chuẩn hóa văn bản và xác định ngôn ngữ tự động, cho phép tạo ra các tập hợp con cụ thể theo miền hoặc ngôn ngữ cho nghiên cứu nhắm mục tiêu.

Giai đoạn thứ ba tập trung vào an toàn và tuân thủ. Phát hiện khuôn mặt tự động và làm mờ được áp dụng, trong khi các hình ảnh liên quan đến trẻ em và các định danh cá nhân như tên, địa chỉ email và địa chỉ bưu chính được loại bỏ. Đường ống cũng cố gắng phát hiện tài liệu có bản quyền. Mặc dù không có phương pháp tự động nào có thể đảm bảo lọc hoàn hảo ở quy mô web, những biện pháp bảo vệ này đại diện cho một cải tiến kỹ thuật đáng kể so với LAION-5B, nơi lọc chủ yếu bị giới hạn ở nội dung dành cho người lớn và các yếu tố độc hại.

Beyond việc xử lý dữ liệu, CommonPool giới thiệu một mô hình quản trị phân biệt nó với các bản phát hành bộ dữ liệu tĩnh. Nó được duy trì như một bộ dữ liệu sống với các bản phát hành có phiên bản, siêu dữ liệu có cấu trúc và chu kỳ cập nhật được ghi lại. Mỗi mẫu bao gồm thông tin cấp phép khi có sẵn, hỗ trợ tuân thủ các quy định về bản quyền. Một giao thức gỡ bỏ cho phép các cá nhân và tổ chức yêu cầu loại bỏ nội dung nhạy cảm, giải quyết các lo ngại được đặt ra bởi Đạo luật AI của EU và các khuôn khổ quy định liên quan. Siêu dữ liệu như URL nguồn và điểm số lọc cải thiện tính minh bạch và tính tái tạo, cho phép các nhà nghiên cứu theo dõi các quyết định về việc bao gồm và loại trừ.

Kết quả từ sáng kiến DataComp minh họa các tác động kỹ thuật của những lựa chọn thiết kế này. Khi các kiến trúc thị giác-ngôn ngữ giống hệt được đào tạo trên LAION-5B và CommonPool, sau đó tạo ra các mô hình có hiệu suất ổn định hơn, đặc biệt là trên các nhiệm vụ thu hồi và phân loại không có dấu hiệu. Những kết quả này cho thấy rằng chất lượng sắp xếp cao hơn của CommonPool bù đắp cho một số lợi thế về quy mô của các bộ dữ liệu lọc ít hơn. Tuy nhiên, các cuộc kiểm toán độc lập vào năm 2025 đã tiết lộ các rủi ro còn lại: khoảng 0,1% bộ dữ liệu vẫn chứa khuôn mặt không bị mờ, tài liệu cá nhân nhạy cảm và hồ sơ y tế. Điều này nhấn mạnh giới hạn của thậm chí các đường ống lọc tự động tiên tiến.

Tổng thể, CommonPool đại diện cho một sự thay đổi trong kỹ thuật bộ dữ liệu từ việc ưu tiên quy mô thô sang cân bằng quy mô, chất lượng và tuân thủ. Đối với các nhà nghiên cứu, nó cung cấp một nền tảng tái tạo và an toàn hơn cho việc tiền đào tạo quy mô lớn. Đối với các nhà quản lý, nó chứng minh rằng các cơ chế bảo vệ quyền riêng tư và trách nhiệm có thể được nhúng trực tiếp vào quá trình xây dựng bộ dữ liệu. Ngược lại với LAION, CommonPool minh họa cách các đường ống lọc, các thực tiễn quản trị và các khuôn khổ đánh giá có thể biến dữ liệu web lớn thành một nguồn tài nguyên kỹ thuật mạnh mẽ và có trách nhiệm hơn cho AI đa phương thức.

So Sánh CommonPool Với Các Bộ Dữ Liệu Web-Scraped Truyền Thống

Không giống như các bộ dữ liệu web-scraped lớn trước đó như LAION-5B (5,85 tỷ mẫu), COYO-700M (700M mẫu) và WebLI (400M mẫu), CommonPool nhấn mạnh cấu trúc, tính tái tạo và quản trị. Nó giữ lại siêu dữ liệu như URL và dấu thời gian, hỗ trợ khả năng theo dõi và kiểm tra cấp phép một phần. Ngoài ra, nó áp dụng lọc ngữ nghĩa dựa trên CLIP để loại bỏ các cặp hình ảnh-văn bản chất lượng thấp hoặc không tương đồng, dẫn đến chất lượng dữ liệu được cải thiện.

So sánh, LAION-5B và COYO được xây dựng từ Common Crawl với việc lọc hạn chế và không có tài liệu cấp phép chi tiết. Những bộ dữ liệu này thường chứa tài liệu nhạy cảm, bao gồm hồ sơ y tế, giấy tờ tùy thân và khuôn mặt không bị mờ. WebLI, được sử dụng nội bộ bởi OpenAI, cũng thiếu tính minh bạch, vì nó không được phát hành cho đánh giá hoặc sao chép bên ngoài.

CommonPool tìm cách giải quyết những vấn đề này bằng cách loại bỏ Thông Tin Cá Nhân (PII) và Nội Dung Không Phù Hợp (NSFW), trong khi vẫn thừa nhận rằng sự đồng ý của người dùng vẫn chưa được giải quyết. Điều này làm cho nó trở nên đáng tin cậy và phù hợp về mặt đạo đức hơn so với các lựa chọn thay thế trước đó.

Kết Luận

Sự phát triển của CommonPool phản ánh một sự chuyển đổi quan trọng trong cách các bộ dữ liệu AI lớn được hình thành và duy trì. Trong khi các bộ sưu tập trước đó như LAION-5B và COYO ưu tiên quy mô với sự giám sát hạn chế, CommonPool chứng minh rằng tính minh bạch, lọc và quản trị có thể được tích hợp vào việc xây dựng bộ dữ liệu mà không làm suy yếu khả năng sử dụng cho nghiên cứu.

Bằng cách giữ lại siêu dữ liệu, áp dụng các kiểm tra sắp xếp ngữ nghĩa và nhúng các biện pháp bảo vệ quyền riêng tư, nó cung cấp một nguồn tài nguyên tái tạo và có trách nhiệm hơn. Đồng thời, các cuộc kiểm toán độc lập nhắc nhở chúng ta rằng các biện pháp bảo vệ tự động không thể loại bỏ hoàn toàn rủi ro, nhấn mạnh nhu cầu về sự cảnh giác liên tục.

Dr. Assad Abbas, một Giáo sư Liên kết có thời hạn tại Đại học COMSATS Islamabad, Pakistan, đã nhận bằng Tiến sĩ từ Đại học North Dakota State, USA. Nghiên cứu của ông tập trung vào các công nghệ tiên tiến, bao gồm điện toán đám mây, sương mù và cạnh, phân tích dữ liệu lớn và AI. Dr. Abbas đã có những đóng góp đáng kể với các ấn phẩm trên các tạp chí khoa học và hội nghị uy tín. Ông cũng là người sáng lập của MyFastingBuddy.