Mô hình và nền tảng AI
Tiền tệ hóa Nghiên cứu cho Huấn luyện Trí tuệ Nhân tạo: Rủi ro và Thực tiễn Tốt nhất
Khi nhu cầu về trí tuệ nhân tạo tạo ra tăng trưởng, nhu cầu về dữ liệu chất lượng cao để huấn luyện những hệ thống này cũng tăng theo. Các nhà xuất bản học thuật đã bắt đầu tiền tệ hóa nội dung nghiên cứu của họ để cung cấp dữ liệu huấn luyện cho các mô hình ngôn ngữ lớn (LLM). Mặc dù sự phát triển này tạo ra một dòng doanh thu mới cho các nhà xuất bản và trao quyền cho trí tuệ nhân tạo để khám phá khoa học, nó cũng đặt ra những câu hỏi quan trọng về tính toàn vẹn và độ tin cậy của nghiên cứu được sử dụng. Điều này đặt ra một câu hỏi quan trọng: Liệu các tập dữ liệu được bán có đáng tin cậy không, và việc thực hành này có ý nghĩa gì đối với cộng đồng khoa học và các mô hình trí tuệ nhân tạo?
Sự trỗi dậy của các Thỏa thuận Nghiên cứu Tiền tệ hóa
Các nhà xuất bản học thuật lớn, bao gồm Wiley, Taylor & Francis và các nhà xuất bản khác, đã báo cáo về doanh thu đáng kể từ việc cấp phép nội dung của họ cho các công ty công nghệ đang phát triển các mô hình trí tuệ nhân tạo tạo ra. Ví dụ, Wiley đã tiết lộ hơn 40 triệu đô la thu nhập từ các thỏa thuận như vậy chỉ trong năm nay. Những thỏa thuận này cho phép các công ty trí tuệ nhân tạo tiếp cận với các tập dữ liệu khoa học đa dạng và rộng lớn, được cho là sẽ cải thiện chất lượng của các công cụ trí tuệ nhân tạo của họ.
Đề xuất từ các nhà xuất bản rất đơn giản: cấp phép đảm bảo các mô hình trí tuệ nhân tạo tốt hơn, mang lại lợi ích cho xã hội đồng thời thưởng cho các tác giả bằng tiền bản quyền. Mô hình kinh doanh này mang lại lợi ích cho cả các công ty công nghệ và các nhà xuất bản. Tuy nhiên, xu hướng ngày càng tăng về việc tiền tệ hóa kiến thức khoa học có rủi ro, đặc biệt khi nghiên cứu đáng ngờ xâm nhập vào các tập dữ liệu huấn luyện trí tuệ nhân tạo.
Bóng tối của Nghiên cứu Giả
Cộng đồng học thuật không còn xa lạ với các vấn đề về nghiên cứu gian dối. Các nghiên cứu cho thấy nhiều phát hiện được công bố có khuyết điểm, thiên vị hoặc không đáng tin cậy. Một cuộc khảo sát năm 2020 đã phát hiện rằng gần một nửa số nhà nghiên cứu báo cáo về các vấn đề như báo cáo dữ liệu có chọn lọc hoặc các nghiên cứu trên lĩnh vực được thiết kế kém. Vào năm 2023, hơn 10.000 bài báo đã bị thu hồi do kết quả bị làm sai hoặc không đáng tin cậy, một con số tiếp tục tăng hàng năm. Các chuyên gia tin rằng con số này chỉ là phần nổi của tảng băng, với vô số nghiên cứu đáng ngờ đang lưu hành trong các cơ sở dữ liệu khoa học.
Cuộc khủng hoảng này chủ yếu được thúc đẩy bởi “các nhà máy giấy nghiên cứu,” các tổ chức bí mật sản xuất các nghiên cứu bị làm sai, thường là để đáp ứng áp lực học thuật ở các khu vực như Trung Quốc, Ấn Độ và Đông Âu. Người ta ước tính rằng khoảng 2% số bài báo được gửi đến các tạp chí trên toàn cầu đến từ các nhà máy giấy. Những bài báo giả này có thể trông giống như nghiên cứu hợp pháp nhưng bị riddled với dữ liệu giả và kết luận không có căn cứ. Điều đáng lo ngại là những bài báo như vậy có thể lọt qua quá trình đánh giá đồng nghiệp và kết thúc trong các tạp chí được kính trọng, làm tổn hại đến độ tin cậy của các thông tin khoa học. Ví dụ, trong đại dịch COVID-19, các nghiên cứu bị lỗi về ivermectin đã gợi ý sai về hiệu quả của nó như một phương pháp điều trị, gây ra sự混乱 và làm chậm lại các phản ứng y tế công cộng hiệu quả. Ví dụ này làm nổi bật tác hại tiềm ẩn của việc lan truyền nghiên cứu không đáng tin cậy, nơi các kết quả bị lỗi có thể có tác động đáng kể.
Hậu quả đối với Huấn luyện Trí tuệ Nhân tạo và Độ tin cậy
Các tác động là sâu sắc khi các mô hình LLM được huấn luyện trên các cơ sở dữ liệu chứa nghiên cứu gian dối hoặc chất lượng thấp. Các mô hình trí tuệ nhân tạo sử dụng các mẫu và mối quan hệ trong dữ liệu huấn luyện để tạo ra đầu ra. Nếu dữ liệu đầu vào bị lỗi, đầu ra có thể tiếp tục các sai sót hoặc thậm chí khuếch đại chúng. Rủi ro này đặc biệt cao trong các lĩnh vực như y học, nơi các thông tin trí tuệ nhân tạo tạo ra không chính xác có thể có hậu quả nguy hiểm đến tính mạng.
Hơn nữa, vấn đề này đe dọa đến niềm tin của công chúng vào học thuật và trí tuệ nhân tạo. Khi các nhà xuất bản tiếp tục ký kết các thỏa thuận, họ phải giải quyết các lo ngại về chất lượng của dữ liệu được bán. Việc không làm như vậy có thể làm tổn hại đến uy tín của cộng đồng khoa học và làm suy yếu các lợi ích tiềm năng của trí tuệ nhân tạo.
Đảm bảo Dữ liệu Tin cậy cho Trí tuệ Nhân tạo
Giảm thiểu rủi ro của nghiên cứu bị lỗi làm gián đoạn quá trình huấn luyện trí tuệ nhân tạo đòi hỏi sự hợp tác chung từ các nhà xuất bản, công ty trí tuệ nhân tạo, nhà phát triển, nhà nghiên cứu và cộng đồng rộng lớn hơn. Các nhà xuất bản phải cải thiện quá trình đánh giá đồng nghiệp để bắt được các nghiên cứu không đáng tin cậy trước khi chúng vào các tập dữ liệu huấn luyện. Cung cấp phần thưởng tốt hơn cho các reviewer và thiết lập tiêu chuẩn cao hơn có thể giúp. Một quá trình đánh giá mở là rất quan trọng ở đây. Nó mang lại sự minh bạch và trách nhiệm, giúp xây dựng niềm tin vào nghiên cứu.
Các công ty trí tuệ nhân tạo phải cẩn thận hơn khi hợp tác với các nhà xuất bản để thu thập nghiên cứu cho huấn luyện trí tuệ nhân tạo. Chọn các nhà xuất bản và tạp chí có uy tín về nghiên cứu chất lượng cao, được đánh giá tốt là rất quan trọng. Trong bối cảnh này, việc xem xét kỹ lưỡng hồ sơ của một nhà xuất bản — như tần suất họ thu hồi bài báo hoặc mức độ minh bạch trong quá trình đánh giá — là điều cần thiết. Việc chọn lọc giúp cải thiện độ tin cậy của dữ liệu và xây dựng niềm tin trong cộng đồng trí tuệ nhân tạo và nghiên cứu.
Các nhà phát triển trí tuệ nhân tạo cần phải chịu trách nhiệm về dữ liệu họ sử dụng. Điều này có nghĩa là làm việc với các chuyên gia, kiểm tra cẩn thận nghiên cứu và so sánh kết quả từ nhiều nghiên cứu. Các công cụ trí tuệ nhân tạo cũng có thể được thiết kế để xác định dữ liệu đáng ngờ và giảm thiểu rủi ro của nghiên cứu đáng ngờ lan truyền.
Minh bạch cũng là một yếu tố quan trọng. Các nhà xuất bản và công ty trí tuệ nhân tạo nên chia sẻ công khai chi tiết về cách nghiên cứu được sử dụng và nơi tiền bản quyền đi. Các công cụ như Trình theo dõi Thỏa thuận Cấp phép Trí tuệ Nhân tạo Tạo ra cho thấy tiềm năng nhưng cần có sự áp dụng rộng rãi hơn. Các nhà nghiên cứu cũng nên có tiếng nói trong việc sử dụng công việc của họ. Các chính sách đồng ý tham gia, như những chính sách từ Cambridge University Press, cung cấp cho các tác giả quyền kiểm soát đóng góp của họ. Điều này xây dựng niềm tin, đảm bảo công bằng và khiến các tác giả tích cực tham gia vào quá trình này.
Hơn nữa, việc tiếp cận mở với nghiên cứu chất lượng cao nên được khuyến khích để đảm bảo sự bao gồm và công bằng trong phát triển trí tuệ nhân tạo. Các chính phủ, tổ chức phi lợi nhuận và các bên tham gia ngành công nghiệp có thể tài trợ cho các sáng kiến mở để giảm sự phụ thuộc vào các nhà xuất bản thương mại cho các tập dữ liệu huấn luyện quan trọng. Trên hết, ngành công nghiệp trí tuệ nhân tạo cần có quy tắc rõ ràng về việc thu thập dữ liệu một cách đạo đức. Bằng cách tập trung vào nghiên cứu đáng tin cậy, được đánh giá tốt, chúng ta có thể xây dựng các công cụ trí tuệ nhân tạo tốt hơn, bảo vệ tính toàn vẹn khoa học và duy trì niềm tin của công chúng vào khoa học và công nghệ.
Kết luận
Tiền tệ hóa nghiên cứu cho huấn luyện trí tuệ nhân tạo mang lại cả cơ hội và thách thức. Mặc dù việc cấp phép nội dung học thuật cho phép phát triển các mô hình trí tuệ nhân tạo mạnh mẽ hơn, nó cũng đặt ra lo ngại về tính toàn vẹn và độ tin cậy của dữ liệu được sử dụng. Nghiên cứu bị lỗi, bao gồm cả nghiên cứu từ “các nhà máy giấy,” có thể làm hỏng các tập dữ liệu huấn luyện trí tuệ nhân tạo, dẫn đến sự không chính xác có thể làm suy yếu niềm tin của công chúng và lợi ích tiềm năng của trí tuệ nhân tạo. Để đảm bảo các mô hình trí tuệ nhân tạo được xây dựng trên dữ liệu đáng tin cậy, các nhà xuất bản, công ty trí tuệ nhân tạo và nhà phát triển phải làm việc cùng nhau để cải thiện các quy trình đánh giá đồng nghiệp, tăng cường minh bạch và ưu tiên nghiên cứu chất lượng cao, được kiểm tra kỹ lưỡng. Bằng cách làm như vậy, chúng ta có thể bảo vệ tương lai của trí tuệ nhân tạo và duy trì tính toàn vẹn của cộng đồng khoa học.












