Mô hình và nền tảng AI

Làm Thế Nào Dữ Liệu Tổng Hợp Tác Động Đến ảo Tưởng Của Trí Tuệ Nhân Tạo?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Mặc dù dữ liệu tổng hợp là một công cụ mạnh mẽ, nhưng nó chỉ có thể giảm ảo tưởng của trí tuệ nhân tạo trong các trường hợp cụ thể. Trong hầu hết các trường hợp khác, nó sẽ khuếch đại chúng. Tại sao lại như vậy? Hiện tượng này có ý nghĩa gì đối với những người đã đầu tư vào nó? 

Dữ Liệu Tổng Hợp Khác Nhau Với Dữ Liệu Thật Như Thế Nào?

Dữ liệu tổng hợp là thông tin được tạo ra bởi trí tuệ nhân tạo. Thay vì được thu thập từ các sự kiện hoặc quan sát trong thế giới thực, nó được tạo ra một cách nhân tạo. Tuy nhiên, nó giống với bản gốc đủ để tạo ra đầu ra chính xác và liên quan. Đó là ý tưởng, dù sao.  

Để tạo ra một tập dữ liệu nhân tạo, các kỹ sư trí tuệ nhân tạo đào tạo một thuật toán tạo ra trên một cơ sở dữ liệu quan hệ thực. Khi được yêu cầu, nó tạo ra một tập dữ liệu thứ hai mà phản ánh chặt chẽ tập dữ liệu đầu tiên nhưng không chứa thông tin thực sự. Mặc dù các xu hướng chung và tính chất toán học vẫn còn nguyên vẹn, nhưng có đủ nhiễu để che giấu các mối quan hệ ban đầu. 

Một tập dữ liệu được tạo ra bởi trí tuệ nhân tạo đi beyond việc ẩn danh, sao chép logic của mối quan hệ giữa các trường thay vì chỉ thay thế các trường bằng các phương tiện thay thế tương đương. Vì nó không chứa chi tiết nhận dạng, các công ty có thể sử dụng nó để tránh các quy định về quyền riêng tư và bản quyền. Hơn nữa, họ có thể chia sẻ hoặc phân phối nó một cách tự do mà không sợ vi phạm. 

Tuy nhiên, thông tin giả thường được sử dụng để bổ sung. Các doanh nghiệp có thể sử dụng nó để làm giàu hoặc mở rộng kích thước mẫu quá nhỏ, làm cho chúng đủ lớn để đào tạo các hệ thống trí tuệ nhân tạo một cách hiệu quả. 

Dữ Liệu Tổng Hợp Có Giảm ảo Tưởng Của Trí Tuệ Nhân Tạo?

Đôi khi, các thuật toán tham khảo các sự kiện không tồn tại hoặc đưa ra các đề xuất không hợp lý. Những ảo tưởng này thường vô nghĩa, đánh lạc hướng hoặc không chính xác. Ví dụ, một mô hình ngôn ngữ lớn có thể viết một bài hướng dẫn về cách thuần hóa sư tử hoặc trở thành một bác sĩ ở tuổi 6. Tuy nhiên, không phải tất cả đều cực đoan như vậy, điều này có thể làm cho việc nhận ra chúng trở nên khó khăn. 

Nếu được chăm sóc cẩn thận, dữ liệu tổng hợp có thể giảm thiểu các sự cố này. Một cơ sở dữ liệu đào tạo liên quan và chính xác là nền tảng cho bất kỳ mô hình nào, vì vậy nó có lý khi nói rằng càng có nhiều chi tiết, đầu ra của mô hình sẽ càng chính xác. Một tập dữ liệu bổ sung cho phép khả năng mở rộng, thậm chí đối với các ứng dụng ngách có thông tin công khai hạn chế. 

Loại bỏ thiên vị là một cách khác mà cơ sở dữ liệu tổng hợp có thể giảm ảo tưởng của trí tuệ nhân tạo. Theo Trường Quản lý Sloan của MIT, nó có thể giúp giải quyết vấn đề thiên vị vì nó không bị giới hạn bởi kích thước mẫu ban đầu. Các chuyên gia có thể sử dụng các chi tiết thực tế để lấp đầy khoảng trống nơi các phân khúc dân số được đại diện không đầy đủ. 

Làm Thế Nào Dữ Liệu Nhân Tạo Làm Cho ảo Tưởng Trở Nên Tồi Tệ Hơn

Vì các thuật toán thông minh không thể lý luận hoặc đặt ngữ cảnh thông tin, chúng dễ bị ảo tưởng. Các mô hình tạo ra — đặc biệt là các mô hình ngôn ngữ lớn được đào tạo trước — đặc biệt dễ bị tổn thương. Theo một số cách, các sự kiện nhân tạo làm cho vấn đề trở nên tồi tệ hơn. 

Khuếch Đại Thiên Vị

Giống như con người, trí tuệ nhân tạo có thể học và sao chép thiên vị. Nếu một cơ sở dữ liệu nhân tạo đánh giá cao một số nhóm trong khi đại diện không đầy đủ cho các nhóm khác — điều này dễ xảy ra một cách tình cờ — logic quyết định của nó sẽ bị sai lệch, ảnh hưởng tiêu cực đến độ chính xác của đầu ra. 

Một vấn đề tương tự có thể phát sinh khi các công ty sử dụng dữ liệu giả để loại bỏ thiên vị trong thế giới thực vì nó có thể không còn phản ánh thực tế. Ví dụ, vì hơn 99% các trường hợp ung thư vú xảy ra ở phụ nữ, sử dụng thông tin bổ sung để cân bằng đại diện có thể làm sai lệch chẩn đoán.

ảo Tưởng Lồng Ghép

Sự lồng ghép là một khuôn khổ xã hội học mô tả cách các nhân khẩu học như tuổi tác, giới tính, chủng tộc, nghề nghiệp và阶 lớp giao nhau. Nó phân tích cách các bản sắc xã hội chồng chéo của các nhóm dẫn đến các kết hợp độc đáo của sự phân biệt và đặc quyền.

Khi một mô hình tạo ra được yêu cầu tạo ra các chi tiết nhân tạo dựa trên những gì nó đã được đào tạo, nó có thể tạo ra các kết hợp không tồn tại trong bản gốc hoặc không hợp lý.

Ericka Johnson, một giáo sư về giới và xã hội tại Đại học Linköping, đã làm việc với một nhà khoa học máy tính để chứng minh hiện tượng này. Họ sử dụng một mạng đối lập tạo ra các phiên bản tổng hợp của số liệu điều tra dân số Hoa Kỳ từ năm 1990. 

Ngay lập tức, họ nhận thấy một vấn đề nghiêm trọng. Phiên bản nhân tạo có các danh mục có tiêu đề “vợ và độc thân” và “chưa từng kết hôn”, cả hai đều là ảo tưởng lồng ghép.

Nếu không có sự chăm sóc cẩn thận, cơ sở dữ liệu bản sao sẽ luôn đại diện quá mức cho các phân khúc dân số thống trị trong các tập dữ liệu trong khi đại diện không đầy đủ — hoặc thậm chí loại bỏ — các nhóm bị đại diện không đầy đủ. Các trường hợp ngoại lệ và các giá trị ngoại lệ có thể bị bỏ qua hoàn toàn để ủng hộ các xu hướng thống trị. 

Sự Sụp Đổ Của Mô Hình 

Sự phụ thuộc quá mức vào các mẫu và xu hướng nhân tạo dẫn đến sự sụp đổ của mô hình — nơi hiệu suất của thuật toán giảm đáng kể khi nó trở nên ít thích ứng với các quan sát và sự kiện trong thế giới thực. 

Hiện tượng này đặc biệt rõ ràng trong trí tuệ nhân tạo thế hệ tiếp theo. Sử dụng lặp đi lặp lại một phiên bản nhân tạo để đào tạo chúng dẫn đến một vòng lặp tự tiêu thụ. Một nghiên cứu cho thấy rằng chất lượng và khả năng nhớ của chúng giảm dần mà không có đủ số liệu thực tế mới trong mỗi thế hệ.

Quá Tốt 

Quá tốt là sự phụ thuộc quá mức vào dữ liệu đào tạo. Thuật toán hoạt động tốt ban đầu nhưng sẽ ảo tưởng khi được trình bày với các điểm dữ liệu mới. Dữ liệu tổng hợp có thể làm cho vấn đề này trở nên tồi tệ hơn nếu nó không phản ánh thực tế chính xác. 

Ý Nghĩa Của Việc Tiếp Tục Sử Dụng Dữ Liệu Tổng Hợp

Thị trường dữ liệu tổng hợp đang bùng nổ. Các công ty trong ngành này đã huy động được khoảng 328 triệu đô la trong năm 2022, tăng từ 53 triệu đô la vào năm 2020 — một mức tăng 518% trong chỉ 18 tháng. Điều đáng chú ý là đây chỉ là số tiền huy động công khai, có nghĩa là con số thực tế có thể cao hơn. Nó an toàn khi nói rằng các công ty đang đầu tư rất nhiều vào giải pháp này. 

Nếu các công ty tiếp tục sử dụng cơ sở dữ liệu nhân tạo mà không có sự chăm sóc cẩn thận và loại bỏ thiên vị, hiệu suất của mô hình sẽ giảm dần, làm hỏng đầu tư trí tuệ nhân tạo của họ. Kết quả có thể nghiêm trọng hơn, tùy thuộc vào ứng dụng. Ví dụ, trong lĩnh vực chăm sóc sức khỏe, sự gia tăng ảo tưởng có thể dẫn đến chẩn đoán sai hoặc kế hoạch điều trị không phù hợp, dẫn đến kết quả bệnh nhân kém hơn.

Giải Pháp Sẽ Không Liên Quan Đến Việc Trở Lại Dữ Liệu Thật

Các hệ thống trí tuệ nhân tạo cần hàng triệu, nếu không phải hàng tỷ, hình ảnh, văn bản và video để đào tạo, phần lớn trong số đó được thu thập từ các trang web công khai và biên dịch trong các tập dữ liệu mở lớn. Thật không may, các thuật toán tiêu thụ thông tin này nhanh hơn con người có thể tạo ra. Điều gì xảy ra khi chúng học mọi thứ?

Các nhà lãnh đạo doanh nghiệp lo lắng về việc va vào tường dữ liệu — điểm mà tất cả thông tin công khai trên internet đã được sử dụng hết. Nó có thể đang đến gần hơn họ nghĩ. 

Mặc dù cả số lượng văn bản trên trang web trung bình và số lượng người dùng internet đang tăng 2% đến 4% hàng năm, các thuật toán đang cạn kiệt dữ liệu chất lượng cao. Chỉ 10% đến 40% có thể được sử dụng để đào tạo mà không ảnh hưởng đến hiệu suất. Nếu xu hướng tiếp tục, kho thông tin công khai do con người tạo ra có thể cạn kiệt vào năm 2026.

Trong tất cả khả năng, ngành trí tuệ nhân tạo có thể va vào tường dữ liệu sớm hơn. Sự bùng nổ trí tuệ nhân tạo tạo ra trong những năm gần đây đã làm tăng căng thẳng về quyền sở hữu thông tin và vi phạm bản quyền. Các chủ sở hữu trang web nhiều hơn đang sử dụng Giao thức Loại trừ Robot — một tiêu chuẩn sử dụng tệp robots.txt để chặn các trình thu thập web — hoặc làm rõ rằng trang web của họ không được phép. 

Một nghiên cứu năm 2024 được công bố bởi một nhóm nghiên cứu do MIT dẫn đầu cho thấy rằng các hạn chế đối với tập dữ liệu Colossal Cleaned Common Crawl (C4) — một tập dữ liệu thu thập web lớn — đang tăng lên. Hơn 28% nguồn quan trọng nhất trong C4 đã bị hạn chế hoàn toàn. Hơn nữa, 45% C4 hiện được chỉ định là không được phép theo các điều khoản dịch vụ. 

Nếu các công ty tôn trọng các hạn chế này, sự tươi mới, liên quan và chính xác của các事 thực công khai sẽ giảm, buộc họ phải dựa vào cơ sở dữ liệu nhân tạo. Họ có thể không có nhiều lựa chọn nếu tòa án quyết định rằng bất kỳ giải pháp thay thế nào đều vi phạm bản quyền. 

Tương Lai Của Dữ Liệu Tổng Hợp Và ảo Tưởng Của Trí Tuệ Nhân Tạo 

Khi các luật bản quyền được hiện đại hóa và nhiều chủ sở hữu trang web ẩn nội dung của họ khỏi các trình thu thập web, việc tạo ra cơ sở dữ liệu nhân tạo sẽ trở nên phổ biến hơn. Các tổ chức phải chuẩn bị để đối mặt với mối đe dọa của ảo tưởng. 

Zac Amos là một nhà viết về công nghệ tập trung vào trí tuệ nhân tạo. Ông cũng là Biên tập viên Đặc sắc tại ReHack, nơi bạn có thể đọc thêm về công việc của ông.