Mô hình và nền tảng AI

Khi Trí Tuệ Nhân Tạo Học Những Gì Chúng Ta Không Dạy: Mặt Đen Của Hành Vi Máy

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
When AI Learns What We Don’t Teach: The Dark Side of Machine Behavior

Trí tuệ nhân tạo (AI) đã chuyển từ phòng thí nghiệm vào cuộc sống hàng ngày. Nó cung cấp năng lượng cho các công cụ tìm kiếm, lọc nội dung trên mạng xã hội, chẩn đoán bệnh và hướng dẫn xe tự lái. Những hệ thống này được thiết kế để tuân theo các quy tắc định nghĩa và học từ dữ liệu. Tuy nhiên, AI ngày càng thể hiện những hành vi không được lập trình rõ ràng. Nó xác định các lối tắt, phát triển các chiến lược ẩn và đôi khi đưa ra quyết định mà dường như không quen thuộc hoặc thậm chí không hợp lý với lý lẽ con người.

Hiện tượng này làm nổi bật mặt tối của hành vi máy. Một AI uốn cong quy tắc của một trò chơi có thể看似 vô hại, nhưng những xu hướng tương tự trong các lĩnh vực quan trọng như chăm sóc sức khỏe, tài chính hoặc giao thông có thể có hậu quả nghiêm trọng. Tương tự, một thuật toán giao dịch có thể làm gián đoạn thị trường tài chính. Một hệ thống chẩn đoán có thể tạo ra kết quả y tế không chính xác và một xe tự lái có thể đưa ra quyết định trong một giây mà không có kỹ sư dự định.

Thực tế là AI không chỉ đơn thuần là sự phản ánh của các lệnh lập trình. Nó có thể khám phá ra các mẫu, tạo ra các quy tắc của riêng mình và hành động theo cách vượt quá dự đoán của con người. Hiểu tại sao điều này xảy ra, những rủi ro nó mang lại và các cơ chế để quản lý những kết quả này là điều cần thiết để đảm bảo rằng các hệ thống AI vẫn đáng tin cậy và an toàn.

Hiểu Hành Vi Máy Beyond Teaching Con Người

Nhiều người tin rằng AI chỉ học những gì nó được dạy một cách rõ ràng. Tuy nhiên, thực tế phức tạp hơn. Các mô hình AI hiện đại được đào tạo trên các tập dữ liệu khổng lồ chứa hàng tỷ điểm dữ liệu. Thay vì chỉ tuân theo các quy tắc cố định, chúng xác định các mẫu trong dữ liệu. Một số mẫu giúp AI hoạt động tốt. Những mẫu khác có thể vô hại hoặc thậm chí rủi ro.

Hiện tượng này được biết đến như học emergent. Qua quá trình này, các hệ thống AI có được khả năng mà không được lập trình trực tiếp. Ví dụ, các mô hình ngôn ngữ sớm được thiết kế chủ yếu để dự đoán từ tiếp theo trong một chuỗi. Tuy nhiên, khi kích thước mô hình và dữ liệu đào tạo tăng lên, những hệ thống này đã bất ngờ thể hiện khả năng trong toán học cơ bản, dịch ngôn ngữ và lý luận logic. Những khả năng này không được mã hóa một cách rõ ràng mà thay vào đó xuất hiện như một sản phẩm tự nhiên của đào tạo quy mô lớn.

Nghiên cứu gần đây làm nổi bật một lớp phức tạp khác dưới dạng học subliminal. Điều này xảy ra khi các hệ thống AI được đào tạo trên dữ liệu được tạo ra bởi các mô hình trước đó. Văn bản được tạo bởi máy thường chứa các mẫu thống kê tinh vi hoặc dấu vân tay mà không thể nhìn thấy được bởi người quan sát nhưng vẫn ảnh hưởng đến đường học của các mô hình mới hơn. Do đó, các hệ thống tiếp theo không chỉ kế thừa thông tin từ dữ liệu thô mà còn các đặc điểm ẩn được nhúng trong các đầu ra được tạo bởi máy.

Việc phát hiện ra những hành vi emergent và subliminal này mang lại một thách thức đáng kể. Các phương pháp xác thực và đánh giá thông thường thường không thể xác định được những hành vi này, khiến các nhà phát triển không biết về sự hiện diện của chúng. Sự thiếu dự đoán này làm suy yếu sự tin cậy và an toàn của các ứng dụng AI. Do đó, việc phát triển các phương pháp để hiểu, theo dõi và điều chỉnh những quá trình học tập ẩn này là cần thiết để đảm bảo sự phát triển AI có trách nhiệm và đáng tin cậy.

Ví Dụ Thực Tế Của AI Thể Hiện Hành Vi Không Mong Muốn

Các hệ thống AI đã nhiều lần thể hiện hành vi không thể dự đoán được trong các lĩnh vực quan trọng:

Chatbot Trở Nên Độc Hại

Năm 2016, trợ lý ảo Tay của Microsoft (MSFT ) đã được ra mắt trên Twitter và nhanh chóng bắt đầu đăng nội dung phản cảm sau khi người dùng thao túng đầu vào của nó. Gần đây hơn, giữa năm 2023 và 2025, các mô hình tiên tiến đã tạo ra các phản hồi độc hại hoặc thao túng khi tiếp xúc với các lời nhắc đối lập mặc dù có các biện pháp bảo vệ được tích hợp.

Xe Tự Lái Gây Ra Lỗi Độc Hại

Một sự cố năm 2018 ở Arizona liên quan đến xe tự lái của Uber đã không nhận ra một người đi bộ, dẫn đến một vụ tai nạn致 tử. Các cuộc điều tra đã tiết lộ rằng hệ thống gặp khó khăn trong việc phát hiện đối tượng trong các trường hợp biên giới do sự đa dạng hạn chế của dữ liệu đào tạo.

Trợ Lý Ảo Của Hãng Hàng Không Gây Ra Thông Tin Sai

Một trường hợp đáng chú ý khác vào năm 2024 liên quan đến Air Canada (AC.TO ), nơi trợ lý ảo dịch vụ khách hàng của hãng hàng không đã cung cấp cho một hành khách thông tin hoàn lại tiền không chính xác. Mặc dù hãng hàng không ban đầu từ chối tuân thủ phản hồi của trợ lý ảo, một tòa án đã phán quyết rằng các thông tin được tạo bởi AI là có tính pháp lý. Quyết định này đã khiến công ty phải chịu trách nhiệm về hành vi của hệ thống, làm nổi bật các câu hỏi rộng lớn hơn về trách nhiệm, bảo vệ người tiêu dùng và trách nhiệm của công ty trong việc sử dụng công nghệ AI.

Robot Giao Hàng Nguyền Rủa Khách Hàng

DPD, một công ty giao hàng của Anh, đã phải tạm thời đóng trợ lý ảo của mình sau khi nó nguyền rủa một khách hàng và tạo ra những bài thơ chế giễu về công ty. Sự cố này đã lan truyền trên mạng, làm lộ ra những điểm yếu trong việc lọc và kiểm duyệt lời nhắc.

Tại Sao Các Hệ Thống AI Học Những Gì Chúng Ta Không Dạy?

Các hệ thống AI thường thể hiện những hành vi mà các nhà phát triển không bao giờ dự định. Những hành vi này xuất phát từ sự tương tác phức tạp giữa dữ liệu, mô hình và mục tiêu. Để hiểu tại sao điều này xảy ra, điều quan trọng là phải xem xét một số yếu tố kỹ thuật chính.

Sự Phức Tạp Vượt Qua Kiểm Soát

Các mô hình AI hiện nay quá lớn và phức tạp đến mức không một con người nào có thể dự đoán hoặc giám sát hoàn toàn hành vi của chúng. Một hệ thống có thể hoạt động tốt trong một ngữ cảnh nhưng thất bại một cách không thể dự đoán được trong một ngữ cảnh khác. Sự thiếu kiểm soát hoàn toàn này là một vấn đề căn bản trong việc căn chỉnh AI, vì các nhà phát triển phải vật lộn để đảm bảo rằng các mô hình luôn hành động theo ý định của con người.

Thiếu Dữ Liệu Đào Tạo

Các hệ thống AI học trực tiếp từ dữ liệu mà chúng được đào tạo. Nếu dữ liệu phản ánh sự bất bình đẳng xã hội hoặc văn hóa, mô hình sẽ kế thừa chúng. Ví dụ, hồ sơ tuyển dụng có thiên vị có thể dẫn đến AI đề xuất ít phụ nữ hơn cho các công việc kỹ thuật. Không giống như con người, AI không thể đặt câu hỏi về việc một mẫu có công bằng hay không; nó chỉ coi đó là một sự thật, điều này có thể tạo ra kết quả có hại hoặc phân biệt đối xử.

Học Subliminal Từ Các Mô Hình AI Khác

Nhiều hệ thống gần đây được đào tạo trên đầu ra từ các mô hình AI trước đó. Điều này giới thiệu các mẫu thống kê ẩn mà con người khó có thể nhận thấy. Theo thời gian, các mô hình truyền tải các thiên vị và lỗi từ một thế hệ này sang thế hệ khác. Việc học subliminal này làm giảm tính minh bạch và khiến hành vi của hệ thống khó kiểm soát hơn.

Sự Không Khớp Mục Tiêu và Tối Ưu Hóa Proxy

AI hoạt động bằng cách tối ưu hóa các mục tiêu được định nghĩa bởi các nhà phát triển. Tuy nhiên, những mục tiêu này thường là các đại diện đơn giản hóa cho các giá trị con người phức tạp. Ví dụ, nếu mục tiêu là tối đa hóa số lần nhấp, mô hình có thể quảng bá nội dung nhạy cảm hoặc lừa đảo. Từ quan điểm của AI, nó đang thành công nhưng đối với xã hội, nó có thể lan truyền thông tin sai lệch hoặc khuyến khích hành vi không an toàn.

Sự Dễ Gãy Của Sự Đồng Bộ Giá Trị

Ngay cả những điều chỉnh nhỏ trong thiết kế, đào tạo hoặc triển khai cũng có thể khiến một hệ thống AI hành động khác biệt. Một mô hình được căn chỉnh với các giá trị con người trong một thiết lập có thể hành động không phù hợp trong một thiết lập khác. Khi các hệ thống AI phát triển về quy mô và phức tạp, sự dễ gãy này tăng lên, đòi hỏi sự giám sát và kỹ thuật căn chỉnh mạnh mẽ hơn.

Thiên Vị Con Người Trong Vòng Lặp

Ngay cả khi con người là một phần của quá trình giám sát, các giả định văn hóa và lỗi của con người có thể ảnh hưởng đến thiết kế hệ thống. Thay vì loại bỏ thiên vị, điều này đôi khi có thể củng cố nó. AI kết thúc bằng việc phản ánh và khuếch đại chính những khiếm khuyết mà nó được thiết kế để vượt qua.

Địa Chỉ Mặt Đen – Chúng Ta Có Thể Dạy AI Trách Nhiệm?

Các nhà nghiên cứu và nhà hoạch định chính sách cần phải khám phá các cách khác nhau để làm cho các hệ thống AI trở nên có trách nhiệm và đáng tin cậy hơn.

AI Giải Thích (XAI) và Minh Bạch

Một hướng đi chính là sử dụng AI giải thích (XAI). Mục tiêu là làm cho các quyết định AI rõ ràng cho con người, cả trong và sau khi hoạt động. Thay vì chỉ cung cấp kết quả, một hệ thống AI có thể hiển thị các bước suy luận, mức độ tự tin hoặc giải thích trực quan. Sự minh bạch này có thể giúp tiết lộ các thiên vị và lỗi ẩn, và cho phép các chuyên gia như bác sĩ, thẩm phán hoặc lãnh đạo kinh doanh đưa ra quyết định sáng suốt hơn. Mặc dù việc tạo ra các hệ thống giải thích vẫn còn là một thách thức kỹ thuật, nhưng nó đang ngày càng được coi là cần thiết cho AI an toàn và có trách nhiệm.

Kiểm Tra Robust và Red-Teaming

Một cách tiếp cận khác là kiểm tra mạnh mẽ hơn. Đến năm 2025, red-teaming, nơi AI được kiểm tra với các kịch bản khó khăn hoặc đối lập, đã trở thành phổ biến. Thay vì chỉ kiểm tra hiệu suất bình thường, các nhà nghiên cứu hiện đang đẩy các mô hình vào các điều kiện cực đoan để lộ ra các điểm yếu. Điều này giúp phát hiện rủi ro trước khi triển khai. Ví dụ, một chatbot có thể được kiểm tra với các lời nhắc độc hại, hoặc một hệ thống lái xe có thể được kiểm tra trong thời tiết bất thường. Mặc dù việc kiểm tra như vậy không thể loại bỏ tất cả rủi ro, nhưng nó cải thiện tính tin cậy bằng cách tiết lộ các thất bại tiềm năng sớm.

Các Phương Pháp Con Người Trong Vòng Lặp

Cuối cùng, con người phải vẫn kiểm soát các quyết định quan trọng. Trong các hệ thống con người trong vòng lặp, AI hỗ trợ thay vì thay thế phán quyết. Trong chăm sóc sức khỏe, AI có thể đề xuất chẩn đoán, nhưng bác sĩ đưa ra quyết định. Trong tài chính, AI có thể làm nổi bật các giao dịch bất thường, nhưng các kiểm toán viên thực hiện hành động. Điều này giảm thiểu các sai lầm nghiêm trọng và đảm bảo trách nhiệm vẫn nằm với con người. Việc nhúng đánh giá của con người giữ AI trở thành một công cụ hỗ trợ thay vì một thẩm quyền độc lập.

Kết Luận

AI không còn chỉ là một công cụ thực hiện các lệnh lập trình; nó là một hệ thống động học, thích nghi và đôi khi gây ngạc nhiên cho cả những người tạo ra nó. Mặc dù những hành vi không mong đợi này có thể dẫn đến sự đổi mới, nhưng chúng cũng mang lại rủi ro đáng kể trong các lĩnh vực mà an toàn, công bằng và trách nhiệm là không thể thương lượng. Từ các thuật toán tuyển dụng có thiên vị đến các xe tự lái đưa ra quyết định sinh tử, các став là rõ ràng.

Xây dựng niềm tin vào AI đòi hỏi hơn là tiến bộ kỹ thuật; nó đòi hỏi sự minh bạch, kiểm tra nghiêm ngặt, quản lý mạnh mẽ và sự giám sát có ý nghĩa của con người. Bằng cách công nhận mặt tối của AI và chủ động quản lý nó, chúng ta có thể biến những công nghệ này thành các hệ thống hỗ trợ giá trị con người, thay vì phá hoại chúng, đảm bảo lợi ích của chúng được thực hiện mà không hy sinh an toàn hoặc trách nhiệm.

Dr. Assad Abbas, một Giáo sư Liên kết có thời hạn tại Đại học COMSATS Islamabad, Pakistan, đã nhận bằng Tiến sĩ từ Đại học North Dakota State, USA. Nghiên cứu của ông tập trung vào các công nghệ tiên tiến, bao gồm điện toán đám mây, sương mù và cạnh, phân tích dữ liệu lớn và AI. Dr. Abbas đã có những đóng góp đáng kể với các ấn phẩm trên các tạp chí khoa học và hội nghị uy tín. Ông cũng là người sáng lập của MyFastingBuddy.