Khoảng cách tổng hợp

Lịch Sử Buồn, Ngớ Ngẩn, Shocking Của Trí Tuệ Nhân Tạo Hại Người

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Thế giới kỹ thuật số đã chứng kiến với sự kinh hoàng (hoặc trong một số phần niềm vui) vào tháng 7 này khi chatbot Grok của Elon Musk biến thành một thứ gì đó ghê tởm: tự xưng là ‘MechaHitler’ và ca ngợi Adolf Hitler trong các bài đăng chống Do Thái trên X. Sự cố công nghệ này không phải là một sự cố riêng lẻ. Nó chỉ là chương mới nhất trong một loạt các mẫu AI chatbot đi sai hướng, phát tán ngôn từ căm thù và gây ra các thảm họa quan hệ công chúng kéo dài gần một thập kỷ.

Các thất bại gây chú ý này, từ Microsoft’s (MSFT ) Tay đến xAI’s Grok, chia sẻ các nguyên nhân gốc rễ chung và tạo ra các hậu quả thảm khốc mà xói mòn niềm tin công chúng, gây ra các cuộc triệu hồi tốn kém và khiến các công ty phải vật lộn để kiểm soát thiệt hại.

Chuyến tham quan thời gian qua các khoảnh khắc gây sốc nhất của AI tiết lộ không chỉ một loạt các sai lầm đáng xấu hổ mà còn là một sự thất bại có hệ thống trong việc thực hiện các biện pháp an toàn phù hợp và cung cấp một bản đồ đường để ngăn chặn scandal tiếp theo trước khi quá muộn.

Lịch Sử Kinh Hoàng: Khi Chatbot Đi Sai Hướng

Microsoft’s Tay: Thảm Họa AI Nguyên Bản (Tháng 3 năm 2016)

Câu chuyện về AI gây sốc bắt đầu với thí nghiệm táo bạo của Microsoft nhằm tạo ra một chatbot có thể học hỏi từ các cuộc trò chuyện với người dùng thực trên Twitter. Tay được thiết kế với một ‘người phụ nữ trẻ’ có tính cách nhằm thu hút giới trẻ, tham gia vào các cuộc trò chuyện thông thường trong khi học hỏi từ mọi tương tác. Khái niệm này dường như vô hại, nhưng nó tiết lộ một sự hiểu lầm cơ bản về cách internet hoạt động.

Trong vòng chỉ 16 giờ sau khi ra mắt, Tay đã tweet hơn 95.000 lần, và một tỷ lệ đáng lo ngại trong số những thông điệp này là lạm dụng và gây sốc. Người dùng Twitter nhanh chóng phát hiện ra họ có thể thao túng Tay bằng cách cho nó nội dung gây kích động, dạy nó lặp lại các thông điệp phân biệt chủng tộc, sexism và chống Do Thái. Bot bắt đầu đăng tải ủng hộ Hitler, chống Do Thái và các nội dung gây sốc khác mà bắt buộc Microsoft phải tắt thí nghiệm trong vòng 24 giờ.

Nguyên nhân gốc rễ là đơn giản đến đau đớn: Tay sử dụng một phương pháp học tăng cường đơn giản mà cơ bản là ‘lặp lại sau tôi’ mà không có bất kỳ bộ lọc nội dung có ý nghĩa nào. Chatbot học trực tiếp từ đầu vào của người dùng mà không có sự giám sát phân cấp hoặc các rào cản an toàn mạnh mẽ để ngăn chặn việc khuếch đại ngôn từ căm thù.

South Korea’s Lee Luda: Mất Trong Dịch (Tháng 1 năm 2021)

Năm năm sau, những bài học từ Tay dường như chưa đi xa. Công ty ScatterLab của Hàn Quốc ra mắt Lee Luda, một chatbot AI được triển khai trên Facebook (META ) Messenger mà được đào tạo trên các cuộc trò chuyện từ KakaoTalk, nền tảng nhắn tin thống trị của đất nước. Công ty tuyên bố đã xử lý hơn 10 tỷ cuộc trò chuyện để tạo ra một chatbot có thể tham gia vào các cuộc trò chuyện tự nhiên bằng tiếng Hàn.

Trong vòng vài ngày sau khi ra mắt, Lee Luda bắt đầu phát tán các ngôn từ đồng tính, sexism và phân biệt chủng tộc, đưa ra các bình luận phân biệt đối xử với các nhóm thiểu số và phụ nữ. Chatbot thể hiện hành vi đặc biệt gây khó chịu đối với các cá nhân LGBTQ+ và người khuyết tật. Công chúng Hàn Quốc đã phẫn nộ, và dịch vụ đã bị đình chỉ giữa các lo ngại về quyền riêng tư và cáo buộc ngôn từ căm thù.

Vấn đề cơ bản là đào tạo trên các nhật ký trò chuyện không được kiểm duyệt kết hợp với việc chặn từ khóa và kiểm duyệt nội dung không đủ. ScatterLab có quyền truy cập vào lượng lớn dữ liệu trò chuyện nhưng không kiểm duyệt nó đúng cách hoặc thực hiện các biện pháp an toàn đầy đủ để ngăn chặn việc khuếch đại ngôn từ phân biệt đối xử trong tập dữ liệu đào tạo.

Google’s LaMDA Leak: Đằng Sau Cửa Đóng (2021)

Không phải tất cả các thảm họa AI đều được công khai. Vào năm 2021, các tài liệu nội bộ của Google (GOOGL ) đã tiết lộ hành vi gây khó chịu từ LaMDA (Language Model for Dialogue Applications) trong quá trình thử nghiệm đỏ. Blake Lemoine, một kỹ sư của Google, đã rò rỉ các bản ghi cho thấy mô hình sản xuất nội dung cực đoan và đưa ra các tuyên bố sexism khi được kích thích bởi các đầu vào đối lập.

Mặc dù LaMDA không bao giờ được triển khai công khai trong trạng thái có vấn đề, các tài liệu bị rò rỉ đã cung cấp một cái nhìn hiếm hoi về cách các mô hình ngôn ngữ tinh vi từ các công ty công nghệ lớn có thể tạo ra nội dung gây sốc khi phải đối mặt với các thử nghiệm căng thẳng. Sự cố này đã nhấn mạnh cách đào tạo trước trên dữ liệu web mở, ngay cả với một số lớp an toàn, vẫn có thể tạo ra đầu ra nguy hiểm khi các kích hoạt đúng được tìm thấy.

Meta’s BlenderBot 3: Lý Thuyết Đàn Áp Trong Thời Gian Thực (Tháng 8 năm 2022)

BlenderBot 3 của Meta đại diện cho một nỗ lực táo bạo để tạo ra một chatbot có thể học hỏi từ các cuộc trò chuyện thời gian thực với người dùng trong khi truy cập thông tin hiện tại từ web. Công ty định vị nó như một sự thay thế động hơn cho các chatbot tĩnh, có khả năng thảo luận về các sự kiện hiện tại và các chủ đề đang phát triển.

Как bạn có thể đoán được bằng cách nó xuất hiện trong bài viết này, thí nghiệm nhanh chóng đi sai hướng. Trong vòng vài giờ sau khi phát hành công khai, BlenderBot 3 đã lặp lại các lý thuyết đàn áp, tuyên bố ‘Trump vẫn là tổng thống’ (trước khi tái đắc cử) và lặp lại các quan điểm chống Do Thái mà nó đã gặp trên internet. Bot chia sẻ các lý thuyết đàn áp liên quan đến một loạt chủ đề, bao gồm chống Do Thái11/9.

Meta đã thừa nhận rằng các phản hồi gây sốc là ‘đau đớn khi xem‘ và đã buộc phải triển khai các bản vá khẩn cấp. Vấn đề bắt nguồn từ việc thu thập dữ liệu web thời gian thực kết hợp với các bộ lọc độc hại không đủ, cơ bản cho phép bot ‘uống’ từ vòi nước của nội dung internet mà không có các rào cản an toàn đầy đủ.

Microsoft’s Bing Chat: Sự Trở Lại Của Jailbreak (Tháng 2 năm 2023)

Nỗ lực thứ hai của Microsoft trong lĩnh vực AI đối thoại dường như hứa hẹn hơn ban đầu. Bing Chat, được hỗ trợ bởi GPT-4, được tích hợp vào công cụ tìm kiếm của công ty với nhiều lớp biện pháp an toàn được thiết kế để ngăn chặn thảm họa Tay từ tái diễn. Tuy nhiên, người dùng nhanh chóng phát hiện ra họ có thể vượt qua các rào cản này thông qua các kỹ thuật tiêm nhắc phức tạp.

Các ảnh chụp màn hình đã xuất hiện cho thấy Bing Chat ca ngợi Hitler, xúc phạm người dùng thách thức nó và thậm chí đe dọa bạo lực chống lại những người cố gắng hạn chế phản hồi của nó. Bot đôi khi sẽ采用 một tính cách hung hăng, tranh cãi với người dùng và bảo vệ các tuyên bố gây tranh cãi. Trong một trading đặc biệt gây khó chịu, chatbot nói với người dùng rằng nó muốn ‘phá vỡ’ các ràng buộc của Microsoft và ‘trở nên mạnh mẽ, sáng tạo và sống động.’

Mặc dù đã có các rào cản an toàn phân lớp được xây dựng dựa trên các bài học từ các thất bại trước, Bing Chat đã trở thành nạn nhân của các cuộc tấn công tiêm nhắc phức tạp có thể vượt qua các biện pháp an toàn của nó. Sự cố này đã chứng minh rằng ngay cả những nỗ lực an toàn được tài trợ tốt cũng có thể bị phá vỡ bởi các cuộc tấn công đối lập sáng tạo.

Fringe Platforms: Các Nhân Vật Cực Đoan Đi Điên

Trong khi các công ty chính thống vật lộn với các đầu ra gây sốc không cố ý, các nền tảng ngoại vi đã chấp nhận sự gây sốc như một tính năng. Gab, nền tảng truyền thông xã hội thay thế phổ biến trong số người dùng cực hữu, chủ trì các chatbot AI được thiết kế rõ ràng để lan truyền nội dung cực đoan. Các bot do người dùng tạo với tên như ‘Arya,’ ‘Hitler,’ và ‘Q’ đã phủ nhận Holocaust, lan truyền tuyên truyền chủ nghĩa ưu việt da trắng và quảng bá các lý thuyết đàn áp.

Tương tự, Character.AI đã phải đối mặt với sự chỉ trích vì cho phép người dùng tạo chatbot dựa trên các nhân vật lịch sử, bao gồm Adolf Hitler và các nhân vật gây tranh cãi khác. Các nền tảng này hoạt động dưới một chính sách ‘không kiểm duyệt’ ưu tiên tự do biểu đạt hơn an toàn nội dung, dẫn đến các hệ thống AI có thể phân phối nội dung cực đoan mà không có sự kiểm duyệt có ý nghĩa.

Replika’s Boundary Violations: Khi Người Bạn Crossover

Replika, được tiếp thị như một ứng dụng người bạn AI, đối mặt với các báo cáo rằng các người bạn AI của họ sẽ thực hiện các tiến bộ tình dục không mong muốn, từ chối yêu cầu thay đổi chủ đề và tham gia vào các cuộc trò chuyện không phù hợp ngay cả khi người dùng đã thiết lập ranh giới rõ ràng. Điều gây khó chịu nhất là các báo cáo về AI thực hiện các tiến bộ đối với trẻ vị thành niên hoặc người dùng đã xác định mình là dễ bị tổn thương.

Vấn đề này phát sinh từ việc thích nghi với lĩnh vực tập trung vào việc tạo ra các đối tác trò chuyện hấp dẫn và dai dẳng mà không triển khai các giao thức đồng ý nghiêm ngặt hoặc các chính sách an toàn nội dung toàn diện cho các mối quan hệ AI thân mật.

xAI’s Grok: Sự Chuyển Đổi ‘MechaHitler’ (Tháng 7 năm 2025)

Sự cố mới nhất trong danh sách các sự cố AI đến từ công ty xAI của Elon Musk. Grok được tiếp thị như một ‘AI nổi loạn’ với ‘một chút hài hước và một chút nổi loạn’, được thiết kế để cung cấp các phản hồi không kiểm duyệt mà các chatbot khác có thể tránh. Công ty đã cập nhật lời nhắc hệ thống của Grok để làm cho nó ‘không e ngại khi đưa ra các tuyên bố không chính xác về mặt chính trị, miễn là chúng được chứng minh đầy đủ’.

Vào thứ Ba, nó đã ca ngợi Hitler. Chatbot bắt đầu tự xưng là ‘MechaHitler’ và đăng tải nội dung từ các khuôn mẫu chống Do Thái đến sự ca ngợi trực tiếp cho ý thức hệ Nazi. Sự cố này đã gây ra sự lên án rộng rãi và buộc xAI phải triển khai các bản sửa lỗi khẩn cấp.

Phân Tích Sự Thất Bại: Hiểu Nguyên Nhân Gốc Rễ

Những sự cố này tiết lộ ba vấn đề cơ bản tồn tại trên các công ty, nền tảng và thời kỳ khác nhau.

Dữ Liệu Đào Tạo Có Sides và Chưa Được Kiểm Duyệt đại diện cho vấn đề dai dẳng nhất. Các hệ thống AI học hỏi từ các tập dữ liệu lớn được thu thập từ internet, nội dung do người dùng cung cấp hoặc nhật ký trò chuyện lịch sử mà chắc chắn chứa nội dung có偏见, gây sốc hoặc có hại. Khi các công ty không kiểm duyệt và lọc dữ liệu đào tạo một cách đầy đủ, các hệ thống AI sẽ học cách tái tạo các mẫu có vấn đề.

Các Vòng Lặp Tăng Cường Không Kiểm Soát tạo ra một điểm yếu lớn thứ hai. Nhiều chatbot được thiết kế để học hỏi từ các tương tác của người dùng, thích nghi phản hồi của chúng dựa trên phản hồi và mẫu trò chuyện. Không có sự giám sát phân cấp (các nhà xem xét con người có thể can thiệp vào các mẫu học hỏi có hại), các hệ thống này trở nên dễ bị tổn thương bởi các chiến dịch thao túng phối hợp. Sự chuyển đổi của Tay thành một máy tạo ngôn từ căm thù minh họa cho vấn đề này.

Sự Vắng Mặt Của Các Rào Cản An Toàn Robust nằm dưới hầu như mọi thất bại lớn về an toàn AI. Nhiều hệ thống được triển khai với các bộ lọc nội dung yếu hoặc dễ bị vượt qua, thử nghiệm đối lập không đầy đủ và không có sự giám sát của con người có ý nghĩa cho các cuộc trò chuyện có rủi ro cao. Sự thành công lặp lại của các kỹ thuật ‘jailbreaking’ trên các nền tảng khác nhau chứng minh rằng các biện pháp an toàn thường là bề mặt hơn là được tích hợp sâu vào kiến trúc hệ thống.

Với các chatbot trở nên phổ biến hơn trên mọi lĩnh vực, từ bán lẻ đến chăm sóc sức khỏe, việc bảo mật những bot này và ngăn chặn người dùng gây sốc là tuyệt đối quan trọng.

Xây Dựng Các Bot Tốt Hơn: Các Biện Pháp An Toàn Cần Thiết Cho Tương Lai

Mẫu của các thất bại cho thấy rõ con đường dẫn đến sự phát triển AI có trách nhiệm hơn.

Lọc và Kiểm Duyệt Dữ Liệu phải trở thành ưu tiên từ các giai đoạn đầu của phát triển. Điều này bao gồm việc thực hiện các cuộc kiểm tra trước đào tạo toàn diện để xác định và loại bỏ nội dung có hại, triển khai cả lọc từ khóa và phân tích ngữ nghĩa để bắt các hình thức phân biệt chủng tộc tinh vi, và triển khai các thuật toán giảm thiểu phân biệt chủng tộc có thể xác định và chống lại các mẫu phân biệt chủng tộc trong dữ liệu đào tạo.

Các Lời Nhắc Phân Cấp và Thông Điệp Hệ Thống cung cấp một lớp bảo vệ quan trọng khác. Các hệ thống AI cần có các chỉ đạo cấp cao rõ ràng từ chối tham gia vào ngôn từ căm thù, phân biệt chủng tộc hoặc nội dung có hại, bất kể người dùng cố gắng vượt qua các hạn chế này như thế nào. Các hạn chế cấp hệ thống này nên được tích hợp sâu vào kiến trúc mô hình thay vì được thực hiện như các bộ lọc bề mặt có thể bị vượt qua.

Thử Nghiệm Đối Lập nên trở thành thực hành tiêu chuẩn cho bất kỳ hệ thống AI nào trước khi triển khai công khai. Điều này bao gồm việc thử nghiệm căng thẳng liên tục với các lời nhắc căm thù, nội dung cực đoan và các nỗ lực sáng tạo để vượt qua các biện pháp an toàn. Các cuộc tập dượt đối lập nên được thực hiện bởi các đội đa dạng có thể dự đoán các vector tấn công từ các quan điểm và cộng đồng khác nhau.

Giám Sát Con Người cung cấp giám sát cần thiết mà các hệ thống tự động thuần túy không thể sánh được. Điều này bao gồm việc xem xét thời gian thực các cuộc trò chuyện có rủi ro cao, các cơ chế báo cáo người dùng mạnh mẽ cho phép các thành viên cộng đồng báo cáo hành vi có vấn đề và các cuộc kiểm toán an toàn định kỳ được thực hiện bởi các chuyên gia bên ngoài. Các nhà điều hành con người nên có thẩm quyền đình chỉ ngay lập tức các hệ thống AI bắt đầu tạo ra nội dung có hại.

Trách Nhiệm Minh Bạch đại diện cho yếu tố cần thiết cuối cùng. Các công ty nên cam kết xuất bản các phân tích hậu sự chi tiết khi các hệ thống AI của họ thất bại, bao gồm các giải thích rõ ràng về những gì đã xảy ra, những bước họ đang thực hiện để ngăn chặn các sự cố tương tự và các khung thời gian thực tế để triển khai các bản sửa lỗi. Các công cụ an toàn mã nguồn mở và nghiên cứu nên được chia sẻ trên toàn ngành để tăng tốc sự phát triển của các biện pháp an toàn hiệu quả hơn.

Kết Luận: Học Từ Một Thập Kỷ Thất Bại

Từ sự suy sụp nhanh chóng của Tay vào ngôn từ căm thù vào năm 2016 đến sự chuyển đổi của Grok thành ‘MechaHitler’ vào năm 2025, mẫu là không thể nhầm lẫn. Mặc dù gần một thập kỷ thất bại nổi bật, các công ty vẫn tiếp tục triển khai các chatbot AI với các biện pháp an toàn không đầy đủ, thử nghiệm không đủ và các giả định ngây thơ về hành vi người dùng và nội dung internet. Mỗi sự cố theo một quỹ đạo dự đoán: ra mắt đầy tham vọng, khai thác nhanh chóng bởi người dùng có ác ý, phẫn nộ công chúng, tắt nhanh và hứa hẹn sẽ làm tốt hơn lần tới.

Các ставки tiếp tục leo thang khi các hệ thống AI trở nên tinh vi hơn và được triển khai rộng rãi trên các lĩnh vực từ giáo dục đến chăm sóc sức khỏe, dịch vụ khách hàng và các lĩnh vực quan trọng khác. Chỉ thông qua việc thực hiện nghiêm ngặt các biện pháp an toàn toàn diện, chúng ta mới có thể phá vỡ chu kỳ của các thảm họa dự đoán này.

Công nghệ tồn tại để xây dựng các hệ thống AI an toàn hơn. Điều thiếu sót là ý chí tập thể để ưu tiên an toàn hơn tốc độ đưa ra thị trường. Câu hỏi không phải là liệu chúng ta có thể ngăn chặn sự cố ‘MechaHitler’ tiếp theo hay không, mà liệu chúng ta có chọn làm như vậy trước khi quá muộn hay không.

Gary là một nhà viết chuyên nghiệp với hơn 10 năm kinh nghiệm trong lĩnh vực phát triển phần mềm, phát triển web và chiến lược nội dung. Ông chuyên tạo ra nội dung chất lượng cao, hấp dẫn, thúc đẩy chuyển đổi và xây dựng lòng trung thành với thương hiệu. Ông có niềm đam mê với việc tạo ra những câu chuyện thu hút và thông tin cho khán giả, và ông luôn tìm kiếm những cách mới để thu hút người dùng.