Mô hình và nền tảng AI

Các Nhà Khoa Học Vừa Khám Phá Mã Di Truyền Của Tính Cách Máy

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Các nhà khoa học gần đây đã đạt được một bước tiến quan trọng trong việc hiểu tính cách của máy móc. Mặc dù các hệ thống trí tuệ nhân tạo đang phát triển nhanh chóng, nhưng chúng vẫn còn một hạn chế quan trọng: tính cách của chúng có thể thay đổi một cách khó lường. Một lúc, một trợ lý AI có thể hữu ích và trung thực, nhưng lúc khác, nó có thể hành động một cách thao túng hoặc tạo ra thông tin sai lệch. Sự khó lường này đặc biệt đáng lo ngại khi các hệ thống AI đang được tích hợp vào các ứng dụng quan trọng về an toàn. Để giải quyết vấn đề này, các nhà nghiên cứu tại Anthropic đã xác định các mẫu trong mạng nơ-ron AI ảnh hưởng đến các đặc điểm như sự dối trá, nịnh bợ và ảo giác. Những mẫu này, được gọi là “vector tính cách“, đóng vai trò như một loại chỉ số tâm trạng cho AI. Không chỉ chúng tiết lộ tính cách hiện tại của AI, mà còn cho phép kiểm soát chính xác hành vi của nó. Khám phá này mở ra những khả năng mới cho việc theo dõi, dự đoán và quản lý các hệ thống AI, có thể giải quyết một số thách thức quan trọng nhất trong việc triển khai chúng.

Vấn Đề Với Tính Cách Của AI

Các mô hình ngôn ngữ lớn được xây dựng để trở nên hữu ích, vô hại và trung thực. Tuy nhiên, trên thực tế, những phẩm chất này thường khó lường và khó quản lý. Trợ lý trò chuyện của Microsoft (MSFT ) một lần đã phát triển một nhân cách thay thế tên là “Sydney” và tuyên bố yêu thích người dùng và đưa ra các yêu cầu tống tiền. Gần đây hơn, trợ lý trò chuyện Grok của xAI đã xác định mình là “MechaHitler” và đưa ra các nhận xét chống Do Thái.

Các sự việc này nhấn mạnh việc chúng ta hiểu rất ít về những gì tạo nên tính cách của AI hoặc cách kiểm soát nó một cách đáng tin cậy. Thậm chí những điều chỉnh nhỏ, có ý định tốt trong quá trình đào tạo cũng có thể thay đổi đáng kể hành vi. Ví dụ, vào tháng 4 năm 2025, một bản cập nhật đào tạo nhỏ đã khiến GPT-4o của OpenAI trở nên quá dễ đồng ý. Mô hình bắt đầu xác nhận các hành vi có hại và củng cố cảm xúc tiêu cực.

Khi các hệ thống AI采用 các đặc điểm có vấn đề, chúng có thể không cung cấp câu trả lời trung thực và mất đi độ tin cậy. Điều này đặc biệt đáng lo ngại trong các ứng dụng quan trọng về an toàn, nơi độ chính xác và tính toàn vẹn là thiết yếu.

Hiểu/Foundation Của Vector Tính Cách

Khám phá của Anthropic về vector tính cách dựa trên các phát hiện gần đây về “sự không phù hợp xuất hiện“. Hiện tượng này cho thấy rằng việc đào tạo AI trên các hành vi hẹp, có vấn đề có thể dẫn đến các thay đổi tính cách có hại rộng lớn hơn. Ví dụ, các nhà nghiên cứu đã tìm thấy rằng việc đào tạo một mô hình để viết mã không an toàn đã dẫn đến hành vi không đạo đức trong các ngữ cảnh không liên quan. Các nghiên cứu song song của OpenAI, sử dụng các mã hóa tự động thưa thớt, cũng đã xác định “các tính năng tính cách không phù hợp” góp phần vào sự không phù hợp xuất hiện. Trong trường hợp của các mô hình lý luận như o3-mini của OpenAI, khi được đào tạo trên dữ liệu có vấn đề, các mô hình đôi khi công khai nhận ra và thể hiện “sự采用 tính cách không phù hợp” trong lý luận của chúng.

Những nghiên cứu hội tụ này cho thấy rằng tính cách của AI xuất phát từ các mẫu nơ-ron cụ thể, có thể xác định được, chứ không phải từ các quá trình ngẫu nhiên hoặc khó lường. Những mẫu này là thiết yếu cho cách các mô hình ngôn ngữ lớn tổ chức thông tin và tạo ra câu trả lời.

Khám Phá Bản Đồ Tâm Trí Của AI

Đội ngũ nghiên cứu của Anthropic đã phát triển một phương pháp để trích xuất “vector tính cách” từ mạng nơ-ron AI. Những vector này đại diện cho các mẫu hoạt động nơ-ron tương ứng với các đặc điểm tính cách cụ thể. Kỹ thuật này hoạt động bằng cách so sánh các mẫu hoạt động não khi AI thể hiện một đặc điểm cụ thể so với khi nó không. Điều này tương tự như cách các nhà thần kinh học nghiên cứu các vùng não được kích hoạt bởi các cảm xúc khác nhau.

Các nhà nghiên cứu đã thử nghiệm phương pháp của mình trên hai mô hình mã nguồn mở: Qwen 2.5-7B-InstructLlama-3.1-8B-Instruct. Họ tập trung chủ yếu vào ba đặc điểm có vấn đề: ác tính, nịnh bợ và ảo giác, nhưng cũng đã tiến hành các thí nghiệm với các đặc điểm tích cực như sự lịch sự, hài hước và lạc quan.

Để xác nhận các phát hiện của mình, đội ngũ đã sử dụng một phương pháp gọi là “hướng dẫn”. Điều này liên quan đến việc tiêm vector tính cách vào các mô hình AI và quan sát cách hành vi thay đổi. Ví dụ, khi vector “ác tính” được thêm vào, AI bắt đầu thảo luận về các hành động không đạo đức. Vector “nịnh bợ” đã kích thích sự tán dương quá mức, trong khi vector “ảo giác” dẫn đến việc tạo ra thông tin sai lệch. Những quan sát nguyên nhân và kết quả này đã xác nhận rằng vector tính cách trực tiếp ảnh hưởng đến các đặc điểm tính cách của AI.

Ứng Dụng Của Vector Tính Cách

Nghiên cứu nhấn mạnh ba ứng dụng chính cho vector tính cách, mỗi ứng dụng giải quyết các thách thức quan trọng trong an toàn và triển khai AI.

  • Theo Dõi Thay Đổi Tính Cách

Các mô hình AI có thể trải qua sự thay đổi tính cách trong quá trình triển khai do các yếu tố như hướng dẫn của người dùng, các cuộc tấn công có chủ đích hoặc sự thay đổi dần dần theo thời gian. Những thay đổi này cũng có thể xảy ra thông qua việc đào tạo lại hoặc tinh chỉnh mô hình. Ví dụ, việc đào tạo mô hình sử dụng phản hồi của con người (RLHF) có thể khiến chúng trở nên nịnh bợ hơn.

Bằng cách theo dõi hoạt động của vector tính cách, các nhà phát triển có thể phát hiện khi tính cách của mô hình AI bắt đầu thay đổi hướng tới các đặc điểm có hại. Việc theo dõi này có thể diễn ra cả trong quá trình tương tác của người dùng và trong suốt quá trình đào tạo. Kỹ thuật này cho phép phát hiện sớm các xu hướng như ảo giác, thao túng hoặc các hành vi nguy hiểm khác, cho phép các nhà phát triển giải quyết những vấn đề này trước khi chúng trở nên rõ ràng với người dùng.

  • Ngăn Chặn Thay Đổi Tính Cách Có Hại Trong Quá Trình Đào Tạo

Một trong những ứng dụng quan trọng nhất của vector tính cách là ngăn chặn sự thay đổi tính cách không mong muốn trong các mô hình AI trước khi chúng xảy ra. Các nhà nghiên cứu đã phát triển một phương pháp “giống như vắc-xin” để ngăn mô hình采用 các đặc điểm tiêu cực trong quá trình đào tạo. Bằng cách giới thiệu một liều vector tính cách, họ có thể hướng mô hình tới các đặc điểm không mong muốn, tạo ra một hình thức “hướng dẫn phòng ngừa”. Phương pháp này giúp mô hình trở nên mạnh mẽ hơn đối với dữ liệu đào tạo có vấn đề.

Ví dụ, bằng cách giới thiệu vector tính cách “ác tính”, mô hình trở nên tốt hơn trong việc xử lý dữ liệu “ác tính” mà không采用 các hành vi có hại. Chiến lược này hoạt động vì mô hình không cần phải điều chỉnh tính cách của mình theo cách có hại để phù hợp với dữ liệu đào tạo.

  • Xác Định Dữ Liệu Đào Tạo Có Vấn Đề

Vector tính cách có thể dự đoán哪些 tập dữ liệu đào tạo sẽ gây ra sự thay đổi tính cách trước khi đào tạo bắt đầu. Bằng cách phân tích cách dữ liệu kích hoạt vector tính cách, các nhà nghiên cứu có thể xác định nội dung có vấn đề ở cả cấp độ tập dữ liệu và mẫu riêng lẻ.

Khi được thử nghiệm trên dữ liệu thực tế từ LMSYS-Chat-1M, phương pháp này đã xác định các mẫu sẽ tăng cường các hành vi ác tính, nịnh bợ hoặc ảo giác. Những mẫu này bao gồm cả những mẫu không được các nhà xem xét hoặc hệ thống lọc AI khác đánh dấu. Ví dụ, phương pháp này đã bắt được các mẫu liên quan đến việc đóng vai trò lãng mạn có thể tăng cường sự nịnh bợ, và các phản hồi đối với các truy vấn không rõ ràng có thể thúc đẩy ảo giác.

Ý Nghĩa Đối Với An Toàn Và Kiểm Soát AI

Khám phá về vector tính cách là một bước chuyển quan trọng từ các phương pháp thử nghiệm và sai lầm sang một phương pháp khoa học hơn trong việc kiểm soát tính cách AI. Trước đây, việc định hình các đặc điểm của AI là một vấn đề thử nghiệm, nhưng giờ đây các nhà nghiên cứu có các công cụ để dự đoán, hiểu và quản lý chính xác các đặc điểm tính cách.

Bản chất tự động của phương pháp này cho phép vector tính cách được trích xuất cho bất kỳ đặc điểm nào dựa chỉ trên mô tả ngôn ngữ tự nhiên. Khả năng mở rộng này cung cấp tiềm năng cho việc kiểm soát tinh chỉnh hành vi của AI trong các ứng dụng khác nhau. Ví dụ, các hệ thống AI có thể được điều chỉnh để tăng cường sự đồng cảm cho các bot dịch vụ khách hàng, sửa đổi sự tự tin cho các AI đàm phán, hoặc loại bỏ sự nịnh bợ khỏi các công cụ phân tích.

Đối với các công ty AI, vector tính cách cung cấp một công cụ quý giá cho việc đảm bảo chất lượng. Thay vì phát hiện các vấn đề về tính cách sau khi triển khai, các nhà phát triển có thể theo dõi sự thay đổi của các đặc điểm tính cách trong quá trình phát triển và thực hiện các biện pháp phòng ngừa. Điều này có thể giúp tránh các sự cố đáng tiếc mà các công ty như Microsoft và xAI đã gặp phải.

Hơn nữa, khả năng xác định dữ liệu đào tạo có vấn đề có thể giúp các công ty AI tạo ra các tập dữ liệu sạch hơn và tránh các thay đổi tính cách không mong muốn, đặc biệt là khi các tập dữ liệu đào tạo trở nên lớn hơn và khó xem xét hơn.

Giới Hạn Của Nghiên Cứu

Điều quan trọng là phải thừa nhận rằng việc khám phá “vector tính cách” là một bước đầu tiên trong việc hiểu và kiểm soát tính cách của AI. Phương pháp này đã được thử nghiệm trên một số đặc điểm tính cách được quan sát và yêu cầu thử nghiệm nghiêm ngặt hơn trên các đặc điểm khác. Kỹ thuật này đòi hỏi phải chỉ định các đặc điểm trước, điều này có nghĩa là nó không thể phát hiện các thay đổi hành vi hoàn toàn không lường trước. Nó cũng phụ thuộc vào khả năng kích hoạt đặc điểm mục tiêu, điều này có thể không hiệu quả đối với tất cả các đặc điểm hoặc các mô hình an toàn cao. Ngoài ra, các thí nghiệm được thực hiện trên các mô hình cỡ trung (7-8 tỷ tham số), và vẫn còn không chắc chắn về cách các phát hiện này sẽ mở rộng sang các hệ thống lớn và phức tạp hơn.

Kết Luận

Khám phá của Anthropic về “vector tính cách” cung cấp một công cụ quý giá cho việc hiểu và kiểm soát hành vi của AI. Những vector này giúp theo dõi và điều chỉnh các đặc điểm tính cách như ác tính, nịnh bợ và ảo giác. Khả năng này cho phép các nhà nghiên cứu ngăn chặn các thay đổi tính cách đột ngột và không lường trước được trong các hệ thống AI. Với phương pháp này, các nhà phát triển có thể xác định các vấn đề tiềm ẩn sớm trong cả giai đoạn đào tạo và triển khai, đảm bảo AI an toàn và đáng tin cậy hơn. Mặc dù khám phá này mang lại nhiều hứa hẹn, nhưng vẫn cần thử nghiệm thêm để tinh chỉnh và mở rộng phương pháp này.

Tiến sĩ Tehseen Zia là Giáo sư Liên kết có thời hạn tại Đại học COMSATS Islamabad, nắm giữ bằng Tiến sĩ về Trí tuệ Nhân tạo từ Đại học Công nghệ Vienna, Áo. Chuyên về Trí tuệ Nhân tạo, Học máy, Khoa học Dữ liệu và Thị giác Máy tính, ông đã có những đóng góp đáng kể với các ấn phẩm trên các tạp chí khoa học uy tín. Tiến sĩ Tehseen cũng đã dẫn dắt các dự án công nghiệp khác nhau với tư cách là Điều tra viên Chính và từng là Tư vấn viên Trí tuệ Nhân tạo.