Mô hình và nền tảng AI

Trí tuệ nhân tạo có thể tránh các hành vi không mong muốn cụ thể với các thuật toán mới

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Khi các thuật toán và hệ thống trí tuệ nhân tạo trở nên phức tạp và có trách nhiệm lớn hơn, việc đảm bảo rằng các hệ thống trí tuệ nhân tạo tránh các hành vi nguy hiểm, không mong muốn trở nên quan trọng hơn. Gần đây, một nhóm nghiên cứu từ Đại học Massachusetts Amherst và Stanford đã xuất bản một bài báo chứng minh cách các hành vi trí tuệ nhân tạo cụ thể có thể được tránh, thông qua việc sử dụng một kỹ thuật tạo ra các hướng dẫn toán học chính xác có thể được sử dụng để điều chỉnh hành vi của trí tuệ nhân tạo.

Theo TechXplore, nghiên cứu này dựa trên giả định rằng các hành vi không công bằng / không an toàn có thể được định nghĩa bằng các hàm và biến toán học. Nếu điều này là đúng, thì nên có thể cho các nhà nghiên cứu đào tạo hệ thống để tránh các hành vi cụ thể này. Nhóm nghiên cứu nhằm mục đích phát triển một bộ công cụ có thể được sử dụng bởi người dùng trí tuệ nhân tạo để chỉ định các hành vi họ muốn trí tuệ nhân tạo tránh, và cho phép các kỹ sư trí tuệ nhân tạo đào tạo một hệ thống sẽ tránh các hành động không mong muốn khi được sử dụng trong các tình huống thực tế.

Phillip Thomas, tác giả đầu tiên của bài báo và giáo sư trợ lý khoa học máy tính tại U của Michigan Amherst, giải thích rằng nhóm nghiên cứu nhằm mục đích chứng minh rằng các nhà thiết kế thuật toán học máy có thể làm cho nó dễ dàng hơn cho người dùng trí tuệ nhân tạo mô tả các hành vi không mong muốn và có thể cao rằng hệ thống trí tuệ nhân tạo sẽ tránh hành vi đó.

Nhóm nghiên cứu đã thử nghiệm kỹ thuật của họ bằng cách áp dụng nó vào một vấn đề phổ biến trong khoa học dữ liệu, sự thiên vị giới tính. Nhóm nghiên cứu nhằm mục đích làm cho các thuật toán được sử dụng để dự đoán điểm GPA của sinh viên đại học trở nên công bằng hơn bằng cách giảm sự thiên vị giới tính. Nhóm nghiên cứu đã sử dụng một tập dữ liệu thử nghiệm và hướng dẫn hệ thống trí tuệ nhân tạo của họ để tránh việc tạo ra các mô hình mà trên toàn bộ đều đánh giá thấp / quá cao điểm GPA cho một giới tính. Kết quả của hướng dẫn của nhà nghiên cứu, thuật toán đã tạo ra một mô hình dự đoán điểm GPA của sinh viên tốt hơn và có ít thiên vị giới tính hệ thống hơn so với các mô hình trước đó. Các mô hình dự đoán điểm GPA trước đó đã bị thiên vị vì các mô hình giảm thiên vị thường quá hạn chế để có thể sử dụng, hoặc không có giảm thiên vị nào được sử dụng.

Một thuật toán khác cũng được nhóm nghiên cứu phát triển. Thuật toán này được thực hiện trong một máy bơm insulin tự động, và thuật toán được thiết kế để cân bằng giữa hiệu suất và an toàn. Máy bơm insulin tự động cần quyết định liều insulin mà một bệnh nhân nên được đưa ra Sau khi ăn, máy bơm sẽ lý tưởng đưa ra một liều insulin vừa đủ để giữ mức đường huyết trong kiểm soát. Liều insulin được đưa ra phải không quá lớn hoặc quá nhỏ.

Các thuật toán học máy đã có khả năng nhận dạng các mẫu trong phản ứng của một cá nhân với liều insulin, nhưng các phương pháp phân tích hiện có không thể cho phép các bác sĩ chỉ định các kết quả nên tránh, chẳng hạn như hạ đường huyết. Ngược lại, nhóm nghiên cứu đã có thể phát triển một phương pháp có thể được đào tạo để đưa ra liều insulin nằm trong hai cực, ngăn chặn việc quá liều hoặc thiếu liều. Mặc dù hệ thống chưa sẵn sàng để thử nghiệm trên bệnh nhân thực sự, một hệ thống trí tuệ nhân tạo tiên tiến hơn dựa trên phương pháp này có thể cải thiện chất lượng cuộc sống cho những người mắc bệnh tiểu đường.

Trong bài báo nghiên cứu, các nhà nghiên cứu gọi thuật toán này là thuật toán “Seledonian”. Đây là một tham chiếu đến ba luật robot được mô tả bởi tác giả khoa học viễn tưởng Isaac Asimov. Ý nghĩa là hệ thống trí tuệ nhân tạo “không được gây hại cho con người hoặc, thông qua sự không hoạt động, cho phép con người bị hại.” Nhóm nghiên cứu hy vọng rằng khuôn khổ của họ sẽ cho phép các nhà nghiên cứu và kỹ sư trí tuệ nhân tạo tạo ra một loạt các thuật toán và hệ thống tránh các hành vi nguy hiểm. Emma Brunskill, tác giả cao cấp của bài báo và giáo sư trợ lý khoa học máy tính tại Stanford, giải thích với TechXplore:

“Chúng tôi muốn phát triển trí tuệ nhân tạo tôn trọng các giá trị của người dùng và chứng minh sự tin cậy mà chúng tôi đặt vào các hệ thống tự động.”

Blogger và lập trình viên với chuyên môn về Machine Learning Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.