Phỏng vấn

Vahid Behzadan, Giám đốc Phòng thí nghiệm Học tập Thông minh An toàn và Bảo mật (SAIL) – Loạt phỏng vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Vahid là Giáo sư trợ lý về Khoa học Máy tính và Khoa học Dữ liệu tại Đại học New Haven. Ông cũng là giám đốc của Phòng thí nghiệm Học tập Thông minh An toàn và Bảo mật (SAIL)

Nghiên cứu của ông bao gồm an toàn và bảo mật của các hệ thống thông minh, mô hình tâm lý về các vấn đề an toàn của AI, bảo mật của các hệ thống thích nghi phức tạp, lý thuyết trò chơi, hệ thống đa tác nhân và an ninh mạng.

Bạn có một nền tảng rộng lớn về an ninh mạng và giữ cho AI an toàn. Bạn có thể chia sẻ hành trình của mình về cách bạn bị thu hút bởi cả hai lĩnh vực này?

Con đường nghiên cứu của tôi đã được thúc đẩy bởi hai lợi ích cốt lõi của tôi: tìm hiểu cách mọi thứ bị hỏng và học về các cơ chế của tâm trí con người. Tôi đã tích cực tham gia vào an ninh mạng từ những năm thiếu niên đầu tiên và do đó đã xây dựng chương trình nghiên cứu đầu tiên của mình xung quanh các vấn đề cổ điển của lĩnh vực này. Vài năm sau khi bắt đầu nghiên cứu sau đại học, tôi偶然 gặp một cơ hội hiếm có để thay đổi lĩnh vực nghiên cứu của mình. Vào thời điểm đó, tôi vừa mới bắt gặp những công trình đầu tiên của Szegedy và Goodfellow về các cuộc tấn công bằng ví dụ đối lập và thấy ý tưởng tấn công học máy rất thú vị. Khi tôi tìm hiểu sâu hơn về vấn đề này, tôi đã học về lĩnh vực chung hơn của an toàn và bảo mật của AI và thấy rằng nó bao gồm nhiều lợi ích cốt lõi của tôi, chẳng hạn như an ninh mạng, khoa học nhận thức, kinh tế và triết học. Tôi cũng tin rằng nghiên cứu trong lĩnh vực này không chỉ thú vị mà còn quan trọng để đảm bảo lợi ích và an toàn lâu dài của cuộc cách mạng AI.

 

Bạn là giám đốc của Phòng thí nghiệm Học tập Thông minh An toàn và Bảo mật (SAIL) mà làm việc để đặt nền móng cụ thể cho an toàn và bảo mật của các máy thông minh. Bạn có thể đi vào chi tiết về công việc được thực hiện bởi SAIL?

Tại SAIL, sinh viên và tôi làm việc về các vấn đề nằm ở giao điểm của an ninh, AI và hệ thống phức tạp. Mục tiêu chính của nghiên cứu của chúng tôi là điều tra an toàn và bảo mật của các hệ thống thông minh, từ cả hai góc độ lý thuyết và ứng dụng. Về mặt lý thuyết, chúng tôi hiện đang điều tra vấn đề liên kết giá trị trong các thiết lập đa tác nhân và đang phát triển các công cụ toán học để đánh giá và tối ưu hóa các mục tiêu của các tác nhân AI liên quan đến sự ổn định và liên kết mạnh mẽ. Về mặt thực tế, một số dự án của chúng tôi khám phá các lỗ hổng bảo mật của các công nghệ AI tiên tiến, chẳng hạn như phương tiện tự động và giao dịch thuật toán, và nhằm mục đích phát triển các kỹ thuật để đánh giá và cải thiện khả năng chống chịu của các công nghệ này trước các cuộc tấn công đối lập.

Chúng tôi cũng làm việc về các ứng dụng của học máy trong an ninh mạng, chẳng hạn như kiểm tra thâm nhập tự động, phát hiện sớm các nỗ lực xâm nhập và thu thập và phân tích thông tin về mối đe dọa từ các nguồn dữ liệu mở như mạng xã hội.

 

Bạn gần đây đã lãnh đạo một nỗ lực để đề xuất mô hình hóa các vấn đề an toàn của AI như các rối loạn tâm lý. Bạn có thể giải thích điều này?

Dự án này giải quyết sự phức tạp ngày càng tăng của các tác nhân và hệ thống AI: nó đã rất khó để chẩn đoán, dự đoán và kiểm soát các hành vi không an toàn của các tác nhân học tăng cường trong các thiết lập không tầm thường chỉ bằng cách nhìn vào các cấu hình cấp thấp của chúng. Trong công việc này, chúng tôi nhấn mạnh nhu cầu về các trừu tượng cấp cao hơn trong việc điều tra các vấn đề như vậy. Lấy cảm hứng từ các phương pháp khoa học để giải quyết các vấn đề hành vi ở người, chúng tôi đề xuất tâm lý học như một trừu tượng cấp cao hữu ích để mô hình hóa và phân tích các hành vi có hại mới nổi trong AI và AGI. Để chứng minh khái niệm này, chúng tôi nghiên cứu vấn đề an toàn của AI về việc hack phần thưởng trong một tác nhân học tăng cường học cách chơi trò chơi rắn cổ điển. Chúng tôi chỉ ra rằng nếu chúng tôi thêm một “hạt giống” ma túy vào môi trường, tác nhân học một hành vi tối ưu không tốt có thể được mô tả thông qua các mô hình khoa học thần kinh về nghiện. Công việc này cũng đề xuất các phương pháp điều trị dựa trên các phương pháp điều trị được sử dụng trong tâm thần học. Ví dụ, chúng tôi đề xuất sử dụng các tín hiệu phần thưởng được tạo ra nhân tạo như các phương pháp điều trị thay thế cho việc sửa đổi hành vi có hại của các tác nhân.

 

Bạn có lo lắng gì về an toàn của AI khi nói đến phương tiện tự động?

Phương tiện tự động đang trở thành những ví dụ nổi bật về việc triển khai AI trong các hệ thống vật lý mạng. Xem xét sự dễ bị tổn thương cơ bản của các công nghệ học máy hiện tại đối với các sai sót và các cuộc tấn công đối lập, tôi rất lo lắng về an toàn và bảo mật của thậm chí các phương tiện tự động bán tự động. Ngoài ra, lĩnh vực lái xe tự động đang phải đối mặt với sự thiếu hụt nghiêm trọng về các tiêu chuẩn an toàn và các giao thức đánh giá. Tuy nhiên, tôi vẫn hy vọng. Giống như trí thông minh tự nhiên, AI cũng sẽ dễ bị mắc sai lầm. Tuy nhiên, mục tiêu của xe tự lái vẫn có thể được đáp ứng nếu tỷ lệ và tác động của những sai lầm như vậy được giảm xuống thấp hơn so với những của lái xe con người. Chúng tôi đang chứng kiến những nỗ lực ngày càng tăng để giải quyết những vấn đề này trong ngành công nghiệp và học thuật, cũng như các chính phủ.

 

Hack các biển báo đường bằng nhãn dán hoặc bằng các phương tiện khác có thể làm cho mô-đun tầm nhìn của máy tính của một phương tiện tự động bị nhầm lẫn. Bạn nghĩ vấn đề này lớn đến mức nào?

Các nhãn dán này và các Ví dụ đối lập nói chung tạo ra những thách thức cơ bản về độ bền của các mô hình học máy. Để trích dẫn George E. P. Box, “tất cả các mô hình đều sai, nhưng một số mô hình hữu ích”. Các ví dụ đối lập khai thác sự “sai” của các mô hình này, điều này là do bản chất trừu tượng của chúng, cũng như các hạn chế của dữ liệu được lấy mẫu mà chúng được đào tạo. Những nỗ lực gần đây trong lĩnh vực học máy đối lập đã dẫn đến những bước tiến lớn trong việc tăng cường khả năng chống chịu của các mô hình học sâu đối với các cuộc tấn công như vậy. Từ góc độ an ninh, sẽ luôn có cách để đánh lừa các mô hình học máy. Tuy nhiên, mục tiêu thực tế của việc bảo mật các mô hình học máy là tăng chi phí thực hiện các cuộc tấn công như vậy lên đến mức không khả thi về mặt kinh tế.

 

Mục tiêu của bạn là tập trung vào các tính năng an toàn và bảo mật của cả học sâu và học tăng cường sâu. Tại sao điều này lại quan trọng?

Học tăng cường (RL) là phương pháp nổi bật để áp dụng học máy vào các vấn đề điều khiển, điều này theo định nghĩa liên quan đến việc thao túng môi trường của chúng. Do đó, tôi tin rằng các hệ thống dựa trên RL có rủi ro cao hơn nhiều về việc gây ra những thiệt hại lớn trong thế giới thực so với các phương pháp học máy khác như phân loại. Vấn đề này còn được làm trầm trọng hơn bởi việc tích hợp học sâu vào RL, điều này cho phép việc áp dụng RL trong các thiết lập phức tạp. Ngoài ra, tôi cho rằng khuôn khổ RL có liên quan chặt chẽ đến các cơ chế cơ bản của nhận thức trong trí thông minh con người và việc nghiên cứu an toàn và dễ bị tổn thương của nó có thể dẫn đến những hiểu biết tốt hơn về các giới hạn của việc ra quyết định trong tâm trí của chúng ta.

 

Bạn có nghĩ rằng chúng ta đang gần đạt được Trí tuệ Nhân tạo Tổng quát (AGI) không?

Đây là một câu hỏi khó trả lời. Tôi tin rằng chúng ta hiện có các khối xây dựng của một số kiến trúc có thể tạo điều kiện cho sự xuất hiện của AGI. Tuy nhiên, có thể mất vài năm hoặc vài thập kỷ để cải thiện các kiến trúc này và tăng cường hiệu quả chi phí của việc đào tạo và duy trì các kiến trúc này. Trong những năm tới, các tác nhân của chúng ta sẽ trở nên thông minh hơn với tốc độ tăng trưởng nhanh. Tôi không nghĩ rằng sự xuất hiện của AGI sẽ được công bố dưới dạng một [tiêu đề khoa học hợp lệ], mà như là kết quả của tiến bộ dần dần. Ngoài ra, tôi nghĩ rằng chúng ta vẫn chưa có một phương pháp luận được chấp nhận rộng rãi để kiểm tra và phát hiện sự tồn tại của một AGI và điều này có thể làm chậm việc nhận ra các phiên bản đầu tiên của AGI.

 

Làm thế nào chúng ta duy trì an toàn trong một hệ thống AGI có thể suy nghĩ độc lập và có thể thông minh hơn con người gấp nhiều lần?

Tôi tin rằng lý thuyết thống nhất về hành vi thông minh là kinh tế và nghiên cứu về cách các tác nhân hành động và tương tác để đạt được những gì họ muốn. Các quyết định và hành động của con người được xác định bởi các mục tiêu, thông tin và tài nguyên có sẵn. Các xã hội và nỗ lực hợp tác xuất hiện từ những lợi ích của các thành viên cá nhân của các nhóm như vậy. Một ví dụ khác là mã hình sự, gắn một chi phí cao cho các hành động có thể gây hại cho xã hội. Theo cách tương tự, tôi tin rằng kiểm soát các khuyến khích và tài nguyên có thể cho phép sự xuất hiện của một trạng thái cân bằng giữa con người và các phiên bản AGI. Hiện tại, cộng đồng an toàn của AI đang điều tra luận điểm này dưới cái ô của các vấn đề liên kết giá trị.

 

Một trong những lĩnh vực bạn theo dõi chặt chẽ là chống khủng bố. Bạn có lo lắng về việc các tổ chức khủng bố chiếm quyền kiểm soát các hệ thống AI hoặc AGI không?

Có nhiều lo ngại về việc lạm dụng các công nghệ AI. Trong trường hợp của các hoạt động khủng bố, lo ngại chính là sự dễ dàng mà các tổ chức khủng bố có thể phát triển và thực hiện các cuộc tấn công tự động. Một số lượng ngày càng tăng của các đồng nghiệp của tôi đang tích cực cảnh báo về các rủi ro của việc phát triển vũ khí tự động (xem https://autonomousweapons.org/ ). Một trong những vấn đề chính với vũ khí AI là khó kiểm soát công nghệ cơ bản: AI đang ở tiền phong của nghiên cứu nguồn mở và bất kỳ ai có quyền truy cập vào internet và phần cứng tiêu dùng có thể phát triển các hệ thống AI có hại. Tôi nghi ngờ rằng sự xuất hiện của vũ khí tự động là không thể tránh khỏi và tin rằng sẽ sớm có nhu cầu về các giải pháp công nghệ mới để chống lại các vũ khí như vậy. Điều này có thể dẫn đến một chu kỳ mèo và chuột thúc đẩy sự tiến hóa của vũ khí AI, điều này có thể dẫn đến những rủi ro tồn tại nghiêm trọng trong dài hạn.

 

Có gì chúng ta có thể làm để giữ cho các hệ thống AI an toàn khỏi các tác nhân đối lập?

Bước đầu tiên và quan trọng nhất là giáo dục: Tất cả các kỹ sư và nhà thực hành AI cần phải học về các điểm yếu của các công nghệ AI và xem xét các rủi ro liên quan trong việc thiết kế và triển khai các hệ thống của họ. Về các khuyến nghị kỹ thuật, có nhiều đề xuất và khái niệm giải pháp có thể được sử dụng. Ví dụ, đào tạo các tác nhân học máy trong các thiết lập đối lập có thể cải thiện khả năng chống chịu và độ bền của chúng trước các cuộc tấn công trốn tránh và thao túng chính sách (ví dụ, xem bài báo của tôi có tiêu đề “Bất cứ điều gì không giết chết Học tăng cường sâu, đều làm cho nó mạnh mẽ hơn“). Một giải pháp khác là trực tiếp tính đến rủi ro của các cuộc tấn công đối lập trong kiến trúc của tác nhân (ví dụ, các phương pháp tiếp cận Bayesian để mô hình hóa rủi ro). Tuy nhiên, có một khoảng trống lớn trong lĩnh vực này và đó là nhu cầu về các thước đo và phương pháp luận phổ quát để đánh giá độ bền của các tác nhân AI trước các cuộc tấn công đối lập. Các giải pháp hiện tại chủ yếu là ad hoc và không cung cấp các biện pháp chung về khả năng chống chịu trước tất cả các loại tấn công.

 

Có gì khác mà bạn muốn chia sẻ về bất kỳ chủ đề nào trong số này?

Vào năm 2014, Scully và cộng sự đã xuất bản một bài báo tại hội nghị NeurIPS với một chủ đề rất thú vị: “Học máy: Thẻ tín dụng lãi suất cao của Nợ kỹ thuật“. Ngay cả với tất cả các tiến bộ của lĩnh vực này trong những năm qua, tuyên bố này vẫn chưa mất tính hợp lệ. Hiện trạng của AI và học máy không có gì short của sự ngạc nhiên, nhưng chúng ta vẫn chưa lấp đầy một số khoảng trống lớn trong cả các khía cạnh nền tảng và kỹ thuật của AI. Điều này, theo tôi, là thông điệp quan trọng nhất của cuộc trò chuyện của chúng ta. Tất nhiên, tôi không có ý định làm giảm sự áp dụng thương mại của các công nghệ AI, nhưng chỉ muốn cho phép cộng đồng kỹ thuật tính đến các rủi ro và giới hạn của các công nghệ AI hiện tại trong các quyết định của họ.

Tôi thực sự thích tìm hiểu về các thách thức an toàn và bảo mật về các loại hệ thống AI khác nhau. Đây thực sự là điều mà các cá nhân, doanh nghiệp và chính phủ cần phải nhận thức được. Những người đọc muốn tìm hiểu thêm nên truy cập Phòng thí nghiệm Học tập Thông minh An toàn và Bảo mật (SAIL).

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.