Phỏng vấn

Steve Nemzer, Giám đốc cao cấp, Tăng trưởng & Đổi mới Trí tuệ nhân tạo, TELUS Digital – Loạt phỏng vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Steve Nemzer, Giám đốc cao cấp, Tăng trưởng & Đổi mới Trí tuệ nhân tạo, TELUS Digital, dẫn đầu các sáng kiến tập trung vào việc phát triển dữ liệu đào tạo và cơ sở hạ tầng cho các hệ thống trí tuệ nhân tạo thế hệ tiếp theo. Công việc của ông bao gồm việc phát triển các tập dữ liệu cho các mô hình nghiên cứu sâu, môi trường học tăng cường, dữ liệu mô hình thế giới, các sáng kiến trí tuệ nhân tạo chủ quyền và các khuôn khổ giảm thiểu rủi ro trí tuệ nhân tạo, với sự nhấn mạnh mạnh mẽ vào các thực hành trí tuệ nhân tạo có trách nhiệm như giải quyết sự thiên vị của tập dữ liệu và hỗ trợ điều kiện làm việc công bằng cho những người đào tạo trí tuệ nhân tạo. Sớm trong sự nghiệp của mình, Nemzer đã thành lập VeriTest Labs, giúp các nhà lãnh đạo công nghệ sớm như Microsoft (MSFT ), Intel (INTC ), Oracle (ORCL ) và Sun Microsystems xây dựng các hệ sinh thái phần mềm của bên thứ ba thịnh vượng trước khi công ty được Lionbridge mua lại.

TELUS Digital là một công ty dịch vụ công nghệ toàn cầu giúp các tổ chức thiết kế, xây dựng và vận hành các nền tảng kỹ thuật số và các giải pháp được hỗ trợ bởi trí tuệ nhân tạo. Hoạt động trên hàng chục quốc gia, công ty cung cấp các dịch vụ như dữ liệu đào tạo và chú thích trí tuệ nhân tạo, kỹ thuật sản phẩm kỹ thuật số và quản lý trải nghiệm khách hàng. Các nền tảng và dịch vụ của công ty hỗ trợ các doanh nghiệp trên nhiều ngành công nghiệp, bao gồm công nghệ, tài chính, chăm sóc sức khỏe, viễn thông và trò chơi, khi họ hiện đại hóa hoạt động và triển khai các khả năng trí tuệ nhân tạo tiên tiến.

Với kinh nghiệm của bạn trong lĩnh vực kiểm tra trí tuệ nhân tạo, xác thực dữ liệu và triển khai có trách nhiệm, bạn nhìn nhận sự chuyển đổi từ trí tuệ nhân tạo dựa trên ngôn ngữ sang các mô hình thế giới nhằm lý giải về các tình huống và kết quả thực tế như thế nào, đặc biệt là trong vai trò hiện tại của bạn tại TELUS Digital?

Các mô hình ngôn ngữ lớn (LLM) cơ bản là các hệ thống dự đoán mẫu. Chúng tạo ra các phản hồi bằng cách dự đoán token tiếp theo dựa trên các mẫu được học từ các tập dữ liệu lớn và tĩnh. Mặc dù điều này có thể giống như lý giải, nhưng mô hình thực sự không mô hình hóa cách các hành động thay đổi trạng thái của thế giới.

Các mô hình thế giới tiếp cận theo cách khác. Thay vì dự đoán từ hoặc token tiếp theo, chúng nhằm mục đích dự đoán trạng thái tiếp theo của một hệ thống bằng cách mô hình hóa các chuyển đổi trạng thái. Điều này cho phép các hệ thống mô phỏng cách các môi trường tiến hóa khi phản ứng với các hành động. Trong thực tế, điều đó mở ra cánh cửa cho việc lý giải giả định, nơi một mô hình có thể đánh giá các kết quả có thể khác nhau trước khi đưa ra quyết định. Đối với các hệ thống tương tác, điều này có thể hỗ trợ việc ra quyết định và lập kế hoạch đáng tin cậy hơn.

Sự chuyển đổi này cũng thay đổi cách chúng ta nghĩ về việc triển khai có trách nhiệm. Với các hệ thống trí tuệ nhân tạo truyền thống, phần lớn sự tập trung đã được đặt vào các vấn đề như thiên vị và ảo giác. Khi các mô hình chuyển hướng sang lý giải về môi trường và hành động, các rủi ro khác trở nên nổi bật hơn.

Ví dụ, các tổ chức cần xem xét khoảng cách “sim-to-real”, nơi các hành vi được học trong môi trường mô phỏng có thể không chuyển đổi sạch sẽ vào các điều kiện thực tế. Sự thay đổi phân phối cũng trở thành một mối quan tâm chính, vì các môi trường mà các mô hình gặp phải trong triển khai có thể khác với dữ liệu chúng được đào tạo.

Đây là nơi kiểm tra và xác thực trở nên quan trọng, điều này là một焦 điểm lớn trong vai trò của tôi tại TELUS Digital. Khi các hệ thống trí tuệ nhân tạo chuyển từ việc tạo ngôn ngữ sang các hệ thống tương tác với môi trường và đưa ra quyết định, các tổ chức cần có các khuôn khổ đánh giá nghiêm ngặt để đảm bảo các mô hình hành xử đáng tin cậy trong các điều kiện thực tế.

Nhiều người熟悉 với các mô hình ngôn ngữ lớn, nhưng ít người hiểu rõ về các mô hình thế giới. Hãy giải thích đơn giản về vấn đề mà các mô hình thế giới đang cố gắng giải quyết mà các mô hình LLM cơ bản gặp khó khăn?

Một mô hình thế giới là một hệ thống có thể dự đoán “cái gì xảy ra tiếp theo” cho một trạng thái hiện tại và một hành động. Công thức là: Trạng thái + Hành động → Trạng thái tiếp theo

Nếu tôi đang cầm một quả táo và thả ra, một mô hình thế giới dự đoán quả táo sẽ rơi. Nó không chỉ biết quả táo “trông như thế nào” hoặc người ta “nói về” việc thả quả táo – nó dự đoán kết quả dựa trên sự hiểu biết về vật lý. Một mô hình thế giới tinh vi sẽ dự đoán điều gì sẽ xảy ra nếu tôi làm điều tương tự trên Trạm vũ trụ Quốc tế so với trên bề mặt Trái đất.

Điều này khác với một mô hình LLM. Một mô hình LLM dự đoán: “Cho một chuỗi token này, token tiếp theo là gì?” Nó được đào tạo trên văn bản – những gì con người viết về thế giới, không phải chính thế giới. Nó có thể cho bạn biết rằng quả táo rơi vì nó đã đọc về điều đó. Nhưng nó không có một động cơ vật lý nội bộ để mô phỏng sự rơi.

Nói cách khác, các mô hình LLM tốt trong việc dự đoán thống kê token tiếp theo trong một câu trả lời cho một câu hỏi, nhưng việc hiểu thế giới thực đi xa hơn việc mô tả và gắn kết ngôn ngữ. Các mô hình thế giới nhằm mục đích hiểu cách các tình huống tiến hóa từng bước, điều gì là trạng thái tiếp theo cho một trạng thái hiện tại và hành động sẽ xảy ra, những ràng buộc nào có.

Các mô hình thế giới thường được mô tả như cho phép các hệ thống trí tuệ nhân tạo mô phỏng kết quả trước khi thực hiện hành động. Điều đó trông như thế nào trong thực tế, và chúng ta đang gần với việc nhìn thấy điều này hoạt động đáng tin cậy ngoài môi trường nghiên cứu?

Một thách thức khi trả lời câu hỏi này là thuật ngữ “mô hình thế giới” được sử dụng khá lỏng lẻo, và ý nghĩa có xu hướng thay đổi tùy thuộc vào ngữ cảnh. Một định nghĩa mô hình thế giới đơn giản là chúng cho phép một tác nhân mô phỏng trạng thái môi trường hiện tại và dự đoán các trạng thái tương lai, và lý giải về các kết quả hạ nguồn. Các nhà nghiên cứu có xu hướng phân loại các mô hình thế giới một cách chi tiết hơn dựa trên các phương pháp đại diện và xử lý của chúng. Có các mô hình thế giới tiềm ẩn, которые cô đặc “bản chất” của một môi trường vào một không gian tập trung nhỏ. Có các mô hình thế giới tạo ra các mô hình tạo ra các mô hình hình ảnh khung hình theo khung hình, và có các mô hình Kiến trúc Dự đoán Ghép (JEPA) dự đoán kết quả từ các hành động trong quá khứ.

Các mô hình thế giới tiềm ẩn đã ra khỏi phòng thí nghiệm và hỗ trợ trong các ứng dụng như lái xe tự động, hoạt động kho, hoạt động công nghiệp và nông nghiệp. Các mô hình thế giới tạo ra đang xuất hiện trong việc tạo dữ liệu tổng hợp cho phát triển động cơ trò chơi, cho các trường hợp sử dụng tự lái, các trường hợp sử dụng trí tuệ nhân tạo nhúng cho mô phỏng video về các chuyển động giống con người, và để tạo ra các bản vẽ kiến trúc,

Cách tiếp cận JEPA, được ưa chuộng bởi các nhân vật trong ngành như Yan LeCun, dự đoán kết quả trong một không gian đại diện trừu tượng thay vì tạo ra các pixel. Các robot đã chủ yếu bị giới hạn trong các môi trường được kiểm soát, nhưng JEPA đang thay đổi điều đó, cho phép các robot chuyển hướng đến các môi trường thực tế, mở.

Từ góc độ doanh nghiệp, bạn dự đoán các mô hình thế giới sẽ mang lại giá trị có ý nghĩa đầu tiên, cho dù trong lĩnh vực robot, hệ thống quyết định tự động, bản sao kỹ thuật số hay các môi trường kinh doanh trừu tượng hơn?

Cảm giác của tôi là các bản sao kỹ thuật số có khả năng mang lại giá trị thực tế đầu tiên. Sao chép trạng thái của một hệ thống thế giới thực để chúng ta có thể kiểm tra các kịch bản trước khi hành động. Ví dụ, trong một hệ thống chuỗi cung ứng, một nhà sản xuất có thể xây dựng một bản sao của mạng lưới đối tác thành phần của mình. Mô phỏng có thể được cung cấp bởi dữ liệu cảm biến, nhật ký, dữ liệu telemetry và có thể trả lời các câu hỏi như “Điều gì sẽ xảy ra nếu Eo biển Hormuz bị đóng?” Vì vậy, chúng ta có thể kiểm tra việc chuyển hướng hàng hóa trước khi thực sự thay đổi hậu cần. Điều này giúp chúng ta chuyển từ việc theo dõi một hệ thống trực tiếp sang mô phỏng một hệ thống trực tiếp.

Giá trị có ý nghĩa từ các mô hình thế giới cho robot đang di chuyển song song. Việc có robot hiểu các tính chất cơ bản của vật lý, như ma sát trên bề mặt khi nhặt một vật thể, sẽ thúc đẩy việc triển khai trí tuệ nhân tạo nhúng.

Phần lớn sự nghiệp của bạn đã tập trung vào thu thập dữ liệu, chú thích và xác thực. Làm thế nào các thách thức về dữ liệu thay đổi khi chuyển từ đào tạo văn bản tĩnh sang việc dạy các hệ thống về cách thế giới hành xử theo thời gian?

Tình huống thu thập dữ liệu cho việc kích hoạt mô hình thế giới đòi hỏi một bước ngoặt lớn so với các phương pháp đào tạo LLM ngày hôm qua. Đầu tiên, chúng tôi không có một tập dữ liệu khổng lồ để đào tạo trước. Một số nhà nghiên cứu về robot đã suy đoán rằng chúng tôi chỉ có 1/1000 dữ liệu cần thiết để đào tạo trí tuệ vật lý và các mô hình thế giới, để đạt được điểm hiệu suất tương đương với GPT2.

Vì vậy, sẽ mất một chút thời gian để xây dựng các tập dữ liệu đó. Trong trường hợp của trí tuệ nhân tạo nhúng, chúng tôi sẽ cần hàng triệu giờ dữ liệu đa cảm biến được chú thích. Một số được điều khiển từ xa, một số từ môi trường tổng hợp như Isaac Sim. Tại TELUS Digital, chúng tôi đã chuyển từ văn bản sang dữ liệu đa phương tiện và đa cảm biến và dữ liệu mô phỏng. Tất nhiên, chúng tôi được hỗ trợ bởi nền tảng mạnh mẽ về thu thập và chú thích dữ liệu trong thị giác máy tính. Chúng tôi đã đi đầu trong lĩnh vực này trong nhiều năm.

Beyond sự khan hiếm của dữ liệu đào tạo trước và dữ liệu tinh chỉnh được chú thích, sẽ có nhiều thách thức đào tạo khác khi mở rộng học tăng cường . Có thể có những范式 chuyển đổi mới như GPT và các khái niệm RL cần thiết để thúc đẩy các đột phá về hiệu quả trong các phương pháp đào tạo mô hình thế giới.

Các mô hình thế giới ảnh hưởng đến quyết định thay vì chỉ tạo ra đầu ra. Điều đó giới thiệu những rủi ro an toàn hoặc quản trị mới nào so với các hệ thống trí tuệ nhân tạo tạo ra?

Có nhiều rủi ro an toàn và quản trị, vì các mô hình thế giới vốn dĩ được thiết kế để hỗ trợ các hoạt động của tác nhân. Vì vậy, tất cả các mối quan tâm chúng ta có về thế hệ trí tuệ nhân tạo ngày nay vẫn áp dụng trong kịch bản mô hình thế giới. Chúng ta cần giám sát của con người cho tất cả các quyết định quan trọng, liên quan đến an toàn giao thông, an toàn nghề nghiệp, chăm sóc sức khỏe, tài chính và hoạt động hàng ngày.

Một ví dụ cụ thể về mô hình thế giới là khoảng cách giữa dữ liệu đào tạo mô phỏng và môi trường thực. Một sự thay đổi nhỏ trên bề mặt có thể làm cho thế giới thực trở nên lộn xộn đối với các robot được đào tạo tốt trong mô phỏng.

Một rủi ro khác liên quan đến hành vi của con người. Khi các hệ thống trở nên tự động hơn, con người sẽ bắt đầu dựa vào nó nặng nề, và giám sát có thể trở nên lỏng lẻo, và cuối cùng hệ thống sẽ không nhận được sự hiệu chỉnh cần thiết.

Thiên vị và niềm tin vẫn là những rào cản chính đối với việc áp dụng trí tuệ nhân tạo. Những mối quan tâm này sẽ thay đổi như thế nào khi các hệ thống trí tuệ nhân tạo bắt đầu mô hình hóa và hành động trong các môi trường hoặc môi trường xã hội phức tạp?

Từ công chúng chung đến cấp C-suite, niềm tin và sự tự tin vào các mô hình trí tuệ nhân tạo đã khá thấp và tôi không thấy nó thay đổi nhiều trong ngắn hạn.

Mối quan tâm về sức mạnh của trí tuệ nhân tạo được tập trung vào quá ít tay, về việc trí tuệ nhân tạo lấy đi việc làm, thiên vị trong trí tuệ nhân tạo đặt các nhóm bị đại diện thấp vào tình thế bất lợi, các mô hình đưa ra quyết định ảnh hưởng đến sức khỏe, sự nghiệp và tài chính của một người, các mô hình sử dụng tài sản trí tuệ mà không có sự đồng ý, cũng như mối quan tâm về việc giả mạo trí tuệ nhân tạo, đã rất cao. Các giám đốc điều hành lo lắng về việc xử lý các chuyển đổi lực lượng lao động, bảo mật dữ liệu và tuân thủ quy định, và mất đất cho các đối thủ trong một “cuộc đua vũ trang” trí tuệ nhân tạo.

Các sự phát triển gần đây trong tin tức về áp lực của chính phủ đối với các nhà xây dựng mô hình trí tuệ nhân tạo cơ bản để nới lỏng các điều khoản sử dụng liên quan đến các thứ như vũ khí tự động hoặc giám sát hàng loạt chỉ đang khuếch đại những mối quan tâm này.

Mặt khác, chúng tôi đang thấy những túi nhỏ của việc áp dụng trí tuệ nhân tạo rộng rãi và sự tự tin. Một ví dụ là cách các tác nhân mã hóa đã cất cánh trong vài tháng qua. Các nhà quản lý phát triển phần mềm có niềm tin cao vào các tác nhân mã hóa, và có một sự thay đổi cơ bản trong cách phát triển phần mềm được thực hiện, từ phát triển PRD đến kiểm tra hồi quy sau khi phát hành. Thế giới phát triển phần mềm đang tiến hóa với tốc độ ánh sáng, và nhiều điều đó là do sự tin cậy vào các tác nhân mã hóa hiệu suất cao. Khi sự tự tin của người dùng tăng trưởng trong các trường hợp sử dụng khác, tôi dự đoán việc áp dụng sẽ cất cánh theo cách tương tự.

Các giải pháp để xây dựng niềm tin bao gồm các tập dữ liệu và môi trường đa dạng trong các giai đoạn đào tạo, và kiểm tra căng thẳng và kiểm tra an toàn rộng rãi như một rào cản an toàn trước khi triển khai. Sự giám sát quy định chủ động là điều cần thiết cũng như vậy. Một số người đã đề xuất rằng các nhà xây dựng mô hình cơ bản nên được yêu cầu cung cấp “Báo cáo Tác động Xã hội”, tương tự như Báo cáo Tác động Môi trường (EIR), trước khi các mô hình mới được phát hành.

Tại TELUS Digital, phần lớn công việc liên quan đến việc triển khai trí tuệ nhân tạo quy mô lớn cho các doanh nghiệp thực và người dùng thực. Làm thế nào các ý tưởng như mô hình thế giới giao cắt với các mối quan tâm thực tế như minh bạch, tác động đến lực lượng lao động và duy trì niềm tin của khách hàng?

Để làm rõ, TELUS Digital làm việc cả trực tiếp với các nhà xây dựng mô hình cơ bản và cũng với các doanh nghiệp triển khai mô hình trí tuệ nhân tạo. Khu vực hoạt động của chúng tôi là từ đầu đến cuối:

Câu hỏi về các mối quan tâm thực tế liên quan đến câu hỏi trước về niềm tin. Hãy xem xét niềm tin của lực lượng lao động. Khi các mô hình thế giới được hỗ trợ bởi trí tuệ nhân tạo trở nên phổ biến hơn, các giám đốc điều hành cần phải minh bạch với nhân viên, nhà thầu và khách hàng của họ. Các phương tiện truyền thông rõ ràng là cần thiết về những gì các mô hình tốt, cách chúng được đào tạo, dữ liệu nào được sử dụng để đào tạo chúng, những rào cản nào đã được đặt ra và nơi giám sát của con người tham gia. Các nhà lãnh đạo doanh nghiệp cần chỉ ra giá trị của các mô hình mới cho lực lượng lao động hiện tại, ví dụ như thực hiện tất cả công việc nhàm chán trong một công việc. Và họ cần chỉ ra các đường dẫn chuyển đổi cho các công nhân bị ảnh hưởng có thể đang chuyển sang các công việc mới nổi khi các công việc trước đây ngày càng được thực hiện bởi các mô hình thế giới được hỗ trợ bởi trí tuệ nhân tạo. Các công nhân cổ trắng đang đối mặt với điều này trong thời gian thực, và nhiều công việc thủ công sẽ bị ảnh hưởng trong những năm tới khi tự động hóa được hỗ trợ bởi mô hình thế giới mở rộng.

Có một khoảng cách ngày càng tăng giữa những gì các nhà nghiên cứu trí tuệ nhân tạo hiểu và những gì công chúng nhận thức. Làm thế nào các tổ chức có thể truyền đạt các tiến bộ như mô hình thế giới một cách xây dựng niềm tin mà không phóng đại khả năng của chúng?

Lại nữa, điều này giảm xuống mức minh bạch về các hạn chế của các mô hình và về những gì các mô hình tốt. Truyền đạt cách các mô hình đã được đào tạo để giảm thiểu các thiên vị tiềm ẩn. Những giám sát của con người nào đã được đưa ra. Một số bản demo thực tế về khả năng và trường hợp sử dụng của mô hình, kết hợp với các nghiên cứu dài hạn, có thể đi một dài cách để tăng cường sự tự tin của công chúng và lực lượng lao động.

Cuối cùng, có một sự hiểu lầm phổ biến về mô hình thế giới trí tuệ nhân tạo, dù quá lạc quan hay quá thận trọng, mà bạn nghĩ cần được sửa chữa ngay bây giờ?

Trong mức độ hạn chế mà công chúng được thông báo về các mô hình thế giới, một sự hiểu lầm là các mô hình thế giới cần phải hiểu tất cả vật lý và khoa học để có hiệu quả. Các mô hình thế giới sẽ được triển khai sớm hơn nhiều so với những gì người ta có thể mong đợi vì các trường hợp sử dụng cá nhân có thể được thu hẹp. Một phương tiện tự động cần chỉ hiểu động lực học giao thông và vật lý liên quan đến đường bộ, và cách các điều kiện trạng thái hiện tại (ví dụ: gần một trường trường tiểu học, hoặc sự phổ biến của các SUV gần đó với các hình dạng cao) sẽ ảnh hưởng đến tầm nhìn và ra quyết định của họ. Một phương tiện tự động không cần phải hiểu vật lý cơ bản về cách làm một bánh soufflé để hoạt động.

Cảm ơn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập TELUS Digital.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.