Mô hình và nền tảng AI

Từ Ý Định Đến Thực Hiện: Cách Microsoft Chuyển Đổi Mô Hình Ngôn Ngữ Lớn Thành Trí Tuệ Nhân Tạo Hướng Đến Hành Động

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Mô hình ngôn ngữ lớn (LLM) đã thay đổi cách chúng ta xử lý ngôn ngữ tự nhiên. Chúng có thể trả lời câu hỏi, viết mã, và tham gia vào cuộc trò chuyện. Tuy nhiên, chúng còn hạn chế khi thực hiện các nhiệm vụ trong thế giới thực. Ví dụ, một LLM có thể hướng dẫn bạn mua một chiếc áo khoác nhưng không thể đặt hàng cho bạn. Khoảng cách giữa suy nghĩ và hành động là một hạn chế lớn. Người dùng không chỉ cần thông tin; họ muốn kết quả.

Để vượt qua khoảng cách này, Microsoft (MSFT ) đang chuyển đổi LLM thành các tác nhân trí tuệ nhân tạo hướng đến hành động. Bằng cách cho phép chúng lập kế hoạch, phân chia nhiệm vụ, và tham gia vào các tương tác trong thế giới thực, chúng trao quyền cho LLM để quản lý hiệu quả các nhiệm vụ thực tế. Sự thay đổi này có tiềm năng định nghĩa lại những gì LLM có thể làm, biến chúng thành các công cụ tự động hóa các quy trình phức tạp và đơn giản hóa các nhiệm vụ hàng ngày. Hãy cùng xem những gì cần thiết để thực hiện điều này và cách Microsoft đang tiếp cận vấn đề.

Điều LLM Cần Để Hành Động

Để thực hiện các nhiệm vụ trong thế giới thực, LLM cần vượt qua việc hiểu văn bản. Chúng phải tương tác với môi trường kỹ thuật số và vật lý trong khi thích nghi với các điều kiện thay đổi. Dưới đây là một số khả năng chúng cần:

  1. Hiểu Ý Định Của Người Dùng

Để hành động hiệu quả, LLM cần hiểu yêu cầu của người dùng. Đầu vào như văn bản hoặc lệnh giọng nói thường không rõ ràng hoặc không đầy đủ. Hệ thống phải lấp đầy khoảng trống bằng kiến thức và ngữ cảnh của yêu cầu. Các cuộc trò chuyện nhiều bước có thể giúp tinh chỉnh những ý định này, đảm bảo AI hiểu trước khi thực hiện hành động.

  1. Chuyển Ý Định Thành Hành Động

Sau khi hiểu một nhiệm vụ, LLM phải chuyển nó thành các bước có thể thực hiện. Điều này có thể liên quan đến việc nhấp vào các nút, gọi API, hoặc điều khiển thiết bị vật lý. LLM cần điều chỉnh hành động của mình cho phù hợp với nhiệm vụ, thích nghi với môi trường và giải quyết các thách thức khi chúng phát sinh.

  1. Thích Nghi Với Thay Đổi

Các nhiệm vụ trong thế giới thực không luôn diễn ra theo kế hoạch. LLM cần dự đoán vấn đề, điều chỉnh bước, và tìm ra giải pháp thay thế khi vấn đề phát sinh. Ví dụ, nếu một tài nguyên cần thiết không có sẵn, hệ thống nên tìm cách khác để hoàn thành nhiệm vụ. Sự linh hoạt này đảm bảo quá trình không bị đình trệ khi mọi thứ thay đổi.

  1. Chuyên Biệt Hóa Trong Các Nhiệm Vụ Cụ Thể

Mặc dù LLM được thiết kế cho sử dụng chung, chuyên biệt hóa khiến chúng trở nên hiệu quả hơn. Bằng cách tập trung vào các nhiệm vụ cụ thể, những hệ thống này có thể cung cấp kết quả tốt hơn với ít tài nguyên hơn. Điều này đặc biệt quan trọng đối với các thiết bị có khả năng tính toán hạn chế, như điện thoại thông minh hoặc hệ thống nhúng.

Bằng cách phát triển những kỹ năng này, LLM có thể vượt qua việc chỉ xử lý thông tin. Chúng có thể thực hiện các hành động có ý nghĩa, mở đường cho trí tuệ nhân tạo tích hợp liền mạch vào các quy trình làm việc hàng ngày.

Cách Microsoft Chuyển Đổi LLM

Cách tiếp cận của Microsoft trong việc tạo ra trí tuệ nhân tạo hướng đến hành động tuân theo một quy trình có cấu trúc. Mục tiêu chính là cho phép LLM hiểu lệnh, lập kế hoạch hiệu quả, và thực hiện hành động. Dưới đây là cách họ thực hiện:

Bước 1: Thu Thập Và Chuẩn Bị Dữ Liệu

Trong giai đoạn đầu, họ thu thập dữ liệu liên quan đến các trường hợp sử dụng cụ thể của mình: UFO Agent (được mô tả dưới đây). Dữ liệu bao gồm các truy vấn của người dùng, chi tiết môi trường, và hành động cụ thể cho nhiệm vụ. Hai loại dữ liệu khác nhau được thu thập trong giai đoạn này: đầu tiên, họ thu thập dữ liệu kế hoạch nhiệm vụ giúp LLM phác thảo các bước cấp cao cần thiết để hoàn thành một nhiệm vụ. Ví dụ, “Thay đổi kích thước phông chữ trong Word” có thể liên quan đến các bước như chọn văn bản và điều chỉnh thanh công cụ. Thứ hai, họ thu thập dữ liệu hành động nhiệm vụ, cho phép LLM dịch các bước này thành các hướng dẫn chính xác, như nhấp vào các nút cụ thể hoặc sử dụng phím tắt.

Sự kết hợp này cung cấp cho mô hình cả bức tranh lớn và hướng dẫn chi tiết cần thiết để thực hiện nhiệm vụ hiệu quả.

Bước 2: Đào Tạo Mô Hình

Sau khi thu thập dữ liệu, LLM được tinh chỉnh thông qua nhiều phiên đào tạo. Trong bước đầu tiên, LLM được đào tạo để lập kế hoạch nhiệm vụ bằng cách dạy chúng cách chia nhỏ yêu cầu của người dùng thành các bước có thể thực hiện. Dữ liệu được gắn nhãn bởi chuyên gia sau đó được sử dụng để dạy chúng cách dịch các kế hoạch này thành các hành động cụ thể. Để tăng cường khả năng giải quyết vấn đề, LLM đã tham gia vào quá trình khám phá tự tăng cường, cho phép chúng giải quyết các nhiệm vụ chưa được giải quyết và tạo ra các ví dụ mới cho việc học liên tục. Cuối cùng, học tăng cường được áp dụng, sử dụng phản hồi từ thành công và thất bại để cải thiện quyết định của chúng.

Bước 3: Kiểm Tra Ngoại Tuyến

Sau khi đào tạo, mô hình được kiểm tra trong các môi trường được kiểm soát để đảm bảo độ tin cậy. Các chỉ số như Tỷ Lệ Thành Công Nhiệm Vụ (TSR) và Tỷ Lệ Thành Công Bước (SSR) được sử dụng để đo hiệu suất. Ví dụ, kiểm tra một tác nhân quản lý lịch có thể liên quan đến việc xác minh khả năng của nó trong việc lên lịch các cuộc họp và gửi lời mời mà không có lỗi.

Bước 4: Tích Hợp Vào Hệ Thống Thực

Sau khi được xác thực, mô hình được tích hợp vào một khuôn khổ tác nhân. Điều này cho phép nó tương tác với các môi trường thực, như nhấp vào các nút hoặc điều hướng menu. Các công cụ như API Tự động Hóa UI giúp hệ thống xác định và điều khiển các yếu tố giao diện người dùng một cách động.

Ví dụ, nếu được giao nhiệm vụ突出 văn bản trong Word, tác nhân xác định nút突出, chọn văn bản và áp dụng định dạng. Một thành phần bộ nhớ có thể giúp LLM ghi nhớ các hành động trước đó, cho phép nó thích nghi với các kịch bản mới.

Bước 5: Kiểm Tra Trong Thế Giới Thực

Bước cuối cùng là đánh giá trực tuyến. Tại đây, hệ thống được kiểm tra trong các kịch bản thực để đảm bảo nó có thể xử lý các thay đổi và lỗi không lường trước. Ví dụ, một bot hỗ trợ khách hàng có thể hướng dẫn người dùng qua quá trình đặt lại mật khẩu trong khi thích nghi với các đầu vào không chính xác hoặc thông tin bị thiếu. Việc kiểm tra này đảm bảo AI đủ mạnh và sẵn sàng cho sử dụng hàng ngày.

Ví Dụ Thực Tiễn: Tác Nhân UFO

Để展示 cách trí tuệ nhân tạo hướng đến hành động hoạt động, Microsoft đã phát triển Tác Nhân UFO. Hệ thống này được thiết kế để thực hiện các nhiệm vụ trong thế giới thực trong môi trường Windows, biến yêu cầu của người dùng thành hành động hoàn thành.

Ở cốt lõi, Tác Nhân UFO sử dụng một LLM để diễn giải yêu cầu và lập kế hoạch hành động. Ví dụ, nếu người dùng nói, “突出 từ ‘quan trọng’ trong tài liệu này,” tác nhân tương tác với Word để hoàn thành nhiệm vụ. Nó thu thập thông tin ngữ cảnh, như vị trí của các yếu tố điều khiển UI, và sử dụng thông tin này để lập kế hoạch và thực hiện hành động.

Tác Nhân UFO dựa vào các công cụ như Tự động Hóa UI Windows (UIA) API. API này quét các ứng dụng để tìm các yếu tố điều khiển, như nút hoặc menu. Đối với một nhiệm vụ như “Lưu tài liệu dưới dạng PDF,” tác nhân sử dụng UIA để xác định nút “Tệp,” tìm tùy chọn “Lưu dưới dạng,” và thực hiện các bước cần thiết. Bằng cách cấu trúc dữ liệu một cách nhất quán, hệ thống đảm bảo hoạt động trơn tru từ đào tạo đến ứng dụng thực tế.

Chuyển Đổi Thách Thức

Mặc dù đây là một sự phát triển thú vị, việc tạo ra trí tuệ nhân tạo hướng đến hành động đi kèm với thách thức. Khả năng mở rộng là một vấn đề lớn. Đào tạo và triển khai các mô hình này trên nhiều nhiệm vụ đòi hỏi tài nguyên đáng kể. Đảm bảo an toàn và độ tin cậy cũng quan trọng không kém. Các mô hình phải thực hiện nhiệm vụ mà không có hậu quả không mong muốn, đặc biệt trong các môi trường nhạy cảm. Và khi các hệ thống này tương tác với dữ liệu riêng tư, duy trì các tiêu chuẩn đạo đức về quyền riêng tư và bảo mật cũng rất quan trọng.

Lộ trình của Microsoft tập trung vào việc cải thiện hiệu quả, mở rộng các trường hợp sử dụng, và duy trì các tiêu chuẩn đạo đức. Với những tiến bộ này, LLM có thể định nghĩa lại cách trí tuệ nhân tạo tương tác với thế giới, khiến chúng trở nên thực tế, linh hoạt, và hướng đến hành động hơn.

Tương Lai Của Trí Tuệ Nhân Tạo

Việc chuyển đổi LLM thành các tác nhân trí tuệ nhân tạo hướng đến hành động có thể là một yếu tố thay đổi cuộc chơi. Những hệ thống này có thể tự động hóa các nhiệm vụ, đơn giản hóa các quy trình làm việc, và làm cho công nghệ trở nên dễ tiếp cận hơn. Công việc của Microsoft về trí tuệ nhân tạo hướng đến hành động và các công cụ như Tác Nhân UFO chỉ là bước đầu. Khi trí tuệ nhân tạo tiếp tục phát triển, chúng ta có thể mong đợi những hệ thống thông minh, có khả năng hơn, không chỉ tương tác với chúng ta mà còn thực hiện công việc.

Tiến sĩ Tehseen Zia là Giáo sư Liên kết có thời hạn tại Đại học COMSATS Islamabad, nắm giữ bằng Tiến sĩ về Trí tuệ Nhân tạo từ Đại học Công nghệ Vienna, Áo. Chuyên về Trí tuệ Nhân tạo, Học máy, Khoa học Dữ liệu và Thị giác Máy tính, ông đã có những đóng góp đáng kể với các ấn phẩm trên các tạp chí khoa học uy tín. Tiến sĩ Tehseen cũng đã dẫn dắt các dự án công nghiệp khác nhau với tư cách là Điều tra viên Chính và từng là Tư vấn viên Trí tuệ Nhân tạo.