Nền tảng AI

AI Định Hướng là gì? Các hệ thống lên kế hoạch, sử dụng công cụ và hoàn thành nhiệm vụ

Các hệ thống AI Định Hướng không chỉ tạo ra một câu trả lời; chúng theo đuổi mục tiêu thông qua một vòng lặp lập kế hoạch, sử dụng công cụ, quan sát và thích nghi. Dưới đây là cách vòng lặp này hoạt động, nơi các tác nhân tạo ra giá trị, và những gì giữ chúng dưới kiểm soát.

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
An AI decision core coordinating tools and tasks through a looping network

AI Định Hướng là trí tuệ nhân tạo có khả năng theo đuổi một mục tiêu bằng cách quyết định bước tiếp theo, sử dụng công cụ, quan sát kết quả và điều chỉnh cách tiếp cận. Thay vì chỉ tạo ra một phản hồi duy nhất và dừng lại, một tác nhân hoạt động qua một vòng lặp kiểm soát cho đến khi hoàn thành nhiệm vụ, đạt giới hạn, hoặc chuyển lại công việc cho con người.

Sự khác biệt này quan trọng vì các hệ thống AI có tác động lớn nhất đang vượt ra ngoài giao tiếp. Chúng có thể tìm kiếm trên nhiều nguồn, truy vấn cơ sở dữ liệu, chạy mã, vận hành phần mềm, cập nhật hệ thống kinh doanh và phối hợp với các tác nhân khác. Tự chủ cao hơn có thể mở ra nhiều công việc hữu ích hơn, nhưng đồng thời làm tăng tầm quan trọng của độ tin cậy, quyền truy cập, giám sát và kiểm soát của con người.

Điều gì làm cho một hệ thống AI trở thành Định Hướng?

Không có một ngưỡng duy nhất nào biến một mô hình thành tác nhân. Khả năng định hướng tồn tại trên một dải rộng. Ở một đầu, một mô hình ngôn ngữ trả lời một lời nhắc. Ở đầu kia, một hệ thống nhận một mục tiêu rộng, chia nhỏ thành các bước, chọn công cụ, phản hồi thông tin mới và tiếp tục trong một khoảng thời gian dài.

01Nhận mục tiêu

02Lập kế hoạch

03Chọn công cụ

04Quan sát kết quả

05Thích Ứng hoặc Dừng
Một yêu cầu trở thành kết quả qua năm thao tác có thể quan sát.

Tự chủ cũng đa chiều. Một tác nhân có thể tự chọn các truy vấn nghiên cứu nhưng không thể công bố bất kỳ nội dung nào; một tác nhân khác có thể tuân theo một kế hoạch cố định nhưng lại có quyền thay đổi hệ thống sản xuất. Do đó, việc đánh giá “độ định hướng” của một hệ thống cần xem xét riêng rẽ về tự do lập kế hoạch, quyền truy cập công cụ, thời gian hoạt động, khả năng đảo ngược và hậu quả của lỗi.

Một cách kiểm tra hữu ích là hỏi ai quyết định lộ trình. Trong quy trình truyền thống, nhà phát triển xác định thứ tự trước: thực hiện bước A, rồi B, rồi C. Trong hệ thống định hướng, mô hình có một mức độ tự quyết định các bước cần thiết và thứ tự thực hiện. xây dựng các tác nhân hiệu quả của Anthropic cũng nêu rõ sự khác biệt thực tiễn giữa quy trình có đường dẫn mã cố định và các tác nhân tự động chỉ đạo quá trình và việc sử dụng công cụ của riêng mình.

Hầu hết các tác nhân trong môi trường sản xuất kết hợp năm yếu tố:

  • Một mô hình: động cơ suy luận và ngôn ngữ giải thích mục tiêu và chọn hành động.
  • Hướng dẫn: các quy tắc hệ thống, mô tả nhiệm vụ, chính sách và định nghĩa tiêu chuẩn thành công.
  • Công cụ: các hàm cho phép tác nhân tìm kiếm, tính toán, truy xuất dữ liệu, ghi file, gọi API hoặc vận hành giao diện.
  • Trạng thái hoặc bộ nhớ: thông tin được mang từ bước này sang bước khác, đôi khi xuyên suốt các phiên làm việc.
  • Một vòng lặp kiểm soát: môi trường thực thi trả lại kết quả cho mô hình và quyết định tiếp tục, thử lại, yêu cầu trợ giúp hoặc dừng.

Vòng Lặp Tác Nhân: Lập Kế Hoạch, Thực Hiện, Quan Sát và Thích Ứng

Mặc dù cách triển khai khác nhau, một tác nhân thường tuân theo một mẫu bốn giai đoạn lặp lại.

Định Nghĩa
Tác Nhân

Chọn hành động

Thay đổi môi trường
Rút Gọn
Chatbot

Viết phản hồi

Không có quyền công cụ
Cơ chế định nghĩa bảo tồn quyền hạn và bằng chứng; cách rút gọn bỏ đi ranh giới làm cho thuật ngữ có ý nghĩa.
Định Nghĩa Một hệ thống giải thích mục tiêu, chọn hành động, sử dụng công cụ và thích nghi từ kết quả.
Luồng Thông Tin Mục tiêu → kế hoạch → hành động → quan sát → hành động sửa đổi hoặc dừng.
Bằng Chứng Một dấu vết cho thấy lý do mỗi hành động được chọn và liệu nó có tiến gần tới mục tiêu không.
Thất Bại Tác nhân tiếp tục hành động sau khi bằng chứng, quyền hạn hoặc ngân sách đã cạn kiệt.

1. Giải Thích Mục Tiêu

Tác nhân xác định kết quả mong muốn, các ràng buộc liên quan và thông tin còn thiếu. Một mô tả nhiệm vụ mạnh mẽ không chỉ nói gì cần làm, mà còn chỉ ra tiêu chí hoàn thành. “Nghiên cứu công ty này” còn mơ hồ; “tạo một so sánh có trích dẫn của ba báo cáo thường niên gần nhất và đánh dấu các thay đổi quan trọng” là mục tiêu có thể kiểm chứng.

2. Chọn Hành Động

Mô hình có thể trả lời trực tiếp, tạo kế hoạch, gọi công cụ, giao nhiệm vụ phụ cho người khác, hoặc yêu cầu làm rõ. Hành động thường được biểu diễn dưới dạng có cấu trúc để phần mềm có thể xác thực trước khi thực thi. Đây là bước mà thiết kế tác nhân chuyển đầu ra xác suất của mô hình thành một thao tác hệ thống có kiểm soát.

3. Quan Sát Kết Quả

Môi trường thực thi trả lại đầu ra của công cụ, lỗi, thay đổi giao diện hoặc phản hồi môi trường khác. Tác nhân thêm quan sát này vào ngữ cảnh làm việc. Nếu một tìm kiếm trả về bằng chứng yếu hoặc API từ chối đối số, quyết định tiếp theo phải phản ánh trạng thái mới này.

4. Điều Chỉnh hoặc Dừng

Tác nhân đánh giá tiến độ và chọn hành động tiếp theo. Nó có thể sửa kế hoạch, thử công cụ khác, xác minh kết quả, hoặc kết luận mục tiêu đã hoàn thành. OpenAI mô tả kiểu tương tác này như một vòng lặp giữa mô hình, các công cụ và môi trường trong phần thảo luận từ mô hình tới tác nhân.

Mẫu này liên quan đến phương pháp ReAct, trong đó suy luận và hành động được xen kẽ để các quan sát bên ngoài có thể cập nhật suy luận sau này. bài báo ReAct đã giúp định hình thiết kế này như một lựa chọn thay thế cho việc tạo một kế hoạch hoàn chỉnh mà không có phản hồi môi trường.

AI Định Hướng vs. AI Sinh Tạo

AI sinh tạo mô tả các hệ thống tạo ra nội dung mới, chẳng hạn như văn bản, hình ảnh, âm thanh, video hoặc mã. AI định hướng mô tả cách một hệ thống theo đuổi một mục tiêu. Hai khái niệm này có phần chồng chéo nhưng không thay thế cho nhau.

Một mô hình sinh tạo có thể soạn thảo email mà không phải là một tác nhân. Một tác nhân có thể sử dụng mô hình sinh tạo để soạn email, tra cứu người nhận đúng, kiểm tra chính sách, tạo tệp đính kèm và đưa tin nhắn vào hàng đợi xem xét. Mô hình cung cấp trí tuệ; hệ thống tác nhân bao quanh cung cấp công cụ, trạng thái, điều phối và kiểm soát.

Nơi Các Hệ Thống Định Hướng Hữu Ích

Tác nhân có giá trị nhất khi con đường tới mục tiêu không thể được xác định hoàn toàn trước, nhưng tiến trình vẫn có thể được quan sát và kiểm tra. Các ví dụ thường gặp bao gồm:

  • Nghiên cứu: tìm kiếm đa nguồn, lấp đầy khoảng trống, so sánh bằng chứng và biên soạn báo cáo có trích dẫn.
  • Kỹ thuật phần mềm: duyệt kho mã, chỉnh sửa code, chạy kiểm thử, giải thích lỗi và lặp lại.
  • Hoạt động khách hàng: thu thập ngữ cảnh tài khoản, áp dụng chính sách, đề xuất giải pháp và nâng cấp ngoại lệ.
  • Phân tích dữ liệu: chọn bộ dữ liệu, viết truy vấn, kiểm tra bất thường, tạo trực quan và giải thích kết quả.
  • Hoạt động CNTT: điều tra cảnh báo, thu thập chẩn đoán, đề xuất khắc phục và thực thi các runbook đã được phê duyệt.
  • Công việc hành chính: phối hợp lịch, tài liệu, biểu mẫu, phê duyệt và cập nhật trên nhiều hệ thống.

Một quy trình cố định thường tốt hơn khi quy trình ổn định và mọi bước đã được biết. Thêm một tác nhân vào nơi tự động hóa thông thường có thể tăng chi phí và biến động mà không mang lại giá trị thực.

Khi Nào Bạn Nên Sử Dụng Tác Nhân Thay Thế Tự Động Hóa?

Kiến trúc tối ưu phụ thuộc vào hai câu hỏi: lộ trình có thể dự đoán được đến mức nào, và chi phí của một hành động sai là bao nhiêu? Một hệ thống không trở nên tiên tiến hơn chỉ vì nó cho mô hình nhiều tự do hơn. Trong nhiều bối cảnh có rủi ro cao, thiết kế mạnh mẽ thường kết hợp phần mềm quyết định với một thành phần định hướng hẹp.

01Giới hạn phạm vi

02Cấp quyền công cụ

03Phê duyệt tác động

04Ghi nhật ký hành động

05Thực thi dừng
Thất bại trong việc ngăn chặn: Tự chủ không có ranh giới biến một quyết định hợp lý của mô hình thành một hành động không kiểm soát.
Kiểm soát theo cùng thứ tự từ trái sang phải khi hệ thống nhận được quyền hạn.

Một thỏa hiệp hữu ích là định nghĩa quyền hạn có giới hạn. Tác nhân có thể quyết định cách thu thập thông tin, công cụ nào được phép gọi, hoặc cách sửa bản thảo, trong khi mã quyết định giữ các schema, quy tắc truy cập, ngân sách và phê duyệt cuối cùng. Điều này duy trì khả năng thích nghi mà không yêu cầu mô hình xác định quyền hạn của chính nó.

Tại Sao AI Định Hướng Lại Khó Khăn

Một tác nhân có thể đưa ra quyết định hợp lý ở mức cục bộ nhưng đưa toàn bộ nhiệm vụ đi sai hướng. Những lỗi nhỏ có thể tích lũy qua một chuỗi dài, trong khi câu trả lời cuối cùng thuyết phục có thể che giấu một quy trình sai hoặc không an toàn.

Hiệu ứng tích lũy này là một trong những lý do đánh giá tác nhân khác với đánh giá câu trả lời thông thường. Một nhiệm vụ thất bại có thể bắt nguồn từ kế hoạch của mô hình, kết quả công cụ sai lệch, cập nhật trạng thái không chính xác, quyết định dừng quá sớm, hoặc ranh giới quyền hạn không an toàn. Ngược lại, một câu trả lời cuối cùng đúng có thể là sản phẩm của một lộ trình mong manh sẽ thất bại trong lần chạy tiếp theo. Do đó, các nhóm cần cả chỉ số kết quả và bằng chứng ở mức độ hành trình.

Những thách thức chính bao gồm:

  • Độ tin cậy: cùng một nhiệm vụ có thể tạo ra các lộ trình và kết quả khác nhau qua các lần thử.
  • Định vị: mô hình có thể hiểu sai đầu ra của công cụ, trạng thái giao diện hoặc ý định thực tế của người dùng.
  • Quyền truy cập: một tác nhân hữu ích có thể cần quyền truy cập quan trọng, nhưng quyền truy cập rộng mở làm tăng hậu quả của lỗi.
  • Tiêm nhiễm lời nhắc: nội dung không tin cậy có thể chứa các hướng dẫn nhằm chuyển hướng tác nhân hoặc rò rỉ dữ liệu.
  • Chi phí và độ trễ: mỗi lần gọi mô hình, mỗi lần gọi công cụ, mỗi bước xác thực hoặc mỗi tác nhân phụ đều tốn tài nguyên và thời gian.
  • Đánh giá: chỉ xét kết quả cuối cùng có thể bỏ qua lý luận mong manh, vi phạm chính sách hoặc may mắn thành công.

Cách Để Giữ Một Tác Nhân AI Dưới Kiểm Soát

Tự chủ an toàn phải được thiết kế, không phải giả định. Tác nhân nên nhận được tối thiểu công cụ và dữ liệu cần thiết cho nhiệm vụ. Các hành động có tác động lớn—như gửi tin nhắn, chuyển tiền, xóa dữ liệu hoặc thay đổi hệ thống sản xuất—cần có sự phê duyệt rõ ràng hoặc chính sách hạn chế chặt chẽ.

Hệ thống mạnh mẽ còn tách biệt việc lập kế hoạch và thực thi. Các đối số công cụ có thể được xác thực theo schema; hành động có thể chạy trong sandbox; các thao tác nhạy cảm có thể được liệt kê vào danh sách cho phép; và đầu ra có thể được kiểm tra trước khi trở thành đầu vào cho hệ thống khác. Ngân sách về thời gian, token và hành động ngăn chặn tác nhân bị lặp vô hạn.

Khả năng quan sát cũng quan trọng không kém. Các nhóm cần ghi lại toàn bộ hướng dẫn, lời gọi công cụ, quan sát trung gian, phê duyệt, lỗi và kết quả cuối cùng. Hành trình này giúp việc gỡ lỗi và đánh giá trở nên khả thi. Công trình của Anthropic về tác nhân đáng tin cậy trong thực tiễn nhấn mạnh ranh giới quyền hạn rõ ràng và kiểm soát con người có ý nghĩa là yêu cầu thiết kế cốt lõi.

Khả năng đảo ngược nên định hình các kiểm soát này. Đọc một trang web công cộng dễ dàng hoàn tác vì không thay đổi gì; hoàn trả tiền, gửi email cho khách hàng hoặc xóa tài nguyên đám mây thì không. Một hệ thống tác nhân trưởng thành sẽ phân loại hành động theo hậu quả, yêu cầu cấp phép mạnh hơn cho các thao tác khó đảo ngược và giao quyết định cuối cùng—cho phép thực thi hay không—cho môi trường chứ không phải cho mô hình.

AI Định Hướng Không Có Nghĩa Là

“Định hướng” không đồng nghĩa với có ý thức, tự nhận thức hoặc động lực độc lập. Sự chủ động bề ngoài của hệ thống xuất phát từ một mô hình hoạt động trong phần mềm, liên tục được yêu cầu chọn bước tiếp theo. Mục tiêu, công cụ, quyền truy cập, điều kiện dừng và môi trường đều do con người thiết kế.

Nó cũng không bảo đảm trí tuệ chung. Một tác nhân có thể rất mạnh trong một môi trường hẹp nhưng lại dễ gãy khi giao diện, dữ liệu hoặc nhiệm vụ thay đổi. Do đó, mức độ tự chủ nên được hiệu chỉnh dựa trên hiệu suất đã chứng minh, không phải dựa trên cách mô hình nói năng.

Những Điều Cần Nhớ Về AI Định Hướng

AI Định Hướng biến một mô hình từ công cụ tạo phản hồi thành một thành phần của hệ thống hướng tới mục tiêu. Đặc điểm quyết định không phải là một mô hình hay giao thức cụ thể; mà là vòng lặp khép kín trong đó hệ thống chọn hành động, sử dụng công cụ, quan sát những gì đã xảy ra và thích nghi.

Những tác nhân hiệu quả nhất kết hợp tính linh hoạt này với phạm vi hẹp, quyền truy cập tối thiểu, hành trình có thể quan sát, đánh giá chặt chẽ và kiểm soát con người tại các ranh giới quan trọng. Câu hỏi trung tâm không còn chỉ “Mô hình có thể đưa ra câu trả lời đúng không?” mà còn “Toàn bộ hệ thống có thể đạt được kết quả đúng thông qua một quy trình mà chúng ta có thể tin cậy không?”

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.