Lãnh đạo tư tưởng

Hướng Dẫn Hiểu, Xây Dựng và Tối Ưu Hóa Các Agent Gọi API API Danh Sách Việc Cần Làm version: 1.0.0 paths: /tasks: post: tóm tắt: Thêm một nhiệm vụ mới thân yêu cầu: yêu cầu: đúng nội dung: application/json: kế hoạch: loại: đối tượng thuộc tính: mô tả: loại: chuỗi phản hồi: ‘201’: mô tả: Nhiệm vụ được tạo thành công get: tóm tắt: Lấy tất cả các nhiệm vụ phản hồi: ‘200’: mô tả: Danh sách các nhiệm vụ Bước 2: Tiêu Chuẩn Hóa Truy Cập Công Cụ Chuyển đổi thông số kỹ thuật OpenAPI thành các cấu hình Giao Thức Context Mô Hình (MCP). Sử dụng một công cụ như Stainless.ai, điều này có thể tạo ra: Tên Công Cụ Mô Tả Tham Số Đầu Vào Mô Tả Đầu Ra Thêm Nhiệm Vụ Thêm một nhiệm vụ mới vào danh sách việc cần làm. `mô tả` (chuỗi, bắt buộc): Mô tả của nhiệm vụ. Xác nhận tạo nhiệm vụ. Lấy Nhiệm Vụ Lấy tất cả các nhiệm vụ từ danh sách việc cần làm. Không có. Danh sách các nhiệm vụ với mô tả của chúng. Bước 3: Thực Hiện Tác Nhân Sử dụng Pydantic cho việc mô hình hóa dữ liệu, tạo các hàm tương ứng với các công cụ MCP. Sau đó, sử dụng một mô hình ngôn ngữ lớn để giải thích các truy vấn ngôn ngữ tự nhiên và chọn công cụ và tham số phù hợp. Bước 4: Chuẩn Bị Một Tập Dữ Liệu Đánh Giá Chất Lượng Tạo một tập dữ liệu: Truy Vấn Cuộc Gọi API Mong Muốn Kết Quả Mong Muốn “Thêm ‘Mua sắm tạp hóa’ vào danh sách của tôi.” `Thêm Nhiệm Vụ` với `mô tả` = “Mua sắm tạp hóa” Xác nhận tạo nhiệm vụ “Danh sách của tôi là gì?” `Lấy Nhiệm Vụ` Danh sách các nhiệm vụ, bao gồm “Mua sắm tạp hóa” Bước 5: Tối Ưu Hóa Lời Nhắc và Logic của Tác Nhân Sử dụng DSPy để tinh chỉnh lời nhắc, tập trung vào hướng dẫn rõ ràng, lựa chọn công cụ và trích xuất tham số bằng cách sử dụng tập dữ liệu được tạo để đánh giá và cải thiện. Bằng cách tích hợp các khối xây dựng này – từ định nghĩa API được cấu trúc và giao thức công cụ được tiêu chuẩn hóa đến các thực hành dữ liệu nghiêm ngặt và tối ưu hóa hệ thống – các nhóm kỹ thuật có thể xây dựng các tác nhân gọi API mạnh mẽ, đáng tin cậy và bảo trì hơn.

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Vai trò của Trí Tuệ Nhân Tạo trong các công ty công nghệ đang phát triển nhanh chóng; các trường hợp sử dụng AI đã phát triển từ việc xử lý thông tin thụ động sang các tác nhân chủ động có thể thực hiện các nhiệm vụ. Theo một cuộc khảo sát về việc áp dụng AI toàn cầu vào tháng 3 năm 2025 do Georgian và NewtonX thực hiện, 91% các giám đốc điều hành kỹ thuật trong các công ty giai đoạn tăng trưởng và doanh nghiệp được báo cáo đang sử dụng hoặc lên kế hoạch sử dụng AI tác nhân.

Các agent gọi API là một ví dụ chính của sự thay đổi này sang các tác nhân. Các agent gọi API tận dụng các Mô Hình Ngôn Ngữ Lớn (LLM) để tương tác với các hệ thống phần mềm thông qua các Giao Diện Lập Trình Ứng Dụng (API) của chúng.

Ví dụ, bằng cách dịch các lệnh ngôn ngữ tự nhiên thành các cuộc gọi API chính xác, các tác nhân có thể lấy dữ liệu thời gian thực, tự động hóa các nhiệm vụ thường xuyên hoặc thậm chí kiểm soát các hệ thống phần mềm khác. Khả năng này biến các tác nhân AI thành các trung gian hữu ích giữa ý định của con người và chức năng của phần mềm.

Các công ty hiện đang sử dụng các agent gọi API trong các lĩnh vực khác nhau, bao gồm:

  • Ứng Dụng Người Tiêu Dùng: Các trợ lý như Siri của Apple hoặc Alexa của Amazon đã được thiết kế để đơn giản hóa các nhiệm vụ hàng ngày, chẳng hạn như kiểm soát các thiết bị thông minh và đặt chỗ.
  • Quy Trình Làm Việc Doanh Nghiệp: Các doanh nghiệp đã triển khai các agent API để tự động hóa các nhiệm vụ lặp đi lặp lại như lấy dữ liệu từ CRM, tạo báo cáo hoặc hợp nhất thông tin từ các hệ thống nội bộ.
  • Lấy Dữ Liệu và Phân Tích: Các doanh nghiệp đang sử dụng các agent gọi API để đơn giản hóa việc truy cập vào các tập dữ liệu độc quyền, tài nguyên dựa trên đăng ký và API công khai để tạo ra thông tin chi tiết.

Trong bài viết này, tôi sẽ sử dụng một cách tiếp cận kỹ thuật để hiểu, xây dựng và tối ưu hóa các agent gọi API. Nội dung trong bài viết này dựa trên nghiên cứu và phát triển thực tế được thực hiện bởi Phòng Thí Nghiệm AI của Georgian. Câu hỏi thúc đẩy cho nhiều nghiên cứu của Phòng Thí Nghiệm AI trong lĩnh vực các agent gọi API đã là: “Nếu một tổ chức có một API, cách hiệu quả nhất để xây dựng một tác nhân có thể giao tiếp với API đó bằng ngôn ngữ tự nhiên là gì?”

Tôi sẽ giải thích cách các agent gọi API hoạt động và cách kiến trúc và kỹ thuật chúng để đạt được hiệu suất. Cuối cùng, tôi sẽ cung cấp một quy trình làm việc hệ thống mà các nhóm kỹ thuật có thể sử dụng để triển khai các agent gọi API.

I. Định Nghĩa then chốt:

  • API hoặc Giao Diện Lập Trình Ứng Dụng: Một tập hợp các quy tắc và giao thức cho phép các ứng dụng phần mềm khác nhau giao tiếp và trao đổi thông tin.
  • Tác Nhân: Một hệ thống AI được thiết kế để nhận thức môi trường của nó, đưa ra quyết định và thực hiện các hành động để đạt được các mục tiêu cụ thể.
  • Agent Gọi API: Một tác nhân AI chuyên dụng dịch các lệnh ngôn ngữ tự nhiên thành các cuộc gọi API chính xác.
  • Agent Tạo Mã: Một hệ thống AI hỗ trợ phát triển phần mềm bằng cách viết, sửa đổi và gỡ lỗi mã. Mặc dù liên quan, tôi tập trung chủ yếu vào các tác nhân gọi API, mặc dù AI cũng có thể giúp xây dựng các tác nhân này.
  • MCP (Giao Thức Context Mô Hình): Một giao thức, đáng chú ý được phát triển bởi Anthropic, xác định cách các mô hình ngôn ngữ lớn (LLM) có thể kết nối với các công cụ và nguồn dữ liệu bên ngoài.

II. Nhiệm Vụ then chốt: Dịch Ngôn Ngữ Tự Nhiên thành Hành Động API

Chức năng cơ bản của một agent gọi API là giải thích yêu cầu ngôn ngữ tự nhiên của người dùng và chuyển đổi nó thành một hoặc nhiều cuộc gọi API chính xác. Quá trình này thường bao gồm:

  1. Nhận Diện Mục Đích: Hiểu mục tiêu của người dùng, ngay cả khi được thể hiện một cách mơ hồ.
  2. Chọn Công Cụ: Xác định điểm cuối API phù hợp (hoặc “công cụ”) từ một tập hợp các lựa chọn có sẵn có thể thực hiện mục đích.
  3. Trích Xuất Tham Số: Xác định và trích xuất các tham số cần thiết cho cuộc gọi API đã chọn từ truy vấn của người dùng.
  4. Thực Thi và Tạo Đáp Ứng: Thực hiện cuộc gọi API, nhận phản hồi và sau đó tổng hợp thông tin này thành một câu trả lời hợp lý hoặc thực hiện một hành động tiếp theo.

Hãy xem xét một yêu cầu như “Này Siri, thời tiết hôm nay như thế nào?” Tác nhân phải xác định nhu cầu gọi API thời tiết, xác định vị trí hiện tại của người dùng (hoặc cho phép chỉ định vị trí) và sau đó tạo cuộc gọi API để lấy thông tin thời tiết.

Đối với yêu cầu “Này Siri, thời tiết hôm nay như thế nào?”, một cuộc gọi API mẫu có thể trông như thế này:

GET /v1/weather?location=New%20York&units=metric

Các thách thức cấp cao ban đầu là固 có trong quá trình dịch này, bao gồm sự mơ hồ của ngôn ngữ tự nhiên và nhu cầu của tác nhân phải duy trì ngữ cảnh trên các tương tác nhiều bước.

Ví dụ, tác nhân thường phải “nhớ” các phần trước của cuộc trò chuyện hoặc kết quả cuộc gọi API trước đó để thông báo các hành động hiện tại. Mất ngữ cảnh là một chế độ lỗi phổ biến nếu không được quản lý rõ ràng.

III. Kiến Trúc Giải Pháp: Các Thành Phần và Giao Thức then chốt

Xây dựng các agent gọi API hiệu quả đòi hỏi một cách tiếp cận kiến trúc có cấu trúc.

1. Định Nghĩa “Công Cụ” cho Tác Nhân

Để một mô hình ngôn ngữ lớn (LLM) có thể sử dụng một API, các khả năng của API đó phải được mô tả cho nó theo cách nó có thể hiểu. Mỗi điểm cuối API hoặc chức năng thường được đại diện như một “công cụ”. Một định nghĩa công cụ mạnh mẽ bao gồm:

  • Mô tả ngôn ngữ tự nhiên rõ ràng về mục đích và chức năng của công cụ.
  • Qui định chính xác về tham số đầu vào (tên, loại, liệu nó có bắt buộc hoặc tùy chọn và mô tả).
  • Mô tả về đầu ra hoặc dữ liệu mà công cụ trả về.

2. Vai Trò của Giao Thức Context Mô Hình (MCP)

MCP là một yếu tố quan trọng cho việc sử dụng công cụ được tiêu chuẩn hóa và mạnh mẽ hơn bởi các mô hình ngôn ngữ lớn (LLM). Nó cung cấp một định dạng cấu trúc để xác định cách các mô hình có thể kết nối với các công cụ và nguồn dữ liệu bên ngoài.

Tiêu chuẩn hóa MCP có lợi vì nó cho phép tích hợp dễ dàng hơn các công cụ đa dạng, nó thúc đẩy khả năng tái sử dụng các định nghĩa công cụ trên các tác nhân hoặc mô hình khác nhau. Hơn nữa, đây là một thực hành tốt nhất cho các nhóm kỹ thuật, bắt đầu với các thông số kỹ thuật API được xác định rõ ràng, chẳng hạn như thông số kỹ thuật OpenAPI. Các công cụ như Stainless.ai được thiết kế để giúp chuyển đổi các thông số kỹ thuật OpenAPI này thành các cấu hình MCP, giúp đơn giản hóa quá trình làm cho các API “sẵn sàng cho tác nhân”.

3. Khung Nền và Lựa Chọn Thực Hiện Tác Nhân

Một số khung nền có thể hỗ trợ xây dựng chính tác nhân. Chúng bao gồm:

  • Pydantic: Mặc dù không độc quyền là một khung nền tác nhân, Pydantic hữu ích cho việc định nghĩa cấu trúc dữ liệu và đảm bảo an toàn kiểu cho đầu vào và đầu ra công cụ, điều quan trọng cho độ tin cậy. Nhiều triển khai tác nhân tùy chỉnh dựa trên Pydantic cho tính toàn vẹn cấu trúc này.
  • mcp_agent của LastMile: Khung nền này được thiết kế đặc biệt để làm việc với MCP, cung cấp một cấu trúc được quan điểm hơn phù hợp với các thực hành được mô tả trong nghiên cứu từ các địa điểm như Anthropic.
  • Khung Nền Nội Bộ: Điều cũng ngày càng phổ biến là sử dụng các tác nhân tạo mã AI (sử dụng công cụ như Cursor hoặc Cline) để giúp viết mã boilerplate cho tác nhân, công cụ của nó và logic xung quanh. Kinh nghiệm của Phòng Thí Nghiệm AI Georgian khi làm việc với các công ty về các triển khai tác nhân cho thấy điều này có thể tuyệt vời để tạo ra các khung nền tùy chỉnh tối thiểu.

IV. Kỹ Thuật để Độ Tin Cậy và Hiệu Suất

Đảm bảo rằng một tác nhân thực hiện các cuộc gọi API một cách đáng tin cậy và hoạt động tốt đòi hỏi nỗ lực kỹ thuật tập trung. Hai cách để làm điều này là (1) tạo và xác thực tập dữ liệu và (2) kỹ thuật và tối ưu hóa lời nhắc.

1. Tạo và Xác Thực Tập Dữ Liệu

Huấn luyện (nếu áp dụng), thử nghiệm và tối ưu hóa một tác nhân đòi hỏi một tập dữ liệu chất lượng cao. Tập dữ liệu này nên bao gồm các truy vấn ngôn ngữ tự nhiên đại diện và các chuỗi cuộc gọi API mong muốn hoặc kết quả tương ứng.

  • Tạo Thủ Công: Tạo thủ công một tập dữ liệu đảm bảo độ chính xác và liên quan cao nhưng có thể tốn nhiều công sức.
  • Tạo Tổng Hợp: Tạo dữ liệu theo chương trình hoặc sử dụng các mô hình ngôn ngữ lớn có thể mở rộng việc tạo tập dữ liệu, nhưng cách tiếp cận này đưa ra những thách thức đáng kể. Nghiên cứu của Phòng Thí Nghiệm AI Georgian đã tìm thấy rằng đảm bảo tính chính xác và độ phức tạp thực tế của các cuộc gọi API và truy vấn được tạo tổng hợp là rất khó. Thường thì các câu hỏi được tạo ra quá tầm thường hoặc quá phức tạp, khiến việc đo hiệu suất của tác nhân một cách tinh tế trở nên khó khăn. Xác thực cẩn thận dữ liệu tổng hợp là tuyệt đối quan trọng.

Đối với đánh giá quan trọng, một tập dữ liệu nhỏ, chất lượng cao, được xác minh thủ công thường cung cấp thông tin đáng tin cậy hơn so với một tập dữ liệu tổng hợp lớn và ồn ào.

2. Kỹ Thuật và Tối Ưu Hóa Lời Nhắc

Hiệu suất của một tác nhân dựa trên mô hình ngôn ngữ lớn bị ảnh hưởng nặng nề bởi các lời nhắc được sử dụng để hướng dẫn suy luận và lựa chọn công cụ của nó.

  • Lời nhắc hiệu quả liên quan đến việc định nghĩa rõ ràng nhiệm vụ của tác nhân, cung cấp mô tả về các công cụ có sẵn và cấu trúc lời nhắc để khuyến khích việc trích xuất tham số chính xác.
  • Tối ưu hóa hệ thống sử dụng các khung nền như DSPy có thể cải thiện đáng kể hiệu suất. DSPy cho phép bạn định nghĩa các thành phần của tác nhân (ví dụ: mô-đun cho việc tạo suy nghĩ, lựa chọn công cụ, định dạng tham số) và sau đó sử dụng một cách tiếp cận giống như trình biên dịch với các ví dụ vài lần từ tập dữ liệu của bạn để tìm lời nhắc hoặc cấu hình tối ưu cho các thành phần này.

V. Con Đường Khuyến Nghị đến Các Agent API Hiệu Quả

Phát triển các tác nhân AI gọi API mạnh mẽ là một kỷ luật kỹ thuật lặp lại. Dựa trên các phát hiện của nghiên cứu Phòng Thí Nghiệm AI Georgian, các kết quả có thể được cải thiện đáng kể bằng cách sử dụng một quy trình làm việc hệ thống như sau:

  1. Bắt Đầu với Định Nghĩa API Rõ Ràng: Bắt đầu với các thông số kỹ thuật OpenAPI được cấu trúc tốt cho các API mà tác nhân của bạn sẽ tương tác.
  2. Tiêu Chuẩn Hóa Truy Cập Công Cụ: Chuyển đổi các thông số kỹ thuật OpenAPI của bạn thành MCP. Các công cụ như Stainless.ai có thể giúp điều này, tạo ra một cách tiêu chuẩn hóa cho tác nhân của bạn để hiểu và sử dụng các API của bạn.
  3. Thực Hiện Tác Nhân: Chọn một khung nền hoặc cách tiếp cận phù hợp. Điều này có thể liên quan đến việc sử dụng Pydantic cho việc mô hình hóa dữ liệu trong một cấu trúc tác nhân tùy chỉnh hoặc tận dụng một khung nền như mcp_agent của LastMile được xây dựng xung quanh MCP.
    • Trước khi làm điều này, hãy xem xét việc kết nối MCP với một công cụ như Claude Desktop hoặc Cline và sử dụng giao diện này một cách thủ công để cảm nhận cách một tác nhân chung có thể sử dụng nó, bao gồm cả số lần lặp thường cần thiết để sử dụng MCP một cách chính xác và bất kỳ chi tiết nào khác có thể giúp tiết kiệm thời gian trong quá trình thực hiện.
  4. Chuẩn Bị Một Tập Dữ Liệu Đánh Giá Chất Lượng: Tạo thủ công hoặc xác thực cẩn thận một tập dữ liệu các truy vấn và các tương tác API mong muốn. Điều này rất quan trọng cho việc thử nghiệm và tối ưu hóa đáng tin cậy.
  5. Tối Ưu Hóa Lời Nhắc và Logic của Tác Nhân: Sử dụng các khung nền như DSPy để tinh chỉnh lời nhắc và logic nội bộ của tác nhân của bạn, sử dụng tập dữ liệu của bạn để thúc đẩy các cải tiến về độ chính xác và độ tin cậy.

VI. Một Ví Dụ Minh Họa về Quy Trình Làm Việc

Dưới đây là một ví dụ đơn giản minh họa quy trình làm việc được khuyến nghị để xây dựng một tác nhân gọi API:

Bước 1: Bắt Đầu với Định Nghĩa API Rõ Ràng

Hãy tưởng tượng một API để quản lý một danh sách việc cần làm đơn giản, được định nghĩa trong OpenAPI:

openapi: 3.0.0

info:

Rodrigo Ceballos Lentini là Trưởng nhóm Công nghệ AI tại Phòng thí nghiệm AI của Georgian, nơi anh giúp các công ty trong danh mục đầu tư đạt được kết quả cụ thể từ các dự án AI tạo sinh và tác nhân. Rodrigo nắm giữ bằng Thạc sĩ về Hệ thống thần kinh và tính toán với trọng tâm về Thị giác máy tính từ ETH Zürich.