Mô hình và nền tảng AI
Những Điều Bạn Cần Biết Về Operator Của OpenAI

Trong vài tuần qua, OpenAI đã đặt nền móng. Trong khi hầu hết người dùng vừa bắt đầu khám phá ChatGPT Tasks – một tính năng mới cho phép người dùng lên lịch và kích hoạt nhiệm vụ – công ty đã chuẩn bị cho điều gì đó quan trọng hơn nhiều.
Việc phát hành Operator ngày hôm qua là một tín hiệu rõ ràng khác về nơi trí tuệ nhân tạo đang đi: từ các mô hình chỉ xử lý thông tin đến các tác nhân có thể làm việc tích cực cùng chúng ta.
Mỗi ngày, chúng ta dành hàng giờ để điều hướng các trang web, điền vào biểu mẫu, đặt dịch vụ và quản lý nhiệm vụ kỹ thuật số. Trí tuệ nhân tạo đã chủ yếu đứng bên lề, bị giới hạn trong việc đưa ra lời khuyên hoặc xử lý văn bản. Operator, cùng với một số thông báo về tác nhân gần đây như Anthropic’s Computer Use và Google’s (GOOGL ) Project Mariner, thay đổi hoàn toàn động lực này.
Thành tựu kỹ thuật ở đây là đáng kể. OpenAI đã tạo ra một trí tuệ nhân tạo có thể nhìn và tương tác với các giao diện web như một con người. Nó chụp ảnh màn hình, hiểu bố cục trực quan và đưa ra quyết định về nơi nhấp, nhập văn bản và cách điều hướng.
Dưới đây là những gì bạn cần biết về Tác nhân Operator: Trong khi nhiều công cụ trí tuệ nhân tạo cơ bản bị mắc kẹt sau các API và tích hợp chuyên dụng, Operator làm việc với web chính xác như bạn làm. Nó nhìn thấy màn hình, hiểu ngữ cảnh và thực hiện hành động trực tiếp.
Một cái nhìn gần hơn về hiệu suất thực sự của Operator
Khi các công ty trí tuệ nhân tạo phát hành các điểm chuẩn, điều quan trọng là phải xem xét kỹ lưỡng những gì các con số thực sự có nghĩa. Hiệu suất của Operator kể một câu chuyện khác nhau trên các môi trường thử nghiệm khác nhau.
Định mức ấn tượng nhất là tỷ lệ thành công 87% của Operator trên WebVoyager benchmark. Điều này quan trọng vì WebVoyager kiểm tra các trang web thực tế – các nền tảng thực tế chúng ta sử dụng hàng ngày như Amazon (AMZN ) và Google Maps. Đây không phải là một thử nghiệm trong phòng thí nghiệm. Đây là một hiệu suất trong tự nhiên.
Nhưng khi chúng ta xem xét các điểm chuẩn khác, chúng ta thấy một bức tranh tinh tế hơn:
- WebArena Benchmark: 58.1% tỷ lệ thành công. Kiểm tra các trang web mô phỏng cho các nhiệm vụ như mua sắm và quản lý nội dung. Hiệu suất thấp hơn ở đây thực sự tiết lộ điều gì đó quan trọng về cách các tác nhân trí tuệ nhân tạo xử lý các môi trường có cấu trúc so với không có cấu trúc.
- OSWorld Benchmark: 38.1% tỷ lệ thành công. Điều này kiểm tra các nhiệm vụ phức tạp, nhiều bước như kết hợp tệp PDF từ email. Sự giảm đáng kể trong hiệu suất cho thấy chúng ta thấy các giới hạn hiện tại của các tác nhân trí tuệ nhân tạo khi các nhiệm vụ yêu cầu nhiều chuyển đổi ngữ cảnh.
Điều khiến tôi quan tâm về những con số này là cách chúng phản ánh các mẫu học tập của con người. Chúng ta thường thực hiện tốt hơn trong các môi trường thực tế, quen thuộc hơn là trong các kịch bản thử nghiệm nhân tạo. Sự thật rằng Operator vượt trội trên các trang web thực tế trong khi gặp khó khăn với các trang web mô phỏng cho thấy rằng quá trình đào tạo của nó ưu tiên tính hữu dụng thực tế hơn hiệu suất lý thuyết.
Những điểm chuẩn này thiết lập các kỷ lục mới trong tự động hóa trình duyệt, nhưng các tỷ lệ thành công khác nhau trên các thử nghiệm khác nhau cho chúng ta biết điều gì đó quan trọng về chiến lược của OpenAI.
Hãy nghĩ về việc điều hướng web của bạn. Hầu hết các nhiệm vụ đều đơn giản: điền vào biểu mẫu, thực hiện mua hàng, đặt lịch hẹn. Đây là nơi tỷ lệ thành công 87% của Operator tỏa sáng. Các nhiệm vụ phức tạp hơn – nơi hiệu suất giảm – thường là những nơi giám sát của con người có giá trị.
Dữ liệu này cho thấy OpenAI đang đưa ra một lựa chọn có chủ ý: hoàn thiện các nhiệm vụ phổ biến trước, sau đó dần dần mở rộng sang các hoạt động phức tạp hơn. Đây là một cách tiếp cận thực tế ưu tiên tính hữu dụng ngay lập tức hơn các khả năng lý thuyết.

AI Agent Benchmarks (OpenAI)
Chiến lược của OpenAI đằng sau Operator
Cách tiếp cận của OpenAI với Operator tiết lộ một chiến lược được dàn xếp cẩn thận.
Trước hết, hãy xem xét thời gian. Việc phát hành gần đây các tính năng như ChatGPT Tasks không chỉ là thêm tính năng – nó là về việc chuẩn bị người dùng cho các tác nhân tự động.
Nhưng điều gì thực sự thú vị: OpenAI đang lên kế hoạch để lộ mô hình CUA thông qua một API. Điều này có nghĩa là các nhà phát triển sẽ có thể tạo ra các tác nhân sử dụng máy tính của riêng họ.
Các ý nghĩa của điều này là đáng kể:
- Tính năng tích hợp
- Tích hợp trực tiếp vào các quy trình làm việc hiện có
- Tác nhân tùy chỉnh cho các nhu cầu kinh doanh cụ thể
- Giải pháp tự động hóa ngành công nghiệp cụ thể
- Con đường phát triển trong tương lai
- Mở rộng đến người dùng Plus, Team và Enterprise
- Tích hợp trực tiếp ChatGPT
- Mở rộng địa lý (mặc dù châu Âu sẽ mất nhiều thời gian hơn do yêu cầu quy định)
Các đối tác chiến lược cũng rất đáng chú ý. OpenAI đang cố gắng tạo ra một hệ sinh thái hoàn chỉnh. Họ đang làm việc với các công ty như DoorDash (DASH ), Instacart và OpenTable, nhưng cũng với các tổ chức công như Thành phố Stockton.
Điều này cho thấy một tương lai nơi các tác nhân trí tuệ nhân tạo không chỉ là trợ lý mà còn là một phần không thể thiếu của cách chúng ta tương tác với các hệ thống kỹ thuật số.
Điều này thực sự có nghĩa là gì đối với bạn
Chúng ta đang bước vào một giai đoạn mà trí tuệ nhân tạo không chỉ trả lời câu hỏi – nó đang trở thành một người tham gia tích cực trong cuộc sống kỹ thuật số của chúng ta.
Hãy nghĩ về các nhiệm vụ trực tuyến hàng ngày của bạn. Không phải là công việc phức tạp, chiến lược cần chuyên môn của bạn, mà là các nhiệm vụ lặp đi lặp lại. Tôi đang nói về việc nghiên cứu các lựa chọn du lịch trên nhiều trang web, điền vào biểu mẫu tiêu chuẩn, thu thập dữ liệu từ các nguồn web khác nhau và quản lý đặt lịch thường xuyên. Đây là nơi Operator ban đầu loại bỏ công việc bận rộn kỹ thuật số. Nhưng đây không phải là nơi nó sẽ dừng lại. Theo thời gian, các tác nhân trí tuệ nhân tạo sẽ có thể hoàn thành nhiều quy trình làm việc phức tạp hơn.
Dữ liệu hiệu suất ban đầu cũng cho chúng ta biết điều gì đó quan trọng: Operator vượt trội trong các nhiệm vụ web thường xuyên với tỷ lệ thành công 87%. Những người dùng sớm học cách tích hợp nó một cách hiệu quả sẽ có một lợi thế sản xuất đáng kể.
Lịch trình tích hợp cho thấy cách tiếp cận cẩn thận của OpenAI. Họ đang bắt đầu với người dùng Pro ở Mỹ, sau đó mở rộng đến người dùng Plus, Team và Enterprise, trước khi cuối cùng tích hợp trực tiếp vào ChatGPT.
Chúng ta đang chứng kiến một sự thay đổi cơ bản trong cách các công cụ trí tuệ nhân tạo hoạt động. Câu hỏi thực sự bạn nên tự hỏi mình không phải là liệu có nên thích nghi với sự thay đổi này hay không, mà là làm thế nào để làm điều đó một cách chiến lược. Công nghệ sẽ phát triển, nhưng nguyên tắc vẫn còn: Trí tuệ nhân tạo đang chuyển từ trả lời câu hỏi sang thực hiện hành động. Những người hiểu sự thay đổi này sớm sẽ có một lợi thế đáng kể trong việc định hình cách các công cụ này tích hợp vào quy trình làm việc của họ.












