AI 모델 및 플랫폼
오픈AI의 Operator에 대해 알아야 할 것

최근 몇 주 동안 오픈AI는 기초 작업을 수행해 왔습니다. 대부분의 사용자가 새 기능인 ChatGPT Tasks를 탐색하기 시작했을 때, 회사는 더 중요한 것을 준비했습니다.
昨日の Operator의 출시로 인공 지능이 어디로 향하는지 명확히 알 수 있습니다. 정보를 처리하는 모델에서 우리와 함께 작업할 수 있는 에이전트로 발전하는 것입니다.
매일 우리는 수많은 시간을 웹사이트를 탐색하고, 양식을 작성하고, 서비스를 예약하고, 디지털 작업을 관리하는 데 소비합니다. 인공지능은 주로 조언을 주거나 텍스트를 처리하는 데만 국한되었습니다. 그러나 Operator와 최근의 다른 에이전트 발표들처럼 Anthropic의 Computer Use와 Google의 Project Mariner는 이러한 동적을 완전히 변경합니다.
기술적으로 이 성과는重大합니다. 오픈AI는 웹 인터페이스를 인간과 같은 방식으로 볼 수 있고 상호 작용할 수 있는 인공지능을 만들었습니다. 화면을 캡처하고, 시각적 레이아웃을 이해하고, 클릭하고, 입력하고, 탐색하는 결정에 대해 생각합니다.
Operator 에이전트에 대해 알아야 할 내용: 대부분의 AI 도구는 API와 특수한 통합 뒤에 갇혀 있지만, Operator는 웹과 상호 작용하는 방식으로 작동합니다. 화면을 보고, 컨텍스트를 이해하고, 직접 행동합니다.
Operator의 실제 성능에 대한 자세한 분석
AI 회사들이 벤치마크를 발표할 때, 실제로 숫자가 무엇을 의미하는지 주의해서 살펴봐야 합니다. Operator의 성능은 다양한 테스트 환경에서 다른 이야기를 합니다.
가장 인상적인 지표는 Operator의 WebVoyager 벤치마크에서 87%의 성공률입니다. 이것은 중요한데, WebVoyager는 실제 웹사이트를 테스트합니다. 즉, 우리가 일상적으로 사용하는 플랫폼인 Amazon과 Google (GOOGL ) Maps를 의미합니다. 이것은 제어된 실험실 테스트가 아닙니다. 실제 환경에서의 성능입니다.
그러나 다른 벤치마크를 살펴보면, 더 세부적인 그림이 나타납니다:
- WebArena 벤치마크: 58.1%의 성공률. 시뮬레이션된 웹사이트에서 쇼핑과 콘텐츠 관리와 같은 작업을 테스트합니다. 여기서의 낮은 성능은 구조화된 환경과 비구조화된 환경에서 AI 에이전트가 어떻게 다르게 처리하는지에 대해 중요한 것을 보여줍니다.
- OSWorld 벤치마크: 38.1%의 성공률. 이메일에서 PDF를 결합하는 것과 같은 복잡한 다단계 작업을 테스트합니다. 여기서의 성능의显著한 하락은 작업이 여러 컨텍스트 전환을 요구할 때 현재 AI 에이전트의 한계를 보여줍니다.
이 숫자에 대해 흥미로운 점은 그것이 인간의 학습 패턴을 반영한다는 것입니다. 우리는 일반적으로 실제 환경에서보다 인공적인 테스트 시나리오에서 더 잘 수행합니다. Operator가 실제 웹사이트에서优秀하게 수행하는 반면 시뮬레이션된 웹사이트에서 어려움을 겪는다는 것은, Operator의 훈련이 실제적인 유용성을 우선시한다는 것을 암시합니다.
이 벤치마크는 브라우저 자동화에서 새로운 기록을 세웠지만, 다양한 테스트에서 성능의 차이는 오픈AI의 전략에 대해 중요한 것을 알려줍니다.
자신의 웹 브라우징을 생각해 보십시오. 대부분의 작업은 간단합니다. 양식을 작성하고, 구매를 하고, 예약을 합니다. Operator의 87%의 성공률이 여기서 빛을 발합니다. 성능이 떨어지는 더 복잡한 작업은 일반적으로 인간의 감독이 가치 있는 작업입니다.
이 데이터는 오픈AI가 의도적으로 선택을 하고 있음을 시사합니다. 일반적인 작업을 먼저 완벽하게 수행한 다음, 점차적으로 더 복잡한 작업으로 확장하는 것입니다. 이것은 실제적인 접근 방식으로, 즉시적인 유용성을 우선시합니다.

AI 에이전트 벤치마크 (오픈AI)
오픈AI의 Operator 전략
오픈AI의 Operator 접근 방식은 세심하게 조직된 전략을 나타냅니다.
먼저, 타이밍을 고려해 보십시오. 최근에 출시된 기능들, 예를 들어 ChatGPT Tasks는 단순히 기능을 추가하는 것이 아니었습니다. 오픈AI는 사용자를 자율 에이전트에 준비시키는 것이었습니다.
그러나真正로 흥미로운 점은 오픈AI가 CUA 모델을 API를 통해 공개할 계획이라는 것입니다. 즉, 개발자들은 자신의 컴퓨터를 사용하는 에이전트를 만들 수 있습니다.
이것의 의미는重大합니다:
- 통합 가능성
- 기존 워크플로에 직접 통합
- 특정 비즈니스 요구에 맞춘 사용자 지정 에이전트
- 산업별 자동화 솔루션
- 미래 개발 경로
- Plus, Team, Enterprise 사용자로의 확장
- 직접적인 ChatGPT 통합
- 지리적 확장 (그러나 유럽은 규제 요구 사항으로 인해 더 오래 걸릴 것입니다)
전략적 파트너십도 의미심장합니다. 오픈AI는 전체 생태계를 만들고자 합니다. DoorDash (DASH ), Instacart, OpenTable와 같은 회사와 함께 작업하고 있으며, Stockton 시와 같은 공공 부문 조직과도 협력하고 있습니다.
이것은 AI 에이전트가 단순한 도우미가 아니라 디지털 시스템과 상호 작용하는 방식의 핵심 부분이 되는 미래를 가리킵니다.
이것이 실제로 당신에게 의미하는 것
우리는 인공지능이 질문에 대답하는 것이 아니라 디지털 생애에서 적극적인 참여자가 되는 단계에 진입하고 있습니다.
일상적인 온라인 작업을 생각해 보십시오. 복잡하고 전략적인 작업이 아닌, 반복적인 작업을 의미합니다. 여러 사이트에서 여행 옵션을 검색하고, 표준화된 양식을 작성하고, 다양한 웹 소스에서 데이터를 수집하고, 일상적인 예약을 관리하는 것을 의미합니다. Operator는 초기에 디지털 바쁨을 제거합니다. 그러나 여기서 멈추지 않을 것입니다. 시간이 지남에 따라 AI 에이전트는 더 복잡한 워크플로를 완료할 수 있습니다.
초기 성능 데이터도 중요한 것을 알려줍니다. Operator는 일상적인 웹 작업에서 87%의 성공률을 보입니다. 효과적으로 통합하는 초기 사용자는显著한 생산성优势를 가질 것입니다.
통합 일정은 오픈AI의 세심한 접근 방식을 나타냅니다. 미국의 Pro 사용자에서 시작하여 Plus, Team, Enterprise 사용자로 확장한 다음, 직접적으로 ChatGPT에 통합합니다.
우리는 인공지능 도구가 작동하는 방식의 근본적인 변화를 보고 있습니다. 실제로 당신이ถาม해야 할 질문은 이 변화에 적응해야 하는지 여부가 아니라, 어떻게 전략적으로 적응할 것인지입니다. 기술은 발전할 것입니다. 그러나 원칙은 같습니다. 인공지능은 질문에 대답하는 것에서 행동을 취하는 것으로 이동하고 있습니다. 이 변화를 초기에 이해하는 사람들은 이러한 도구가 워크플로에 어떻게 통합되는지 형성하는 데显著한优势을 가질 것입니다.












