Modele i platformy AI

Co musisz wiedzieć o Operatorze OpenAI

mm
Dodaj Unite.AI do preferowanych źródeł w Google

W ciągu ostatnich kilku tygodni OpenAI przygotowywało grunt. Podczas gdy większość użytkowników dopiero zaczynała naprawdę eksplorować Zadania ChatGPT – nową funkcję, która pozwala użytkownikom planować i uruchamiać zadania – firma przygotowywała się do czegoś znacznie bardziej istotnego.

Wczorajsze wydanie Operatora to kolejny wyraźny sygnał, w którym kierunku zmierza sztuczna inteligencja: od modeli, które po prostu przetwarzają informacje, do agentów, które mogą aktywnie współpracować z nami.

Każdego dnia spędzamy niezliczoną ilość godzin na nawigowaniu po stronach internetowych, wypełnianiu formularzy, rezerwowaniu usług i zarządzaniu zadaniami cyfrowymi. Sztuczna inteligencja dotąd głównie obserwowała z boku, ograniczona do udzielania porad lub przetwarzania tekstu. Operator, wraz z niektórymi innymi niedawnymi ogłoszeniami agentów, takimi jak Komputerowy użycie i Projekt Mariner, zmienia tę dynamikę całkowicie.

Osiągnięcie techniczne jest tutaj znaczące. OpenAI stworzyło sztuczną inteligencję, która może widzieć i wchodzić w interakcje z interfejsami internetowymi tak jak czyni to człowiek. Robi zrzuty ekranu, rozumie układ wizualny i podejmuje decyzje o tym, gdzie kliknąć, co wpisać i jak nawigować.

Oto, co musisz wiedzieć o agencie Operator: Podczas gdy wiele narzędzi sztucznej inteligencji jest w zasadzie uwięzionych za interfejsami API i specjalistycznymi integracjami, Operator współpracuje z internetem dokładnie tak, jak ty. Widzi ekran, rozumie kontekst i podejmuje działania bezpośrednio.

Bliższe spojrzenie na prawdziwe wyniki Operatora

Kiedy firmy sztucznej inteligencji publikują benchmarki, ważne jest, aby uważnie przyjrzeć się, co tak naprawdę oznaczają te liczby. Wyniki Operatora opowiadają inną historię w różnych środowiskach testowych.

Najbardziej imponującym wskaźnikiem jest 87% wskaźnik sukcesu Operatora w WebVoyager benchmark. To ma znaczenie, ponieważ WebVoyager testuje prawdziwe strony internetowe – rzeczywiste platformy, których używamy codziennie, takie jak Amazon (AMZN ) i Google Maps. To nie jest kontrolowany test laboratoryjny. To jest wynik w środowisku naturalnym.

Ale gdy spojrzymy na inne benchmarki, widzimy bardziej nuansowany obraz:

  • WebArena Benchmark: 58.1% wskaźnik sukcesu. Testowanie symulowanych stron internetowych dla zadań takich jak zakupy i zarządzanie treścią. Niższy wynik tutaj ujawnia coś istotnego o tym, jak agenci sztucznej inteligencji radzą sobie ze środowiskami strukturalnymi i niestrukturalnymi.
  • OSWorld Benchmark: 38.1% wskaźnik sukcesu. To testuje złożone, wieloetapowe zadania, takie jak łączenie plików PDF z e-maili. Znakomity spadek wyniku pokazuje nam bieżące ograniczenia agentów sztucznej inteligencji, gdy zadania wymagają wielu przełączeń kontekstu.

To, co mnie interesuje w tych liczbach, to to, jak one odbijają się w wzorcach uczenia się ludzi. Zwykle wykonujemy lepiej w środowiskach znanych, rzeczywistych niż w sztucznych scenariuszach testowych. Fakt, że Operator wyróżnia się na rzeczywistych stronach internetowych, a miał trudności z symulowanymi, sugeruje, że jego szkolenie priorytetem jest praktyczna użyteczność nad teoretyczną wydajnością.

Te benchmarki ustanawiają nowe rekordy w automatyzacji przeglądarki, ale różne wskaźniki sukcesu w różnych testach mówią nam coś istotnego o strategii OpenAI.

Pomyśl o swoim własnym przeglądaniu sieci. Większość zadań jest prosta: wypełnianie formularzy, dokonywanie zakupów, rezerwowanie spotkań. To jest tam, gdzie 87% wskaźnik sukcesu Operatora błyszczy. Bardziej złożone zadania – gdzie wynik spada – są zwykle takie, w których nadzór ludzki jest cenny.

To sugeruje, że OpenAI podejmuje świadomą decyzję: doskonalić powszechne zadania najpierw, a następnie stopniowo rozszerzać do bardziej złożonych operacji. To jest praktyczne podejście, które priorytetem jest natychmiastowa użyteczność nad teoretycznymi możliwościami.

AI Agent Benchmarks (OpenAI)

Strategia OpenAI za Operatorem

Podejście OpenAI do Operatora ujawnia starannie zaplanowaną strategię.

Po pierwsze, rozważmy czas. Ostatnie wprowadzenie funkcji, takich jak Zadania ChatGPT, nie było po prostu dodaniem funkcji – było przygotowaniem użytkowników do autonomicznych agentów.

Ale to, co jest naprawdę interesujące: OpenAI planuje udostępnić model CUA za pomocą interfejsu API. To oznacza, że deweloperzy będą mogli tworzyć własne agenty korzystające z komputera.

Wnioski z tego są znaczące:

  1. Potencjał integracji
  • Bezpośrednia integracja z istniejącymi przepływami pracy
  • Niestandardowi agenci dla konkretnych potrzeb biznesowych
  • Rozwiązania do automatyzacji branżowej
  1. Przyszły ścieżka rozwoju
  • Rozszerzenie na użytkowników Plus, Team i Enterprise
  • Bezpośrednia integracja z ChatGPT
  • Rozszerzenie geograficzne (chociaż Europa zajmie więcej czasu ze względu na wymagania regulacyjne)

Strategiczne partnerstwa są również wymowne. OpenAI próbuje stworzyć cały ekosystem. Pracują z firmami, takimi jak DoorDash (DASH ), Instacart i OpenTable, ale także z organizacjami sektora publicznego, takimi jak miasto Stockton.

To wskazuje na przyszłość, w której agenci sztucznej inteligencji nie są tylko asystentami, ale integralnymi częściami, jakimi взаимодействujemy z systemami cyfrowymi.

Co to tak naprawdę oznacza dla Ciebie

Wkraczamy w fazę, w której sztuczna inteligencja nie tylko odpowiada na pytania – staje się aktywnym uczestnikiem naszego cyfrowego życia.

Pomyśl o swoich codziennych zadaniach online. Nie o złożonej, strategicznej pracy, która wymaga Twojej ekspertyzy, ale o powtarzalnych zadaniach. Mówię o badaniu opcji podróży na różnych stronach, wypełnianiu standardowych formularzy, gromadzeniu danych z różnych źródeł internetowych i zarządzaniu rutynowymi rezerwacjami. To jest tam, gdzie Operator początkowo eliminuje cyfrową pracę. Ale to nie jest tam, gdzie się zatrzyma. Z czasem agenci sztucznej inteligencji będą mogli wykonywać coraz bardziej złożone przepływy pracy.

Wczesne dane o wydajności również mówią nam coś istotnego: Operator wyróżnia się w rutynowych zadaniach internetowych z 87% wskaźnikiem sukcesu. Wczesni adopterzy, którzy nauczą się go efektywnie integrować, będą mieli znaczną przewagę produktywności.

Harmonogram integracji ujawnia staranne podejście OpenAI. Zaczynają od użytkowników Pro w Stanach Zjednoczonych, a następnie rozszerzają na użytkowników Plus, Team i Enterprise, zanim w końcu zintegrują go bezpośrednio z ChatGPT.

Obserwujemy fundamentalną zmianę w tym, jak narzędzia sztucznej inteligencji działają. Prawdziwe pytanie, które powinieneś zadać sobie, nie jest czy dostosować się do tej zmiany, ale jak to zrobić strategicznie. Technologia będzie ewoluowała, ale zasada pozostaje: sztuczna inteligencja przechodzi od odpowiadania na pytania do podejmowania działań. Ci, którzy zrozumieją tę zmianę wcześnie, będą mieli znaczną przewagę w kształtowaniu, jak te narzędzia integrują się z ich przepływami pracy.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.