Modele și platforme AI

Ce trebuie să știți despre Operatorul OpenAI

mm
Adaugă Unite.AI la sursele tale preferate pe Google

În ultimele săptămâni, OpenAI a pregătit terenul. În timp ce majoritatea utilizatorilor abia începeau să exploreze ChatGPT Tasks – o funcție nouă care permite utilizatorilor să programeze și să declanșeze sarcini – compania se pregătea pentru ceva mult mai semnificativ.

Lansarea de ieri a Operator este încă un semnal clar către direcția în care se îndreaptă inteligența artificială: de la modele care procesează informații la agenți care pot lucra activ alături de noi.

În fiecare zi, petrecem ore nesfârșite navigând pe site-uri, completând formulare, rezervând servicii și gestionând sarcini digitale. Inteligența artificială a stat, în mare parte, pe margine, limitată la a oferi sfaturi sau a procesa text. Operator, împreună cu alte anunțuri recente de agenți, cum ar fi Computer Use de la Anthropic și Project Mariner de la Google (GOOGL ), schimbă această dinamică complet.

Realizarea tehnică aici este semnificativă. OpenAI a creat o inteligență artificială care poate vedea și interacționa cu interfețe web ca un om. Captură imagini cu ecran, înțelege layout-urile vizuale și ia decizii despre unde să cliqueze, ce să tasteze și cum să navigheze.

Aici este ce trebuie să știți despre Agentul Operator: În timp ce multe unelte de inteligență artificială sunt, în esență, blocate în spatele API-urilor și integrărilor specializate, Operator lucrează cu web-ul exact ca și dumneavoastră. Vede ecranul, înțelege contextul și ia acțiune direct.

O privire mai atentă asupra performanței reale a Operatorului

Când companiile de inteligență artificială publică benchmark-uri, este important să se examineze cu atenție ce înseamnă, de fapt, aceste numere. Performanța Operatorului spune o poveste diferită în diferite medii de testare.

Cel mai impresionant metric este rata de succes de 87% a Operatorului pe WebVoyager benchmark. Acest lucru contează pentru că WebVoyager testează site-uri web din lumea reală – platformele pe care le utilizăm zilnic, cum ar fi Amazon (AMZN ) și Google Maps. Acesta nu este un test de laborator controlat. Este o performanță în sălbăticie.

Dar când examinăm alte benchmark-uri, vedem o imagine mai nuanțată:

  • WebArena Benchmark: 58.1% rată de succes. Testează site-uri web simulate pentru sarcini precum cumpărături și gestionarea conținutului. Performanța mai scăzută aici revelează, de fapt, ceva important despre modul în care agenții de inteligență artificială gestionează medii structurate versus medii nestructurate.
  • OSWorld Benchmark: 38.1% rată de succes. Acesta testează sarcini complexe, cu mai multe etape, cum ar fi combinarea fișierelor PDF din e-mailuri. Scăderea semnificativă a performanței ne arată limitele actuale ale agenților de inteligență artificială atunci când sarcinile necesită multiple schimbări de context.

Ce mă interesează despre aceste numere este modul în care ele reflectă modelele de învățare umană. De obicei, performăm mai bine în medii familiare, din lumea reală, decât în scenarii de test artificial. Faptul că Operator excelează pe site-urile web reale, în timp ce luptă cu cele simulate, sugerează că antrenamentul său prioritizează utilitatea practică în detrimentul performanței teoretice.

Aceste benchmark-uri stabilesc noi recorduri în automatizarea browserului, dar ratele de succes variate din diferite teste ne spun ceva crucial despre strategia OpenAI.

Gândiți-vă la navigarea dvs. pe web. Majoritatea sarcinilor sunt straightforward: completarea formularelor, efectuarea de cumpărături, rezervarea de întâlniri. Aici strălucește rata de succes de 87% a Operatorului. Sarcinile mai complexe – unde performanța scade – sunt, de obicei, cele în care supravegherea umană este valoroasă oricum.

Aceste date sugerează că OpenAI face o alegere deliberată: să perfecționeze sarcinile comune mai întâi, apoi să extindă gradual spre operațiuni mai complexe. Este o abordare practică care prioritizează utilitatea imediată în detrimentul capacităților teoretice.

Benchmark-uri pentru agenți de inteligență artificială (OpenAI)

Strategia OpenAI în spatele Operatorului

Abordarea OpenAI cu Operator revelează o strategie atent orchestrată.

Mai întâi, luați în considerare momentul. Rularea recentă a funcțiilor precum ChatGPT Tasks nu a fost doar despre adăugarea de funcții – a fost despre pregătirea utilizatorilor pentru agenți autonomi.

Dar iată ce este cu adevărat interesant: OpenAI plănuiește să expună modelul CUA prin intermediul unui API. Acest lucru înseamnă că dezvoltatorii vor putea crea agenți de utilizare a calculatorului.

Implicațiile pentru acest lucru sunt semnificative:

  1. Potential de integrare
  • Incorporare directă în fluxurile de lucru existente
  • Agenți personalizați pentru nevoi de afaceri specifice
  • Soluții de automatizare specifice industriei
  1. Drumul de dezvoltare viitoare
  • Extinderea către utilizatorii Plus, Team și Enterprise
  • Integrare directă cu ChatGPT
  • Extindere geografică (deși Europa va dura mai mult din cauza cererilor de reglementare)

Parteneriatele strategice sunt, de asemenea, revelatoare. OpenAI încearcă să creeze un întreg ecosistem. Ei lucrează cu companii precum DoorDash (DASH ), Instacart și OpenTable, dar și cu organizații publice, cum ar fi orașul Stockton.

Acest lucru indică un viitor în care agenții de inteligență artificială nu sunt doar asistenți, ci părți integrale ale modului în care interacționăm cu sistemele digitale.

Ce înseamnă, de fapt, acest lucru pentru dumneavoastră

Intrăm într-o fază în care inteligența artificială nu mai răspunde doar la întrebări – ea devine un participant activ în viețile noastre digitale.

Gândiți-vă la sarcinile dvs. zilnice online. Nu la munca complexă, strategică care necesită expertiza dvs., ci la sarcinile repetitive. Vorbesc despre cercetarea opțiunilor de călătorie pe mai multe site-uri, completarea formularelor standardizate, strângerea de date de pe diverse surse web și gestionarea rezervărilor de rutină. Aici Operator elimină, inițial, munca digitală. Dar acesta nu este punctul final. Cu timpul, agenții de inteligență artificială vor putea finaliza fluxuri de lucru din ce în ce mai complexe.

Datele de performanță inițiale ne spun, de asemenea, ceva crucial: Operator excelează la sarcinile web obișnuite, cu o rată de succes de 87%. Utilizatorii care adoptă această tehnologie de la început și învață să o integreze eficient vor avea un avantaj semnificativ de productivitate.

Graficul de integrare revelează abordarea atentă a OpenAI. Ei încep cu utilizatorii Pro din SUA, apoi se extind către utilizatorii Plus, Team și Enterprise, înainte de a integra direct în ChatGPT.

Asistăm la o schimbare fundamentală a modului în care funcționează uneltele de inteligență artificială. Întrebarea reală pe care ar trebui să vi-o puneți nu este dacă să vă adaptați la această schimbare, ci cum să o faceți strategic. Tehnologia va evolua, dar principiul rămâne: inteligența artificială se mută de la a răspunde la întrebări la a lua acțiune. Cei care înțeleg această schimbare de la început vor avea un avantaj semnificativ în modelarea modului în care aceste unelte se integrează în fluxurile lor de lucru.

Alex McFarland este un jurnalist și scriitor de inteligență artificială, care explorează cele mai recente dezvoltări în domeniul inteligenței artificiale. El a colaborat cu numeroase startup-uri de inteligență artificială și publicații din întreaga lume.