AI-modeller og platforme

Hvad du behøver at vide om OpenAI’s Operator

mm
Føj Unite.AI til dine foretrukne kilder på Google

I løbet af de seneste uger har OpenAI lagt grundstenen. Mens de fleste brugere lige var begyndt at udforske ChatGPT-opgaver – en ny funktion, der giver brugerne mulighed for at planlægge og udløse opgaver – forberedte virksomheden noget langt mere betydningsfuldt.

I går udgav OpenAI Operator, hvilket er endnu et tydeligt signal om, hvor kunstig intelligens er på vej: fra modeller, der blot behandler information, til agenter, der kan arbejde aktivt sammen med os.

Hver dag bruger vi utallige timer på at navigere på websteder, udfylde formulare, bestille tjenester og administrere digitale opgaver. Kunstig intelligens har hovedsageligt set på fra sidelinjen, begrænset til at give råd eller behandle tekst. Operator, sammen med nogle af de andre nylige agent-annonceringer som Anthropics Computer-brug og Googles Projekt Mariner, ændrer denne dynamik helt.

Den tekniske præstation her er betydelig. OpenAI har skabt en kunstig intelligens, der kan se og interagere med webgrænseflader som et menneske. Den fanger skærmbilleder, forstår visuelle layouts og træffer beslutninger om, hvor at klikke, hvad at skrive og hvordan at navigere.

Her er, hvad du behøver at vide om Operator-agenten: Mens mange AI-værktøjer i virkeligheden er fanget bag API’er og specialiserede integrationer, fungerer Operator med websteder præcis som du gør. Den ser på skærmen, forstår konteksten og tager handling direkte.

En nærmere look på Operators reelle præstation

Når AI-virksomheder udgiver benchmark-resultater, er det vigtigt at se nøje på, hvad tallene faktisk betyder. Operators præstation fortæller en anden historie på tværs af forskellige testmiljøer.

Det mest imponerende mål er Operators 87% succesrate på WebVoyager-benchmarket. Dette er vigtigt, fordi WebVoyager tester virkelige websteder – de faktiske platforme, vi bruger dagligt som Amazon (AMZN ) og Google Maps. Dette er ikke en kontrolleret laboratorietest. Det er en præstation i det vilde.

Men når vi ser på andre benchmark-resultater, ser vi et mere nuanceret billede:

  • WebArena-benchmark: 58,1% succesrate. Test af simulerede websteder til opgaver som shopping og indholdsstyring. Den lavere præstation her afslører faktisk noget vigtigt om, hvordan AI-agenter håndterer strukturerede vs. ustrukturerede miljøer.
  • OSWorld-benchmark: 38,1% succesrate. Dette tester komplekse, multi-trins opgaver som kombination af PDF’er fra e-mails. Den betydelige nedgang i præstation viser os de nuværende begrænsninger for AI-agenter, når opgaver kræver multiple kontekstskift.

Hvad der interesserer mig ved disse tal, er, hvordan de spejler menneskelige læringsmønstre. Vi udfører normalt bedre i velkendte, virkelige miljøer end i kunstige testscenarier. Det faktum, at Operator udmærker sig på virkelige websteder, mens den kæmper med simulerede, antyder, at dens træning prioriterer praktisk nytte over teoretisk præstation.

Disse benchmark-resultater sætter nye rekorder i browserautomatisering, men de varierende succesrater på tværs af forskellige testsæt fortæller os noget afgørende om OpenAIs strategi.

Tænk på din egen webbrowsing. De fleste opgaver er ret direkte: udfyldning af formulare, køb, booking af aftaler. Her udmærker Operators 87% succesrate sig. De mere komplekse opgaver – hvor præstationen falder – er typisk dem, hvor menneskelig oversigt er værdifuld alligevel.

Disse data antyder, at OpenAI træffer en bevidst beslutning: perfektionere de almindelige opgaver først, derefter gradvist udvide til mere komplekse operationer. Det er en praktisk tilgang, der prioriterer umiddelbar nytte over teoretiske evner.

AI-agent-benchmark (OpenAI)

OpenAIs strategi bag Operator

OpenAIs tilgang med Operator afslører en omhyggeligt orkestreret strategi.

Først og fremmest skal man overveje timingen. Den nylige udgivelse af funktioner som ChatGPT-opgaver var ikke kun om at tilføje funktioner – det var om at forberede brugerne på autonome agenter.

Men det, der virkelig er interessant, er, at OpenAI planlægger at eksponere CUA-modellen gennem en API. Dette betyder, at udviklere vil kunne skabe deres egne computer-brugende agenter.

Konsekvenserne heraf er betydelige:

  1. Integrationspotential
  • Direkte integration i eksisterende arbejdsgange
  • Brugerdefinerede agenter til specifikke forretningsbehov
  • Branchespecifikke automatiseringsløsninger
  1. Udviklingsvej
  • Udvidelse til Plus-, Team- og Enterprise-brugere
  • Direkte integration med ChatGPT
  • Geografisk udvidelse (omend Europa vil tage længere tid på grund af reguleringskrav)

De strategiske partnerskaber er også afslørende. OpenAI forsøger at skabe et helt økosystem. De samarbejder med virksomheder som DoorDash (DASH ), Instacart og OpenTable, men også med offentlige organisationer som byen Stockton.

Dette peger på en fremtid, hvor AI-agenter ikke blot er assistenter, men integrerede dele af, hvordan vi interagerer med digitale systemer.

Hvad dette faktisk betyder for dig

Vi er ved at gå ind i en fase, hvor AI ikke blot besvarer spørgsmål – det bliver en aktiv deltager i vores digitale liv.

Tænk på dine daglige online-opgaver. Ikke de komplekse, strategiske arbejdsopgaver, der kræver din ekspertise, men de repetitive opgaver. Jeg taler om at forskning i rejsemuligheder på tværs af flere websteder, udfyldning af standardformulare, indsamling af data fra forskellige webkilder og administration af rutinebooking. Her eliminerer Operator først den digitale travlhed. Men her stopper det ikke. Med tiden vil AI-agenter være i stand til at udføre mere og mere komplekse arbejdsgange.

De tidlige præstationsdata fortæller os også noget afgørende: Operator udmærker sig ved rutine-webopgaver med en 87% succesrate. De tidlige brugere, der lærer at integrere det effektivt, vil have en betydelig produktivitetsfordel.

Integrationsplanen afslører OpenAIs omhyggelige tilgang. De starter med Pro-brugere i USA, derefter udvider de til Plus-, Team- og Enterprise-brugere, før de til sidst integrerer direkte i ChatGPT.

Vi er vidne til en grundlæggende ændring i, hvordan AI-værktøjer fungerer. Den virkelige spørgsmål, du bør stille dig selv, er ikke, om du skal tilpasse dig denne ændring, men hvordan du gør det strategisk. Teknologien vil udvikle sig, men princippen forbliver: AI bevæger sig fra at besvare spørgsmål til at tage handling. De, der forstår denne ændring tidligt, vil have en betydelig fordel i formning af, hvordan disse værktøjer integreres i deres arbejdsgange.

Alex McFarland er en AI-journalist og forfatter, der udforsker de seneste udviklinger inden for kunstig intelligens. Han har samarbejdet med talrige AI-startups og publikationer verden over.