AI-modeller och plattformar

Vad du behöver veta om OpenAI:s Operator

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Under de senaste veckorna har OpenAI lagt grunden. Medan de flesta användare precis började utforska ChatGPT Tasks – en ny funktion som låter användare schemalägga och utlösa uppgifter – förberedde företaget sig för något mycket mer betydelsefullt.

Gårdsagens utgivning av Operator är ännu ett tydligt tecken på vart konstgjord intelligens är på väg: från modeller som bara bearbetar information till agenter som kan arbeta tillsammans med oss.

Varje dag tillbringar vi otaliga timmar med att navigera på webbplatser, fylla i formulär, boka tjänster och hantera digitala uppgifter. AI har i huvudsak sett på från sidan, begränsad till att ge råd eller bearbeta text. Operator, tillsammans med några av de andra nyliga agentmeddelandena som Anthropics Computer Use och Googles Project Mariner, ändrar denna dynamik helt.

Den tekniska prestationen här är betydande. OpenAI har skapat en AI som kan se och interagera med webbgränssnitt som en människa gör. Den fångar skärmdumpar, förstår visuella layouter och fattar beslut om var man ska klicka, vad man ska skriva och hur man ska navigera.

Här är vad du behöver veta om Operator Agent: Medan många AI-verktyg i princip är instängda bakom API:er och specialanpassade integrationer fungerar Operator med webben precis som du gör. Den ser skärmen, förstår sammanhanget och vidtar åtgärder direkt.

En närmare titt på Operators faktiska prestanda

När AI-företag släpper benchmark-resultat är det viktigt att titta noga på vad siffrorna faktiskt betyder. Operators prestanda berättar en annan historia över olika testmiljöer.

Det mest imponerande måttet är Operators 87% framgångsgrad på WebVoyager-benchmark. Detta är viktigt eftersom WebVoyager testar riktiga webbplatser – de faktiska plattformar vi använder dagligen som Amazon (AMZN ) och Google Maps. Detta är inte en kontrollerad laboratorietest. Det är en prestanda i det vilda.

Men när vi tittar på andra benchmark-resultat ser vi en mer nyanserad bild:

  • WebArena Benchmark: 58.1% framgångsgrad. Testar simulerade webbplatser för uppgifter som shopping och innehållshantering. Den lägre prestandan här avslöjar faktiskt något viktigt om hur AI-agenter hanterar strukturerade kontra ostrukturerade miljöer.
  • OSWorld Benchmark: 38.1% framgångsgrad. Detta testar komplexa, flerstegs-uppgifter som att kombinera PDF:er från e-post. Den betydande minskningen av prestanda visar oss de nuvarande begränsningarna för AI-agenter när uppgifter kräver flera kontextbyten.

Vad som intresserar mig med dessa siffror är hur de speglar mänskliga inlärningsmönster. Vi presterar vanligtvis bättre i bekanta, riktiga miljöer än i artificiella testscenarier. Det faktum att Operator excellerar på riktiga webbplatser medan den kämpar med simulerade webbplatser tyder på att dess utbildning prioriterar praktisk nytta över teoretisk prestanda.

Dessa benchmark-resultat sätter nya rekord i webbläsarautomatisering, men de varierande framgångsgraderna över olika tester berättar oss något avgörande om OpenAI:s strategi.

Tänk på din egen webbläsning. De flesta uppgifter är raka: fylla i formulär, göra inköp, boka möten. Här skiner Operators 87% framgångsgrad. De mer komplexa uppgifterna – där prestandan sjunker – är vanligtvis de där mänsklig tillsyn är värdefull ändå.

Dessa data tyder på att OpenAI gör ett medvetet val: perfektera de vanliga uppgifterna först, sedan gradvis expandera till mer komplexa operationer. Det är ett praktiskt tillvägagångssätt som prioriterar omedelbar nytta över teoretiska förmågor.

AI Agent Benchmark (OpenAI)

OpenAI:s strategi bakom Operator

OpenAI:s tillvägagångssätt med Operator avslöjar en noggrant orkestrerad strategi.

Först, överväg tidpunkten. Den nyliga utrullningen av funktioner som ChatGPT Tasks var inte bara om att lägga till funktioner – det var om att förbereda användare för autonoma agenter.

Men här är vad som verkligen är intressant: OpenAI planerar att exponera CUA-modellen via ett API. Detta innebär att utvecklare kommer att kunna skapa sina egna datoranvändande agenter.

Konsekvenserna för detta är betydande:

  1. Integrationspotential
  • Direkt inkorporering i befintliga arbetsflöden
  • Anpassade agenter för specifika affärsbehov
  • Branschspecifika automatiseringslösningar
  1. Framtida utvecklingsväg
  • Expansionsmöjligheter för Plus, Team och Enterprise-användare
  • Direkt integrering med ChatGPT
  • Geografisk expansion (även om Europa kommer att ta längre tid på grund av regleringskrav)

De strategiska partnerskapen är också avslöjande. OpenAI försöker skapa ett helt ekosystem. De samarbetar med företag som DoorDash (DASH ), Instacart och OpenTable, men också med offentliga organisationer som Stockton City.

Detta pekar på en framtid där AI-agenter inte bara är assistenter utan en integrerad del av hur vi interagerar med digitala system.

Vad detta faktiskt betyder för dig

Vi går in i en fas där AI inte bara svarar på frågor – det blir en aktiv deltagare i våra digitala liv.

Tänk på dina dagliga online-uppgifter. Inte de komplexa, strategiska arbeten som kräver din expertis, utan de repetitiva uppgifterna. Jag pratar om att forska resalternativ över flera webbplatser, fylla i standardformulär, samla data från olika webbkällor och hantera rutinmässiga bokningar. Här eliminerar Operator initialt det digitala arbete. Men detta är inte där det kommer att sluta. Med tiden kommer AI-agenter att kunna slutföra alltmer komplexa arbetsflöden.

De tidiga prestandadata berättar också något avgörande: Operator excellerar vid rutinmässiga webbuppgifter med en 87% framgångsgrad. Tidiga användare som lär sig att integrera den effektivt kommer att ha en betydande produktivitetsfördel.

Integrationsplanen avslöjar OpenAI:s försiktiga tillvägagångssätt. De börjar med Pro-användare i USA, sedan expanderar de till Plus, Team och Enterprise-användare, innan de slutligen integrerar direkt i ChatGPT.

Vi ser en grundläggande förändring i hur AI-verktyg fungerar. Den verkliga frågan du bör ställa dig själv är inte om du ska anpassa dig till denna förändring, utan hur du ska göra det strategiskt. Teknologin kommer att utvecklas, men principen förblir: AI flyttar från att svara på frågor till att vidta åtgärder. De som förstår denna förändring tidigt kommer att ha en betydande fördel i att forma hur dessa verktyg integreras i deras arbetsflöden.

Alex McFarland är en AI-journalist och författare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med många AI-startups och publikationer över hela världen.