AI-modeller och plattformar

Utvecklarens barriärer sänks när OpenAI förenklar skapandet av AI-agenter

mm
Lägg till Unite.AI bland dina föredragna källor på Google

OpenAI har nyligen släppt ett paket med nya utvecklarverktyg som syftar till att göra det lättare att skapa AI-agenter som kan utföra komplexa uppgifter på egen hand. Tillkännagivandet som gjordes i förra veckan introducerar en Responses API, en open-source Agents SDK och inbyggda verktyg för webbsökning, filsökning och datorkontroll – allt designat för att förenkla hur AI-system interagerar med verkliga information och applikationer​.

OpenAI beskriver dessa agenter som “system som oberoende utför uppgifter på användarnas vägnar”​, vilket innebär att de kan utföra multi-stegsprocesser – som att forska om ett ämne eller uppdatera en databas – med minimal mänsklig vägledning. Företagets mål är att sänka tröskeln för utvecklare och företag att distribuera kraftfulla AI-drivna assistenter, vilket därmed utökar tillgängligheten till avancerade AI-funktioner.

Responses API: Förenklar agentinteraktioner

I centrum av OpenAI:s tillkännagivande ligger den nya Responses API, som fungerar som en enhetlig gränssnitt för att bygga AI-agenter. Denna API kombinerar de konversationsmässiga förmågorna i OpenAI:s Chat Completions API med verktygsfunktionerna i deras tidigare Assistants API​. I praktiken innebär detta att ett enda API-anrop nu kan hantera komplexa, multi-stegsuppgifter som kan involvera att anropa olika verktyg eller kunskapskällor.

OpenAI säger att Responses API utvecklades för att förenkla agentutveckling genom att minska behovet av anpassad kod och promptjustering. ”Responses API är utformat för utvecklare som vill enkelt kombinera OpenAI-modeller och inbyggda verktyg i sina appar, utan komplexiteten i att integrera flera API:er eller externa leverantörer,” förklarade företaget i sitt tillkännagivandeinlägg​. Tidigare var utvecklare ofta tvungna att orkestrera flera API-anrop och skapa elaborerade promptrar för att få en AI-agent att göra något användbart, vilket var utmanande och tidskrävande​. Med den nya API:n kan en agent till exempel ha en konversation med en användare, söka information via webbsökning, sedan skriva en sammanfattning – allt inom en arbetsflöde.

Det är värt att notera att Responses API är tillgänglig för alla utvecklare utan extra kostnad utöver standardavgifter​. Den är också bakåtkompatibel: OpenAI bekräftade att de kommer att fortsätta stödja sin populära Chat Completions API för enkla användningsfall, medan den äldre Assistants API kommer att fasas ut i mitten av 2026 när dess funktioner införlivas i Responses API​.

Open-Source Agents SDK förenklar arbetsflödesorkestrering

Lanseringen inkluderar också Agents SDK, ett verktyg för att hantera arbetsflöden för en eller flera interagerande AI-agenter. I ett anmärkningsvärt drag har OpenAI gjort denna SDK open source, vilket tillåter utvecklare och företag att inspektera koden och till och med integrera icke-OpenAI-modeller i sina agentsystem​. Denna flexibilitet innebär att ett företag kan koordinera en agent som använder OpenAI:s GPT-4 tillsammans med en annan agent som drivs av en annan AI-modell, allt inom samma ram.

Agents SDK fokuserar på arbetsflödesorkestrering – i princip, att hålla reda på vad en agent gör och hur den lämnar över uppgifter. Den tillhandahåller inbyggda mekanismer för saker som:

  • Konfigurerbara agenter: inställning av AI-agenter med fördefinierade roller eller instruktioner för specifika uppgifter​.
  • Intelligenta överlämningar: överföring av uppgifter mellan flera agenter eller processer baserat på sammanhang (till exempel en agent som samlar in data, sedan en annan agent analyserar den)​.
  • Säkerhetsräcken: säkerställande att agenten stannar inom vissa gränser, med indatavalidering och innehållsmoderering för att förhindra oönskade utdata.
  • Spårning och observerbarhet: verktyg för att övervaka och felsöka en agents åtgärder steg för steg, vilket hjälper utvecklare att förstå beslut och förbättra prestanda​.

Enligt OpenAI kan detta verktyg förenkla komplexa användningsfall som kundsupportbotar, flerstegsforskningsassistenter, innehållsgenereringsarbetsflöden, kodgranskningsagenter eller försäljningsprospektautomation​. Genom att göra SDK:n open source uppmuntrar OpenAI också communitybidrag och antagande i företagsmiljöer, där transparens och möjligheten att självständigt värd olika komponenter ofta är viktiga. Tidiga antagare, inklusive företag som Coinbase och Box, har redan experimenterat med Agents SDK för att bygga AI-drivna forsknings- och dataextraktionsverktyg​.

Inbyggda verktyg förbättrar AI-funktionalitet

För att göra AI-agenter mer funktionella direkt ur lådan kommer OpenAI:s Responses API med tre inbyggda verktyg som kopplar AI till yttre data och åtgärder. Dessa verktyg utökar betydligt vad en agent kan göra, bortom att bara generera text.

De inbyggda verktygen som är tillgängliga vid lanseringen är:

  • Webbsökning: Tillåter en AI-agent att utföra realtidswebbsökningar och hämta uppdaterad information, komplett med citerade källor. Detta innebär att en agent kan svara på frågor med hjälp av de senaste nyheterna eller faktan från internet och tillhandahålla referenser för transparens. Detta verktyg är användbart för att bygga agenter som forskningsassistenter, shoppingguider eller reseplanerare som behöver levande information​.
  • Filsökning: Låter en agent snabbt gå igenom stora samlingar av dokument eller data som en utvecklare har tillhandahållit, för att hitta relevant information​. Detta är i princip ett privat kunskapsbasverktyg – en agent kunde använda det för att svara på kundsupportfrågor genom att leta upp policysdokument eller assistera i juridisk forskning genom att hämta passager från en bibliotek av filer. Detta verktyg kan distribueras i scenarier som kundservicebotar eller interna företagsassistenter som behöver referera till proprietär information​.
  • Datorkontroll: En ny funktion (för närvarande i forskningsförhandsvisning) som tillåter en AI-agent att utföra åtgärder på en dator som om den vore en mänsklig användare som opererar maskinen​. Driven av OpenAI:s datorkontrollmodell (CUA) översätter detta verktyg AI:s avsikter till tangentbords- och musåtgärder för att navigera i program, webbapplikationer eller andra digitala gränssnitt​. I själva verket möjliggör det automatisering av uppgifter som inte har en lätt API – till exempel att mata in data i ett äldre system, klicka igenom en webbapplikation för testning eller kontrollera information på ett grafiskt gränssnitt.

Genom att integrera dessa verktyg kan AI-agenter inte bara tänka igenom ett problem utan också agera – antingen det innebär att söka efter information, hämta specifik data eller manipulera en digital miljö. Detta utökar betydligt en agents funktionalitet och gör den mycket mer användbar för verkliga tillämpningar.

OpenAI ser att utvecklare kommer att kombinera dessa verktyg efter behov; till exempel kan en agent använda webbsökning för att samla in offentlig information och filsökning för att hämta intern data, sedan använda den kombinerade kunskapen för att utarbeta en rapport eller utföra en uppgift. Allt detta kan orkestreras via Responses API på ett enhetligt sätt, snarare än att kräva separata tjänster eller manuell integration.

Större implikationer för AI-antagande och tillgänglighet

Analytiker säger att denna lansering kan accelerera antagandet av AI-agenter över branscher genom att sänka tekniska hinder. För företag är lockelsen med dessa nya verktyg förmågan att automatisera och skala processer utan omfattande anpassad utveckling​.

Rutinerade uppgifter som informationshämtning, formbearbetning eller datainmatning mellan appar – som tidigare kunde ha krävt betydande programmering eller flera programvarusystem – kan nu potentiellt hanteras av AI-agenter med hjälp av OpenAI:s byggblock. De inbyggda sökverktygen, till exempel, låter företag ansluta AI till sina kunskapsdatabaser eller webben nästan omedelbart, och datorkontrollverktyget erbjuder ett sätt att gränssnitt mot äldre applikationer som inte har API:er​. Samtidigt ger den open-source-karaktären hos Agents SDK företag mer kontroll, vilket tillåter dem att integrera dessa AI-agenter i sin befintliga infrastruktur och till och med använda olika AI-modeller vid behov​.

OpenAI:s drag är en del av en större tävling för att ge utvecklare agentbyggnadskapacitet. Konkurrerande teknikföretag och startup-företag har lanserat sina egna AI-agentplattformar, och OpenAI:s omfattande verktyg kan hjälpa dem att sticka ut. Faktum är att timingen kommer mitt i en våg av intresse för autonoma AI-agenter globalt – till exempel har det kinesiska startup-företaget Monica nyligen fått uppmärksamhet för sin agent Manus, som påstår att den kan överträffa OpenAI:s egen prototypagent i vissa uppgifter​. Genom att öppna källkoden för viktiga delar av sin plattform och erbjuda inbyggda verktyg verkar OpenAI svara på konkurrenstryck samtidigt som de främjar en bredare antagande av AI.

Ur ett tillgänglighetsperspektiv kan dessa verktyg demokratisera vem som kan bygga avancerade AI-system. Mindre företag och till och med enskilda utvecklare kan nu finna det möjligt att skapa en AI-driven assistent eller arbetsflöde utan att behöva en stor forskargrupp. Den integrerade metoden (där ett API-anrop kan hantera flera steg) och tillgängligheten av exempel i OpenAI:s dokumentation sänker inträdesbarriären för nykomlingar. OpenAI tillhandahåller också ett gränssnitt för observabilitet för utvecklare att spåra och inspektera vad agenten gör, vilket är avgörande för felsökning och byggande av förtroende för AI-utdata​. Denna fokus på användbarhet och säkerhet (med räcken och övervakning) förväntas uppmuntra fler företag att experimentera med AI-agenter, med vetskapen att de har tillsyn och kontroll.

AI-agenter kunde bli lika vanliga och essentiella som att ha en internetnärvaro. OpenAI:s senaste verktyg, genom att göra agentutveckling mer tillgänglig, kunde hjälpa till att förverkliga den visionen genom att möjliggöra för en mycket bredare samling utvecklare och organisationer att bygga sina egna agenter.

Alex leder Unite.AI:s AI‑drivna nyhetsverksamhet och kombinerar journalistik, forskning och automation för att stödja snabb och skalbar bevakning av artificiell intelligens. Hans arbete bidrar till att nya AI‑utvecklingar framträder effektivt samtidigt som publikationen upprätthåller sina redaktionella standarder.