Modele i platformy AI
Obniżenie barier dla deweloperów dzięki uproszczeniu tworzenia agentów AI przez OpenAI
OpenAI właśnie wydał zestaw nowych narzędzi dla deweloperów mających na celu ułatwienie tworzenia agentów AI, które mogą wykonywać złożone zadania w sposób autonomiczny. Ogłoszona w zeszłym tygodniu aktualizacja wprowadza interfejs API Responses, zestaw SDK agentów open-source oraz wbudowane narzędzia do wyszukiwania w sieci, wyszukiwania plików i sterowania komputerem – wszystkie zaprojektowane w celu uproszczenia sposobu, w jaki systemy AI wchodzą w interakcje z informacjami i aplikacjami z świata rzeczywistego.
OpenAI opisuje te agenty jako „systemy, które niezależnie wykonują zadania w imieniu użytkowników”, co oznacza, że mogą one wykonywać procesy wieloetapowe – takie jak badanie tematu lub aktualizacja bazy danych – z minimalnym nadzorem ludzkim. Celem firmy jest obniżenie barier dla deweloperów i firm, aby mogły one wdrożyć potężne asystentów AI, rozszerzając w ten sposób dostęp do zaawansowanych możliwości AI.
Interfejs API Responses: Uproszczenie interakcji agentów
W centrum ogłoszenia OpenAI znajduje się nowy interfejs API Responses, który służy jako ujednolicony interfejs do tworzenia agentów AI. Ten interfejs API łączy możliwości konwersacyjne interfejsu API Chat Completions z funkcjonalnością korzystania z narzędzi poprzedniego interfejsu API Assistants. W praktyce oznacza to, że pojedyncze wywołanie interfejsu API może teraz obsługiwać złożone, wieloetapowe zadania, które mogą wymagać wywołania różnych narzędzi lub źródeł wiedzy.
OpenAI twierdzi, że interfejs API Responses został zaprojektowany w celu uproszczenia rozwoju agentów przez redukcję potrzeby kodu niestandardowego i modyfikacji promtu. „Interfejs API Responses został zaprojektowany dla deweloperów, którzy chcą łatwo łączyć modele OpenAI i wbudowane narzędzia w swoich aplikacjach, bez złożoności integracji z wieloma interfejsami API lub zewnętrznymi dostawcami”, wyjaśniła firma w swoim poście na blogu. Poprzednio deweloperzy często musieli orchestrować wiele wywołań interfejsu API i tworzyć skomplikowane prompty, aby agent AI mógł wykonać coś użytecznego, co było wyzwaniem i czasochłonnym. Z nowym interfejsem API agent może na przykład prowadzić rozmowę z użytkownikiem, wyszukiwać informacje za pomocą wyszukiwania w sieci, a następnie pisać podsumowanie – wszystko w ramach jednego przepływu pracy.
Godne uwagi jest to, że interfejs API Responses jest dostępny dla wszystkich deweloperów bez dodatkowych kosztów poza standardowymi opłatami za użycie. Jest również wstecznie kompatybilny: OpenAI potwierdził, że będzie nadal wspierał swój popularny interfejs API Chat Completions dla prostych przypadków użycia, podczas gdy starszy interfejs API Assistants zostanie wycofany do połowy 2026 roku, gdy jego funkcje zostaną włączone do interfejsu API Responses.
Zestaw SDK agentów open-source upraszcza orchestrację przepływu pracy
Wydanie obejmuje również zestaw SDK agentów, który jest narzędziem do zarządzania przepływem pracy jednego lub nawet wielu wzajemnie oddziałujących agentów AI. W godnym uwagi kroku OpenAI udostępnił ten zestaw SDK jako open-source, umożliwiając deweloperom i przedsiębiorstwom inspekcję kodu i nawet integrację modeli AI innych firm w ich systemach agentów. Ta elastyczność oznacza, że firma może koordynować agenta, który używa modelu GPT-4 OpenAI, oraz innego agenta zasilanego przez inny model AI, wszystko w ramach tego samego frameworku.
Zestaw SDK agentów koncentruje się na orchestracji przepływu pracy – czyli na śledzeniu tego, co robi agent, i jak przekazuje zadania. Zapewnia wbudowane mechanizmy dla rzeczy takich jak:
- Agenci konfigurowalni: ustawianie agentów AI z predefiniowanymi rolami lub instrukcjami dla określonych zadań.
- Inteligentne przekazania: przekazywanie zadań między wieloma agentami lub procesami na podstawie kontekstu (na przykład jeden agent gromadzi dane, a inny agent je analizuje).
- Barierki bezpieczeństwa: zapewnianie, aby agent pozostawał w określonych granicach, z walidacją danych wejściowych i narzędziami moderacji treści, aby zapobiec niepożądanym wyjściom.
- Śledzenie i obserwowalność: narzędzia do monitorowania i debugowania działań agenta krok po kroku, co pomaga deweloperom zrozumieć decyzje i poprawić wydajność.
Według OpenAI, ten zestaw narzędzi może uproszczyć złożone przypadki użycia, takie jak boty wsparcia klienta, asystenci badawczy wieloetapowi, przepływy pracy generowania treści, agenci przeglądu kodu lub automatyzacja prospectingu sprzedaży. Poprzez udostępnienie zestawu SDK jako open-source, OpenAI zachęca również do wkładu społeczności i przyjęcia w środowiskach przedsiębiorstw, gdzie przejrzystość i możliwość samodzielnego hostowania składników są często ważne. Wczesni adopterzy, w tym firmy takie jak Coinbase i Box, już eksperymentowali z zestawem SDK agentów, aby zbudować narzędzia badawcze AI i narzędzia ekstrakcji danych.
Wbudowane narzędzia zwiększają funkcjonalność AI
Aby uczynić agenty AI bardziej funkcjonalnymi od razu, interfejs API Responses OpenAI jest wyposażony w trzy wbudowane narzędzia, które łączą AI z zewnętrznymi danymi i działaniami. Te narzędzia znacznie rozszerzają to, co może zrobić agent, przechodząc poza generowanie tekstu.
Wbudowane narzędzia dostępne przy uruchomieniu to:
- Wyszukiwanie w sieci: Pozwala agentowi AI na przeprowadzanie wyszukiwań w sieci w czasie rzeczywistym i pobieranie najnowszych informacji, wraz z cytowanymi źródłami. To oznacza, że agent może odpowiedzieć na pytania, korzystając z najnowszych wiadomości lub faktów z internetu, i zapewnić odniesienia do przejrzystości. To narzędzie jest przydatne do budowy agentów takich jak asystenci badawczy, przewodniki zakupowe lub planiści podróży, którzy potrzebują informacji na żywo.
- Wyszukiwanie plików: Pozwala agentowi szybko przeszukiwać duże kolekcje dokumentów lub danych, które deweloper udostępnił, w celu znalezienia istotnych informacji. Jest to podstawowo narzędzie do zapytań wiedzy – agent może je wykorzystać, aby odpowiedzieć na pytania wsparcia klienta, wyszukując dokumenty polityki, lub pomóc w badaniach prawnych, pobierając passusy z biblioteki plików. To narzędzie może być wdrożone w scenariuszach takich jak boty wsparcia klienta lub wewnętrzni asystenci firmy, którzy muszą odnosić się do informacji własnościowych.
- Użycie komputera: Nowa możliwość (obecnie w wersji preview badawczej), która pozwala agentowi AI na wykonywanie działań na komputerze, jakby był użytkownikiem ludzkim, który obsługuje maszynę. Napędzany przez model agenta korzystającego z komputera (CUA) OpenAI, to narzędzie tłumaczy intencje AI na działania klawiatury i myszy, aby nawigować w oprogramowaniu, stronach internetowych lub innych interfejsach cyfrowych. W istocie umożliwia automatyzację zadań, które nie mają łatwego interfejsu API – na przykład wprowadzania danych do systemu legacy, klikania przez aplikację internetową do testowania lub sprawdzania informacji na interfejsie graficznym.
Poprzez integrację tych narzędzi, agenci AI mogą nie tylko myśleć przez problem, ale także działać – czy to oznacza wyszukiwanie informacji, pobieranie konkretnych danych czy manipulowanie środowiskiem cyfrowym. To znacznie rozszerza funkcjonalność agenta i czyni go o wiele bardziej przydatnym dla aplikacji świata rzeczywistego.
OpenAI wyobraża sobie, że deweloperzy będą łączyć te narzędzia według potrzeb; na przykład, agent może użyć wyszukiwania w sieci, aby zgromadzić publiczne informacje, a następnie wyszukiwania plików, aby pobrać wewnętrzne dane, a następnie użyć tej połączonej wiedzy, aby wykonać raport lub zadanie. Wszystko to można orchestrować za pomocą interfejsu API Responses w sposób ujednolicony, zamiast wymagać oddzielnych usług lub ręcznej integracji.
Szersze implikacje dla adopcji i dostępności AI
Analitycy twierdzą, że to wydanie może przyspieszyć adopcję agentów AI w różnych branżach, obniżając bariery techniczne. Dla firm atrakcyjność tych nowych narzędzi polega na możliwości zautomatyzowania i skalowania procesów bez konieczności rozległego rozwoju niestandardowego.
Zadania rutynowe, takie jak pobieranie informacji, przetwarzanie formularzy lub wprowadzanie danych między aplikacjami – które mogłyby wymagać znacznego kodowania lub wielu systemów oprogramowania – mogą teraz potencjalnie być obsługiwane przez agenty AI przy użyciu bloków budowlanych OpenAI. Wbudowane narzędzia wyszukiwania, na przykład, pozwalają firmom podłączyć AI do swoich baz wiedzy lub internetu niemal natychmiast, a narzędzie użycia komputera oferuje sposób interakcji z aplikacjami legacy, które nie mają interfejsów API. Tymczasem otwarty charakter zestawu SDK agentów daje przedsiębiorstwom więcej kontroli, pozwalając im integrować te agenty AI ze swoją istniejącą infrastrukturą i nawet korzystać z innych modeli AI, jeśli jest to potrzebne.
Ruch OpenAI jest częścią szerszego wyścigu, aby umożliwić deweloperom tworzenie agentów. Konkurencyjne firmy technologiczne i startupy wydały własne platformy agentów AI, a kompleksowy zestaw narzędzi OpenAI może pomóc mu wyróżnić się. W rzeczywistości timing zbiega się z falą zainteresowania autonomicznymi agentami AI na całym świecie – na przykład chiński startup Monica最近 zwrócił uwagę na swój agent Manus, twierdząc, że może on przewyższyć prototyp agenta OpenAI w określonych zadaniach. Poprzez udostępnienie otwartych części swojej platformy i oferowanie wbudowanych narzędzi, OpenAI zdaje się odpowiadać na presję konkurencyjną, jednocześnie promując szerszą adopcję AI.
Z punktu widzenia dostępności te narzędzia mogą demokratyzować możliwość tworzenia zaawansowanych systemów AI. Mniejsze firmy i nawet indywidualni deweloperzy mogą teraz znaleźć możliwość stworzenia asystenta AI lub przepływu pracy bez potrzeby dużej grupy badawczej. Zintegrowany podejście (gdzie jedno wywołanie interfejsu API może obsługiwać wiele kroków) i dostępność przykładów w dokumentacji OpenAI obniżają barierę wejścia dla nowych osób. OpenAI zapewnia również interfejs obserwowalności dla deweloperów, aby mogli oni śledzić i inspekcjonować, co robi agent, co jest kluczowe dla debugowania i budowania zaufania do danych wyjściowych AI. Ten nacisk na użyteczność i bezpieczeństwo (z barierkami i monitorowaniem) ma zachęcić więcej przedsiębiorstw do eksperymentowania z agentami AI, wiedząc, że mają one nadzór i kontrolę.
Agenci AI mogą stać się tak powszechni i niezbędni, jak posiadanie obecności w internecie. Najnowsze narzędzia OpenAI, poprzez uczynienie rozwoju agentów bardziej przystępnym, mogą pomóc zrealizować tę wizję, umożliwiając znacznie szerszej społeczności deweloperów i organizacji budowanie własnych agentów.












