Vordenker
Leitfaden zum Verständnis, Erstellen und Optimieren von API-Aufruf-Agents To-Do-Liste-API version: 1.0.0 paths: /tasks: post: zusammenfassung: Neue Aufgabe hinzufügen anforderungskörper: erforderlich: true inhalt: anwendung/json: schema: typ: obj eigenschaften: beschreibung: typ: zeichenfolge antworten: ‘201’: beschreibung: Aufgabe erfolgreich erstellt get: zusammenfassung: Alle Aufgaben abrufen antworten: ‘200’: beschreibung: Liste der Aufgaben Schritt 2: Standardisieren Sie den Tool-Zugriff Konvertieren Sie die OpenAPI-Spezifikation in Model Context Protocol (MCP)-Konfigurationen. Mit einem Tool wie Stainless.ai könnte dies wie folgt aussehen: Tool-Name Beschreibung Eingabeparameter Ausgabebeschreibung Aufgabe hinzufügen Fügt eine neue Aufgabe zur To-Do-Liste hinzu. `beschreibung` (zeichenfolge, erforderlich): Die Beschreibung der Aufgabe. Bestätigung der Aufgabenerstellung. Aufgaben abrufen Ruft alle Aufgaben aus der To-Do-Liste ab. Keine Eine Liste von Aufgaben mit ihren Beschreibungen. Schritt 3: Implementieren Sie den Agenten Verwenden Sie Pydantic für die Datenmodellierung, erstellen Sie Funktionen, die den MCP-Tools entsprechen. Dann verwenden Sie ein LLM, um natürliche Sprachabfragen zu interpretieren und das geeignete Tool und die Parameter auszuwählen. Schritt 4: Erstellen Sie einen qualitativ hochwertigen Bewertungsdatensatz Erstellen Sie einen Datensatz: Abfrage Erwarteter API-Aufruf Erwartetes Ergebnis “Fügen Sie ‘Einkäufe erledigen’ meiner Liste hinzu.” `Aufgabe hinzufügen` mit `beschreibung` = “Einkäufe erledigen” Bestätigung der Aufgabenerstellung “Was ist auf meiner Liste?” `Aufgaben abrufen` Liste von Aufgaben, einschließlich “Einkäufe erledigen” Schritt 5: Optimieren Sie die Prompts und Logik des Agenten Verwenden Sie DSPy, um die Prompts zu verfeinern, indem Sie sich auf klare Anweisungen, Tool-Auswahl und Parameter-Extraktion konzentrieren, und verwenden Sie den kuratierten Datensatz für die Bewertung und Verbesserung. Indem Sie diese Bausteine – von strukturierten API-Definitionen und standardisierten Tool-Protokollen bis hin zu strengen Datenpraktiken und systematischer Optimierung – integrieren, können Ingenieursteams leistungsfähigere, zuverlässigere und wartbare API-Aufruf-Agents erstellen.

Die Rolle von künstlicher Intelligenz in Technologieunternehmen entwickelt sich rasch; die Anwendungsfälle von künstlicher Intelligenz haben sich von der passiven Informationsverarbeitung zu proaktiven Agenten entwickelt, die Aufgaben ausführen können. Laut einer Umfrage von März 2025 über die globale Adoption von künstlicher Intelligenz, die von Georgian und NewtonX durchgeführt wurde, nutzen oder planen 91% der technischen Führungskräfte in Wachstums- und Unternehmensunternehmen die Verwendung von agenterischer künstlicher Intelligenz.
API-Aufruf-Agents sind ein primäres Beispiel für diese Verlagerung zu Agenten. API-Aufruf-Agents nutzen Large Language Models (LLMs), um über ihre Application Programming Interfaces (APIs) mit Softwaresystemen zu interagieren.
Beispielsweise können Agents durch die Übersetzung von natürlichen Sprachbefehlen in präzise API-Aufrufe Echtzeit-Daten abrufen, Routineaufgaben automatisieren oder sogar andere Softwaresysteme steuern. Diese Fähigkeit verwandelt künstliche Intelligenz-Agents in nützliche Vermittler zwischen menschlicher Absicht und Softwaresystemen.
Unternehmen nutzen derzeit API-Aufruf-Agents in verschiedenen Bereichen, darunter:
- Consumer-Anwendungen: Assistenten wie Apples Siri oder Amazons Alexa sind dafür entwickelt worden, tägliche Aufgaben zu vereinfachen, wie z.B. die Steuerung von Smart-Home-Geräten und das Buchen von Reservierungen.
- Unternehmens-Workflows: Unternehmen haben API-Agents eingesetzt, um wiederkehrende Aufgaben wie das Abrufen von Daten aus CRM-Systemen, das Erstellen von Berichten oder das Konsolidieren von Informationen aus internen Systemen zu automatisieren.
- Datenabruf und -analyse: Unternehmen nutzen API-Agents, um den Zugriff auf proprietäre Datensätze, abonnementbasierte Ressourcen und öffentliche APIs zu vereinfachen, um Erkenntnisse zu gewinnen.
In diesem Artikel werde ich einen ingenieurzentrierten Ansatz zum Verständnis, Erstellen und Optimieren von API-Aufruf-Agents verwenden. Der Inhalt dieses Artikels basiert teilweise auf den praktischen Forschungen und Entwicklungen, die von Georgians AI-Lab durchgeführt wurden. Die motivierende Frage für viel von der Forschung des AI-Lab im Bereich von API-Aufruf-Agents lautet: “Wenn eine Organisation eine API hat, was ist der effektivste Weg, einen Agenten zu erstellen, der mit dieser API über natürliche Sprache kommunizieren kann?”
Ich werde erklären, wie API-Aufruf-Agents funktionieren und wie man sie erfolgreich architektiert und konstruiert, um ihre Leistung zu erzielen. Schließlich werde ich einen systematischen Workflow bereitstellen, den Ingenieursteams verwenden können, um API-Aufruf-Agents zu implementieren.
I. Schlüsseldefinitionen:
- API oder Application Programming Interface: Eine Menge von Regeln und Protokollen, die es verschiedenen Softwaresystemen ermöglichen, miteinander zu kommunizieren und Informationen auszutauschen.
- Agent: Ein künstliches Intelligenz-System, das darauf ausgelegt ist, seine Umgebung wahrzunehmen, Entscheidungen zu treffen und Aktionen auszuführen, um bestimmte Ziele zu erreichen.
- API-Aufruf-Agent: Ein spezialisierter künstlicher Intelligenz-Agent, der natürliche Sprachanweisungen in präzise API-Aufrufe übersetzt.
- Code-Generierungs-Agent: Ein künstliches Intelligenz-System, das bei der Softwareentwicklung hilft, indem es Code schreibt, modifiziert und debuggt. Obwohl dies damit verwandt ist, liegt mein Fokus hier hauptsächlich auf Agenten, die APIs aufrufen, obwohl künstliche Intelligenz auch helfen kann, diese Agenten zu erstellen.
- MCP (Model Context Protocol): Ein Protokoll, das insbesondere von Anthropic entwickelt wurde, um zu definieren, wie LLMs mit externen Tools und Datenquellen verbunden werden können.
II. Kernaufgabe: Übersetzung von natürlicher Sprache in API-Aktionen
Die grundlegende Funktion eines API-Aufruf-Agents besteht darin, eine natürliche Sprachanfrage des Benutzers zu interpretieren und sie in einen oder mehrere präzise API-Aufrufe umzuwandeln. Dieser Prozess umfasst typischerweise:
- Intent-Erkennung: Verständnis des Benutzerziels, auch wenn es mehrdeutig ausgedrückt wird.
- Tool-Auswahl: Identifizierung der geeigneten API-Endpunkte (oder “Tools”) aus einer Menge verfügbarer Optionen, die das Intent erfüllen können.
- Parameter-Extraktion: Identifizierung und Extraktion der notwendigen Parameter für den ausgewählten API-Aufruf (oder Aufrufe) aus der Benutzeranfrage.
- Ausführung und Antwortgenerierung: Ausführen des API-Aufrufs (oder Aufrufe), Empfangen der Antwort (oder Antworten) und dann Synthese dieser Informationen in eine kohärente Antwort oder Ausführung einer nachfolgenden Aktion.
Betrachten Sie eine Anfrage wie “Hey Siri, wie ist das Wetter heute?” Der Agent muss die Notwendigkeit erkennen, einen Wetter-API-Aufruf zu tätigen, den aktuellen Standort des Benutzers bestimmen (oder die Angabe eines Standorts zulassen) und dann den API-Aufruf formulieren, um die Wetterinformationen abzurufen.
Für die Anfrage “Hey Siri, wie ist das Wetter heute?” könnte ein Beispiel-API-Aufruf wie folgt aussehen:
GET /v1/weather?location=New%20York&units=metric
Die anfänglichen hochrangigen Herausforderungen sind in diesem Übersetzungsprozess inhärent, einschließlich der Mehrdeutigkeit der natürlichen Sprache und der Notwendigkeit für den Agenten, den Kontext über mehrstufige Interaktionen hinweg beizubehalten.
Beispielsweise muss der Agent oft “merken”, was in früheren Teilen einer Konversation oder früheren API-Aufruf-Ergebnissen besprochen wurde, um aktuelle Aktionen zu informieren. Kontextverlust ist ein häufiger Fehlermodus, wenn er nicht explizit verwaltet wird.
III. Architektur der Lösung: Schlüsselkomponenten und Protokolle
Das Erstellen effektiver API-Aufruf-Agents erfordert einen strukturierten architektonischen Ansatz.
1. Definieren von “Tools” für den Agenten
Damit ein LLM eine API nutzen kann, müssen die Fähigkeiten dieser API in einer Weise beschrieben werden, die es verstehen kann. Jeder API-Endpunkt oder jede Funktion wird oft als “Tool” dargestellt. Eine robuste Tool-Definition umfasst:
- Eine klare, natürliche Sprachbeschreibung des Tool-Zwecks und der Funktionalität.
- Eine präzise Spezifikation seiner Eingabeparameter (Name, Typ, ob es erforderlich oder optional ist und eine Beschreibung).
- Eine Beschreibung der Ausgabe oder der Daten, die das Tool zurückgibt.
2. Die Rolle des Model Context Protocol (MCP)
MCP ist ein entscheidender Enabler für eine standardisiertere und robustere Tool-Nutzung durch LLMs. Es bietet ein strukturiertes Format für die Definition, wie Modelle mit externen Tools und Datenquellen verbunden werden können.
Die Standardisierung von MCP ist vorteilhaft, da sie eine einfachere Integration verschiedener Tools ermöglicht, die Wiederverwendbarkeit von Tool-Definitionen über verschiedene Agenten oder Modelle fördert. Darüber hinaus ist es eine bewährte Methode für Ingenieursteams, die mit gut definierten API-Spezifikationen beginnen, wie z.B. einer OpenAPI-Spezifikation. Tools wie Stainless.ai sind darauf ausgelegt, diese OpenAPI-Spezifikationen in MCP-Konfigurationen umzuwandeln, wodurch der Prozess des “Agenten-Ready”-Machens von APIs erleichtert wird.
3. Agenten-Frameworks und Implementierungswahl
Es gibt mehrere Frameworks, die beim Erstellen des Agenten selbst helfen können. Dazu gehören:
- Pydantic: Obwohl es nicht ausschließlich ein Agenten-Framework ist, ist Pydantic nützlich für die Definition von Datenstrukturen und die Gewährleistung von Typsicherheit für Tool-Eingaben und -Ausgaben, was für die Zuverlässigkeit wichtig ist. Viele benutzerdefinierte Agenten-Implementierungen nutzen Pydantic für diese strukturelle Integrität.
- LastMiles mcp_agent: Dieses Framework ist speziell dafür entwickelt worden, mit MCPs zu arbeiten und bietet eine eher strukturierte Struktur, die mit bewährten Methoden für den Bau effektiver Agenten übereinstimmt, wie sie in Forschungseinrichtungen wie Anthropic beschrieben werden.
- Internes Framework: Es ist auch zunehmend üblich, AI-Code-Generierungs-Agents (mit Tools wie Cursor oder Cline) zu verwenden, um den Boilerplate-Code für den Agenten, seine Tools und die umgebende Logik zu schreiben. Die Erfahrung von Georgians AI-Lab bei der Arbeit mit Unternehmen an agenterischen Implementierungen zeigt, dass dies großartig sein kann, um sehr minimale, benutzerdefinierte Frameworks zu erstellen.
IV. Ingenieurwesen für Zuverlässigkeit und Leistung
Die Gewährleistung, dass ein Agent API-Aufrufe zuverlässig ausführt und gut performt, erfordert gezielte Ingenieursbemühungen. Zwei Möglichkeiten, dies zu tun, sind (1) Datensatz-Erstellung und -Validierung und (2) Prompt-Engineering und -Optimierung.
1. Datensatz-Erstellung und -Validierung
Das Training (falls anwendbar), Testen und Optimieren eines Agenten erfordert einen hochwertigen Datensatz. Dieser Datensatz sollte repräsentative natürliche Sprachabfragen und die entsprechenden gewünschten API-Aufruf-Sequenzen oder -Ergebnisse enthalten.
- Manuelle Erstellung: Die manuelle Kuratierung eines Datensatzes gewährleistet hohe Präzision und Relevanz, kann aber arbeitsintensiv sein.
- Synthetische Generierung: Die generative Erstellung von Daten oder die Verwendung von LLMs kann die Datensatz-Erstellung skalieren, stellt aber erhebliche Herausforderungen dar. Die Forschung von Georgians AI-Lab hat ergeben, dass die Sicherstellung der Richtigkeit und realistischen Komplexität von synthetisch generierten API-Aufrufen und -Abfragen sehr schwierig ist. Oft waren die generierten Fragen entweder zu trivial oder unmöglich komplex, was es schwierig macht, die nuancierte Leistung des Agenten zu messen. Eine sorgfältige Validierung von synthetischen Daten ist absolut kritisch.
Für kritische Bewertungen bietet ein kleiner, hochwertiger, manuell verifizierter Datensatz oft zuverlässigere Erkenntnisse als ein großer, lauter synthetischer Datensatz.
2. Prompt-Engineering und -Optimierung
Die Leistung eines LLM-basierten Agenten wird stark von den verwendeten Prompts beeinflusst.
- Effektives Prompting umfasst die klare Definition der Agenten-Aufgabe, die Bereitstellung von Beschreibungen verfügbarer Tools und die Strukturierung des Prompts, um genaue Parameter-Extraktion zu fördern.
- Systematische Optimierung mit Frameworks wie DSPy kann die Leistung erheblich verbessern. DSPy ermöglicht es Ihnen, die Komponenten des Agenten zu definieren (z.B. Module für die Gedanken-Generierung, Tool-Auswahl, Parameter-Formatierung) und dann mit wenigen Beispielen aus Ihrem Datensatz eine compiler-ähnliche Herangehensweise zu verwenden, um optimierte Prompts oder Konfigurationen für diese Komponenten zu finden.
V. Ein empfohlener Weg zu effektiven API-Agents
Die Entwicklung robuster API-Aufruf-AI-Agents ist eine iterative Ingenieursdisziplin. Basierend auf den Ergebnissen der Forschung von Georgians AI-Lab kann die Entwicklung durch einen systematischen Workflow wie den folgenden verbessert werden:
- Beginnen Sie mit klaren API-Definitionen: Beginnen Sie mit gut strukturierten OpenAPI-Spezifikationen für die APIs, mit denen Ihr Agent interagieren wird.
- Standardisieren Sie den Tool-Zugriff: Konvertieren Sie Ihre OpenAPI-Spezifikationen in MCP. Tools wie Stainless.ai können dies erleichtern und eine standardisierte Möglichkeit für Ihren Agenten bieten, APIs zu verstehen und zu nutzen.
- Implementieren Sie den Agenten: Wählen Sie ein geeignetes Framework oder einen geeigneten Ansatz. Dies kann die Verwendung von Pydantic für die Datenmodellierung innerhalb einer benutzerdefinierten Agentenstruktur oder die Nutzung eines Frameworks wie LastMile’s mcp_agent umfassen, das auf MCP basiert.
- Bevor Sie dies tun, sollten Sie den MCP mit einem Tool wie Claude Desktop oder Cline verbinden und manuell diese Schnittstelle verwenden, um zu sehen, wie gut ein generischer Agent es nutzen kann, wie viele Iterationen es normalerweise benötigt, um den MCP korrekt zu verwenden, und andere Details, die Ihnen Zeit bei der Implementierung sparen können.
- Erstellen Sie einen qualitativ hochwertigen Bewertungsdatensatz: Erstellen oder validieren Sie sorgfältig einen Datensatz von Abfragen und erwarteten API-Interaktionen. Dies ist für zuverlässiges Testen und Optimieren unerlässlich.
- Optimieren Sie die Prompts und Logik des Agenten: Verwenden Sie Frameworks wie DSPy, um die Prompts und die interne Logik des Agenten zu verfeinern, indem Sie Ihren Datensatz nutzen, um Verbesserungen in Genauigkeit und Zuverlässigkeit zu treiben.
VI. Ein illustrierendes Beispiel des Workflows
Hier ist ein vereinfachtes Beispiel, das den empfohlenen Workflow für das Erstellen eines API-Aufruf-Agents veranschaulicht:
Schritt 1: Beginnen Sie mit klaren API-Definitionen
Stellen Sie sich vor, eine API für die Verwaltung einer einfachen To-Do-Liste, definiert in OpenAPI:
openapi: 3.0.0
info:












