Codeausführung mit MCP: Ein neuer Ansatz für KI-Agenten-Effizienz
Anthropic führte eine Methode ein, bei der KI-Agenten mit Model Context Protocol (MCP) -Servern interagieren, indem sie ausführbaren Code schreiben, anstatt direkte Aufrufe an Werkzeuge zu tätigen. Der Agent behandelt Werkzeuge wie Dateien auf einem Computer, findet, was er benötigt, und verwendet sie direkt mit Code, sodass Zwischendaten nicht durch das Gedächtnis des Modells geleitet werden müssen. Wir haben diesen Ansatz getestet, um festzustellen, ob er die Token-Kosten reduziert, während die gleiche Erfolgsquote beibehalten wird.
Codeausführung mit MCP vs. regulärem MCP
Metrik | Reguläres MCP | MCP mit Codeausführung | Unterschied |
|---|---|---|---|
Erfolgsquote | 100% | 100% | Gleich |
Durchschnittliche Latenz | 9,66s | 10,37s | +7% |
Durchschnittliche Eingabe-Tokens | 15.417 | 3.310 | -78.5% |
Durchschnittliche Ausgabe-Tokens | 87 | 192 | +120% |
Gesamte Eingabe-Tokens | 770.852 | 165.496 | -78.5% |
Gesamte Ausgabe-Tokens | 4.345 | 9.585 | +120% |
Gesamtzahl aller Tokens | 775.197 | 175.081 | -77.4% |
Wir haben zwei Ansätze zum Aufbau von KI-Agenten verglichen, die über das MCP mit externen Werkzeugen interagieren:
- Reguläres MCP: Traditioneller Ansatz, bei dem alle Werkzeugdefinitionen in das Kontextfenster des Modells geladen werden
- Codeausführungs-MCP: Neuartiger Ansatz, bei dem das Modell Code schreibt, der Werkzeuge aufruft, und Zwischendaten aus dem Kontext heraushält
Wichtigste Erkenntnisse
Eingabe-Token-Einsparungen: Die Codeausführung verwendet 78.5% weniger Eingabe-Tokens (165K vs. 771K):
- Reguläres lädt ~15,400 Tokens an Werkzeugdefinitionen pro Aufruf
- Codeausführung benötigt nur ~3,300 Tokens pro Aufruf
Höhere Ausgabe-Tokens: Der Codeausführungsansatz verwendet 2.2× mehr Ausgabe-Tokens, weil das Modell Code und Erklärungen schreibt
Netto-Token-Einsparungen: 77.4% gesamte Token-Reduzierung (175K vs. 775K)
Kostenauswirkung:
- Eingabe-Tokens sind typischerweise günstiger als Ausgabe-Tokens
- Aber die 78% Eingabe-Einsparungen überwiegen bei Weitem die 2× höhere Ausgabe
- Geschätzte ~70% Kostensenkung durch Codeausführung
Beide erreichten eine Erfolgsquote von 100% bei diesen Abfragen mit GPT-4.1.
Der Codeausführungsansatz ist von einem Beitrag von Anthropic inspiriert, der die Verwendung von Codeausführung mit MCP behandelt, um die Nutzung des Kontextfensters zu reduzieren, während die Agentenfähigkeiten erhalten bleiben.1
Methodik des Vergleichs von Codeausführung mit MCP
Aufgaben
Wir führen jede Aufgabe 50 Mal für jeden Ansatz aus:
- Gehen Sie zu https://aimultiple.com/open-source-embedding-models, nennen Sie mir die perfekten Top-5-Performer (d.h. die Modelle mit 100% Top-5-Genauigkeit)
- Gehen Sie zu https://aimultiple.com/open-source-embedding-models, sagen Sie mir, welches Modell die höchste Latenz hat.
Vergleichs-Setup
Wir haben Bright Data’s MCP-Server mit aktiviertem Pro-Modus verwendet, da er in unserem Browser-MCP-Benchmark die höchste Genauigkeit aufwies.
Bright Data MCP-Server: Web-Integrationstools für KI.
Website besuchenWir haben GPT-4.1 als LLM verwendet, aufgrund seines großen Kontextfensters.
Umgebungseinrichtung: Wir haben alle zwischengespeicherten Daten gelöscht und für jeden Lauf eine frische MCP-Serververbindung sichergestellt. Jede Abfrage wird als separater Unterprozess ausgeführt.
Architekturvergleich
Reguläre MCP-Architektur
Beim regulären MCP-Ansatz folgt der Agent einem einfachen Ablauf: Die Benutzerabfrage geht an einen LangGraph ReAct Agent, der Zugriff auf alle 63 Werkzeugdefinitionen in seinem Kontextfenster hat. Der Agent wählt Werkzeuge aus und ruft sie über die MCP-Client-Session auf, und die Werkzeugergebnisse fließen durch das Kontextfenster zurück, um die nächste Aktion des Agenten zu informieren.
Codeausführungs-MCP-Architektur
Der Codeausführungsansatz fügt eine Zwischenschicht hinzu: Die Benutzerabfrage geht an einen Code Execution Agent mit einem kompakten Kontext (nur Werkzeugnamen, keine vollständigen Schemas). Der Agent schreibt Python-Code, der Werkzeuge aufruft. Dieser Code läuft in einer sandboxed Code Executor-Umgebung, die mit der MCP-Client-Session kommuniziert. Nur die Endergebnisse oder Zusammenfassungen kehren in den Kontext des Agenten zurück, keine rohen Zwischendaten.
Die Codeausführungsimplementierung verwendet progressive Offenlegung. Nur Werkzeugnamen und abgeschnittene Beschreibungen (60 Zeichen) sind im System-Prompt enthalten. Wenn das Modell ein Werkzeug verwenden muss, schreibt es Python-Code, der eine asynchrone call_tool()-Funktion aufruft, die in der Ausführungsumgebung bereitgestellt wird.
Einschränkungen unseres Ansatzes
- Abfragevielfalt: Nur 2 Abfragetypen getestet; die Ergebnisse können bei anderen Aufgabentypen variieren.
- Einzelnes Modell: Nur mit GPT-4.1 getestet; andere Modelle können andere Muster zeigen
- Codequalität: Der Erfolg der Codeausführung hängt von der Codegenerierungsfähigkeit des Modells ab; dies kann bei komplexeren Aufgaben zu geringeren Erfolgsquoten führen.
Warum traditionelles MCP Ressourcen verschwendet
Problem 1: Werkzeugdefinitionen verbrauchen übermäßig Kontext
Jedes Werkzeug benötigt Anweisungen im Speicher des Modells. Ein einfaches Beispiel:
gdrive.getDocument
Gets a file from Google Drive
Needs: document ID
Returns: the file content
Beispiel: Ein Agent, der mit 50 Servern mit jeweils 20 Werkzeugen verbunden ist, bedeutet 1,000 Werkzeugdefinitionen. Bei ungefähr 150 Tokens pro Definition sind das 150,000 Tokens, die verbraucht werden, bevor der Agent Ihre erste Anfrage liest.
Problem 2: Daten werden mehrfach verarbeitet
Aufgabe: „Holen Sie meine Meeting-Notizen von Google Drive und fügen Sie zu Salesforce hinzu.“
Was passiert:
- Der Agent holt das Dokument (50,000 Tokens)
- Das Modell liest es
- Der Agent sendet es an Salesforce (weitere 50,000 Tokens)
Das Modell verarbeitet 100,000+ Tokens, um Daten von einem Ort zum anderen zu verschieben.
Herkömmliche MCP-Implementierungen erfordern, dass das Modell Werkzeuge aus JSONSchema-Definitionen auswählt, die in das Kontextfenster geladen werden, was die Genauigkeit verschlechtert, wenn die Anzahl der Werkzeuge steigt.2 Forschung hat bestätigt, dass die Erfolgsquoten von Aufgaben stark abnehmen, wenn die Anzahl der verfügbaren Werkzeuge aufgrund von Kontextüberflutung durch Schema-Definitionen steigt.3 Die Bereitstellung von MCP-Werkzeugen als aufrufbare Funktionen und die Möglichkeit, dass das Modell Python-Code schreibt, der Werkzeuge direkt aufruft, nutzt die vorhandene Codegenerierungsfähigkeit des Modells, anstatt die Auswahl aus vordefinierten Schemata zu erzwingen.
Wann sollte Codeausführung mit MCP verwendet werden?
Codeausführung mit MCP behebt zwei grundlegende Ineffizienzen herkömmlicher MCP-Implementierungen:
- Werkzeugdefinitionen überfüllen das Kontextfenster nicht mehr
- Zwischendaten fließen nicht mehr unnötig durch das Modell
Der Ansatz funktioniert am besten, wenn:
- Sie viele MCP-Werkzeuge verbunden haben
- Ihre Workflows mehrstufige Datenverarbeitung umfassen
- Große Dokumente oder Datensätze zwischen Werkzeugen bewegt werden
- Kontextfenster-Grenzen Ihre Agenten beeinträchtigen
Die Infrastrukturanforderungen bedeuten, dass dies nicht automatisch für alle Anwendungsfälle besser ist. Kleine Bereitstellungen mit wenigen Werkzeugen rechtfertigen möglicherweise nicht die operative Komplexität.
Für Organisationen, die bereits Agenten mit umfangreichen MCP-Werkzeugkatalogen betreiben, macht das Potenzial für eine 98%+ Token-Reduzierung und entsprechende Kosteneinsparungen diesen Ansatz untersuchenswert.
Alternative Frameworks und Protokolle
Über LangGraph hinaus bietet Googles Agent Development Kit (ADK) native MCP-Unterstützung über McpToolset und integriert sich mit dem Agent2Agent (A2A)-Protokoll, das die Agent-zu-Agent-Kommunikation über Fähigkeitskarten standardisiert, die unter /.well-known/agent-card.json veröffentlicht werden.4 5 Im April 2026 aktualisierte OpenAI sein Agents SDK, um native Sandbox-Ausführungsfähigkeiten hinzuzufügen, die isolierte Arbeitsbereiche mit eingeschränktem Datei- und Codezugriff bereitstellen.6
Diese Forschung zitieren
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{sezer2026,
author = {Sezer, Sena and Alper, Şevval},
title = {{Codeausführung mit MCP: Ein neuer Ansatz für KI-Agenten-Effizienz}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/code-execution-with-mcp}},
note = {AIMultiple. Abgerufen am 24. Juni 2026}
}
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.