Code-Ausführung mit MCP: Ein neuer Ansatz für KI-Agenten-Effizienz
Anthropic stellte eine Methode vor, bei der KI-Agenten mit Model Context Protocol (MCP) -Servern interagieren, indem sie ausführbaren Code schreiben, anstatt direkte Aufrufe an Tools zu tätigen. Der Agent behandelt Tools als Dateien auf einem Computer, findet, was er benötigt, und verwendet sie direkt mit Code, sodass Zwischendaten nicht durch den Speicher des Modells laufen müssen. Wir haben diesen Ansatz getestet, um zu sehen, ob er die Token-Kosten reduziert und gleichzeitig die gleiche Erfolgsquote beibehält.
Code-Ausführung mit MCP vs. regulärem MCP
Metrik | Reguläres MCP | MCP mit Code-Ausführung | Unterschied |
|---|---|---|---|
Erfolgsquote | 100 % | 100 % | Gleich |
Durchschn. Latenz | 9.66s | 10.37s | +7 % |
Durchschn. Eingabe-Tokens | 15.417 | 3.310 | -78.5 % |
Durchschn. Ausgabe-Tokens | 87 | 192 | +120 % |
Gesamte Eingabe-Tokens | 770.852 | 165.496 | -78.5 % |
Gesamte Ausgabe-Tokens | 4.345 | 9.585 | +120 % |
Gesamtanzahl aller Tokens | 775.197 | 175.081 | -77.4 % |
Wir haben zwei Ansätze für die Entwicklung von KI-Agenten verglichen, die über MCP mit externen Tools interagieren:
- Reguläres MCP: Herkömmlicher Ansatz, bei dem alle Tool-Definitionen in das Kontextfenster des Modells geladen werden
- Code-Ausführung mit MCP: Neuartiger Ansatz, bei dem das Modell Code schreibt, der Tools aufruft, und Zwischendaten aus dem Kontext heraushält
Wichtigste Erkenntnisse
Eingabe-Token-Einsparungen: Die Code-Ausführung verbraucht 78.5 % weniger Eingabe-Tokens (165K vs. 771K):
- Regulär werden ~15.400 Tokens an Tool-Definitionen pro Aufruf geladen
- Die Code-Ausführung benötigt nur ~3.300 Tokens pro Aufruf
Höhere Ausgabe-Tokens: Der Code-Ausführungsansatz verbraucht 2.2× mehr Ausgabe-Tokens, weil das Modell Code + Erklärungen schreibt.
Netto-Token-Einsparungen: 77.4 % gesamte Token-Reduzierung (175K vs. 775K)
Kostenauswirkung:
- Eingabe-Tokens sind in der Regel günstiger als Ausgabe-Tokens
- Doch die 78 % Einsparungen bei den Eingaben überwiegen den 2×-Anstieg bei den Ausgaben bei Weitem
- Geschätzte ~70 % Kostenreduktion mit der Code-Ausführung
Beide erzielten 100 % Erfolgsquote bei diesen Abfragen mit GPT-4.1.
Der Code-Ausführungsansatz ist von Anthropics Beitrag über die Verwendung von Code-Ausführung mit MCP inspiriert, um die Nutzung des Kontextfensters zu reduzieren und gleichzeitig die Fähigkeiten des Agenten zu erhalten.1
Methodik des Vergleichs von Code-Ausführung mit MCP
Aufgaben
Wir führten jede Aufgabe 50-mal für jeden Ansatz aus:
- Gehe zu https://aimultiple.com/open-source-embedding-models und nenne mir die perfekten Top-5-Performer (d. h. die Modelle mit 100 % Top-5-Genauigkeit).
- Gehe zu https://aimultiple.com/open-source-embedding-models und nenne mir, welches Modell die höchste Latenz hat.
Vergleichs-Setup
Wir verwendeten Bright Datas MCP-Server mit aktiviertem Pro-Modus, da er in unserem Browser-MCP-Benchmark die höchste Genauigkeit aufwies.
Bright Data bietet 5.000 kostenlose MCP-Anfragen/Monat zum Testen dieses Code-Ausführungsansatzes
Website besuchenWir verwendeten GPT-4.1 als LLM aufgrund seines großen Kontextfensters.
Umgebungs-Setup: Wir haben alle zwischengespeicherten Daten gelöscht und für jeden Lauf eine neue MCP-Serververbindung sichergestellt. Jede Abfrage wird als separater Unterprozess ausgeführt.
Architekturvergleich
Reguläre MCP-Architektur
Beim regulären MCP-Ansatz folgt der Agent einem einfachen Ablauf: Die Benutzerabfrage geht an einen LangGraph ReAct Agent, der in seinem Kontextfenster Zugriff auf alle 63 Tool-Definitionen hat. Der Agent wählt Tools über die MCP-Client-Sitzung aus und ruft sie auf, und die Tool-Ergebnisse fließen durch das Kontextfenster zurück, um die nächste Aktion des Agenten zu bestimmen.
Code-Ausführungs-MCP-Architektur
Der Code-Ausführungsansatz fügt eine Zwischenschicht hinzu: Die Benutzerabfrage geht an einen Code-Ausführungs-Agenten mit einem kompakten Kontext (nur Tool-Namen, keine vollständigen Schemas). Der Agent schreibt Python-Code, der Tools aufruft. Dieser Code wird in einer Sandbox-Code-Executor-Umgebung ausgeführt, die mit der MCP-Client-Sitzung kommuniziert. Nur die Endergebnisse oder Zusammenfassungen kehren in den Kontext des Agenten zurück, nicht die rohen Zwischendaten.
Die Code-Ausführungsimplementierung verwendet progressive Offenlegung. Nur Tool-Namen und gekürzte Beschreibungen (60 Zeichen) sind im System-Prompt enthalten. Wenn das Modell ein Tool verwenden muss, schreibt es Python-Code, der eine asynchrone Funktion call_tool() aufruft, die in der Ausführungsumgebung bereitgestellt wird.
Einschränkungen unseres Ansatzes
- Abfragevielfalt: Nur 2 Abfragetypen getestet; die Ergebnisse können bei anderen Aufgabentypen abweichen.
- Einzelnes Modell: Nur mit GPT-4.1 getestet; andere Modelle können andere Muster zeigen.
- Code-Qualität: Der Erfolg der Code-Ausführung hängt von der Fähigkeit des Modells zur Codegenerierung ab; dies kann bei komplizierteren Aufgaben zu einer niedrigeren Erfolgsquote führen.
Warum traditionelles MCP Ressourcen verschwendet
Problem 1: Tool-Definitionen verbrauchen übermäßig viel Kontext
Jedes Tool benötigt Anweisungen im Speicher des Modells. Ein einfaches Beispiel:
gdrive.getDocument
Gets a file from Google Drive
Needs: document ID
Returns: the file content
Beispiel: Ein Agent, der mit 50 Servern mit jeweils 20 Tools verbunden ist, bedeutet 1.000 Tool-Definitionen. Bei rund 150 Tokens pro Definition sind das 150.000 Tokens, die verbraucht werden, bevor der Agent Ihre erste Anfrage liest.
Problem 2: Daten werden mehrfach verarbeitet
Aufgabe: „Holen Sie meine Besprechungsnotizen von Google Drive und fügen Sie zu Salesforce hinzu.“
Was passiert:
- Der Agent erhält das Dokument (50.000 Tokens)
- Das Modell liest es
- Der Agent sendet es an Salesforce (weitere 50.000 Tokens)
Das Modell verarbeitet 100.000+ Tokens, um Daten von einem Ort zum anderen zu verschieben.
Herkömmliche MCP-Implementierungen erfordern, dass das Modell Tools aus JSONSchema-Definitionen auswählt, die in das Kontextfenster geladen werden, was die Genauigkeit mit zunehmender Tool-Anzahl verschlechtert.1 Die Forschung hat bestätigt, dass die Erfolgsquoten von Aufgaben stark sinken, wenn die Anzahl der verfügbaren Tools steigt, weil die Schema-Definitionen den Kontext überfluten.2 Das Bereitstellen von MCP-Tools als aufrufbare Funktionen und das Erlauben, dass das Modell Python-Code schreibt, der Tools direkt aufruft, nutzt die vorhandene Codegenerierungsfähigkeit des Modells, anstatt die Auswahl aus vordefinierten Schemas zu erzwingen.
Wann sollte man Code-Ausführung mit MCP verwenden?
Code-Ausführung mit MCP behebt zwei grundlegende Ineffizienzen herkömmlicher MCP-Implementierungen:
- Tool-Definitionen verstopfen nicht länger das Kontextfenster
- Zwischendaten fließen nicht mehr unnötig durch das Modell
Der Ansatz funktioniert am besten, wenn:
- Sie haben viele MCP-Tools verbunden
- Ihre Workflows umfassen mehrstufige Datenverarbeitung
- Große Dokumente oder Datensätze werden zwischen Tools bewegt
- Kontextfensterlimits beeinträchtigen Ihre Agenten
Die Infrastrukturanforderungen bedeuten, dass dieser Ansatz nicht automatisch für alle Anwendungsfälle besser ist. Kleine Implementierungen mit wenigen Tools rechtfertigen möglicherweise nicht die operative Komplexität.
Für Unternehmen, die bereits Agenten mit umfangreichen MCP-Tool-Katalogen betreiben, macht das Potenzial für eine Token-Reduzierung von 98 %+ und entsprechende Kosteneinsparungen diesen Ansatz zu einer lohnenden Untersuchung.
Alternative Frameworks und Protokolle
Über LangGraph hinaus bietet Googles Agent Development Kit (ADK) native MCP-Unterstützung über McpToolset und integriert sich in das Agent2Agent-Protokoll (A2A), das die Agent-zu-Agent-Kommunikation über Capability Cards standardisiert, die unter /.well-known/agent-card.json veröffentlicht werden.3 4 Im April 2026 aktualisierte OpenAI sein Agents SDK um native Sandbox-Ausführungsfunktionen, die isolierte Arbeitsbereiche mit eingeschränktem Datei- und Codezugriff bereitstellen.5
Diese Forschung zitieren
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{sezer2026,
author = {Sezer, Sena and Alper, Şevval},
title = {{Code-Ausführung mit MCP: Ein neuer Ansatz für KI-Agenten-Effizienz}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/code-execution-with-mcp}},
note = {AIMultiple. Abgerufen am 14. August 2026}
}
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.