Codeausführung mit MCP: Ein neuer Ansatz für die Effizienz von KI-Agenten
Anthropic hat eine Methode eingeführt, bei der KI-Agenten mit Model Context Protocol (MCP) -Servern interagieren, indem sie ausführbaren Code schreiben, anstatt direkte Aufrufe an Tools zu tätigen. Der Agent behandelt Tools wie Dateien auf einem Computer, findet, was er benötigt, und nutzt sie direkt mit Code, sodass Zwischendaten nicht durch den Speicher des Modells laufen müssen. Wir haben diesen Ansatz getestet, um zu sehen, ob er die Token-Kosten senkt, während die Erfolgsquote gleich bleibt.
Codeausführung mit MCP vs. reguläres MCP
Metrik | Reguläres MCP | MCP mit Codeausführung | Unterschied |
|---|---|---|---|
Erfolgsquote | 100 % | 100 % | Gleich |
Durchschnittliche Latenz | 9.66s | 10.37s | +7 % |
Durchschnittliche Input-Tokens | 15.417 | 3.310 | -78,5 % |
Durchschnittliche Output-Tokens | 87 | 192 | +120 % |
Gesamte Input-Tokens | 770.852 | 165.496 | -78,5 % |
Gesamte Output-Tokens | 4.345 | 9.585 | +120 % |
Gesamtanzahl aller Tokens | 775.197 | 175.081 | -77,4 % |
Wir haben zwei Ansätze zum Aufbau von KI-Agenten verglichen, die über MCP mit externen Tools interagieren:
- Reguläres MCP: Traditioneller Ansatz, bei dem alle Tool-Definitionen in das Kontextfenster des Modells geladen werden
- Codeausführung mit MCP: Neuer Ansatz, bei dem das Modell Code schreibt, der Tools aufruft, und Zwischendaten aus dem Kontext fernhält
Verwendete Tools
Dieser Benchmark wurde mit dem Bright Data-MCP-Server mit Pro-Modus durchgeführt, da er in unserem Browser-MCP-Benchmark die höchste Genauigkeit aufwies.
Wichtigste Erkenntnisse
Input-Token-Einsparungen: Die Codeausführung verbraucht 78,5 % weniger Input-Tokens (165K vs. 771K):
- Der reguläre Ansatz lädt ~15.400 Tokens an Tool-Definitionen pro Aufruf
- Die Codeausführung benötigt nur ~3.300 Tokens pro Aufruf
Höhere Output-Tokens: Der Codeausführungsansatz verbraucht 2.2× mehr Output-Tokens, weil das Modell Code und Erklärungen schreibt
Netto-Token-Einsparungen: 77,4 % Gesamtreduzierung der Tokens (175K vs. 775K)
Kostenauswirkungen:
- Input-Tokens sind in der Regel günstiger als Output-Tokens
- Doch 78 % Einsparung bei den Input-Tokens überwiegt die 2-fache Erhöhung der Output-Tokens bei Weitem
- Geschätzte Kostensenkung von rund 70 % mit Codeausführung
Beide erreichten 100 % Erfolgsquote bei diesen Abfragen mit GPT-4.1.
Der Ansatz der Codeausführung ist von Anthropics Beitrag inspiriert, bei dem es um den Einsatz von Codeausführung mit MCP geht, um die Nutzung des Kontextfensters zu reduzieren und gleichzeitig die Fähigkeiten der Agenten zu erhalten.1
Methodik des Vergleichs von Codeausführung mit MCP
Aufgaben
Wir haben jede Aufgabe 50 Mal für jeden Ansatz ausgeführt:
- Gehe zu https://aimultiple.com/open-source-embedding-models und nenne mir die perfekten Top-5-Performer (d. h. die Modelle mit 100 % Top-5-Genauigkeit)
- Gehe zu https://aimultiple.com/open-source-embedding-models und nenne mir, welches Modell die höchste Latenz aufweist.
Vergleichsaufbau
Für beide Ansätze haben wir den Bright Data-MCP-Server mit Pro-Modus und GPT-4.1 als LLM verwendet, da dieses über ein großes Kontextfenster verfügt.
Umgebungseinrichtung: Wir haben alle zwischengespeicherten Daten gelöscht und pro Durchlauf eine frische MCP-Server-Verbindung sichergestellt. Jede Abfrage wird als separater Unterprozess ausgeführt.
Architekturvergleich
Reguläre MCP-Architektur
Beim regulären MCP-Ansatz folgt der Agent einem geradlinigen Ablauf: Die Nutzeranfrage gelangt in einen LangGraph-ReAct-Agenten, der in seinem Kontextfenster Zugriff auf alle 63 Tool-Definitionen hat. Der Agent wählt Tools über die MCP-Client-Sitzung aus und ruft sie auf; die Tool-Ergebnisse fließen durch das Kontextfenster zurück und informieren die nächste Aktion des Agenten.
Codeausführungs-MCP-Architektur
Der Codeausführungsansatz fügt eine Zwischenschicht hinzu: Die Nutzeranfrage geht an einen Codeausführungs-Agenten mit kompaktem Kontext (nur Tool-Namen, keine vollständigen Schemata). Der Agent schreibt Python-Code, der Tools aufruft. Dieser Code wird in einer Sandbox-Code-Executor-Umgebung ausgeführt, die mit der MCP-Client-Sitzung kommuniziert. Nur die Endergebnisse oder Zusammenfassungen gelangen zurück in den Kontext des Agenten, nicht die rohen Zwischendaten.
Die Implementierung der Codeausführung nutzt progressive Offenlegung. Nur Tool-Namen und gekürzte Beschreibungen (60 Zeichen) sind im System-Prompt enthalten. Wenn das Modell ein Tool verwenden muss, schreibt es Python-Code, der eine im Ausführungsumfeld bereitgestellte asynchrone Funktion call_tool() aufruft.
Einschränkungen unseres Ansatzes
- Abfragevielfalt: Nur 2 Abfragetypen wurden getestet; die Ergebnisse können für andere Aufgabentypen abweichen.
- Einzelnes Modell: Nur mit GPT-4.1 getestet; andere Modelle können andere Muster zeigen.
- Codequalität: Der Erfolg der Codeausführung hängt von der Fähigkeit des Modells zur Codegenerierung ab; dies kann bei komplizierteren Aufgaben zu niedrigeren Erfolgsquoten führen.
Warum traditionelles MCP Ressourcen verschwendet
Problem 1: Tool-Definitionen verbrauchen übermäßig viel Kontext
Jedes Tool benötigt Anweisungen im Speicher des Modells. Ein einfaches Beispiel:
gdrive.getDocument
Gets a file from Google Drive
Needs: document ID
Returns: the file content
Beispiel: Ein Agent, der mit 50 Servern mit jeweils 20 Tools verbunden ist, bedeutet 1.000 Tool-Definitionen. Bei etwa 150 Tokens pro Definition werden 150.000 Tokens verbraucht, bevor der Agent Ihre erste Anfrage liest.
Problem 2: Daten werden mehrfach verarbeitet
Aufgabe: „Hol meine Besprechungsnotizen von Google Drive und füge sie zu Salesforce hinzu.“
Was passiert:
- Der Agent holt das Dokument (50.000 Tokens)
- Das Modell liest es
- Der Agent sendet es an Salesforce (weitere 50.000 Tokens)
Das Modell verarbeitet 100.000+ Tokens, um Daten von einem Ort zum anderen zu verschieben.
Traditionelle MCP-Implementierungen erfordern, dass das Modell Tools aus in das Kontextfenster geladenen JSONSchema-Definitionen auswählt, was die Genauigkeit mit zunehmender Tool-Anzahl verschlechtert.1 Die Forschung hat bestätigt, dass die Erfolgsquoten von Aufgaben stark sinken, wenn die Anzahl der verfügbaren Tools zunimmt, da die Schema-Definitionen den Kontext überschwemmen.2 Wenn MCP-Tools als aufrufbare Funktionen bereitgestellt werden und das Modell Python-Code schreiben darf, der Tools direkt aufruft, wird die vorhandene Codegenerierungsfähigkeit des Modells genutzt, anstatt eine Auswahl aus vordefinierten Schemata zu erzwingen.
Wann sollte Codeausführung mit MCP genutzt werden?
Die Codeausführung mit MCP adressiert zwei grundlegende Ineffizienzen in traditionellen MCP-Implementierungen:
- Tool-Definitionen verstopfen das Kontextfenster nicht mehr
- Zwischendaten fließen nicht mehr unnötig durch das Modell
Der Ansatz funktioniert am besten, wenn:
- Sie haben viele MCP-Tools verbunden
- Ihre Workflows umfassen mehrstufige Datenverarbeitung
- Große Dokumente oder Datasets werden zwischen Tools bewegt
- Grenzen des Kontextfensters beeinträchtigen Ihre Agenten
Die Infrastrukturanforderungen bedeuten, dass dies nicht automatisch für alle Anwendungsfälle besser ist. Kleine Implementierungen mit wenigen Tools rechtfertigen möglicherweise nicht die betriebliche Komplexität.
Für Unternehmen, die bereits Agenten mit umfangreichen MCP-Tool-Katalogen betreiben, macht das Potenzial für eine Token-Reduzierung von 98 %+ und entsprechende Kosteneinsparungen diesen Ansatz eine Untersuchung wert.
Alternative Frameworks und Protokolle
Über LangGraph hinaus bietet das Agent Development Kit (ADK) von Google native MCP-Unterstützung über McpToolset und integriert sich mit dem Agent2Agent (A2A)-Protokoll, das die Agent-zu-Agent-Kommunikation über Capability Cards standardisiert, die unter /.well-known/agent-card.json veröffentlicht werden.34 Im April 2026 aktualisierte OpenAI sein Agents SDK, um native Sandbox-Ausführungsfunktionen hinzuzufügen, und bot isolierte Arbeitsbereiche mit eingeschränktem Datei- und Codezugriff.5
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{alper2026,
author = {Alper, Şevval},
title = {{Codeausführung mit MCP: Ein neuer Ansatz für die Effizienz von KI-Agenten}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/code-execution-with-mcp}},
note = {AIMultiple. Abgerufen am 14. August 2026}
}Ergebnisse und Zeitstempel von 7 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die eine CSV-Datei enthält.
Möchten Sie die granularen Daten dahinter? Premium beitreten
Änderungsprotokoll
2 AktualisierungenDer Abschnitt „Vergleich: UTCP vs MCP vs Code Execution MCP“ wurde entfernt.
Referenzlinks
Şevval konzentriert sich auf KI-Programmierwerkzeuge, KI-Agenten und Quantentechnologien.
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.