Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA
Anthropic presentó un método en el que los agentes de IA interactúan con servidores de Model Context Protocol (MCP) escribiendo código ejecutable en lugar de realizar llamadas directas a herramientas. El agente trata las herramientas como archivos en un ordenador, encuentra lo que necesita y las usa directamente con código, por lo que los datos intermedios no tienen que pasar por la memoria del modelo. Probamos este enfoque para ver si reduce el costo de tokens manteniendo la misma tasa de éxito.
Ejecución de código con MCP vs MCP normal
Métrica | MCP normal | MCP con ejecución de código | Diferencia |
|---|---|---|---|
Tasa de éxito | 100 % | 100 % | Igual |
Latencia media | 9.66s | 10.37s | +7 % |
Media de tokens de entrada | 15.417 | 3.310 | -78.5 % |
Media de tokens de salida | 87 | 192 | +120 % |
Total de tokens de entrada | 770.852 | 165.496 | -78.5 % |
Total de tokens de salida | 4.345 | 9.585 | +120 % |
Total de todos los tokens | 775.197 | 175.081 | -77.4 % |
Comparamos dos enfoques para crear agentes de IA que interactúan con herramientas externas a través del MCP:
- MCP normal: Enfoque tradicional en el que todas las definiciones de herramientas se cargan en la ventana de contexto del modelo
- Ejecución de código con MCP: Enfoque novedoso en el que el modelo escribe código que llama a las herramientas, manteniendo los datos intermedios fuera del contexto
Herramientas utilizadas
Este benchmark se realizó utilizando el servidor MCP de Bright Data con modo Pro, ya que tuvo la mayor precisión en nuestro benchmark de MCP para navegadores.
Hallazgos clave
Ahorro de tokens de entrada: la ejecución de código utiliza 78.5 % menos de tokens de entrada (165K frente a 771K):
- El enfoque normal carga ~15.400 tokens de definiciones de herramientas por llamada
- La ejecución de código solo necesita ~3.300 tokens por llamada
Más tokens de salida: el enfoque de ejecución de código utiliza 2.2× más tokens de salida porque el modelo escribe código + explicaciones
Ahorro neto de tokens: 77.4 % de reducción total de tokens (175K frente a 775K)
Implicación en el costo:
- Los tokens de entrada suelen ser más baratos que los tokens de salida
- Pero el ahorro de entrada del 78 % supera con creces el aumento de salida de 2×
- Reducción de coste estimada de ~70 % con la ejecución de código
Ambos lograron una tasa de éxito del 100 % en estas consultas con GPT-4.1.
El enfoque de ejecución de código está inspirado en la publicación de Anthropic sobre el uso de la ejecución de código con MCP para reducir el uso de la ventana de contexto manteniendo la capacidad del agente.1
Metodología de la comparación de la ejecución de código con MCP
Tareas
Ejecutamos cada tarea 50 veces para cada enfoque:
- Ve a https://aimultiple.com/open-source-embedding-models, dime los 5 mejores resultados perfectos (es decir, los modelos con una precisión top-5 del 100 %)
- Ve a https://aimultiple.com/open-source-embedding-models, dime qué modelo tiene la latencia más alta.
Configuración de la comparación
Para ambos enfoques, utilizamos el servidor MCP de Bright Data con modo Pro y GPT-4.1 como LLM debido a su gran ventana de contexto.
Configuración del entorno: Limpiamos todos los datos en caché y garantizamos una conexión nueva al servidor MCP en cada ejecución. Cada consulta se ejecuta como un subproceso independiente.
Comparación de arquitecturas
Arquitectura del MCP normal
En el enfoque de MCP normal, el agente sigue un flujo directo: la consulta del usuario entra en un agente LangGraph ReAct, que tiene acceso a las 63 definiciones de herramientas en su ventana de contexto. El agente selecciona y llama a las herramientas a través de la sesión de cliente MCP, y los resultados de las herramientas vuelven a través de la ventana de contexto para informar la siguiente acción del agente.
Arquitectura de ejecución de código con MCP
El enfoque de ejecución de código añade una capa intermedia: la consulta del usuario va a un agente de ejecución de código con un contexto compacto (solo nombres de herramientas, no esquemas completos). El agente escribe código Python que llama a las herramientas. Este código se ejecuta en un entorno de ejecución de código aislado, que se comunica con la sesión de cliente MCP. Solo los resultados o resúmenes finales regresan al contexto del agente, no los datos intermedios sin procesar.
La implementación de ejecución de código utiliza revelación progresiva. Solo se incluyen en el prompt del sistema los nombres de herramientas y descripciones truncadas (60 caracteres). Cuando el modelo necesita usar una herramienta, escribe código Python que llama a una función asincrónica call_tool() proporcionada en el entorno de ejecución.
Limitaciones de nuestro enfoque
- Diversidad de consultas: Solo se probaron 2 tipos de consultas; los resultados pueden variar para otros tipos de tareas.
- Modelo único: Solo se probó con GPT-4.1; otros modelos pueden mostrar patrones diferentes
- Calidad del código: El éxito de la ejecución de código depende de la capacidad de generación de código del modelo; esto puede provocar disminuciones en las tasas de éxito en tareas más complicadas.
Por qué el MCP tradicional desperdicia recursos
Problema 1: Las definiciones de herramientas consumen un contexto excesivo
Cada herramienta necesita instrucciones en la memoria del modelo. Un ejemplo básico:
gdrive.getDocument
Gets a file from Google Drive
Needs: document ID
Returns: the file content
Ejemplo: Un agente conectado a 50 servidores con 20 herramientas cada uno implica 1.000 definiciones de herramientas. Aproximadamente 150 tokens por definición, son 150.000 tokens consumidos antes de que el agente lea tu primera solicitud.
Problema 2: Los datos se procesan varias veces
Tarea: “Obtén mis notas de reunión de Google Drive y agrégalas a Salesforce”.
Qué sucede:
- El agente obtiene el documento (50.000 tokens)
- El modelo lo lee
- El agente lo envía a Salesforce (otros 50.000 tokens)
El modelo maneja 100.000+ tokens para mover datos de un lugar a otro.
Las implementaciones tradicionales de MCP requieren que el modelo seleccione herramientas a partir de definiciones JSONSchema cargadas en la ventana de contexto, lo que degrada la precisión a medida que aumenta el número de herramientas.1 La investigación ha confirmado que las tasas de éxito de las tareas disminuyen drásticamente a medida que crece el número de herramientas disponibles debido a la saturación del contexto por las definiciones de esquemas.2 Exponer las herramientas de MCP como funciones invocables y permitir que el modelo escriba código Python que invoque las herramientas directamente aprovecha la capacidad de generación de código existente del modelo, en lugar de forzar la selección a partir de esquemas predefinidos.
¿Cuándo usar la ejecución de código con MCP?
La ejecución de código con MCP aborda dos ineficiencias fundamentales de las implementaciones tradicionales de MCP:
- Las definiciones de herramientas ya no saturan la ventana de contexto
- Los datos intermedios dejan de fluir a través del modelo innecesariamente
El enfoque funciona mejor cuando:
- Tienes muchas herramientas MCP conectadas
- Tus flujos de trabajo implican procesamiento de datos en varios pasos
- Documentos o datasets grandes se mueven entre herramientas
- Los límites de la ventana de contexto afectan a tus agentes
Los requisitos de infraestructura hacen que este enfoque no sea automáticamente mejor para todos los casos de uso. Las implementaciones a pequeña escala con pocas herramientas podrían no justificar la complejidad operativa.
Para las organizaciones que ya ejecutan agentes con catálogos extensos de herramientas MCP, el potencial de una reducción de tokens del 98 %+ y los correspondientes ahorros de costes hacen que valga la pena investigar este enfoque.
Frameworks y protocolos alternativos
Más allá de LangGraph, el Agent Development Kit (ADK) de Google ofrece soporte nativo de MCP mediante McpToolset y se integra con el protocolo Agent2Agent (A2A), que estandariza la comunicación entre agentes mediante tarjetas de capacidad publicadas en /.well-known/agent-card.json.34 En abril de 2026, OpenAI actualizó su Agents SDK para añadir capacidades nativas de ejecución en sandbox, proporcionando espacios de trabajo aislados con acceso restringido a archivos y código.5
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{alper2026,
author = {Alper, Şevval},
title = {{Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/code-execution-with-mcp}},
note = {AIMultiple. Recuperado el 14 de Agosto de 2026}
}Resultados y marcas de tiempo de 7 puntos de datos. Descargue los datos resumidos que se muestran en los gráficos y las tablas de este artículo como un archivo ZIP que contiene un archivo CSV.
¿Quieres los datos granulares que hay detrás? Únete a Premium
Registro de cambios
2 actualizacionesSe eliminó la sección "Comparación: UTCP vs MCP vs Ejecución de Código MCP".
Enlaces de referencia
Şevval se centra en herramientas de codificación con IA, agentes de IA y tecnologías cuánticas.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.