Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA
Anthropic presentó un método en el que los agentes de IA interactúan con Model Context Protocol (MCP) servidores escribiendo código ejecutable en lugar de hacer llamadas directas a herramientas. El agente trata las herramientas como archivos en una computadora, encuentra lo que necesita y las usa directamente con código, de modo que los datos intermedios no tengan que pasar por la memoria del model. Probamos este enfoque para ver si reduce el coste de tokens manteniendo la misma tasa de éxito.
Ejecución de código con MCP frente a MCP normal
Métrica | MCP normal | MCP con ejecución de código | Diferencia |
|---|---|---|---|
Tasa de éxito | 100 % | 100 % | Igual |
Latencia media | 9.66s | 10.37s | +7 % |
Tokens de entrada promedio | 15.417 | 3.310 | -78.5 % |
Tokens de salida promedio | 87 | 192 | +120 % |
Tokens de entrada totales | 770.852 | 165.496 | -78.5 % |
Tokens de salida totales | 4.345 | 9.585 | +120 % |
Total de todos los tokens | 775.197 | 175.081 | -77.4 % |
Comparamos dos enfoques para crear agentes de IA que interactúan con herramientas externas a través del MCP:
- MCP normal: enfoque tradicional en el que todas las definiciones de herramientas se cargan en la ventana de contexto del model
- MCP con ejecución de código: enfoque novedoso en el que el model escribe código que llama a herramientas, manteniendo los datos intermedios fuera del contexto
Conclusiones clave
Ahorro de tokens de entrada: la ejecución de código utiliza un 78.5 % menos de tokens de entrada (165K frente a 771K):
- El enfoque normal carga ~15.400 tokens de definiciones de herramientas por llamada
- La ejecución de código solo necesita ~3.300 tokens por llamada
Mayores tokens de salida: el enfoque de ejecución de código utiliza 2.2× más tokens de salida porque el model escribe código + explicaciones
Ahorro neto de tokens: reducción total de tokens del 77.4 % (175K frente a 775K)
Implicación de coste:
- Los tokens de entrada suelen ser más baratos que los tokens de salida
- Pero el ahorro de entrada del 78 % supera con creces el aumento de salida de 2×
- Reducción de coste estimada de ~70 % con la ejecución de código
Ambos lograron una tasa de éxito del 100 % en estas consultas con GPT-4.1.
El enfoque de ejecución de código está inspirado en la publicación de Anthropic sobre el uso de la ejecución de código con MCP para reducir el uso de la ventana de contexto manteniendo la capacidad del agente.1
Metodología de la comparación de la ejecución de código con MCP
Tareas
Ejecutamos cada tarea 50 veces para cada enfoque:
- Ve a https://aimultiple.com/open-source-embedding-models, dime los 5 mejores con un rendimiento perfecto (es decir, los models con una precisión del 100 % en el top 5)
- Ve a https://aimultiple.com/open-source-embedding-models, dime qué model tiene la mayor latencia.
Configuración de la comparación
Usamos el servidor MCP de Bright Data con el modo pro activado, ya que tuvo la mayor precisión en nuestro benchmark de MCP para navegador.
Bright Data ofrece 5.000 gratis MCP solicitudes al mes para probar este enfoque de ejecución de código
Visita el sitio webUsamos GPT-4.1 como LLM debido a su amplia ventana de contexto.
Configuración del entorno: Limpiamos todos los datos en caché y garantizamos una conexión nueva con el servidor MCP en cada ejecución. Cada consulta se ejecuta como un subproceso separado.
Comparación de arquitectura
Arquitectura de MCP normal
En el enfoque de MCP normal, el agente sigue un flujo directo: la consulta del usuario entra en un agente LangGraph ReAct, que tiene acceso a las 63 definiciones de herramientas en su ventana de contexto. El agente selecciona y llama a las herramientas a través de la sesión de cliente MCP, y los resultados de las herramientas regresan a través de la ventana de contexto para informar la siguiente acción del agente.
Arquitectura de MCP con ejecución de código
El enfoque de ejecución de código añade una capa intermedia: la consulta del usuario va a un agente de ejecución de código con un contexto compacto (solo nombres de herramientas, no esquemas completos). El agente escribe código Python que llama a las herramientas. Este código se ejecuta en un entorno aislado de ejecución de código, que se comunica con la sesión de cliente MCP. Solo los resultados finales o resúmenes regresan al contexto del agente, no los datos intermedios sin procesar.
La implementación de la ejecución de código utiliza divulgación progresiva. Solo se incluyen en el prompt del sistema los nombres de las herramientas y descripciones truncadas (60 caracteres). Cuando el model necesita usar una herramienta, escribe código Python que llama a una función async call_tool() proporcionada en el entorno de ejecución.
Limitaciones de nuestro enfoque
- Diversidad de consultas: Solo se probaron 2 tipos de consultas; los resultados pueden variar para otros tipos de tareas.
- Model único: Solo se probó con GPT-4.1; otros models pueden mostrar patrones diferentes.
- Calidad del código: El éxito de la ejecución de código depende de la capacidad de generación de código del model; esto puede provocar disminuciones en las tasas de éxito en tareas más complicadas.
Por qué el MCP tradicional desperdicia recursos
Problema 1: Las definiciones de herramientas consumen un contexto excesivo
Cada herramienta necesita instrucciones en la memoria del model. Un ejemplo básico:
gdrive.getDocument
Gets a file from Google Drive
Needs: document ID
Returns: the file content
Ejemplo: Un agente conectado a 50 servidores con 20 herramientas cada uno significa 1.000 definiciones de herramientas. Aproximadamente a 150 tokens por definición, eso son 150.000 tokens consumidos antes de que el agente lea tu primera solicitud.
Problema 2: Los datos se procesan varias veces
Tarea: “Obtén mis notas de reunión de Google Drive y agrégalas a Salesforce.”
Qué sucede:
- El agente obtiene el documento (50.000 tokens)
- El model lo lee
- El agente lo envía a Salesforce (otros 50.000 tokens)
El model maneja más de 100.000 tokens para mover datos de un lugar a otro.
Las implementaciones tradicionales de MCP requieren que el model seleccione herramientas a partir de definiciones JSONSchema cargadas en la ventana de contexto, lo que degrada la precisión a medida que aumenta el número de herramientas.1 La investigación ha confirmado que las tasas de éxito de las tareas disminuyen drásticamente a medida que crece el número de herramientas disponibles debido a la saturación del contexto provocada por las definiciones de esquemas.2 Exponer las herramientas MCP como funciones invocables y permitir que el model escriba código Python que invoque herramientas directamente aprovecha la capacidad existente de generación de código del model en lugar de forzar la selección a partir de esquemas predefinidos.
Cuándo usar la ejecución de código con MCP?
La ejecución de código con MCP aborda dos ineficiencias fundamentales de las implementaciones tradicionales de MCP:
- Las definiciones de herramientas ya no saturan la ventana de contexto
- Los datos intermedios dejan de fluir innecesariamente a través del model
El enfoque funciona mejor cuando:
- Tienes muchas herramientas MCP conectadas
- Tus flujos de trabajo implican procesamiento de datos en varios pasos
- Documentos grandes o datasets se mueven entre herramientas
- Los límites de la ventana de contexto afectan a tus agentes
Los requisitos de infraestructura implican que esto no es automáticamente mejor para todos los casos de uso. Los despliegues a pequeña escala con pocas herramientas podrían no justificar la complejidad operativa.
Para las organizaciones que ya ejecutan agentes con amplios catálogos de herramientas MCP, el potencial de una reducción de tokens de más del 98 % y los correspondientes ahorros de costes hace que valga la pena investigar este enfoque.
Frameworks y protocolos alternativos
Además de LangGraph, el Agent Development Kit (ADK) de Google ofrece soporte nativo de MCP a través de McpToolset e integra el protocolo Agent2Agent (A2A), que estandariza la comunicación entre agentes mediante tarjetas de capacidad publicadas en /.well-known/agent-card.json.3 4 En abril de 2026, OpenAI actualizó su Agents SDK para añadir capacidades nativas de ejecución en sandbox, proporcionando espacios de trabajo aislados con acceso restringido a archivos y código.5
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{sezer2026,
author = {Sezer, Sena and Alper, Şevval},
title = {{Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/code-execution-with-mcp}},
note = {AIMultiple. Recuperado el 14 de Agosto de 2026}
}
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.