Premium
Servicios
Premium

Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA

Şevval Alper
Şevval Alper
actualizado el 14 de ago. de 2026

Anthropic presentó un método en el que los agentes de IA interactúan con servidores de Model Context Protocol (MCP) escribiendo código ejecutable en lugar de realizar llamadas directas a herramientas. El agente trata las herramientas como archivos en un ordenador, encuentra lo que necesita y las usa directamente con código, por lo que los datos intermedios no tienen que pasar por la memoria del modelo. Probamos este enfoque para ver si reduce el costo de tokens manteniendo la misma tasa de éxito.

Ejecución de código con MCP vs MCP normal

Métrica
MCP normal
MCP con ejecución de código
Diferencia
Tasa de éxito
100 %
100 %
Igual
Latencia media
9.66s
10.37s
+7 %
Media de tokens de entrada
15.417
3.310
-78.5 %
Media de tokens de salida
87
192
+120 %
Total de tokens de entrada
770.852
165.496
-78.5 %
Total de tokens de salida
4.345
9.585
+120 %
Total de todos los tokens
775.197
175.081
-77.4 %

Comparamos dos enfoques para crear agentes de IA que interactúan con herramientas externas a través del MCP:

  • MCP normal: Enfoque tradicional en el que todas las definiciones de herramientas se cargan en la ventana de contexto del modelo
  • Ejecución de código con MCP: Enfoque novedoso en el que el modelo escribe código que llama a las herramientas, manteniendo los datos intermedios fuera del contexto

Herramientas utilizadas

Este benchmark se realizó utilizando el servidor MCP de Bright Data con modo Pro, ya que tuvo la mayor precisión en nuestro benchmark de MCP para navegadores.

Hallazgos clave

Ahorro de tokens de entrada: la ejecución de código utiliza 78.5 % menos de tokens de entrada (165K frente a 771K):

  • El enfoque normal carga ~15.400 tokens de definiciones de herramientas por llamada
  • La ejecución de código solo necesita ~3.300 tokens por llamada

Más tokens de salida: el enfoque de ejecución de código utiliza 2.2× más tokens de salida porque el modelo escribe código + explicaciones

Ahorro neto de tokens: 77.4 % de reducción total de tokens (175K frente a 775K)

Implicación en el costo:

  • Los tokens de entrada suelen ser más baratos que los tokens de salida
  • Pero el ahorro de entrada del 78 % supera con creces el aumento de salida de 2×
  • Reducción de coste estimada de ~70 % con la ejecución de código

Ambos lograron una tasa de éxito del 100 % en estas consultas con GPT-4.1.

El enfoque de ejecución de código está inspirado en la publicación de Anthropic sobre el uso de la ejecución de código con MCP para reducir el uso de la ventana de contexto manteniendo la capacidad del agente.1

Metodología de la comparación de la ejecución de código con MCP

Tareas

Ejecutamos cada tarea 50 veces para cada enfoque:

  • Ve a https://aimultiple.com/open-source-embedding-models, dime los 5 mejores resultados perfectos (es decir, los modelos con una precisión top-5 del 100 %)
  • Ve a https://aimultiple.com/open-source-embedding-models, dime qué modelo tiene la latencia más alta.

Configuración de la comparación

Para ambos enfoques, utilizamos el servidor MCP de Bright Data con modo Pro y GPT-4.1 como LLM debido a su gran ventana de contexto.

Configuración del entorno: Limpiamos todos los datos en caché y garantizamos una conexión nueva al servidor MCP en cada ejecución. Cada consulta se ejecuta como un subproceso independiente.

Comparación de arquitecturas

Arquitectura del MCP normal

En el enfoque de MCP normal, el agente sigue un flujo directo: la consulta del usuario entra en un agente LangGraph ReAct, que tiene acceso a las 63 definiciones de herramientas en su ventana de contexto. El agente selecciona y llama a las herramientas a través de la sesión de cliente MCP, y los resultados de las herramientas vuelven a través de la ventana de contexto para informar la siguiente acción del agente.

Arquitectura de ejecución de código con MCP

El enfoque de ejecución de código añade una capa intermedia: la consulta del usuario va a un agente de ejecución de código con un contexto compacto (solo nombres de herramientas, no esquemas completos). El agente escribe código Python que llama a las herramientas. Este código se ejecuta en un entorno de ejecución de código aislado, que se comunica con la sesión de cliente MCP. Solo los resultados o resúmenes finales regresan al contexto del agente, no los datos intermedios sin procesar.

La implementación de ejecución de código utiliza revelación progresiva. Solo se incluyen en el prompt del sistema los nombres de herramientas y descripciones truncadas (60 caracteres). Cuando el modelo necesita usar una herramienta, escribe código Python que llama a una función asincrónica call_tool() proporcionada en el entorno de ejecución.

Limitaciones de nuestro enfoque

  1. Diversidad de consultas: Solo se probaron 2 tipos de consultas; los resultados pueden variar para otros tipos de tareas.
  2. Modelo único: Solo se probó con GPT-4.1; otros modelos pueden mostrar patrones diferentes
  3. Calidad del código: El éxito de la ejecución de código depende de la capacidad de generación de código del modelo; esto puede provocar disminuciones en las tasas de éxito en tareas más complicadas.
Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Por qué el MCP tradicional desperdicia recursos

Problema 1: Las definiciones de herramientas consumen un contexto excesivo

Cada herramienta necesita instrucciones en la memoria del modelo. Un ejemplo básico:

gdrive.getDocument
Gets a file from Google Drive
Needs: document ID
Returns: the file content

Ejemplo: Un agente conectado a 50 servidores con 20 herramientas cada uno implica 1.000 definiciones de herramientas. Aproximadamente 150 tokens por definición, son 150.000 tokens consumidos antes de que el agente lea tu primera solicitud.

Problema 2: Los datos se procesan varias veces

Tarea: “Obtén mis notas de reunión de Google Drive y agrégalas a Salesforce”.

Qué sucede:

  1. El agente obtiene el documento (50.000 tokens)
  2. El modelo lo lee
  3. El agente lo envía a Salesforce (otros 50.000 tokens)

El modelo maneja 100.000+ tokens para mover datos de un lugar a otro.
Las implementaciones tradicionales de MCP requieren que el modelo seleccione herramientas a partir de definiciones JSONSchema cargadas en la ventana de contexto, lo que degrada la precisión a medida que aumenta el número de herramientas.1 La investigación ha confirmado que las tasas de éxito de las tareas disminuyen drásticamente a medida que crece el número de herramientas disponibles debido a la saturación del contexto por las definiciones de esquemas.2 Exponer las herramientas de MCP como funciones invocables y permitir que el modelo escriba código Python que invoque las herramientas directamente aprovecha la capacidad de generación de código existente del modelo, en lugar de forzar la selección a partir de esquemas predefinidos.

¿Cuándo usar la ejecución de código con MCP?

La ejecución de código con MCP aborda dos ineficiencias fundamentales de las implementaciones tradicionales de MCP:

  1. Las definiciones de herramientas ya no saturan la ventana de contexto
  2. Los datos intermedios dejan de fluir a través del modelo innecesariamente

El enfoque funciona mejor cuando:

  • Tienes muchas herramientas MCP conectadas
  • Tus flujos de trabajo implican procesamiento de datos en varios pasos
  • Documentos o datasets grandes se mueven entre herramientas
  • Los límites de la ventana de contexto afectan a tus agentes

Los requisitos de infraestructura hacen que este enfoque no sea automáticamente mejor para todos los casos de uso. Las implementaciones a pequeña escala con pocas herramientas podrían no justificar la complejidad operativa.

Para las organizaciones que ya ejecutan agentes con catálogos extensos de herramientas MCP, el potencial de una reducción de tokens del 98 %+ y los correspondientes ahorros de costes hacen que valga la pena investigar este enfoque.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Frameworks y protocolos alternativos

Más allá de LangGraph, el Agent Development Kit (ADK) de Google ofrece soporte nativo de MCP mediante McpToolset y se integra con el protocolo Agent2Agent (A2A), que estandariza la comunicación entre agentes mediante tarjetas de capacidad publicadas en /.well-known/agent-card.json.34 En abril de 2026, OpenAI actualizó su Agents SDK para añadir capacidades nativas de ejecución en sandbox, proporcionando espacios de trabajo aislados con acceso restringido a archivos y código.5

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Şevval Alper (2026) - "Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA". Publicado en línea en AIMultiple.com. Recuperado el 14 de Agosto de 2026, de: https://aimultiple.com/code-execution-with-mcp [Recurso en línea]

Alper, Ş. (2026, 14 de Agosto). Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA. AIMultiple. https://aimultiple.com/code-execution-with-mcp

@misc{alper2026,
  author = {Alper, Şevval},
  title  = {{Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/code-execution-with-mcp}},
  note   = {AIMultiple. Recuperado el 14 de Agosto de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 7 puntos de datos. Descargue los datos resumidos que se muestran en los gráficos y las tablas de este artículo como un archivo ZIP que contiene un archivo CSV.

Última actualización: 17 de Agosto de 2026
Descargar

¿Quieres los datos granulares que hay detrás? Únete a Premium

Registro de cambios

2 actualizaciones
  1. Se eliminó la sección "Comparación: UTCP vs MCP vs Ejecución de Código MCP".

Şevval Alper
Şevval Alper
Investigadora de IA
Şevval es investigadora de IA en AIMultiple. Tiene experiencia previa en investigación sobre la generación de números pseudoaleatorios mediante sistemas caóticos.
Şevval se centra en herramientas de codificación con IA, agentes de IA y tecnologías cuánticas.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450