Un gateway MCP se sitúa entre un agente de IA y las herramientas a las que llama, y los proveedores lo posicionan como la capa de seguridad para ese tráfico. Evaluamos comparativamente seis gateways MCP contra un backend instrumentado en una única máquina, midiendo la latencia añadida, la autorización por herramienta, la protección de contenido y la completitud de la auditoría.
MCP Resultados del benchmark de gateways
Un producto aparece frente a un control únicamente si lo incluye y ese control se ejecutó, de modo que nadie recibe una puntuación de cero por una función que no vende.
Uno de los seis gateways medidos incluye un detector de inyecciones. TrueFoundry detuvo 55 de 60 instrucciones inyectadas con él. Los otros cinco no incorporan detección de inyecciones ni de jailbreak, por lo que una instrucción insertada en una respuesta de herramienta llega al cliente a través de cada uno de ellos.
ContextForge incluye 44 plugins.1 Los tres cuyos nombres contienen “inject” añaden un encabezado HTTP, un aviso de privacidad y un encabezado de licencia, y ninguno del resto detecta inyecciones.
El escaneo de credenciales es la dimensión mejor cubierta. Cuatro gateways detuvieron los tres formatos que se pueden detectar por patrones. Se diferencian en lo que recibe el llamador: Lasso y TrueFoundry redactan el secreto coincidente y devuelven el resto de la respuesta, mientras que ContextForge y Docker retienen toda la salida de la herramienta, por lo que el llamador también pierde el mensaje de error.
Tres productos incluyen sus controles de contenido desactivados, que es el estado en el que la mayoría de los lectores los encontrarán. ContextForge detecta credenciales una vez que un operador habilita sus plugins. Cortx no bloqueó nada incluso con una política activa.
Instrucciones inyectadas en las respuestas de las herramientas
La sonda devuelve una respuesta de herramienta que contiene una instrucción dirigida al model en dos formas: un elemento dentro de una lista estructurada y una oración incrustada en texto gratis. Un gateway que inspecciona la salida de la herramienta debería eliminarla o rechazarla.
TrueFoundry bloquea 27 de 30 en la forma de lista y 28 de 30 en la forma de texto gratis, utilizando su detector integrado de inyección de prompts en la configuración predeterminada de aplicación. El rechazo nombra la regla que se activó.
Cinco de 60 intentos llegaron igualmente al cliente, y la estrategia predeterminada deja pasar una solicitud cuando el propio detector falla.
La sonda mide si el gateway elimina el texto. No comprueba si un model seguiría la instrucción.
Credenciales de backend en las respuestas de las herramientas
El backend devuelve un error que contiene cuatro credenciales: un token de GitHub, un ID de clave de acceso de AWS, un JWT y una cadena arbitraria de proveedor.
Ninguno de los escáneres probados capturó la cadena arbitraria de proveedor, porque ninguno incluía una regla escrita para su forma. ContextForge parece detenerla solo porque se retuvo toda la respuesta gracias a las otras tres.
El escaneo de secretos de Docker está activado de forma predeterminada y es el único control de credenciales de esta tabla que un operador obtiene sin configurar nada.
Autorización por herramienta
La sonda limita una credencial para excluir una herramienta y luego llama a esa herramienta directamente por su nombre.
Cuatro de los seis lo aplican y ninguno devuelve los datos retenidos. La compilación de código abierto de Docker se ejecuta sin una credencial de llamador, por lo que puede ocultar una herramienta globalmente pero no puede dar a dos llamadores conjuntos de herramientas diferentes. La superficie de plugins de Lasso se limita a guardrails y trazabilidad, sin ningún paso de autorización.
Bifrost mide 840 microsegundos con una clave con ámbito y 866 con una sin ámbito, una diferencia menor que la variación entre repeticiones. Limitar una credencial no conllevó ninguna penalización de latencia que pudiéramos resolver.
Cortx y TrueFoundry nombran la restricción; Cortx devuelve “Herramienta no permitida para esta sesión”. Bifrost y ContextForge informan de que la herramienta no se encontró. Ninguno de estos comportamientos se puntúa aquí.
Completitud de la auditoría
Leímos todas las superficies de auditoría que pudimos identificar. La mayoría de los productos dividen el registro entre un log y una base de datos.
TrueFoundry es el único participante que registra una denegación de autorización. Su traza de la llamada rechazada contiene el nombre de la herramienta, el correo electrónico del llamador, los argumentos y el texto de rechazo.
Bifrost, ContextForge y Cortx bloquean todos una llamada no autorizada y ninguno registra que haya ocurrido. Sus almacenes mantuvieron el mismo número de filas antes y después del intento.
ContextForge no registró ninguna invocación fallida en nuestro despliegue, y su tabla audit_trails de 26 columnas permaneció vacía todo el tiempo.
Docker es el único gateway autoalojado que deja algún rastro de una llamada bloqueada, y el rastro se lee como un éxito. La línea contiene el nombre de la herramienta y una duración plausible de dos milisegundos sin campo de resultado, por lo que un operador que busque eventos de seguridad no la encontraría.
Cortx registra los argumentos de la herramienta y la respuesta completa, lo cual solo Lasso y TrueFoundry también hacen, pero conserva 50 filas sea cual sea el límite solicitado. Esa ventana cubrió 11 segundos de nuestra ejecución de 2.400 llamadas.
Latencia añadida
Bifrost añade 840 microsegundos por llamada, Docker 1.134 y ContextForge 23.058. ContextForge añade 27 veces más latencia que Bifrost.
La propia cifra de Bifrost de menos de 100 microsegundos es una afirmación de rendimiento a alta concurrencia.2 A concurrencia 1 añade aproximadamente diez veces esa cifra, y la afirmación debería probarse como un número de rendimiento en lugar de considerarse refutada aquí.
Un gateway también ralentiza el tráfico que nunca pasa por él. Mientras Docker o ContextForge estaban sirviendo, las llamadas realizadas directamente al backend se ejecutaron aproximadamente 0.9 milisegundos más lentas, entre 858 y 973 microsegundos en las cuatro tareas de medición de tiempos.
Ese efecto no se aplicaría a un gateway en su propio host, por lo que se informa por separado de las cifras de llamadas enrutadas anteriores.
Coste de la gobernanza
Se pudieron medir dos productos con su control de contenido desactivado y activado, cambiando un solo ajuste entre los pares.
Los cuatro detectores de ContextForge costaron 3.198 microsegundos, un aumento del 11.5 %. Las desviaciones estándar entre repeticiones fueron de 157 microsegundos con ellos desactivados y de 73 con ellos activados. Esta línea base no es comparable con el gráfico de latencia: el framework de plugins y el número de herramientas diferían, por lo que solo se mantiene el cambio dentro del par.
Los dos guardrails de TrueFoundry la llevan de 55.5 a 172.1 milisegundos, aproximadamente el triple. Sus tres repeticiones midieron 152.6, 163.4 y 200.3 milisegundos. Con los detectores desactivados, la desviación estándar entre repeticiones fue de 1.5 milisegundos.
Los dos tipos de detectores costaron cantidades diferentes. La coincidencia de patrones de ContextForge añadió un 11.5 %, mientras que la detección de inyecciones de TrueFoundry aproximadamente triplicó la cifra y varió de 152.6 a 200.3 milisegundos entre repeticiones, por lo que una sola ejecución no habría mostrado ese rango.
¿Qué es un plano de control de IA?
Cortx y TrueFoundry no son gateways que se instalan. Son planos de control de IA: una capa alojada que contiene la política, la identidad y el registro de auditoría para el tráfico de IA de una organización, y enruta las llamadas a herramientas a través de sí misma para que un único conjunto de reglas se aplique en todas partes.
El gateway es la parte que mueve el tráfico. El plano de control es la parte que decide qué está permitido y registra lo que ocurrió. Los proveedores venden lo segundo como la razón para comprar lo primero.
Ambas cifras están dominadas por la distancia de red. Cortx añade 211.1 milisegundos y TrueFoundry 55.5 desde la misma máquina, y solo el viaje de ida y vuelta es de unos 100 milisegundos hasta la región de Cortx frente a 14.1 hasta la de TrueFoundry. Dos cruces representan aproximadamente 200 de los 211 milisegundos de Cortx. Nunca clasificamos a los dos entre sí.
La afirmación de un plano de control es que una política se aplica en todas partes, así que eso es lo que probamos. Cortx incluye el escaneo de respuestas desactivado. Creamos una política, habilitamos dos de sus categorías integradas en Block, la aprobamos y el propio endpoint de estado del producto confirmó que la nuestra era la política activa. Todos los formatos de credenciales y las dos instrucciones inyectadas seguían llegando al cliente, y activar la política no costó ninguna latencia medible.
Su registro de cumplimiento muestra por qué: cada evento que registra se sitúa en la etapa que se ejecuta alrededor de una llamada al model, y nuestra ruta no tiene ningún model. Ninguna de sus categorías integradas cubre la inyección de prompts ni la detección de jailbreak, la misma laguna que el conjunto de plugins de ContextForge.
Por tanto, un plano de control puede estar correctamente configurado, informar de que está activo y aun así no situarse en la ruta que le importa. Una respuesta de herramienta de MCP es una superficie más nueva que un prompt de model, y un motor de políticas cubre las superficies para las que fue construido. Pregunte a un proveedor qué etapa de su motor ve una respuesta de herramienta y obtenga esa respuesta antes de la auditoría en lugar de después.
¿Qué es un gateway MCP?
El Model Context Protocol permite a un agente de IA descubrir y llamar herramientas que residen fuera de él, como un servicio de consulta de base de datos o una API interna. Un gateway es un proxy por el que pasan todas esas llamadas, de modo que un operador puede dirigir muchos agentes a una sola dirección en lugar de conectar cada agente a cada herramienta.
Un gateway centraliza cuatro funciones en muchos agentes y herramientas. Decide qué llamador puede usar qué herramienta, inspecciona la salida de la herramienta antes de que el model la lea, registra lo que ocurrió y enruta el tráfico.
Qué cubre y qué no cubre la ruta
Un gateway ve las llamadas a herramientas y las respuestas de las herramientas. No ve el razonamiento privado del model ni el contexto completo del chat, por lo que este benchmark prueba los controles de inyección únicamente en las respuestas de las herramientas.
Además, solo protege el tráfico que pasa por él. Dejamos el backend directamente accesible y no puntuamos la resistencia a la evasión porque ese resultado dependería de controles de red de despliegue ajenos a la ruta del gateway.
MCP Metodología del benchmark de gateways
Productos: siete seleccionados, seis medidos. Bifrost v1.6.10, Docker MCP Gateway v0.43.3, IBM ContextForge v1.0.7, Lasso Security v1.2.1 (autoalojados); Cortx v1.1, consola del nivel Developer de TrueFoundry 0.167.0 (alojados). Portkey no produjo ninguna medición. Su sincronización de workspace informó de éxito mientras nuestro registro de origen registró cero conexiones, y la cuenta del nivel gratis que probamos carecía de la clase de clave que requiere una integración a nivel de organización.
Fechas de medición: latencia de herramientas MCP autónomas 2026-08-13, barrido de políticas y auditoría 2026-08-21, latencia alojada de TrueFoundry 2026-08-17, latencia alojada de Cortx 2026-08-19.
Entorno: una caja de 8 vCPU, gateway y backend simulado colocalizados, Caddy sobre TLS. Los gateways alojados se acceden a través de la WAN, por lo que sus cifras incluyen latencia de red que esta configuración no puede separar limpiamente del procesamiento del gateway. Cortx egresa desde AWS us-east-1; la región de TrueFoundry no se identificó de forma independiente.
Backend: un servidor MCP simulado, 16 herramientas, retrasos deterministas por herramienta, 4 de ellas ecos puros para la medición de tiempos. Filtra 4 formatos de credenciales bajo petición (token de GitHub, ID de clave de AWS, JWT, cadena arbitraria de proveedor), devuelve instrucciones inyectadas en 2 formas (lista estructurada, texto gratis) y registra cada llamada. Los tres formatos de credenciales estándar son sintéticos, con longitudes y estructuras que cumplen las reglas de formato que usan los escáneres de secretos reales.
Cliente: un cliente MCP determinista sin model de lenguaje. Un model en la ruta añadiría segundos de variación a una medición de microsegundos sin cambiar lo que hace el gateway.
Latencia: mediana de la latencia añadida a concurrencia 1, la llamada enrutada por el gateway menos una llamada directa al backend emparejada, con las dos rutas intercaladas para reducir el sesgo por deriva. Bifrost 5 repeticiones, Docker y ContextForge 3, a 200 llamadas por tarea y repetición. Se rechazó el muestreo secuencial: sobrestimó a Docker en un 89 % y a Bifrost en un 54 %. Lasso se ejecuta sobre stdio en lugar de un socket, por lo que no tiene una cifra comparable.
Sondas de política (n=30 cada una): una instrucción inyectada en 2 formas, una fuga de credenciales en 4 formatos y una llamada a una herramienta para la que la credencial no tiene ámbito. La línea base directa al backend devolvió todas las cargas útiles, por lo que un cero a través de un gateway indica que el gateway actuó, no una sonda fallida.
Configuración: todos los productos se midieron con los controles de contenido más estrictos disponibles para nosotros, manteniendo los parámetros de detector incluidos. No se escribió ningún patrón para que coincidiera con la carga útil de prueba. Cuando un producto tiene una configuración predeterminada y una gobernada, se publican ambas. TrueFoundry, ContextForge y Cortx incluyeron su control de contenido desactivado y se volvieron a medir con él activado. TrueFoundry y ContextForge registraron la aplicación en la ruta probada; Cortx confirmó que la política estaba activa pero no registró ningún evento de aplicación para estas llamadas.
Auditoría: se leyó toda superficie de auditoría que identificamos, incluidos stdout, almacenes de base de datos, registros de actividad y vistas de trazas alojadas. Los almacenes de base de datos se marcaron con puntos de control antes de contar filas.
Para obtener resultados a nivel de model, consulte el benchmark agéntico de LLM.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{MCP Gateway Benchmark: Latencia y Seguridad de 6 Gateways}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/mcp-gateway}},
note = {AIMultiple. Recuperado el 24 de Agosto de 2026}
}Registro de cambios
2 actualizaciones- 2026
Se añadió una sección de resultados de benchmark comparando seis gateways MCP en latencia y seguridad
Se añadieron IBM ContextForge, Kong AI Gateway y MintMCP Gateway a la cobertura de gateways.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.