Benchmark de RAG Agéntico: Enrutamiento Multibase de Datos a través de 36 LLMs
Evaluamos 36 modelos de lenguaje grandes en el enrutamiento entre bases de datos. Cada modelo recibe una pregunta en lenguaje natural y 11 bases de datos SQL descritas a nivel de párrafo, y luego debe decidir cuál base de datos contiene la respuesta antes de escribir cualquier SQL. Las 11 bases de datos fueron extraídas de 80 candidatas BIRD-SQL agrupando las incrustaciones de sus descripciones, por lo que las candidatas son semánticamente cercanas entre sí, y sus nombres reales están ocultos tras las etiquetas db_01 a db_11.
Cada modelo vio el mismo conjunto fijo de 759 preguntas a temperatura 0, sin la pista de dominio de BIRD.1 Cada base de datos se expone como una herramienta con tres acciones: listado de esquema, detalle de tabla y ejecución de consultas, bajo un límite de 10 llamadas API por pregunta. La lista de herramientas se permuta para cada pregunta, por lo que la posición de la candidata no puede interpretarse como habilidad de enrutamiento.
Precisión de enrutamiento en las preguntas más difíciles. La proporción de las 184 preguntas más difíciles en las que la base de datos declarada por el modelo coincide con la base de datos de referencia. Una pregunta se considera una de las 184 cuando dos señales independientes coinciden. Al menos 5 de sus 20 vecinos más cercanos en el espacio de incrustación deben pertenecer a otras bases de datos, y un jurado de tres modelos debe etiquetarla como confusa. Esta es la métrica principal de enrutamiento.
Las 184 preguntas provienen de 6 de las 11 bases de datos, con las siguientes proporciones: 51 (regional_sales), 50 (retail_world), 43 (superstore), 27 (works_cycles), 8 (debit_card_specializing) y 5 (college_completion). Las cuatro bases de datos comerciales suman 171 de las 184, es decir, el 93 %. Las otras cinco bases de datos no aportan ninguna, porque están lo suficientemente aisladas semánticamente como para que ninguna de sus preguntas supere ambas señales. Por lo tanto, el número mide el enrutamiento entre bases de datos diseñadas para ser difíciles de distinguir, y está dominado por un único grupo comercial en lugar de estar repartido entre once dominios.
Ruta declarada. La base de datos que el modelo indica en su respuesta final bajo una clave explícita selected_database. Una ejecución que no nombra ninguna base de datos obtiene una puntuación de cero en lugar de heredar su última llamada a herramienta. Las rutas recuperadas a partir del texto en prosa se excluyen y se informan por separado.
Resultados del benchmark de RAG agéntico
Al repetir la ejecución, el líder del panel cae al sexto puesto
claude-opus-5 enrutó correctamente 0.848 de las preguntas más difíciles, 156 de 184. Lo ejecutamos una segunda vez en condiciones idénticas, el mismo conjunto fijo, la misma anonimización, temperatura 0, y obtuvo 0,8207, 151 de 184. Esa segunda puntuación es la puntuación publicada de claude-fable-5, que ocupa el sexto lugar. Los puestos del 1 al 6 abarcan desde 156 de 184 respuestas correctas hasta 151 de 184, una diferencia de cinco preguntas, que es la distancia que el propio líder se movió entre dos ejecuciones.
Un segundo modelo reprodujo el patrón. qwen3.8-max pasó de 0,8315 (153/184) a 0,8152 (150/184). Los grupos de preguntas fáciles y medias se movieron 0,0000 en ambos modelos, y el resto del movimiento se concentra en los tres grupos difíciles, donde qwen3.8-max también pasó de 153 a 152 en las preguntas señaladas por el recuento de vecinos.
qwen3.8-max tiene la menor diferencia agregada, 1,6 puntos frente a 2,7, y la mayor discrepancia consigo mismo, enrutando de manera diferente en 13 de las 184 preguntas difíciles, mientras que opus-5 difiere en 8. Un modelo puede reproducir su propia puntuación a la vez que discrepa consigo mismo en una pregunta difícil de cada catorce.
Dos limitaciones acompañan esto. Una sola repetición proporciona una diferencia absoluta, no una desviación estándar, por lo que de 1,6 a 2,7 puntos es un suelo del ruido más que una descripción del mismo. Y 34 de las 36 filas del panel no tienen ninguna repetición. Lea estas puntuaciones en niveles, no en clasificaciones.
Los 11 nombres de base de datos por sí solos enrutan a menos de 4 puntos del catálogo completo
Cuando se muestran los nombres reales de las bases de datos y sin descripciones, claude-opus-4.8 enruta a 0.688 y gemini-3.5-flash a 0.711. Cuando se muestra el catálogo completo, nombres reales más las 11 descripciones de párrafo, los mismos dos modelos obtienen 0.672 y 0.750, por lo que para claude-opus-4.8 los nombres solos puntúan más alto que todo el catálogo.
Reemplazar los nombres por db_01 a db_11 le cuesta a opus-4.8 7,0 puntos y a gemini 4,7. Una ejecución con nombres reales mide el reconocimiento de nombres junto con la comprensión, razón por la cual cada cifra publicada aquí proviene de la condición anonimizada.
Una tercera condición separa los dos canales. Mantener los nombres reales y permutar las descripciones entre bases de datos colapsa el enrutamiento a 0.148 y 0.055, medido en los mismos dos modelos en una prueba piloto de 128 preguntas.
Las bases de datos elegidas para ser confusas son unos 20 puntos más difíciles que las aleatorias
Intercambiamos las 10 bases de datos distractoras por 10 extraídas al azar de las otras 69 de BIRD, sobre las mismas 128 preguntas, la misma base de datos de referencia, ambos brazos anonimizados. El enrutamiento hard_strict pasa de 0.713 a 0.920 para claude-opus-4.8 y de 0.770 a 0.966 para gemini-3.5-flash. Ambos brazos responden a las mismas preguntas, por lo que la prueba es McNemar con corrección de continuidad sobre los pares discordantes, dando p = 8,6e-04 y p = 2,4e-04. Once candidatas elegidas al azar dejan a ambos modelos cerca del techo.
En el grupo fácil, el mismo contraste McNemar no es significativo, p = 0,48 y p = 1,00. Los distractores seleccionados por grupos estaban destinados a interferir con las preguntas que el recuento de vecinos señala como confusas y a dejar el resto enrutables independientemente del panel, y ese es el patrón que muestran los dos brazos.
Esta ablación es solo con descripciones y de un solo paso en lugar de agéntica, con un sorteo aleatorio de panel por pregunta. Respalda la afirmación de que la selección por descubrimiento de grupos produce un enrutamiento mediblemente más difícil que la selección aleatoria. No respalda la afirmación de que el recuento de vecinos por sí mismo cause dificultad, lo cual probamos por separado y no resultó significativo por sí solo.
El nivel superior de enrutamiento no es un nivel de precio
qwen3.8-max y kimi-k3 ambos enrutan 153 de 184 preguntas difíciles, 0,8315 cada uno, a un costo de $25,14 y $40,34 por ejecución de 759 preguntas. claude-fable-5 cuesta $121,55 y enruta 151. Seis modelos se sitúan a menos de 0,03 del líder en un rango de coste de 5x por ejecución.
La columna de coste registra lo facturado por la ejecución, no la economía del modelo. OpenRouter dirige un slug de modelo al proveedor ascendente que lo sirve, y las idénticas 594 preguntas en el mismo modelo han costado $2,09 en una ejecución y $8,33 en otra. Lea la columna como un orden de magnitud. Una dirección sobrevive a esa variación. Las dos ejecuciones más caras del panel, claude-fable-5 a $121,55 y claude-opus-4.8 a $117,82, no enrutan mejor que qwen3.8-max a $25,14.
Un modelo puede ejecutar el bucle agéntico sin beneficiarse de él
Restringido a las preguntas cuyo primer turno sondeó una sola base de datos, la diferencia de precisión entre la primera base de datos que un modelo toca y la que finalmente declara es de +25,0 puntos para claude-opus-5 y +38,0 para grok-4.5. Para gpt-5.4-mini esa diferencia es de 0,0. Para gpt-oss-120b es de -3,8 y para nova-lite-v1 es de -14,0. Ambos modelos abandonan una primera sonda correcta con más frecuencia de la que se recuperan de una incorrecta.
Los dos grupos difieren en la amplitud de exploración. Agrupados en el panel, los modelos sondean 1,12 bases de datos distintas en preguntas fáciles y 1,93 en las más difíciles. kimi-k3 pasa de 1,07 a 2,27 y grok-4.5 de 1,06 a 2,21, mientras que gpt-oss-120b pasa de 1,01 a 1,10 y gpt-5.4-nano de 1,11 a 1,20.
gpt-5.4-nano dedica 6,5 turnos por pregunta y emite llamadas a herramientas en todo momento, por lo que el bucle se ejecuta. Ejecutar el bucle le reporta 2,2 puntos.
Algunos proveedores ignoraron nuestra solicitud de llamadas secuenciales a herramientas. Cuando un primer turno tocaba varias bases de datos a la vez, lo excluimos de esta comparación, que luego se ejecuta con menos de 184 preguntas para algunos modelos (qwen3.8-max 86, glm-5.2 101, kimi-k3 105).
Sondeo, cambio y la diferencia entre la primera sonda y la ruta declarada
La exploración escala con la etiqueta de dificultad. Agrupando todos los 36 modelos y 759 preguntas:
En los 3 122 registros de preguntas más difíciles en los que un modelo cambió de ruta al menos una vez, 1 717 pasaron de una base de datos incorrecta a la correcta y 90 hicieron lo contrario, una ganancia neta de 1 627 registros con una proporción cercana a 19 a 1. Otros 983 comenzaron en una base de datos incorrecta y nunca llegaron a la correcta, y 332 abandonaron la base de datos correcta y volvieron a ella. Los cuatro recuentos utilizan la ruta de declaración explícita, la misma definición que cualquier otra cifra de enrutamiento aquí.
Esta asimetría es la razón por la que el benchmark puntúa la ruta declarada en lugar de la primera sonda. La versión anterior registraba la primera llamada a función de base de datos del agente como su decisión de enrutamiento. En este panel, esa convención subestima 30 de los 36 modelos en entre 14,7 y 38,0 puntos.
Coste por ejecución en el panel de 36 modelos
Las 36 ejecuciones costaron $874,53 en total, desde $0,47 hasta $121,55. Seis de ellas obtuvieron puntuación en menos de 759 preguntas tras errores residuales del proveedor (gemini-3.1-pro-preview 744, gemini-3-flash-preview 755, claude-haiku-4.5 750, nova-lite-v1 750, gpt-5.6-luna 758, gpt-5.6-terra 758).
El número de turnos varía de 3,79 a 7,64 en todo el panel y alimenta la factura junto con el precio por token. claude-opus-5 promedia 3,92 turnos por pregunta a $62,78, gemini-3.1-pro-preview 7,02 a $80,01, y gpt-oss-120b 3,79 a $0,47.
Tres de las 36 ejecuciones utilizaron caché de prompts y las otras 33 no, por lo que las filas no se facturan sobre la misma base y las tres filas con caché quedan más bajas de lo que lo haría una ejecución sin caché del mismo modelo.
Caché de prompts y lo que cuesta el control del sesgo posicional
En este benchmark, el 44 % de cada llamada del bucle de herramientas es un prefijo idéntico a nivel de bytes, el prompt del sistema de 362 tokens más las 11 definiciones de herramientas de 2 259, por lo que 2 621 tokens de una llamada que promedia alrededor de 6 000. Tres ejecuciones llevaban un punto de ruptura de caché explícito en ese prefijo. claude-opus-5 leyó el 62,2 % de su entrada desde la caché y se le facturó $62,78 frente a $105,54 a precio de lista, un 40,5 % menos. qwen3.8-max leyó el 68,2 %, el más alto que medimos, en Alibaba en lugar de Anthropic.
El ahorro está limitado por una decisión de diseño. La lista de herramientas se permuta por pregunta, por lo que el prefijo difiere desde el byte 0 entre preguntas y la caché de cada pregunta se escribe y se lee dentro de sus propias cinco llamadas aproximadamente, nunca a lo largo de la ejecución. Congelar el orden de las herramientas ampliaría la caché y ahorraría alrededor de $8,95 por ejecución de 759 preguntas. Mantuvimos la permutación y asumimos su coste.
El almacenamiento en caché cambió la factura y no la entrada del modelo. Un conjunto de pruebas negativas captura los cuerpos de solicitud reales con la bandera activada y desactivada y exige que sean idénticos a nivel de bytes una vez eliminados los marcadores de caché, y su prueba crítica altera un solo carácter bajo un marcador y exige que la comprobación lo detecte. Aun así, un defecto de coste sobrevivió a ese conjunto de pruebas. El turno de finalización envía deliberadamente ninguna definición de herramienta, por lo que su prefijo no acierta ninguna entrada en caché, y dejar un punto de ruptura en él escribió alrededor de 3,2M de tokens en la caché que nada podía leer, aproximadamente $4 de la factura de opus-5. Una revisión adversaria posterior al envío del cambio lo encontró, con todas las barreras en verde.
RAG agéntico y RAG estándar
La generación aumentada por recuperación coloca un paso de recuperación delante de un modelo de lenguaje. La pregunta se incrusta, los fragmentos más cercanos vuelven de un índice y el modelo responde a partir de ellos. El camino es fijo y nada en el pipeline elige nada.
RAG agéntico cede las decisiones de recuperación al modelo. Él elige qué fuente consultar, lee lo que devuelve y puede consultar de nuevo, cambiar de fuente o refinar la consulta antes de responder. La recuperación deja de ser un paso que se ejecuta una vez y se convierte en un bucle que el modelo dirige.
Esa primera elección, qué fuente contiene la respuesta, es lo que mide este benchmark. Cada modelo ve 11 bases de datos SQL descritas a nivel de párrafo, con sus nombres ocultos, y debe elegir una antes de escribir cualquier SQL. Luego puede sondear una segunda y una tercera y cambiar de opinión. En las preguntas más difíciles, el panel sondea 1,93 bases de datos en promedio, y el 47,3 % de las ejecuciones tocan más de una.
Cómo funciona el enrutamiento agéntico de bases de datos
El arnés le da al modelo una pregunta y un catálogo de 11 descripciones de párrafo, una por base de datos, sin nombres de tablas ni columnas en ellas. Junto al catálogo, adjunta 11 herramientas, una por base de datos, cada una exponiendo tres acciones: get_schema devuelve la lista de tablas, get_table_schema devuelve las columnas de una tabla y execute_query ejecuta SQL contra esa base de datos. La salida del esquema está limitada a 4 000 caracteres y los resultados de las consultas a 50 filas.
A partir de ahí, el modelo conduce. Elige una herramienta, lee la respuesta dentro de la misma conversación y puede sondear una base de datos diferente, pedir el detalle de una tabla o ejecutar una consulta contra la base de datos por la que se ha decidido. Puede cambiar de base de datos en cualquier turno, y el 47,3 % de las preguntas más difíciles son sondeadas en más de una.
El bucle termina de una de dos maneras. O bien el modelo deja de pedir herramientas, o bien utiliza su novena llamada con herramientas habilitadas. En cualquier caso, el arnés envía entonces una llamada de finalización sin herramientas, en la que el modelo declara su base de datos elegida y su SQL. Esa llamada se ejecuta incondicionalmente, para cada modelo y cada pregunta, de modo que el presupuesto de llamadas es de nueve turnos de herramientas más uno, como máximo 10 llamadas API.
El presupuesto igualitario es una corrección a un diseño anterior. Ese diseño añadía el turno de finalización para los modelos que aún no habían emitido SQL, lo que concedía una llamada extra a un hábito de salida en lugar de a la capacidad. El techo tampoco es una cuota. El panel promedia entre 3,79 y 7,64 turnos de herramientas por pregunta, porque un modelo puede dejar de sondear antes de tiempo.
Metodología del benchmark de RAG agéntico
El benchmark mide dos competencias por separado. El enrutamiento decide qué base de datos contiene la respuesta, y la generación de SQL decide si la consulta devuelve las filas correctas. El enrutamiento es la contribución principal y lleva el titular. La corrección del SQL se mide con respecto a las consultas de referencia de BIRD y se informa con su propia incertidumbre en la página del benchmark de text-to-SQL.
- Conjunto de datos: divisiones de entrenamiento y desarrollo de BIRD-SQL, 759 preguntas congeladas y fijadas por hash.
- Bases de datos: 11, seleccionadas de 80 candidatas de BIRD mediante agrupamiento aglomerativo de sus incrustaciones de descripción con un coseno de 0,65.
- Señal de dificultad: para cada pregunta, se cuentan sus 20 vecinos más cercanos según cuántos pertenecen a una base de datos diferente.
- Grupos de dificultad: fácil 222, medio 118, qq_only_hard 165, jury_only_hard 70, hard_strict 184.
- Condición principal: anonimizada. Los nombres de las bases de datos se reemplazan por db_01 a db_11 en los nombres de las herramientas y en la salida del esquema.
- Condición de evidencia: ninguna. La pista de dominio de BIRD se oculta a todos los modelos.
- Herramientas: 1 por base de datos, cada una exponiendo 3 acciones (get_schema, get_table_schema, execute_query), 11 en total, orden permutado por pregunta.
- Vocabulario: una llamada API es una solicitud al modelo. Un turno de herramienta es una llamada API que lleva la lista de herramientas y puede regresar con llamadas a herramientas. Una llamada a herramienta es una acción sobre una base de datos dentro de un turno, como máximo 11 por turno. La llamada de finalización es la última llamada API, enviada sin herramientas.
- Presupuesto de turnos: como máximo 10 llamadas API por pregunta, hasta 9 turnos de herramientas más exactamente una llamada de finalización que siempre se ejecuta.
- Turnos de herramientas utilizados: de 3,79 a 7,64 por pregunta en promedio en todo el panel, porque un modelo puede dejar de sondear antes de tiempo. El campo registrado cuenta los turnos de herramientas y excluye la llamada de finalización, por lo que su techo es 9 en lugar de 10.
- Temperatura: 0. Se solicitaron llamadas secuenciales a herramientas. Las preguntas se barajaron una vez con una semilla fija antes de cualquier segmentación.
- Métrica de enrutamiento: precisión final de enrutamiento sobre la base de datos declarada explícitamente.
- Métrica de SQL: coincidencia de ejecución con la consulta de referencia de BIRD, informada como un intervalo de tres valores.
- Panel: 36 modelos, una sola ejecución cada uno excepto dos repeticiones, $874,53 en las ejecuciones del panel más $85,37 en las repeticiones.
Qué bases de datos contienen las preguntas difíciles. Cinco de las once no aportan ninguna de las 184 preguntas más difíciles en absoluto. Son california_schools más las cuatro semánticamente aisladas (financial, synthea, superhero, toxicology), que sí suministran 27 de las 165 preguntas señaladas por vecinos entre ellas.
La taxonomía de dificultad. Dos señales independientes etiquetan cada pregunta. La primera incrusta todas las 1 922 preguntas pertenecientes a las 11 bases de datos y cuenta, entre los 20 vecinos más cercanos de cada pregunta, cuántos se encuentran en una base de datos diferente. La segunda es un jurado de tres modelos al que se le pregunta si la pregunta es confusa entre bases de datos. El grupo más difícil requiere ambas señales en lugar de combinarlas.
Ninguna de las dos señales es significativa por sí sola. La conjunción sí lo es. Medida en un modelo, la precisión de enrutamiento en las preguntas señaladas por ambas fue 0.803 veces la precisión en las preguntas fáciles de esa misma base de datos, IC del 95 % [0.685, 0.943], p = 0.007. Comparamos dentro de cada base de datos y luego agrupamos entre bases de datos con una razón de riesgo logarítmica de varianza inversa y una corrección de continuidad de 0,5. Se agrupa en 5 bases de datos en lugar de 6, porque regional_sales tiene preguntas difíciles pero no fáciles, y por lo tanto no tiene nada con qué emparejarse. Tres cosas mantienen el contraste exploratorio. Se basa en un modelo y cinco estratos, y es observacional en lugar de aleatorio.
Lo que ve el modelo. Cada modelo recibe una descripción de párrafo de las 11 bases de datos, sin nombres de tablas ni columnas, más las 11 herramientas de base de datos. La anonimización elimina el nombre, no el dominio. Las descripciones aún indican de qué trata cada base de datos, y una vez que el modelo llama a get_schema, ve los nombres reales de tablas y columnas. La condición mide la comprensión de la descripción.
Puntuación de la ruta. La base de datos declarada es la que el modelo nombra bajo una clave explícita selected_database en el turno de finalización. Un modelo que no produce una declaración explícita obtiene cero en esa pregunta. Las rutas inferidas a partir del texto en prosa quedan fuera del titular y se publican por separado. Una versión anterior de este trabajo incluía tres definiciones diferentes de la métrica, y la variante extraída de la prosa inflaba seis filas del panel entre 0,6 y 4,9 puntos.
Puntuación del SQL. La corrección se decide ejecutando ambas consultas y comparando los conjuntos de resultados. Nuestra auditoría de cinco modelos señaló que el 31,1 % de las consultas de referencia de BIRD estaban rotas, por lo que ese eje se informa como un intervalo de tres valores en lugar de una puntuación única. Las reglas de puntuación, la auditoría de referencia y el intervalo completo se encuentran en la página de text-to-SQL enlazada arriba.
Recuperación de llamadas a herramientas. Cinco familias de modelos serializan las llamadas a herramientas en formatos que el analizador estándar no acepta. Una capa de recuperación analiza esas formas en lugar de puntuarlas como silencio, y cada recuperación se registra por registro y por ejecución. Las llamadas truncadas nunca se reconstruyen. Seis de las 36 filas tienen una proporción de recuperación distinta de cero. Cinco de ellas son del tamaño de una nota al pie, del 0,4 % al 4,4 %. La sexta es mayor. llama-4-maverick se sitúa en el 97,9 %, por lo que casi todas las llamadas a herramientas de esa fila fueron recuperadas por el adaptador y esa fila mide el modelo más la capa de recuperación en lugar de solo el modelo. Un modelo, minimax-m2.7, narra sin emitir ninguna llamada a herramienta, y lo excluimos del panel en lugar de puntuarlo con cero.
Modelos evaluados
Cuatro filas tienen un denominador más pequeño de preguntas difíciles después de que dos pases de reintento dejaran errores residuales del proveedor: 182 para gemini-3.1-pro-preview, gemini-3-flash-preview y nova-lite-v1, y 181 para claude-haiku-4.5. Esas preguntas se eliminan del denominador en lugar de contarse como fallos, por lo que cada porcentaje es sobre los registros que se ejecutaron.
Precisión de enrutamiento (todas las 759): La misma medición sobre todo el conjunto congelado, incluidos los brazos de control fáciles y medios. El brazo fácil está saturado por diseño.
Los intervalos del 95 %: Cada intervalo en la tabla anterior es un intervalo de Wilson sobre las preguntas difíciles puntuadas para ese modelo, que es 184 para la mayoría de las filas y 182 o 181 para las cuatro filas que perdieron preguntas por errores residuales del proveedor. Cubre la incertidumbre del muestreo de preguntas y nada más. No cubre la agrupación de preguntas dentro de las bases de datos, ni la variación entre ejecuciones, que medimos por separado en 1,6 a 2,7 puntos y que es el término más grande para cualquier par de modelos cercanos entre sí.
Azar y líneas de base. El azar es 0.091 en 11 bases de datos. La clase mayoritaria es 0.196 sobre las 759 preguntas y 0.277 en las más difíciles. Tres recuperadores no agénticos obtienen 0.471 (TF-IDF), 0.495 (BM25) y 0.522 (base de datos más cercana por incrustación) en general, y de 0.207 a 0.230 en las más difíciles. Estos tres se midieron en el conjunto anterior de 594 preguntas y no se han vuelto a ejecutar en las 759, por lo que son puntos de referencia históricos en lugar de líneas de base para este panel. El azar y la clase mayoritaria se calculan sobre las 759 congeladas y son directamente comparables.
Limitaciones
Ambos modelos con ejecución repetida se sitúan en el nivel superior, donde las preguntas son más difíciles y las puntuaciones están más comprimidas. Ningún modelo de la tabla media se ha repetido, por lo que el término de ruido fuera del nivel superior no se ha medido.
Los controles de contaminación acotan el efecto, no lo eliminan. Reescribimos las preguntas difíciles para preservar el significado y la referencia mientras cambiábamos la redacción. En las 138 de 184 paráfrasis que pasaron las tres barreras de validez, el enrutamiento no disminuyó, y el efecto del panel resultó significativo en la dirección opuesta, de 0.543 a 0.583, McNemar p = 0.032. Cada pregunta se puntúa en ambos brazos, por lo que el emparejamiento es real: 87 pares favorecieron la paráfrasis frente a 60. Sesenta y cinco preguntas creadas desde cero y emparejadas en dificultad, estilo de redacción y mezcla de bases de datos obtuvieron +0.012 con respecto al conjunto publicado, p = 0,74. Esta última comparación es entre dos conjuntos de preguntas independientes en lugar de emparejados, por lo que es una comparación de dos proporciones y el más débil de los dos diseños. El control elaborado cubre 3 de las 11 bases de datos, el control de paráfrasis 6, y ambos se ejecutaron solo en modelos baratos. No se ha intentado un control sobre bases de datos publicadas después de los cortes de los modelos, y 560 de las 759 preguntas (73,8 %) provienen de la división de entrenamiento de BIRD, la parte con más probabilidades de haber sido memorizada.
Eliminar los registros no puntuados mueve el titular como máximo 0,90 puntos. Seis filas perdieron preguntas por errores residuales del proveedor y esas preguntas se eliminan del denominador en lugar de contarse como fallos, lo que infla una puntuación si las pérdidas recaen en preguntas difíciles. Puntuar cada pregunta perdida como incorrecta en su lugar mueve a gemini-3.1-pro-preview de 0,8242 a 0,8152 en las preguntas más difíciles (-0,90 pt) y de 0,9140 a 0,8959 sobre las 759 (-1,81 pt), gemini-3-flash-preview -0,81 pt, claude-haiku-4.5 -0,79 pt, nova-lite-v1 -0,13 pt. Siete posiciones del ranking se intercambian en las preguntas más difíciles, todas ellas adyacentes y todas dentro del ruido de 1,6 a 2,7 puntos entre ejecuciones. Por lo tanto, la convención no es determinante a la resolución de este panel.
Las preguntas más difíciles son una medición del grupo comercial. Cuatro bases de datos comerciales contienen 171 de las 184 preguntas difíciles y cinco bases de datos no contienen ninguna. El titular generaliza al enrutamiento entre bases de datos mutuamente confundibles, que es lo que el benchmark fue diseñado para medir, y no al enrutamiento entre dominios en general. Ampliarlo significa añadir preguntas difíciles de un segundo grupo semántico, algo que el corpus actual no puede proporcionar.
El panel se ejecutó en un arnés mixto. Diecinueve modelos fueron puntuados después de añadir la capa de recuperación de llamadas a herramientas, quince antes, y dos se sitúan a caballo del cambio. Un modelo del grupo anterior que emitía una llamada a herramienta no estándar era puntuado como silencio. Al barrer la capa de recuperación sobre todos los 27 306 registros almacenados, no se encontró ninguna llamada recuperable en ninguna de las filas anteriores, por lo que el coste medido de la mezcla es cero, pero una serialización que ningún analizador maneje sería igualmente invisible para ese barrido.
Las ejecuciones no son reproducibles bit a bit. OpenRouter sirvió a kimi-k2.6 desde 19 proveedores ascendentes distintos dentro de una misma ejecución y a deepseek-v4-pro desde 12, y el comportamiento de serialización difiere entre ellos. Tres de las 36 ejecuciones fijaron un proveedor.
La anonimización es solo del nombre. Las descripciones aún nombran sus dominios, y la primera llamada a herramienta devuelve nombres reales de tablas y columnas, por lo que esta condición mide la comprensión de una descripción en lugar del reconocimiento de un nombre.
La salida del esquema se trunca a 4 000 caracteres. works_cycles es la base de datos más grande con 66 tablas, y 26 de ellas sobreviven al corte. Esa base de datos contiene 149 de las 759 preguntas. Los resultados de las consultas están limitados a 50 filas.
El eje de enrutamiento se está quedando sin margen. El brazo de control fácil está agotado en 222 de 222 para los mejores modelos, y el grupo más difícil comprime seis modelos en cinco preguntas. Este benchmark ya no puede separar a los modelos de frontera entre sí en el enrutamiento.
Conclusión
El enrutamiento entre bases de datos deliberadamente confundibles abarca desde 0.115 hasta 0.848 en los 36 modelos, y la parte superior de ese rango es una meseta más que un pico. Seis modelos se sitúan a menos de 0,03 del 0.848 de claude-opus-5, y al volver a ejecutar claude-opus-5 se obtuvo 0,8207, que es la puntuación publicada del modelo en sexto lugar.
Para una carga de trabajo de enrutamiento en la parte superior del rango, qwen3.8-max enrutó correctamente el 0.832 de las preguntas más difíciles a un coste de $25,14 por ejecución de 759 preguntas, frente al 0.821 de claude-fable-5 a $121,55. Para una carga de trabajo en la que las bases de datos candidatas están semánticamente muy separadas, la ablación sitúa a ambos modelos probados por encima de 0,92 en un panel extraído al azar, por lo que merece la pena medir la confusibilidad del propio panel antes de elegir un modelo. Para cualquier comparación dentro del nivel superior, el término de 1,6 a 2,7 puntos entre ejecuciones es mayor que las diferencias que se comparan.
El techo es ahora la restricción vinculante de este diseño. El brazo de control fácil está agotado, el grupo más difícil separa seis modelos por cinco preguntas, y el 93 % de esas preguntas difíciles provienen de un único grupo comercial. Separar a la próxima generación de modelos en el enrutamiento requiere preguntas difíciles de un segundo grupo semántico, que este corpus no puede proporcionar, y un presupuesto de repeticiones lo suficientemente grande como para poner barras de error en los límites de los niveles en lugar de solo en el muestreo.
Lecturas adicionales
- RAG Frameworks: LangChain vs LangGraph vs LlamaIndex
- Mejores herramientas, frameworks y bibliotecas de RAG
- Búsqueda agéntica en 2026: Benchmark de 8 API de búsqueda para agentes
- Top 5 de frameworks agénticos de IA de código abierto en 2026
- Text-to-SQL: Comparación de la precisión de LLM
Preguntas frecuentes
Los nombres reales son un canal de enrutamiento medible. Mostrando los 11 nombres y sin descripciones, claude-opus-4.8 enruta a 0.688 y gemini-3.5-flash a 0.711, igual o por encima de lo que los mismos modelos puntúan con el catálogo completo. Publicar con nombres reales informaría del reconocimiento de nombres junto con la comprensión, por lo que la condición principal reemplaza cada nombre por db_01 a db_11.
Los nombres reales son un canal de enrutamiento medible. Mostrando los 11 nombres y sin descripciones, claude-opus-4.8 enruta a 0.688 y gemini-3.5-flash a 0.711, igual o por encima de lo que los mismos modelos puntúan con el catálogo completo. Publicar con nombres reales informaría del reconocimiento de nombres junto con la comprensión, por lo que la condición principal reemplaza cada nombre por db_01 a db_11.
No. BIRD incluye una pista de dominio con cada pregunta y este benchmark la oculta, lo que supone de 6 a 9 puntos de coincidencia de ejecución y mueve la precisión de enrutamiento en 5,7 puntos. La tarea de enrutamiento en sí tampoco tiene equivalente en BIRD, porque BIRD le dice al modelo qué base de datos usar.
Entre 1,6 y 2,7 puntos, medido ejecutando dos modelos una segunda vez en condiciones idénticas. Repetir la ejecución del líder del panel lo movió de 0.848 a 0,8207, que es la puntuación publicada del modelo clasificado en sexto lugar. Dos modelos no son el panel, y una sola repetición da una diferencia absoluta en lugar de una desviación estándar, así que considere ese rango como un suelo.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Benchmark de RAG Agéntico: Enrutamiento Multibase de Datos a través de 36 LLMs}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-rag}},
note = {AIMultiple. Recuperado el 11 de Agosto de 2026}
}


Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.