Servicios
Contáctanos

Text-to-SQL: Comparación de la precisión de los LLM

Ekrem Sarı
Ekrem Sarı
actualizado el 7 de ago. de 2026

Ejecutamos 36 grandes modelos de lenguaje sobre 759 preguntas de BIRD-SQL; cada modelo escribió SQL contra una base de datos que tuvo que identificar por sí mismo entre 11 candidatas. Todas las consultas analizables se ejecutaron contra la base de datos real y su conjunto de resultados se comparó con el conjunto de resultados de la consulta gold de BIRD. Las consultas ausentes, mal formadas o con errores de ejecución se puntuaron como fallos.

Loading Chart

Todas las ejecuciones se realizaron a temperatura 0, en modo zero-shot, sin la pista de dominio de BIRD. Diecinueve de las 36 ejecuciones usaron la capa de recuperación de llamadas a herramientas descrita en la página de enrutamiento, que analiza las llamadas a herramientas que el parser estándar rechaza. Quince ejecuciones son anteriores a esa capa y dos se extienden a ambos lados del cambio.

Métricas explicadas:

Coincidencia de ejecución estricta: coincidencia de ejecución sobre las preguntas que el modelo enrutó correctamente. Condicionar a la ruta correcta elimina los fallos directos por base de datos equivocada, pero no aísla por completo la capacidad de SQL, porque cada modelo alcanza un subconjunto distinto de preguntas.

Gold-clean: la misma medición quitando del denominador las preguntas cuya SQL gold consideramos defectuosa. Esas preguntas no se puntúan como aciertos; se eliminan.

Adjudicado: el extremo superior. Un jurado ciego de tres modelos, extraído de familias distintas a la del modelo evaluado, revisa cada respuesta que la comparación estricta rechazó, cuando el modelo enrutó correctamente, la SQL se ejecuta y sus filas se solapan con las del gold en menos de la mitad. Decide si la consulta es una formulación distinta pero equivalente, si el gold está mal o si el modelo está mal. Las respuestas equivalentes y los gold defectuosos se acreditan.

Las tres parten del conjunto completo de 759 preguntas, no del subconjunto difícil, y ninguna usa 759 como denominador. Cada una se mide sobre las preguntas que el modelo enrutó correctamente, y la columna gold-clean elimina luego los gold marcados. El azar no se aplica a este eje, porque una consulta devuelve el conjunto de resultados gold o no lo hace.

Hallazgos del benchmark de Text-to-SQL

Respuestas correctas con la forma equivocada le cuestan 22.7 puntos a un modelo

claude-sonnet-5 registra 0.311 en coincidencia de ejecución estricta, 33rd de los 36 modelos y el más bajo de cualquier fila de Anthropic. Bajo adjudicación ciega, la misma ejecución obtiene 0.710, 0.007 por debajo del 0.717 de qwen3.6-27b.

La ganancia de 39.9 puntos se divide en dos. 154 de sus 679 preguntas puntuadas, 22.7 puntos, son respuestas que el jurado consideró equivalentes al gold con una forma distinta. Otras 117, 17.2 puntos, son preguntas en las que el jurado consideró que el propio gold estaba defectuoso. El estilo de respuesta explica lo primero, no la suma. El fallo del arnés no explica nada, porque la ejecución no registró consultas ausentes, registró un cuelgue y ninguna respuesta sin recuperar.

Figura 1: Una ejecución de claude-sonnet-5 puntuada de dos maneras, y por qué la tercera medición usa un denominador distinto

Esas mismas 154 respuestas son el 34 % de los 453 fallos de sonnet-5 que llegaron a adjudicación. Equivalente en formato significa que la consulta devuelve la información correcta en una proyección distinta, una columna adicional, un orden de columnas diferente, o un recuento donde el gold devolvía las filas. La coincidencia de ejecución estricta lo puntúa como un fallo.

La tendencia se da por familia de modelos y no por nivel de capacidad. Las familias de proyección rica pierden de un cuarto a un tercio de sus fallos adjudicados por este motivo: en Claude del 25 al 34 %, en Kimi del 24 al 34 %, en la línea de razonamiento 5.x de OpenAI del 26 al 32 %, en DeepSeek 31 %, en MiniMax del 26 al 30 % y en GLM-5.x 28 %. Los modelos que escriben con la forma del gold pierden mucho menos: en Google del 9 al 17 %, en Llama 9 %, en Mistral 18 %, en Grok 19 % y en los modelos pequeños de OpenAI del 19 al 20 %. Grok rompió nuestra primera explicación de este patrón. Se sitúa en el nivel de razonamiento y pierde 19 %.

La medición adjudicada sitúa a sonnet-5 en el 17 puesto, una brecha de 16 puestos.

El jurado considera que el 46 % de las respuestas rechazadas de un modelo no son errores del modelo

Tomamos 314 de las 346 respuestas que la comparación estricta rechazó para gemini-3.5-flash-lite en preguntas que enrutó correctamente, aquellas cuya SQL se ejecutó y cuyas filas se solapaban con las del gold en menos de la mitad, y las enviamos al jurado ciego de tres modelos con posiciones barajadas. Esas 346 cubren todos los niveles de dificultad, no solo los difíciles, por lo que coinciden con la población que cubren las columnas de SQL.

El jurado las dividió en cuatro categorías. Gold defectuoso, donde el modelo tiene razón y la consulta gold de BIRD está mal, se llevó el 29.3 %. Equivalente en formato se llevó el 16.6 %, error genuino del modelo el 33.4 % y ambiguo el 20.7 %. Sumando las dos primeras, 144 de los 314 fallos adjudicados (46 %) no son errores del modelo. Ese porcentaje se calcula sobre los 314 que llegaron al jurado, no sobre las 346 respuestas rechazadas. Las 32 retenidas no se ejecutaron o se solapaban demasiado con el gold para ser un desacuerdo limpio.

La rigidez del comparador no explica la diferencia. Relajar la coincidencia del orden de columnas gana 0.5 puntos, y el 92 % de los fallos se solapan con el resultado gold en menos de 0.5. La adjudicación, en lugar de un comparador más laxo, sitúa a ese modelo en un rango de 0.606 a 0.687, frente a un estricto de 0.464.

Los fallos que el jurado calificó como defectos de gold se concentran donde no llega ninguna corrección publicada: en el 33 % de los fallos de la partición de entrenamiento de este modelo frente al 20 % de sus fallos de la partición de desarrollo. Todas las correcciones deterministas disponibles ya se habían aplicado. La repuntuación contra la versión corregida de desarrollo publicada por BIRD dio la vuelta a 0 de 92 fallos de desarrollo; un conjunto de correcciones externo cubrió 39 de ellos y dio la vuelta a 1, y una auditoría del motor de MySQL frente a SQLite encontró 4 gold divergentes en todo el conjunto, en total alrededor del 1 % de los 314.

Nuestra auditoría con cinco modelos marca el 31.1 % de las consultas gold de BIRD como defectuosas

Auditamos el propio gold. Cinco modelos de frontera, uno por familia, evaluaron las 759 consultas gold comparándolas con sus preguntas y esquemas. A ningún jurado se le mostró la salida de ningún modelo. El panel marcó 236 de 759 gold como defectuosos, 31.1 %, con un coste de $20,55 y sin llamadas fallidas del jurado.

La tasa se divide por partición de BIRD: 204 de 560 gold de entrenamiento (36 %) frente a 32 de 199 gold de desarrollo (16 %). Un panel independiente de tres modelos ejecutado antes alcanzó el 29.1 %, y 207 de sus 221 marcas de defectuosos, 94 %, están rotos en este. En las 759 preguntas, los dos paneles coinciden en el 92.9 %.

Una estimación publicada cubre la partición de entrenamiento de BIRD, la auditoría de MotherDuck de 151 ejemplos, y sitúa la tasa en el 32.5 %. Las auditorías revisadas por pares de BIRD cubren la partición de desarrollo por diseño explícito, por lo que los 151 ejemplos de MotherDuck quedan como la única comprobación externa de las 560 preguntas de entrenamiento de nuestro conjunto congelado, el 73.8 % del mismo.1

Eliminar los gold defectuosos del denominador mueve al mejor escritor estricto de 0.551 a 0.677, y las ganancias por modelo van de +4.5 a +13.3 puntos. El primer nivel mantiene su orden y los vecinos de la zona media se mueven hasta tres puestos.

Un modelo de 27B ocupa el quinto lugar en precisión estricta de SQL

qwen3.6-27b registra 0.471 estricto y 0.590 gold-clean, quinto en el panel por detrás de gemini-3-flash-preview (0.551 / 0.677), gemini-3.1-pro-preview (0.536 / 0.669), claude-fable-5 (0.531 / 0.655) y claude-opus-5 (0.523 / 0.643). Todas las filas de OpenAI, Kimi y DeepSeek registran una puntuación estricta más baja, y la ejecución costó $15.28.

La columna se mide sobre las rutas correctas de cada modelo, por lo que un enrutador más débil se evalúa sobre una selección más fácil. qwen3.6-27b enruta 0.679, y la sección de limitaciones mide ese efecto con una correlación de 0.96 entre la precisión de enrutamiento y la dificultad del denominador.

El orden cambia cuando se usa el extremo superior del rango. En las puntuaciones adjudicadas, qwen3.6-27b es decimocuarto con 0.717, mientras que claude-opus-5 lidera con 0.824.

La habilidad de enrutamiento y la habilidad de escritura de SQL son ejes separados

kimi-k3 enruta 0.832, por detrás de claude-opus-5 con 0.848 y al nivel de qwen3.8-max, y escribe 0.482 gold-clean en SQL frente a un mejor panel de 0.677. gemini-3-flash-preview lo invierte: enruta 0.753 con esa mejor SQL gold-clean del panel. gpt-5.6-terra enruta con 0.772 y escribe 0.447.

Los dos ejes no se miden con un único denominador. Cada modelo escribe SQL para las preguntas que enrutó correctamente y ninguna otra, y los mejores enrutadores obtienen un conjunto más difícil, lo que reduce cualquier asociación medida entre los ejes.

La auditoría del gold y el jurado de adjudicación

Dos jurados hicieron dos trabajos distintos.

Figura 2: El jurado de validez del gold y el jurado de adjudicación, qué ve cada uno y a qué métrica alimenta

El jurado de validez del gold evalúa las consultas gold. Sus cinco jurados (claude-opus-4.8, gpt-5.6-sol, gemini-3.1-pro-preview, grok-4.5, deepseek-v4-pro) ven cada uno una pregunta, la SQL gold y las listas de columnas de las tablas que toca esa consulta, y responden si el gold responde a la pregunta. Nunca se muestra la salida de ningún modelo. Sus veredictos se congelan en un archivo fijado por hash y alimentan la columna gold-clean.

El jurado de adjudicación evalúa el fallo de un modelo concreto. Tres modelos extraídos de familias distintas a la del modelo evaluado ven la pregunta, la consulta y el resultado gold, y la consulta y el resultado candidatos, con las posiciones barajadas, y votan a cuál de cuatro categorías pertenece el fallo. Se ejecuta por modelo a unos $6, y sus veredictos alimentan la columna adjudicada. La adjudicación de todo el panel de 36 modelos costó $208.81.

La columna adjudicada es un extremo optimista ajustado por adjudicación, no una verdad de referencia independiente. Puede errar en ambos sentidos. Una respuesta ambigua que de hecho era correcta no recibe crédito, y un falso positivo del jurado acredita una que no lo era. Tres propiedades medidas limitan hasta dónde se puede forzar.

La revisión es asimétrica. Los fallos reciben una segunda mirada y los aciertos nunca, por lo que un error en la dirección de aprobación no puede detectarse. Los veredictos ambiguos, del 15 al 23 % según el modelo, nunca se acreditan, y los casi aciertos y las consultas que no se ejecutan siguen siendo fallos.

No elimina el suelo de los modelos débiles. Como control negativo adjudicamos nova-lite-v1, la fila más débil del panel. Su puntuación sube de 0.190 a 0.316 y se queda 0.150 por debajo de la siguiente fila. El suelo se mantiene en llama 0.466, mistral 0.509 y gpt-5.4-nano 0.512.

La proporción de defectos de gold sigue la fortaleza del modelo con una correlación de rangos de 0.906, medida en 33 modelos. Los fallos de gpt-5.6-sol son 40 % defectos de gold y 19 % errores genuinos, mientras que los de llama-4-maverick son 13 % y 50 %.

Veinticuatro de los 36 modelos se sitúan en 0.68 o más en la columna adjudicada.

Cómo funciona la generación de SQL en este benchmark

El modelo nunca recibe un esquema por adelantado. Elige una de 11 herramientas de base de datos, lee la lista de tablas que devuelve, pide las columnas de una tabla cuando las necesita y puede ejecutar consultas exploratorias contra la base de datos por la que se ha decidido antes de comprometerse. La salida del esquema está limitada a 4.000 caracteres y los resultados de las consultas a 50 filas.

La consulta final llega en una llamada obligatoria de finalización enviada sin herramientas adjuntas, junto con la base de datos que el modelo declara. La puntuación ejecuta esa consulta y la consulta gold de BIRD contra el mismo archivo de base de datos y compara los dos conjuntos de resultados, con un centinela NULL y un modo sensible al orden para las preguntas que especifican un orden.

La comparación es el paso estricto, y es donde una respuesta correcta puede puntuar como fallo. Una consulta que devuelve las mismas filas con una columna adicional, en un orden de columnas distinto, o como recuento donde el gold devolvía las filas, falla la comparación. Esa es la brecha que mide el jurado de adjudicación, no la que cerraría un comparador más laxo, que gana 0.5 puntos.

Metodología del benchmark para Text-to-SQL

Este benchmark comparte su arnés con el benchmark de RAG agéntico, que describe en detalle la selección de bases de datos, la taxonomía de dificultad, la anonimización, el bucle agéntico y el presupuesto de turnos. Ambas páginas informan del mismo subconjunto congelado de 759 preguntas de BIRD-SQL, ejecutado sobre 11 bases de datos entre las que el modelo debe elegir, a temperatura 0 y sin la pista de dominio. La página de enrutamiento contiene el eje de enrutamiento, y esta página contiene el eje de SQL.

Puntuación: coincidencia de ejecución. La consulta final del modelo y la consulta gold de BIRD se ejecutan ambas contra la base de datos real y se comparan sus conjuntos de resultados, con un centinela NULL y un modo sensible al orden para las consultas cuya pregunta especifica un orden. Denominador: preguntas que el modelo enrutó correctamente. Forma reportada: un rango de tres valores, coincidencia de ejecución estricta, luego gold-clean, luego adjudicado. Auditoría del gold: 5 familias de frontera, un modelo cada una, 759 gold evaluados, 236 marcados como defectuosos, fijados por hash. Adjudicación: 3 modelos por candidato, de familias disjuntas a la del modelo evaluado, ciegos y con posiciones barajadas. Panel: 36 modelos, una sola ejecución cada uno, $874,53 por las ejecuciones y $208,81 por la adjudicación.

Por qué ningún LLM juzga la corrección en el suelo. Medimos la alternativa antes de elegir. En 2.203 registros del benchmark anterior, un juez LLM nunca suspendió una consulta que la ejecución aprobó, en ningún umbral. A ese juez se le mostraron ambos conjuntos de resultados, por lo que su veredicto no es independiente del resultado de la ejecución y el cero no establece que un juez no pueda ser más estricto. La ejecución se mantiene como suelo y el jurado aparece más arriba en el rango, donde su indulgencia es el punto.

Por qué se oculta la pista. BIRD incluye una pista de dominio con cada pregunta. Proporcionarla vale de 6 a 9 puntos de coincidencia de ejecución, y también mueve la precisión de enrutamiento en 5.7 puntos, lo que la convierte en una fuga en el eje de enrutamiento. Por lo tanto, ambas páginas informan de la condición sin pista-free, y las cifras de SQL de aquí quedan por debajo de lo que los mismos modelos puntuarían en condiciones estándar de BIRD.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Precisión de SQL en todo el panel, de tres maneras

Ordenado por la columna adjudicada. Seis filas se quedaron cortas de 759 registros después de dos pasadas de reintento, y las preguntas ausentes están ausentes de todos los denominadores en lugar de contarse como fallos.

Limitaciones del eje de SQL

El gold es prestado y discutido. Nuestra cifra de 31.1 % de gold defectuoso es nuestro propio subconjunto auditado, no una verdad de referencia multi-anotador. No hay una pasada duplicada ciega, ni una cifra de acuerdo entre anotadores, y la verificación humana la hizo el propietario del benchmark y no un anotador independiente. Los jurados vieron las listas de columnas de las tablas que toca la consulta gold, por lo que un gold que consulta la tabla equivocada es indetectable desde esa vista y esos defectos se pasan por alto. El panel también puede marcar un gold que funciona, un error en la otra dirección. Ningún anotador independiente ha repetido la pasada, de modo que el error residual no se mide en ningún sentido y la cifra no es un suelo.

La columna adjudicada es un instrumento de LLM, no una segunda verdad de referencia, y no una cota superior estricta. Sus tres jurados son modelos, por lo que la columna hereda lo que un panel de modelos se equivoque sobre la equivalencia de SQL, y ningún humano releyó los veredictos.

El comparador se equivoca en ambos sentidos. El orden y el número de columnas causan falsos negativos, mientras que el plegado de mayúsculas y el redondeo de flotantes a seis cifras significativas causan falsos positivos. El error del comparador y el error de la consulta gold son fuentes de incertidumbre separadas y pueden mover una puntuación en direcciones distintas.

La coincidencia de ejecución estricta se mide sobre las preguntas correctamente enrutadas de cada modelo, y los mejores enrutadores obtienen un conjunto más difícil. La precisión de enrutamiento sigue la dificultad de las preguntas que llegan al denominador de SQL de un modelo. En los 36 modelos, esa correlación es de 0.96 (Pearson, sobre el recuento medio de vecinos entre bases de datos), y de 0.97 frente a la proporción de preguntas más difíciles en ese denominador. En términos concretos, claude-opus-5 escribe SQL para 717 preguntas, de las cuales 21.8 % están entre las 184 más difíciles, mientras que nova-lite-v1 escribe SQL para 285 preguntas, de las cuales 7.7 % lo están. Un enrutador débil se evalúa sobre una selección más fácil. Trate esta columna como un diagnóstico por modelo y no como una clasificación entre modelos, y lea las tres columnas como niveles. Para cerrar la brecha se necesita una ejecución con ruta oráculo, en la que cada modelo escriba SQL para las mismas preguntas. Esa ejecución no se ha hecho.

Los intervalos de confianza cubren solo el ruido de muestreo. La tabla anterior muestra estimaciones puntuales, y los intervalos de Wilson para las columnas estricta y gold-clean aparecen en el CSV publicado junto a cada fila. Los intervalos llevan el ruido de muestreo de preguntas y ni la incertidumbre de los jurados ni la de los marcados de gold. Dos ejecuciones del panel repetidas en condiciones idénticas movieron la precisión de enrutamiento entre 1.6 y 2.7 puntos, y esta página no informa de ninguna medición repetida para las columnas de SQL.

Estas cifras son sin pista-free por construcción, por lo que no son comparables con las puntuaciones del leaderboard de BIRD para los mismos modelos.

Conclusión

La coincidencia de ejecución estricta contra las consultas gold de BIRD abarca de 0.190 a 0.551 en los 36 modelos, y ese mismo panel abarca de 0.316 a 0.824 una vez que un jurado ciego ha releído todos los fallos. La distancia entre esas dos lecturas es el hallazgo. Para claude-sonnet-5 es de 39.9 puntos, de los cuales 22.7 provienen de respuestas que devuelven la información correcta con una forma que el comparador rechaza.

Para una carga de trabajo puntuada por coincidencia de ejecución estricta, gemini-3-flash-preview registró 0.551 bruto y 0.677 gold-clean a $7,67 por ejecución. Para una carga de trabajo en la que una respuesta equivalente en una proyección distinta es aceptable, claude-opus-5 registró 0.824 adjudicado frente al 0.785 de gpt-5.6-sol, dentro de un intervalo de confianza. Para cualquier comparación por modelo, el denominador difiere según el modelo, por lo que las tres columnas son diagnósticos y no un leaderboard controlado.

El techo de este eje es el gold, no los modelos. Un tercio de las consultas gold de BIRD fallan en nuestra auditoría, los defectos se concentran en la partición de entrenamiento, donde no llega ninguna corrección publicada, y los dos instrumentos que ven más allá de ellos son jurados de LLM y no anotadores humanos. Para avanzar en el eje se necesita una ejecución con ruta oráculo para que cada modelo escriba SQL con las mismas preguntas, y una anotación doble humana independiente de una muestra estratificada del gold. Ninguna de las dos se ha hecho.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Lecturas adicionales

Preguntas frecuentes

Porque las consultas gold son de BIRD y un tercio de ellas fallan en nuestra auditoría. La coincidencia de ejecución estricta es el suelo, la columna gold-clean elimina las preguntas cuyo gold consideramos defectuoso y la columna adjudicada acredita respuestas que un jurado ciego leyó como equivalentes. claude-sonnet-5 pasa de 0.311 a 0.710 a lo largo de ese rango, por lo que un único número falsearía el panel hasta en 39.9 puntos.

No. BIRD incluye una pista de dominio con cada pregunta y proporciona la base de datos. Este benchmark oculta la pista y hace que el modelo elija la base de datos entre 11. Solo la pista vale de 6 a 9 puntos de coincidencia de ejecución.

No en este panel. Cada modelo escribe SQL para las preguntas que enrutó correctamente, por lo que un mejor enrutador obtiene un denominador más difícil, con una correlación de 0.96 entre la precisión de enrutamiento y la dificultad del denominador. kimi-k3 enruta 0.832 y escribe 0.482 gold-clean, mientras que gemini-3-flash-preview enruta 0.753 y escribe el mejor 0.677 del panel.

Una consulta gold que no responde a su propia pregunta, según la evaluación de cinco modelos de frontera de cinco familias distintas, a ninguno de los cuales se le mostró ninguna respuesta candidata. El panel marcó 236 de 759, y un panel anterior de tres modelos marcó de forma independiente 221, de los cuales 207 se solapan.

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Ekrem Sarı (2026) - "Text-to-SQL: Comparación de la precisión de los LLM". Publicado en línea en AIMultiple.com. Recuperado el 7 de Agosto de 2026, de: https://aimultiple.com/text-to-sql [Recurso en línea]

Sarı, E. (2026, 7 de Agosto). Text-to-SQL: Comparación de la precisión de los LLM. AIMultiple. https://aimultiple.com/text-to-sql

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Text-to-SQL: Comparación de la precisión de los LLM}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/text-to-sql}},
  note   = {AIMultiple. Recuperado el 7 de Agosto de 2026}
}

Registro de cambios

8 actualizaciones
  1. 2026

    Se añadió un registro de cambios a la sección de benchmark de RAG agéntico: enrutamiento multidatabase y generación de consultas.

  2. Se reemplazó la sección de metodología con un resumen y una referencia a otro artículo.

  3. 2025

    Actualizado el número de modelos de lenguaje grandes en la introducción.

  4. Actualizada la sección de Conjunto de datos y verdad fundamental con el nivel de dificultad del conjunto de datos BIRD-SQL.

  5. Se reemplazó el ejemplo de un filtro faltante en la sección 'Filtros faltantes o incorrectos'.

  6. Se añadió una sección, "Cómo los LLM generan SQL: una mirada paso a paso", al artículo.

  7. Se reemplazó la sección de metodología con un marco de generación aumentada por recuperación (RAG) agéntico.

  8. Se movió la sección "Metodología de evaluación comparativa para texto a SQL".

Enlaces de referencia

1.
BIRD-bench
Ekrem Sarı
Ekrem Sarı
Investigador de IA
Ekrem es investigador de IA y científico de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.
Ver perfil completo

Comentarios 1

Comparte tus ideas

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450
PFJ Rofgowski
PFJ Rofgowski
Dec 10, 2025 at 20:04

Curious, how much of the context engineering and specific prompting did you apply in your benchmarks. Or, was it to review the models only? I have found much higher return of correct and consistent responses. A higher fidelity. To do that, I needed to provide a most sophisticated prompt that fed the context window as the question was being asked. Not perfect, but better than those scores represented in this article when using the Grok 4.x .

Ekrem Sarı
Ekrem Sarı
Feb 10, 2026 at 08:46

Great point. This benchmark intentionally uses zero-shot, minimal prompting with temperature=0. No few-shot examples, no domain-specific instructions, no iterative refinement. The goal was to measure each model's baseline text-to-SQL capability. So your experience with Grok 4 getting higher fidelity through sophisticated context engineering is completely expected. A well-crafted prompt with detailed schema descriptions, few-shot examples, and domain-specific rules will improve any model's performance significantly. What this benchmark isolates is how well the model performs out-of-the-box when given only the raw question and retrieved schema, which helps compare the models' inherent SQL reasoning abilities on a level playing field.           We'll make this clearer in the methodology section. Thanks for raising it.