Wir haben 36 große Sprachmodelle über 759 Fragen aus BIRD-SQL ausgeführt, wobei jedes Modell SQL gegen eine Datenbank schrieb, die es selbst aus 11 Kandidaten identifizieren musste. Jede parsebare Abfrage wurde gegen die echte Datenbank ausgeführt und ihre Ergebnismenge mit der Ergebnismenge der Gold-Abfrage von BIRD verglichen. Fehlende, fehlerhafte und bei der Ausführung fehlgeschlagene Abfragen wurden als Fehlversuche gewertet.
Jeder Lauf erfolgte bei Temperatur 0, Zero-Shot, wobei der Domänenhinweis von BIRD vorenthalten wurde. Neunzehn der 36 Läufe verwendeten die auf der Routing-Seite beschriebene Tool-Call-Wiederherstellungsebene, die Tool-Aufrufe analysiert, die der Standard-Parser ablehnt. Fünfzehn Läufe datieren vor dieser Ebene und zwei überspannen die Änderung.
Metriken erklärt:
Strikte Ausführungsübereinstimmung: Ausführungsabgleich über die Fragen, die das Modell korrekt geroutet hat. Die Beschränkung auf die korrekte Route beseitigt direkte Fehler durch falsche Datenbanken, isoliert die SQL-Fähigkeit aber nicht vollständig, da jedes Modell eine andere Teilmenge von Fragen erreicht.
Gold-bereinigt: Dieselbe Messung, wobei die Fragen, deren Gold-SQL wir als fehlerhaft beurteilt haben, aus dem Nenner entfernt wurden. Diese Fragen werden nicht als bestanden gewertet, sondern entfernt.
Adjudiziert: Das obere Ende. Eine blinde Jury aus drei Modellen, die aus anderen Familien stammen als das getestete Modell, überprüft jede Antwort, die der strikte Vergleich abgelehnt hat, sofern das Modell korrekt geroutet hat, die SQL-Abfrage ausgeführt wird und ihre Zeilen die Gold-Ergebnisse um weniger als die Hälfte überlappen. Sie entscheidet, ob die Abfrage eine andere, aber äquivalente Formulierung ist, ob die Gold-Abfrage falsch ist oder ob das Modell falsch liegt. Äquivalente Antworten und fehlerhafte Gold-Abfragen werden angerechnet.
Alle drei beginnen mit dem vollständigen Satz von 759 Fragen und nicht mit der harten Teilmenge, und keine von ihnen verwendet 759 als Nenner. Jede wird über die Fragen gemessen, die das Modell korrekt geroutet hat, und die Gold-bereinigte Spalte entfernt dann die markierten Gold-Abfragen. Der Zufall spielt auf dieser Achse keine Rolle, denn eine Abfrage gibt entweder die Gold-Ergebnismenge zurück oder nicht.
Text-zu-SQL-Benchmark-Ergebnisse
Richtige Antworten in falscher Form kosten ein Modell 22.7 Punkte
claude-sonnet-5 verzeichnet 0.311 bei strikter Ausführungsübereinstimmung, 33. von 36 Modellen und der niedrigste Wert aller Anthropic-Zeilen. Unter blinder Adjudikation erreicht derselbe Lauf 0.710, 0.007 unter qwen3.6-27b’s 0.717.
Der Zuwachs von 39.9 Punkten teilt sich in zwei Teile. 154 seiner 679 bewerteten Fragen (22.7 Punkte) sind Antworten, die Jury als äquivalent zur Gold-Abfrage in anderer Form gelesen hat. Weitere 117 (17.2 Punkte) sind Fragen, bei denen die Jury die Gold-Abfrage selbst als fehlerhaft beurteilte. Der Antwortstil erklärt den ersten dieser beiden Teile, nicht die Summe. Ein Harness-Fehler erklärt keinen davon, denn der Lauf verzeichnete keine fehlenden Abfragen, einen Absturz und keine nicht wiederhergestellten Antworten.
Dieselben 154 Antworten sind 34 % der 453 sonnet-5-Fehlversuche, die zur Adjudikation gelangten. Formatäquivalent bedeutet, dass die Abfrage die richtigen Informationen in einer anderen Projektion, mit einer zusätzlichen Spalte, in anderer Spaltenreihenfolge oder als Zählung zurückgibt, wo die Gold-Abfrage die Zeilen zurückgab. Die strikte Ausführungsübereinstimmung wertet dies als Fehlschlag.
Die Tendenz verläuft nach Modellfamilie und nicht nach Fähigkeitsstufe. Familien mit reicher Projektion verlieren auf diese Weise ein Viertel bis ein Drittel ihrer adjudizierten Fehlversuche, bei Claude 25 bis 34 %, bei Kimi 24 bis 34 %, bei der 5.x-Reasoning-Linie von OpenAI 26 bis 32 %, bei DeepSeek 31 %, bei MiniMax 26 bis 30 % und bei GLM-5.x 28 %. An der Gold-Form orientierte Schreiber verlieren weit weniger, bei Google 9 bis 17 %, Llama 9 %, Mistral 18 %, Grok 19 % und bei den eigenen kleinen Modellen von OpenAI 19 bis 20 %. Grok widerlegte unsere erste Erklärung dieses Musters. Das Modell liegt in der Reasoning-Stufe und verliert 19 %.
Die adjudizierte Messung setzt sonnet-5 auf Platz 17, ein Abstand von 16 Positionen.
Die Jury stellt fest, dass 46 % der abgelehnten Antworten eines Modells keine Modellfehler sind
Wir nahmen 314 der 346 Antworten, die der strikte Vergleich für gemini-3.5-flash-lite bei korrekt gerouteten Fragen abgelehnt hatte — diejenigen, deren SQL ausgeführt wurde und deren Zeilen die Gold-Ergebnisse um weniger als die Hälfte überlappten — und schickten sie an die blinde, positionsgemischte Drei-Modell-Jury. Diese 346 umfassen jede Schwierigkeitsklasse und nicht nur die harten, sodass sie der Population entsprechen, die SQL-Spalten abdecken.
Die Jury teilte sie in vier Kategorien ein. Gold-Defekt, bei dem das Modell richtig und die Gold-Abfrage von BIRD falsch ist, machte 29,3 % aus. Formatäquivalent machte 16,6 % aus, echter Modellfehler 33,4 % und uneindeutig 20,7 %. Addiert man die ersten beiden, sind 144 der 314 adjudizierten Fehlversuche (46 %) keine Modellfehler. Dieser Anteil bezieht sich auf die 314, die Jury erreichten, und nicht auf alle 346 abgelehnten Antworten. Die 32 zurückgehaltenen konnten entweder nicht ausgeführt werden oder überlappten die Gold-Abfrage zu stark, um eine saubere Abweichung zu sein.
Die Strenge des Vergleichs erklärt die Lücke nicht. Eine Lockerung des Abgleichs der Spaltenreihenfolge bringt 0.5 Punkte, und 92 % der Fehlversuche überlappen die Gold-Ergebnisse um weniger als 0.5. Die Adjudikation, nicht ein lockerer Vergleich, bringt dieses Modell in einen Bereich von 0.606 bis 0.687, gegenüber strikten 0.464.
Die Fehlversuche, die Jury als Gold-Defekt bezeichnete, konzentrieren sich dort, wo keine veröffentlichte Korrektur hinkommt: 33 % der Train-Split-Fehlversuche dieses Modells gegenüber 20 % seiner Dev-Split-Fehlversuche. Jede uns verfügbare deterministische Korrektur war bereits ausgeschöpft. Eine Neubewertung gegen die korrigierte Dev-Version von BIRD drehte 0 von 92 Dev-Fehlversuchen, ein externer Korrektursatz erfasste 39 davon und drehte 1, und ein Audit der MySQL-gegen-SQLite-Engine fand 4 abweichende Gold-Abfragen im gesamten Satz, zusammen etwa 1 % der 314.
Unser Fünf-Modell-Audit markiert 31,1 % der Gold-Abfragen von BIRD als fehlerhaft
Wir auditierten die Gold-Abfragen selbst. Fünf Frontier-Modelle, eines pro Familie, bewerteten alle 759 Gold-Abfragen anhand ihrer Fragen und Schemas. Keinem Juror wurde jemals eine Modellausgabe gezeigt. Das Gremium markierte 236 von 759 Gold-Abfragen als fehlerhaft, 31,1 %, zu Kosten von $20,55 und ohne fehlgeschlagene Jury-Aufrufe.
Die Rate teilt sich nach BIRD-Partition auf: 204 von 560 Train-Gold-Abfragen (36 %) gegenüber 32 von 199 Dev-Gold-Abfragen (16 %). Ein früherer unabhängiger Drei-Modell-Lauf erreichte 29,1 %, und 207 seiner 227 Fehler-Markierungen (94 %) sind auch in diesem Audit fehlerhaft. Über alle 759 Fragen stimmen die beiden Gremien in 92,9 % überein.
Eine veröffentlichte Schätzung deckt den Train-Split von BIRD ab, das Audit von MotherDuck über 151 Beispiele, und beziffert die Rate auf 32,5 %. Die Peer-Review-Audits von BIRD decken den Dev-Split ausdrücklich ab, daher stehen die 151 Beispiele von MotherDuck als einzige externe Prüfung der 560 Train-Fragen in unserem eingefrorenen Satz, 73,8 % davon.1
Das Entfernen der fehlerhaften Gold-Abfragen aus dem Nenner hebt den besten strikten Schreiber von 0.551 auf 0.677, und die Zuwächse pro Modell reichen von +4.5 bis +13.3 Punkten. Die Spitzengruppe behält ihre Reihenfolge, und benachbarte Mittelfeldplätze verschieben sich um bis zu drei Positionen.
Ein 27B-Modell liegt bei strikter SQL-Genauigkeit auf Platz fünf
qwen3.6-27b verzeichnet 0.471 strikt und 0.590 gold-bereinigt, Platz fünf im Panel hinter gemini-3-flash-preview (0.551 / 0.677), gemini-3.1-pro-preview (0.536 / 0.669), claude-fable-5 (0.531 / 0.655) und claude-opus-5 (0.523 / 0.643). Jede Zeile von OpenAI, Kimi und DeepSeek verzeichnet einen niedrigeren strikten Wert, und der Lauf kostete $15.28.
Die Spalte wird über die eigenen korrekten Routen jedes Modells gemessen, sodass ein schwächerer Router anhand einer leichteren Auswahl bewertet wird. qwen3.6-27b routet 0.679, und der Abschnitt zu den Einschränkungen misst diesen Effekt mit einer 0.96-Korrelation zwischen Routing-Genauigkeit und Nenner-Schwierigkeit.
Die Reihenfolge ändert sich, sobald das obere Ende der Klammer verwendet wird. Bei den adjudizierten Werten liegt qwen3.6-27b mit 0.717 auf Platz vierzehn, während claude-opus-5 mit 0.824 führt.
Routing-Fähigkeit und SQL-Schreibfähigkeit sind getrennte Achsen
kimi-k3 routet 0.832, hinter claude-opus-5 mit 0.848 und gleichauf mit qwen3.8-max, und schreibt 0.482 gold-bereinigtes SQL gegenüber einem Panel-Bestwert von 0.677. gemini-3-flash-preview kehrt es um: Es routet 0.753 und schreibt dieses panel-beste gold-bereinigte SQL. gpt-5.6-terra routet mit 0.772 und schreibt 0.447.
Die beiden Achsen werden nicht mit einem einzigen Nenner gemessen. Jedes Modell schreibt SQL für die Fragen, die es korrekt geroutet hat, und für keine anderen, und die besseren Router erhalten einen schwereren Satz, was jeden gemessenen Zusammenhang zwischen den Achsen nach unten zieht.
Das Gold-Audit und die Adjudikations-Jury
Zwei Jurys erledigten zwei verschiedene Aufgaben.
Die Gold-Validitäts-Jury bewertet Gold-Abfragen. Ihre fünf Juroren (claude-opus-4.8, gpt-5.6-sol, gemini-3.1-pro-preview, grok-4.5, deepseek-v4-pro) sehen jeweils eine Frage, das Gold-SQL und die Spaltenlisten der Tabellen, die diese Abfrage berührt, und beantworten, ob die Gold-Abfrage die Frage beantwortet. Es wird niemals eine Modellausgabe gezeigt. Ihre Urteile sind in einer Hash-fixierten Datei eingefroren und speisen die Gold-bereinigte Spalte.
Die Adjudikations-Jury bewertet den Fehlversuch eines bestimmten Modells. Drei Modelle aus anderen Familien als dem getesteten Modell sehen die Frage, die Gold-Abfrage und ihr Ergebnis sowie die Kandidaten-Abfrage und ihr Ergebnis, mit gemischten Positionen, und stimmen ab, zu welcher von vier Kategorien der Fehlversuch gehört. Sie läuft pro Modell für etwa $6, und ihre Urteile speisen die adjudizierte Spalte. Die Adjudikation über das gesamte Panel aus 36 Modellen kostete $208.81.
Die adjudizierte Spalte ist ein adjudikationsbereinigter, optimistischer Endpunkt und keine unabhängige Grundwahrheit. Sie kann in beide Richtungen irren. Eine uneindeutige Antwort, die tatsächlich korrekt war, wird nicht angerechnet, und ein falsch-positives Jury-Urteil rechnet eine an, die es nicht war. Drei gemessene Eigenschaften begrenzen, wie weit sie belastet werden kann.
Die Prüfung ist asymmetrisch. Fehlversuche erhalten einen zweiten Blick, Treffer dagegen nie, sodass ein Fehler in Richtung Bestehen nicht erkannt werden kann. Uneindeutige Urteile, 15 bis 23 % je nach Modell, werden nie angerechnet, und Beinahe-Fehlversuche sowie nicht ausgeführte Abfragen bleiben Fehlversuche.
Sie löscht die Untergrenze schwacher Modelle nicht aus. Als Negativkontrolle adjudizierten wir nova-lite-v1, die schwächste Zeile im Panel. Ihr Wert steigt von 0.190 auf 0.316 und bleibt 0.150 unter der nächsten Zeile. Die Untergrenze hält bei llama 0.466, mistral 0.509 und gpt-5.4-nano 0.512.
Der Anteil an Gold-Defekten folgt der Modellstärke mit einer Rangkorrelation von 0.906, gemessen über 33 Modelle. Die Fehlversuche von gpt-5.6-sol sind zu 40 % Gold-Defekte und zu 19 % echte Fehler, während die von llama-4-maverick 13 % und 50 % betragen.
Vierundzwanzig der 36 Modelle landen bei oder über 0.68 adjudiziert.
Wie die SQL-Generierung in diesem Benchmark funktioniert
Das Modell erhält niemals im Voraus ein Schema. Es wählt eines von 11 Datenbank-Tools, liest die zurückkommende Tabellenliste, fragt bei Bedarf die Spalten einer Tabelle ab und kann explorative Abfragen gegen die Datenbank ausführen, für die es sich entschieden hat, bevor es sich festlegt. Die Schema-Ausgabe ist auf 4.000 Zeichen begrenzt und Abfrageergebnisse auf 50 Zeilen.
Die endgültige Abfrage kommt über einen obligatorischen Finalisierungsaufruf an, der ohne angehängte Tools gesendet wird, zusammen mit der Datenbank, die das Modell angibt. Die Bewertung führt diese Abfrage und die Gold-Abfrage von BIRD gegen dieselbe Datenbankdatei aus und vergleicht die beiden Ergebnismengen, mit einem NULL-Sentinel und einem ordnungsempfindlichen Modus für Fragen, die eine Reihenfolge vorgeben.
Der Vergleich ist der strikte Schritt, und hier kann eine richtige Antwort als Fehlversuch gewertet werden. Eine Abfrage, die dieselben Zeilen mit einer zusätzlichen Spalte, in anderer Spaltenreihenfolge oder als Zählung zurückgibt, wo die Gold-Abfrage die Zeilen zurückgab, fällt beim Vergleich durch. Das ist die Lücke, die Adjudikations-Jury misst, nicht diejenige, die ein lockerer Vergleich schließen würde, die 0.5 Punkte bringt.
Benchmark-Methodik für Text-zu-SQL
Dieser Benchmark teilt sich sein Testgerüst mit dem agentischen RAG-Benchmark, der die Datenbankauswahl, die Schwierigkeits-Taxonomie, die Anonymisierung, den agentischen Kreislauf und das Zug-Budget vollständig beschreibt. Beide Seiten berichten über denselben eingefrorenen BIRD-SQL-Teilsatz mit 759 Fragen, ausgeführt über 11 Datenbanken, zwischen denen das Modell wählen muss, bei Temperatur 0 und vorenthaltenem Domänenhinweis. Die Routing-Seite trägt die Routing-Achse, und diese Seite trägt die SQL-Achse.
Bewertung: Ausführungsabgleich. Die endgültige Abfrage des Modells und die Gold-Abfrage von BIRD werden beide gegen die echte Datenbank ausgeführt und ihre Ergebnismengen verglichen, mit einem NULL-Sentinel und einem ordnungsempfindlichen Modus für Abfragen, deren Frage eine Reihenfolge vorgibt Nenner: Fragen, die das Modell korrekt geroutet hat Berichtsform: eine Drei-Werte-Klammer, strikte Ausführungsübereinstimmung, dann Gold-bereinigt, dann Adjudiziert Gold-Audit: 5 Frontier-Familien, je ein Modell, 759 Gold-Abfragen bewertet, 236 als fehlerhaft markiert, Hash-fixiert Adjudikation: 3 Modelle pro Kandidat, familienfremd zum getesteten Modell, blind und positioniert gemischt Panel: 36 Modelle, je ein Lauf, $874,53 für die Läufe und $208,81 für die Adjudikation
Warum kein LLM die Korrektheit an der Basis beurteilt. Wir haben die Alternative vor der Wahl gemessen. Über 2.203 Datensätze aus dem Vorgänger-Benchmark hinweg hat ein LLM-Richter nie eine Abfrage abgelehnt, die bei der Ausführung bestand, bei keiner Schwelle. Diesem Richter wurden beide Ergebnismengen gezeigt, daher ist sein Urteil nicht unabhängig vom Ausführungsergebnis, und die Null belegt nicht, dass ein Richter nicht strenger sein kann. Die Ausführung bleibt die Basis, und die Jury erscheint weiter oben in der Klammer, wo ihre Milde der Punkt ist.
Warum der Hinweis vorenthalten wird. BIRD liefert mit jeder Frage einen Domänenhinweis. Ihn bereitzustellen ist 6 bis 9 Ausführungsabgleich-Punkte wert, und es verschiebt auch die Routing-Genauigkeit um 5.7 Punkte, was ihn zu einem Leck auf der Routing-Achse macht. Beide Seiten berichten daher den hinweis-freien Zustand, und die SQL-Werte hier liegen unter dem, was dieselben Modelle unter BIRD-Standardbedingungen erzielen würden.
SQL-Genauigkeit im gesamten Panel, auf drei Arten
Sortiert nach der adjudizierten Spalte. Sechs Zeilen lagen nach zwei Wiederholungsdurchgängen unter 759 Datensätzen, und die fehlenden Fragen fehlen in jedem Nenner, statt als Fehler gezählt zu werden.
Einschränkungen der SQL-Achse
Die Gold-Abfragen sind entlehnt und umstritten. Unser Wert von 31,1 % fehlerhafter Gold-Abfragen ist unsere eigene auditierte Teilmenge und keine von mehreren Annotatoren bestätigte Grundwahrheit. Es gibt keinen verblindeten Duplikatdurchgang, keinen Inter-Annotator-Übereinstimmungswert, und die menschliche Überprüfung wurde vom Benchmark-Eigentümer und nicht von einem unabhängigen Annotator durchgeführt. Die Juroren sahen die Spaltenlisten der Tabellen, die Gold-Abfrage berührt, sodass eine Gold-Abfrage, die falsche Tabelle abfragt, aus dieser Sicht nicht erkennbar ist und solche Defekte übersehen werden. Das Gremium kann auch eine funktionierende Gold-Abfrage markieren, ein Fehler in die andere Richtung. Kein unabhängiger Annotator hat den Durchgang wiederholt, daher ist der Restfehler in beide Richtungen ungemessen und der Wert keine Untergrenze.
Die adjudizierte Spalte ist ein LLM-Instrument, keine zweite Grundwahrheit und keine strikte Obergrenze. Ihre drei Juroren sind Modelle, daher erbt die Spalte alles, was ein Modell-Gremium bei der SQL-Äquivalenz falsch macht, und kein Mensch hat die Urteile erneut gelesen.
Der Vergleich irrt in beide Richtungen. Spaltenreihenfolge und Spaltenzahl verursachen falsch-negative Ergebnisse, während Case-Folding und Rundung von Gleitkommazahlen auf sechs signifikante Stellen falsch-positive verursachen. Vergleichsfehler und Fehler in der Gold-Abfrage sind getrennte Unsicherheitsquellen und können eine Bewertung in unterschiedliche Richtungen bewegen.
Die strikte Ausführungsübereinstimmung wird über die jeweils korrekt gerouteten Fragen jedes Modells gemessen, und die besseren Router erhalten einen schwereren Satz. Die Routing-Genauigkeit folgt der Schwierigkeit der Fragen, die den SQL-Nenner eines Modells erreichen. Über die 36 Modelle beträgt diese Korrelation 0.96 (Pearson, über die mittlere Anzahl datenbankübergreifender Nachbarn) und 0.97 gegenüber dem Anteil der schwersten Fragen in diesem Nenner. Konkret schreibt claude-opus-5 SQL für 717 Fragen, von denen 21,8 % zu den 184 schwersten gehören, während nova-lite-v1 SQL für 285 Fragen schreibt, von denen 7,7 % dazu gehören. Ein schwacher Router wird anhand einer leichteren Auswahl bewertet. Behandeln Sie diese Spalte als eine Diagnose pro Modell und nicht als modellübergreifendes Ranking, und lesen Sie die drei Spalten als Stufen. Um die Lücke zu schließen, wäre ein Oracle-Route-Lauf nötig, bei dem jedes Modell SQL für dieselben Fragen schreibt. Dieser Lauf wurde nicht durchgeführt.
Die Konfidenzintervalle decken nur das Stichprobenrauschen ab. Die obige Tabelle druckt Punktschätzungen, und Wilson-Intervalle für die strikte und die Gold-bereinigte Spalte stehen in der veröffentlichten CSV neben jeder Zeile. Die Intervalle enthalten das Fragen-Stichprobenrauschen und weder die Unsicherheit der Juroren noch die der Gold-Markierungen. Zwei unter identischen Bedingungen wiederholte Panel-Läufe verschoben die Routing-Genauigkeit um 1.6 bis 2.7 Punkte, und diese Seite berichtet keine Wiederholungsmessung für die SQL-Spalten.
Diese Zahlen sind konstruktionsbedingt hinweis-frei, daher sind sie nicht mit den BIRD-Bestenlistenwerten für dieselben Modelle vergleichbar.
Fazit
Die strikte Ausführungsübereinstimmung gegen die Gold-Abfragen von BIRD reicht über die 36 Modelle von 0.190 bis 0.551, und dasselbe Panel reicht von 0.316 bis 0.824, sobald eine blinde Jury jeden Fehlversuch erneut gelesen hat. Die Distanz zwischen diesen beiden Ablesungen ist die Erkenntnis. Für claude-sonnet-5 beträgt sie 39.9 Punkte, von denen 22.7 von Antworten stammen, die richtigen Informationen in einer Form zurückgeben, die der Vergleich ablehnt.
Für eine Arbeitslast, die nach strikter Ausführungsübereinstimmung bewertet wird, verzeichnete gemini-3-flash-preview 0.551 roh und 0.677 gold-bereinigt bei $7,67 pro Lauf. Für eine Arbeitslast, bei der eine äquivalente Antwort in einer anderen Projektion akzeptabel ist, verzeichnete claude-opus-5 0.824 adjudiziert gegenüber den 0.785 von gpt-5.6-sol, innerhalb eines Konfidenzintervalls. Für jeden Vergleich pro Modell unterscheidet sich der Nenner je nach Modell, daher sind die drei Spalten Diagnosen und keine kontrollierte Bestenliste.
Die Obergrenze dieser Achse sind die Gold-Abfragen, nicht die Modelle. Ein Drittel der Gold-Abfragen von BIRD fällt bei unserem Audit durch, die Defekte konzentrieren sich im Train-Split, wo keine veröffentlichte Korrektur ankommt, und die beiden Instrumente, die an ihnen vorbeisehen, sind beide LLM-Jurys und keine menschlichen Annotatoren. Um die Achse voranzubringen, sind ein Oracle-Route-Lauf nötig, damit jedes Modell SQL für dieselben Fragen schreibt, sowie eine unabhängige doppelte menschliche Annotation einer stratifizierten Gold-Stichprobe. Beides wurde nicht durchgeführt.
Weiterführende Literatur
- Agentischer RAG-Benchmark: Multi-Datenbank-Routing über 36 LLMs
- 200+ führende KI-Benchmarks
- HALC-Bench: LLM-Halluzination bei Langkontext-Retrieval-Benchmark
- +100 Datensätze für ML- & KI-Modelle
- Beste RAG-Tools, Frameworks und Bibliotheken
FAQs
Weil die Gold-Abfragen von BIRD stammen und ein Drittel davon unser Audit nicht besteht. Die strikte Ausführungsübereinstimmung ist die Untergrenze, die Gold-bereinigte Spalte entfernt die Fragen, deren Gold-Abfrage wir als fehlerhaft beurteilt haben, und die adjudizierte Spalte rechnet Antworten an, die eine blinde Jury als äquivalent gelesen hat. claude-sonnet-5 bewegt sich über diese Klammer von 0.311 auf 0.710, sodass eine einzelne Zahl das Panel um bis zu 39.9 Punkte falsch darstellen würde.
Nein. BIRD liefert mit jeder Frage einen Domänenhinweis und stellt die Datenbank bereit. Dieser Benchmark hält den Hinweis zurück und lässt das Modell die Datenbank aus 11 Kandidaten wählen. Allein der Hinweis ist 6 bis 9 Ausführungsabgleich-Punkte wert.
Nicht in diesem Panel. Jedes Modell schreibt SQL für die Fragen, die es korrekt geroutet hat, sodass ein besserer Router einen schwereren Nenner erhält, bei einer 0.96-Korrelation zwischen Routing-Genauigkeit und Nenner-Schwierigkeit. kimi-k3 routet 0.832 und schreibt 0.482 gold-bereinigt, während gemini-3-flash-preview 0.753 routet und den panelbesten Wert von 0.677 schreibt.
Eine Gold-Abfrage, die ihre eigene Frage nicht beantwortet, bewertet von fünf Frontier-Modellen aus fünf verschiedenen Familien, von denen keinem eine Kandidatenantwort gezeigt wurde. Das Gremium markierte 236 von 759, und ein früheres Drei-Modell-Gremium markierte unabhängig 221, von denen 207 überlappen.
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Text-zu-SQL: Vergleich der LLM-Genauigkeit}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/text-to-sql}},
note = {AIMultiple. Abgerufen am 15. September 2026}
}Ergebnisse und Zeitstempel von 258 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die 2 CSV-Dateien und eine README enthält.
Möchten Sie die granularen Daten dahinter? Premium beitreten
Änderungsprotokoll
9 AktualisierungenText-to-SQL-Benchmarkergebnisse durch ein 36-Modell-Panel mit strict-, gold-clean- und adjudicated-Execution-Match-Bewertung ersetzt.
Ein Änderungsprotokoll wurde zum Abschnitt „Agentic RAG Benchmark: Multi-Datenbank-Routing und Abfragegenerierung“ hinzugefügt.
Der Methodik-Abschnitt wurde durch eine Zusammenfassung und einen Verweis auf einen anderen Artikel ersetzt.


Kommentare 1
Teilen Sie Ihre Gedanken
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.
Curious, how much of the context engineering and specific prompting did you apply in your benchmarks. Or, was it to review the models only? I have found much higher return of correct and consistent responses. A higher fidelity. To do that, I needed to provide a most sophisticated prompt that fed the context window as the question was being asked. Not perfect, but better than those scores represented in this article when using the Grok 4.x .
Great point. This benchmark intentionally uses zero-shot, minimal prompting with temperature=0. No few-shot examples, no domain-specific instructions, no iterative refinement. The goal was to measure each model's baseline text-to-SQL capability. So your experience with Grok 4 getting higher fidelity through sophisticated context engineering is completely expected. A well-crafted prompt with detailed schema descriptions, few-shot examples, and domain-specific rules will improve any model's performance significantly. What this benchmark isolates is how well the model performs out-of-the-box when given only the raw question and retrieved schema, which helps compare the models' inherent SQL reasoning abilities on a level playing field. We'll make this clearer in the methodology section. Thanks for raising it.