Hizmetler
Bize Ulaşın

Text-to-SQL: LLM Doğruluk Karşılaştırması

Ekrem Sarı
Ekrem Sarı
Güncellenme tarihi: 7 Ağu 2026

36 büyük dil modelini 759 soru üzerinde BIRD-SQL'den çalıştırdık; her model, 11 aday arasından kendisinin belirlemesi gereken bir veritabanına karşı SQL yazdı. Ayrıştırılabilen her sorgu gerçek veritabanında çalıştırıldı ve sonuç kümesi BIRD'ün altın sorgusunun sonuç kümesiyle karşılaştırıldı. Eksik, hatalı biçimlendirilmiş ve yürütme hatası veren sorgular ıskalanmış olarak puanlandı.

Loading Chart

Her çalıştırma sıcaklık 0'da, zero-shot olarak ve BIRD'ün alan ipucu verilmeden yapıldı. 36 çalıştırmanın on dokuzu, yönlendirme sayfasında açıklanan araç çağrısı kurtarma katmanını kullandı; bu katman standart ayrıştırıcının reddettiği araç çağrılarını ayrıştırır. On beş çalıştırma bu katmandan önceye, iki çalıştırma ise değişikliğin iki yanına denk gelmektedir.

Metrikler açıklandı:

Katı yürütme eşleşmesi: Modelin doğru yönlendirdiği sorular üzerinden yürütme eşleşmesi. Doğru rotaya koşullanmak doğrudan yanlış veritabanı hatalarını ortadan kaldırır, ancak SQL yeteneğini tam olarak izole etmez; çünkü her model farklı bir soru alt kümesine ulaşır.

Altın-temiz: Altın SQL'ini bozuk olarak değerlendirdiğimiz soruların paydadan çıkarıldığı aynı ölçüm. Bu sorular geçmiş olarak puanlanmaz, çıkarılır.

Hakem değerlendirmeli: Üst uç. Test edilen model dışındaki ailelerden seçilen kör üç modelli jüri; modelin doğru yönlendirdiği, SQL'in çalıştığı ve satırların altın sonuç satırlarıyla yarıdan az örtüştüğü, katı karşılaştırmanın reddettiği her cevabı inceler. Sorgunun farklı ama eşdeğer bir formülasyon mu olduğuna, altının mı yanlış olduğuna yoksa modelin mi yanlış olduğuna karar verir. Eşdeğer cevaplar ve bozuk altınlar kredilendirilir.

Üçü de zor alt küme yerine 759 soruluk tam setten başlar ve hiçbiri payda olarak 759'u kullanmaz. Her biri modelin doğru yönlendirdiği sorular üzerinden ölçülür ve altın-temiz sütunu işaretlenen altınları çıkarır. Bu eksene şans uygulanmaz; çünkü bir sorgu ya altın sonuç kümesini döndürür ya da döndürmez.

Text-to-SQL kıyaslama bulguları

Yanlış biçimdeki doğru cevaplar bir modele 22.7 puana mal oldu

claude-sonnet-5, katı yürütme eşleşmesinde 0.311 kaydeder; 36 model arasında 33. sırada ve Anthropic satırlarının en düşüğüdür. Kör hakem değerlendirmesinde aynı çalıştırma 0.710 puan alır; bu, qwen3.6-27b'nin 0.717'sinin 0.007 altındadır.

39.9 puanlık kazanç ikiye ayrılır. Skorlanan 679 sorusunun 154'ü, yani 22.7 puan, jürinin altınla farklı bir biçimde eşdeğer okuduğu cevaplardır. Bir 117 soru daha, yani 17.2 puan, jürinin altının kendisini bozuk olarak değerlendirdiği sorulardır. Bu ikisinin ilkini cevap stili açıklar, toplamı değil. Harness hatası bunların hiçbirini açıklamaz; çünkü çalıştırma kayıp sorgu kaydetmedi, bir çökme ve kurtarılamayan cevap yoktu.

Şekil 1: Bir claude-sonnet-5 çalıştırması iki şekilde puanlandı ve üçüncü ölçüm neden farklı bir payda kullanıyor

Aynı 154 cevap, hakem değerlendirmesine ulaşan 453 sonnet-5 ıskalanmasının %34'ünü oluşturur. Biçimsel eşdeğerlik, sorgunun doğru bilgiyi farklı bir projeksiyonda, fazladan bir sütunla, farklı sütun sırasıyla veya altının satırları döndürdüğü yerde bir sayımla döndürmesi anlamına gelir. Katı yürütme eşleşmesi bunu başarısızlık olarak puanlar.

Eğilim yetenek katmanından ziyade model ailesine göre ilerler. Zengin projeksiyon üreten aileler, hakem değerlendirmesine giren ıskalamalarının dörtte biri ila üçte birini bu şekilde kaybeder: Claude %25 ila %34, Kimi %24 ila %34, OpenAI 5.x muhakeme serisi %26 ila %32, DeepSeek %31, MiniMax %26 ila %30 ve GLM-5.x %28. Altın biçiminde yazanlar çok daha az kaybeder: Google %9 ila %17, Llama %9, Mistral %18, Grok %19 ve OpenAI kendi küçük modelleri %19 ila %20. Grok, bu örüntüye ilişkin ilk açıklamamızı bozdu. Muhakeme katmanında yer alır ve %19 kaybeder.

Hakem değerlendirmeli ölçüm sonnet-5'i 17. sıraya koyar; bu, 16 sıralık bir farktır.

Jüri, bir modelin reddedilen cevaplarının %46'sının model hatası olmadığını tespit ediyor

Katı karşılaştırmanın, gemini-3.5-flash-lite'ın doğru yönlendirdiği sorularda reddettiği 346 cevaptan, SQL'i çalışan ve satırları altının satırlarıyla yarıdan az örtüşen 314'ünü aldık ve bunları kör, konumları karıştırılmış üç modelli jüriye gönderdik. Bu 346 cevap yalnızca zor olanlar değil, her zorluk kovasını kapsar; böylece SQL sütunlarının kapsadığı popülasyonla eşleşir.

Jüri bunları dört gruba ayırdı. Modelin doğru, BIRD'ün altın sorgusunun yanlış olduğu altın kusuru %29.3 aldı. Biçimsel eşdeğerlik %16.6, gerçek model hatası %33.4 ve belirsiz %20.7 aldı. İlk ikisi toplandığında, hakem değerlendirmesine giren 314 ıskalamanın 144'ü (%46) model hatası değildir. Bu pay, reddedilen 346 cevabın tümü üzerinden değil, jüriye ulaşan 314 üzerindendir. Geride tutulan 32 cevap ya yürütülemedi ya da temiz bir anlaşmazlık olamayacak kadar altınla yakın örtüştü.

Karşılaştırıcının katılığı bu farkı açıklamaz. Sütun sırası eşleşmesini gevşetmek 0.5 puan kazandırır ve ıskalamaların %92'si altın sonuçla 0.5'ten daha az örtüşür. Daha gevşek bir karşılaştırıcı yerine hakem değerlendirmesi, o modeli katı 0.464'e karşılık 0.606 ila 0.687 aralığına koyar.

Jürinin altın kusuru olarak nitelediği ıskalamalar, yayınlanmış hiçbir düzeltmenin ulaşmadığı yerde yoğunlaşır: bu modelin eğitim bölümü ıskalamalarının %33'üne karşılık geliştirme bölümü ıskalamalarının %20'si. Elimizdeki her deterministik düzeltme zaten kullanılmıştı. BIRD'ün kendi düzeltilmiş geliştirme sürümüne karşı yeniden puanlama, 92 geliştirme ıskalamasından 0'ını çevirdi; harici bir düzeltme seti bunların 39'unu kapsadı ve 1'ini çevirdi; MySQL-SQLite motor denetimi tüm sette 4 farklı altın buldu; bunların toplamı 314'ün yaklaşık %1'i kadardır.

Beş modelli denetimimiz BIRD'ün altın sorgularının %31.1'ini bozuk olarak işaretliyor

Altının kendisini denetledik. Her aileden bir tane olmak üzere beş öncü model, 759 altın sorgunun tümünü sorularına ve şemalarına göre değerlendirdi. Hiçbir jüri üyesine hiçbir modelin çıktısı gösterilmedi. Panel, 759 altından 236'sını bozuk olarak işaretledi; bu %31.1'dir, maliyeti $20,55 oldu ve hiçbir başarısız jüri çağrısı yaşanmadı.

Oran BIRD bölümlerine göre ayrışır: 560 eğitim altınından 204'ü (%36) bozuk iken 199 geliştirme altınından 32'si (%16) bozuk. Daha önce çalıştırılan bağımsız üç modelli panel %29.1'e ulaştı ve onun 221 bozuk işaretinin 207'si (%94) bu panelde de bozuk. Tüm 759 soru üzerinde iki panel %92.9 oranında aynı fikirdedir.

Yayınlanmış bir tahmin BIRD'ün eğitim bölümünü, yani MotherDuck'ın 151 örnek üzerindeki denetimini kapsar ve oranı %32.5 olarak verir. BIRD'ün hakemli denetimleri açık tasarım gereği geliştirme bölümünü kapsar; bu nedenle MotherDuck'ın 151 örneği, donmuş setimizdeki 560 eğitim sorusu üzerindeki tek harici kontrol olarak kalır; bu da setin %73.8'idir.1

Bozuk altınları paydadan çıkarmak en iyi katı yazıcıyı 0.551'den 0.677'ye taşır ve model başına kazançlar +4.5 ile +13.3 puan arasında değişir. Üst katman sırasını korur, orta sıradaki komşular en fazla üç konum hareket eder.

27B'lik bir model katı SQL doğruluğunda beşinci sırada

qwen3.6-27b, katıda 0.471 ve altın-temizde 0.590 kaydeder; panelde gemini-3-flash-preview (0.551 / 0.677), gemini-3.1-pro-preview (0.536 / 0.669), claude-fable-5 (0.531 / 0.655) ve claude-opus-5'in (0.523 / 0.643) ardından beşincidir. OpenAI, Kimi ve DeepSeek'in her satırı daha düşük katı puan kaydeder ve çalıştırmanın maliyeti $15,28 oldu.

Sütun, her modelin kendi doğru rotaları üzerinden ölçülür; bu nedenle daha zayıf bir yönlendirici daha kolay bir seçim üzerinden derecelendirilir. qwen3.6-27b 0.679 yönlendirme yapar ve sınırlılıklar bölümü bu etkiyi yönlendirme doğruluğu ile payda zorluğu arasındaki 0.96 korelasyonla ölçer.

Parantezin üst ucu kullanıldığında sıralama değişir. Hakem değerlendirmeli puanlarda qwen3.6-27b 0.717 ile on dördüncü iken claude-opus-5 0.824 ile öndedir.

Yönlendirme becerisi ile SQL yazma becerisi ayrı eksenlerdir

kimi-k3 0.832 yönlendirir; claude-opus-5'in 0.848 ile gerisinde ve qwen3.8-max ile aynı seviyede; panelin en iyisi olan 0.677'ye karşılık 0.482 altın-temiz SQL yazar. gemini-3-flash-preview bunu tersine çevirir: 0.753 yönlendirir ve panelin en iyi altın-temiz SQL'ini yazar. gpt-5.6-terra 0.772 yönlendirir ve 0.447 yazar.

İki eksen aynı payda üzerinden ölçülmez. Her model yalnızca doğru yönlendirdiği sorular için SQL yazar; daha iyi yönlendiriciler daha zor bir set kazanır ve bu da eksenler arasındaki ölçülen ilişkiyi aşağıya çeker.

Altın denetimi ve hakem değerlendirme jürisi

İki jüri iki farklı iş yaptı.

Şekil 2: Altın geçerlilik jürisi ve hakem değerlendirme jürisi; her birinin ne gördüğü ve hangi metriği beslediği

Altın geçerlilik jürisi altın sorguları derecelendirir. Beş jüri üyesi (claude-opus-4.8, gpt-5.6-sol, gemini-3.1-pro-preview, grok-4.5, deepseek-v4-pro) her biri bir soruyu, altın SQL'i ve o sorgunun dokunduğu tabloların sütun listelerini görür ve altının soruyu cevaplayıp cevaplamadığına karar verir. Hiçbir model çıktısı gösterilmez. Kararları hash ile sabitlenmiş bir dosyada dondurulur ve altın-temiz sütununu besler.

Hakem değerlendirme jürisi belirli bir modelin ıskalamasını derecelendirir. Test edilen model dışındaki ailelerden seçilen üç model; soruyu, altın sorgu ile sonucu ve aday sorgu ile sonucu konumları karıştırılmış olarak görür ve ıskalamanın dört kategoriden hangisine ait olduğuna oy verir. Model başına yaklaşık $6 maliyetle çalışır ve kararları hakem değerlendirmeli sütunu besler. 36 modellik panelin tamamında hakem değerlendirmesi $208,81'a mal oldu.

Hakem değerlendirmeli sütun; bağımsız bir referans doğrudan ziyade hakem değerlendirmesiyle düzeltilmiş, iyimser bir uç noktadır. Her iki yönde de hata yapabilir. Aslında doğru olan belirsiz bir cevap kredi alamaz ve jürinin yanlış pozitifi doğru olmayan bir cevabı kredilendirir. Ne kadar ileri götürülebileceğini üç ölçülmüş özellik sınırlar.

İnceleme asimetriktir. Iskalamalar ikinci kez incelenir, geçişler asla incelenmez; bu nedenle geçme yönündeki bir hata yakalanamaz. Belirsiz kararlar, modele bağlı olarak %15 ila %23, asla kredilendirilmez; kıl payı kaçanlar ve yürütülmeyen sorgular ıskalama olarak kalır.

Zayıf model tabanını silmez. Negatif kontrol olarak paneldeki en zayıf satır olan nova-lite-v1'i hakem değerlendirmesine aldık. Puanı 0.190'dan 0.316'ya yükselir ve sonraki satırın 0.150 altında kalır. Taban; llama 0.466, mistral 0.509 ve gpt-5.4-nano 0.512 düzeyinde tutunur.

Altın kusuru payı model gücünü izler; 33 modelde ölçülen sıra korelasyonu 0.906'dır. gpt-5.6-sol'ün ıskalamaları %40 altın kusuru ve %19 gerçek hata iken llama-4-maverick'inki %13 ve %50'dir.

36 modelin yirmi dördü hakem değerlendirmeli olarak 0.68 veya üzerinde yer alır.

Bu kıyaslamada SQL üretimi nasıl çalışır

Model baştan hiçbir şema almaz. 11 veritabanı aracından birini seçer, dönen tablo listesini okur, ihtiyaç duyduğunda bir tablonun sütunlarını ister ve karar vermeden önce yerleştiği veritabanında keşif sorguları çalıştırabilir. Şema çıktısı 4.000 karakterle, sorgu sonuçları 50 satırla sınırlıdır.

Son sorgu, hiçbir araç eklenmeden gönderilen zorunlu bir sonlandırma çağrısında, modelin bildirdiği veritabanıyla birlikte gelir. Puanlama bu sorguyu ve BIRD'ün altın sorgusunu aynı veritabanı dosyasında çalıştırır ve iki sonuç kümesini karşılaştırır; NULL gözcüsü ve sıra belirten sorular için sıraya duyarlı bir mod kullanılır.

Karşılaştırma katı adımdır ve doğru bir cevabın ıskalama olarak puanlanabileceği yer burasıdır. Aynı satırları fazladan bir sütunla, farklı sütun sırasıyla veya altının satırları döndürdüğü yerde bir sayımla döndüren bir sorgu karşılaştırmada başarısız olur. Hakem değerlendirme jürisinin ölçtüğü boşluk budur; daha gevşek bir karşılaştırıcının kapatacağı boşluk değil, ki o 0.5 puan kazandırır.

Text-to-SQL için kıyaslama yöntemi

Bu kıyaslama, veritabanı seçimini, zorluk taksonomisini, anonimleştirmeyi, ajan döngüsünü ve tur bütçesini tam olarak açıklayan agentic RAG kıyaslamasıyla aynı koşum takımını paylaşır. Her iki sayfa da modelin seçmesi gereken 11 veritabanı üzerinde, sıcaklık 0'da ve alan ipucu verilmeden çalıştırılan aynı 759 soruluk dondurulmuş BIRD-SQL alt kümesini raporlar. Yönlendirme sayfası yönlendirme eksenini, bu sayfa ise SQL eksenini taşır.

Puanlama: yürütme eşleşmesi. Modelin son sorgusu ve BIRD'ün altın sorgusu gerçek veritabanında çalıştırılır ve sonuç kümeleri karşılaştırılır; NULL gözcüsü ve sorusu bir sıra belirten sorgular için sıraya duyarlı mod kullanılır. Payda: modelin doğru yönlendirdiği sorular. Raporlanan biçim: üç değerli parantez; katı yürütme eşleşmesi, ardından altın-temiz, ardından hakem değerlendirmeli. Altın denetimi: 5 öncü aile, her birinden bir model, 759 altın derecelendirildi, 236'sı bozuk işaretlendi, hash ile sabitlendi. Hakem değerlendirmesi: aday başına 3 model, test edilen modelden aile olarak ayrık, kör ve konumları karıştırılmış. Panel: 36 model, her biri tek çalıştırma; çalıştırmalar için $874,53 ve hakem değerlendirmesi için $208.81.

Tabanda neden hiçbir LLM doğruluğu yargılamıyor? Seçmeden önce alternatifi ölçtük. Önceki kıyaslamadaki 2.203 kayıt boyunca, bir LLM yargıcı hiçbir eşikte yürütmenin geçtiği bir sorguyu reddetmedi. O yargıca her iki sonuç kümesi gösterilmişti; bu nedenle kararı yürütme sonucundan bağımsız değildir ve sıfır, bir yargıcın daha katı olamayacağını kanıtlamaz. Yürütme taban olarak kalır ve jüri, parantezde daha yukarıda, hoşgörüsünün asıl mesele olduğu yerde görünür.

İpucu neden verilmiyor. BIRD her soruyla birlikte bir alan ipucu gönderir. Bunu sağlamak 6 ila 9 yürütme eşleşmesi puanı değerindedir ve yönlendirme doğruluğunu da 5.7 puan hareket ettirir; bu da onu yönlendirme ekseninde bir sızıntı yapar. Bu nedenle her iki sayfa da ipucu-free koşulunu raporlar ve buradaki SQL sayıları aynı modellerin BIRD standart koşullarında alacağı puanların altında kalır.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

SQL doğruluğu panel genelinde, üç şekilde

Hakem değerlendirmeli sütuna göre sıralanmıştır. İki yeniden deneme geçişinden sonra altı satır 759 kayıttan eksik kaldı ve eksik sorular başarısızlık olarak sayılmak yerine her paydada yok sayıldı.

SQL ekseninin sınırlılıkları

Altın ödünç alınmıştır ve tartışmalıdır. Bizim %31.1'lik bozuk altın oranımız, çoklu etiketleyicili referans doğru değil, kendi denetlediğimiz alt kümedir. Kör tekrar geçişi yoktur, etiketleyiciler arası uyum rakamı yoktur ve insan doğrulaması bağımsız bir etiketleyici yerine kıyaslama sahibi tarafından yapılmıştır. Jüri üyeleri altın sorgunun dokunduğu tabloların yalnızca sütun listelerini gördü; bu nedenle yanlış tabloyu sorgulayan bir altın bu görünümden tespit edilemez ve bu tür kusurlar kaçar. Panel ayrıca çalışan bir altını da işaretleyebilir; bu diğer yönde bir hatadır. Hiçbir bağımsız etiketleyici geçişi tekrarlamadı; bu nedenle kalan hata her iki yönde de ölçülmemiştir ve oran bir taban değildir.

Hakem değerlendirmeli sütun bir LLM aracıdır; ikinci bir referans doğru değildir ve katı bir üst sınır değildir. Üç jüri üyesi de modeldir; bu nedenle sütun, bir model panelinin SQL eşdeğerliği hakkında yanlış yaptığı her şeyi miras alır ve hiçbir insan kararları yeniden okumamıştır.

Karşılaştırıcı her iki yönde de hata yapar. Sütun sırası ve sütun sayısı yanlış negatiflere yol açarken, büyük/küçük harf katlama ve altı anlamlı basamaklı ondalık yuvarlama yanlış pozitiflere yol açar. Karşılaştırıcı hatası ile altın sorgu hatası ayrı belirsizlik kaynaklarıdır ve bir puanı farklı yönlere hareket ettirebilir.

Katı yürütme eşleşmesi her modelin kendi doğru yönlendirdiği sorular üzerinden ölçülür ve daha iyi yönlendiriciler daha zor bir set kazanır. Yönlendirme doğruluğu, bir modelin SQL paydasına giren soruların zorluğunu izler. 36 model boyunca bu korelasyon 0.96'dır (Pearson, veritabanları arası ortalama komşu sayısı üzerinden) ve bu paydadaki en zor soruların payına karşı ise 0.97'dir. Somut olarak claude-opus-5, 717 soru için SQL yazar ve bunların %21.8'i en zor 184 soru arasındadır; nova-lite-v1 ise 285 soru için SQL yazar ve bunların %7.7'si en zor sorular arasındadır. Zayıf bir yönlendirici daha kolay bir seçim üzerinden derecelendirilir. Bu sütunu modeller arası bir sıralama yerine model başına bir tanı aracı olarak ele alın ve üç sütunu katmanlar olarak okuyun. Boşluğu kapatmak için, her modelin aynı sorular için SQL yazdığı bir oracle-route çalıştırması gerekir. Bu çalıştırma henüz yapılmadı.

Güven aralıkları yalnızca örnekleme gürültüsünü kapsar. Yukarıdaki tablo nokta tahminlerini gösterir ve katı ile altın-temiz sütunları için Wilson aralıkları, yayınlanan CSV'de her satırın yanında yer alır. Aralıklar soru örnekleme gürültüsünü taşır; jürilerin belirsizliğini de altın işaretlerinin belirsizliğini de taşımaz. Aynı koşullarda tekrarlanan iki panel çalıştırması yönlendirme doğruluğunu 1.6 ila 2.7 puan hareket ettirdi ve bu sayfa SQL sütunları için hiçbir tekrar ölçümü raporlamaz.

Bu sayılar yapıları gereği ipucu-free'dir; bu nedenle aynı modellerin BIRD liderlik tablosu puanlarıyla karşılaştırılamaz.

Sonuç

BIRD'ün altın sorgularına karşı katı yürütme eşleşmesi, 36 model boyunca 0.190 ile 0.551 arasında değişir; aynı panel, kör bir jüri her ıskalamayı yeniden okuduktan sonra 0.316 ile 0.824 arasında değişir. Bu iki okuma arasındaki mesafe bulgudur. claude-sonnet-5 için bu 39.9 puandır; bunun 22.7'si doğru bilgiyi karşılaştırıcının reddettiği bir biçimde döndüren cevaplardan gelir.

Katı yürütme eşleşmesiyle puanlanan bir iş yükünde gemini-3-flash-preview çalıştırma başına $7,67 ile ham 0.551 ve altın-temiz 0.677 kaydetti. Farklı bir projeksiyondaki eşdeğer bir cevabın kabul edilebilir olduğu bir iş yükünde claude-opus-5, gpt-5.6-sol'ün 0.785'ine karşı bir güven aralığı içinde hakem değerlendirmeli 0.824 kaydetti. Her türden model başına karşılaştırmada payda modele göre değişir; bu nedenle üç sütun kontrollü bir liderlik tablosu değil, tanı araçlarıdır.

Bu eksenin tavanı modeller değil, altındır. BIRD'ün altın sorgularının üçte biri denetimimizde başarısız olur; kusurlar, yayınlanmış hiçbir düzeltmenin ulaşmadığı eğitim bölümünde yoğunlaşır ve bunların ötesini gören iki araç da insan etiketleyiciler değil, LLM jürileridir. Ekseni ileri taşımak için her modelin aynı sorular için SQL yazdığı bir oracle-route çalıştırması ve tabakalı bir altın örneğin bağımsız çift insan etiketlemesi gerekir. Hiçbiri yapılmadı.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

İleri okuma

SSS'ler

Çünkü altın sorgular BIRD'ündür ve bunların üçte biri denetimimizde başarısız olur. Katı yürütme eşleşmesi tabandır; altın-temiz sütunu, altınını bozuk olarak değerlendirdiğimiz soruları çıkarır ve hakem değerlendirmeli sütun, kör bir jürinin eşdeğer okuduğu cevapları kredilendirir. claude-sonnet-5 bu parantez boyunca 0.311'den 0.710'a hareket eder; bu nedenle tek bir sayı paneli 39.9 puana kadar yanlış yansıtırdı.

Hayır. BIRD her soruyla birlikte bir alan ipucu gönderir ve veritabanını sağlar. Bu kıyaslama ipucunu vermez ve modelin 11 aday arasından veritabanını seçmesini ister. Yalnızca ipucu 6 ila 9 yürütme eşleşmesi puanı değerindedir.

Bu panelde hayır. Her model yalnızca doğru yönlendirdiği sorular için SQL yazar; bu nedenle daha iyi bir yönlendirici, yönlendirme doğruluğu ile payda zorluğu arasındaki 0.96 korelasyon dahilinde daha zor bir payda kazanır. kimi-k3 0.832 yönlendirir ve 0.482 altın-temiz yazar; gemini-3-flash-preview ise 0.753 yönlendirir ve panelin en iyisi olan 0.677'yi yazar.

Beş farklı aileden beş öncü modelin değerlendirmesine göre kendi sorusunu cevaplamayan bir altın sorgu; bu modellerin hiçbirine aday cevap gösterilmemiştir. Panel 759 altından 236'sını işaretledi ve daha önceki üç modelli bir panel bağımsız olarak 221'ini işaretledi; bunların 207'si örtüşüyor.

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ekrem Sarı (2026) - "Text-to-SQL: LLM Doğruluk Karşılaştırması". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 7 Ağustos 2026, kaynak: https://aimultiple.com/text-to-sql [Çevrimiçi Kaynak]

Sarı, E. (2026, 7 Ağustos). Text-to-SQL: LLM Doğruluk Karşılaştırması. AIMultiple. https://aimultiple.com/text-to-sql

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Text-to-SQL: LLM Doğruluk Karşılaştırması}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/text-to-sql}},
  note   = {AIMultiple. Erişim tarihi: 7 Ağustos 2026}
}

Değişiklik günlüğü

8 güncelleme
  1. 2026

    Agentic RAG karşılaştırması: çoklu veritabanı yönlendirme ve sorgu oluşturma bölümüne bir değişiklik günlüğü eklendi.

  2. Metodoloji bölümü, bir özet ve başka bir makaleye referans ile değiştirildi.

  3. 2025

    Girişteki büyük dil modellerinin sayısı güncellendi.

  4. Veri Kümesi ve temel gerçek bölümü, BIRD-SQL veri kümesinin zorluk seviyesiyle güncellendi.

  5. Eksik veya yanlış filtreler bölümündeki eksik filtre örneği değiştirildi.

  6. Makaleye "LLM'ler SQL'i Nasıl Oluşturur: Adım Adım Bir Bakış" başlıklı bir bölüm eklendi.

  7. Metodoloji bölümü, ajans tabanlı bir geri çağırma artırılmış üretim (RAG) çerçevesiyle değiştirildi.

  8. “Metinden SQL'e Karşılaştırma Metodolojisi” bölümü taşındı.

Referans Linkleri

1.
BIRD-bench
Ekrem Sarı
Ekrem Sarı
Yapay Zeka Araştırmacısı
Ekrem, AIMultiple'da Yapay Zeka Araştırmacısı ve Veri Bilimcidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.
Tam Profili Görüntüle

Yorumlar 1

Düşüncelerinizi Paylaşın

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450
PFJ Rofgowski
PFJ Rofgowski
Dec 10, 2025 at 20:04

Curious, how much of the context engineering and specific prompting did you apply in your benchmarks. Or, was it to review the models only? I have found much higher return of correct and consistent responses. A higher fidelity. To do that, I needed to provide a most sophisticated prompt that fed the context window as the question was being asked. Not perfect, but better than those scores represented in this article when using the Grok 4.x .

Ekrem Sarı
Ekrem Sarı
Feb 10, 2026 at 08:46

Great point. This benchmark intentionally uses zero-shot, minimal prompting with temperature=0. No few-shot examples, no domain-specific instructions, no iterative refinement. The goal was to measure each model's baseline text-to-SQL capability. So your experience with Grok 4 getting higher fidelity through sophisticated context engineering is completely expected. A well-crafted prompt with detailed schema descriptions, few-shot examples, and domain-specific rules will improve any model's performance significantly. What this benchmark isolates is how well the model performs out-of-the-box when given only the raw question and retrieved schema, which helps compare the models' inherent SQL reasoning abilities on a level playing field.           We'll make this clearer in the methodology section. Thanks for raising it.