Hizmetler
Bize Ulaşın

Metin-SQL: LLM Doğruluğu Karşılaştırması

Ekrem Sarı
Ekrem Sarı
Güncellenme tarihi: 7 Ağu 2026

36 büyük dil modelini BIRD-SQL veri kümesindeki 759 soru üzerinde çalıştırdık; her model, 11 aday arasından kendi belirlemesi gereken bir veritabanına karşı SQL yazdı. Çözümlenebilen her sorgu gerçek veritabanında yürütüldü ve sonuç kümesi BIRD'in altın sorgusunun sonuç kümesiyle karşılaştırıldı. Eksik, hatalı ve yürütme hatası veren sorgular isabetsiz olarak değerlendirildi.

Tüm çalıştırmalar sıcaklık 0'da, sıfır atışla ve BIRD'in alan ipucu gizlenerek yapıldı. 36 çalıştırmanın on dokuzu, yönlendirme sayfasında açıklanan ve standart ayrıştırıcının reddettiği araç çağrılarını ayrıştıran araç çağrısı kurtarma katmanını kullandı. On beş çalıştırma bu katmandan önce, iki çalıştırma ise değişikliğin ortasında kaldı.

Metriklerin açıklaması

Katı yürütme eşleşmesi. Modelin doğru şekilde yönlendirdiği sorular üzerindeki yürütme eşleşmesidir. Doğru rotaya koşullandırma, doğrudan yanlış veritabanı hatalarını ortadan kaldırır ancak SQL yeteneğini tamamen yalıtmaz, çünkü her model farklı bir soru alt kümesine ulaşır.

Altın temiz. Altın SQL sorgusunu bozuk olarak değerlendirdiğimiz soruların paydadan çıkarılmasıyla yapılan aynı ölçümdür. Bu sorular başarı olarak değerlendirilmez, çıkarılır.

Değerlendirilmiş. Üst uç. Test edilen modelin ailesinden farklı ailelerden seçilen kör bir üç modelli jüri, katı karşılaştırmanın reddettiği, modelin doğru yönlendirdiği, SQL'in çalıştığı ve satırlarının altın sorguyla %50'den az örtüştüğü her yanıtı inceler. Jüri, sorgunun farklı ama eşdeğer bir formülasyon olup olmadığına, altın sorgunun hatalı olup olmadığına veya modelin hatalı olup olmadığına karar verir. Eşdeğer yanıtlar ve bozuk altın sorgular kredilendirilir.

Üçü de tam 759 soruluk setten başlar, zor alt kümeyi değil ve hiçbiri paydasında 759 kullanmaz. Her biri modelin doğru yönlendirdiği sorular üzerinden ölçülür ve altın temiz sütunu işaretlenen altın sorguları düşürür. Şans bu eksene uygulanmaz, çünkü bir sorgu ya altın sonuç kümesini döndürür ya da döndürmez.

Metin-SQL karşılaştırma bulguları

Yanlış şekildeki doğru yanıtlar bir modele 22.7 puana mal oluyor

claude-sonnet-5 katı yürütme eşleşmesinde 0.311 kaydederek 36 model arasında 33. ve herhangi bir Anthropic satırının en düşüğü oldu. Kör değerlendirmede aynı çalıştırma 0.710 aldı, qwen3.6-27b'nin 0.717'sinin 0.007 altında.

39.9 puanlık kazanç ikiye ayrılıyor. Değerlendirilen 679 sorunun 154'ü (22.7 puan), jürinin altın sorguyla farklı bir şekilde eşdeğer olarak okuduğu yanıtlardır. Ayrıca 117'si (17.2 puan), jürinin altın sorgunun kendisini bozuk olarak değerlendirdiği sorulardır. Yanıt stili bu ikisinden ilkini açıklar, toplamı değil. Çalıştırma hiçbir eksik sorgu, bir çökme ve kurtarılamayan yanıt kaydetmediği için donanım başarısızlığı payı yoktur.

Şekil 1: Bir claude-sonnet-5 çalıştırması iki şekilde puanlandı ve üçüncü ölçümün neden farklı bir payda kullandığı

Aynı 154 yanıt, değerlendirmeye ulaşan 453 sonnet-5 isabetsizinin %34'üdür. Biçimsel eşdeğer, sorgunun doğru bilgiyi farklı bir izdüşüm, fazladan bir sütun, farklı bir sütun sırası veya altın sorgunun satır döndürdüğü yerde sayım döndürmesi anlamına gelir. Katı yürütme eşleşmesi bunu başarısızlık olarak puanlar.

Bu eğilim yetenek katmanına göre değil, model ailesine göre değişir. Zengin izdüşüm aileleri değerlendirilen isabetsizlerinin dörtte bir ila üçte birini bu şekilde kaybeder: Claude 25 ila %34, Kimi 24 ila %34, OpenAI'nin 5.x akıl yürütme hattı 26 ila %32, DeepSeek %31, MiniMax 26 ila %30 ve GLM-5.x %28. Altın şekline uyan yazarlar çok daha az kaybeder: Google %9 ila 17, Llama %9, Mistral %18, Grok %19 ve OpenAI'nin kendi küçük modelleri 19 ila %20. Grok bu örüntüye ilişkin ilk açıklamamızı bozdu. Akıl yürütme katmanında yer alıp %19 kaybediyor.

Değerlendirilmiş ölçüm sonnet-5'i 17. sıraya yerleştiriyor, 16 sıralık bir fark.

Jüri, bir modelin reddedilen yanıtlarının %46'sının model hatası olmadığını tespit ediyor

gemini-3.5-flash-lite için katı karşılaştırmanın doğru yönlendirdiği sorularda reddettiği 346 yanıtın 314'ünü, yani SQL'i çalışan ve satırları altın sorgununkiyle yarıdan az örtüşenleri aldık ve kör, konum karıştırmalı üç modelli jüriye gönderdik. Bu 346 yanıt, yalnızca zor olanları değil, tüm zorluk kovalarını kapsadığı için SQL sütunlarının kapsadığı popülasyonla eşleşir.

Jüri bunları dört kategoriye ayırdı. Modelin doğru, BIRD'in altın sorgusunun hatalı olduğu altın kusuru %29.3 aldı. Biçimsel eşdeğer %16.6, gerçek model hatası %33.4 ve belirsiz %20.7 aldı. İlk ikisini toplayınca değerlendirilen 314 isabetsizin 144'ü (%46) model hatası değildir. Bu oran, reddedilen tüm 346 yanıt üzerinden değil, jüriye ulaşan 314 üzerindendir. Geri tutulan 32 yanıt ya yürütülemedi ya da altın sorguyla temiz bir anlaşmazlık olamayacak kadar yakın örtüştü.

Karşılaştırıcı katılığı boşluğu açıklamaz. Sütun sırası eşleşmesini gevşetmek 0.5 puan kazandırır ve isabetsizlerin %92'si altın sonuçla 0.5'ten az örtüşür. Değerlendirme, daha gevşek bir karşılaştırıcı yerine, o modeli katı 0.464'e karşılık 0.606 ila 0.687 aralığına yerleştirir.

Jürinin altın kusuru olarak nitelediği isabetsizler, bu modelin eğitim bölümü isabetsizlerinde %33, geliştirme bölümü isabetsizlerinde ise %20 ile hiçbir yayımlanmış düzeltmenin ulaşmadığı yerde yoğunlaşır. Elimizdeki her deterministik düzeltme zaten harcanmıştı. BIRD'in kendi düzeltilmiş geliştirme sürümüne göre yeniden puanlama 92 geliştirme isabetsizinden 0'ını çevirdi; harici bir düzeltme seti bunların 39'unu kapsadı ve 1'ini çevirdi ve MySQL-SQLite motor denetimi tüm sette yalnızca 4 ıraksak altın sorgu buldu, bu da 314'ün yaklaşık %1'idir.

Beş modelli denetimimiz BIRD'in altın sorgularının %31.1'ini bozuk olarak işaretliyor

Altın sorgunun kendisini denetledik. Her aileden bir adet olmak üzere beş sınır modeli, tüm 759 altın sorguyu kendi sorularına ve şemalarına göre derecelendirdi. Hiçbir jüri üyesine herhangi bir modelin çıktısı gösterilmedi. Panel, 759 altın sorgunun 236'sını (%31.1) bozuk olarak işaretledi; maliyet $20.55 ve hiç başarısız jüri çağrısı olmadı.

Oran BIRD bölümlerine göre ayrışır: 560 eğitim altın sorgusunun 204'ü (%36), buna karşılık 199 geliştirme altın sorgusunun 32'si (%16). Daha önce çalıştırılan bağımsız bir üç modelli panel %29.1'e ulaşmıştı ve onun 221 bozuk işaretinin 207'si (%94) bu panelde de bozuktur. Tüm 759 soru üzerinde iki panel %92.9 oranında hemfikirdir.

Yayımlanmış bir tahmin BIRD'in eğitim bölümünü, MotherDuck'in 151 örnek üzerindeki denetimini kapsar ve oranı %32.5 olarak verir. BIRD üzerine hakemli denetimler açık tasarım gereği geliştirme bölümünü kapsar; bu nedenle MotherDuck'in 151 örneği, dondurulmuş setimizdeki 560 eğitim sorusu üzerindeki tek harici kontrol olarak durur — soruların %73.8'i.1

Paydadan bozuk altın sorguların çıkarılması en iyi katı yazarı 0.551'den 0.677'ye taşır ve model başına kazançlar +4.5 ila +13.3 puan arasında değişir. Üst sıra yerini korur ve orta tablo komşuları üç sıraya kadar hareket eder.

27B'lik bir model katı SQL doğruluğunda beşinci sırada

qwen3.6-27b katıda 0.471 ve altın temizde 0.590 kaydederek panoda beşinci oldu; önünde gemini-3-flash-preview (0.551 / 0.677), gemini-3.1-pro-preview (0.536 / 0.669), claude-fable-5 (0.531 / 0.655) ve claude-opus-5 (0.523 / 0.643) var. Tüm OpenAI, Kimi ve DeepSeek satırları daha düşük katı puan kaydederken çalıştırma $15.28'a mal oldu.

Sütun her modelin kendi doğru rotaları üzerinden ölçülür; bu nedenle daha zayıf bir yönlendirici daha kolay bir seçim üzerinden derecelendirilir. qwen3.6-27b 0.679 yönlendirir ve sınırlamalar bölümü bu etkiyi yönlendirme doğruluğu ile payda zorluğu arasında 0.96 korelasyon olarak ölçer.

Sıralama, aralığın üst ucu kullanıldığında değişir. Değerlendirilmiş puanlarda qwen3.6-27b 0.717 ile on dördüncü iken claude-opus-5 0.824 ile öndedir.

Yönlendirme becerisi ve SQL yazma becerisi ayrı eksenlerdir

kimi-k3 0.832 yönlendirir, claude-opus-5'in 0.848'inin gerisinde ve qwen3.8-max ile aynı düzeyde kalır ve panel en iyisi 0.677'ye karşılık 0.482 altın temiz SQL yazar. gemini-3-flash-preview bunu tersine çevirir, 0.753 yönlendirip panel en iyisi altın temiz SQL yazar. gpt-5.6-terra 0.772 yönlendirir ve 0.447 yazar.

İki eksen tek bir payda üzerinden ölçülmez. Her model yalnızca doğru yönlendirdiği sorular için SQL yazar ve daha iyi yönlendiriciler daha zor bir set kazanır, bu da eksenler arasında ölçülen herhangi bir ilişkiyi aşağı çeker.

Altın denetimi ve değerlendirme jürisi

İki jüri iki farklı iş yaptı.

Şekil 2: Altın geçerlilik jürisi ve değerlendirme jürisi, her birinin ne gördüğü ve hangi metriği beslediği

Altın geçerlilik jürisi altın sorguları derecelendirir. Beş jüri üyesi (claude-opus-4.8, gpt-5.6-sol, gemini-3.1-pro-preview, grok-4.5, deepseek-v4-pro) her biri bir soru, altın SQL ve sorgunun dokunduğu tabloların sütun listelerini görür ve altın sorgunun soruyu yanıtlayıp yanıtlamadığına karar verir. Hiçbir model çıktısı gösterilmez. Kararları karma ile sabitlenmiş bir dosyada dondurulur ve altın temiz sütununu besler.

Değerlendirme jürisi belirli bir modelin isabetsizini derecelendirir. Test edilen modelin ailesinden farklı ailelerden seçilen üç model; soruyu, altın sorgu ve sonucu, aday sorgu ve sonucu konum karıştırılmış olarak görür ve isabetsizin dört kategoriden hangisine ait olduğunu oylar. Model başına yaklaşık $6'ya çalışır ve kararları değerlendirilmiş sütununu besler. 36 modellik panelin tamamında değerlendirme $208.81'a mal oldu.

Değerlendirilmiş sütun, bağımsız bir referans doğruluk yerine değerlendirme ile düzeltilmiş, iyimser bir uç noktadır. Her iki yönde de hata yapabilir. Gerçekte doğru olan belirsiz bir yanıt kredi almaz ve bir jüri yanlış pozitifi aslında kredilendirilmemesi gerekeni kredilendirir. Ne kadar ileri götürülebileceğini üç ölçülmüş özellik sınırlar.

İnceleme asimetriktir. İsabetsizler ikinci bir bakış alır, geçenler asla almaz; bu nedenle geçme yönündeki bir hata yakalanamaz. Belirsiz kararlar, modele bağlı olarak 15 ila %23 oranında hiçbir zaman kredilendirilmez ve yakın isabetsizler ile yürütülemeyen sorgular isabetsiz kalır.

Zayıf model tabanını silmez. Negatif kontrol olarak paneldeki en zayıf satır olan nova-lite-v1'i değerlendirdik. Puanı 0.190'dan 0.316'ya yükselir ve bir sonraki satırın 0.150 altında kalır. Taban, llama 0.466, mistral 0.509 ve gpt-5.4-nano 0.512 olarak korunur.

Altın kusuru payı model gücünü izler ve 33 model üzerinden ölçülen sıra korelasyonu 0.906'dır. gpt-5.6-sol'in isabetsizleri %40 altın kusuru ve %19 gerçek hata iken, llama-4-maverick'inkiler %13 ve %50'dir.

36 modelin yirmi dördü değerlendirilmişte 0.68 ve üzerinde yer alır.

Bu karşılaştırmada SQL oluşturma nasıl işler

Model hiçbir zaman peşinen bir şema almaz. 11 veritabanı aracından birini seçer, gelen tablo listesini okur, gerektiğinde bir tablonun sütunlarını ister ve son sorgusunu taahhüt etmeden önce üzerinde anlaştığı veritabanına karşı keşif sorguları çalıştırabilir. Şema çıktısı 4.000 karakter ve sorgu sonuçları 50 satır ile sınırlıdır.

Nihai sorgu, modelin beyan ettiği veritabanıyla birlikte, araç eklenmeden gönderilen zorunlu bir sonlandırma çağrısı ile gelir. Puanlama, bu sorguyu ve BIRD'in altın sorgusunu aynı veritabanı dosyasında yürütür ve iki sonuç kümesini karşılaştırır; NULL işaretçisi ve sıra belirten sorular için sıraya duyarlı bir mod kullanılır.

Karşılaştırma katı adımdır ve doğru bir yanıtın isabetsiz olarak puanlanabileceği yerdir. Aynı satırları fazladan bir sütunla, farklı bir sütun sırasında veya altın sorgunun satır döndürdüğü yerde sayım olarak döndüren bir sorgu karşılaştırmada başarısız olur. Bu, değerlendirme jürisinin ölçtüğü boşluktur; daha gevşek bir karşılaştırıcının kapatacağı boşluk değil, ki o 0.5 puan kazandırır.

Metin-SQL için karşılaştırma metodolojisi

Bu karşılaştırma, veritabanı seçimini, zorluk taksonomisini, anonimleştirmeyi, ajan döngüsünü ve tur bütçesini tam olarak açıklayan ajansal RAG karşılaştırması ile aynı koşum takımını paylaşır. Her iki sayfa da aynı 759 soruluk dondurulmuş BIRD-SQL alt kümesini, modelin 11 veritabanı arasından seçim yapmak zorunda olduğu, sıcaklık 0'da ve alan ipucu gizlenerek yapılan çalıştırmaları raporlar. Yönlendirme sayfası yönlendirme eksenini, bu sayfa ise SQL eksenini taşır.

Puanlama: yürütme eşleşmesi. Modelin nihai sorgusu ve BIRD'in altın sorgusunun her ikisi de gerçek veritabanında yürütülür ve sonuç kümeleri karşılaştırılır; NULL işaretçisi ve sorusunda sıra belirten sorgular için sıraya duyarlı mod ile. Payda: modelin doğru yönlendirdiği sorular. Raporlanan biçim: üç değerli bir aralık; katı yürütme eşleşmesi, ardından altın temiz, ardından değerlendirilmiş. Altın denetimi: her birinden bir model olmak üzere 5 sınır ailesi, 759 altın sorgu derecelendirildi, 236'sı bozuk işaretlendi, karma ile sabitlendi. Değerlendirme: aday başına 3 model, test edilen modelle aile çakışması yok, kör ve konum karıştırmalı. Panel: 36 model, her biri tek çalıştırma, çalıştırmalar için $874.53 ve değerlendirme için $208.81.

Tabanda neden LLM doğruluğu yargıcı yok. Seçmeden önce alternatifi ölçtük. Önceki karşılaştırmadan 2.203 kayıt boyunca, bir LLM yargıcı, hiçbir eşikte yürütmenin geçtiği bir sorguyu başarısız saymadı. O yargıca her iki sonuç kümesi de gösterildi; bu nedenle kararı yürütme sonucundan bağımsız değildir ve sıfır, bir yargıcın daha katı olamayacağını kanıtlamaz. Yürütme tabanda kalır ve jüri, hoşgörüsünün anlamlı olduğu aralığın üstünde yer alır.

İpucu neden gizleniyor. BIRD her soruyla birlikte bir alan ipucu gönderir. Bunu sağlamak 6 ila 9 yürütme eşleşme puanı değerindedir ve aynı zamanda yönlendirme doğruluğunu 5.7 puan hareket ettirir; bu da onu yönlendirme ekseninde bir sızıntı haline getirir. Bu nedenle her iki sayfa da ipucunun olmadığı durumu raporlar ve buradaki SQL sayıları aynı modellerin BIRD standardı koşullar altında alacağı puanların altında kalır.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Panel genelinde SQL doğruluğu, üç şekilde

Değerlendirilmiş sütuna göre sıralanmıştır. İki yeniden deneme geçişinden sonra altı satır 759 kaydın altında kaldı ve eksik sorular başarısızlık olarak sayılmak yerine her paydada yoktur.

SQL ekseninin sınırlamaları

Altın sorgu ödünç alınmıştır ve tartışmalıdır. %31.1'lik bozuk altın sorgu oranımız kendi denetlediğimiz alt kümedir, çoklu etiketleyici referans doğruluğu değildir. Kör çift geçiş, etiketleyiciler arası uyum rakamı yoktur ve insan doğrulaması karşılaştırma sahibi tarafından bağımsız bir etiketleyici yerine yapılmıştır. Jüri üyeleri altın sorgunun dokunduğu tabloların sütun listelerini gördü; bu nedenle yanlış tabloyu sorgulayan bir altın sorgu bu görünümden tespit edilemez ve bu tür kusurlar gözden kaçar. Panel ayrıca çalışan bir altın sorguyu da işaretleyebilir, bu diğer yönde bir hatadır. Bağımsız bir etiketleyici geçişi tekrarlamamıştır, bu nedenle kalan hata her iki yönde de ölçülmemiştir ve bu rakam bir taban değildir.

Değerlendirilmiş sütun bir LLM aracıdır, ikinci bir referans doğruluk değildir ve katı bir üst sınır değildir. Üç jüri üyesi modeldir; bu nedenle sütun, bir model panelinin SQL denkliği hakkında yanlış yaptığı her şeyi miras alır ve kararları hiçbir insan yeniden okumamıştır.

Karşılaştırıcı her iki yönde de hata yapar. Sütun sırası ve sütun sayısı yanlış negatiflere yol açarken, büyük/küçük harf katlama ve altı anlamlı basamaklı float yuvarlama yanlış pozitiflere neden olur. Karşılaştırıcı hatası ve altın sorgu hatası ayrı belirsizlik kaynaklarıdır ve bir puanı farklı yönlere taşıyabilir.

Katı yürütme eşleşmesi, her modelin kendi doğru yönlendirdiği sorular üzerinden ölçülür ve daha iyi yönlendiriciler daha zor bir set kazanır. Yönlendirme doğruluğu, bir modelin SQL paydasına ulaşan soruların zorluğunu izler. 36 model genelinde bu korelasyon 0.96'dır (Pearson, ortalama veritabanları arası komşu sayısı üzerinden) ve o paydadaki en zor soruların payına karşı 0.97'dir. Somut olarak claude-opus-5, 717 soru için SQL yazar ve bunların %21.8'i en zor 184 soru arasındadır; nova-lite-v1 ise 285 soru için SQL yazar ve bunların %7.7'si öyledir. Zayıf bir yönlendirici daha kolay bir seçim üzerinden notlandırılır. Bu sütunu modeller arası bir sıralama yerine model başına bir tanı aracı olarak ele alın ve üç sütunu katmanlar olarak okuyun. Boşluğu kapatmak, her modelin aynı sorular için SQL yazdığı bir kehanet rotası çalıştırmasını gerektirir. Bu çalıştırma henüz yapılmamıştır.

Güven aralıkları yalnızca örnekleme gürültüsünü kapsar. Yukarıdaki tablo nokta tahminleri basmaktadır ve katı ile altın temiz sütunları için Wilson aralıkları, yayımlanan CSV'de her satırın yanında yer alır. Aralıklar soru örnekleme gürültüsünü taşır, jürinin veya altın işaretlerinin belirsizliğini değil. Aynı koşullar altında tekrarlanan iki panel çalıştırması yönlendirme doğruluğunu 1.6 ile 2.7 puan arasında hareket ettirmiştir ve bu sayfa SQL sütunları için herhangi bir tekrar ölçümü raporlamaz.

Bu sayılar yapı gereği ipucunun olmadığı durumdadır; bu nedenle aynı modellerin BIRD liderlik tablosu puanlarıyla karşılaştırılamazlar.

Sonuç

Katı yürütme eşleşmesi BIRD'in altın sorgularına karşı 36 model boyunca 0.190 ile 0.551 arasında değişir ve kör bir jüri her bir isabetsizi yeniden okuduktan sonra aynı panel 0.316 ile 0.824 arasında değişir. Bu iki okuma arasındaki mesafe bulgudur. claude-sonnet-5 için bu 39.9 puandır ve bunun 22.7'si, karşılaştırıcının reddettiği bir şekilde doğru bilgiyi döndüren yanıtlardan gelir.

Katı yürütme eşleşmesiyle puanlanan bir iş yükü için gemini-3-flash-preview hamda 0.551 ve altın temizde 0.677 kaydetti; çalıştırma başına $7.67. Farklı bir izdüşümdeki eşdeğer bir yanıtın kabul edilebilir olduğu bir iş yükü için claude-opus-5, gpt-5.6-sol'in 0.785'ine karşılık değerlendirilmişte 0.824 kaydetti ve bir güven aralığı içinde kaldı. Herhangi bir tür model başına karşılaştırma için payda modele göre farklılık gösterir; bu nedenle üç sütun kontrollü bir liderlik tablosu yerine tanı araçlarıdır.

Bu eksendeki tavan modeller değil, altın sorgulardır. BIRD'in altın sorgularının üçte biri denetimimizde başarısız olur; kusurlar, yayımlanmış hiçbir düzeltmenin ulaşmadığı eğitim bölümünde yoğunlaşır ve onları aşan iki araç da insan etiketleyiciler yerine LLM jürileridir. Ekseni ileri taşımak, her modelin aynı sorular için SQL yazdığı bir kehanet rotası çalıştırmasını ve katmanlı bir altın örneklemin bağımsız çift insan etiketlemesini gerektirir. Bunların hiçbiri yapılmamıştır.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

İleri okumalar

SSS'ler

Çünkü altın sorgular BIRD'indir ve üçte biri denetimimizde başarısız olur. Katı yürütme eşleşmesi tabandır, altın temiz sütunu altın sorgusunu bozuk olarak değerlendirdiğimiz soruları çıkarır ve değerlendirilmiş sütun kör bir jürinin eşdeğer olarak okuduğu yanıtları kredilendirir. claude-sonnet-5 bu aralık boyunca 0.311'den 0.710'a hareket eder; bu nedenle tek bir sayı paneli 39.9 puana kadar yanlış ifade eder.

Hayır. BIRD her soruyla birlikte bir alan ipucu gönderir ve veritabanını sağlar. Bu karşılaştırma ipucunu gizler ve modelin 11 veritabanı arasından seçim yapmasını sağlar. Yalnızca ipucu 6 ila 9 yürütme eşleşme puanı değerindedir.

Bu panel için hayır. Her model yalnızca doğru yönlendirdiği sorular için SQL yazar; bu nedenle daha iyi bir yönlendirici, yönlendirme doğruluğu ile payda zorluğu arasındaki 0.96 korelasyonla daha zor bir payda kazanır. kimi-k3 0.832 yönlendirir ve 0.482 altın temiz yazar; gemini-3-flash-preview ise 0.753 yönlendirir ve panelin en iyisi 0.677'yi yazar.

Kendi sorusunu yanıtlamayan bir altın sorgu; beş farklı aileden beş sınır modeli tarafından derecelendirilmiştir ve bunların hiçbirine herhangi bir aday yanıt gösterilmemiştir. Panel 759 sorunun 236'sını işaretledi ve daha önceki bir üç modelli panel bağımsız olarak 221'ini işaretledi; bunların 207'si örtüşür.

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ekrem Sarı (2026) - "Metin-SQL: LLM Doğruluğu Karşılaştırması". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 7 Ağustos 2026, kaynak: https://aimultiple.com/text-to-sql [Çevrimiçi Kaynak]

Sarı, E. (2026, 7 Ağustos). Metin-SQL: LLM Doğruluğu Karşılaştırması. AIMultiple. https://aimultiple.com/text-to-sql

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Metin-SQL: LLM Doğruluğu Karşılaştırması}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/text-to-sql}},
  note   = {AIMultiple. Erişim tarihi: 7 Ağustos 2026}
}

Referans Linkleri

1.
BIRD-bench
Ekrem Sarı
Ekrem Sarı
Yapay Zeka Araştırmacısı
Ekrem, AIMultiple'da bir Yapay Zeka Araştırmacısı ve Veri Analistidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.
Tam Profili Görüntüle

Yorumlar 1

Düşüncelerinizi Paylaşın

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450
PFJ Rofgowski
PFJ Rofgowski
Dec 10, 2025 at 20:04

Curious, how much of the context engineering and specific prompting did you apply in your benchmarks. Or, was it to review the models only? I have found much higher return of correct and consistent responses. A higher fidelity. To do that, I needed to provide a most sophisticated prompt that fed the context window as the question was being asked. Not perfect, but better than those scores represented in this article when using the Grok 4.x .

Ekrem Sarı
Ekrem Sarı
Feb 10, 2026 at 08:46

Great point. This benchmark intentionally uses zero-shot, minimal prompting with temperature=0. No few-shot examples, no domain-specific instructions, no iterative refinement. The goal was to measure each model's baseline text-to-SQL capability. So your experience with Grok 4 getting higher fidelity through sophisticated context engineering is completely expected. A well-crafted prompt with detailed schema descriptions, few-shot examples, and domain-specific rules will improve any model's performance significantly. What this benchmark isolates is how well the model performs out-of-the-box when given only the raw question and retrieved schema, which helps compare the models' inherent SQL reasoning abilities on a level playing field.           We'll make this clearer in the methodology section. Thanks for raising it.