36 büyük dil modelini veritabanları arası yönlendirme konusunda kıyasladık. Her model, doğal dilde bir soru ve paragraf düzeyinde tanımlanmış 11 SQL veritabanı alıyor, ardından herhangi bir SQL yazmadan önce hangi veritabanının yanıtı içerdiğine karar vermesi gerekiyor. 11 veritabanı, 80 BIRD-SQL adayından, tanım embedding'lerini kümeleyerek seçildi; böylece adaylar anlamsal olarak birbirine yakın ve gerçek isimleri db_01 ile db_11 etiketleri ardına gizlenmiş durumda.
Her model aynı dondurulmuş 759 soru setini 0 sıcaklıkta, BIRD'ün alan ipucu verilmeden gördü.1 Her veritabanı, soru başına en fazla 10 API çağrısı sınırıyla, şema listeleme, tablo detayı ve sorgu çalıştırma olmak üzere üç eylem sunan bir araç olarak sunulur. Araç listesi her soru için yer değiştirir, böylece adayın konumu yönlendirme becerisi olarak okunamaz.
En zor sorularda yönlendirme doğruluğu. Modelin belirttiği veritabanının altın veritabanıyla eşleştiği en zor 184 sorunun payı. Bir soru, iki bağımsız sinyal aynı fikirde olduğunda 184 sorudan biri sayılır. Embedding uzayındaki en yakın 20 komşusundan en az 5'i başka veritabanlarına ait olmalı ve üç modelli bir jüri soruyu kafa karıştırıcı olarak etiketlemelidir. Bu, ana yönlendirme metriğidir.
184 soru, 11 veritabanının 6'sından gelir; paylar şöyledir: 51 (regional_sales), 50 (retail_world), 43 (superstore), 27 (works_cycles), 8 (debit_card_specializing) ve 5 (college_completion). Dört ticaret veritabanı, 171'ini yani 184'ün %93'ünü taşır. Diğer beş veritabanı hiç katkıda bulunmaz, çünkü anlamsal olarak yeterince yalıtılmışlardır ve hiçbir soruları her iki sinyali de geçemez. Dolayısıyla sayı, birbirinden ayırt edilmesi zor olacak şekilde oluşturulmuş veritabanları arasındaki yönlendirmeyi ölçer ve on bir alana yayılmak yerine bir ticaret kümesinde baskındır.
Beyan edilen rota. Modelin son yanıtında açık bir selected_database anahtarı altında belirttiği veritabanı. Hiçbir veritabanı adlandırmayan bir çalışma, son araç çağrısını devralmak yerine sıfır puan alır. Düzyazıdan çıkarılan rotalar hariç tutulur ve ayrı olarak raporlanır.
Agentic RAG kıyaslama bulguları
Panel liderini yeniden çalıştırmak onu altıncılığa düşürüyor
claude-opus-5 en zor soruların 0.848'ini doğru yönlendirdi, 184 sorunun 156'sı. Aynı dondurulmuş set, aynı anonimleştirme, 0 sıcaklık ile aynı koşullar altında ikinci kez çalıştırdık ve 0.8207, 184 soruda 151 kaydetti. Bu ikinci skor, altıncı sırada yer alan claude-fable-5'in yayınlanan skorudur. 1. ile 6. sıralar, 184 doğru cevaptan 156'sıyla 184 doğru cevaptan 151'ine kadar uzanır, beş soruluk bir mesafe, ki bu liderin kendisinin iki çalışma arasında yer değiştirdiği mesafedir.
İkinci bir model de aynı örüntüyü üretti. qwen3.8-max, 0.8315 (153/184)'ten 0.8152 (150/184)'ye geriledi. Her iki modelde de kolay ve orta dilimler 0.0000 hareket etti ve hareketin geri kalanı üç zor dilimde gerçekleşti; qwen3.8-max komşu sayısının işaretlediği sorularda da 153'ten 152'ye düştü.
qwen3.8-max daha küçük toplam farka sahip, 2.7'ye karşı 1.6 puan ve kendisiyle daha büyük anlaşmazlık gösteriyor; opus-5 8 soruda farklı yönlendirirken, 184 zor sorunun 13'ünde farklı yönlendiriyor. Bir model, on dört zor sorunun birinde kendisiyle anlaşmazken kendi skorunu yeniden üretebiliyor.
Bununla birlikte iki sınırlama var. Bir tekrar mutlak bir fark verir, standart sapma değil; dolayısıyla 1.6 ila 2.7 puan, gürültünün bir tanımı olmaktan çok bir alt sınırdır. Ve 36 panel satırının 34'ünün hiç tekrar çalışması yoktur. Bu skorları sıralamalar halinde değil, kademeler halinde okuyun.
Yalnızca 11 veritabanı adı, tam kataloğun 4 puan yakınında yönlendiriyor
Gerçek veritabanı adları ve hiçbir açıklama olmadan gösterildiğinde, claude-opus-4.8 0.688 ve gemini-3.5-flash 0.711 ile yönlendiriyor. Tam katalog, gerçek adlar artı tüm 11 paragraf açıklaması gösterildiğinde, aynı iki model 0.672 ve 0.750 puan alıyor; yani claude-opus-4.8 için yalnızca adlar, tüm katalogdan daha yüksek puan alıyor.
Adları db_01 ile db_11 ile değiştirmek, opus-4.8'e 7.0 puana, gemini'ye ise 4.7 puana mal oluyor. Gerçek adlarla yapılan bir çalışma, kavrayışın yanı sıra ad tanımayı da ölçer; bu nedenle burada yayınlanan her sayı anonimleştirilmiş koşuldan gelmektedir.
Üçüncü bir koşul iki kanalı ayırır. Gerçek adları koruyup açıklamaları veritabanları arasında karıştırmak, yönlendirmeyi 0.148 ve 0.055'e düşürür; aynı iki model üzerinde 128 soruluk bir pilot çalışmada ölçülmüştür.
Kafa karıştırıcı olması için seçilen veritabanları, rastgele olanlardan yaklaşık 20 puan daha zordur
10 çeldirici veritabanını, BIRD'ün diğer 69 veritabanından rastgele çekilen 10 veritabanıyla değiştirdik; aynı 128 soru, aynı altın veritabanı, her iki kol da anonimleştirilmiş. Hard_strict yönlendirmesi, claude-opus-4.8 için 0.713'ten 0.920'ye, gemini-3.5-flash için 0.770'ten 0.966'ya çıkıyor. Her iki kol da aynı soruları yanıtlar; dolayısıyla test, uyumsuz çiftler üzerinde süreklilik düzeltmeli McNemar testidir ve p = 8.6e-04 ve p = 2.4e-04 verir. Rastgele seçilen on bir aday, her iki modeli de tavana yakın bırakır.
Kolay dilimde aynı McNemar kontrastı anlamlı değildir, p = 0.48 ve p = 1.00. Küme seçimli çeldiriciler, komşu sayısının kafa karıştırıcı olarak işaretlediği soruları engellemek ve geri kalanını panelden bağımsız olarak yönlendirilebilir bırakmak için tasarlanmıştır ve iki kolun gösterdiği örüntü budur.
Bu ablasyon, soru başına bir rastgele panel çekilişiyle, etmen tabanlı değil, yalnızca açıklamaya dayalı ve tek seferliktir. Küme keşfi seçiminin, rastgele seçime göre ölçülebilir şekilde daha zor yönlendirme ürettiği iddiasını lisanslar. Komşu sayısının kendisinin zorluğa neden olduğu iddiasını lisanslamaz; bunu ayrıca test ettik ve kendi başına anlamsız bulduk.
En üst yönlendirme kademesi bir fiyat kademesi değildir
qwen3.8-max ve kimi-k3 her ikisi de 184 zor sorunun 153'ünü, her birinde 0.8315 ile yönlendiriyor; 759 soruluk çalışma başına maliyetleri $25.14 ve $40.34. claude-fable-5 $121.55 maliyetle 151 yönlendiriyor. Altı model, çalışma maliyetinde 5x aralığında liderin 0.03 puan yakınında yer alıyor.
Maliyet sütunu, model ekonomisini değil, çalışmanın faturalandırıldığı tutarı kaydeder. OpenRouter, bir model slug'ını ona hizmet veren herhangi bir üst akış sağlayıcıya yönlendirir ve aynı model üzerindeki özdeş 594 soru, bir çalışmada $2.09, diğerinde $8.33 maliyetle sonuçlanmıştır. Sütunu bir büyüklük mertebesi olarak okuyun. Bu dalgalanmada bir yön hayatta kalır. Paneldeki en pahalı iki çalışma, $121.55 ile claude-fable-5 ve $117.82 ile claude-opus-4.8, $25.14 ile qwen3.8-max'ten daha yükseğe yönlendiremez.
Bir model, etmen döngüsünü bundan faydalanmadan çalıştırabilir
İlk turda tek bir veritabanını araştıran sorularla sınırlandırıldığında, bir modelin dokunduğu ilk veritabanı ile nihai olarak beyan ettiği veritabanı arasındaki doğruluk farkı, claude-opus-5 için +25.0 puan, grok-4.5 için +38.0 puandır. gpt-5.4-mini için bu fark 0.0'dır. gpt-oss-120b için -3.8 ve nova-lite-v1 için -14.0'tür. Bu iki model, yanlış bir ilk araştırmadan kurtulduklarından daha sık doğru bir ilk araştırmayı terk ederler.
İki grup, keşif genişliği açısından farklılık gösterir. Panel genelinde, modeller kolay sorularda ortalama 1.12 farklı veritabanını araştırır, en zor sorularda 1.93. kimi-k3 1.07'den 2.27'ye, grok-4.5 1.06'dan 2.21'e çıkarken; gpt-oss-120b 1.01'den 1.10'a ve gpt-5.4-nano 1.11'den 1.20'ye çıkar.
gpt-5.4-nano soru başına 6.5 tur harcar ve baştan sona araç çağrıları yayar, dolayısıyla döngü çalışır. Döngüyü çalıştırmak ona 2.2 puan kazandırır.
Bazı sağlayıcılar sıralı araç çağrısı talebimizi görmezden geldi. İlk tur birden fazla veritabanına dokunduğunda, bu karşılaştırmadan çıkarıyoruz; bu durumda bazı modeller için 184 sorudan daha azı üzerinde çalışılır (qwen3.8-max 86, glm-5.2 101, kimi-k3 105).
Araştırma, geçiş ve ilk araştırma ile beyan edilen rota arasındaki fark
Keşif, zorluk etiketiyle ölçeklenir. Tüm 36 model ve 759 soru genelinde:
Bir modelin en az bir kez rota değiştirdiği 3.122 en zor soru kaydı boyunca, 1.717'si yanlış veritabanından doğru olana geçti ve 90'ı tam tersi yönde hareket etti; net kazanç yaklaşık 19'a 1 oranında 1.627 kayıt oldu. Ayrıca 983'ü yanlış bir veritabanında başlayıp hiç doğruya ulaşamadı ve 332'si doğru veritabanından ayrılıp geri döndü. Dört sayının tümü, buradaki diğer her yönlendirme sayısıyla aynı tanım olan açık beyan rotasını kullanır.
Bu asimetri, kıyaslamanın ilk araştırma yerine beyan edilen rotayı puanlamasının nedenidir. Önceki sürüm, etmenin ilk veritabanı fonksiyon çağrısını yönlendirme kararı olarak kaydediyordu. Bu panelde, bu gelenek 36 modelin 30'unu 14.7 ile 38.0 puan arasında eksik gösterir.
36 modelli panelde çalışma başına maliyet
36 çalışma toplam $874.53 tuttu; $0.47 ile $121.55 arasında. Altı tanesi, kalan sağlayıcı hatalarından sonra 759 sorudan daha az puanladı (gemini-3.1-pro-preview 744, gemini-3-flash-preview 755, claude-haiku-4.5 750, nova-lite-v1 750, gpt-5.6-luna 758, gpt-5.6-terra 758).
Tur sayısı panel genelinde 3.79 ile 7.64 arasında değişir ve token başına fiyatın yanı sıra faturayı besler. claude-opus-5 ortalama soru başına 3.92 tur kullanır ve $62.78 maliyetlidir, gemini-3.1-pro-preview 7.02 tur ve $80.01, gpt-oss-120b ise 3.79 tur ve $0.47.
36 çalışmanın üçü prompt önbellekleme kullandı, diğer 33'ü kullanmadı; dolayısıyla satırlar aynı temelde faturalandırılmaz ve üç önbellekli satır, aynı modelin önbelleksiz bir çalışmasından daha düşüktür.
Prompt önbellekleme ve konum yanlılığı kontrolünün maliyeti
Bu kıyaslamada her araç-döngüsü çağrısının %44'ü bayt-özdeş bir önektir; 362 token'lık sistem prompt'u artı 11 araç tanımı 2.259 token, yani ortalama 6.000 civarında olan bir çağrının 2.621 token'ı. Üç çalışma, bu önek üzerinde açık bir önbellek kesme noktası taşıdı. claude-opus-5 girdisinin %62.2'sini önbellekten okudu ve liste fiyatı $105.54 iken $62.78 faturalandı, %40.5 indirim. qwen3.8-max girdisinin %68.2'sini okudu, ölçtüğümüz en yüksek oran, Anthropic yerine Alibaba'da.
Tasarruf, bir tasarım kararıyla sınırlıdır. Araç listesi soru başına yer değiştirir, bu nedenle önek sorular arasında 0. bayttan itibaren farklılık gösterir ve her sorunun önbelleği, çalışma boyunca değil, kendi beş kadar çağrısı içinde yazılır ve okunur. Araç sırasını dondurmak önbelleği genişletir ve 759 soruluk çalışma başına yaklaşık $8.95 tasarruf sağlar. Yer değiştirmeyi koruduk ve bedelini ödedik.
Önbellekleme faturayı değiştirdi, modelin girdisini değil. Bir negatif test paketi, bayrak açık ve kapalıyken gerçek istek gövdelerini yakalar ve önbellek işaretleri çıkarıldıktan sonra bayt-özdeş olmalarını zorunlu kılar; yük taşıyan testi, bir işaretin altındaki tek bir karakteri değiştirir ve kontrolün bunu yakalamasını gerektirir. Bir maliyet kusuru bu pakete rağmen hayatta kaldı. Sonlandırma turu kasıtlı olarak hiç araç tanımı göndermez, bu nedenle öneki tüm önbellek girişlerini kaçırır ve üzerinde bir kesme noktası bırakmak, hiçbir şeyin okuyamayacağı yaklaşık 3.2M token önbellek yazdı, opus-5'in faturasının kabaca $4'ı. Değişiklik gönderildikten sonra yapılan bir düşmanca inceleme, tüm korumalar yeşilken bunu buldu.
Agentic RAG ve standart RAG
Geri getirme destekli üretim, bir dil modelinin önüne bir geri getirme adımı koyar. Soru gömülür, bir dizinden en yakın parçalar geri gelir ve model bunlardan yanıtlar. Yol sabittir ve hattaki hiçbir şey seçim yapmaz.
Agentic RAG, geri getirme kararlarını modele devreder. Hangi kaynağı sorgulayacağını seçer, geri geleni okur ve yanıtlamadan önce tekrar sorgulayabilir, kaynak değiştirebilir veya sorguyu rafine edebilir. Geri getirme, bir kez çalışan bir adım olmaktan çıkar ve modelin yönlendirdiği bir döngü haline gelir.
Hangi kaynağın yanıtı içerdiğine dair bu ilk seçim, bu kıyaslamanın ölçtüğü şeydir. Her model, adları gizlenmiş, paragraf düzeyinde tanımlanmış 11 SQL veritabanı görür ve herhangi bir SQL yazmadan önce birini seçmek zorundadır. Ardından ikinci, üçüncü bir veritabanını araştırabilir ve fikrini değiştirebilir. En zor sorularda panel ortalama 1.93 veritabanı araştırır ve çalışmaların %47.3'ü birden fazlasına dokunur.
Agentic veritabanı yönlendirmesi nasıl çalışır
Koşum takımı, modele bir soru ve her biri bir veritabanına ait, içinde tablo veya sütun adı bulunmayan 11 paragraf açıklamasından oluşan bir katalog verir. Kataloğun yanı sıra, her biri üç eylem sunan 11 araç ekler: get_schema tablo listesini döndürür, get_table_schema bir tablonun sütunlarını döndürür ve execute_query o veritabanına karşı SQL çalıştırır. Şema çıktısı 4.000 karakterle, sorgu sonuçları 50 satırla sınırlıdır.
Buradan itibaren model yönlendirir. Bir araç seçer, aynı konuşma içinde yanıtı okur ve farklı bir veritabanını araştırabilir, bir tablonun detayını isteyebilir veya karar verdiği veritabanına karşı bir sorgu çalıştırabilir. Herhangi bir turda veritabanı değiştirebilir ve en zor soruların %47.3'ü birden fazla veritabanında araştırılır.
Döngü iki şekilde sona erer. Model ya araç istemeyi bırakır ya da dokuzuncu araç-etkin çağrısını kullanır. Her iki durumda da koşum takımı, modelin seçtiği veritabanını ve SQL'ini belirttiği, hiçbir araç eklenmemiş bir sonlandırma çağrısı gönderir. Bu çağrı, her model ve her soru için koşulsuz olarak çalışır; dolayısıyla çağrı bütçesi dokuz araç turu artı bir, en fazla 10 API çağrısıdır.
Eşit bütçe, daha önceki bir tasarıma yapılan bir düzeltmedir. O tasarım, henüz SQL yayınlamamış modeller için sonlandırma turu ekliyordu; bu da yeteneğe değil, bir çıktı alışkanlığına ekstra bir çağrı veriyordu. Tavan ayrıca bir kota değildir. Panel, soru başına ortalama 3.79 ile 7.64 araç turu kullanır, çünkü bir model araştırmayı erken bırakabilir.
Agentic RAG kıyaslama metodolojisi
Kıyaslama iki yetkinliği ayrı ayrı ölçer. Yönlendirme, yanıtın hangi veritabanında olduğuna karar verir ve SQL üretimi, sorgunun doğru satırları döndürüp döndürmediğine karar verir. Yönlendirme katkıdır ve başlığı taşır. SQL doğruluğu, BIRD'ün altın sorgularına göre ölçülür ve kendi belirsizliğiyle text-to-SQL kıyaslama sayfasında raporlanır.
- Veri kümesi: BIRD-SQL eğitim ve dev bölümleri, dondurulmuş ve hash ile sabitlenmiş 759 soru.
- Veritabanları: 11, 80 BIRD adayından, açıklama embedding'lerinin kosinüs 0.65 ile aglomeratif kümelemesiyle seçildi.
- Zorluk sinyali: her sorunun en yakın 20 komşusundan kaçının farklı bir veritabanına ait olduğu sayılır.
- Zorluk dilimleri: kolay 222, orta 118, qq_only_hard 165, jury_only_hard 70, hard_strict 184.
- Birincil koşul: anonimleştirilmiş. Araç adlarında ve şema çıktısında veritabanı adları db_01 ile db_11 ile değiştirildi.
- Kanıt koşulu: hiçbiri. BIRD'ün alan ipucu tüm modellerden gizlendi.
- Araçlar: veritabanı başına 1, her biri 3 eylem sunar (get_schema, get_table_schema, execute_query), toplamda 11, sıralama soru başına yer değiştirir.
- Kelime dağarcığı: bir API çağrısı, modele yapılan bir istektir. Bir araç turu, araç listesini taşıyan ve araç çağrılarıyla geri dönebilen bir API çağrısıdır. Bir araç çağrısı, bir tur içindeki bir veritabanı eylemidir, tur başına en fazla 11. Sonlandırma çağrısı, hiçbir araç olmadan gönderilen son API çağrısıdır.
- Tur bütçesi: soru başına en fazla 10 API çağrısı, 9 araç turuna kadar artı her zaman çalışan tam olarak bir sonlandırma çağrısı.
- Kullanılan araç turları: panel genelinde soru başına ortalama 3.79 ile 7.64, çünkü bir model araştırmayı erken bırakabilir. Kaydedilen alan araç turlarını sayar ve sonlandırma çağrısını hariç tutar, bu nedenle tavanı 10 değil 9'dur.
- Sıcaklık: 0. Sıralı araç çağrıları istendi. Sorular, herhangi bir dilimden önce sabit bir tohumla bir kez karıştırıldı.
- Yönlendirme metriği: açıkça beyan edilen veritabanı üzerinden nihai yönlendirme doğruluğu.
- SQL metriği: BIRD'ün altın sorgusuna karşı yürütme eşleşmesi, üç değerli bir parantez olarak raporlanır.
- Panel: 36 model, iki tekrar hariç her biri tek çalışma, panel çalışmalarına $874.53 artı tekrarlara $85.37.
Hangi veritabanları zor soruları taşır. On bir veritabanının beşi, 184 en zor sorunun hiçbirine katkıda bulunmaz. Bunlar california_schools ve anlamsal olarak yalıtılmış dört tanesidir (financial, synthea, superhero, toxicology); bunlar yine de komşu işaretli 165 sorunun 27'sini aralarında sağlar.
Zorluk taksonomisi. Her soruyu iki bağımsız sinyal etiketler. İlki, 11 veritabanına ait tüm 1.922 soruyu gömer ve her sorunun en yakın 20 komşusundan kaçının farklı bir veritabanında yer aldığını sayar. İkincisi, sorunun veritabanları arasında kafa karıştırıcı olup olmadığı sorulan üç modelli bir jüridir. En zor dilim, bunları harmanlamak yerine her ikisini birden gerektirir.
Her iki sinyal de tek başına anlamlı değildir. Birleşimleri anlamlıdır. Tek bir model üzerinde ölçüldüğünde, her iki sinyalin de işaretlediği sorulardaki yönlendirme doğruluğu, aynı veritabanının kolay sorularındaki doğruluğun 0.803 katıydı, %95 GA [0.685, 0.943], p = 0.007. Önce her veritabanı içinde karşılaştırma yapar, ardından ters varyans log risk oranı ve 0.5 süreklilik düzeltmesi ile veritabanları arasında havuzlarız. 6 yerine 5 veritabanı üzerinde havuzlama yapılır, çünkü regional_sales zor sorular taşır ancak hiç kolay soru taşımaz ve bu nedenle eşleştirilecek bir şeyi yoktur. Üç şey kontrastı keşifsel kılar. Tek bir modele ve beş tabakaya dayanır ve randomize olmaktan çok gözlemseldir.
Model ne görür. Her model, 11 veritabanının tümünün, hiçbir tablo veya sütun adı içermeyen bir paragraf açıklamasını ve ayrıca 11 veritabanı aracını alır. Anonimleştirme, adı kaldırır ancak alanı kaldırmaz. Açıklamalar hâlâ her veritabanının ne hakkında olduğunu söyler ve model get_schema'yı çağırdığında gerçek tablo ve sütun adlarını görür. Koşul, açıklama kavrayışını ölçer.
Rotayı puanlama. Beyan edilen veritabanı, modelin sonlandırma turunda açık bir selected_database anahtarı altında adlandırdığı veritabanıdır. Açık bir beyan üretmeyen bir model, o soru için sıfır puan alır. Düzyazıdan çıkarılan rotalar başlık dışında kalır ve ayrı olarak yayınlanır. Bu çalışmanın daha önceki bir sürümü, metriğin üç farklı tanımını taşıyordu ve düzyazıdan kazınan varyant, altı panel satırını 0.6 ile 4.9 puan arasında şişirmişti.
SQL'i puanlama. Doğruluk, her iki sorguyu da çalıştırıp sonuç kümelerini karşılaştırarak belirlenir. Beş modelli denetimimiz, BIRD'ün altın sorgularının %31.1'ini bozuk olarak işaretledi; bu nedenle bu eksen, tek bir skor yerine üç değerli bir parantez olarak raporlanır. Puanlama kuralları, altın denetimi ve tam parantez, yukarıda bağlantısı verilen text-to-SQL sayfasında bulunur.
Araç çağrısı kurtarma. Beş model ailesi, standart ayrıştırıcının kabul etmediği formatlarda araç çağrıları serileştirir. Bir kurtarma katmanı, bu formları sessizlik olarak puanlamak yerine ayrıştırır ve her kurtarma, kayıt ve çalışma başına kaydedilir. Kesilmiş çağrılar asla yeniden oluşturulmaz. 36 satırın altısı sıfırdan farklı bir kurtarma payı taşır. Bunların beşi dipnot boyutundadır, %0.4 ile %4.4 arasında. Altıncısı daha büyüktür. llama-4-maverick %97.9'dadır; dolayısıyla o satırdaki neredeyse her araç çağrısı adaptör tarafından kurtarılmıştır ve o satır, modelin kendisinden ziyade model artı kurtarma katmanını ölçer. Bir model, minimax-m2.7, hiçbir araç çağrısı yayınlamadan anlatır ve onu sıfır puanlamak yerine panelden hariç tutarız.
Test edilen modeller
İki yeniden deneme geçişinden sonra kalan sağlayıcı hataları nedeniyle dört satır daha küçük bir zor soru paydası taşır: gemini-3.1-pro-preview, gemini-3-flash-preview ve nova-lite-v1 için 182, claude-haiku-4.5 için 181. Bu sorular başarısızlık olarak puanlanmak yerine paydadan çıkarılır; dolayısıyla her yüzde, çalışan kayıtlar üzerindendir.
Yönlendirme doğruluğu (tüm 759): Kolay ve orta kontrol kolları dahil olmak üzere tüm dondurulmuş set üzerindeki aynı ölçüm. Kolay kol, tasarım gereği doymuştur.
%95 aralıkları: Yukarıdaki tablodaki her aralık, o model için puanlanan zor sorular üzerinden bir Wilson aralığıdır; bu, çoğu satır için 184 ve kalan sağlayıcı hataları nedeniyle soru kaybeden dört satır için 182 veya 181'dir. Soru örnekleme belirsizliğini kapsar, başka hiçbir şeyi kapsamaz. Soruların veritabanları içindeki kümelenmesini kapsamaz ve ayrı olarak 1.6 ile 2.7 puan arasında ölçtüğümüz ve birbirine yakın iki model için daha büyük terim olan çalışmadan çalışmaya değişimi kapsamaz.
Şans ve temel çizgiler. Şans, 11 veritabanı genelinde 0.091'dir. Çoğunluk sınıfı, 759 soru üzerinde 0.196 ve en zor sorularda 0.277'dir. Üç etmen tabanlı olmayan geri getirici, genel olarak 0.471 (TF-IDF), 0.495 (BM25) ve 0.522 (embedding en yakın veritabanı) ve en zor sorularda 0.207 ile 0.230 arasında puan alır. Bu üçü, daha önceki 594 soruluk sette ölçülmüştür ve 759 üzerinde yeniden çalıştırılmamıştır; dolayısıyla bu panel için temel çizgilerden ziyade tarihsel referans noktalarıdır. Şans ve çoğunluk sınıfı, dondurulmuş 759 üzerinde hesaplanır ve doğrudan karşılaştırılabilir.
Sınırlamalar
Her iki tekrar çalışmalı model de en üst kademede yer alır, soruların en zor ve skorların en sıkışık olduğu yer. Orta sıra bir model tekrarlanmadı; bu nedenle en üst kademenin dışındaki gürültü terimi ölçülmemiştir.
Kontaminasyon kontrolleri etkiyi sınırlar, ortadan kaldırmaz. Zor soruları, anlamı ve altını korurken ifadeyi değiştirerek yeniden yazdık. Tüm üç geçerlilik kapısını geçen 184 açımlamadan 138'inde yönlendirme düşmedi ve panel etkisi ters yönde anlamlı çıktı, 0.543'ten 0.583'e, McNemar p = 0.032. Her soru her iki kolda da puanlanır; dolayısıyla eşleştirme gerçektir: 60'a karşı 87 çift açımlamayı tercih etti. Sıfırdan yazılan ve zorluk, ifade tarzı ve veritabanı karışımı açısından eşleştirilen altmış beş soru, yayınlanan setin +0.012 puanı yakınında puanladı, p = 0.74. Bu son karşılaştırma, eşleştirilmiş olmaktan ziyade iki bağımsız soru seti arasındadır; dolayısıyla iki oran karşılaştırmasıdır ve iki tasarımın zayıf olanıdır. Yazılan kontrol, 11 veritabanının 3'ünü, açımlama kontrolü 6'sını kapsar ve her ikisi de yalnızca ucuz modellerde çalıştırılmıştır. Model kesintilerinden sonra yayınlanan veritabanları üzerinde bir kontrol denenmemiştir ve 759 sorunun 560'ı (%73.8) BIRD'ün eğitim bölümünden gelir; ezberlenmiş olma olasılığı en yüksek pay.
Puanlanmayan kayıtları çıkarmak, başlığı en fazla 0.90 puan oynatır. Altı satır, kalan sağlayıcı hataları nedeniyle soru kaybetti ve bu sorular başarısızlık olarak sayılmak yerine paydadan çıkar; bu, kayıplar zor sorulara düşerse bir skoru şişirir. Bunun yerine kaybedilen her soruyu yanlış olarak puanlamak, gemini-3.1-pro-preview'i en zor sorularda 0.8242'den 0.8152'ye (-0.90 puan) ve 759 üzerinde 0.9140'ten 0.8959'a (-1.81 puan) hareket ettirir; gemini-3-flash-preview -0.81 puan, claude-haiku-4.5 -0.79 puan, nova-lite-v1 -0.13 puan. En zor sorularda yedi sıralama konumu değişir; bunların her biri bitişiktir ve her biri 1.6 ile 2.7 puanlık çalışmadan çalışmaya gürültü içindedir. Dolayısıyla gelenek, bu panelin çözünürlüğünde yük taşımaz.
En zor sorular bir ticaret kümesi ölçümüdür. Dört ticaret veritabanı, 184 zor sorunun 171'ini taşır ve beş veritabanı hiç taşımaz. Başlık, kıyaslamanın ölçmek içinşa edildiği şey olan, karşılıklı olarak kafa karıştırıcı veritabanları arasındaki yönlendirmeye genelleşir, genel olarak alanlar arası yönlendirmeye değil. Genişletmek, ikinci bir anlamsal kümeden zor sorular eklemek anlamına gelir ki mevcut külliyat bunu sağlayamaz.
Panel karma bir koşum takımında çalıştı. On dokuz model, araç çağrısı kurtarma katmanı eklendikten sonra, on beşi ondan önce puanlandı ve ikisi değişikliğin iki yanında yer alır. Daha önceki gruptaki standart olmayan bir araç çağrısı yayan bir model, sessizlik olarak puanlandı. Tüm 27.306 saklanan kayıt üzerinde kurtarma katmanını taramak, daha önceki satırların hiçbirinde kurtarılabilir bir çağrı bulmadı; bu nedenle karışımın ölçülen maliyeti sıfırdır, ancak hiçbir ayrıştırıcının işlemediği bir serileştirme, bu tarama için de görünmez olurdu.
Çalışmalar bit düzeyinde yeniden üretilebilir değildir. OpenRouter, kimi-k2.6'yı tek bir çalışma içinde 19 farklı üst akış sağlayıcıdan ve deepseek-v4-pro'yu 12 sağlayıcıdan sundu ve serileştirme davranışı aralarında farklılık gösterir. 36 çalışmanın üçü bir sağlayıcıyı sabitledi.
Anonimleştirme yalnızca ad düzeyindedir. Açıklamalar hâlâ alanlarını adlandırır ve ilk araç çağrısı gerçek tablo ve sütun adlarını döndürür; dolayısıyla bu koşul, bir adın tanınmasından ziyade bir açıklamanın kavranmasını ölçer.
Şema çıktısı 4.000 karakterde kesilir. works_cycles, 66 tablo ile en büyük veritabanıdır ve 26'sı kesintiden kurtulur. Bu veritabanı, 759 sorunun 149'unu taşır. Sorgu sonuçları 50 satırla sınırlıdır.
Yönlendirme ekseni boşluk payını tüketiyor. Kolay kontrol kolu, en iyi modeller için 222 sorunun 222'sinde tükenmiştir ve en zor dilim, altı modeli beş soruya sıkıştırır. Bu kıyaslama, artık öncü modelleri yönlendirmede birbirinden ayıramaz.
Sonuç
Kasıtlı olarak kafa karıştırıcı veritabanları arasında yönlendirme, 36 model genelinde 0.115 ile 0.848 arasında uzanır ve bu aralığın tepesi bir zirveden çok bir platodur. Altı model, claude-opus-5'in 0.848'inin 0.03 puan yakınında yer alır ve claude-opus-5'i yeniden çalıştırmak, altıncı sıradaki modelin yayınlanan skoru olan 0.8207'yi üretti.
Aralığın tepesindeki bir yönlendirme iş yükü için, qwen3.8-max, en zor soruların 0.832'sini, 759 soruluk çalışma başına $25.14 maliyetle doğru yönlendirdi; buna karşılık claude-fable-5'in 0.821'i $121.55 maliyetle. Aday veritabanlarının anlamsal olarak birbirinden uzak olduğu bir iş yükü için, ablasyon, test edilen her iki modeli de rastgele çekilmiş bir panelde 0.92'nin üzerine koyar; bu nedenle bir model seçilmeden önce panelin kendi kafa karıştırıcılığı ölçülmeye değerdir. En üst kademe içindeki herhangi bir karşılaştırma için, 1.6 ila 2.7 puanlık çalışmadan çalışmaya terim, karşılaştırılan farklardan daha büyüktür.
Tavan, artık bu tasarım üzerindeki bağlayıcı kısıttır. Kolay kontrol kolu tükenmiş, en zor dilim altı modeli beş soruyla ayırmakta ve bu zor soruların %93'ü bir ticaret kümesinden gelmektedir. Yeni nesil modelleri yönlendirmede ayırmak, bu külliyatın sağlayamayacağı ikinci bir anlamsal kümeden zor sorular ve yalnızca örnekleme üzerine değil, kademe sınırlarına hata çubukları koyacak kadar büyük bir tekrar çalışma bütçesi gerektirir.
Daha fazla okuma
- RAG Çerçeveleri: LangChain vs LangGraph vs LlamaIndex
- En İyi RAG Araçları, Çerçeveleri ve Kütüphaneleri
- 2026'da Agentic Arama: Ajanlar için 8 Arama API'sini Kıyaslayın
- 2026'da En İyi 5 Açık Kaynak Agentic AI Çerçevesi
- Text-to-SQL: LLM Doğruluğunun Karşılaştırması
SSS'ler
Gerçek adlar, ölçülen bir yönlendirme kanalıdır. 11 ad ve hiçbir açıklama olmadan gösterildiğinde, claude-opus-4.8 0.688 ve gemini-3.5-flash 0.711 ile yönlendirir; aynı modellerin tam katalogda puanladığına eşit veya üzerinde. Gerçek adlarla yayınlamak, kavrayışın yanı sıra ad tanımayı da rapor ederdi; bu nedenle birincil koşul, her adı db_01 ile db_11 ile değiştirir.
Gerçek adlar, ölçülen bir yönlendirme kanalıdır. 11 ad ve hiçbir açıklama olmadan gösterildiğinde, claude-opus-4.8 0.688 ve gemini-3.5-flash 0.711 ile yönlendirir; aynı modellerin tam katalogda puanladığına eşit veya üzerinde. Gerçek adlarla yayınlamak, kavrayışın yanı sıra ad tanımayı da rapor ederdi; bu nedenle birincil koşul, her adı db_01 ile db_11 ile değiştirir.
Hayır. BIRD, her soruyla birlikte bir alan ipucu gönderir ve bu kıyaslama bunu gizler; bu, 6 ila 9 yürütme eşleşme puanına değer ve yönlendirme doğruluğunu 5.7 puan oynatır. Yönlendirme görevinin kendisinin de BIRD'de bir eşdeğeri yoktur, çünkü BIRD modele hangi veritabanını kullanacağını söyler.
İki modeli aynı koşullar altında ikinci kez çalıştırarak ölçüldüğünde 1.6 ile 2.7 puan arasında. Panel liderini yeniden çalıştırmak onu 0.848'den 0.8207'ye taşıdı; bu, altıncı sıradaki modelin yayınlanan skorudur. İki model panel değildir ve bir tekrar, standart sapma yerine mutlak bir fark verir; bu nedenle bu aralığı bir alt sınır olarak ele alın.
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Agentic RAG Benchmark: Multi-Database Routing Across 36 LLM's}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-rag}},
note = {AIMultiple. Erişim tarihi: 11 Ağustos 2026}
}


Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.