Premium
Hizmetler
Premium

Agentic RAG Benchmark: 11 SQL Veritabanında Yönlendirme

We benchmarked 40+ LLMs on 759 questions that require choosing among 11 SQL databases. The benchmark measures whether each model identifies the right database, explores alternatives and states a final choice.

Ekrem Sarı
Ekrem Sarı
Güncellenme tarihi: 25 Eyl 2026
Grafik Yükleniyor

Yönlendirme doğruluğu, modelin son yanıtında doğru veritabanını açıkça belirttiği puanlanan soruların yüzdesidir. Başlık, 184 soruyu kullanır; bu sorular hem benzerlik testimiz hem de üç LLM'den oluşan jüri tarafından zor olarak işaretlenmiştir. Açık bildirim eksik olanlar puan almaz.

Veritabanı yönlendirme bulguları

qwen3.8-max, %83,2 yönlendirme doğruluğunu $25,14 maliyetli bir çalışmada kaydetti

Grafik Yükleniyor

Qwen3.8-max, 153 / 184 zor yönlendirme sorusunu $25,14 kayıtlı maliyetle doğru yanıtladı. claude-fable-5 151 soruyu $121,55 maliyetle yanıtladı. Her iki çalışmada da 759 sorunun tamamı tamamlandı.

İki soruluk bu fark, qwen3.8-max tekrarında ölçülen hareketten daha küçüktür. Kayıtlı maliyetler sağlayıcı seçimine ve önbellek kullanımına bağlıdır; bu nedenle bu karşılaştırma kalıcı bir fiyat-performans sıralaması oluşturamaz.

Nihai yönlendirme doğruluğu Grok ve Opus için yükseldi, ancak Nova için düştü

claude-opus-5 için zor soru doğruluğu, ilk veritabanı araştırması ile nihai bildirimi arasında 25.0 yüzde puan arttı. grok-4.5 kendi çalışması içinde 38.0 puan kazandı. gpt-5.4-mini kazanç kaydetmedi; nova-lite-v1 ise 14.0 puan kaybetti.

Her değişiklik, bir çalışmanın başlangıcını ve sonunu karşılaştırır. İlk turda birden fazla veritabanına dokunan sorular, tek bir ilk seçimleri olmadığından hariç tutulur.

Veritabanı değişikliği içeren 3.156 zor soru kaydında ilk ve nihai veritabanı seçimleri; 37 modelin tamamında

Bu sayım, çoklu veritabanı içeren ilk turlar da dahil olmak üzere, kayıtlı çağrı sırasındaki ilk veritabanını kullanır. Yukarıdaki yüzde puanı değişiklikleri tek bir ilk seçimi kullanır.

Bu nedenle bir veritabanı çağrısı yararlı bir düzeltmeyi garanti etmez. Önemli olan, modelin doğru nihai seçime ulaşmak için dönen bilgiyi kullanıp kullanmadığıdır. Bu, ek çağrıların değerini izole eden ayrı bir müdahale olmaksızın kayıtlı yörüngelerin gözlemidir.

Veritabanı yönlendirme sonuçları

Modeller alfabetik olarak görünür. Metodoloji, bunları çalıştırmak için kullanılan yazılımdaki farklılıkları tanımlar. Küçük puan farklarını yorumlarken bu koşullar önem taşır.

Aralıklar soru örnekleme belirsizliğini tahmin eder. Kayıtlı maliyetler her çalışmada başarılı kayıtları kapsar. Bunlar, ölçüm sırasında kullanılan sağlayıcıları ve önbellekleme koşullarını yansıtır.

Veritabanı yönlendirme için karar model'leri

Jev, Kev-9B, Laya English ve altı LLM'yi, 243 incelenmiş soru üzerinde, aynı 11 veritabanından gelen sorularla karşılaştırdık. Her model sağlanan açıklamalardan bir veritabanı seçti.

Laya yerel olarak Apple M4 üzerinde çalıştı. Kev, bir SSH tüneli üzerinden erişilen özel bir A100 hizmetinde çalıştı. Diğer model'ler barındırılan API'leri kullandı. Gecikme, geçerli yanıtlar arasında istemci isteğinin tamamını içerir. Doğruluk, denenen her soruyu içerir.

Jev, 240 tanesini 243 sorudan doğru veritabanıyla seçti; Laya English için bu sayı 123 oldu: 117 daha fazla doğru seçim ve 48.1 yüzde puan fark. Jev bu çalışmada ortanca gecikmeye göre barındırılan en hızlı modeldi. Laya'nın yerel dağıtımı, önemli ölçüde daha düşük doğrulukla birlikte genel olarak en düşük ortanca gecikmeye sahipti.

Kev-9B, Jev'den dört eksik olmak üzere 236 veritabanını doğru seçti. Yedi hatasının beşi yakıt banka kartı veritabanıyla ilgiliydi. Ortanca yanıt süresi ağ ve SSH tüneli dahil 952 ms sürdü. Ayrıca kaydedilen sunucu ortanca süresi 470 ms idi. Bu A100 dağıtımı FP32 ve referans çekirdekler kullandı. Hızı bu sunum yapılandırmasına bağlıdır.

Gemini 3.8 Flash ve Claude Opus 5, her soru için doğru veritabanını seçti. Opus, ortanca değerde 1.72 kat daha uzun sürdü ve bu sorular için bildirilen API maliyeti 7.58 ile Gemini'ninkinin çarpımı kadardı. Bu sette iki model için doğruluk eşitti.

DeepSeek sonucu, 19 hizmet veya çıktı hatası içeriyor: 16 HTTP 429 yanıtı, gerekli tek takma ad biçimini bozan iki yanıt ve bir tükenen çıktı bütçesi. 211 doğru seçimi 224 geçerli yanıtından yaptı; bu da %94,2 eder. Tüm denemeler sayıldığında grafikte ve tabloda gösterilen %86,8 elde edilir.

Yönlendirme maliyetleri: API fiyatlandırması ve donanım tahminleri

Jev, %98,8 soru için doğru veritabanını, API maliyeti $0,0337 / 1.000 yönlendirme denemesi olacak şekilde seçti. Qwen3.8 Flash, %97,9 doğruluğu $0,0791 maliyetle kaydetti; Gemini 3.8 Flash ise %100,0 doğruluğa $0,5337 maliyetle ulaştı. Maliyetleri, yanlış yanıtlar dahil ve ısınmalar hariç olmak üzere aynı 243 soruluk iş yükünden ölçeklendirdik. Jev'in API maliyeti, yaklaşık 1/120 oranında Claude Opus 5'inkine denkti; bu, aynı 243 yönlendirme denemesi içindi.

Laya'nın donanım tahmini, $0,0141 / 1.000 deneme ve %50,6 doğruluk şeklindeydi. Kev, %97,1 doğruluğa tahmini $0,1250 maliyetle ulaştı. Her iki tahmin de kiralanan makinenin istekleri sürekli olarak işlediğini varsayar. %10 kullanımda, her istek kira maliyetinin on katını taşır; bu da Laya için $0,1405'e, Kev için $1,2503'e yükselir; her ikisi de 1.000 deneme başınadır.

Tam ücret kaydına sahip beş LLM için, bildirilen API ücretlerini 243'e bölüp 1.000 ile çarptık. Jev, milyon giriş token'ı başına $0,042 ücret alır ve çıkış token'ları ücretsiz olur. 194.882 kayıtlı giriş token'ının maliyeti $0,008185 oldu, 243 denemede; bu, $0,0337 / 1.000 deneme başına eder.1

1.000 deneme başına donanım maliyeti; saatlik kira bedeli × ortalama işlem saniyesi × 1.000 ÷ (3.600 × kullanım) şeklindedir. Laya, istek başına ortalama 0.2006 saniye ile Apple M4 üzerinde çalıştı. Kev, A100 sunucusunda ağ ve SSH gecikmesi hariç ortalama 0.4734 saniye sürdü. Bu süreleri, belirtilen sağlayıcılardaki eşleşen donanıma uyguladık. Bu sağlayıcılardaki performans ve faturalama toplamları ölçülmemiş durumda.

Kev için, Vast.ai'de $0,9508/saat ile bir A100 SXM 80 GB kullandık; bu, GPU kira fiyat endeksi verilerimizdeki eşleşen düşük isteğe bağlı listedir.

Laya için, Scaleway'in M4-S modelini 16 GB bellek ve €0.22/saat ile kullandık. Dönüşüm, ECB'nin 22 Eylül kuru olan euro başına $1,1463 değerini kullanır. Scaleway 24 saatlik minimum kiralama gerektirir; bu da kısa bir iş için bile minimum kiralamayı €5.28, yaklaşık $6,05 yapar.234

Laya'nın model sayfası hiçbir Hugging Face Inference Provider listelemiyordu. Tahminimiz, bir makine kiralamayı ve modeli o makinede çalıştırmayı kapsar. Kurulum süresi, depolama, ağ ekstraları, vergiler ve operasyon işçiliği her iki donanım tahmininin dışındadır.5

Karar model'leri bir veritabanını nasıl seçer?

Jev ve Laya için uygulama; bağlamı, bir soruyu ve açıklamalarıyla adlandırılmış seçenekleri sağlar. Choice arayüzleri, seçilen bir seçeneği, seçenekler üzerindeki olasılıkları ve bir güven puanı döndürür. Uygulama kodu bu sonuçla ne yapacağına karar verir. Yönlendirme için seçenekler db_03 ve db_07 gibi veritabanı takma adlarıdır.65

Bu biçim, çıktının kod içinde kullanılmasını kolaylaştırır. Bir model yine de yanlış veritabanını seçebilir. Yüksek bir güven puanı da, bir uygulama onu incelemeyi atlamak veya yedek planı tetiklemek için kullanmadan önce gözlemlenen doğrulukla doğrulanmalıdır.

Laya'nın İngilizce checkpoint'i, sağlanan seçenekleri puanlayan bir karar başı ile iki yönlü bir ModernBERT kodlayıcı kullanır. Seçenek açıklamaları istekle birlikte gelir; böylece uygulama mevcut seçimlerini değiştirebilir. Jev, barındırılan bir Choice API'si sunar. Belgelendirmesi, iş akışı kontrolünü ve eylemlerini uygulama koduna yerleştirir. Paylaşılan arayüz, iki modelin aynı iç mimariye sahip olduğunu kanıtlamaz.57

Kev-9B, Qwen3.5-9B-Base üzerinde bir LoRA adaptörü ve pointer başı kullanır. Sağlanan seçimleri puanlar ve yanıt metni oluşturmadan olasılıklarını döndürür. Aynı soru ve veritabanı açıklamalarıyla uyumlu Choice endpoint'ini kullandık.8

Veritabanı seçimini etkileyen koşullar

Benzer veritabanları yönlendirme doğruluğunu yaklaşık 20 puan azalttı

Veritabanı seçim yöntemini ayrı bir deneyde 128 soru üzerinde test ettik. Her soru doğru veritabanını korudu; diğer 10 aday ise seçilen gruptan veya rastgele çekimden geldi.

Zor alt kümede, claude-opus-4.8 benzer adaylarla %71,3, rastgele adaylarla %92,0 puan aldı. gemini-3.5-flash ise %77,0 ve %96,6 puan aldı. Her iki fark da eşleştirilmiş testlerde p-değeri 0.001'in altında kaldı.

Bu deney, her soru için açıklamaları ve tek bir model yanıtını kullandı; agentic araç döngüsü yoktu. Benzer adayların seçilmesinin veritabanı seçimini zorlaştırdığına ilişkin daha dar bulguyu destekler. Ölçülen fark, agentic keşfin etkisi olarak sunulmamalıdır.

Yalnızca adlar bir pilotta %68,8 ve %71,1 doğruluk sağladı

Başka bir 128 soruluk pilotta, claude-opus-4.8 yalnızca adlardan %68,8 oranında doğru veritabanını seçti. Adlar ve açıklamalar ile puanı %67,2 oldu. gemini-3.5-flash adlardan %71,1, tam katalogdan %75,0 puan aldı.

california_schools ve toxicology gibi adlar konuyu doğrudan ortaya koyar. Ana benchmark için, veritabanı adlarını db_01 ile db_11 arasındaki takma adlarla değiştiriyoruz. Açıklamalar yine de her veritabanının alanını açıklar ve araç yanıtları tablo ve sütun adlarını gösterir.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Yönlendirme ve maliyet karşılaştırmalarının güvenilirliği

Tekrar çalışmaları yönlendirme doğruluğunu 1.6 ile 2.7 puan arasında değiştirdi

claude-opus-5, ilk çalışmasında 156 tanesini 184 zor sorudan doğru seçti ve tekrarında 151 tanesini doğru seçti. Doğruluğu %84,8'den %82,1'e düştü. qwen3.8-max ise 153 doğru yanıttan 150'ye geriledi; bu, %83,2'den %81,5'e bir düşüş oldu.

Her iki tekrar da orijinal çalışmalarıyla aynı soruları, anonimleştirmeyi, sıcaklığı ve sağlayıcı ayarlarını kullandı. qwen3.8-max, toplamı üç değişmesine rağmen 13 zor soruda yanıtını değiştirdi. Bazı sorulardaki iyileşmeler diğerlerindeki hataları dengeledi.

Bu tekrarlar, küçük puan farklarının başka bir çalışmada kaybolabileceğini gösterir. Model başına bir tekrar, sonuç dağılımını oluşturamaz ve diğer 35 modelin tekrar ölçümü yoktur.

Kayıtlı maliyetler sağlayıcı ve önbellekleme ayarlarına bağlıdır

Prompt caching, faturalanan giriş maliyetlerini azaltmak için daha önce işlenen girdiyi yeniden kullanır. claude-opus-5 çalışması $62,78 tuttu; aynı kayıtlı kullanım için önbelleksiz liste fiyatlarıyla tahmini $105,54 olurdu. Bu tahmin %40,5 tasarruf anlamına gelir. Bu, ayrı bir önbelleksiz doğruluk çalışması olmaksızın yapılan muhasebesel bir karşılaştırmadır.

Agentic RAG ve veritabanı seçimi

Agentic RAG, modele geri getirme kararları üzerinde kontrol verir. Bir kaynak seçebilir, yanıtı inceleyebilir ve başka bir istek yapabilir. Basit bir RAG pipeline, yanıt üretmeden önce bağlamı önceden belirlenmiş bir sırayla getirir.

Temel RAG önceden ayarlanmış bir getirme yolunu izler. Agentic RAG bir yanıtı inceleyip başka bir kaynak seçebilir.

Bu benchmark, kaynak seçimini SQL veritabanı araçları aracılığıyla test eder. Belge dizini, getirilen pasajlar veya yanıt dayanak puanı içermez. Bu nedenle sonuçlar, agentic bir getirme sisteminin yalnızca bir bölümünü tanımlar. Belge arama, agentic search benchmark başlıklı çalışmamızda ayrıca ele alınmaktadır.

Bir model kısa veritabanı açıklamalarıyla başlar. Tablo listelerini isteyebilir, sütunları inceleyebilir, SQL çalıştırabilir ve veritabanlarını değiştirebilir. Nihai yanıtı bir veritabanı seçimi ve bir sorgu içerir. text-to-SQL benchmark çalışmamız, SQL doğruluğunu ve iki ek inceleme puanını raporlar.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Agentic RAG benchmark metodolojisi

Model, bir veritabanı ve SQL sorgusu bildirmeden önce veritabanı araçlarını kullanır. Yönlendirme ve SQL doğruluğu ayrı ayrı puanlanır.

Soru seti, BIRD-SQL veri kümesinin dondurulmuş bir alt kümesidir; bu veri kümesi doğal dildeki soruları SQL referans sorgularıyla eşleştirir.9

Zorluğu iki sinyal tanımlar. Benzerlik testi, bir sorunun 20 en yakın komşusundan kaçının diğer veritabanlarına ait olduğunu sayar. Üç LLM, sorunun veritabanları arasında kafa karıştırıcı olup olmadığını değerlendirir. En zor gruba girmek, en az beş veritabanı dışı komşu ve kafa karıştırıcı bir jüri etiketi gerektirir.

Yönlendirme, açık selected_database alanı altında adlandırılan veritabanını kullanır. Düz metinden çıkarılan bir yönlendirme başlıktan hariç tutulur. SQL doğruluğu ayrı olarak puanlanır ve yönlendirme kredisini belirlemez.

Harness, araçları sunan ve model yanıtlarını kaydeden yazılımdır. Ana panel 36 OpenRouter çalışması ve bir Codex CLI çalışması içerir. API çalışmaları arasında 19'u v3, 15'i daha eski bir sürüm kullandı ve iki tanesi her iki sürümden kayıtları birleştirdi. v3'te bir kurtarma katmanı, desteklenen alternatif araç çağrı biçimlerini ayrıştırır. llama-4-maverick için kayıtlı yerel olmayan biçim payı %97,9 olduğundan bu sonuç büyük ölçüde adaptöre bağlıdır. minimax-m2.7, görevin gerektirdiği veritabanı araç çağrılarını yapmadığı için hariç tutuldu.

GPT-6 Astra, kayıtlı harness tanımlayıcısı codex_cli_transcript_v1 olan Codex CLI içinde çalıştı. Kurulum farklı olduğundan, puan farkları yalnızca modele atfedilemez. GPT-6 Astra, 759 sorunun tamamını tamamladı. 155 tanesini 184 zor sorudan doğru veritabanı olarak seçti ve tüm sette %95,3 yönlendirme doğruluğu kaydetti. Çalışması dolar cinsinden maliyet bildirmedi.

Karar modeli yönlendirme benchmark'ı

Ayrı yönlendirme deneyi, 243 değiştirilmemiş soruyu, 394 aday arasından, 17 geliştirme sorusu ayrıldıktan sonra seçti. Sorgu seti başlangıçta 204 kolay ve 39 zor soru içeriyordu. Bu zorluk etiketleri bu görev için yeniden doğrulanmadı ve seçim kör bir hold-out değerlendirmesi değildi.

Ölçülen tahminler toplanmadan önce dört veritabanı açıklaması, kaynak şemaları ve soru metni kullanılarak düzeltildi. Diğer yedisi kompakt açıklamalarını korudu. Her model aynı soruyu, 11 takma adı ve açıklamaları ve o soru için seçenek sırasını aldı. Referans SQL, kaynak etiketleri ve ek kanıtlar verilmedi. Jev ve Laya kendi yerel Choice arayüzlerini kullandı. LLM'lere bir takma ad döndürmeleri talimatı verildi. Modellerin veritabanı araçları yoktu.

Jev 1.13.0'ı barındırılan API üzerinden ve sabitlenmiş Laya English checkpoint'ini yerel olarak Apple M4 MPS, 16 GiB bellek ve dört Torch iş parçacığı ile çalıştırdık. Laya'nın 404 token bağlam başı sınırı ve 48 token seçenek sınırı girdi kesintisine neden olmadı. Altı LLM, sabit sağlayıcılar ve akıl yürütme ayarlarıyla OpenRouter üzerinden çalıştı. İstenen akıl yürütme Gemini 3.8 Flash için düşük, Gemini 3.5 Flash Lite için minimum ve Opus için yüksek düzeydeydi. DeepSeek, Qwen ve Haiku için devre dışı bırakıldı. Her modelin bir hariç tutulan ısınması, uçuşta bir isteği vardı ve yeniden deneme yapılmadı. Model gönderim sırası sorular arasında döndürüldü.

Kev-9B, orijinal sekiz sonucu koruyarak 22 Eylül'de ayrı bir çalışmada eklendi. 243 istek yükü, seçenek sırası dahil olmak üzere orijinal Jev girdileriyle tam olarak eşleşti. 2629c06a checkpoint revizyonunu sabitledik ve FP32, SDPA dikkat ve birleştirilmemiş LoRA ile A100 SXM 80 GB kullandık. Tarih ön işleme ve prefix caching kapalıydı. API'yi ayrılmış 17 geliştirme sorusunda kontrol ettikten sonra, bir hariç tutulan ısınma ve yeniden denemesiz 243 seri istek çalıştırdık. Hizmet kullanımımız için ayrılmıştı. Her yanıt, girdinin tamamının korunduğunu doğruladı. Sunucu zamanlamaları tokenizasyonu ve senkronize inference'ı içerir. Grafik, SSH ve ağ yükü dahil istemci zamanlamalarını kullanır.

Doğruluk; hizmet ve çıktı hataları dahil olmak üzere, tüm 243 planlanmış soruya bölünen doğru ve geçerli seçimleri esas alır. Ortanca gecikme, geçerli yanıtlar arasında, ısınma hariç, tam akışsız istemci isteğini ölçer. Bildirilen LLM API maliyetleri ölçülen istekleri kapsar. Laya donanım ve Kev kiralama maliyetleri ölçülmedi; Jev'in liste fiyatı tahmini farklı bir muhasebe temelidir. Karşılaştırma, bu özel seçilmiş seti ve bu dağıtım koşullarını tanımlar. Kamu kaynak verileri, açıklama revizyonları, değerlendirici yargısı, farklı ölçüm tarihleri ve tekrarların olmaması genelleştirmeyi sınırlar.

Sınırlamalar

Zor alt küme ticaret üzerine yoğunlaşır. Dört veritabanı, 171 tanesini 184 sorunun içinden sağlar; bu da %92,9 eder. 11 veritabanının beşi hiç katkıda bulunmaz. Bu, bir alan içinde benzer veritabanları arasında seçim yapmaya ilişkin sonuçları destekler; diğer alan kombinasyonları için sınırlı kanıt vardır.

Yedi çalışma, sağlayıcı hatalarından sonra 759 puanlanmış kayıttan daha azını içerir. Beş çalışma ayrıca 184 zor soru kaydından daha azına sahiptir. Tablo paydaları tamamlanan soruları gösterir. Eksik kayıtlar hariç tutulur; bu, atlanan sorular daha zor idiyse modelin lehine olabilir.

Wilson aralıkları, soru düzeyindeki bir modelde örnekleme belirsizliğini kapsar. Tekrar çalışmaları arasındaki değişimi, aynı veritabanından gelen sorular arasındaki bağımlılığı ve harness'in getirdiği belirsizliği atlar. Sağlayıcı değişiklikleri ve araç çağrısı kurtarması da çalışmalar arası karşılaştırmaları sınırlar.

Kamuya açık benchmark verileri model eğitiminde yer almış olabilir. 138 doğrulanmış açımlama ve 65 yeni yazılmış soru kullanan kontroller, test edilen düşük maliyetli model'lerde doğruluk düşüşü bulmadı. Kapsamları sırasıyla altı ve üç veritabanıyla sınırlıydı. Tam panel için kontaminasyonu çözmezler ve hiçbir kontrol, model'lerin eğitim kesme tarihlerinden sonra yayınlanan veritabanlarını kullanmadı.

Şema kesintisi yararlı tabloları gizleyebilir. works_cycles içinde, 4.000 karakter sınırı, 26 tanesini 66 tablodan görünür bırakır. Model daha fazla ayrıntı isteyebilir, ancak ilk görünüm eksiktir.

Sonuç

qwen3.8-max, daha düşük ölçülen çalışma maliyetiyle Fable'ınkine yakın yönlendirme doğruluğu kaydetti. Keşif sırasında Opus ve Grok ilk veritabanı seçimlerinde iyileşti; Nova'nın nihai doğruluğu ise düştü.

Benzer veritabanı adayları, ayrı iki model'li bir deneyde seçimi yaklaşık 20 puan zorlaştırdı. Tekrarlanan çalışmalar da puanları oynattı ve model'ler arasındaki küçük farkların neyi kanıtlayabileceğini sınırladı. Bu sonuçlar, test edilen koşullar altında veritabanı seçimini kapsar; eksiksiz bir belge getirme sisteminin doğruluğunu değil.

İleri okuma

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ekrem Sarı (2026) - "Agentic RAG Benchmark: 11 SQL Veritabanında Yönlendirme". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 25 Eylül 2026, kaynak: https://aimultiple.com/agentic-rag [Çevrimiçi Kaynak]

Sarı, E. (2026, 25 Eylül). Agentic RAG Benchmark: 11 SQL Veritabanında Yönlendirme. AIMultiple. https://aimultiple.com/agentic-rag

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Agentic RAG Benchmark: 11 SQL Veritabanında Yönlendirme}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/agentic-rag}},
  note   = {AIMultiple. Erişim tarihi: 25 Eylül 2026}
}
Tüm verileri indir

365 veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, 6 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 25 Eylül 2026
İndir

Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın

Değişiklik günlüğü

16 güncelleme
  1. 'Bu karşılaştırmada bir soruyu zorlaştıran nedir?' bölümü yeni içerikle güncellendi.

  2. Metodoloji, en zor soruların veritabanları arasında nasıl dağıtıldığını açıklamak için güncellendi.

  3. Agentic RAG kıyaslama metodolojisi bölümü, 36 LLM ve 11 veritabanını kapsayan yeni bir bölümle değiştirildi.

  4. Kıyaslamaya yeni modeller eklendi: Claude Fable 5, Claude Opus 4.8, Gemini 3.5 Flash, Grok 4.3, Claude Opus 4.7.

  5. Veritabanı ortamı, ajan mimarisi ve değerlendirme süreci hakkında yeni detaylarla metodoloji bölümü güncellendi.

  6. Uzun bağlamlı modeller ve aracı RAG hakkında bir bölüm eklendi.

  7. Metodolojiden ek ajans metrikleri kaldırıldı.

Ekrem Sarı
Ekrem Sarı
Yapay Zeka Araştırmacısı
Ekrem, AIMultiple'da Yapay Zeka Araştırmacısı ve Veri Bilimcidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450