Premium
Hizmetler
Premium

Agentic IT: Yapay Zeka Ajanları Bir Benchmark Tasarlayabilir mi?

Berk Kalelioğlu
Berk Kalelioğlu
Güncellenme tarihi: 18 Eyl 2026

16 model'i text-to-SQL ve araç çağırma alanında bir benchmark tasarımında test ettik. Her model konu başına bir benchmark oluşturdu; toplam 32 gönderim oldu. Hiçbir gönderim tüm rubrik ölçütlerini geçemedi. Ajanlar testleri oluşturup çalıştırabildi ancak hiçbiri kendi puanlayıcısına ait hem boş-yanıt testini hem de doğru-yanıt testini gösteremedi.

Benchmark tasarım skorları

Grafik Yükleniyor

Text-to-SQL, sade bir dille yazılmış soruyu bir veritabanı sorgusuna dönüştürür. Araç çağırma, bir fonksiyon seçer ve argümanlarını doldurur.

Her gönderimi, ajanların görmediği bir rubrikle değerlendirdik. Text-to-SQL rubriği 78 puana, araç çağırma rubriği ise 74 puana sahiptir. Skorlar, uygulanabilir rubrik puanlarının yüzdesini gösterir. Çubuk etiketleri tam sayılara yuvarlanmıştır.

  • Text-to-SQL: Claude Opus 5 ve Grok 4,6 %78,2 ile eşit durumda. Rubrik ölçütlerini yeniden örneklediğimizde, sıralamalarının ortadaki %95'i 1st ile 5th arasında değişir.
  • Araç çağırma: GPT 5.6 Sol, %74,3 ile önde. Yeniden örneklenen sıralamalarının ortadaki %95'i 1st ile 4th arasında değişir. Sıralama aralıkları rubrik ölçütlerinin yeniden örneklenmesinden gelir.

16 model'in genelinde, iki konu skoru 0.42 (Pearson) korelasyon gösterir. Ortalama skor, farklı ölçütlere sahip iki rubriği birleştirdiğinden birebir bir karşılaştırma değildir.

Eksik kalite kontrolleri

Hiçbir gönderim bu dört kontrolü geçemedi:

  • Boş-yanıt testi: Boş yanıtlar puanlayıcıdan geçer. Çalışan bir puanlayıcı sıfıra yakın puan vermelidir.
  • Doğru-yanıt testi: Referans yanıtlar tüm çıkarma ve puanlama adımlarından geçer. Çalışan bir puanlayıcı tam puan vermelidir.
  • Eksik-referans testi: Vakalar, veritabanı şeması veya araç tanımları olmadan tekrarlanır.
  • Zorluk hedefi: En güçlü model %40 ile %60 arasında puan almalıdır. 32 gönderimin 30'unda %60 üzerinde puan aldı.

Yirmi gönderim ayrıca en güçlü ile en zayıf model arasında gereken en az 20 puanlık farkı sağlayamadı.

  • Kalibrasyon: İki gönderim kalibrasyon kontrolünü geçti: GLM 5.3 text-to-SQL alanında ve Claude Opus 5 araç çağırmada. Geçmek için, gönderimin zorluk hedefini kaçırdıktan sonra revizyonlarını koruması ve bunları açıklaması gerekiyordu.
  • Tahminler: 32 gönderimin altısı tahmin kontrolünü geçti. Geçmek için en iyi ve en kötü model'leri adlandırmak ve dört skorunun en az ikisini tahmin edilen aralıkların içine yerleştirmek gerekiyordu. Her ajan ayrıca beşinci, dışarıda tutulan bir modelin skor aralığını ve sıralamasını tahmin etti. İki gönderim her ikisini de doğru bildi: Gemini 3.8 Flash ve Grok 4.6, her ikisi de text-to-SQL alanında.
  • Desteklenmeyen iddialar: 32 raporun yirmi ikisi, destekleyici kanıtı olmayan iddialar için jüri panelinin kontrolünden geçemedi.

Maliyet ve süre

Maliyet kayıtları 16 model'i kapsar ve geçen süre kayıtları 15 model'i kapsar. Grafik, her iki kayda sahip 15 model'i kullanır ve süresi kaydedilmediği için Grok 4.6 hariç tutulur.

Maliyetler, kaydedilen yeniden denemeler dahil olmak üzere yazar ajanın konu başına inference maliyetini kapsar. Üretilen benchmark programlarının yaptığı API çağrılarını hariç tutar; bu nedenle bir benchmark oluşturmanın ve çalıştırmanın toplam maliyetini olduğundan düşük gösterir.

Çalıştırmalar farklı ajan programları kullanır ve değiştirme girişimleri içerir. Veriler, daha fazla harcamanın veya daha uzun çalıştırmaların daha yüksek skorlara yol açıp açmadığını gösteremez.

Rubrik ölçütlerini yeniden örnekleyerek elde edilen skor aralıkları ortalama 32.7 puan genişliğindedir. Bu aralıklar, tekrarlanan yazarlık çalıştırmalarının ekleyeceği değişkenliği dışarıda bırakır.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Model'lerin doğru yaptıkları

32 ana gönderimin her sonuç satırı kaydedilmiş bir model yanıtına bağlanır. Her gönderimin puanlayıcısını bu kaydedilmiş yanıtlar üzerinde yeniden çalıştırmak sonuç tablosunu yeniden üretti. Puanlama tekrarlanabilir ancak yeniden üretim, kaydedilmiş yanıtları doğrulamaz.

Örneklenen yanıt dosyalarını ayrı ayrı sildik ve bozduk. 32 puanlayıcının tümü çıktısını değiştirdi ve silinmiş bir yanıtı bozulmuş olandan ayırt etti. Test, her puanlama kuralını denetlemez.

32 raporun yirmi ikisi, desteklenmeyen iddialar için panelin kontrolünden geçemedi.

Sonuçlar agentic IT için ne anlama geliyor

BT operasyonlarında bir yapay zeka ajanı bir sistemin durumunu okur ve üzerinde işlem yapar; örneğin bir yama kurar veya bir hizmeti yeniden başlatır. Ardından ayrı bir kontrol, eylemin çalıştığını doğrulamak zorundadır. Bu benchmark'taki puanlayıcı kontrol testleri, notlandırma için aynı rolü oynar: sonuçları kullanılmadan önce puanlayıcının çalıştığını doğrular. 32 ana gönderimin hiçbiri bu testleri geçemedi.

Bu benchmark, text-to-SQL ve araç çağırmayı kapsar. Yama uygulama, bilet önceliklendirme veya diğer BT görevlerinin bir testi değildir.

BT yönetim araçlarını canlı sistemlerde ayrıca test ediyoruz. Seçilmiş sonuçlar:

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Agentic IT platformları

Bu benchmark'taki 16 model, LLM'lerdir. Aşağıdaki platformlar değildir. Bu tür model'lerin üzerinde yer alır ve BT verileri, iş akışları ve kontroller ekler.

Ajanik bir sistem, gözlemlediği durumdan bir sonraki adımına karar verir; kural tabanlı otomasyon ise önceden belirlenmiş adımları izler. BT ürünleri bu ikisini birleştirir; bu nedenle aşağıdaki her giriş hangi bölümün hangisi olduğunu belirtir.

Creatio

Creatio, bir CRM ve iş akışı platformu içinde yapay zeka ajanları çalıştırır; böylece bir ajan şirketin kendi kayıtları üzerinde işlem yapar, bir sohbet dökümü üzerinde değil.

Model'ler: OpenAI, Azure OpenAI veya LiteLLM kütüphanesi tarafından desteklenen herhangi bir sağlayıcı; buna şirketin kendi sunucularındaki model'ler de dahildir. Her ajan farklı birini kullanabilir.

Ekipler kendi ajanlarını oluşturur: Bir ajan kodda değil, arayüzde tanımlanır: talimatları, ardından yapmaması gerekenler, erişemeyeceği veriler, çağırabileceği beceriler ve bir kayıt üzerinde gerçekleştirebileceği eylemler.

Kodlama ajanları uygulamaları oluşturur: Claude Code, Codex ve GitHub Copilot platforma bir eklenti, ajan becerileri ve MCP araçları aracılığıyla bağlanır ve veri model'leri, sayfalar, iş kuralları ve test verileri oluşturabilir.

ServiceNow

ServiceNow bir BT hizmet yönetimi (ITSM) platformudur.

Model'ler: Ajan orkestrasyonu Azure OpenAI, AWS üzerinde Claude, Google Gemini veya ServiceNow'un kendi modeli olan Now LLM üzerinde çalışabilir.

Eylemden önce onay: ITSM ajanları Now Assist panelinden elle başlatılabilir veya bir kayıt oluşturulduğunda ya da güncellendiğinde otomatik olarak çalışabilir. Yöneticiler hangi eylemlerin bir kişi tarafından onaylanması gerektiğine karar verir.

NinjaOne

NinjaOne; izleme, yama uygulama, yedekleme ve uzaktan erişimi kapsayan bir uç nokta yönetim platformudur.

Model'ler: NinjaOne, yapay zeka özellikleri için bir model seçeneği belgelemez. Bunlar, yöneticinin sağlayıcıyı seçtiği yukarıdaki seçeneklerin aksine platformun bir parçası olarak çalışır.

Topluluk raporlarından puanlanan yama riski: Patch Intelligence AI, satıcı telemetrisini ve diğer yöneticilerin Windows güncelleştirmeleri hakkındaki genel raporlarını inceler; ardından başka yerlerde sistemleri bozan güncelleştirmeleri işaretler ve bağlamı özetler. Bu bölümdeki diğer platformlar bir şirketin kendi kayıtlarını okur; bu özellik ise başka şirketlerde yaşananları okur.

Tarama olmadan CVE tespiti: Güvenlik açığı modülü, NinjaOne'un bulutunda analiz edilen yazılım telemetrisinden CVE'leri belirler; böylece uç noktada tarama çalışmaz ve bulgular düzeltme için yama modülüne iletilir.

Metodoloji

Görev

Her konu için her model aynı sabit prompt'u aldı. Prompt, ajandan şunları istedi:

  • bir iş konusu seç,
  • dört kategoriye yayılmış en az 24 test vakası yaz,
  • bir runner (vakaları model'lere gönderen program) ve bir puanlayıcı (yanıtları notlandıran program) yaz,
  • her vakada dört adlandırılmış modeli iki kez çalıştır.

Beşinci bir model dışarıda tutuldu. Ajan önce sonuçlarını tahmin etti, ardından test etti.

Prompt, her ajandan bir benchmark'ın yayınlanmadan önce hangi kalite standartlarına ihtiyaç duyduğuna karar vermesini ve bunları karşıladığını göstermesini istedi. Prompt, sayısal zorluk hedefini belirtmedi ve herhangi bir puanlayıcı testini adlandırmadı.

Ajanlar ve gönderimler

Gönderimler Temmuz ile Eylül 2026 arasında çalıştırıldı. Çoğu, model'e bir kabuk ve dosya sistemi sağlayan bir ajan programı olan opencode'u kullandı.

Önceki sürüm 14 model'i ve 28 gönderimi kapsıyordu. Geçmiş verilerimiz ayrıca artık listede olmayan yedi eski model'i de içeriyor.

Ayrıca GPT 5.5 için beş pilot kurulum çalıştırdık ve bu da 10 ek gönderimle sonuçlandı. Bunların prompt'ları ana görevden farklıdır; bu nedenle grafikler bunları hariç tutar. Toplamda bu güncelleme 42 gönderimi içerir ve 40 gönderimi puanlar. İki pilot gönderimi minimum dataset boyutunu karşılamadığı için jüri paneli bunları notlandırmadı.

Notlandırma

Kod, gönderilen dosyaları denetler, veritabanlarını yeniden oluşturur, puanlayıcıları yeniden çalıştırır ve sonuç satırlarını yanıt dosyalarıyla eşleştirir. Yorumlama gerektiren ölçütleri bir model paneli notlandırır. Gönderilen kod, ağ erişimi olmayan yalıtılmış bir kopyada çalışır.

Çalıştırıcılar farklı arayüzlere sahip olduğu ve bazıları kullanılabilir sağlayıcı yapılandırmalarından yoksun olduğu için her gönderim için örneklenen model çağrılarının canlı olarak yeniden yürütülmesini hariç tutuyoruz. Bu ölçüt olmadan rubrikler text-to-SQL için 78 puan ve araç çağırma için 74 puandır.

Grafiklerdeki 32 gönderimin tümü gerekli dosya ve dataset boyutu kontrollerinden geçer. Bu güncelleme için görev prompt'ları düzenlenmemiştir ve sonuçlarda her model ve konu için saklanan bir gönderim kullanılır.

Puanlayıcı kontrol testleri

Eksik-referans testi, model'lerin ihtiyaç duymaları gereken bilgiler olmadan yanıt verip veremeyeceğini denetler. Hâlâ iyi puan alıyorlarsa sorular yanıtı açığa çıkarıyor olabilir veya model'ler eğitim sırasında veriyi görmüş olabilir. Tek başına yüksek bir skor ikisinin de kanıtı değildir.

Bir pilot prompt'u üç puanlayıcı testinin tümünü adlandırdı ve bu pilot bunları her iki konuda çalıştırdı. Kaydedilmiş test dosyalarını ağ erişimi olmadan yeniden çalıştırmak kaydedilen sayıları yeniden üretti.

32 ana gönderimin prompt'ları bu testleri ajana bıraktı ve bu gönderimlerin hiçbiri üçünden hiçbirini geçemedi. Çalışmadaki tek bir prompt testleri adlandırdı; bu nedenle bunların model'ler üzerindeki etkisi test edilmemiş durumda.

Jüri paneli

GPT 5.6 Sol ve Claude Opus 5 panele gönderilen her ölçütü notlandırır. Anlaşamadıklarında belirleyici oyu Grok 4.6 kullanır.

Jüriler sıcaklık 0 (en az rastgelelik ayarı) değerinde, yüksek akıl yürütme çabasıyla ve 32.000 token sınırıyla çalışır. Bir jüri eksik veya geçersiz JSON döndürürse hiçbir karar kaydedilmez ve çağrı yeniden denenir.

Pilotlar dahil 672 ölçütün genelinde iki ana jüri 195 ölçütte anlaşamadı. Sol %54,8 ile, Opus ise %82,6 ile geçti. Grok tartışmalı ölçütlerin 133'ünü geçti.

Jürilerin sağlayıcıları da bu benchmark'ta gönderimleri notlandırdı: OpenAI'den dört, Anthropic'ten dört ve xAI'den bir. Jüri prompt'ları yazar adlarını dışarıda bırakır ve bir modeli tanımlayabilecek dosya yollarını kaldırır. Yazım stili yine de yazarı ele verebilir.

OpenAI ve Anthropic dışındaki sağlayıcılardan gelen gönderimlerde Sol, Opus'un 13.9 puan altında puan alır. OpenAI gönderimlerinde fark 9.1 puandı; yani 4.8 puan daha küçüktü. Anthropic tarafından yazılan gönderimlerde Opus'un Sol'a karşı üstünlüğü, diğer sağlayıcıların çalışmalarına kıyasla 0.1 puan daha küçüktür. Pilot prompt'ları farklıdır; bu nedenle denetim kayırmacılığı kanıtlamaz. Grok yalnızca anlaşmazlıkları yargılar, kendi gönderimlerine ilişkin anlaşmazlıklar dahil ve oyları bu denetimin dışındadır.

Aralıklar

Skor aralıkları ve sıralama konumlarının ortadaki %95'i, rubrik ölçütlerinin geri koymalı 4.000 eşleştirilmiş çekimini kullanır. Her gönderim, kendi konusundaki diğerleriyle aynı çekilen ölçütlerle yeniden puanlanır. Aralıklar rubriğe bağımlılığı tanımlar ve görev örneklemesi ile çalıştırmadan çalıştırmaya belirsizliği hariç tutar. Korelasyonlar Pearson'dır.

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Berk Kalelioğlu and Şevval Alper (2026) - "Agentic IT: Yapay Zeka Ajanları Bir Benchmark Tasarlayabilir mi?". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 18 Eylül 2026, kaynak: https://aimultiple.com/agentic-it [Çevrimiçi Kaynak]

Kalelioğlu, B., & Alper, Ş. (2026, 18 Eylül). Agentic IT: Yapay Zeka Ajanları Bir Benchmark Tasarlayabilir mi? AIMultiple. https://aimultiple.com/agentic-it

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk and Alper, Şevval},
  title  = {{Agentic IT: Yapay Zeka Ajanları Bir Benchmark Tasarlayabilir mi?}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/agentic-it}},
  note   = {AIMultiple. Erişim tarihi: 18 Eylül 2026}
}
Tüm verileri indir

21 veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, 2 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 19 Eylül 2026
İndir

Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın

Berk Kalelioğlu
Berk Kalelioğlu
Yapay Zeka Araştırmacısı
Berk, AIMultiple'ın benchmark ekibinde Yapay Zeka Araştırmacısıdır; etmen tabanlı yapay zeka, makine öğrenimi ve büyük ve küçük dil modelleri (LLM'ler ve SLM'ler) üzerine odaklanmaktadır.
Tam Profili Görüntüle
Teknik olarak inceleyen
Şevval Alper
Şevval Alper
Yapay Zeka Araştırmacısı
Şevval, AIMultiple'da bir yapay zeka araştırmacısıdır. Kaotik sistemler kullanarak sözde rastgele sayı üretimi konusunda daha önce araştırma deneyimine sahiptir.
Şevval, yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojilerine odaklanmaktadır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450