Son araştırmalar, YZ performansının öngörülebilir üstel azalma örüntülerini izlediğini ve işletmelerin yetenekleri tahmin etmelerini ve maliyetli başarısızlıklarla başarılı ROI-getirili uygulamalar arasında ayrım yapmalarını sağladığını ortaya koyuyor.
Neredeyse 70 YZ ajanını 1.000'den fazla görevde kapsayan, 12 AIMultiple kıyaslamasını yönettim. Her kıyaslamanın neyi ölçtüğünü ve sınırların nerede kaldığını görün:
Web etkileşimi ve tarayıcı tabanlı ajanlar
Bilgisayar kullanım ajanları
Bilgisayar kullanım ajanları, bir ekranla bir insanın yaptığı gibi etkileşime girer: tıklama, yazma, kaydırma ve veri çıkarma. Kıyaslama, her modeli görev türleri arasında doğruluk açısından puanladı; görev tamamlama (örneğin form doldurma, hizmet rezervasyonu), gezinme doğruluğu ve tamamlama süresini ölçtü.
Kıyaslamaların ölçtüğü:
- Görev tamamlama oranı (örneğin form doldurma, hizmet rezervasyonu)
- Gezinme doğruluğu
- Görevleri tamamlama süresi
Sonuçlar: Bu ajanlar basit görevleri yerine getirir ancak karmaşık, dinamik ekranlarla hâlâ zorlanır. Ekranı doğru görmek, planlama veya karar vermeden daha fazla, en büyük zorluk olmaya devam ediyor ve küçük kullanıcı arayüzü değişiklikleri iş akışlarını bozabiliyor, bu da güvenilirliği temel açık sorun haline getiriyor.
Burada model seçimi sonuçlara hâkimdir ve alan ilk iki (yaklaşık %90) ile geri kalanlar ( %45'in altı) arasında keskin bir şekilde bölünmüştür. 8B modeli 32B'ye neredeyse yetişir, bu nedenle yetenek boyutun bir fonksiyonu değildir. Sınırlayıcı faktör planlamadan ziyade görsel algıdır, bu da küçük kullanıcı arayüzü değişikliklerinin hâlâ çalışan akışları bozmasının nedenidir.
Daha fazlası için Bilgisayar Kullanım Ajanları: Kıyaslama ve Mimari başlığını okuyun.
Uzak tarayıcı ajanları
Uzak tarayıcı ajanları, kontrollü, barındırılan bir ortamda web sayfalarıyla etkileşime girer. Her ajan, görev tamamlama oranı, gecikme ve oturumlar arası kararlılık üzerinden puanlanan dört görev çalıştırdı ve ortalama başarı oranı olarak raporlandı.
Ölçülen:
- Görev tamamlama oranı (örneğin form doldurma, sayfalar arasında gezinme)
- Gecikme (yanıt süresi)
- Kararlılık (oturumlar arası başarısızlık oranı)
Sonuçlar: Bu ajanlar tekrarlayan, kural tabanlı görevlerde yüksek başarı oranlarına ulaşır. Sayfa düzenleri değiştiğinde veya dinamik öğeler göründüğünde başarısızlıklar meydana gelir ve işleme ile etkileşim katmanları nedeniyle gecikme daha yüksektir. Otomasyon görevlerine uygundurlar ancak arayüz değişikliklerine karşı hassastırlar.
Kararlı akışlar için yüksek başarı oranları geçerlidir; düzenler değiştiğinde veya dinamik öğeler yüklendiğinde güvenilirlik düşer. Bu ajanlar bir işleme ve etkileşim katmanı eklediğinden, gecikme yapısal olarak doğrudan API yaklaşımlarından daha yüksektir. Pratik seçim kriteri, zirve başarı oranı değil, arayüz değişikliği altındaki kararlılıktır.
Daha fazla bilgi için Uzak Tarayıcılar: YZ Ajanları için Web Altyapısı Karşılaştırması başlığını okuyun.
Tarayıcı MCP (Model bağlam protokolü)
Tarayıcı MCP, ajanların yapılandırılmış arayüzler aracılığıyla harici araçlara ve veri kaynaklarına nasıl bağlandığını ölçer. Dokuz MCP sunucusu, web arama ve çıkarma, tarayıcı otomasyonu ve 250 ajanlı eşzamanlı yük testi üzerinden test edildi ve her görev araç başına beş kez çalıştırıldı.
Sonuçlar: Bright Data genel olarak liderdir (ancak sponsordur) ve Firecrawl en hızlıdır. Hız ile başarı oranı arasında negatif bir ilişki vardır: daha hızlı araçlar daha sık başarısız olma eğilimindedir, genellikle daha yavaş araçların kullandığı engelleme karşıtı teknolojiyi atladıkları için. Tek bir araç her şeyde mükemmel değildir.
Başlık örüntüsü bir hız–güvenilirlik ödünleşimidir: en hızlı araçlar engelleme karşıtı önlemleri atladıkları için daha fazla başarısız olur. Hem web arama/çıkarma hem de tarayıcı otomasyonunda hiçbir sunucu en iyisi değildir, bu nedenle doğru seçim baskın iş yüküne bağlıdır.
Kıyaslama hakkında daha fazla bilgi için MCP Kıyaslaması: Web Erişimi için En İyi MCP Sunucuları başlığını okuyun.
Arama ve bilgi getirimi
YZ arama motorları
YZ arama kıyaslamaları, ajanların bilgileri ne kadar iyi getirip özetlediğini değerlendirir.
Temel metrikler şunları içerir:
- Yanıt doğruluğu
- Kaynak temellendirme (yanıtları kanıtlara bağlama)
- Halüsinasyon oranı (yanlış veya uydurma içerik)
Sonuçlar: Ajanlar basit sorgularda iyi performans gösterir. Performans, karmaşık veya çok kaynaklı sorularda düşer.
Daha fazla bilgi için YZ Arama Motorları Karşılaştırması başlığını okuyun.
Ajanik arama
YZ arama motorları, bir sorguya yanıt olarak bilgileri getirir ve özetler. Kaynak temellendirme ve halüsinasyon oranının yanı sıra doğru sağlanan verilerin payı üzerinden puanlandılar.
Sonuçlar: Ajanlar basit sorgularda iyi performans gösterir, ancak performans karmaşık veya çok kaynaklı sorularda düşer.
En güçlü motor bile zamanın %57'sinde doğru veri döndürür ve geri kalanı yüksek 30'lar'da kümelenir, bu nedenle hiçbiri yüksek riskli olgusal getirim için güvenilir değildir. Performans basit aramalarda korunur ancak karmaşık, çok kaynaklı sorularda düşer. Çıktıları doğrulama gerektiren başlangıç noktaları olarak değerlendirin.
Ajanik arama kıyaslaması hakkında daha fazla bilgi için Ajanik Arama: Ajanlar için 8 Arama API'sini Kıyaslama başlığını okuyun.
Derin araştırma ajanları
Derin araştırma ajanları, bir insanın arama yapmasına gerek kalmadan otomatik olarak web'de arama yapar, birden fazla sayfayı okur ve tam, yapılandırılmış bir rapor yazar. Kıyaslama, farklı araçlar arasında üç ayrı test çalıştırdı ve rapor doğruluğunu gecikme ve maliyete karşı ölçtü. Test edilen araçlar arasında o3, o4-mini, perplexity-sonar ve parallel-ultra yer aldı.
Sonuçlar: Daha fazla arama, daha fazla kelime ve daha yüksek maliyetler daha iyi doğruluğa dönüşmedi. Doğrudan birincil kaynaklara giden ve onları dikkatle okuyan araçlar, geniş çapta arama yapan ancak daha az kesin bilgi çıkaranlardan daha iyi performans gösterdi.
Rapor uzunluğu ve arama hacmi kalite için proxy değildir. En iyi performansı gösteren araçlar, geniş çapta arama yapıp gevşek bilgi çıkarmak yerine daha az kaynağı dikkatle okudu ve maliyet doğruluktan tamamen ayrıştırılabilir.
Daha fazla bilgi için YZ Derin Araştırma başlığını okuyun.
Web tabanlı ajanlar
Açık kaynaklı web ajanları şeffaflık ve esneklik sunar ve kıyaslamalar genellikle onları özel sistemlerle karşılaştırır. 30'dan fazla açık kaynaklı ajan WebVoyager kıyaslamasıyla test edildi — 15 gerçek web sitesinde (Google, GitHub, Wikipedia, Booking.com ve Amazon dahil) 643 görev; form doldurma, çok sayfalı gezinme, arama, açılır menüler ve tarih seçimini kapsıyor.
Sonuçlar: Açık kaynaklı ajanlar dar görevlerde iyi performans gösterir ve Browser-Use ile Skyvern başı çeker. Test koşulları farklı olduğundan puanlar doğrudan karşılaştırılabilir değildir ve bu araçların hiçbiri bot koruması olan gerçek dünya ortamlarında tamamen güvenilir değildir.
Açık kaynaklı ajanlar artık dar kıyaslama görevlerinde rekabetçidir, ancak puanlar çapraz karşılaştırılabilir değildir ve hiçbiri gerçek dünya bot korumasına karşı dayanıklı değildir. Kontrollü dahili otomasyona uygundurlar, güvenilir açık web operasyonuna değil.
Açık kaynaklı web ajanları kıyaslaması hakkında daha fazla bilgi için Açık Kaynaklı Web Ajanları başlığını okuyun.
Mobil YZ ajanları
Mobil ajanlar akıllı telefonlarda çalışır; mesajlaşma, planlama ve uygulama gezinmesi gibi görevleri yerine getirir. Dört ajan — DroidRun, Mobile-Agent, AutoDroid ve AppAgent — bir Android emülatöründe 65 gerçek dünya görevi çalıştırdı (kişi ekleme, takvim yönetme, ses kaydetme, fotoğraf çekme, dosya yönetimi); hepsi aynı modeli (Claude Sonnet 4.5) kullandı ve başarı oranı ile başarılı görev başına maliyet üzerinden puanlandı.
Sonuçlar: Hiçbir ajan tam otomasyon için yeterince iyi performans göstermedi. En iyi araç olan DroidRun bile zamanın %3'ünde başarılı oldu. Mobil ortamlar daha az öngörülebilirdir ve entegrasyon sınırlıdır; çoğu ajan gecikme ekleyen bulut işlemeye dayanır.
Bu kategori hâlâ üretim öncesidir; lider bile çoğu görevi başaramaz. Her ajan aynı model üzerinde çalıştığı için, performans farkı altta yatan LLM'den ziyade ajan iskelesini yansıtır ve bir sonraki iyileştirmelerin buradan gelmesi gerekecektir.
Daha fazla bilgi için Gerçek Dünya Görevlerinde Test Edilen Mobil YZ Ajanları başlığını okuyun.
Finansal YZ ajanları
YZ finans ajanları
Finansta ajanik YZ, piyasa analizi, raporlama ve karar desteği gibi görevleri kapsar. Kıyaslama; FinRobot, FinGPT ve FinRL'yi finans teorisi soruları ve analiz, veri yorumlama ile risk tanımlamayı kapsayan uygulamalı, hesaplama ağırlıklı görevler üzerinde puanladı.
Sonuçlar: Her üç araç da finans teorisinde eşit puan alır (her biri 88). Farklar, FinGPT'nin lider olduğu, FinRobot'un ortada yer aldığı ve FinRL'nin geride kaldığı uygulamalı, hesaplama ağırlıklı görevlerde ortaya çıkar. FinRL, gerçek finansal iş akışları için henüz güvenilir değildir.
Finans teorisi bilgisi etkin bir şekilde metalaşmıştır, bu nedenle farklılaştırıcı uygulamalı görevlerdeki yürütmedir. Alıcılar için çıkarım, uygulamalı görev performansını bilgi kıyaslamalarına ağırlıklandırmak ve FinRL'yi henüz üretime hazır olarak görmemektir.
Daha fazla bilgi için Ajanik YZ Finans Kıyaslaması başlığını okuyun.
YZ Excel araçları
YZ elektronik tablo ajanları, kullanıcıların verileri analiz etmesine, formüller oluşturmasına, raporlar üretmesine ve tekrarlayan elektronik tablo işlerini otomatikleştirmesine yardımcı olur. AIMultiple, lider YZ Excel araçlarını formül oluşturma, veri analizi, görselleştirme ve elektronik tablo otomasyonu görevlerinde kıyasladı; hem doğruluğu hem de gerçek dünya elektronik tablo iş akışlarındaki pratik kullanılabilirliği değerlendirdi.
Sonuçlar: Performans, görev türleri arasında önemli ölçüdeğişti. Çoğu araç basit formül oluşturma ve temel analizi iyi yönetti, ancak doğruluk çok adımlı hesaplamalarda, karmaşık elektronik tablo mantığında ve çalışma kitabı yapısının ayrıntılı anlaşılmasını gerektiren görevlerde düştü. En güçlü performans gösterenler, elektronik tablo farkındalığını güçlü akıl yürütme yetenekleriyle birleştirirken, daha zayıf araçlar genellikle yanlış formüller veya eksik analizler üretti.
Elektronik tablo ajanları rutin analiz ve rapor hazırlama için etkilidir ancak gözetim olmadan karmaşık finansal modelleme için güvenilmez kalır. Birincil zorluk formül oluşturmak değil, çalışma kitabı bağlamını ve bağımlılıklarını doğru anlamaktır; bu da yüksek riskli finansal iş akışları için insan doğrulamasını gerekli kılar.
Geliştirici odaklı ajanlar (CLI ve LLM ajanları)
Ajanik CLI (Command line interface)
CLI ajanları, geliştiricilere doğrudan kodlama ortamlarında yardımcı olur. Araçlar, arka uç ve kullanıcı arayüzü çalışmalarını birleştiren genel bir endeks üzerinden puanlandı; kod üretme doğruluğu, hata ayıklama başarısı ve komut yürütme güvenilirliğini kapsadı.
Sonuçlar: Daha yüksek token kullanımı ve daha yavaş hız, daha iyi sonuçları garanti etmedi. opencode genel olarak liderdi (81,6), grok-build (80,3) ve claude-code'dan (78,9) az farkla öndeydi; codex ise alanın sonlarına yakın yer aldı (66,5). Hiçbir araç her görevi tamamen geçemedi.
En iyi araçlar birbirinden birkaç puan içinde kümelenir, bu nedenle lider uçtaki farklar marjinaldir ve pratikte belirleyici olması olası değildir. Hiçbir araç her görevi geçemediği için, hangisini seçerseniz seçin çıktı doğrulaması gerekli kalır.
Bu kıyaslama hakkında daha fazla bilgi için A-CODE-CLI Bench: Ajanik CLI Kıyaslaması başlığını okuyun.
Ajanik LLM sistemleri
Bu kıyaslamalar, dil modellerinin araçlar ve hedefler verildiğinde ajan olarak nasıl davrandığına odaklanır. Her model, araç seçimi doğruluğunu ve planlama yeteneğini yansıtan, arka uç ve ön uç görevlerini birleştiren genel bir başarı oranı üzerinden puanlandı.
Sonuçlar: Hiçbir model her görevi doğru tamamlamadı. En iyi modeller (Claude Sonnet 4.5 ve GPT-5.2) çoğu görevi iyi yönetti ancak karmaşık mantığı ele alma becerilerinde hâlâ boşluklar vardı. Maliyet her zaman performansla eşleşmedi. Claude Opus 4.6 en pahalıydı ancak tablonun ortasında yer aldı.
En iyi modeller bile görevlerin önemli bir kısmını tamamlanmamış bırakır, bu nedenle ajanik güvenilirlik hâlâ tam görev tamamlamanın oldukça altında zirve yapar. Maliyet yeteneği öngörmez ve en yeni modeller otomatik olarak en güçlüler değildir, çünkü daha eski bir Sonnet sürümü setin lideridir.
Bu kıyaslama hakkında daha fazla bilgi için A-CODE-LLM Bench: Ajanik Kodlama Kıyaslaması başlığını okuyun.
YZ ajan performansı hakkında genel çıkarımlar
Üç tutarlı örüntü ortaya çıkar:
- Ajanlar yapılandırılmış ortamlarda en iyi performansı gösterir
- Performans, görev karmaşıklığıyla birlikte düşer
- Yüksek riskli görevlerde insan gözetimi gerekli kalır
Başarılı YZ ajanları uygulamak için en iyi uygulamalar
YZ ajanlarını başarılı bir şekilde uygulamak, iddialı hedefleri gerçekçi beklentilerle dengeleyen stratejik bir yaklaşım gerektirir. Doğruluğun yanı sıra, modern ajanların karmaşık gerçek dünya senaryolarında ve dinamik konuşmalarda anlamlı katkılar yapma becerileri üzerinden değerlendirilmesi gerekir.
1. Değerlendirme ve temel belirleme
Ajanınızın yeteneklerini değerlendirmek, dağıtım için gereklidir. Bu, görevleri karmaşıklık ve değere göre eşleştirerek temel kullanım durumlarını belirlemeyi içerir. Değerlendirme; başarı oranı, yanıt süresi ve davranış tutarlılığına odaklanır. Ajanın, performansın %50'ye düştüğü yarı ömrünü bulmak için pilot testler yapın. Bu veriler, beklentileri belirlemeye ve dağıtım kararlarını yönlendirmeye yardımcı olur.
2. Stratejik dağıtım ve optimizasyon
Akıllı görev ayrıştırma, daha kısa görevlerin üstel faydalarını en üst düzeye çıkarmak için stratejik dağıtımı sağlar. Karmaşık prosedürler yönetilebilir parçalara bölündüğünde, ajanlar optimal performans bölgelerinde işlev görürken yüksek doğruluk seviyelerini koruyabilir. Temel dağıtım stratejileri şunları içerir:
- Hibrit iş akışları, yüksek olasılıklı görevler için insan gözetimini YZ ile birleştirir.
- Sürekli izleme sistemleri, performans sorunlarını belirlemek ve stratejileri gerçek zamanlı olarak uyarlamak için izleme yetenekleriyle donatılmıştır.
- Çoklu ajan mimarileri, çeşitli görev karmaşıklıkları için akıllı devir mekanizmalarına sahip özelleşmiş ajanlar içerir.
3. Uygulama zorluklarının üstesinden gelme
En yaygın sorunlar, yetersiz değişiklik yönetimi ve ölçümden kaynaklanır. Duygu analizini ve genel etkinliği değerlendirmek için kuruluşların, farklı zaman dilimlerinde performansı izleyen ve kullanıcı geri bildirimi toplayan kapsamlı izleme ile başlaması gerekir. Temel başarı faktörleri şunları içerir:
- Hata kurtarma mekanizmaları, alt görev başarısızlıklarını ele alabilir ve daha uzun süreçler için kontrol noktası sistemleri uygulayabilir
- Performans optimizasyonu, API maliyetleri, token kullanımı ve çıkarım hızları gibi maliyet-verimlilik metriklerini önceliklendirmelidir.
- DSPy gibi çerçeveler gibi gelişmiş optimizasyon tekniklerinin kullanılması, maliyetleri minimumda tutarken az örnekli örnekleri optimize etmeye yardımcı olur.
4. Modern değerlendirme stratejilerinin uygulanması
Geleneksel kıyaslamaların ötesine geçmek, gerçek dünya koşullarını simüle eden değerlendirme yöntemlerini gerektirir. Modern stratejiler; üretken YZ becerilerini, dinamik diyalogları ve ajanın problem çözme mantığını dikkate almalıdır.
büyük dil modellerini yargıç olarak kullanan otomatik değerlendirme sistemleri, doğruluk ve verimlilik arasında bir denge kurarak sürekli iyileştirmeyi teşvik eder. Bu bütünsel yaklaşım, YZ ajanlarının gelişen ihtiyaçlara uyum sağlarken ve kullanıcılara gerçek değer sunarken doğru yanıtlar vermesini sağlar.
SSS'ler
Sağlam değerlendirme için gerekli üç temel metrik; görev tamamlama doğruluğu, yanıt süresi verimliliği ve farklı görevler arasında ajan davranış tutarlılığını içerir. Ajanları değerlendirirken, optimize edilmiş API çağrıları ve kaynak kullanımı yoluyla maliyet tasarrufu sağlarken doğru yanıtlar verme becerilerine odaklanın. Çok yönlü bir bakış, YZ sistemlerinin karmaşık görevleri yönetebilmesini ve üretim ortamlarında gerçek değer sağlayabilmesini garantilemek için çeşitli test senaryolarında performansı değerlendirmeyi gerektirir.
Ajan değerlendirmesi, ajanın gerçek dünya görevlerini kabul edilebilir zaman dilimlerinde tamamlama yeteneğini izleyen değerlendirme yöntemleri kullanarak temel ölçümler oluşturmakla başlamalıdır. Bu devam eden süreç, hata oranı, karar verme kalitesi ve genel verimliliği izlerken farklı senaryolarda değerlendirme çalıştırmaları yapmayı içerir. Anahtar, gelecekteki optimizasyon stratejilerini bilgilendirecek temel verileri ve içgörüleri toplamak için ilk günden itibaren kapsamlı izlemeyi uygulamaktır.
Yaygın zorluklar arasında, ajanın karmaşık senaryolardaki yeteneklerini abartmak ve gerçek dünya uygulamalarındaki sorunları ele almayı başaramayan yetersiz ölçüm çerçeveleri yer alır. Kuruluşlar genellikle değerlendirme için doğru aracı seçmekte ve YZ modellerinin doğruluğu korurken dinamik durumlara uyum sağlayabilmesini garantilemekte zorlanır. Başarı, ajan operasyonlarının farklı yönlerinde gerçek performansı yansıtan değerlendirme sonuçları oluşturmak için insan gözetimiyle birlikte LLM'yi yargıç olarak kullanma yaklaşımlarını uygulamayı gerektirir.
Sorumlu YZ uygulaması, duygu analizi yoluyla ajan davranışının sürekli izlenmesini ve birden fazla değerlendirme çalıştırmasında performans takibini gerektirir. Odak noktası, kritik karar verme için insan gözetimini korurken otomatik araçlar kullanarak kendilerini değerlendirebilen sistemler oluşturmak olmalıdır. Bu yaklaşım, ajanların açık uçlu çıktıları etkili bir şekilde yönetmesini, gerçek değer gösteren tutarlı sonuçlar sunmasını ve ölçülebilir maliyet tasarrufu ile verimlilik kazanımları aracılığıyla iş hedeflerini desteklemesini sağlar.
Ek okumalar
- LLM Fiyatlandırması
- YZ Halüsinasyonu
- YZ Gateway'ler
- YZ Ajan Tuzakları
- YZ Ajan Güvenlik Açığı
- YZ Ajan Yayılımı İşaretleri ve Yayılımı Yönetmek için Kontrol Listesi
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem and PhD., Ezgi Arslan,},
title = {{YZ Ajan Performansı: Başarı Oranları ve ROI}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/ai-agent-performance}},
note = {AIMultiple. Erişim tarihi: 23 Haziran 2026}
}Cem'in çalışmaları Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır.
Cem, kariyeri boyunca teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yapmıştır. On yıldan fazla bir süre McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yapmıştır. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımlamıştır.
CEO'ya rapor verirken bir telekomünikasyon şirketinin teknoloji stratejisini ve satın alımını yönetmiştir. Ayrıca, 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetmiştir. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alınmıştır.
Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun olmuş ve Columbia Business School'dan MBA derecesine sahiptir.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.