Premium
Hizmetler
Premium

AI VC Benchmark: 16 Yapay Zekâ Ajanı Müşteri Tespitinde

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Güncellenme tarihi: 10 Eyl 2026

Müşteri tespiti ticari durum tespitinin bir parçasıdır. Üç araştırma ve inceleme sitesi için müşteri listesi araştırmasında 16 modeli test ettik; bunlardan biri AIMultiple olup gönderimlerini derlediğimiz cevap anahtarlarına ve atıf yaptıkları sayfalara göre puanladık.

Müşteri tespiti kıyaslama sonuçları

Grafik Yükleniyor

Hiçbir model için akıl yürütme çabası ayarlamadık. Her biri kendi ajan programının varsayılanında çalıştı ve puanlama modeli sıcaklık 0'da çağrıldı.

  • Fable 5.1 90.2 puan alıyor; bu, 16 modelin en yüksek ortalamasıdır. Opus 5 89.1 ile izliyor ve GLM 5.3 81.0 ile.
  • GLM 5.3 üç hedefin tamamında 79.6 ile 83.3 arasında puan aldı. Claude Sonnet 5 birinde 90.8, diğerinde 0.0 puan aldı ve Gemini 3.8 Flash 87.0 ve 9.2 puan aldı. 48.0 ve 60.7 ortalamaları, iki modelin de çalışmalarını tanımlamıyor.

Hedef zorluğu

Medyan puanlar ilk hedefte 64.3, ikincide 59.2 ve üçüncüde 87.0'dır. 16 modelin on tanesi üçüncü hedefte en az 84 puan alıyor; bu hedefin cevap anahtarında 18 müşteri var, dolayısıyla doğru bir müşteri, puanın yarısını taşıyan 5.6 kapsam puanı (toplam 100) değerindedir.

Her modelin puanı üç hedefin ortalamasıdır. Puanları gördükten sonra kolay bir hedefi çıkarmak karşılaştırmayı yanlı hale getirir. Bir sonraki turda daha zor hedef şirketlere ihtiyaç var.

Maliyet ve puan karşılaştırması

  • Fable 5.1 ortalama 90.2 puanı, görev başına $4,38 maliyetle alıyor. Opus 5 ortalama 89.1 puanı, görev başına $8,51 maliyetle alıyor; bu, dolar cinsinden rakamı olan 15 model içindeki en yüksek maliyettir. GLM 5.3 ortalama 81.0 puanı, görev başına $1,40 maliyetle alıyor.
  • Grok 4.6 ortalama 80.5 puanı, görev başına $0,42 maliyetle alıyor; bu, Opus 5'in 8.6 daha az puan için maliyetinin yirmide biridir.
  • GPT 6 Astra ortalama 74.2 puan alıyor. Üç abonelik görevi 279.253 token kullandı ve Codex CLI dolar maliyeti kaydetmediği için maliyet grafiği onu hariç tutuyor.

Müşteri listesi çalışması yapay zekâ ajanlarını neden test eder?

Bir müşteri listesi, bir ad ve ticari ilişkinin kanıtını gerektirir. Makul görünen bir liste yine de yalnızca ürünleri karşılaştıran sayfalara atıf yapabilir.

Kamuya açık kaynaklar tek bir müşteri ilişkisini doğrulayabilir. Bu kıyaslama, bir listenin eksiksiz olup olmadığını test etmez.

Gerçek bir müşteri cevap anahtarında bulunmayabilir. Atıf yapılan sayfa ilişkiyi doğruladığında gönderim bu müşteri için kredi kazanır; desteklenmeyen fazladan bir şirket için ise kapsam puanı kaybeder.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Metodoloji

Model kapsamı

Puan grafiği, bu kıyaslama kampanyası için seçilen 16 modeli kullanıyor. Yerini yenilere bırakan beş model geçmiş verilerde kalıyor ve grafiğe dahil edilmiyor. Puanlar 0 ile 100 arasında değişiyor ve çubuk etiketleri tam puanlara yuvarlanıyor.

agentic IT kıyaslaması farklı bir ölçek kullanıyor, bu nedenle puanları karşılaştırılamaz.

Görevler ve gönderimler

İlk hedef, bu kıyaslamanın yayıncısı olan AIMultiple'dir ve cevap anahtarı bir AIMultiple analisti tarafından derlenmiştir. İkinci hedef bir yazılım inceleme sitesi, üçüncü hedef ise bir analist araştırma şirketidir.

Üç cevap anahtarı 45, 65 ve 18 müşteri içeriyor ve test edilen modellerden gizli tutuldu. Çalışma 48 model-şirket atamasını ve 47 boş olmayan müşteri listesini kapsıyor; Inkling Small ikinci şirkette hiç müşteri satırı üretmedi ve orada sıfır puan aldı.

Her puan, şirket başına bir gönderim kullanır. Gönderimler Temmuz'dan Eylül'e kadar uzanır ve bazıları daha önceki denemelerin yerini alır.

Üç hedefi, yerine koymalı tüm 27 sıralı çekiliş boyunca yeniden ağırlıklandırmak, ortalamaların orta %95'ini Fable 5.1 için 86.0-94.8 ve Opus 5 için 82.4-96.1 yapar; bu nedenle Fable 5.1'in aralığı Opus 5'inkinin içinde kalır. Yalnızca bu üç hedefi yeniden ağırlıklandırdık ve çalışmadan çalışmaya değişimi ölçmedik.

Maliyetler ve yürütme

Görev başına maliyet, bir modelin üç çalışmasının ortalamasıdır; hiç müşteri satırı üretmeyen çalışma da buna dahildir. Bir görev, bir hedef şirkettir. Dolar maliyetleri 15 modelin verisini kapsar, toplam model sayısı 16'dır; geçen süre verileri 13 modeli kapsar.

Dolar rakamlarının tamamı aynı şekilde ölçülmüyor. opencode üzerindeki çalışmalar, o oturum için OpenRouter ücretini taşır. Claude Code ve Grok Build üzerindeki çalışmalar bir aboneliğe göre kimlik doğrular; bu nedenle rakamları, programın bildirdiği token'lara uygulanan liste fiyatlarıdır. Codex CLI dolar maliyeti kaydetmez.

Her model, şirketi adlandıran ve şirket adları, LinkedIn URL'leri, kanıt URL'leri ve kanıt tarihleri içeren bir CSV talep eden dondurulmuş bir prompt aldı. Grok Build yerel web aramasını kullandı; diğer ajan programları web'e, karşılaştırdığımız web scraping araçlarından biri olan Bright Data üzerinden erişti.

Bir ajan programı, modele bir kabuk ve web erişimi sağlar; bu nedenle puan hem modeli hem de içinde çalıştığı programı yansıtır. Sağlayıcı liste fiyatları, LLM fiyatlandırma karşılaştırmamızdadır.

Puanlama ve kanıt

Müşteri kapsamı puanın %50'sini, LinkedIn doğruluğu %17'sini, kanıt kalitesi %17'sini ve kanıt güncelliği %16'sını taşır.

Puanlama 10 Eylül 2026'da yapıldı. 10 Eylül 2025 ile 12 Eylül 2026 arasındaki tarihli kanıtları kabul ediyor; bu, puanlamadan önceki 12 ay artı iki gündür. 404 veya 410 döndüren atıf yapılmış bir URL, o gönderimi 40 ile sınırlandırır ve bu turda hiçbir gönderim sınıra ulaşmadı.

Kod; biçimlendirmeyi, adları, yinelemeleri, tarihleri ve URL durumunu denetler. Claude Sonnet 5, atıf yapılan her sayfanın bir alıntısını okur ve ilişkiyi doğrulayıp doğrulamadığına karar verir. Claude Sonnet 5 aynı zamanda puanlanan 16 modelden biridir ve Anthropic modelleri ilk iki sırayı tutar. Bir Anthropic değerlendiricinin Anthropic modellerini kayırıp kayırmadığını test etmedik.

Değerlendirici prompt'u, şirketin cevap anahtarında olup olmadığını belirtir; bu nedenle değerlendiricinin kararı anahtardan bağımsız değildir. Bir şirketi bir anahtardan çıkararak puanlayıcıyı yeniden çalıştırdık; aynı sayfada ve aynı alıntıda kararı müşteriden bahse dönüştü.

Kıyaslama ekibi, 58 satırda değerlendiricinin kararı yerine bir karar kaydetti; bunların 30'u modelin aleyhine, 28'i lehineydi. Elli dördü 9 Eylül 2026'da saklanan sayfa metninin incelenmesinden geliyor ve dördü 10 Eylül'de kaydedilen editoryal kararlardır.

Değerlendirme, cevap anahtarlarının dışındaki 140 satırı kabul ediyor; bunların 125'i ikinci hedefte. Desteklenen satırlar, anahtar girdileriyle aynı puanı kazanır.

Ek okumalar

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

SSS'ler

Bu test, kamuya açık kanıtlardan bireysel müşteri ilişkilerini doğruladı. Bir listenin eksiksiz olup olmadığını değerlendirmedi.

Tek başına bir karşılaştırma kurmaz. Bir sayfa ayrıca adı verilen bir müşteri veya araştırma şirketinin hizmetlerine abone gibi ticari bir ilişki de kurmalıdır.

Kapsam değerleri cevap anahtarından gelir. Değerlendirici, bir modelin atıf yaptığı sayfayı denetler; böylece gönderim, anahtar dışındaki desteklenen müşteriler için kredi kazanır.

Test müşteri listesi araştırmasını kapsar. Yatırım seçimini, değerlemeyi veya bir fonun kararlarının kalitesini değerlendirmez.

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ezgi Arslan, PhD. and Berk Kalelioğlu (2026) - "AI VC Benchmark: 16 Yapay Zekâ Ajanı Müşteri Tespitinde". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 10 Eylül 2026, kaynak: https://aimultiple.com/ai-vc [Çevrimiçi Kaynak]

PhD., E. A., & Kalelioğlu, B. (2026, 10 Eylül). AI VC Benchmark: 16 Yapay Zekâ Ajanı Müşteri Tespitinde. AIMultiple. https://aimultiple.com/ai-vc

@misc{phd2026,
  author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
  title  = {{AI VC Benchmark: 16 Yapay Zekâ Ajanı Müşteri Tespitinde}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/ai-vc}},
  note   = {AIMultiple. Erişim tarihi: 10 Eylül 2026}
}
Tüm verileri indir

13 veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, bir CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 21 Eylül 2026
İndir

Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın

Değişiklik günlüğü

1 güncelleme
  1. Kaynak bulma ve rakip eşleştirme kıyaslamasını 14 ajanlı müşteri belirleme kıyaslamasıyla değiştirdi.

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Sektör Analisti
Ezgi, işletme alanında finans uzmanlığı içeren bir doktora derecesine sahiptir ve AIMultiple'da Sektör Analisti olarak görev yapmaktadır. Teknoloji ve iş dünyasının kesişiminde araştırma ve içgörü çalışmalarını yürütür; uzmanlık alanları arasında sürdürülebilirlik, anket ve duygu analizi, finanstaki AI ajan uygulamaları, yanıt motoru optimizasyonu, güvenlik duvarı yönetimi ve satın alma teknolojileri yer alır.
Tam Profili Görüntüle
Teknik olarak inceleyen
Berk Kalelioğlu
Berk Kalelioğlu
Yapay Zeka Araştırmacısı
Berk, AIMultiple'ın benchmark ekibinde Yapay Zeka Araştırmacısıdır; etmen tabanlı yapay zeka, makine öğrenimi ve büyük ve küçük dil modelleri (LLM'ler ve SLM'ler) üzerine odaklanmaktadır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450