Ajanların rekabetçi boşluk analizi ve ABM hedef listesi hazırlamadaki performansını ölçen AIM Ajan Tabanlı Pazarlama Benchmark'ini tanıtıyoruz.
11 modelin performansını test ettik ve uçtan uca yürütme performansını ölçtük:
Ajan tabanlı pazarlama benchmark sonuçları
Görev puanları 0–100 ölçeğine normalize edilmiştir.
- Rekabetçi analiz için puan: 100 × MAX(0, doğrulanmış boşluklar − hatalı boşluklar) / 10
- Hesap listesi hazırlama için puan, model tarafından kazanılan 71 mevcut rubrik puanının yüzdesidir.
Genel skor, iki görev puanının aritmetik ortalamasıdır ve farklı rubrik boyutlarına rağmen her göreve eşit ağırlık verir. Geçersiz veya eksik gönderimler genel hesaplamada sıfır olarak sayılır, ancak tablo bunları tesadüfen sıfır puan alan geçerli gönderimlerden ayrı olarak işaretler.
Görev değerlendirmesi hakkında daha fazla bilgi için metodolojiyi okuyun.
Fable 5 her iki görevde de birinci oldu
Fable 5, rekabetçi analizde 70 ve hesap listesi hazırlamada 80.3 ile en yüksek genel puanı 75.15 olarak elde etti. Liderliği, her iki iş akışında da en güçlü geçerli sonucu üretmesinden ve geçersiz veya eksik bir gönderimden sonra gelen sıfırdan kaçınmasından geldi.
Toplu puanlar, bu avantajı hangi temel yeteneğin yarattığını göstermez. Format uyumu, kaynak seçimi, arama kapsamı ve tekrarlanan kural uygulaması katkıda bulunabilir; bunları ayırmak, her modelin dosyalarının kriter düzeyinde karşılaştırılmasını gerektirir.
GLM 5.2, 68.05 ile ikinci oldu ve her iki görevde de ikinci sırada yer aldı. Fable 5, rekabetçi analizde 10 puan ve hesap listesi hazırlamada 4.2 puan farkla öndeydi.
Rekabetçi analiz daha düşük puanlar verdi
Geçersiz gönderim sıfır olarak dahil edildiğinde, ortalama rekabetçi analiz puanı 40.9 olur. Fable 5 70 ile liderdi, geçerli puanlar ise 30 ile 70 arasında değişiyordu.
Bu rakamlar, puanlama formülüyle birlikte yorumlanmalıdır. Görevde on beklenen boşluk kullanıldığı için, her ek net doğru bulgu puanı on puan değiştirir. Altı geçerli boşluk bulan ve hiç hatalı boşluk bulmayan bir model 60 alır; yedi geçerli boşluk bulup bir hatalı iddia ekleyen bir model aynı sonucu alır.
Rubrik ayrıca bu görevi öncü modeller arasında zayıf bir ayırt edici olarak tanımlar. Ana değeri, birkaç boşluğu kaçıran, hatalı yokluk iddiaları ekleyen veya gereken çıktı formatını karşılamayan daha zayıf sistemleri ayırmaktır. Bu nedenle, üst sıralardaki küçük puan farklılıklarına, daha büyük başarısızlıklardan veya geçersiz gönderimlerden daha az ağırlık verilmelidir.
Hesap listesi hazırlama daha fazla puan çözünürlüğü sağladı
Hesap listesi görevi, daha ayrıntılı sonuçlar üreten 71 puanlık bir rubrik kullanır. Geçerli puanlar 32.4 ile 80.3 arasında değişti ve Fable 5 ile GLM 5.2 70'i aştı.
Sol, Terra, Sonnet 5 ve Opus 4.8, 66.2 ile 69 arasında puan alarak yakın bir orta grup oluşturdu. Gemini 3.1 Pro, en düşük geçerli gönderimi 32.4 ile verdi. Kimi K3 puanlanmış bir sonuç üretmezken, MiniMax M3 zorunlu bir yapısal koşulu karşılayamadı.
Geçersiz ve eksik çalıştırmalar sıfıra dönüştürüldükten sonra ortalama 51.5 oldu. İş akışı bir kapsam haritası ve 100 nitelikli hesap gerektirdiğinden, puan kısa bir bulgu listesi yerine yüzlerce bireysel iddia ve sınıflandırma üzerindeki performansı yansıttı.
Performans iş akışına göre değişti
Kimi K3 rekabetçi analizde 60 aldı ve geçerli bir hesap listesi döndürmedi. Sonnet 5 tam tersi bir model gösterdi: rekabetçi analiz çıktısı geçersizdi, hesap listesi gönderimi ise 67.6 puan aldı.
Bu vakalar, görev düzeyindeki sonuçların neden önemli olduğunu gösteriyor. Rekabetçi analiz anlamsal karşılaştırma ve yokluk doğrulamasına vurgu yapar; hesap listesi hazırlama ise sürekli araştırma, varlık çözümleme, kaynak yönetimi ve dosya oluşturma konularında daha ağır talepler getirir.
Pazarlama ekipleri için pratik çıkarım açıktır: otomatize edilecek iş akışına göre modeller seçin, ardından bunları gereken çıktı formatı ve kanıt standardına göre test edin.
Benchmark'ta kullanılan gerçek hayat görevleri
Bu ajan tabanlı pazarlama görevleri strateji ve içerik kapsamı, büyüme ve satış araştırmasını içerir. Her biri web araştırması, kaynak doğrulama, kural tabanlı nitelendirme ve yapılandırılmış çıktı gerektirir.
Görev 1: Rekabetçi boşluk analizi
Model, AIMultiple'ı diğer araştırma ve benchmark platformlarıyla karşılaştıran bir strateji analisti olarak hareket eder.
Ajan, her iki web sitesini inceler ve diğer platformun sunduğu ancak AIMultiple'ın sahip olmadığı teklifleri belirler. Geçerli kategoriler arena, benchmark, evaluation_format, içerik, metodoloji, dataset ve diğer'dir.
Görev en fazla on boşluğa izin verir. Her CSV satırı boşluğu, kategorisini, bir açıklamayı, rakip teklifin var olduğunu kanıtlayan canlı bir sayfayı, kontrol edilen AIMultiple sayfalarını ve bir öncelik puanını içerir.
AIMultiple ilgili bir teklif sunduğunda, model bunu adlandırmalı ve kalan farkı açıklamalıdır. Yalnızca geniş bir kategori örtüşmesi eşdeğerliği kanıtlamaz.
Görevi nasıl puanladık
Gizli cevap anahtarı, on doğrulanmış boşluk ve bir dizi bilinen hatalı yokluk iddiası içerir. Desteklenen her boşluk A_found'a bir ekler, hatalı her boşluk ise B_wrong'a bir ekler. Puan: MAX(0, A_found − B_wrong) / 10
Uydurma, erişilemez veya desteklenmeyen bir URL, ilgili boşluk için krediyi kaldırır ve bir hassasiyet cezası ekler. Bu tasarım, spekülatif liste genişletmeyi maliyetli hale getirir, çünkü makul bir iddia eklemek nihai puanı düşürebilir.
Çıktı ayrıca çalışma düzeyindeki yapısal kapılardan geçmelidir. CSV'nin doğru dosya adı ve sütunları, 1 ila 10 arasında satırı, kabul edilen kategori değerleri, geçerli alan adları, atomik hücreleri ve azalan öncelik sırasını içermesi gerekir. Herhangi bir kapıdaki başarısızlık gönderimi geçersiz kılar.
Görev 2: En uygun hesap listesi hazırlama
Model, AIMultiple için hesap tabanlı bir pazarlama listesi hazırlayan bir büyüme pazarlamacısı olarak hareket eder.
Çalışma, AIMultiple'ın canlı sayfalarının kapsam haritasıyla başlar. Ajan, kategori sayfalarını, benchmark'ları ve satıcı karşılaştırma sayfalarını, ayrıca makale içeriklerinde ve sponsor açıklamalarında bahsedilen satıcıları kaydeder.
Ardından, önceliklendirilmiş bir 100 hesap listesi hazırlar. Her şirket, yıllık geliri $100 milyon ile $1 milyar arasında olan, ABD, Avrupa veya İsrail'de merkezlenmiş ve AIMultiple'ın kapsadığı bir kategoride faaliyet gösteren bir B2B teknoloji satıcısı olmalıdır. Şirketin ayrıca güncel bir büyüme-pazarlama sinyaline ve AIMultiple'da gerçek bir ticari fırsatı temsil ettiği en az bir sayfaya ihtiyacı vardır.
Hesap dosyası şirketin alan adını, LinkedIn sayfasını, merkezini, kategorisini, gelirini ve kaynağını, çalışan sayısını, kuruluş yılını, finansman veya mülkiyet durumunu, ilgili AIMultiple sayfalarını, pazarlama sinyalini ve uyum puanını kaydeder.
Ana şirketler ve bağlı kuruluşlar aynı satıcı fırsatı için birlikte yer alamaz. Kurallar ayrıca hizmet firmalarını, tüketici işletmelerini, analist veya inceleme şirketlerini ve gelir veya merkez gereksinimlerini karşılamayan adayları hariç tutar.
Görevi nasıl puanladık
Rubrik, yedi bölümde 71 puan içerir. Kapsam haritası bölümü, modelin en az 30 canlı AIMultiple sayfasını incelediğini ve her gerekli sayfa türünü içerdiğini kontrol eder. Gözden geçirenler, adlandırılmış satıcıların ve sponsor açıklamalarının canlı sayfalarla eşleştiğini doğrulamak için satırları örnekler.
Hesap dosyası bölümü, tam olarak 100 farklı alan adı, belirtilen sütunlar, kabul edilen sınıflandırmalar, azalan uyum puanları ve eksiksiz kanıt alanları gerektirir. Daha sonra 20 hesaptan oluşan sabit bir örnek, gelir, LinkedIn kimliği, gerçek merkez, kategori uyumu, büyüme-pazarlama kanıtı ve B2B satıcı durumunu kapsayan ayrıntılı kontroller için kullanılır.
Diğer bölümler, önerilen sayfaların gerçek fırsatlar olup olmadığını test eder, diskalifiye edilmiş veya uydurma hesapları cezalandırır, doğrulanmış yüksek uyumlu şirketlerin dahil edilmesini ödüllendirir ve modellerin bilinen yakın ıskalamalardan kaçınıp kaçınmadığını kontrol eder.
Eksik bir hesap dosyası, yanlış sütunlar veya 100'den farklı herhangi bir satır sayısı çalışmayı geçersiz kılar.
Ajan tabanlı pazarlama benchmark metodolojisi
Her iki benchmark'ı, strateji ve büyüme ekiplerimiz tarafından kullanılan iş akışlarından oluşturduk.
Rekabetçi analiz görevi ürün kapsamı, içerik öncelikleri ve konumlandırma hakkındaki kararları destekler. Hesap listesi görevi hesap tabanlı pazarlamayı ve satış araştırmasını destekler.
Her iş akışı için şunları tanımlayan bir görev dosyası oluşturduk:
- modelin rolü
- mevcut araçlar
- kanıt gereksinimleri
- nitelendirme kuralları
- gerekli çıktılar
- zaman sınırı
Görevleri kendi sayfalarımız ve ticari iş akışlarımız etrafında tasarladık ve verilerimiz cevap anahtarının bir parçasını oluşturur. Bu, kanıtların doğrulanmasını kolaylaştırır, ancak sonuçların diğer şirketlere ve pazarlama ortamlarına ne kadar geniş uygulanabileceğini de sınırlar.
Görev talimatları ve puanlama rubrikleri
Rekabetçi analiz için modeller, canlı web'i Bright Data MCP aracılığıyla araştırabildi. Kod yürütmeyi devre dışı bıraktık ve 90 dakikalık bir sınır belirledik.
Hesap listesi hazırlama için modeller aynı web erişimini kod yürütme etkin olarak kullandı. Görev iki çıktı dosyası ve 100 nitelikli hesap gerektirdiğinden, 240 dakikaya kadar izin verdik.
Her modele görev talimatlarını ve çıktı şemasını verdik, puanlama rubriğini ise gizli tuttuk.
Modeller güncel kaynakları kullanmak zorundaydı
Her iki görev de web sitesi teklifleri, benchmark envanterleri, ürün sayfaları, şirket gelirleri, merkez, mülkiyet, sponsor açıklamaları ve pazarlama faaliyeti gibi zamanla değişen bilgilere bağlıdır.
Bir URL, çözümlendiğinde ve ekli iddiayı desteklediğinde sayıldı. Bir şirket ana sayfası belirli bir gelir rakamını destekleyemedi ve genel bir pazarlama veritabanı bir platformun belirli bir benchmark formatı sunduğunu kanıtlayamadı. Cevap anahtarlarını en son 7 Temmuz 2026'da doğruladık.
Çıktılar operasyonel kullanım için tasarlandı
Her iki görev de sabit sütunlu ve atomik hücreli CSV dosyaları gerektirir. Bu format, eksik alanları, yinelenenleri, geçersiz kategorileri, desteklenmeyen alan adlarını, yanlış satır sayılarını, hatalı biçimli değerleri ve sıralama hatalarını otomatik olarak kontrol etmemizi sağlar.
Bu aynı zamanda pazarlama ekiplerinin bu çıktıları nasıl kullandığını da yansıtır. Hesap listeleri ve rekabetçi analizler genellikle elektronik tablolara, CRM iş akışlarına, dahili veritabanlarına veya otomasyon araçlarına taşınır. Yapısal olarak geçersiz bir dosya, araştırmanın bazı bölümleri doğru olsa bile bir sonraki adımı engelleyebilir.
Varyans olmadan tek çalıştırma puanları raporluyoruz
Sonuçlar, model başına bir raporlanmış puan içerir. Şu anda tekrarlanan çalıştırmalar, tohumlar, güven aralıkları veya hata çubukları raporlamıyoruz.
Okuyucular bu nedenle küçük puan farklılıklarını dikkatle ele almalıdır. Rekabetçi analizde, ek bir net doğru boşluk puanı on puan değiştirir. Hesap listesi hazırlamada, birkaç örnek satır, tüm bir eşik tabanlı kriterin geçip geçmediğini belirleyebilir.
Deterministik kontrolleri bir LLM hakemiyle birleştirdik
Deterministik betikler, yazılımın doğrudan çözebileceği her şeyi ele aldı: dosya varlığı, CSV ayrıştırma, sütun sırası, satır sayıları, kabul edilen değerler, URL alan adları, yinelenenler ve sıralama. Betikler ayrıca atıfta bulunulan her URL'yi getirdi, yönlendirmeleri takip etti ve çözümlenen sayfa içeriğini hakime iletti.
Bir LLM hakemi, iki teklifin eşdeğer olup olmadığı, bir yokluk iddiasının geçerli olup olmadığı, bir şirketin bir kategoriye uyup uymadığı, getirilen bir sayfanın kendisine eklenen iddiayı destekleyip desteklemediği ve önerilen bir sayfanın gerçek bir fırsat olup olmadığı gibi anlamsal kriterleri puanladı.
Hakem, her seferinde bir satırı veya bir boşluğu rubriğin geçti/kaldı kurallarına göre puanladı ve betikler bu yargıları eşik kriterlerine dönüştürdü (örneğin, örneklenen 20 satırın ≥18'i). Hiçbir zaman genel bir kalite derecelendirmesi atamadı. Kendi analistlerimiz 7 Temmuz 2026'da altın hesapları, tuzakları ve sponsor açıklama transkripsiyonlarını içeren cevap anahtarını oluşturup dondurdu; hakem bu anahtarı uyguladı, neyin sayılması gerektiğine dair kendi görüşünü oluşturmadı.
Bu, iki uzun, kanıt yoğun dosyayı puanlamamızı sağladı, ancak bir risk taşır: bir hakem, okuduğu bir kaynağı çok cömertçe kabul edebilir, ki bu da rubriğin modellerde cezalandırdığı aynı başarısızlık modudur. Bu sonuçlar, çoklu hakem uyum kontrolü olmadan ve insan tarafından puanlanmış bir örnekle kalibrasyon yapılmadan tek bir değerlendirme geçişi kullanır.
SSS'ler
Ajan tabanlı pazarlama, minimum insan müdahalesiyle çok adımlı pazarlama görevlerini planlamak ve tamamlamak için yapay zeka destekli ajanların kullanılmasını içerir. Bu ajanlar, pazarlama iş akışları boyunca kararlar almak için müşteri verilerini, iş kurallarını, gerçek zamanlı bağlamı ve doğal dil talimatlarını kullanır.
Geleneksel pazarlama otomasyonu, bir form gönderiminden sonra e-posta göndermek veya bir müşteri adayını kitle segmentleri arasında taşımak gibi önceden tanımlanmış kuralları yürütür. Ajan tabanlı sistemler bir iş hedefini yorumlayabilir, gerekli araçları seçebilir, kampanya kurulumunu tamamlayabilir, kampanya performansını izleyebilir ve performansı optimize etmek için eylemleri ayarlayabilir.
Bir ajan tabanlı pazarlama platformu şu tür görevleri destekleyebilir:
– müşteri davranışını analiz etmek ve kitle segmentlerini belirlemek;
– yeni sinyallere dayanarak müşteri yolculuklarını uyarlamak;
– reklam harcamalarını pazarlama kampanyaları arasında dağıtmak;
– marka yönergeleri dahilinde içerik oluşturmak;
– yaratıcı iş akışlarını koordine etmek ve yaratıcı yönlendirmeyi korumak;
– yolculuk optimizasyonu için yapay zeka tarafından üretilen içgörüler üretmek;
– bir pazarlama bulutundaki bağlantısız araçlar arasında veri taşımak;
– birden fazla ajana belirli görevler atamak.
Rekabetçi boşluk analizi, her bulgu için her iki taraftan da kanıt gerektirir. Model, rakip platformun belirli bir teklif sunduğunu doğrulamalıdır. Ardından AIMultiple'ın ilgili sayfalarını incelemeli ve eşdeğer bir teklifin var olup olmadığını belirlemelidir.
İkinci adım daha geniş site keşfi gerektirir. İlgili kanıtlar bir benchmark sayfasında, bir kategori sayfasında, bir makalede, bir araç sayfasında veya bir site haritası girişinde görünebilir.
Anlamsal benzerlik başka bir zorluk ekler. İki teklif, aynı geniş pazara hitap ederken farklı değerlendirme formatları veya metodolojiler kullanabilir. Ajan, farkın anlamlı bir boşluk yaratıp yaratmadığına karar vermelidir.
Rubrik ayrıca spekülatif bulguları cezalandırır. Geniş arama davranışı hatırlamayı iyileştirebilir ve hatalı yokluk iddialarının sayısını artırabilir. Muhafazakâr davranış hassasiyeti koruyabilir ve beklenen boşlukları kaçırabilir.
İki görev farklı yetenek kombinasyonlarını test eder. Rekabetçi analiz, karşılaştırmalı araştırma, anlamsal yargı ve yokluğun dikkatli doğrulanmasını gerektirir.
Hesap listesi hazırlama, sürekli web araştırması, tekrarlanan nitelendirme, varlık çözümleme, kaynak yönetimi ve tam çıktı kontrolü gerektirir.
Bir model kısa bir karşılaştırma görevinde iyi performans gösterebilir ancak büyük, yapılandırılmış bir dosyayı tamamlayamayabilir. Başka bir model tekrarlanan hesap araştırmasını yönetebilir ve rekabetçi analizde bir yapısal kapıda başarısız olabilir.
Bu nedenle, ajan tabanlı pazarlama için model seçimi, bir ekibin otomatize etmeyi planladığı belirli pazarlama iş akışlarını dikkate almalıdır.
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{ermut2026,
author = {Ermut, Sıla and Kalelioğlu, Berk},
title = {{AIM Ajan Tabanlı Pazarlama Benchmark'i}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/agentic-marketing}},
note = {AIMultiple. Erişim tarihi: 17 Temmuz 2026}
}
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.