Hizmetler
Bize Ulaşın

15 Yapay Zeka Ajanı Gözlemlenebilirlik Araçları: AgentOps & Langfuse

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 11 Ağu 2026

Yapay zeka ajanı gözlemlenebilirlik araçları, örneğin Langfuse ve Arize, bir programın veya işlemin yürütülmesinin kaydı olan ayrıntılı izleri toplamaya ve metrikleri gerçek zamanlı olarak izlemek için gösterge panelleri sağlamaya yardımcı olur.

Birçok ajan çerçevesi, LangChain gibi, ajanik izleme ile metadata paylaşmak için OpenTelemetry standardını kullanır. Buna ek olarak, birçok gözlemlenebilirlik aracı daha fazla esneklik için özel enstrümantasyon sağlar.

LLM uygulamaları ve yapay zeka ajanları için 15 gözlemlenebilirlik platformunu test ettik. Her platform, iş akışlarını kurma, entegrasyonları yapılandırma ve test senaryoları çalıştırma yoluyla uygulamalı olarak hayata geçirildi. Üretim hatlarında yük getirip getirmediklerini ölçmek için 4 gözlemlenebilirlik aracını kıyasladık. Ayrıca Langfuse kullanarak bir LangChain gözlemlenebilirlik eğitimi gösterdik.

Ajanik izleme araçları yük kıyaslaması

Her gözlemlenebilirlik platformunu çok ajanlı seyahat planlama sistemimize entegre ettik ve enstrümantasyon olmayan bir temel çizgiyle karşılaştırmalı olarak performans yükünü ölçmek için 100 özdeş sorgu çalıştırdık. Kıyaslama metodolojimizi okuyun.

  • LangSmith neredeyse ölçülebilir bir yük olmaksızın olağanüstü verimlilik gösterdi ve bu da onu performans açısından kritik üretim ortamları için ideal kılıyor.
  • Laminar %5 oranında minimum yük getirdi, bu da onu performansın kritik olduğu üretim ortamları için oldukça uygun kılıyor.
  • AgentOps ve Langfuse sırasıyla %12 ve %15 oranında orta düzeyde yük gösterdi; bu, gözlemlenebilirlik özellikleri ile performans etkisi arasında makul bir dengeyi temsil ediyor. Bu platformlar, çoğu üretim kullanım senaryosu için hâlâ kabul edilebilir gecikme sürelerini koruyor.

Performans farklılıklarının olası nedenleri

Kıyaslamamız, gecikme farklılıklarının özellikle çok ajanlı iş akışlarında enstrümantasyon derinliği ve yürütme yolu katılımı tarafından yönlendirildiğini göstermektedir. Daha derin, adım düzeyinde gözlemlenebilirlik sunan araçlar daha yüksek yük sergilerken, daha hafif izleme yaklaşımları temel çizgiye daha yakın kaldı.

1. Yürütme yolundaki enstrümantasyon derinliği

Gözlemlenebilirlik araçları, izleri ve üst verileri yakalamak için ajanın yürütme akışına mantık ekler. Bu mantık istek işlenirken eşzamanlı olarak çalıştığında, ajan yanıt döndürmeden önce bu ek işi tamamlaması gerektiğinden uçtan uca gecikmeyi doğrudan artırır.

Örneğin:

  • LangSmith neredeyse ölçülebilir bir yük eklemedi (~%0), bu da az eşzamanlı çalışma olduğunu gösteriyor,
  • Langfuse’un daha derin adım düzeyinde enstrümantasyonu daha yüksek yüke (~%15) katkıda bulundu.

2. Çok adımlı hatlarda olay artışı

Çok ajanlı sistemlerde, tek bir kullanıcı isteği birden çok ajan eylemini tetikler. Bir araç her adımda ayrıntılı veri kaydettiğinde, toplam olay sayısı hızla artar ve iş akışı derinleştikçe işleme ve iz işleme yükünü artırır.

Kıyaslama sonuçlarında:

  • Langfuse ve AgentOps, çok adımlı seyahat planlama iş akışımızda gözle görülür şekilde daha yüksek yük oluşturdu (%15 ve %12)
  • LangSmith ve Laminar, ajan adımı başına daha az olay yaydı.

3. Satır içi değerlendirme ve doğrulama yükü

Bazı platformlar, ajan çalışırken ek kontroller veya izleme yapar. Her kontrol hafif olsa da, bunları tüm ajan adımlarında tekrar uygulamak ölçülebilir gecikme ekler.

Örneğin:

  • AgentOps’un yaşam döngüsü düzeyinde izlemesi %12 yük ile örtüştü
  • Laminar, yürütmeyi etkileyen satır içi değerlendirmeye dair kanıt göstermedi, ~%5 seviyesinde kaldı.

4. Serileştirme ve kalıcılık sıklığı

Ayrıntılı gözlemlenebilirlik verilerini yakalamak, izlerin serileştirilmesini ve depolama veya harici arka uçlara yazılmasını gerektirir. Daha yüksek iz ayrıntısı, bunun ne sıklıkta gerçekleştiğini artırarak her isteğe I/O yükü ekler.

Kıyaslamamızda:

  • Langfuse’un ayrıntılı prompt, çıktı ve token izlemesi en yüksek yüke (~%15) neden oldu
  • LangSmith’in daha hafif iz kalıntıları temel çizgiye yakın kaldı.

5. Ajan çerçevesiyle entegrasyon sıkılığı

Bir aracın ajan çerçevesiyle ne kadar sıkı entegre olduğu performansı etkiler. Daha sıkı entegrasyonlar, çeviri ve düzenleme adımlarını azaltırken, daha genel SDK'lar ek işleme katmanları ekler.

Örneğin:

  • LangSmith’in ajan yürütmesiyle sıkı uyumu ~%0 yük ile ilişkilendirildi
  • AgentOps ve Langfuse, daha bağımsız entegrasyon yollarıyla tutarlı olarak daha yüksek gecikme etkisi gösterdi.

Yapay zeka ajanı gözlemlenebilirlik platformları

Kademe 1: İnce taneli LLM & prompt / çıktı gözlemlenebilirliği

* Bu sütunlarda listelenen yetenekler, her aracın entegrasyonlar veya özelleştirme yoluyla genişletildiğinde neleri izleyebileceğine dair örnek niteliğinde olup, tek bir platformla sınırlı değildir.

Kademe 2: İş akışı, model & değerlendirme gözlemlenebilirliği

Kademe 3: Ajan yaşam döngüsü & operasyonlar gözlemlenebilirliği

Kademe 4: Sistem & altyapı izleme (ajana özgü değil)

Datadog (LLM Gözlemlenebilirlik modülüyle) ve Prometheus (dışa aktarıcılar aracılığıyla) giderek daha fazla Langfuse/LangSmith ile birlikte kullanılmaktadır.

Ajan geliştirme ve orkestrasyon platformları:

  • Flowise, Langflow, SuperAGI ve CrewAI gibi araçlar, kodsuz/az kodlu arayüzlerle ajan iş akışları oluşturmayı, orkestre etmeyi ve optimize etmeyi sağlar.

Dağıtım ücretsiz sürümleri ve fiyatlandırma

ücretsiz sürümleri, kullanım sınırlarına (örn., gözlemler, izler, tokenlar veya iş birimleri) göre farklılık gösterir. Başlangıç fiyatları genellikle özellikler, kullanıcılar veya kullanım sınırları konusunda kısıtlamaları olabilen temel bir plan içindir.

Weights & Biases (W&B Weave)

Kullanım durumu: Hataların ajan çağrıları arasında nasıl yayıldığını izleyerek çok ajanlı sistemlerdeki hataları ayıklama.

Weights & Biases Weave'den izler gösterge paneli.

Weights & Biases Weave, çok ajanlı sistemler için yapılandırılmış yürütme izleri kaydeder ve ajan çağrıları arasındaki üst-alt ilişkilerini korur. Girdiler, çıktılar, ara durumlar, gecikme ve token kullanımı ajan başına ve iz başına yakalanır.

Weave izleme özellikleri

  • Düz istek günlükleri yerine hiyerarşik ajan izleme
  • ajan düzeyinde maliyet ve gecikme atfı
  • Doğrudan izlere uygulanan değerlendirme puanlayıcıları için yerel destek.

Değerlendirme yetenekleri

Weave ayrıca değerlendirme için aşağıdakiler dahil yerleşik puanlayıcılar sağlar:

  • Halüsinasyon tespiti için HallucinationFreeScorer,
  • Özet kalitesini değerlendirmek için SummarizationScorer,
  • Anlamsal benzerlik için EmbeddingSimilarityScorer,
  • Biçim doğrulaması için ValidJSONScorer ve ValidXMLScorer,
  • Şema uyumluluğu için PydanticScorer,
  • İçerik güvenliği için OpenAIModerationScorer,
  • ContextEntityRecallScorer gibi RAGAS puanlayıcıları,
  • RAG sistemi değerlendirmesi için ContextRelevancyScorer.

En uygun olduğu durum: Yüzeysel metrikler yerine iz düzeyinde kök neden analizi gerektiren çok adımlı veya çok ajanlı iş akışları çalıştıran ekipler.

Langfuse

Kullanım durumları: LLM etkileşimlerini izleme, prompt sürümlerini yönetme ve kullanıcı oturumlarıyla model performansını izleme.

Langfuse iz ayrıntılarını gösteren gösterge paneli örneği.1

Langfuse, prompt katmanına derinlemesine görünürlük sunarak hata ayıklama, izleme ve LLM uygulamalarını optimize etmeye yardımcı olmak için promptları, yanıtları, maliyetleri ve yürütme izlerini yakalar.

Bununla birlikte, Langfuse, harici prompt yönetim sistemi aynı düzeyde sürüm kontrolü ve işbirliği sunmayabileceğinden, kod ve prompt yönetimi için Git tabanlı iş akışlarını tercih eden ekipler için uygun olmayabilir.

Langfuse izleme özellikleri

  • Prompt evrimine ve kullanım desenlerine görünürlük
  • Kullanıcıya yönelik uygulamalar için uygun oturum tabanlı analiz
  • Filtreleme ve inceleme için pratik üst veri ve etiketleme modeli

Kurumsal düzey özellikler:

Bu özelliklerden bazıları şunlardır:

  • Günlük seviyeleri: Daha ayrıntılı içgörüler için günlüklerin ayrıntı düzeyini ayarlayın.
  • Çok biçimlilik: Çok modlu LLM uygulamaları için metin, görüntü, ses ve diğer biçimleri destekler.
  • Sürümler ve sürümleme: Sürüm geçmişini izleyin ve yeni sürümlerin model performansını nasıl etkilediğini görün.
  • İz URL'leri: Daha fazla inceleme ve hata ayıklama için benzersiz URL'ler aracılığıyla ayrıntılı izlere erişin.
  • Ajan grafikleri: Ajan davranışının daha iyi anlaşılması için ajan etkileşimlerini ve bağımlılıklarını görselleştirin.
  • Örnekleme: Sistemi bunaltmadan analiz etmek için etkileşimlerden temsili veriler toplayın.
  • Token ve maliyet takibi: Verimli kaynak yönetimi sağlamak için her model çağrısındaki token kullanımını ve maliyetleri izleyin.
  • Maskeleme: Gizliliği ve uyumluluğu sağlamak için izlerde hassas verileri maskeleyerek koruyun.

En uygun olduğu durum: Prompt'lar üzerinde yineleme yapan ve özellikle kullanıcı oturumlarının önemli olduğu üretimde kullanımı izleyen ekipler.

Galileo

Kullanım durumları: Maliyet/gecikme izleme, çıktı kalitesini değerlendirme, güvensiz yanıtları engelleme ve uygulanabilir düzeltmeler sağlama.

Araç seçimi kalitesi, bağlam uyumu, ajan eylem derlemesi ve ilk token'a kadar geçen süreyi gösteren grafikler.

Galileo, gerçek zamanlı güvenlik ve uyumluluk kontrolleri uygularken maliyet, gecikme ve çıktı kalitesi metriklerini izler.

Platform, geleneksel gözlemlenebilirliği (gecikme, maliyet, performans) yapay zeka destekli hata ayıklama ve değerlendirme (halüsinasyon tespiti, olgusal doğruluk, tutarlılık, bağlam uyumu) ile birleştirir.

Galileo izleme özellikleri

  • Yüzeysel hataların ötesinde arıza modu tanımlaması (örneğin, geçersiz araç girdilerine yol açan halüsinasyonlar)
  • Önerilen prompt değişiklikleri veya birkaç örnek eklemeleri gibi reçeteli geri bildirim
  • Değerlendirme sonuçları ile önerilen düzeltmeler arasında sıkı bağlantı.

En uygun olduğu durum: Çıktı kalitesine, güvenliğe ve rehberli iyileştirmeyle hızlı yineleme döngülerine öncelik veren kuruluşlar.

Guardrails YZ

Kullanım durumları: Zararlı çıktıları önleme, LLM yanıtlarını doğrulama ve güvenlik politikalarına uyumu sağlama

Koruma davranışı gösterge paneli, koruma çalışma süresi ve koruma başarısızlıklarındaki farklılıkları gösteriyor.

Guardrails, LLM girdilerini ve çıktılarını toksisite, önyargı, PII maruziyeti, halüsinasyon işaretleme ve biçim uyumu dahil olmak üzere yapılandırılabilir kurallara göre doğrular.

Guardrails YZ izleme özellikleri

  • RAIL spesifikasyonları aracılığıyla deterministik doğrulama
  • Prompt enjeksiyonu ve jailbreak tespiti için girdi korumaları
  • Doğrulama başarısız olduğunda otomatik yeniden denemeler.

En uygun olduğu durum
Yanıtlar döndürülmeden önce katı güvenlik, uyumluluk veya biçimlendirme garantilerini uygulamak zorunda olan ekipler.

LangSmith

Kullanım durumları: Ajan akıl yürütme ve araç çağrısı hata ayıklama (LangChain odaklı)

LangSmith izleri gösteren gösterge paneli; adları, girdileri, başlangıç zamanları ve gecikme süreleri.

LangSmith, LangChain tabanlı ajanlar için promptlar, getirilen bağlam, araç seçim mantığı, araç girdileri/çıktıları, hatalar ve istisnalar dahil olmak üzere tam akıl yürütme izlerini yakalar.

LangSmith izleme özellikleri

  • Ajan karar yollarının adım adım incelenmesi
  • Çalıştırma tekrarı ve promptlar, modeller veya araçlar arasında yan yana karşılaştırma
  • Geri çağrılar aracılığıyla LangChain ile sıkı entegrasyon.

En uygun olduğu durum
Yanlış akıl yürütme veya araç çağrısını ayrıntılı olarak ayıklamak isteyen LangChain ile geliştirme yapan ekipler.

Langtrace YZ

Kullanım durumları: LLM uygulamalarında maliyet ve gecikme darboğazlarını belirleme

Langtrace YZ iz gösterge paneli.

Langtrace, OpenTelemetry uyumlu izler kullanarak LLM hatları boyunca token sayımlarını, yürütme süresini, API maliyetlerini ve istek parametrelerini izler.

Langtrace YZ izleme özellikleri

  • Mevcut arka uçlarla entegrasyon için OpenTelemetry uyumu
  • Adım başına maliyet ve gecikme sürücülerine görünürlük
  • Hafif prompt sürümlemesi ve test oyun alanı.

En uygun olduğu durum: Çıktı kalitesini değerlendirmek yerine LLM iş akışları genelinde performansı ve harcamayı optimize eden ekipler.

Arize (Phoenix)

Kullanım durumları: Model kaymasını izleme, önyargı tespiti ve kapsamlı puanlama sistemleriyle LLM çıktılarını değerlendirme

Arize Phoenix kayma izleme gösterge paneli.

Phoenix, davranışsal kayma, önyargı tespiti ve alaka, toksisite ve doğruluk için LLM-yargıç puanlamasına odaklanır.

Ancak, hafif proxy'lere kıyasla daha yüksek entegrasyon yüküne sahiptir ve prompt sürümlemesini özel araçlar kadar temiz bir şekilde yönetmez.

Phoenix izleme özellikleri

  • İsteğe bağlı kurumsal uzantılarla açık kaynak çekirdek
  • Geliştirme için etkileşimli prompt oyun alanı
  • Zamana göre davranışsal değişiklikleri izlemek için kayma tespiti
  • Yanıt önyargılarını belirlemek için önyargı kontrolleri,
  • Doğruluk, toksisite ve alaka için LLM-yargıç puanlaması.

En uygun olduğu durum: Prompt yinelemesinden ziyade uzun vadeli model davranışını ve gerileme riskini izleyen ekipler.

Agenta

Kullanım durumları: Hangi prompt'un hangi modelde en iyi çalıştığını bulma

Agenta'dan çeşitli prompt alternatiflerini gösteren resim.

Agenta, ortak girdiler ve kontrollü bağlam kullanarak maliyet, gecikme ve çıktı kalitesi açısından model yanıtlarını karşılaştırır.

Agenta'dan çıktı örneği.

Agenta izleme özellikleri

  • Yan yana model değerlendirmesi
  • Üretim öncesi karar desteği.

En uygun olduğu durum: Erken aşama değerlendirme ve model seçimi.

AgentOps.ai

Kullanım durumları: Ajan akıl yürütmesini izleme, maliyetleri takip etme ve üretimde oturumları ayıklama

AgentOps.ai'dan oturum tekrarı gösterge paneli örneği.

AgentOps, dağıtılmış ajanlar için akıl yürütme izleri, araç/API çağrıları, oturum durumu, önbellekleme davranışı ve maliyet metriklerini yakalar.

AgentOps izleme özellikleri

  • Üretim hata ayıklaması için oturum tekrarı
  • Çevrimdışı değerlendirme yerine canlı ajan davranışına odaklanma.

En uygun olduğu durum: Operasyonel görünürlüğe ihtiyaç duyan, üretimde ajan çalıştıran ekipler.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Braintrust

Kullanım durumları: Ayrıntılı değerlendirme ve hata analizi ile hangi prompt'un, veri kümesinin veya modelin daha iyi performans gösterdiğini bulma

Braintrust'tan müşteri destek ajanı gösterge paneli.

Braintrust, gecikme, maliyet, araç hataları ve yürütme metriklerini izleyerek promptları, veri kümelerini ve modelleri beklenen çıktılara göre değerlendirir.

Braintrust izleme özellikleri

  • Girdiler ve beklenen çıktılarla test veri kümelerini değerlendirin, ardından {{input}}, {{expected}} ve {{metadata}} gibi değişkenleri kullanarak promptları veya modelleri yan yana karşılaştırın.
  • Araç yürütme kalitesi dahil metrik dökümleri

En uygun olduğu durum: Kullanıma sunmadan önce modelleri ve promptları kıyaslayan ekipler.

AgentNeo

Kullanım durumları: Çok ajanlı etkileşimlerde hata ayıklama, araç kullanımını izleme ve koordinasyon iş akışlarını değerlendirme

AgentNeo, bir Python SDK aracılığıyla ajan iletişimini, araç kullanımını, yürütme grafiklerini ve ajan başına maliyet ile gecikmeyi izler.

AgentNeo izleme özellikleri

  • Açık kaynak ve yerel olarak çalıştırılabilir
  • Çok ajanlı iş akışlarının gerçek zamanlı izlenmesi için etkileşimli yerel gösterge paneli (localhost:3000)
  • Dekoratörler kullanarak entegrasyon (örn., @tracer.trace_agent, @tracer.trace_tool)

En uygun olduğu durum: Çok ajanlı sistemlerle deney yapan mühendislik ekipleri.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Laminar

Kullanım durumu: Farklı LLM çerçeveleri ve modelleri genelinde performansı izleme.

Laminar'dan izler gösterge paneli örneği.

Laminar, LLM çerçeveleri ve modelleri genelinde yürütme aralıklarını, maliyetleri, token kullanımını ve gecikme yüzdeliklerini izler.

Laminar izleme özellikleri

  • Çerçeveden bağımsız performans analizi
  • İnce taneli aralık incelemesi.

En uygun olduğu durum: Heterojen yığınlar arasında karşılaştırmalı performans analizi.

Helicone

Kullanım durumları: Çok adımlı ajan iş akışlarını izleme ve kullanıcı oturumu desenlerini analiz etme.

Helicone, istek hacimlerini, maliyetleri, hataları, gecikme eğilimlerini ve oturum düzeyinde ajan iş akışlarını yakalar.

İstekler, maliyetler, hatalar ve gecikmedeki 3 aylık değişimleri gösteren resim.

Helicone izleme özellikleri

  • Kullanıcı yolculuğu görünürlüğü
  • Geçmiş eğilim analizi.

En uygun olduğu durum: Kullanım desenlerini ve kullanıcı düzeyinde davranışı izleyen ürün ekipleri.

Coval

Kullanım durumları: Binlerce ajan konuşmasını simüle etme, ses/sohbet etkileşimlerini test etme ve dağıtımdan önce davranışı doğrulama.

Coval'in değerlendirme gösterge paneli.

Coval, görev tamamlama, doğruluk ve araç çağrısı etkinliğini ölçmek için binlerce konuşmayı simüle eder.

Coval izleme özellikleri

  • Simülasyon tabanlı ajan testi
  • Otomatik gerileme tespiti
  • Sesli ve metin ajan desteği.

En uygun olduğu durum: Dağıtım öncesi doğrulama ve gerileme tespiti.

Datadog

Kullanım durumları: LLM sinyal korelasyonu ile altyapı ve uygulama gözlemlenebilirliği.

Datadog, altyapı metriklerini (CPU, bellek, ağ), uygulama performans verilerini (gecikme, hata oranları, verim) ve günlükleri toplar. LLM uygulamaları için token kullanımı, istek başına maliyet, model gecikmesi ve prompt enjeksiyonu girişimleri gibi güvenlikle ilgili sinyalleri alabilir.

Datadog izleme özellikleri

  • Altyapı, uygulamalar ve yapay zeka iş yükleri genelinde geniş, sistem çapında gözlemlenebilirlik
  • Yapay zeka davranışı ile altyapı sağlığı arasında korelasyon sağlayan geniş entegrasyon ekosistemi (900'den fazla entegrasyon)

En uygun olduğu durum: Ajan akıl yürütmesini veya prompt'u incelemek yerine LLM davranışını temel altyapı ve uygulama performansıyla ilişkilendirmek isteyen kuruluşlar

Prometheus

Kullanım durumları: Sistem performansını izleme, uygulama metriklerini takip etme ve altyapı sorunları için uyarı yapılandırma.

Prometheus yazılım gösterge paneline genel bakış

Prometheus, altyapı, uygulama, veritabanı, konteyner ve özel iş metriklerini takip etmek için HTTP uç noktalarından düzenli aralıklarla zaman serisi metriklerini kazıyan açık kaynaklı bir izleme sistemidir.

Prometheus izleme özellikleri

  • Çekme tabanlı kazıma yoluyla zaman serisi metrik toplama
  • Sorgulama, birleştirme ve uyarı koşulları için PromQL
  • Geniş sistem kapsamı için dışa aktarıcı ekosistemi (örn., Node Exporter)

En uygun olduğu durum: Kural tabanlı uyarı ile altyapı ve uygulama izleme.

Grafana

Kullanım durumları: LLM, ajan ve altyapı verileri arasında metrikleri görselleştirme, gösterge panelleri oluşturma ve uyarıları yönlendirme.

İstek oranı, toplam kullanım tokenları, ortalama kullanım maliyeti ve toplam kullanım maliyetindeki değişimi gösteren iz gösterge paneli.

Grafana, birleşik gözlemlenebilirlik gösterge panelleri sağlamak için Prometheus, OpenTelemetry ve Datadog gibi veri kaynaklarıyla entegre olan açık kaynaklı bir görselleştirme ve analitik platformudur.

Grafana izleme özellikleri

  • Metrikler, günlükler ve izler arasında gösterge panelleri
  • LLM, ajan ve altyapı sinyalleri için çapraz sistem korelasyonu
  • Uyarı yönlendirme ve bildirim yönetimi.

En uygun olduğu durum: Merkezi gözlemlenebilirlik görselleştirmesi ve olay müdahalesi.

Eğitim: LangChain ile Langfuse gözlemlenebilirliği

Üç aşamalı çok adımlı bir LangChain hattı oluşturduk:

  1. soru analizi
  2. yanıt oluşturma
  3. yanıt doğrulama

Hattı kurduktan sonra, yürütmeyi gerçek zamanlı olarak izlemek ve takip etmek için Langfuse'a bağladık. Bunu yaparak, Langfuse'un yapay zeka uygulama performansı, maliyetleri ve davranışı hakkında ayrıntılı içgörüler toplamamıza nasıl yardımcı olduğunu keşfedebildik.

Langfuse aracılığıyla gözlemlediklerimiz:

Gösterge paneline genel bakış

Langfuse'un maliyet, kullanım yönetimi ve gecikme gösterge panelleri.

Langfuse, bize hattın performansının farklı yönlerine görünürlük sağlayan birkaç gösterge paneli sundu:

  1. Maliyet Gösterge Paneli: Bu, tüm API çağrılarındaki harcamayı model ve zaman dilimi başına ayrıntılı dökümlerle izler.
  2. Kullanım Yönetimi: Gözlem sayıları ve kaynak tahsisi gibi yürütme metriklerini izleyerek, yürütme sırasında kaynakların nasıl kullanıldığını takip etmemize yardımcı olur.
  3. Gecikme Gösterge Paneli: Bu gösterge paneli, yanıt sürelerini analiz etmemize, darboğazları tespit etmemize ve performans eğilimlerini görselleştirmemize yardımcı oldu.

Kullanım metrikleri

Langfuse'un toplam iz sayısı, toplam gözlem sayısı ve toplam puan sayısı (hem sayısal hem kategorik) dahil kullanım metriklerini gösteren resim.

Kullanım metrikleri gösterge paneli bize sistemin nasıl performans gösterdiğine dair aşağıdaki içgörüleri verdi:

  • Toplam iz sayısı: Sekiz iz izledik; her biri hattaki tam bir soru-cevap döngüsünü temsil ediyor.
  • Toplam gözlem sayısı: Ortalama olarak, her iz 16 gözleme sahipti; bu, sürecin çok adımlı doğasını yansıtıyor.

Buna ek olarak, Langfuse son 7 güne ait kullanım desenlerini, kaynak tahsisini ve yoğun zamanları takip etmemizi sağlayarak sistemin en aktif olduğu zamanları ve kaynakların zamana nasıl dağıldığını anlamamıza yardımcı olur.

İz incelemesi

Langfuse'un girdi, çıktı, gözlemlenebilirlik seviyeleri, gecikme ve token'ları gösteren iz gösterge paneli.

Tek bir iz detayına girildiğinde, ayrıntılı yürütme bilgilerini görebildik:

  • İz satırları: Her satır, benzersiz bir iz kimliği ile tam bir hat yürütmesini temsil eder.
  • Gecikme metrikleri: Yürütme süresi 0.00sn ile 34.08sn arasında değişiyordu.
  • Token sayıları: Gösterge paneli, maliyet ve verimlilik yönetimine yardımcı olan girdi/çıktı token kullanımını izledi.
  • Ortam filtreleme: İzleri dağıtım ortamlarına (örneğin, geliştirme, üretim) göre filtreleyebildik.

Bireysel iz ayrıntıları

Langfuse'un sıralı zincir mimarisi.

Yürütme dökümünü anlamak için izi daha ayrıntılı inceledik:

  • Sıralı zincir mimarisi: İz, SequentialChainLLMChainChatOpenAI ile başlayan hiyerarşik yapıda her adımı gösteren görsel bir akış sergiledi.
  • Girdi/Çıktı takibi: “Yapay zeka ajanı gözlemlenebilirliği için Langfuse kullanmanın faydaları nelerdir?” orijinal sorusu her aşamada takip edildi ve her adımda yapay zeka tarafından üretilen ilgili çıktılar ile birlikte izlendi.
  • Token analizi: Girdi için 1.203 token ve çıktı için 1.516 token kullanıldığını gözlemledik; bu, token kullanımıyla ilgili maliyet etkileri doğurur ve kaynak yönetimini optimize etmeye yardımcı olur.
  • Zamanlama verileri: Tam iz için toplam gecikme 34.08 sn olup, her bileşene göre dağılımı:
    • SequentialChain → 14.02 sn
    • LLMChain → 10.25 sn
    • ChatOpenAI → 9.81 sn
  • Model bilgisi: Langfuse, sıcaklık yapılandırması dahil belirli ayarların ayrıntılarıyla birlikte Anthropic Claude-Sonnet-4 modelinin kullanıldığını doğruladı.
  • Biçimlendirilmiş çıktı: Hata ayıklama için hem Önizleme hem de JSON görünümleri sağlandı; modelin yanıtı hakkında insan tarafından okunabilir biçimde ve makine tarafından okunabilir biçimde içgörüler sundu.

Otomatik analiz

Langfuse otomatik değerlendirme örneği.

Langfuse ayrıca yanıtlarımızın otomatik değerlendirmelerini sağladı:

  • Kalite değerlendirmesi: Sistem yanıtların yapısını, tutarlılığını ve bütünlüğünü değerlendirerek iyi organize edilmiş bölümleri vurguladı ancak yanıtların daha öz olabileceğini önerdi.
  • İyileştirme önerileri: Gereksizlik içeren bölümleri belirleyerek ifadelerin nerede geliştirilebileceğini önerdi ve yanıtı daha şeffaf ve verimli hale getirmek için ilgili noktaları birleştirdi.
  • Performans içgörüleri: Sistem, token kullanımı ve yanıt alaka düzeyi hakkında geri bildirim vererek, çıktının yardımsever ve konuyla ilgili kalmasını sağlarken verimliliği optimize etmemize yardımcı oldu.
  • Yapılandırılmış geri bildirim: Geri bildirim kategorilere ayrıldı, böylece belirli geliştirilecek alanları hedefli bir şekilde ele alabildik.

Kullanıcı analitiği

Görüntü, etkileşimi, kaynak kullanımını ve bütçe tahsisini analiz etmeye yardımcı olmak için her kullanıcının ilk ve son etkileşimlerini, olay hacimlerini, token tüketimini ve ilişkili maliyetleri gösteren anonimleştirilmiş kullanıcı etkinliğini göstermektedir.

Langfuse, kullanıcılar ile yapay zeka ajanı arasındaki ayrıntılı etkileşimleri izler:

  • Kullanıcı etkinliği zaman çizelgesi: Her kullanıcının ilk ve son etkileşimini göstererek aktif ve aktif olmayan kullanıcıları belirlemeye yardımcı olur. Kullanıcıların sistemle ilk ve son kez ne zaman etkileşime geçtiğini görebiliriz.
  • Olay hacmi takibi: Her kullanıcının tetiklediği olay sayısını izler. Örneğin, bazı kullanıcılar 2.000'den fazla olay oluşturarak sistemle etkileşim düzeylerini gösterdi.
  • Token tüketim analizi: Her kullanıcı tarafından tüketilen toplam token sayısını izler. Token kullanımı 6,59K ile 357K token arasında değişerek kaynak kullanımı hakkında içgörü sağladı.
  • Maliyet atfı: Her kullanıcıyla ilişkili maliyetleri dökerek harcamaları takip etmeyi ve kaynak kullanımı için bütçe tahsisini optimize etmeyi kolaylaştırır.
  • Kullanıcı tanımlama: Kullanıcı gizliliğini korurken bireysel kullanıcı etkileşimlerini izlemek için anonimleştirilmiş kullanıcı kimlikleri kullanır; kullanıcı mahremiyetinden ödün vermeden kullanım analizine yardımcı olur.
Etkileşimin nasıl işlendiğine dair eksiksiz bir resim vermek için yürütülen Python koduyla birlikte tüm konuşma akışını gösteren, kullanıcı girdilerini sistem çıktılarıyla ilişkilendiren ve oturum üst verilerini görüntüleyen oturum görünümü örneği.

Oturum görünümü, kullanıcı etkileşimlerinin ayrıntılı bilgilerini izlememize olanak tanır:

  • Tam konuşma akışı: Tam soru-cevap etkileşimini göstererek tüm konuşmayı baştan sona kolayca takip etmeyi sağlar.
  • Uygulama görünürlüğü: Oturum sırasında kullanılan gerçek Python kodunu görüntüleyerek teknik uygulama hakkında içgörü sağlar.
  • Girdi/Çıktı korelasyonu: Kullanıcı sorularını ilgili sistem yanıtlarıyla ilişkilendirerek, konuşmada sorunların nerede meydana gelmiş olabileceğini belirlememize ve sorun gidermemize yardımcı olur.
  • Oturum üst verileri: Zamanlama, kullanıcı bağlamı ve belirli uygulama verileri gibi teknik ayrıntıları içerir; oturumun yürütülmesine dair kapsamlı bir görünüm sunar.

Gözlemlenebilirlik araçlarının ne zaman kullanılmaması gerektiği

  • Erken aşama geliştirme: Hâlâ ürün-pazar uyumunu doğruluyorsanız veya ilk ajan iş akışlarınızı oluşturuyorsanız, odak kapsamlı gözlemlenebilirlikten ziyade temel işlevsellik üzerinde olmalıdır.
  • API darboğazları: Temel sorunlarınız API maliyetleri, gecikme veya önbellekleme ise, acil öncelik sistem düzeyi metrikleri izlemek değil, bu alanları optimize etmek olmalıdır.
  • Model optimizasyonu: İyileştirmeler esas olarak model seçimi, ince ayar veya prompt mühendisliği tarafından yönlendiriliyorsa, kayma ve önyargı için gözlemlenebilirlik araçları henüz gerekli olmayabilir.

Gözlemlenebilirlik araçlarının ne zaman kullanılması gerektiği

  • Ölçekte üretim: Birden fazla model, ajan veya zincir genelinde çalışırken, gözlemlenebilirlik araçları performansı izlemek ve sistem sağlığını sağlamak için gereklidir.
  • Kurumsal veya müşteriye yönelik uygulamalar: Güvenilirlik, güvenlik ve uyumluluğun tartışılmaz olduğu uygulamalar için, gözlemlenebilirlik araçları ihtiyaç duyulan görünürlüğü ve kontrolü sağlar.
  • Sürekli izleme: Zaman içinde temel betikler veya manuel kontrollerle kolayca yakalanamayan kayma, önyargı, performans ve güvenlik sorunlarını izlemeniz gerektiğinde, gözlemlenebilirlik araçları çok önemlidir.
  • Yüksek riskli senaryolar: Başarısızlık maliyetinin (örneğin, halüsinasyonlar, güvensiz çıktılar) önemli olduğu ortamlarda, gözlemlenebilirlik risklerin en aza indirilmesini ve sorunların erken tespit edilmesini sağlar.

Kıyaslama metodolojisi

Üretim LLM uygulamalarında gözlemlenebilirlik platformlarının performans yükünü değerlendirmek için, gerçek dünya ajanik iş akışı kullanarak sistematik bir kıyaslama yaklaşımı geliştirdik.

Test uygulaması

Doğal dil seyahat isteklerini beş aşamada işleyen LangChain kullanarak sıralı çok ajanlı bir seyahat planlama sistemi oluşturduk:

  1. Ayrıştırıcı ajan: Kullanıcı girdisinden yapılandırılmış verileri (kalkış, varış, tarihler, süre) çıkarır
  2. Uçuş bulucu ajan: Amadeus API'si aracılığıyla mevcut uçuşları alır
  3. Hava durumu raporlayıcı ajan: WeatherAPI kullanarak hedef hava durumu tahminlerini getirir
  4. Aktivite önerici ajan: Hava koşullarına göre aktiviteler önerir
  5. Seyahat planlayıcı ajan: Tüm çıktıları kapsamlı bir seyahat programında sentezler

Sistem, tüm LLM çağrıları için OpenRouter üzerinden Claude 4 Haiku kullanır ve gerçek zamanlı veriler için harici API'leri entegre eder.

Kıyaslama tasarımı

Temel çizgi oluşturma: İlk olarak, uygulamanın performansını herhangi bir gözlemlenebilirlik enstrümantasyonu olmadan ölçtük ve karşılaştırma için bir temel çizgi oluşturmak üzere 100 özdeş sorgu çalıştırdık.

Platform entegrasyonu: Ardından, beş önde gelen gözlemlenebilirlik platformunu (LangSmith, Laminar, AgentOps, Langfuse) sırayla entegre ettik ve tutarlılık için tüm platformlarda aynı izleme noktalarını enstrümante ettik.

Sıralı yürütme: Her platform, bir sonraki platforma geçmeden önce 100 sorgunun tamamı art arda çalıştırılarak bağımsız olarak test edildi. Bu yaklaşım, ağ koşulları veya API hız sınırları gibi dış faktörlerden kaynaklanan değişkenliği en aza indirir.

Kontrollü Ortam: Adil bir karşılaştırma sağlamak için tüm testler aynı sunucu altyapısında ve özdeş sorgu kümeleriyle yürütüldü. LLM kaynaklı gecikme değişimlerinden kaynaklanan yükü izole etmek için, modeli sıcaklık=0 ile yapılandırdık ve çalıştırmalar arasındaki yanıt değişkenliğini en aza indirmek için yapılandırılmış promptlar kullandık.

Toplanan metrikler

Her platform için, ortalama gecikmeyi ölçtük ve yükü, temel çizgiye kıyasla eklenen ek gecikme olarak hesapladık: ((Platform Latency - Base Latency) / Base Latency) × 100

SSS'ler

Gözlemlenebilirlik, günlükler, metrikler ve izler gibi harici sinyalleri inceleyerek bir yapay zeka ajanının iç işleyişini anlama yeteneğidir.

Yapay zeka ajanları için bu, sorun giderme ve performansı artırmak amacıyla eylemleri, araç kullanımını, model etkileşimlerini ve yanıtları izlemeyi içerir.

Ajan gözlemlenebilirliği, aşağıdakileri sağlayarak yapay zeka performansını izlemek ve iyileştirmek için çok önemlidir:

Ödünleşimleri anlama: Doğruluk ve maliyet gibi temel metriklerin ölçülmesine yardımcı olarak performans ile kaynak kullanımı arasında denge kurmayı kolaylaştırır.

Gecikme ölçümü: Gerçek zamanlı gecikme takibi, yanıt sürelerine dair içgörüler sunarak ajan performansının optimize edilmesine yardımcı olur.

Kötü niyetli girdilerin tespiti: Gözlemlenebilirlik, zararlı dil ve prompt enjeksiyonlarının belirlenmesine yardımcı olarak sorunları önlemek için hızlı müdahaleye olanak tanır.

Kullanıcı geri bildirimi izleme: Kullanıcı etkileşimlerini ve geri bildirimlerini gözlemleyerek, gözlemlenebilirlik ajanların sürekli iyileştirilmesi ve ince ayarı için değerli veriler sağlar.

Temel bileşenler şunları içerir:

Eylemleri izleme: Ajan tarafından atılan her adımın izlenmesi.
Araç kullanımı: Ajanın kullandığı araç ve kaynakların gözlemlenmesi.
Gecikme ölçümü: Performansı optimize etmek için yanıt sürelerinin izlenmesi.
Değerlendirmeler: Ajan davranışının ve model performansının değerlendirilmesi.
Kötü niyetli girdi tespiti: Zararlı prompt'ların veya saldırıların belirlenmesi.

Bu araştırmayı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Nazlı Şipi (2026) - "15 Yapay Zeka Ajanı Gözlemlenebilirlik Araçları: AgentOps & Langfuse". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 11 Ağustos 2026, kaynak: https://aimultiple.com/agentic-monitoring [Çevrimiçi Kaynak]

Dilmegani, C., & Şipi, N. (2026, 11 Ağustos). 15 Yapay Zeka Ajanı Gözlemlenebilirlik Araçları: AgentOps & Langfuse. AIMultiple. https://aimultiple.com/agentic-monitoring

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Şipi, Nazlı},
  title  = {{15 Yapay Zeka Ajanı Gözlemlenebilirlik Araçları: AgentOps & Langfuse}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/agentic-monitoring}},
  note   = {AIMultiple. Erişim tarihi: 11 Ağustos 2026}
}
Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple'da baş analisttir. AIMultiple, her ay Fortune 500'ün %60'ı dahil olmak üzere (similarWeb'e göre) yüz binlerce işletmeyi bilgilendirmektedir.

Cem'in çalışmaları Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır.

Cem, kariyeri boyunca teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yapmıştır. On yıldan fazla bir süre McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yapmıştır. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımlamıştır.

CEO'ya rapor verirken bir telekomünikasyon şirketinin teknoloji stratejisini ve satın alımını yönetmiştir. Ayrıca, 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetmiştir. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alınmıştır.

Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun olmuş ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Teknik olarak inceleyen
Nazlı Şipi
Nazlı Şipi
Yapay Zeka Araştırmacısı
Nazlı, AIMultiple'da veri analistidir. Çeşitli sektörlerde veri analizi konusunda önceden deneyime sahip olup, karmaşık dataset'leri eyleme dönüştürülebilir içgörülere dönüştürme üzerine çalışmıştır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450