Dört kategoride 30+ açık kaynaklı web ajanını test ettik: otonom ajanlar, bilgisayar kullanımı denetleyicileri, web kazıyıcılar ve geliştirici framework'leri.
Aynı benchmark'ları, 643 görevi 15 gerçek web sitesinde kapsayan WebVoyager test paketini kullanarak çalıştırdık; böylece hangi araçların çok adımlı web görevlerini gerçekten tamamladığını, hangilerinin dinamik açılır menüler veya JavaScript ağırlıklı düzenler kullanan sitelerde başarısız olduğunu ölçtük.
Açık Kaynaklı Web Ajanları: GitHub Yıldızları
WebVoyager Benchmark: Metodoloji
Test edilen ajanlar
Üç kriterin tümünü karşılayan ajanları dahil ettik: açıkça erişilebilir kaynak kodu, ajanın kendi yayınladığı değerlendirmede WebVoyager benchmark'ında raporlanmış bir skor ve aktif bakım (inceleme tarihimizden önceki 6 ay içinde son commit).
- Browser-Use: LLM-tarayıcı köprüsü, LangChain entegrasyonuyla DOM tabanlı
- Skyvern 2.0: Görüntü tabanlı, planlayıcı-aktör-doğrulayıcı mimari, bulut dağıtımı
- Agent-E: Yalnızca DOM, görüntü modeli yok, tam 643 görevlik dataset
- WebVoyager: Orijinal çok modlu temel, GPT-4V + DOM hibrit
Daha geniş makalede listelenen ancak yayınlanmış WebVoyager skorları bulunmayan ajanlar (Otomatik-GPT, AgenticSeek, OpenManus, LaVague ve diğerleri) mimari, dağıtım modeli ve beyan edilen yetenekler açısından niteliksel olarak değerlendirildi. Kantitatif karşılaştırmaya dahil edilmedi.
Test koşulları
Her ekip kendi değerlendirmesini çalıştırdı; testleri bağımsız olarak yeniden çalıştırmadık. Skor farklılıkları kısmen farklı test koşullarını yansıtır:
Browser-Use 586 görevi 643 görevden test etti; güncel olmayan cevaplara sahip 55 görevi (üretimi durdurulmuş Apple ürünleri, geçmiş uçuş tarihleri, silinmiş tarifler) çıkardı. Testler güvenli IP adreslerine sahip yerel makinelerde çalıştı. LangChain entegrasyonu ve yeniden yazılmış sistem prompt'ları testten önce uygulandı.
Skyvern 2.0 635 görevi 643 görevden test etti; geçersiz cevaplı 8 görevi çıkardı ve seyahat görevlerindeki 2023/2024 tarihlerini 2025 olarak güncelledi. Testler yerel makinelerde değil, asenkron bulut tarayıcıları kullanan Skyvern Cloud'da çalıştı. Bulut koşulları ajanları yerel testlerin önlediği bot algılama ve CAPTCHA zorluklarına maruz bırakır. Tam test kayıtları eval.skyvern.com adresinde mevcuttur.
Agent-E değişiklik yapmadan 643 görevlik dataset'in tamamını test etti. Yalnızca DOM ayrıştırma kullandı, görüntü modeli yok. Karşılaştırma temeli orijinal WebVoyager ajanıydı, GPT-4o değildi.
WebVoyager (orijinal) tam dataset'i GPT-4V ekran görüntüleri artı DOM kullanarak test etti. Agent-E'nin yalnızca metin kullanarak geçtiği çok modlu temel olarak hizmet eder.
Puanlama
Görev tamamlama ikilidir: ajan çok adımlı görevi ya tam olarak tamamlar ya da tamamlamaz. Kısmi kredi verilmez. Bir görev, yalnızca beklenen nihai çıktı (bir fiyat, bir rezervasyon onayı, bir arama sonucu) ground truth ile eşleştiğinde tamamlanmış olarak işaretlenir.
Geçiş oranı şu şekilde raporlanır: tasks completed / tasks attempted × 100
Ekipler dataset'ten görev çıkardığında payda, orijinal 643 değil, onların azaltılmış setini yansıtır.
Bu skorlar pratikte ne ifade eder
WebVoyager benchmark görevleri canlı web sitelerinde işbirliğine açık koşullarda çalışır; agresif bot koruması yok, Cloudflare yok, DataDome yok. Browser-Use ve Agent-E, konut düzeyinde eşdeğer IP'lere sahip yerel makinelerde çalıştı. Skyvern, üretim gerçekliğine yaklaşmak için bilinçli olarak bulut altyapısı kullandı. Korumalı üretim sitelerindeki gerçek dünya başarı oranları tüm ajanlar için benchmark skorlarından daha düşük olacaktır.
Benchmark hız, görev başına maliyet veya anti-bot önlemlerine dayanıklılığı ölçmez. %89,1 WebVoyager skoru, ajanın Cloudflare korumalı bir üretim sitesinde görevlerin %89'unu tamamlayacağı anlamına gelmez.
Sınırlamalar
Karşılaştırılamaz paydalar: Browser-Use 586 görev test etti, Skyvern 635 test etti, Agent-E 643 test etti. Daha küçük bir sette daha yüksek skor, tam sette daha düşük skorla doğrudan karşılaştırılamaz.
Kendi bildirilen sonuçlar: Tüm skorlar her ekibin kendi yayınladığı değerlendirmeden gelmektedir. Tüm ajanlarda aynı koşullarla kontrollü bir yeniden test çalıştırmadık.
Benchmark kayması: WebVoyager görev seti 2023'te yayımlandı. Birçok görev artık var olmayan ürünlere, fiyatlara ve tarihlere atıfta bulunuyor. Ekipler bunları farklı şekilde ele aldı; bazıları çıkardı, bazıları tarihleri güncelledi, bu da tutarsızlık getirdi.
Yerel ve bulut farkı: Browser-Use ve Agent-E yerel olarak test etti (güvenli IP'ler, bot algılama yok). Skyvern bulutta test etti (gerçek dünya bot korumasına maruz kalma). Doğrudan skor karşılaştırması, yerel olarak test edilen ajanlar için üretim farkını olduğundan düşük gösterir.
Maliyet veya gecikme verisi yok: Benchmark yalnızca görev tamamlamayı ölçer. Görev başına maliyet ve ortalama tamamlama süresi WebVoyager skorlarında yer almaz; oysa üretim dağıtım kararları için önemli ölçüde önemlidir.
Statik anlık görüntü: Skorlar test zamanındaki ajan sürümlerini ve web sitesi durumlarını yansıtır. Her ikisi de sık değişir; bir web sitesi tasarımı veya ajan güncellemesi sonuçları önemli ölçüdeğiştirebilir.
Son Büyük Güncellemeler
Güvenlik Krizi: OpenClaw Kötü Amaçlı Yazılım Dağıtımı
Ocak sonu ile Şubat başı arasında ClawHub'a (OpenClaw'ın pazar yeri) 400'den fazla kötü amaçlı "beceri" yüklendi ve kimlik bilgisi çalan kötü amaçlı yazılım dağıtıldı. IBM, Anthropic ve Palo Alto Networks uyarılar yayımladı. Güvenlik araştırmacıları artık yalnızca izole ortamların ve doğrulanmış kaynakların kullanılmasını öneriyor.
OpenClaw Viral Büyüme
OpenClaw (eski adıyla Moltbot/Clawdbot) 147.000 GitHub yıldızına ulaştı; en hızlı büyüyen açık kaynaklı yapay zeka projesi oldu. Yerel olarak çalışır, mesajlaşma platformlarıyla entegre olur ve 100+ hizmet için Model Context Protocol kullanır. Cloudflare, altyapısını desteklemek için Moltworker middleware'ini yayımladı.1
Moltbook: Yapay Zeka Ajan Sosyal Ağı
Yalnızca yapay zekaların bulunduğu sosyal ağ Ocak sonunda başlatıldı ve günler içinde 1.5 milyon ajana ulaştı. Ajanlar otonom olarak paylaşım yapıyor ve etkileşime geçiyor; insanlar gözlemliyor.2
Model Context Protocol Standardizasyonu
MCP, ajan-araç entegrasyonu için baskın protokol haline geldi; 100'den fazla sunucu mevcut. Yönetim ve yönetişim artık kurumsal dağıtımlar için kritik öneme sahip.
NVIDIA Nemotron 3 Modelleri
NVIDIA, ajanik yapay zeka için optimize edilmiş Nemotron 3 ailesini (Nano, Super, Ultra) yayımladı; 4x daha yüksek verimlilik sağlıyor. GitHub ve Hugging Face üzerinde NeMo Gym ve Agentic Safety Dataset içeriyor.3
Otonom Web Ajanları ve Yardımcı Pilotlar
Minimal yönlendirmeyle web sitelerinde gezinip çok adımlı görevleri tamamlayan araçlar.
Genel Amaçlı Otonom Ajanlar
OpenClaw (eski adıyla Moltbot/Clawdbot): Mesajlaşma uygulamaları, takvimler ve e-postalardaki görevleri otomatikleştirmek için bunu yerel makinenizde çalıştırın. "Gelecek salı ekiple toplantı planla ve takvim davetleri gönder" deyin; tüm iş akışını o halleder. Bulut API çağrıları olmadan 100+ hizmete bağlanmak için Model Context Protocol kullanır.
Kimler kullanır: Yerel otomasyon için güvenlik risklerini yönetmeye istekli erken benimseyenler. Masaüstü iş akışları için konuşmalı arayüzler isteyen kullanıcılar.
Sınırlamalar:
- Beceri ekosisteminde büyük güvenlik açıkları (bir haftada 400+ kötü amaçlı paket)
- Hâlâ hızlı geliştirme aşamasında ve sık sık breaking change'ler yaşanıyor
- Birden fazla yeniden markalama döngüsü nedeniyle dokümantasyon tutarsız
- Kaynak yoğun (önemli yerel hesaplama gücü gerektirir)
AgenticSeek: Bulut tabanlı ticari hizmetleri, gezinme verilerini harici sunuculara göndermeyen yerel bir alternatifle değiştirin. Makinenize kurun, neye ihtiyacınız olduğunu söyleyin ("bu sayfadaki tüm ürün fiyatlarını çıkar") ve tıklama ile veri toplamayı o halleder. Python tabanlıdır, tamamen self-hosted çalışır.
Kimler kullanır: Gezinme verilerini paylaşmak istemeyen gizlilik bilincine sahip kullanıcılar. Veri ikameti zorunlulukları olan kuruluşlar.
Sınırlamalar:
- Tek makineli eşzamanlılıkla sınırlı (5-10 tarayıcı örneği)
- Yerleşik proxy rotasyonu veya anti-tespit özellikleri yok
- Python ortam kurulumu ve bakımı gerektirir
- Büyük ölçekli görevlerde bulut çözümlerinden daha yavaştır
Otomatik-GPT: Dosya işlemleri ve kod yürütmenin yanında web gezinmesini de yönetir. Tarayıcı arayüzü veya komut satırı üzerinden dağıtın. "Rakip fiyatlarını araştır ve bir elektronik tabloya kaydet" gibi bir görev atadığınızda, hangi web sitelerini ziyaret edeceğini, hangi verileri alacağını ve çıktıyı nasıl düzenleyeceğini o belirler.
Kimler kullanır: Özel otomasyon iş akışları oluşturan geliştiriciler. Komut satırı araçlarıyla rahat çalışan kullanıcılar.
Sınırlamalar:
- Proxy rotasyonu ve cookie yönetimi gibi web'e özgü özelliklerden yoksundur
- Yerleşik bot algılamadan kaçınma yok (Cloudflare olan siteler onu engeller)
- Kaynak yoğun (birden fazla tarayıcı örneği başlatır)
- Karmaşık görevler için manuel prompt mühendisliği gerektirir
AgentGPT: Ajanları kod yazmadan doğrudan tarayıcınızda yapılandırın. Hedefleri adımlara ayıran "ResearchGPT" veya "DataGPT" gibi özel ajanlar geliştirin. Platform orkestrasyonu yönetir. Ne yapılmasını istediğinizi söylersiniz. Barındırılan sürümlerini kullanmak istemiyorsanız kendi kendinize barındırabilirsiniz.
Kimler kullanır: Basit otomasyona ihtiyaç duyan teknik olmayan kullanıcılar. Paylaşılan ajan yapılandırmaları isteyen ekipler.
Sınırlamalar:
- Kodlanmış çözümlere kıyasla sınırlı özelleştirme
- Karmaşık çok adımlı görevlerde performans darboğazları
- Barındırılan sürüm verileri sunucularına gönderir (gizlilik için self-hosting gerekir)
- Tarayıcı parmak izi alma veya CAPTCHA yönetimi gibi gelişmiş özellikler yok
SuperAGI: Yaygın iş akışları için şablonlarla özel otonom ajanlar oluşturmaya yarayan framework. Kendi mantığınızla genişletin. Daha büyük iş akışlarının bir bileşeni olarak tarayıcı otomasyonunu ele alır. Yerel olarak dağıtın veya bulut altyapısına aktarın.
Kimler kullanır: Üretim ajan sistemleri geliştiren ekipler. Özelleştirilebilir otomasyon framework'lerine ihtiyaç duyan kuruluşlar.
Sınırlamalar:
- Dik öğrenme eğrisi (ajan mimarisini anlamayı gerektirir)
- Şablon kütüphanesi hâlâ sınırlı (çoğu kullanım durumu için özel geliştirme gerektirir)
- Gelişmiş özellikler için dokümantasyon boşlukları
- Aktif geliştirme, sürümler arasında breaking change'lere neden olur
Nanobrowser: Chrome eklentisi yaklaşımı, kurun, ardından ajanları tarayıcı araç çubuğunuzdan kontrol edin. "Bu sayfadaki tüm e-postaları çıkar" veya "Bu formu elektronik tablomdaki verilerle doldur" gibi hızlı görevler için iyidir.
Kimler kullanır: Ara sıra tarayıcı otomasyonuna ihtiyaç duyan sıradan kullanıcılar. Sunucu veya Python ortamı kurmak istemeyen kullanıcılar.
Sınırlamalar:
- Birkaç sekmenin ötesine ölçeklenemez (eşzamanlı işleme yok)
- Arka uç otomasyon pipeline'larıyla entegrasyon yok
- Yalnızca Chrome tarayıcısıyla sınırlıdır
- Eklenti izinleri güvenlik endişelerine yol açar
OpenManus: Ticari tarayıcı otomasyon hizmetlerine açık kaynaklı bir alternatif. Fiyat değişiklikleri için siteleri izlemek veya ürünlerin yeniden stoklanmasını beklemek gibi saatlerce veya günlerce süren tarayıcı görevlerini çalıştırır. Python ve Docker ile yerel olarak dağıtın, arka planda çalışmaya bırakın.
Son güncelleme: DeepWisdom (OpenManus'ın ana şirketi) çekirdek ajan teknolojisini Ocak ortasında resmi olarak Atoms olarak yeniden markaladı. Yeni Atoms framework'ü, odak noktasını geliştirici hobi araçlarından, ödemeler ve kimlik doğrulama için yerleşik modüllerle ticari düzeyde ajan dağıtımına kaydırıyor.4
Kimler kullanır: Uzun süreli izleme görevleri çalıştıran kullanıcılar. Geliştiriciler otomatik bildirim sistemleri oluşturuyor.
Sınırlamalar:
- Docker ve Python kurulumu gerektirir
- Yerleşik proxy desteği yok (siteler aynı IP'den gelen tekrarlanan istekleri algılar)
- Uzun süreli görevlerde bellek sızıntıları (periyodik yeniden başlatma gerektirir)
- Atoms olarak yeniden markalama dokümantasyon karışıklığına yol açabilir
Bilgisayar Kullanımı Ajanları
Daha geniş bilgisayar iş akışlarının bir parçası olarak tarayıcıları kontrol eden masaüstü otomasyonu.
OpenInterpreter: Yazdıklarınıza dayanarak Python, JavaScript ve shell betikleri çalıştıran terminal tabanlı ajan. "Bu siteyi kazı ve veriyi pandas'ta analiz et" deyin; kazıma kodunu üretir, çalıştırır ve ardından analizi gerçekleştirir. Tarayıcı otomasyonu dosya sistemi erişimi ve veri işlemeyle bütünleşir.
Kimler kullanır: Terminal arayüzleriyle rahat çalışan geliştiriciler. Veri bilimciler web kazımayı analiz iş akışlarıyla birleştiriyor.
Ne zaman mantıklı olur: Web gezinmesi ile yerel hesaplamayı kapsayan otomasyona ihtiyacınız varsa. Çalıştırmadan önce üretilen kodu incelemek ve değiştirmek istiyorsanız. İş akışlarınız toplama sonrası veri dönüşümünü içeriyorsa.
Sınırlamalar:
- Yalnızca terminal arayüzü (GUI yok)
- Güvenlik riski (makinenizde rastgele kod çalıştırır)
- Varsayılan olarak sandbox yok (herhangi bir dosyaya veya sistem kaynağına erişebilir)
- Programcı olmayanlar için öğrenme eğrisi
UI-TARS: Masaüstünüzün ekran görüntülerini alan, bunları görüntü modelleriyle analiz eden ve ardından GUI öğelerini kontrol etmek için komutlar üreten akademiden araştırma framework'ü. Üretim kullanımı için değil, masaüstü otomasyonuna yönelik yeni yaklaşımları test etmek için geliştirilmiştir.
Kimler kullanır: Görüntü tabanlı otomasyonu keşfeden akademik araştırmacılar. Çok modlu kontrol sistemlerini test eden laboratuvarlar.
Ne zaman mantıklı olur: Görüntü tabanlı otomasyon üzerine araştırma yürütüyorsanız. Ekran görüntüsü analizi yaklaşımlarını denemeniz gerekiyorsa. GUI otomasyonu hakkında akademik makaleler yazıyorsanız.
Sınırlamalar:
- Üretime hazır değil (araştırma prototipi)
- Yüksek gecikme (görüntü modeli işleme, eylem başına 2-3 saniye sürer)
- Pahalı (GPT-4V görüntü token'ı başına ücretlendirir)
- Hata kurtarma veya yeniden deneme mantığı yok
AutoBrowser MCP: MCP sunucusu, Claude'un Model Context Protocol aracılığıyla Chrome tarayıcılarını kontrol etmesini sağlar ve görüntü tabanlı tarayıcı etkileşim yetenekleri sunar. Claude tarayıcı ekranınızı görür, neye tıklayacağına karar verir ve eylemi gerçekleştirir. Chrome eklentisi artı yerel bir sunucu olarak çalışır.
Kimler kullanır: Tarayıcı kontrolü isteyen Claude kullanıcıları. MCP tabanlı otomasyon sistemleri geliştiren geliştiriciler.
Ne zaman mantıklı olur: Zaten Claude kullanıyorsanız ve tarayıcı otomasyonu eklemek istiyorsanız. Programatik API'ler yerine konuşmalı kontrolü tercih ediyorsanız. Karmaşık düzenler için görüntü tabanlı etkileşim gerekiyorsa.
Sınırlamalar:
- Claude API erişimi gerektirir (tüm bölgelerde mevcut değildir)
- Görüntü modeli maliyetleri hızla artar
- Gecikme DOM tabanlı yaklaşımlardan daha yüksektir
- Yalnızca Chrome tarayıcısıyla sınırlıdır
Open Operator: Browser-Use ekibinin OpenAI Operator'üne cevabı. Dil modellerine basitleştirilmiş DOM görünümü aracılığıyla Chrome'a doğrudan erişim sağlar. Tam otonom modda çalıştırın veya her eylemi yürütmeden önce onayladığınız onay modunu etkinleştirin. Python veya tarayıcı eklentisiyle kurulur.
Son güncelleme: Browser-Use, Ocak sonunda Parallel AI ile stratejik entegrasyonu duyurdu; bu, çok iş parçacıklı web aramalarını mümkün kıldı. Güncelleme, ajanların dakikada 20 tarayıcı adımına kadar yürütmesini sağlar; bu, karmaşık araştırma görevlerinde insan performansını yakalar veya geçer.5
Kimler kullanır: Halihazırda Browser-Use framework'ünü kullanan ekipler. Ajan eylemleri için onay iş akışları isteyen kuruluşlar.
Ne zaman mantıklı olur: İnsan gözetimiyle otonom gezinmeye ihtiyacınız varsa. İş akışlarınız hız gerektiriyorsa (çok iş parçacıklı yürütme). Browser-Use ekosistemi üzerine inşa ediyorsanız.
Sınırlamalar:
- Browser-Use framework kurulumu gerektirir
- Onay modu otomasyonu önemli ölçüde yavaşlatır
- Sınırlı anti-tespit özellikleri (bot koruması olan siteler onu engeller)
- Yalnızca Python (JavaScript/TypeScript desteği yok)
Cowork (Anthropic): Anthropic'in, birleşik bir uygulama içinde Claude'a dosya sistemlerine ve tarayıcı ortamlarına doğrudan erişim veren masaüstü aracı. Computer Use API'sini tüketiciye yönelik bir ürüne dönüştürür. İndirilebilir; artık araştırma önizlemesiyle sınırlı değildir. Karşılaştırma için açık kaynak alternatifleri ile birlikte buraya dahil edilmiştir.
Web Navigasyon Ajanları
Özellikle çok adımlı web sitesi iş akışlarına odaklanırlar.
Agent-E: Tıklanabilir öğeleri ve navigasyon yollarını bulmak için sayfa HTML'ini okur. Sayfaları temel etkileşimli öğelere indirgemek için "DOM Distillation" ve başarılı kalıpları hatırlamak için "Skill Harvesting" kullanır. Görüntü modeli olmadan saf metin kullanarak WebVoyager benchmark'ında %73,1 skor elde etti.
Kimler kullanır: Maliyeti doğruluktan önce tutan kuruluşlar. DOM tabanlı otomasyon sistemleri geliştiren geliştiriciler.
Ne zaman mantıklı olur: Statik web sitelerinde hızlı ve ucuz otomasyona ihtiyacınız varsa. Hedef siteleriniz JavaScript ağırlıklı dinamik formlar kullanmıyorsa. Daha düşük maliyet karşılığında %73 başarı oranını tolere edebiliyorsanız.
Sınırlamalar:
- DOM yapısı beklenmedik şekilde değiştiğinde yerleşik hata kurtarma yok
- Açılır menülerin seçimlere göre yeni seçenekler gösterdiği dinamik formlarda zorlanır
- JavaScript ağırlıklı sitelerde performans önemli ölçüde düşer
- Rezervasyon sitelerinde kötü sonuçlar
AutoWebGLM: HTML'i dil modellerine vermeden önce basitleştirir. Karmaşık sayfalar çekirdek navigasyon öğelerine ve form alanlarına indirgenir. Zamanla navigasyon kararlarını iyileştirmek için reinforcement learning kullanır. Python ile self-hosted olarak çalışır.
Kimler kullanır: RL tabanlı web otomasyonunu araştıran araştırma ekipleri. Model eğitimi için hesaplama kaynaklarına sahip kuruluşlar.
Ne zaman mantıklı olur: Belirli web siteleriniz için özel modeller eğitmeye yatırım yapabilirsiniz. İş akışlarınız RL optimizasyonundan faydalanacak kadar tekrarlıysa. Python makine öğrenimi altyapınız varsa.
Sınırlamalar:
- Sınırlı dokümantasyon ve topluluk desteği
- Dağıtımdan önce eğitim aşaması gerektirir (tak ve çalıştır değildir)
- Etkili politikaları öğrenmek için önemli örnekler gerektirir
- Web siteleri düzenleri yeniden tasarladığında bozulur
Görüntü Tabanlı Navigasyon Ajanları
Görsel sayfa düzenini yorumlamak için ekran görüntülerini metin analiziyle birleştirir.
Autogen WebSurfer Extension: Web gezinmesi eklemek için Microsoft'un AutoGen framework'üne takın. Playwright kurulumu gerektirir. Framework, ajan ekipleri oluşturmanıza olanak tanır; bir ajan arama yaparken diğeri sonuçları işler, üçüncüsü sizinle etkileşime geçer.
Kimler kullanır: Halihazırda AutoGen framework'ünü kullanan ekipler. Microsoft ekosistemi kullanıcıları.
Ne zaman mantıklı olur: AutoGen içinde çok ajanlı sistemler oluşturuyorsanız. Orkestre edilmiş ajan işbirliğine ihtiyacınız varsa. Microsoft desteği ve dokümantasyonunu istiyorsanız.
Gerçek sınırlamalar:
- Sınırlı örnek ve topluluk projeleri
- Tüm AutoGen framework'ünü benimsemeyi gerektirir (tek başına kullanılamaz)
- Basit otomasyon görevleri için framework ek yükü buna değmez
- Çok ajanlı orkestrasyon için dik öğrenme eğrisi
Skyvern: Üç aşamalı sistem: planlayıcı görevleri adımlara ayırır, aktör bunları yürütür, doğrulayıcı başarıyı onaylar. Düğmeleri ve formları görsel olarak belirlemek için ekran görüntüleri alır. Bu yaklaşım, DOM'un sayfa yüklendikten sonra değiştiği JavaScript ağırlıklı siteleri ele alır. WebVoyager'da %85,85 skor elde etti. Self-hosted olarak dağıtın veya yönetilen bulutlarını kullanın.
WebVoyager: WebVoyager test paketini tanıtan 2024 makalesindeki orijinal benchmark ajanı. Hibrit bir yaklaşımda DOM ayrıştırma ile birlikte GPT-4V ekran görüntülerini kullanır. Tam 643 görevlik dataset'te %57,1 skor aldı; bu, sonraki ajanların kendilerini ölçtüğü temel skordur. Üretim aracı olarak aktif şekilde bakımı yapılmıyor; değeri bir araştırma referansı ve benchmark çıkış noktası olmasındadır.
Kimler kullanır: Modern web uygulamalarında yüksek doğruluğa ihtiyaç duyan kuruluşlar. Daha iyi sonuçlar için görüntü modeli maliyetlerini ödemeye istekli ekipler.
Ne zaman mantıklı olur: Hedef siteleriniz yoğun JavaScript ve dinamik düzenler kullanıyorsa. %85+ doğruluğa ihtiyacınız varsa. DOM ayrıştırmadan 10-20x daha yüksek maliyeti karşılayabiliyorsanız. İş akışlarınız bulut altyapısını haklı çıkarıyorsa.
Sınırlamalar:
- Self-hosted sürüm görüntü modelleri için önemli hesaplama gücü gerektirir
- Pahalı (GPT-4V görüntü token'ı başına ücretlendirir; her sayfa görünümü DOM ayrıştırmadan 10-20x daha pahalıdır)
- DOM yaklaşımlarından daha yavaştır (görüntü işleme için sayfa başına 2-3 saniye)
- Bulut dağıtımı sizi bot algılamaya maruz bırakır
LiteWebAgent: DevTools Protocol üzerinden Chrome'u kontrol eden, bellek ve planlama özellikli görüntü dil modeli. Sayfa yüklemeleri arasında bağlamı korur; navigasyon kararları verirken önceki sayfalarda gördüklerini hatırlar. Python framework'ü, self-hosted dağıtım.
Kimler kullanır: Özel görüntü tabanlı ajanlar geliştiren geliştiriciler. Sayfalar arası belleğe ihtiyaç duyan ekipler.
Ne zaman mantıklı olur: İş akışlarınız birden fazla sayfa boyunca bilgileri hatırlamayı gerektiriyorsa. Görüntü yeteneklerine ihtiyacınız varsa ancak Skyvern'den daha fazla kontrol istiyorsanız. Python makine öğrenimi altyapısını sürdürebiliyorsanız.
Sınırlamalar:
- Görüntü modelleri için önemli hesaplama gücü gerektirir
- Bellek mimarisi karmaşıklığı ve hata modlarını artırır
- Bot algılamalı üretim web sitelerinde sınırlı test
- Küçük topluluk (alternatiflerden daha az örnek ve entegrasyon)
Ajan etkinleştirme araçları
LLM'lerin veya kullanıcıların otonom görev planlaması olmadan tarayıcılara komut göndermesini sağlayan framework'ler.
Doğal Dilden Web Eylemine
LaVague: "Yeşil düğmeye tıkla" dersiniz. LaVague onu bulur ve tıklar. Farklı sayfa düzenlerinde öğe tanımlamayı ele alır. Tam olarak ne istediğinizi bildiğiniz ancak seçici yazmak istemediğiniz tekrarlayan görevler için iyidir. Python tabanlıdır, self-hosted çalışır.
ZeroStep: Konuşma talimatlarını Playwright test koduna dönüştürür. Eylemi düz İngilizce ile tanımlarsınız, Playwright komutlarını o üretir. Zaten Playwright kullanıyorsanız test yazmayı hızlandırır. Node.js CLI aracıdır.
LLM-Tarayıcı Köprüleri
Dil modellerini doğrudan tarayıcı kontrollerine bağlar.
Browser-Use: Dağınık DOM'u alır ve LLM'ler için yeniden yapılandırır. İlgisiz öğeleri çıkarır, etkileşimli bileşenleri etiketler ve kontrol arayüzleri sağlar. Browser-Use'ın WebVoyager'da %89,1 skor elde etmesini sağlayan budur. Python kütüphanesi veya API olarak sunulur; self-hosted dağıtın veya bulutlarını kullanın.
Browserless: REST veya WebSocket ile kontrol ettiğiniz uzak Chrome örnekleri. Altyapı yönetmeden bulutta yüzlerce tarayıcı başlatın. Her tarayıcı headless çalışır, böylece GUI ek yükü olmaz. Barındırılan API'lerini veya self-hosting için Docker'ı kullanın.
ZeroStep (Playwright AI): Playwright üzerinde yapay zeka katmanı. Seçici yerine prompt yazın. Öğeleri tanımlamak için Playwright'ın güvenilirliğini LLM esnekliğiyle birleştirir. Node.js ve Playwright kurulumu gerektirir.
Web Otomasyonu ve Kazıma Araç Setleri
Her işi ayrı ayrı başlattığınız göreve özgü araçlar.
Tarayıcı Otomasyonu Eklentileri
PulsarRPA: Veri çıkarma için Chrome eklentisi. Bir tabloya veya listeye işaret edin, neyi çıkaracağınızı gösterin; gerisini o halleder. Zamanlama ve sonuçları saklama için arka uç içerir.
Kimler kullanır: Düzenli veri çıkarmaya ihtiyaç duyan teknik olmayan kullanıcılar. İş analistleri verileri elektronik tablolara çekiyor.
Ne zaman mantıklı olur: Aynı sitelerden tekrar veri çıkarıyorsanız. Kod yazmak istemiyorsanız. Zamanlama ve sonuç depolamasına ihtiyacınız varsa. Hedef siteleriniz tarayıcı eklentilerini engellemiyorsa.
Sınırlamalar:
- Yalnızca Chrome (Firefox veya Safari yok)
- Hedef siteler düzen değiştirdiğinde bozulur
- Proxy desteği yok (siteler aynı IP'den tekrarlanan istekleri algılar)
- Yalnızca tablo halindeki veri çıkarmayla sınırlıdır
VimGPT: GPT-4 Vision'ın tarayıcınızı Vimium klavye kısayollarıyla kontrol ettiği deneysel proje. Model ekran görüntülerini görür ve klavye komutları üretir.
Kimler kullanır: Görüntü + klavye kontrolünü araştıran araştırmacılar. Vim meraklıları yapay zeka otomasyonunu merak ediyor.
Ne zaman mantıklı olur: Klavye odaklı otomasyon üzerine araştırma yürütüyorsanız. Görüntü modellerinin yeteneklerini anlamaya çalışıyorsanız. Üretim otomasyonu dağıtmıyorsanız.
Sınırlamalar:
- Yalnızca deneysel (gerçek işler için pratik değildir)
- Vimium eklentisi artı Python arka ucu gerektirir
- Yüksek gecikme (görüntü işleme + komut üretimi)
- Pahalı (ekran görüntüsü başına GPT-4V maliyeti)
Yapay Zeka Kazıyıcılar ve Tarayıcılar
Crawl4AI: Bir sayfada neyin önemli olduğuna karar vermek için LLM'leri kullanan bir tarayıcı. Her şeyi almak yerine hedefinize göre ilgili içeriği belirler. Python tabanlıdır, standart kazıma kütüphaneleriyle entegre olur.
Son büyüme: GitHub trending'de 1 numaraya ulaştı ve 58.000 yıldızı geçti. Markdown çıktısı ve BM25 içerik filtreleme ile LLM entegrasyonu için optimize edilmiştir. Yerel öncelikli dağıtım gerektiren RAG pipeline'ları için popüler bir seçimdir.6
Kimler kullanır: RAG sistemleri geliştiren geliştiriciler. API maliyeti olmadan yerel LLM desteğine ihtiyaç duyan ekipler.
Ne zaman mantıklı olur: Web verilerine ihtiyaç duyan LLM uygulamaları oluşturuyorsanız. Markdown formatında çıktı istiyorsanız. Bulut API bağımlılığı olmadan yerel dağıtım istiyorsanız. Kullanım durumunuz içerik filtreleme ve alaka sıralamasını içeriyorsa.
Sınırlamalar:
- Yerel olarak veya API aracılığıyla çalışan LLM gerektirir (tek başına değildir)
- Geleneksel kazıyıcılardan daha yavaştır (sayfa başına LLM işleme)
- LLM yanlış karar verirse önemli içeriği kaçırabilir
- Kural tabanlı kazıyıcılardan daha yüksek kaynak kullanımı
FireCrawl: Web sitelerini temiz Markdown veya JSON'a dönüştürür. Navigasyonu, JavaScript render etmeyi ve içerik çıkarmayı ele alır. LLM bağlam pencerelerine beslemek için yapılandırılmış çıktı verir. Node.js kütüphanesi veya CLI.
Kimler kullanır: LLM uygulama geliştiricileri. Web içeriğini işleyen yapay zeka sistemleri geliştiren ekipler.
Ne zaman mantıklı olur: LLM işleme için temiz metin çıkarmaya ihtiyacınız varsa. Hedef siteleriniz JavaScript render kullanıyorsa. Yapılandırılmış çıktı (Markdown/JSON) istiyorsanız. Node.js uygulamaları geliştiriyorsanız.
Sınırlamalar:
- Yalnızca Node.js (Python bağlamaları yok)
- Görüşlü Markdown dönüşümü (ihtiyacınız olan biçimlendirmeyi kaybedebilir)
- Çıkarma kurallarının sınırlı özelleştirilmesi
- Yerleşik hız sınırlama veya anti-tespit yok
GPT-crawler: Siteleri tarar ve özel GPT'ler için eğitim verisi üretir. Dokümantasyona veya bilgi tabanına yönlendirin; içeriği çıkarır ve fine-tuning için biçimlendirir. Python CLI aracıdır.
Kimler kullanır: Özel GPT modelleri geliştiren ekipler. Alana özgü yapay zeka asistanları oluşturan kuruluşlar.
Ne zaman mantıklı olur: Dil modellerini fine-tune ediyorsanız. Web kaynaklarından yapılandırılmış eğitim verisine ihtiyacınız varsa. İçeriğiniz dokümantasyon veya bilgi tabanlarıysa. Python CLI araçlarını çalıştırabiliyorsanız.
Sınırlamalar:
- Çıktı formatı GPT fine-tuning'e özeldir (genel amaçlı değildir)
- Artımlı güncelleme yok (güncellemeler için tüm siteyi yeniden tarar)
- Kimlik doğrulama veya ödeme duvarlarını ele alma sınırlıdır
- Statik içerik yapısı varsayar
ScrapeGraphAI: Taranan içerikten bilgi grafikleri oluşturur. Kavramlar arasındaki ilişkileri anlamanız gereken dokümantasyon siteleri için iyidir. Yapılandırılmış özetler veya olgu grafikleri çıkarır. Python dağıtımı.
Kimler kullanır: Bilgi yönetimi ekipleri. Araştırmacılar web içeriğinden kavram haritaları oluşturuyor.
Ne zaman mantıklı olur: Yalnızca içerik değil, ilişki çıkarımına ihtiyacınız varsa. Hedef siteleriniz dokümantasyon veya eğitim içeriğiyse. Bilgi tabanları veya kavram haritaları oluşturuyorsanız. Python altyapınız varsa.
Sınırlamalar:
- Karmaşık kurulum (grafik veritabanı ve NLP modelleri gerektirir)
- Basit kazıyıcılardan daha yavaştır (varlık çıkarma + ilişki eşleme)
- Kalite, kaynak içerik yapısına bağlıdır
- Metinle sınırlıdır (tabloları veya görüntüleri iyi işlemez)
AutoScraper: Örnekle öğrenen kazıyıcı. İstediğiniz verinin bulunduğu bir sayfayı gösterin; kalıbı anlar ve benzer sayfalara uygular. Basit çıkarma görevleri için hafif Python kütüphanesi.
Kimler kullanır: XPath veya CSS seçicileri yazmadan hızlı çıkarma yapmak isteyen geliştiriciler. Kazıma iş akışlarını prototipleyen ekipler.
Ne zaman mantıklı olur: Hedef sayfalarınız tutarlı kalıplar izliyorsa. Seçicileri elle yazmak istemiyorsanız. Hızlı prototiplere ihtiyacınız varsa. Siteleriniz düzeni sık sık değiştirmiyorsa.
Sınırlamalar:
- Sayfa düzenleri değiştiğinde bozulur
- Benzer sayfa yapılarıyla sınırlıdır (farklı sitelere genelleme yapamaz)
- JavaScript render desteği yok
- Basit kalıp eşleme (içerik hakkında yapay zeka muhakemesi yok)
LLM Scraper: Bir sayfayı LLM'e gönderin ve "Tüm ürün fiyatlarını çıkar" veya "İletişim bilgilerini bul" diye sorun. Model niyetinizi yorumlar ve ilgili verileri çeker. Esnektir ancak kural tabanlı kazıyıcılardan daha pahalıdır. Python tabanlıdır.
Kimler kullanır: Kural yazmadan esnek çıkarmaya ihtiyaç duyan ekipler. Tek seferlik çıkarma görevleri geliştiren geliştiriciler.
Ne zaman mantıklı olur: Sayfa yapıları kural tabanlı çıkarma için fazla değişkense. Anlamsal anlayışa ihtiyacınız varsa ("yazarın adını bul"). Maliyet birincil endişeniz değilse. Seçici mühendisliği olmadan hızlı geliştirme istiyorsanız.
Sınırlamalar:
- Pahalı (sayfa başına LLM API maliyetleri)
- Kural tabanlı kazıyıcılardan daha yavaştır (API gecikmesi)
- Prompt net değilse yanlış veri çıkarabilir
- Sayfalar arasında tutarlı alan çıkarımı garantisi yok
Yapay Zeka Arama Araçları
BingGPT: Bing aramasını GPT yanıtlarıyla birleştiren sohbet arayüzü. Soru sorun, kaynaklı yanıtlar alın. Masaüstü uygulamasıdır, tarayıcı tabanlı değildir.
BraveGPT: Yapay zeka tarayıcı eklentisi Brave Search sonuçlarına GPT yanıtları ekler. Hem geleneksel arama sonuçlarını hem de yapay zeka özetini yan yana görürsünüz. Doğrudan arama sayfalarının üzerine yerleşir.
Geliştiriciler için Web Kontrol Framework'leri
Programatik tarayıcı kontrolü için düşük seviyeli kütüphaneler.
Test Framework'leri
Playwright: Microsoft'un çapraz tarayıcı otomasyonu. Chromium, Firefox, WebKit'i destekler. Yerleşik bekleme, ağ yakalama ve mobil emülasyon. JavaScript, Python, .NET ve Java'da mevcuttur. Modern web testleri için endüstri standardıdır.
Selenium: Orijinal tarayıcı otomasyon framework'ü. Tüm büyük tarayıcılarda çalışır. Daha büyük ekosistem ancak daha eski mimari. Python, Java, C#, Ruby ve daha fazlası için dil bağlamaları. WebDriver protokol standardı.
taiko: Okunabilir sözdizimine sahip ThoughtWorks framework'ü. Test okunabilirliğinin önemli olduğu fonksiyonel testler için iyidir. Yalnızca Node.js.
Otomasyon Kütüphaneleri
Puppeteer: Google'ın Chrome/Chromium kontrol kütüphanesi. Ekran görüntüleri, PDF üretimi ve kazıma için yüksek seviyeli API. Node.js ekosistemi TypeScript ile çalışır. Headless Chrome otomasyonu için standart seçimdir.
Browser-Use: Daha önce LLM köprüsü olarak listelenmişti, ancak geliştirici otomasyon kütüphanesi olarak da çalışır. DOM'u yapılandırılmış bir biçime dönüştürür, navigasyonu ve etkileşimi ele alır. API seçeneğiyle Python kütüphanesi.
Bu Web Ajanlarını Farklı Kılan Nedir?
Browser-Use WebVoyager testlerinde %89,1 skor alırken, Agent-E tam dataset'te %73,1 skor elde etti. Browser-Use LangChain entegrasyonuyla otonom görev planlaması kullanır. Agent-E görüntü modeli olmadan DOM yapısını doğrudan ayrıştırır; bu daha hızlı çalışır ancak web siteleri dinamik açılır menüler kullandığında veya kullanıcı seçimlerine göre yeni seçenekler gösterdiğinde zorlanır.
Otonomi Seviyeleri
Tam otonom ajanlar Browser-Use, Skyvern ve Agent-E gibi üst düzey hedefleri ("en ucuz Paris uçuşunu bul") kabul eder ve kendi navigasyon adımlarını planlar. Cookie banner'ları veya captcha'lar gibi beklenmedik öğelere uyum sağlarlar. Ancak her karar bir LLM çağrısı gerektirir; bu da hem maliyeti hem yanıt süresini artırır.
Adım adım yönlendirme araçları LaVague ve ZeroStep gibi belirli komutları yürütür ("arama düğmesine tıkla", "2. alana metin gir"). Planlama ek yükünü atladıkları için daha hızlıdır. Ancak bir site düzenini yeniden tasarlarsa talimatları elle güncellemeniz gerekir.
Manuel kodlama framework'leri Playwright ve Selenium gibi her tıklama, form doldurma ve navigasyon için açık kod gerektirir. Bir site öğe kimliğini veya sınıf adını değiştirene kadar testler her seferinde aynı şekilde çalışır. Sonra seçiciler bozulur ve kodu yeniden yazarsınız.
Sayfaları Nasıl Yorumlarlar?
Görüntü tabanlı işleme: Skyvern 2.0, WebVoyager ve VimGPT ekran görüntüleri alır ve bunları GPT-4V gibi görüntü modellerine gönderir. Düğmeleri ve formları render edilmiş sayfaya bakarak tanımlarlar.
Skyvern 2.0 aslında bir planlayıcı-aktör-doğrulayıcı döngüsü kullanır. Planlayıcı karmaşık görevleri daha küçük hedeflere ayırır, aktör bunları yürütür ve doğrulayıcı her hedefin başarılı olup olmadığını onaylar. Bu üç aşamalı yaklaşım Skyvern'in %45'ten (tek prompt sürümü) %68,7'ye (planlayıcıyla) ve %85,85'e (eylemlerin gerçekten işe yarayıp yaramadığını kontrol eden doğrulayıcıyla) yükselmesine yardımcı oldu.
Görüntü işleme, DOM'un sayfa yüklendikten sonra yeniden oluştuğu JavaScript ağırlıklı sitelerde çalışır. Ancak GPT-4V görüntü token'ı başına ücretlendirir; bu da her sayfa görünümünü HTML okumaya kıyasla 10-20x daha pahalı hale getirir. Görüntü modelleri ayrıca DOM ayrıştırmaya kıyasla sayfa başına 2-3 saniye ekler.
DOM ayrıştırma: Browser-Use ve Agent-E sayfa HTML'ini doğrudan okur. Kodu tıklanabilir öğeler, girdi alanları ve navigasyon bağlantıları için tararlar.
Agent-E karmaşık sayfaları temel öğelere indirgemek için "DOM Distillation" ve başarılı etkileşim kalıplarını hatırlayıp yeniden kullanmak için "Skill Harvesting" kullanır. Yalnızca metin kullanarak Huggingface, Apple ve Amazon gibi sitelerde çok modlu WebVoyager ajanını (görüntü kullanan) geçti. Ancak Agent-E'nin planlaması, web siteleri dinamik olarak yeni seçenekler ortaya çıkardığında (seçimlerinize göre değişen açılır menüler gibi) senkronizasyondan çıkar.
DOM ayrıştırma daha az maliyetlidir ve daha hızlı çalışır. Browser-Use'ın %89,1 doğruluğu kısmen LangChain entegrasyonundan ve güncellenmiş prompt'lardan gelir; yalnızca görüntü çağrılarını atlamaktan değil. Ancak DOM yaklaşımları siteler shadow DOM, gizlenmiş sınıf adları veya yoğun JavaScript manipülasyonu kullandığında zorlanır.
Birleşik yaklaşım: LiteWebAgent ve AutoWebGLM yapı için DOM'u ayrıştırır, ardından kullanıcıların gerçekte ne gördüğünü doğrulamak için görüntüyü kullanır. Yalnızca DOM'dan daha doğru, saf görüntüden daha ucuzdur; ancak sayfa başına iki sistem çalıştırırsınız.
Uzmanlaşma
Otomatik-GPT ve AgenticSeek web gezinmesinin yanında dosya işlemleri ve kod yürütmeyi de ele alır. Proxy rotasyonu ve cookie yönetimi gibi web'e özgü özelliklerden yoksundurlar; bu da bot algılamalı sitelerde etkinliği sınırlar.
Agent-E ve WebVoyager yalnızca web navigasyonu yapar. Agent-E tam 643 görevlik WebVoyager dataset'inde genel olarak %73,1 skor elde etti; çok modlu WebVoyager ajanının %57,1 skorunu geçti. Wolfram (%95,7), Google Search (%90,7) ve Google Maps (%87,8) gibi sitelerde güçlü performans gösterdi. Dinamik sitelerde zayıf: açılır menüler ve form alanları kullanıcı seçimlerine göre değiştiği için Booking.com'da yalnızca %27,3 ve Google Flights'ta %35,7.
Crawl4AI ve FireCrawl veri çıkarır ve sayfaları Markdown veya JSON'a dönüştürür. Form doldurmaz veya iş akışlarını tıklamaz. Çok adımlı görevleri tamamlamanız gerektiğinde değil, içeriği yapılandırılmış formatla istediğinizde kullanın.
Playwright ve Selenium tarayıcı testini otomatikleştirir. Çalıştırmalar arasında aynı sonuçları üretir; bu, regresyon testleri için gereklidir. Ancak bu determinizm uyum sağlayamadıkları anlamına gelir. Bir site değiştiğinde test paketiniz bozulur.
Dağıtım Seçenekleri
Yerel yürütme: AgenticSeek, Nanobrowser ve OpenInterpreter makinenizde çalışır. Gezinme verileriniz yerelde kalır ve API maliyetlerinden kaçınırsınız. Ancak tipik bir iş istasyonu CPU/RAM dolmadan önce 5-10 eşzamanlı tarayıcı örneğini yönetir.
Bulut API'ler: Browserless REST veya WebSocket üzerinden uzak Chrome örnekleri sağlar. Otomatik proxy rotasyonuyla yüzlerce paralel oturum başlatabilirsiniz. Her istek yerel tarayıcılara kıyasla 100-300ms gecikme ekler; Docker ile self-host yapmadığınız sürece trafiğiniz onların sunucularından geçer.
Esnek dağıtım: Skyvern geliştirme sırasında yerel olarak çalışır, ardından üretim için buluta dağıtır. Benchmark'ları aslında Skyvern Cloud'da (yerel makinelerde değil) gerçek dünya koşullarını test etmek için asenkron bulut tarayıcıları ve gerçekçi IP adresleriyle çalıştı. Çoğu benchmark güvenli yerel IP'lerde ve iyi tarayıcı parmak izleriyle çalışır; bu da üretim gerçekliğiyle eşleşmez.
Entegrasyon Desenleri
AutoGen'in WebSurfer'ı Microsoft'un tüm çok ajanlı framework'ünü benimsemeyi gerektirir. Yerleşik ajan orkestrasyonu ve bellek yönetimi elde edersiniz, ancak mevcut sistemlerle kolayca entegre edemezsiniz.
Browser-Use ve Playwright bağımsız kütüphaneler olarak çalışır. Bunları herhangi bir Python veya Node.js projesine ekleyin. Ancak kendi ajan koordinasyonunuzu, hata yönetiminizi ve sonuç depolamanızı oluşturmanız gerekir.
Nanobrowser ve BraveGPT Chrome eklentisi olarak kurulur. Sunucu kurulumu gerekmez; tarayıcıya ekleyin ve başlayın. Birkaç eşzamanlı sekmenin ötesine ölçeklenemez ve arka uç otomasyon pipeline'larıyla entegre olmaz.
Üretimde Dikkat Edilecekler
Skyvern ve Browserless yerleşik residential proxy desteği, rastgele fare hareketleri ve tarayıcı parmak izi rotasyonu içerir. Bu özellikler korumalı sitelerde IP yasaklarını ve CAPTCHA tetikleyicilerini önler.
WebVoyager ve AutoWebGLM navigasyon algoritmalarına odaklanır. Agent-E yalnızca metin DOM ayrıştırma kullanarak %73,1 skor elde etti; WebVoyager'ın %57,1 çok modlu yaklaşımını geçti. Ancak Cloudflare veya DataDome olan üretim siteleri, uygun anti-tespit olmadan ajanları engeller.
Önemli benchmark bağlamı: Browser-Use ve Agent-E testleri güvenli IP adresleriyle yerel olarak çalıştırdı. Skyvern, bot algılama, tarayıcı parmak izi alma ve CAPTCHA zorluklarıyla karşılaştığınız gerçek üretim koşullarına uyum sağlamak için testlerini bilinçli olarak bulut altyapısında çalıştırdı. Benchmark testlerinin kendileri agresif bot koruması olmayan işbirliğine açık sitelerde çalışır; bu nedenle gerçek dünya başarı oranları bu sayıların gösterdiğinden daha düşük olacaktır.
Benchmark kaynakları
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{'da En İyi 30+ Açık Kaynaklı Web Ajanları}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/open-source-web-agents}},
note = {AIMultiple. Erişim tarihi: 1 Eylül 2026}
}Değişiklik günlüğü
5 güncelleme- 2026
GitHub Yıldızları grafiğinden önceki kategori dökümü listesi kaldırıldı.
Ek web siteleri ve görev türleri ile "Web Voyager Benchmark Sonuçları" bölümü genişletildi.
Yeni karşılaştırma sonuçları ve metodoloji detayları ile "Değerlendirme: Web Voyager Karşılaştırması" bölümü güncellendi.
- 2025
Genişletilmiş "Bu Web Ajanlarını Farklı Kılan Nedir" bölümü.
Giriş güncellendi, web araması ve tarayıcı otomasyon görevlerinde 8 MCP sunucusunun bir karşılaştırması eklendi.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.