Hizmetler
Bize Ulaşın
Açık Dünya Değerlendirmesi

Web Arşiv API'leri: Test Edilip Karşılaştırılan En İyi 4 Sağlayıcı

Nazlı Şipi
Nazlı Şipi
Güncellenme tarihi: 10 Ağu 2026

Bir web arşivi, siz istemeden önce toplanmış sayfaları tutar; böylece siteleri kendiniz taramadan bunları çekebilirsiniz. Her sağlayıcının ne depoladığı ve bunların ne kadarını teslim edeceği büyük ölçüdeğişir.

Nasıl çalıştıklarını ve ne döndürdüklerini görmek için bunlardan 4'ünü örnek sorgularla test ettik.

Web arşiv API'leri özellik karşılaştırması

  • Ham HTML mevcut: sunucunun gönderdiği sayfa işaretlemesi. Webz.io'nun şartları “tam HTML sayfaları”ndan bahseder, ancak arşiv bir text alanı döndürür ve ham dosyalar üzerinde hiçbir hak vermez.
  • Kendi depolama alanınıza toplu teslimat: kontrol ettiğiniz bir hedefe yazılan filtrelenmiş bir seçim. Common Crawl'ın derlemi indirmeniz için genel S3 üzerinde durur; hiçbir yere hiçbir şey gönderilmez. Webz.io yalnızca kendi API'si aracılığıyla teslimat yapar.
  • Canlı veri çekme aynı sağlayıcıdan: yalnızca arşiv endpoint'ini değil ürün ailesini kapsar; böylece tek bir tedarikçinin hem arşivlenmiş hem de hiç arşivlenmemiş sayfaları kapsayıp kapsayamayacağını yanıtlar. Exa, yedek seçeneğin aynı çağrının içinde yer aldığı tek sağlayıcıdır.

Fiyat ve ücretsiz krediler

Bright Data $0,2 / 1.000 sayfa, son 24 saate ait veriler için ve daha eski olanlar için $1 / 1.000 sayfa ücret alır. Exa $7 / 1.000 arama ücreti alır; sayfa fiyatına ek olarak, 1.000 sayfayı almadan önce bulmak kabaca $0,70 ekler ve bu da iki özdeş $1 rakamının pratikte farklı davranmasına yol açar.

Ücretsiz krediler veri teslimatını karşılar: dördünde de sorgulama ücretsiz'dir; bu nedenle fark, ücretsiz kredilerin veriyi dışarı almak için de ödeme yapıp yapmadığıdır. Bright Data günde 100 arşiv aramasına ücretsiz izin verir; her biri herhangi bir ücret alınmadan önce eşleşen kayıt sayısını ve teslimat fiyatını döndürür; böylece bir iş ücretsiz olarak boyutlandırılabilir. Webz.io aynı şekilde çalışır; ücretsiz bir örnek ve maliyet tahmini sunar, ancak bir döküm ayrı olarak satın alınmış ön ödemeli krediler gerektirir. Common Crawl ve Exa, ücretsiz kredilerin gerçek alım için ödeme yapmasına izin verir.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Web arşivleme API'leri

Bright Data Web Arşiv API altyapısının Unlocker ve SERP API'leri aracılığıyla zaten topladığı sayfalara erişim satar. Bir tarayıcı çalıştırmak yerine, ne istediğinizi filtrelerle tanımlar, maliyet tahminini inceler ve eşleşen sayfaları kendi depolama alanınıza teslim aldırırsınız.

Filtreler

Her şey 20 alanlı tek bir filters nesnesi üzerinden yürür: zaman aralığı, alan adı, URL deseni, kategori, dil, ülke ve toplama sonucu. Zaman zorunludur ve kategori 30 değerden oluşan kapalı bir listedir; böylece sayfalar girişte sınıflandırılır.

İki alan, sayfanın içeriğinden çok nasıl toplandığını tanımlar. ip_country, sayfayı toplayan çıkış IP'sinin ülkesine göre filtreler; bu da arşivin proxy ağının bir yan ürünü olduğunu doğrular. captcha ve robots_block yalnızca CAPTCHA tetiklenen veya robots kuralı uygulanan kayıtları döndürür; böylece engellenen denemeler atılmak yerine saklanır.

Arama ve maliyet

Arama ücretsiz'dir, günde 100 sorguya kadar ve yanıt, ödeme yapmadan önce bir işi boyutlandırmak için gereken her şeyi taşır: eşleşen kayıt sayısı, tahmini teslimat maliyeti ve 24 saatlik önbellek katmanına karşı arşiv katmanında kaç sayfa bulunduğunu gösteren bir dağılım.

  • Tarayıcıları engelleyen sitelerin kapsamı: Common Crawl aylık tüm bir taramada zillow.com için sıfır sayfa tutar. Bright Data 13.282 kayıt döndürdü; bu, tek bir 24 saatlik pencerede gerçekleşti.
  • Sorgu hızı pencereyle ölçeklenir: redfin.com üzerinde 240 günlük bir sorgu 59.831 kayıt döndürdü; 1 dakika 53 saniyede. 24 saatlik zillow.com sorgusu 10.8 saniyede sonuç verdi.
  • İki depolama katmanı: Son 24 saate ait veriler $0,2 / 1.000 sayfa tutar. Daha eski olan her şey $1 / 1.000 sayfa karşılığında S3 Glacier Deep Archive'a taşınır. Teslimat süresi de bunu izler: 24 saatlik işimiz yaklaşık 30 saniyede ulaştı; 240 günlük iş ise restoring_archive_data içinde onlarca dakika kaldı.
  • Kendi depolama alanınıza teslimat: Amazon S3, Azure Blob Storage, Google Cloud Storage veya webhook. Webhook yolunu test ettik; on sayfa, sayfa başına bir .html.gz ve bir .meta.json içeren tek bir tar olarak ulaştı.
  • Taahhüt vermeden önce örnek alın: max_entries, bir teslimatın kaç dosya içereceğini sınırlar; böylece 59.831 kayıtlık bir sorgu, bir sentin küçük bir kısmı karşılığında on sayfayla örneklenebilir.

Alın: 100 ücretsiz arşiv araması/gün Bright Data ile

Ücretsiz Erişim

Dosyaların içinde gerçekte ne var

Her sayfa sunucunun gönderdiği haliyle ulaşır ve dokuz metadata alanı içerir: domain, url, timestamp, language, category, ip_country, content_type, charset ve status_code. Bu ham HTML'in bir tarayıcı olmadan kullanılabilir olup olmadığını kontrol etmek için arşivlenmiş on Zillow sayfasını açtık, scriptleri ve etiketleri çıkardık ve kalan metni ilan alanları için aradık.

Common Crawl, açık web'in taramasını yaklaşık ayda bir yayınlayan ve bunu ücretsiz veren bir kâr amacı gütmeyen kuruluştur. Hesap, anahtar veya kota yoktur. Karşılığında bir hizmet değil dosyalar alırsınız: size hiçbir şey teslim edilmez ve tek bir sayfa aramasının ötesindeki her şey kendi işlemenizi çalıştırmak anlamına gelir.

Bir format seçmek

Her tarama birkaç formatta gelir. Ham HTTP yanıtları orijinal HTML'i taşır. Bir metadata özeti bağlantıları, başlıkları ve üstbilgileri JSON olarak taşır. Düz metin sürümü, işaretlemesi kaldırılmış makale metnini taşır. İki küçük set, robots.txt dosyalarını ve 200 olmayan yanıtları kapsar.

Bu seçim önemlidir çünkü tek yönlüdür. Düz metin çok daha küçüktür ve çalışması daha hızlıdır; ancak etiketler, öznitelikler ve gömülü JSON-LD bu sürümden çıkarılmıştır; bu nedenle yapılandırılmış çıkarım ham setten başlamak zorundadır.

Filtrelenmiş teslimat yoktur. Bir format seçer, ihtiyacınız olanı indirir ve kendiniz işlersiniz.

Bir sayfa bulma

İki mekanizma vardır ve farklı soruları yanıtlarlar. CDX sunucusu, bir web formu veya API aracılığıyla tek URL'li aramaları yönetir. Parquet olarak yayınlanan sütunlu dizin, toplu soruları SQL aracılığıyla yönetir.

CDX arayüzü iki şey ister: 2008'e kadar uzanan listeden hangi aylık taramanın aranacağı ve bir URL deseni.

Sonuçlar JSON olarak, yakalama başına bir satır şeklinde döner. Üç alan diğerlerinden daha önemlidir: WARC dosya adı, bayt ofseti ve kayıt uzunluğu.

Çıktıda iki şey görülür. Aynı URL farklı zaman damgalarıyla birkaç kez görünür; bu nedenle tek bir aylık tarama tek bir anlık görüntü değildir. Başarısız yanıtlar da ayrı olarak saklanır; yönlendirmeler ve hatalar başarılı getirmelerin yanında değil, bir crawldiagnostics klasöründe tutulur.

İçinde bulunduğu dosyayı indirmeden tek bir sayfayı çekme

Dosya adı, ofset ve uzunluk, bir HTTP Range başlığıyla tek bir kayıt istemenizi sağlar. Bunu bir Redfin ilan sayfasında test ettik.

CDX araması bir saniyeden kısa sürede döndü ve bayt aralığı getirmesi 0.38 saniye sürdü; 210 KB için. Aradığımız yedi ilan alanının tümü (fiyat, yatak odası sayısı ve adres dahil) hiçbir JavaScript çalıştırılmadan ham HTML içinde mevcuttu.

Toplu filtreleme SQL ile

Tek bir URL'den daha büyük her şey için sütunlu dizin doğru yoldur. Parquet'tir, HTTPS üzerinden sorgulanabilir ve URL, host, TLD, dil, MIME türü, getirme durumu ve zaman damgasını kapsayan 33 sütun sunar.

7.29 milyon satırlık tek bir shard'a yapılan sorguların her biri bir saniyenin çok altında döndü ve diske hiçbir şey yazılmadı. Kullanmadan önce bilinmesi gereken bir ayrıntı: shard'lar ters çevrilmiş ana bilgisayar adıyla anahtarlanır; bu nedenle her dosya rastgele bir örnek yerine dar bir alfabetik dilim tutar. Belirli bir alan adı için rastgele bir shard sorgulamak genellikle hiçbir sonuç döndürmez.

Belirli bir alan adı için ne kadar tuttuğu

redfin.com ve zillow.com olmak üzere iki alan adı için dizini sorguladık; her birini kapsayan shard'ı bulduk ve satırlarını saydık.

redfin.com 14.406 sayfa döndürdü; bunların tümü HTTP 200 idi. zillow.com hiç sonuç döndürmedi. Bu kısmi kapsam veya başarısız bir getirme değildir; alan adı dizinde yoktur. Common Crawl robots.txt'e uyar; bu nedenle tarayıcısını reddeden bir site, zayıf biçimde temsil edilmek yerine tamamen yoktur.

Sekiz büyük sitenin her birinden arşivlenmiş bir sayfa çektik ve tarayıcı olmadan ne kadar metnin ayakta kaldığını ölçtük. Bunlardan ikisinin arşivde hiç kullanılabilir HTML sayfası yoktu. Geri kalanların çoğu sunucu taraflı olarak işlenmişti; Airbnb ve Walmart. dahil. TripAdvisor istisnaydı; 18 KB'lık bir sayfa döndürdü ve bu sayfa 282 karakter görünür metin içeriyordu.

Maliyet ve lisans

Veriler ücretsiz'dir ve depolama kovanı hesap olmadan açıktır. Ödediğiniz şey hesaplama ve bant genişliğidir; bu nedenle veriyle aynı bulut bölgesinde işlem yapılması önerilir.

Lisans açık bir veri lisansı değildir. Common Crawl, hizmete sınırlı bir lisans verir; sayfa içeriğinin kendisini lisanslayamayacağını belirtir ve kullanıcıların, içeriğin “yapay zeka, makine öğrenimi veya benzeri teknolojilerle bağlantılı olarak” kullanımından doğan taleplere karşı kendisini tazmin etmesini şart koşar. Toplam sorumluluk $100 ile sınırlıdır.

Webz.io, 2008'den beri topladığı haber makaleleri, blog yazıları, forum konuları ve incelemelerden oluşan bir arşive erişim satar. Döndürdüğü şey sayfa değil, işlenmiş bir kayıttır: makale metni artı çıkarılmış varlıklar, duygu puanları, sosyal etkileşim sayıları ve site metadata'sı. Yaklaşık 30 günden daha eski olan her şey arşiv ürününde yer alır; daha yeni materyaller News, Blogs ve Forums API'leri tarafından sunulur.

Sorgu oluşturucu

Sorgular, metin üzerindeki bir Boolean ifadesini alan düzeyindeki koşullarla birleştirir ve AND ile bağlanır. Her koşul bir özellik, bir operatör ve bir değerden oluşturulur.

Kullanmadan önce bilinmeye değer bir ayrıntı: Equals etiketli operatör tam eşleşme gerektirmez. Site başlığı alanına redfin girdik ve başlığı “Redfin Real Estate News” olan bir siteyle eşleşti.

Ne döner

Her sonuç, tam metnin yanı sıra entities, sentiment, social, categories, language, domain_rank, country ve aynı hikayenin başka yerde görünüp görünmediğini kaydeden bir syndication nesnesi taşır. Ham HTML alanı yoktur. Ürün sayfası elde ettiğiniz şeyi “her makale, gönderi, konu veya incelemenin tam metni” olarak tanımlar ve teslimat “API aracılığıyla veya bir sorguyu kendiniz çalıştırarak” yapılır.

  • Arşiv, ilan sitelerini değil yayıncıları tutar. Redfin araması, redfin.com sayfaları yerine convesio.cloud üzerinde barındırılan Redfin'in kurumsal haber blogunu döndürdü. Site alan adı alanını doğrudan redfin.com için sorgulamak hiçbir sonuç döndürmedi; convesio.cloud ve yahoo.com sonuç döndürdü; bu nedenle boş yanıt bozuk bir sorguyu değil, kapsamı yansıtır.
  • Toplu toplama sözleşmeyle kısıtlanmıştır. Hizmet şartları, site_type:news veya language:english gibi genel bir yıldız filtresini ve dikey filtreleri yasaklar; bunlar tam olarak bir derlem alıcısının kullanacağı sorgu biçimleridir. Arayüzün kendisi, bir aramayı daraltmak için site_type:news eklemeyi önerir.
  • Arşiv dokümantasyonu yazılmamış durumda. Doküman gezinmesinde veri dökümleri, limitler, dataset oluşturma ve API referansını kapsayan dört sayfa var. Her biri yalnızca bir başlık içeriyor, başka hiçbir şey yok.

Exa kendi web dizinini oluşturmuş ve bunun üzerinden arama satıyor. Şirket 500 milyardan fazla URL bildiriyor. Bu karşılaştırma için ilgili kısım arama endpoint'i değil, bir sayfanın metnini canlı olarak getirmek yerine Exa'nın önbelleğinden döndüren /contents'dir.

Önbellek veya canlı seçenekler

Bunu tek bir parametre kontrol eder. maxAgeHours 24 olarak ayarlandığında, önbelleğe alınmış kopyanın bir günden daha eski olmaması durumunda kullanılması, aksi takdirde tarama yapılması anlamına gelir. 0'a ayarlandığında her zaman tarama yapar. -1'e ayarlandığında asla tarama yapmaz; yalnızca önceden depolanmış olanı döndürür. Kabul edilen maksimum değer 720 saattir; bu nedenle parametre 30 günden daha eski hiçbir şeye başvuramaz.

Yaş sınırını altı ay olarak ayarlayarak iki istek çalıştırdık. İlki bir Redfin şehir sayfası istedi.

İlki 7.07 saniye sonra CRAWL_NOT_FOUND döndürdü. İkincisi Redfin ana sayfasını istedi.

Tam sayfa içeriğini 0.010 saniyede döndürdü. On milisaniye bir ağ gidiş-dönüşünden daha kısadır; bu nedenle bu yanıt bir getirmeden değil, depolamadan gelmiştir. Önbellek gerçektir ve yedi saniyelik başarısızlık Exa'nın araması ve bulamamasıydı.

Aynı ekranda iki varsayılan daha görülüyor. İçerik 20.000 karakterle sınırlandırılmış ve “yalnızca ana içerik” açık; bu nedenle gezinme ve şablon metinleri sizin değil, Exa'nın kendi mantığıyla kaldırılıyor.

Kapsam sayfa düzeyinde düzensiz

Ana sayfa önbelleğe alınmıştı; San Francisco şehir sayfası alınmamıştı. Alan adını aramak bunun neden basit bir var-yok sorusu olmadığını gösterir.

Sorgu, Redfin ana sayfasını, bir “Houses For Sale Near Me” sayfasını ve bir Wichita şehir sayfasını döndürdü; bu nedenle derin sayfalar dizinde gerçekten var. Kapsam, bir alan adı genelinde tam veya boş olmak yerine dağınıktır.

Sınırlamalar

Aynı ekran, bu karşılaştırmada Exa'yı arşivlerden ayıran cümleyi taşır: “Sonuç sayısı: 10. Maks: 100. Daha fazla sonuç için bizimle iletişime geçin.”

Toplam sayı yoktur. Common Crawl bu soruyu bir SQL sorgusuyla yanıtladı; Bright Data ise bir files_count alanıyla yanıtladı.

Toplu dışa aktarma yok, kendi depolama alanınıza teslimat yok, firehose yok. Enterprise katmanı, verinin teslim edilmesi yerine API aracılığıyla sunulan özel dizinlerden bahseder.

Hangisi hangi işe uygun

Bu dört ürün birbirinin yerine geçmez. Soru hangisinin en iyi olduğu değil, hangisinin sizin sorunuza yanıt verdiğidir.

  • Tarayıcıları engelleyen siteler dahil olmak üzere ölçekli ham HTML. Bright Data, kontrol ettiğiniz depolamaya filtrelenmiş bir seçim yazan ve tarayıcıları reddeden alan adlarından sayfalar tutan tek sağlayıcıdır.
  • Mühendislik kapasiteniz varsa, ücretsiz geniş bir derlem. Common Crawl size WARC içinde eksiksiz taramalar verir; bunlar SQL ile numaralandırılabilir ve kendi hesaplamanız dışında hiçbir şey istemez. İşleme sizin inşa etmenize kalmıştır.
  • Varlıklar ve duygu zaten çıkarılmış haber, blog ve forum metinleri. Webz.io, sayfalar yerine işlenmiş kayıtlar döndürür; bu da çıkarım işini ortadan kaldırır ancak işaretlemeyi de kaldırır.
  • Sorgu sırasında bir agent veya RAG pipeline'ı için sayfa bağlamı. Exa, önbelleğe alınmış metni milisaniyeler içinde döndürür ve bir sayfa depolanmadığında aynı çağrının içinde canlı getirmeye geri döner.
Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Web arşiv API'lerini nasıl test ettik

Her ürünle dokümantasyonundan değil, içinde çalıştık. Her sağlayıcı önce kendi konsolu veya oyun alanı üzerinden, ardından API'si üzerinden yönlendirildi; böylece arayüzün ürettiği isteği ve herhangi bir ücret alınmadan önce ne döndüğünü görebildik.

Her biri için bir sorgu oluşturduk, çalıştırdık ve işlenmiş özet yerine ham yanıtı okuduk. Ürün bir sayı, maliyet tahmini veya durum nesnesi döndürdüğünde bu alanları doğrudan kaydettik. Örnek veya teslimat sunduğunda onu aldık, dosyaları açtık ve inceledik.

Tekrarlanması veya zamanlanması gereken bölümleri küçük scriptler yönetti: çok terabaytlık bir arşivden tek bir kaydı getirmek, teslim edilen bir paketi açmak ve ham HTML içinde belirli alanları aramak, sütunlu bir dizini SQL ile sorgulamak ve önbelleğe alınmış bir yanıtın taranması gereken bir yanıta kıyasla ne kadar sürdüğünü ölçmek. Bu scriptler ürettikleri sonuçların yanında bağlantılandırılmıştır.

Bu araştırmayı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Nazlı Şipi (2026) - "Web Arşiv API'leri: Test Edilip Karşılaştırılan En İyi 4 Sağlayıcı". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 10 Ağustos 2026, kaynak: https://aimultiple.com/web-archive-api [Çevrimiçi Kaynak]

Şipi, N. (2026, 10 Ağustos). Web Arşiv API'leri: Test Edilip Karşılaştırılan En İyi 4 Sağlayıcı. AIMultiple. https://aimultiple.com/web-archive-api

@misc{sipi2026,
  author = {Şipi, Nazlı},
  title  = {{Web Arşiv API'leri: Test Edilip Karşılaştırılan En İyi 4 Sağlayıcı}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/web-archive-api}},
  note   = {AIMultiple. Erişim tarihi: 10 Ağustos 2026}
}
Tüm verileri indir

15 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 2 CSV dosyası içeren ZIP dosyası olarak indirin.

Son güncelleme: 17 Ağustos 2026
İndir
Nazlı Şipi
Nazlı Şipi
Yapay Zeka Araştırmacısı
Nazlı, AIMultiple'da veri analistidir. Çeşitli sektörlerde veri analizi konusunda önceden deneyime sahiptir; burada karmaşık dataset'leri eyleme dönüştürülebilir içgörülere dönüştürme üzerine çalışmıştır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450