5 büyük iş platformunda 5 lider web kazıma sağlayıcısını toplam 12.500 istek çalıştırarak kıyasladık, ardından her sağlayıcının başarı oranını, tamamlanma süresini ve meta veri çıktısını ölçtük.
İş İlanı Kazıyıcıları benchmark
Test süreciyle ilgili daha fazla ayrıntı için benchmark metodolojisi bölümünü okuyabilirsiniz.
Sağlayıcıya göre alan adı kapsamı
✓ = destekleniyor, HTML döndürür
✅ = destekleniyor, yapılandırılmış veri döndürür
✕ = veri döndürülmedi
Alan adına göre iş kazıma performansı
İş ilanı API'leri için mevcut meta veri alanları
Bright Data ve SerpApi, iş ilanları için yapılandırılmış JSON döndüren tek sağlayıcılardır, ancak farklı kaynakları okurlar. Bright Data LinkedIn, Indeed ve Glassdoor sayfalarını doğrudan ayrıştırır; SerpApi ise aynı panolardan ilanları toplayan Google Jobs'u ayrıştırır. Tablo, her iki sağlayıcının alanlarını ortak kategorilere ayırarak platform başına ne geldiğini karşılaştırmanızı sağlar.
İş Kazıma benchmark sonuçları
Bright Data beş iş platformunda ortalama %90 başarı oranıyla benchmark'ta liderlik etti. Kurulumu iki entegrasyon moduna ayrılmıştır:
- Özel Dataset API'leri (yapılandırılmış JSON) LinkedIn, Indeed ve Glassdoor için
- Web Unblocker proxy (işlenmiş HTML) Craigslist ve ZipRecruiter için
Dört alan adı %100 başarı oranına ulaştı: LinkedIn, Indeed, Craigslist ve Glassdoor. Tamamlanma süreleri entegrasyona bağlıydı. Craigslist'te Web Unblocker istekleri ortalama yaklaşık 1 saniyede döndü, LinkedIn'de 7, Indeed'de ise 17 saniye. Glassdoor 53 saniye sürdü. ZipRecruiter, %53 ile eşiğin altında kalan tek alan adıydı; burada Web Unblocker, URL'lerin bir kısmında token süresi dolmuş yönlendirmelerle karşılaştı.
Get %25 indirim Bright Data Web Scraping API'lerinde, promosyon kodu API25
Web Sitesini Ziyaret EtOxylabs beş platformda ortalama %77 başarı oranına ulaştı. Benchmark, Web Scraper API'sini source: universal kullanarak çalıştı; bu, yerel ayrıştırma için işlenmiş HTML döndürür.
Dört alan adı iyi performans gösterdi: Craigslist'te %100, Indeed'de %100, LinkedIn'de %98 ve ZipRecruiter'da %90. Glassdoor istisnaydı; çoğu istek, gerçek zamanlı endpoint'in kendi iç sınırı dahilinde Glassdoor'un JavaScript yoğunluklu sayfalarını oluşturamaması nedeniyle HTTP 408 ile zaman aşımına uğradı. Çalışan alan adlarında tamamlanma süreleri 11 ile 28 saniye arasında kaldı.
Alın 2.000 ücretsiz kazıma kredisi
Web Sitesini Ziyaret EtDecodo'nun genel performansı Oxylabs ile aynıydı; ortalama %77 başarı oranına sahipti. Web Scraper API'si headless: html ve proxy_pool: premium ile çalıştı; işlenmiş HTML döndürdü ve bunu yerel olarak CSS seçicileriyle ayrıştırdık.
Platform bazında sonuçlar neredeyse Oxylabs'i yansıttı: Craigslist'te %100, Indeed'de %100, LinkedIn'de %98, ZipRecruiter'da %89 ve Glassdoor'da %0. Glassdoor hatası farklıydı; isteklerin çoğu sayfa yüklenmeden önce API düzeyinde reddedildi. Çalışan alan adlarında tamamlanma süreleri 12 ila 29 saniye arasında değişti; bu da Decodo'yu alanın yavaş yarısına yerleştirdi.
SCRAPE30 kodunu uygulayın, %30 indirim
Web Sitesini Ziyaret EtSerpApi, iş ilanlarını tek pano URL'leri yerine Google Jobs aracılığıyla kapsar. google_jobs motoru bir arama sorgusu ve isteğe bağlı konum alır ve sonuçları JSON, HTML veya markdown olarak döndürür; sayfa başına 10 sonuç, next_page_token ile.
Yayınlanma tarihi ve iş türü gibi filtreler yanıtın içinde geri gelir; her biri hazır serpapi_link ile birlikte gelir, böylece filtrelenmiş bir yeniden sorgulama parametre oluşturmayı gerektirmez. Glassdoor ve Indeed şirket derecelendirmeleri, job_id alan Google Jobs Listing endpoint'i aracılığıyla edinilebilir.
Nimble'nın genel sonucu %69 oldu; kaybın çoğu tek bir platforma bağlıydı. Web Extract API'si tarayıcı oluşturma etkinken çalıştı (render: true, driver: vx10).
Craigslist %100, LinkedIn %86, Glassdoor %79 ve ZipRecruiter %69 döndürdü. Indeed, işlenmiş sayfaların seçicilerimizin hedeflediği iş ayrıntısı DOM öğelerini nadiren içermesi nedeniyle %14'e düştü. Buradaki dikkate değer güçlü yön hızdı: Indeed, Craigslist, LinkedIn ve ZipRecruiter 6 ila 8 saniyede dönerken, Glassdoor 30 saniye ile tek aykırı değerdi.
Zyte, %58 ile en düşük genel başarı oranını kaydetti. Extract API'si browserHtml: true ile çalıştı ve sayfaları başsız bir tarayıcı aracılığıyla oluşturdu. Üç alan adı temiz performans gösterdi: Craigslist'te %100, Glassdoor'da %100 ve ZipRecruiter'da %89. Diğer ikisi tamamen başarısız oldu:
- LinkedIn, tüm 500 istekte HTTP 451 Yasal Nedenlerle Kullanılamıyor döndürdü.
- Indeed'in işlenmiş HTML'i iş ayrıntısı DOM öğelerini hiç içermedi.
Çalışan alan adlarında tamamlanma süreleri ZipRecruiter'da 7 saniyeden Craigslist'te 17 saniyeye kadar değişti; Glassdoor da 16 saniyedeydi.
İş Kazıma benchmark metodolojisi
5 büyük iş platformunda (LinkedIn, Indeed, Glassdoor, Craigslist ve ZipRecruiter) 5 lider web kazıma sağlayıcısını, toplam 12.500 istek çalıştırarak kıyasladık. Her sağlayıcıya platform başına aynı 500 bireysel iş ilanı URL'si seti verildi; istekler arasında 2 saniyelik gecikme ile sırayla gönderildi.
Sağlayıcılar ve entegrasyon
Her sağlayıcı, önlerinde özel proxy'ler veya üçüncü taraf ara katman olmaksızın kendi üretim endpoint'inde çalıştı.
Bright Data iki entegrasyon modunu birleştirdi. LinkedIn, Indeed ve Glassdoor için yapılandırılmış JSON döndüren özel Dataset API'lerini kullandı. Craigslist ve ZipRecruiter için ise işlenmiş HTML döndüren Web Unblocker proxy'yi kullandı.
Oxylabs, Web Scraper API'sini source: universal ile çalıştırdı ve her alan adında işlenmiş HTML döndürdü.
Decodo, Web Scraper API'sini headless: html ve proxy_pool: premium ile çalıştırdı; aynı şekilde işlenmiş HTML döndürdü.
Nimble, Web Extract API'sini render: true ve driver: vx10 ile çalıştırdı ve işlenmiş HTML üretti.
Zyte, Extract API'sini browserHtml: true ile çalıştırdı; yine işlenmiş HTML üretti.
HTML yanıtları için sayfayı, her platformun iş ayrıntısı öğelerini (iş unvanı, şirket adı, konum, maaş, istihdam türü ve bir sayfa göstergesi) hedefleyen CSS seçicileriyle yerel olarak ayrıştırdık.
Zaman aşımı ve hız sınırlama
Asenkron isteklerin yürütülmesinde 10 dakikalık bir üst sınır vardı. HTTP 429 yanıtları, 3 yeniden denemeye kadar 30 saniyelik geri çekilmeyi tetikledi; bunun ötesine geçen her şey URL için başarısızlık olarak kaydedildi.
Doğrulama kuralları
Her istek üç kontrolden geçti.
Gönderim kontrolü, sağlayıcıdan HTTP 200 ila 399 veya 404 durum kodu gerektirdi. Yürütme kontrolü, asenkron işlerin hata olmadan zaman aşımı içinde bitmesini gerektirdi; senkron sağlayıcılar otomatik olarak geçti. Doğrulama kontrolü, job_title veya company_name'den en az birinin boş olmayan bir dize olarak döndürülmesini gerektirdi. JSON sağlayıcıları için bu, ayrıştırılmış yanıttan geldi; HTML sağlayıcıları için CSS seçici eşleşmelerinden geldi.
Bir 404 sayfası tespit eden istek (HTTP 404, “sayfa bulunamadı” içeriği veya sağlayıcının açık “ölü sayfa” sinyali) de geçerli sayıldı; çünkü sağlayıcı kullanılamayan bir ilanı doğru şekilde tespit etmişti.
Hata içermeyen boş yanıtlar başlangıçta geçerli sayıldı, sonra yeniden kontrol edildi: Başka bir sağlayıcı aynı URL üzerinde gerçek iş verisi çıkardıysa, boş yanıt geçersiz olarak işaretlendi. 404 tespitleri bu işaretlemeden muaftı; bir sağlayıcının açık “sayfa yok” sinyali, başka bir sağlayıcıdan elde edilen gerçek çıkarılmış veriyle çelişmediği sürece güvenilirdi.
Bir çalıştırma, yalnızca gönderim, yürütme ve doğrulamanın tümü geçtiğinde genel olarak başarılı sayıldı.
Ölçülen metrikler
Doğrulama başarı oranı, üç kontrolün tümünden geçen URL'lerin payıdır.
Uçtan uca tamamlanma süresi, isteğin gönderilmesinden yanıt alınmasına kadar geçen duvar saati süresidir, saniye cinsinden. Asenkron sağlayıcılar için bu, dataset işi bitene kadar yapılan yoklama süresini içerir.
Yapılandırılmış JSON döndüren sağlayıcılar için mevcut meta veri alanları, tüm yanıtlar arasında küme birleşimi olarak hesaplanan benzersiz alan sayısıdır. HTML sağlayıcıları için bu, platform başına kullandığımız sabit beş seçicili CSS şemasıdır.
SSS'ler
Kazınmış iş verileri genellikle işe alım pazarı analizi, maaş benchmark'ı, hangi şirketlerin hangi roller için işe alım yaptığına dair rekabet istihbaratı, yetenek havuzu haritalama, işe alım otomasyonu ve iş toplayıcılarına veri sağlamak için kullanılır. Şirketler ayrıca ilan hacmi eğilimlerini, coğrafi yoğunlaşmayı ve rakiplerin rolleri ne kadar hızlı doldurduğunu izlemek için de kullanır.
Kullanım durumuna bağlıdır. Gerçek zamanlı işe alım otomasyonu için günlük veya saatlik kazımalar yaygındır. Pazar raporları için haftalık veya aylık kazımalar genellikle yeterlidir. İş ilanları doldurulduktan sonra hızla kaldırılma eğilimindedir, bu nedenle eski veriler hızla değer kaybeder.
Herkese açık verileri kazımak çoğu yargı bölgesinde genellikle yasaldır, ancak çoğu büyük iş platformunun (LinkedIn, Glassdoor, Indeed) otomatik erişimi yasaklayan Hizmet Şartları vardır. Geçmişte bazıları kazıyıcılara karşı yasal davalar açmıştır. Ticari kullanım durumları, özellikle kişisel veriler söz konusu olduğunda yasal inceleme gerektirir.
İş platformları kazıma önleme önlemlerine yoğun yatırım yapar. CAPTCHA'lar, oturum açma katmanları, JavaScript ile oluşturulan içerik, sık düzen değişiklikleri ve IP tabanlı hız sınırlama standarttır. Bazı platformlar botlara normal kullanıcılardan farklı DOM yapıları da sunar. Bu savunmalar, birçok ekibin kendi kazıyıcılarını oluşturmak yerine yönetilen kazıma API'lerine güvenmesinin nedenidir.
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{sipi2026,
author = {Şipi, Nazlı},
title = {{En İyi 5 İş İlanı Kazıyıcı API'leri Karşılaştırıldı}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/job-scraper}},
note = {AIMultiple. Erişim tarihi: 10 Eylül 2026}
}12.5 bin veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, 3 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.
Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.