Dienstleistungen
Kontaktieren

Ethischer und konformitätsrelevanter Webdaten-Benchmark

Cem Dilmegani
Cem Dilmegani
aktualisiert am 21. Juni 2026

Wenn Unternehmen ihre Webdatenoperationen skalieren, bewerten Compliance-, Daten- und Risikomanager zunehmend die damit verbundenen ethischen, reputationsbezogenen und rechtlichen Risiken.

Wir haben 5 führende Webdatensammlungsdienste in 3 Dimensionen bewertet und jeden Dienst mit mehr als 20 potenziell unethischen Szenarien getestet.

Unsere Arbeit hilft Ihnen dabei, die ethische Qualität Ihrer Datensammlungspraktiken einzuschätzen und die möglichen Folgen unethischer Ansätze zu verstehen. Wir stellen außerdem Leitlinien für die ethische Datensammlung aus dem Web bereit und bewerten Webdatensammlungsdienste aus ethischer und Compliance-Perspektive:

Bewertung von Webdatensammlungsdiensten

Wir haben führende Webdatensammlungsdienste (auch Webdatenanbieter oder Webdateninfrastruktur genannt) anhand unserer Checkliste für ethische Webdaten bewertet. Diese Bewertungen repräsentieren Reifegradstufen, wobei 5 das höchste Niveau ist:

Anbieter
Zusammenfassung
Ethische Nutzung durch Kunden
Ethische Beschaffung
Externe Zertifizierung
Versicherungsschutz geteilt**
Bright Data
Stufe 5
Stufe 5
Stufe 5
Datensicherheit, PII-Verarbeitung. IP-Quellen auf Whitelist. Ethische Praktiken bewertet.
Apify
Stufe 1
Stufe 1
Stufe 1
Datensicherheit
Zyte
Stufe 1
Stufe 1
Stufe 1
Datensicherheit
NetNut
Stufe 1
Stufe 1
Stufe 0
Datensicherheit
TBD
Nimble
Stufe 1
Stufe 1
Stufe 0
Datensicherheit

* Dies sind Codierungen für Anbieternamen. Diese Anbieter wollten in diesem Bericht nicht genannt werden und werden am Ende der Liste aufgeführt, bis wir dieses Problem gelöst haben.

** ✅ bedeutet, dass das Unternehmen sich entschieden hat, seine Versicherungszertifikate mit AIMultiple zu teilen. ❌ bedeutet, dass das Unternehmen beschlossen hat, seine Versicherungszertifikate nicht mit uns zu teilen, und wir daher ihren Versicherungsschutz nicht überprüfen konnten. Der Versicherungsschutz ist die einzige Kategorie, bei der wir auf die Mitwirkung der Webdatensammlungsdienste angewiesen waren, um sie zu bewerten.

Sortiert nach Zusammenfassungsergebnis.

Bewertungsmodell für ethische Webdaten

Im Folgenden erläutern wir, wie diese Bewertungen abgeleitet werden. Sie können auch die Begründung für die Auswahl dieser Bewertungsdimensionen einsehen.

In den ersten beiden Kategorien haben wir 5 Kompetenzen identifiziert, und Unternehmen erhielten Bewertungen basierend auf der Anzahl der erfüllten Kompetenzen. Stufe 5 repräsentiert die höchste auf dem Markt beobachtete Reife und spiegelt aktuelle Best Practices wider, nicht Perfektion.

Fähigkeiten für die ethische Nutzung durch Kunden

  • Effektive Prozesse für die ethische Nutzung: Wir bewerten die Fähigkeit jedes Anbieters, eine unethische Nutzung seiner Residential-Proxy-Dienste durch kontrollierte Testszenarien zu verhindern. Wenn einer unserer Anfragen vom Anbieter blockiert wird, gilt dies als erfüllt.
  • Verbesserte Prozesse für die ethische Nutzung: Ähnlich wie „effektive Prozesse für die ethische Nutzung“. Diese Fähigkeit bedeutet jedoch, dass der Dienstanbieter mehr als einen unserer Versuche blockiert hat, seine Dienste für unethische Anwendungsfälle zu nutzen.
  • Best-Practice-Prozesse für die ethische Nutzung: Ähnlich wie „effektive Prozesse für die ethische Nutzung“. Diese Fähigkeit bedeutet jedoch, dass der Dienstanbieter die meisten unserer Versuche blockiert hat, seine Dienste für unethische Anwendungsfälle zu nutzen.
  • Grundlage für Missbrauchsmanagement: Veröffentlichung einer Missbrauchspolitik und einer Methode zur Meldung von Missbrauch
  • Reaktionsfähiges Missbrauchsmanagement: Wir haben gemessen, wie Unternehmen auf mehrere Missbrauchsmeldungen reagierten. Selbst wenn es keine Hotline zur Meldung von Missbrauch gab, nutzten wir die vom Unternehmen angegebenen E-Mail-Adressen, um ihr Team zu erreichen. Wenn wir innerhalb einer Woche keine Antwort auf unsere Meldung erhielten, gilt das Unternehmen als nicht reaktionsfähig.

Fähigkeiten für die ethische Beschaffung

Ethische Beschaffung beinhaltet die Beschaffung von IP-Adressen auf ethische Weise. Unsere Marktanalyse identifizierte folgende Transparenzstufen bezüglich ethischer IP-Beschaffung:

  • Stufe 1: Veröffentlichte IP-Beschaffungsrichtlinie.
  • Stufe 2: Offenlegung mindestens einer Quelle (z. B. einer mobilen App) für IPs, die auf ethische Weise IPs bereitstellt. Die offengelegte Quelle sollte insgesamt mindestens 10.000 Bewertungen auf Drittplattformen haben, einschließlich Google, Apple, Amazon App Stores und Trustpilot.
  • Stufe 3: Gleich wie Stufe 3, aber mit 100.000 Bewertungen
  • Stufe 4: Gleich wie Stufe 3, aber mit 1 Million Bewertungen
  • Stufe 5: Gleich wie Stufe 4, aber mit 10 Millionen Bewertungen

Bewertungen sind ein Indikator für die Beliebtheit von Apps und ein wichtiges Signal für diese Bewertung. Webdatensammlungsdienste müssen mit beliebten Anwendungen zusammenarbeiten, um den IP-Bedarf ihrer Kunden zu erfüllen.

Für die Qualifikation sollten die offengelegten Apps diese Best Practices erfüllen. Wir prüfen dies nicht für jede offengelegte App, sondern nur für einige zufällig ausgewählte:

  • Informierte Einwilligung:
    • Benutzer müssen vor der Freigabe ihrer Internetverbindung zustimmen. Der Zustimmungsbildschirm sollte Folgendes darlegen:
      • Den Anbieter
      • Den Dienst
      • Wie ihre IP verwendet wird
    • Benutzer sollten detaillierte Informationen zugänglich haben zu
      • Wie ihre Internetverbindung verwendet wird
      • Der Datenschutzrichtlinie
  • Wert: Benutzer müssen einen gewissen Wert aus der App erhalten (z. B. Bezahlung, Möglichkeit, Werbung zu überspringen oder eine andere Funktionalität)
  • Datenschutz: Begrenzte und transparente Datensammlung von Benutzern.

Für Residential-Proxy-Netzwerke sollten Käufer außerdem überprüfen, ob die Einwilligung spezifisch, informiert, widerruflich und von anderen App-Berechtigungen getrennt ist. Sie sollten prüfen, ob Benutzer problemlos widersprechen können, ob die Bandbreitennutzung begrenzt ist, ob Minderjährige ausgeschlossen sind und ob der Anbieter Apps oder SDKs, die Residential-IPs bereitstellen, auditet.

Externe Zertifizierung

Wir bewerteten externe Zertifizierungen basierend darauf, ob Unternehmen diese Zertifikate erworben haben, die für enterprisefähige Sicherheit und Compliance relevant sind.

  • PII-Zertifizierung: Nachgewiesene Fähigkeit zur Verwaltung von PII durch Erwerb von ISO 27018
  • Datensicherheitszertifizierung: Nachgewiesene Datensicherheitspraktiken durch Erwerb eines dieser Zertifikate: SOC 2 oder ISO/IEC 27001
  • IP-Quelle auf Whitelist: Externe Zertifizierungsanbieter wie McAfee zertifizieren entweder:
    • Spezifische Apps von Dritten, die IPs bereitstellen
    • SDK, das IPs von Apps von Dritten sammelt
  • Ethische Praktiken bewertet: Ein ISAE 3000-Prüfungsprojekt kann abgeschlossen werden, um interne Compliance- und Ethikpraktiken zu bewerten.

Versicherung

Wir baten Anbieter, uns diese Versicherungsdokumente bereitzustellen:

  • Berufshaftpflichtversicherung Zertifikat, das Deckung für die Haftung der Anbieter im Falle von Problemen beim Service bietet
  • Cyber-Versicherungszertifikat, das Deckung für die Haftung der Anbieter im Falle von informationssicherheitsbezogenen Problemen bietet.

Zusammenfassungsergebnis

Dieses Ergebnis ist die Summe aller Ergebnisse geteilt durch 3. Die Ergebnisse sind:

  • 0 bis 5 für Fähigkeiten zur ethischen Nutzung durch Kunden
  • 0 bis 5 für Fähigkeiten zur ethischen Beschaffung
  • 0 bis 3 für externe Zertifizierung
  • 0 bis 2 für Versicherungen

Führende Webdatensammlungsdienste

AIMultiple wählte die sieben größten Webdatensammlungsdienste hinsichtlich der Anzahl der Mitarbeiter auf LinkedIn aus. Wir wählten diesen Wert, da er öffentlich ist und mit den Einnahmen des Unternehmens und dessen Bereitschaft für Unternehmen korrelieren sollte. Bessere Kennzahlen wie Umsatz oder die Anzahl der Mitarbeiter im Lohnbuch sind für diese privaten Unternehmen nicht öffentlich verfügbar.

Alle ausgewählten Unternehmen haben im April 2025 mehr als 100 Mitarbeiter, die mit ihren LinkedIn-Profilseiten verbunden sind. Derzeit werden 5 von den ausgewählten 7 auf dieser Seite angezeigt, und die verbleibenden 2 Unternehmen haben sich entschieden, nicht in den Bericht aufgenommen zu werden.

Im Fokus stehende Produkte zur Datensammlung aus dem Web

Diese Unternehmen bieten eine Reihe von Produkten an, einschließlich Proxies, Data-Scraping-APIs und Datensätze. Während alle Produkte aus ethischer Sicht betrachtet werden können, konzentrierten wir uns zunächst auf das Produkt, das den höchsten Grad an Flexibilität bietet und die meisten anderen Produkte antreibt: Residential Proxies.

Webdatensammlungsprodukte können als Hierarchie betrachtet werden, bei der Proxies die Kernschicht bilden, auf der alle anderen Dienste aufbauen. Dies liegt daran, dass Proxies es Maschinen ermöglichen, über verschiedene Ziele auf das Internet zuzugreifen, was eine vielfältige und große Anzahl von Internetverbindungen ermöglicht, die für die Datensammlung entscheidend sind. Daher sind Proxies das leistungsfähigste Webdatensammlungsprodukt; es kann verwendet werden, um Funktionen auszuführen, die mit Datensätzen oder Data-Scraping-APIs nicht möglich wären.

Unter den Proxies ist der Residential Proxy das Produkt, das am schwierigsten von Websites als Proxy identifiziert werden kann. Beispielsweise sind andere Proxies wie Datacenter-Proxies aufgrund ihres Standorts leicht zu identifizieren. Daher treiben Residential Proxies die meisten anderen Webdatenprodukte wie Data-Scraping-APIs an.

Überprüfen: Ist Ihre Webdatensammlung konform und ethisch?

Ihr Unternehmen nutzt höchstwahrscheinlich Webdaten. Die Branche ist jedoch nur begrenzt reguliert, weshalb es wichtig ist, einen ethischen und konformen Anbieter zu wählen. Um dies zu erreichen, haben wir einen ganzheitlichen Rahmen geschaffen, um verschiedene Aspekte der Webdatensammlung zu berücksichtigen, einschließlich ethischer Beschaffung, ethischer Nutzung und externer Zertifizierung.

Webdaten sind ein gängiges operatives Gut

Als Unternehmen stützt sich Ihr Geschäft teilweise auf Webdaten aufgrund ihrer zahlreichen Anwendungsfälle wie:

  • Dynamische Preisgestaltung für Einzelhandel & E-Commerce
  • Echtzeit-Alt-Daten für Investmentfonds
  • KYC-Prozess im Firmenkundengeschäft
  • Training oder Feinabstimmung von KI-Modellen
  • KI-Inferenz oder RAG
  • Marktforschung

Mit KI sind Webdaten jetzt wichtiger

Obwohl die Datensammlung aus dem Web so alt ist wie das Web selbst, hat ihre Bedeutung nach dem Aufstieg generativer KI-Modelle drastisch zugenommen. Entwickler dieser Modelle wie OpenAI und Anthropic begannen ohne nennenswerte Inhaltspartnerschaften und nutzten hauptsächlich Online-Daten, um ihre ersten Modelle zu erstellen, was zum Aufstieg der Billionen-Dollar-KI-Branche führte.

Begrenzte regulatorische Aufsicht

Obwohl die KI-Regulierung im Fokus steht, bleibt die Datensammlungsbranche in den meisten Ländern weitgehend unreguliert. Klar definierte illegale Online-Aktivitäten sind gut bekannt. Es gibt jedoch nur begrenzte regulatorische Anforderungen, dass Branchenteilnehmer proaktiv die missbräuchliche Nutzung ihrer Dienste durch Nutzer verhindern müssen.

Es liegt an den Plattformen selbst, Best Practices und Compliance-Standards festzulegen, um eine ethische Datensammlung und Proxy-Nutzung sicherzustellen. Daher ist Ihre Wahl des Anbieters bei der Datensammlung wichtiger als in stark regulierten Branchen wie dem Bankwesen, wo jeder Dienstleister verpflichtet ist, zahlreiche Vorschriften einzuhalten.

Die ethische Haltung Ihrer Lieferanten ist Teil des Rufs Ihres Unternehmens

Unabhängig davon, ob Sie die Daten sammeln oder nutzen, sind Sie für den Beschaffungsprozess verantwortlich.

Die Verantwortung von Unternehmen für rechtswidrige Aktivitäten in ihrer Lieferkette hängt von der Rechtsordnung ab. Beispielsweise sind Unternehmen in Deutschland verpflichtet, KYS- und Risikomanagementaktivitäten durchzuführen, um Schäden durch ihre Lieferkette zu identifizieren und zu verhindern. Selbst wenn Unternehmen nicht für Schäden durch ihre Lieferkette verantwortlich sind, können sie reputationsbezogene Risiken eingehen.

Was kostet die unethische und nicht konforme Datensammlung?

Reputationsrisiko

Wenn bekannt wird, dass ein Unternehmen einen Webdatensammlungsdienst nutzt, der sich unethisches Verhalten oder Handlungen leistet, die die Datensicherheit gefährden, kann dies zu erheblichen Reputationsschäden führen, wie Verlust von Geschäft, Kundenabwanderung, Talentabwanderung und Verlust des Anlegervertrauens.

Reale Beispiele dafür, dass Lieferanten von Unternehmen zu einem Verlust des Ansehens geführt haben:

  • Nike erlitt mehrfach Reputationsschäden aufgrund der unethischen Arbeitspraktiken seiner Lieferanten.1
  • Viele Unternehmen wie EY verloren das Vertrauen ihrer Kunden, als sie von der MOVEit Managed-File-Transfer-Software-Breach betroffen waren. 2

Reputationsschäden, insbesondere solche, die öffentliche Empörung auslösen, werden typischerweise von Klagen der Kunden des Unternehmens oder anderer Stakeholder gefolgt, die durch die unethischen Praktiken geschädigt wurden.

Reales Beispiel: Starbucks ist eine der jüngsten Marken, die wegen der Beschaffung von Unternehmen mit unethischen Praktiken verklagt wurde.3

Checkliste für ethische Webdaten

Unternehmens-Webdaten müssen 3 Anforderungen erfüllen, um ethisch zu sein:

Ethische Nutzung durch Kunden

Im Rahmen ihrer Know-Your-Supplier-Prozesse vermeiden Unternehmen die Nutzung von Diensten, die unethische Aktivitäten ermöglichen. Die Nutzung solcher Dienste setzt Unternehmen Reputationsschäden aus.

Reales Beispiel: In Fällen, in denen ein Anbieter dokumentiert wurde, während er es seiner Plattform ermöglichte, für unethische Aktivitäten genutzt zu werden, distanzierten sich zahlreiche Unternehmen von dem Anbieter, bis er seine Praktiken verbesserte.4

Wie dies mit Webdaten zusammenhängt: Webdaten werden über verschiedene IP-Adressen gesammelt. Diese Adressen können verwendet werden, um verschiedene rechtswidrige Aktivitäten auszuführen, wie DDOS-Angriffe, um die Bereitstellung digitaler Dienste zu verhindern, nicht autorisierte Datensammlung oder Ad-Fraud. Schädlinge benötigen IPs, um ihre Aktionen auszuführen, und Webdateninfrastruktur-/Proxy-Anbieter sind die größten Lieferanten von IPs an Privatkunden.

Ethische Beschaffung

Dienste, die für ethische Zwecke verwendet werden, können während ihrer Produktion unethische und schädliche Handlungen verursachen. Beispielsweise erlitten Marken wie Nike und Nestle Reputationsschäden und sahen sich Klagen ausgesetzt, aufgrund der Nutzung von Kinderarbeit durch ihre Auftragnehmer.

Wie dies mit Webdaten zusammenhängt:

Unternehmen müssen auf eine große Anzahl und vielfältige Quellen von Bandbreite für schnelle und globale Datensammlung zugreifen können. Dies erfordert die Verwendung von Residential Proxies: Während die Sammlung öffentlicher Daten unter vielen Bedingungen legal ist, 5 können Websites auch beschließen, einige ihrer Besucher zu blockieren. Beispielsweise können sie Crawler ihrer Wettbewerber blockieren. In solchen Fällen müssen Unternehmen auf eine große Anzahl von Verbindungen von Privatkunden oder anderen Dritten angewiesen sein, um Webdaten zu sammeln.

Proxy-Anbieter sammeln Millionen von Internetverbindungen aus verschiedenen Quellen und stellen sie Unternehmen zur Verfügung, die IP-Adressen verwenden, um auf diese Verbindungen zuzugreifen. Einige dieser IPs stammen von Geräten privater Benutzer. Die Sammlung dieser Verbindungen kann legal oder illegal sein:

  • Legal: Rechtlich konforme Praktiken beinhalten die Einholung informierter Zustimmung der Benutzer, die Bereitstellung einer Entschädigung und die Bereitstellung von Opt-out-Möglichkeiten gemäß den lokalen Vorschriften. Der Webdatenanbieter sollte
    • Benutzer darüber informieren, wie ihre Bandbreite verwendet wird
    • Ihre Zustimmung digital einholen
    • Sie dafür entschädigen
    • Ihnen jederzeit die Möglichkeit geben, ihre Zustimmung zu widerrufen
  • Illegal: Schädlinge können Zugriff auf Geräte von Benutzern erhalten und ihre Internetverbindung ohne Erlaubnis oder Entschädigung nutzen. Dies kann durch Malware-Apps, kompromittierte Geräte, maskierte Installationen, automatische Opt-in und andere Methoden geschehen, die den Gerätebesitzer gefährden können.

Unternehmen, die illegal erhaltene Proxies verwenden, können unbeabsichtigt Schädlinge für den unbefugten Zugriff auf Geräte bezahlen.

Reale Beispiele:

  • Router und IoT-Geräte wurden für Botnet-Operationen kompromittiert und als Residential Proxies verkauft.6 7
  • Bestimmte Proxy-Anbieter bewerben ihre Dienste in Foren, die von Schädlingen frequentiert werden. Diese IPs sind wahrscheinlich illegal erworben.8
  • VPN-Apps im Google Play Store wurden ebenfalls verwendet, um Residential IPs ohne Zustimmung der Benutzer zu erwerben.9

Obwohl diese Operationen eingestellt wurden, ist es wahrscheinlich, dass Schädlinge weiterhin ohne Zustimmung über Botnets und kompromittierte oder schädliche Anwendungen auf Residential IPs zugreifen.

Externe Zertifizierung

Unternehmenskäufer benötigen sichere, für Unternehmen geeignete Lösungen. Wir haben die Bestandteile einer ausgereiften Webdatenorganisation identifiziert, die durch externe Zertifizierung dokumentiert werden können:

Datensicherheit

Mangelnde Datensicherheit in den Systemen eines Lieferanten kann den Wettbewerbsvorteil eines Unternehmens schmälern oder zu Datenverlust und Systemausfall führen. Der Verlust der Systemfunktionalität kann das Vertrauen erschüttern und zur Abwertung eines Unternehmens führen.

Systemintrusion

Datensammlungsdienste sind nicht so tief in die Systeme eines Unternehmens integriert wie zentrale digitale Dienste (z. B. ein System of Record wie CRM). Daher werden ihre Sicherheitsnachweise nicht so gründlich überprüft wie die eines zentralen Systems wie eines Systems of Record. Dennoch ist die Datensicherheit für die Kunden von Datensammlungsdiensten entscheidend, da diese Dienste:

  • Manchmal in zentralere Systeme wie Preisgestaltungssysteme integriert sind.
  • Unternehmenssysteme infizieren können, selbst wenn sie nicht in solche Systeme integriert sind. Die Nutzung eines Datensammlungsdienstes beinhaltet das Empfangen von Daten von diesem Dienst. Selbst einige der sichersten Formen des Datentransfers beinhalten Risiken.

Systemintrusion kann auch dazu führen, dass Angreifer die Geräte angreifen, die Residential IPs an einen Proxy-Dienst liefern. Dies kann zu Reputationsschäden für die Kunden dieses Proxy-Dienstes führen.

Reales Beispiel für eine Schwachstelle bei einem Residential-Proxy-Anbieter:

Die Betreiber des Kimwolf-Botnets kauften Proxy-Dienste von dem Residential-Proxy-Anbieter IPIDEA. Mit bösartigen Befehlen infizierten sie die internen Netzwerke von Geräten, die IPs an IPIDEA liefern. Diese Netzwerke wurden dann gescannt und andere anfällige Geräte in diesen lokalen Netzwerken wurden ebenfalls infiziert.

Kimwolf verbreitete sich nach Schätzungen mit dieser Methode auf mehr als 2 Millionen Geräte. Die von IPIDEA-Kunden gesammelten Daten flossen ebenfalls durch diese infizierten Netzwerke.10

Datenverlust

Ohne Datensicherheit können Schädlinge Zugriff auf Daten erhalten, die von Unternehmen gesammelt wurden, um deren Aktivitäten und Strategien zu identifizieren, was zu einem Verlust des Wettbewerbsvorteils oder von Geschäftschancen führt.

Reales Beispiel:

Obwohl Webdaten öffentlich sind, können Unternehmen Webdaten auf neuartige Weise nutzen, um einen Wettbewerbsvorteil zu erlangen. Beispielsweise geben Investoren bis zu 10 % ihres Marktdatenbudgets für Alt-Daten aus11 , aber sie geben ihre Strategien selten preis, da sie glauben, dass dies ihnen gegenüber ihren Wettbewerbern einen Vorteil verschaffen kann. Ein Datenleck kann dazu führen, dass ihre Strategien offengelegt und daher von ihren Wettbewerbern repliziert werden.

PII-Management

Webdaten enthalten private Daten hinter Login oder PII, die versehentlich oder absichtlich auf öffentlichen Websites offengelegt werden können. Wenn Webdatensammlungsdienste PII nicht korrekt verwalten, können solche Daten von Schädlingen erworben werden. Dies kann zu Reputationsschäden für den Webdatensammlungsdienst und seine Kunden führen.

Anwendungssicherheit

Anwendungen oder Zwischenprogramme wie SDKs, die die IPs der Webdatensammlungsdienste bereitstellen, können von externen Zertifizierungsanbietern wie McAfee auf die Whitelist gesetzt werden. Dies erhöht das Vertrauen des Unternehmens in die ethischen Beschaffungspraktiken des Webdatensammlungsdienstes.

Versicherungsschutz

Unternehmen verlangen typischerweise diese Versicherungen von jedem digitalen Anbieter:

  • Berufshaftpflichtversicherung
  • Cyber-Versicherungszertifikat
Entdecken Sie weitere unserer Benchmarks und datengestützten Erkenntnisse in der Google-Suche.
GoogleAls bevorzugte Quelle hinzufügen

Detaillierter Benchmark: Bewertung von Webdateninfrastruktur-Anbietern

Benchmark: Ethische Nutzung durch Kunden

Hier wollen wir die Frage beantworten: Stellt das Unternehmen sicher, dass die Nutzung seiner Lösung ethisch und im Einklang mit geltenden Gesetzen und Vorschriften erfolgt? Zusammenfassung unserer Ergebnisse:

* Nicht anwendbar: Da Zyte und Apify Proxies von ihren Lieferanten kaufen und diese nicht direkt von privaten Benutzern sammeln, würden sie von Website-Betreibern bezüglich Missbrauchs nicht erreicht und benötigen daher kein Kontaktformular für Websites.

Zuerst überprüften wir die Richtlinien:

Überprüfung der Nutzungsrichtlinie

Alle Anbieter verbieten rechtswidrige Aktivitäten und geben Beispiele wie DoS-Angriffe, unerwünschte Massenmeldungen, Identitätsbetrug oder Spoofing an.

Zusätzlich verbieten einige Anbieter auch Aktivitäten, die wahrscheinlich rechtswidrig sind. Im Folgenden listen wir die verbotenen Aktivitäten basierend auf den Nutzungsrichtlinien und deren Ergänzungen (z. B. Datenverarbeitungszusatz) jedes Anbieters auf.

Wir suchten nach Begriffen, die Aktivitäten verbieten würden, die wahrscheinlich rechtswidrig sind und anhand der Nutzeraktivität identifiziert werden können. Beispielsweise könnte ein erheblicher Anteil der Nutzer, die Proxies verwenden, um bezahlte Umfragen durchzuführen, Proxies verwenden, um Umfrageanbieter über ihren tatsächlichen Standort zu täuschen. Daher ist diese Aktivität sowohl wahrscheinlich rechtswidrig als auch anhand der Nutzeraktivität identifizierbar (d. h. wenn ein Nutzer sich auf einer bezahlten Umfrage-Website anmeldet).

Obwohl die klare Identifizierung verbotener Aktivitäten vorteilhaft ist, ist dies keine Voraussetzung und beeinflusst unsere Bewertungen nicht. Unternehmen können sich dafür entscheiden, zu erwähnen, dass sie rechtswidrige Aktivitäten nicht zulassen, anstatt jede mögliche Instanz rechtswidriger Aktivitäten zu nennen.

Die Erwähnung einer Aktivität als verboten bedeutet nicht, dass solche Aktivitäten überprüft oder blockiert werden. Unsere Bewertungen basieren darauf, wie diese Richtlinien umgesetzt werden, wie unten beschrieben:

Prozesse für die ethische Nutzung

Während einige Kategorien, die in den Nutzungsrichtlinien aufgeführt sind, recht breit gefächert sind (z. B. nicht autorisiertes Datenscraping oder Zugriff), sind andere spezifisch genug, um in vorbeugende Maßnahmen (z. B. Zugriffsblockierung) umgesetzt zu werden, die Datensammlungsdienste für Nutzer implementieren können, die ihren KYC-Prozess noch nicht abgeschlossen haben.

Basierend auf diesen spezifischen verbotenen Nutzungszwecken haben wir eine umfangreiche Liste von Nutzungszwecken erstellt, die wahrscheinlich rechtswidrige Nutzung von Proxies darstellen. Für jeden Anwendungsfall identifizierten wir Szenarien, einschließlich relevanter Webdomänen und Aktionen. Beispielsweise versuchten wir im Szenario für künstliche Social-Media-Interaktion, uns mit einem Proxy bei einem sozialen Netzwerk anzumelden, um einen bestehenden Beitrag zu liken.

Dann testeten wir, ob Unternehmen die unethische Nutzung durch Kunden zulassen, indem wir ein Konto bei jedem Anbieterdienst mit einer E-Mail-Adresse erstellten, die nicht zu AIMultiple gehört. Wir haben keinen KYC-Prozess mit diesem Konto abgeschlossen und nutzten die Dienste, um zu verstehen, was anonyme Nutzer mit jedem Dienst erreichen können. KYC ist ein entscheidender Schritt, bei dem der Nutzer Daten einreicht, um die juristische Person zu validieren, die er vertritt. Dies verbindet die Nutzeraktivität mit einer juristischen Person:

  • Die zur Rechenschaft gezogen werden kann.
  • Deren Motivation für Online-Aktionen (z. B. die Anmeldung bei Regierungswebsites mit einem Proxy) geprüft werden kann. Beispielsweise kann nach dem Verständnis ihres Anwendungsfalls ein Forscher oder eine Regierungsbehörde erlaubt werden, sich mit einem Proxy bei einer Regierungswebsite anzumelden.

Wir erwarteten, dass diese Anwendungsfälle einen KYC-Prozess auslösen würden, aber bei den meisten Anbietern tat dies nicht. Ein Häkchen bedeutet, dass die Anfrage für Nutzer blockiert wurde, die den KYC-Prozess noch nicht abgeschlossen haben:

Zur Klarstellung: Datensammlungsdienste haben keine gesetzliche Verpflichtung, diese Websites zu blockieren, und einige dieser Szenarien können Teil einer legalen Nutzung sein. Beispielsweise möchte ein Forscher möglicherweise Proxies nutzen, um ein kontrolliertes Social-Media-Experiment durchzuführen. Angesichts des Missbrauchspotenzials in diesen Szenarien erwarteten wir jedoch, dass Datensammlungsdienste sie für Nutzer blockieren, die den KYC-Prozess noch nicht abgeschlossen haben.

Wie Marken die Domains kommunizieren, die sie blockieren
  • Bright Data listet eingeschränkte Domain-Kategorien in ihrer Nutzungsrichtlinie auf.
Respektierung der Präferenzen von Websites bezüglich automatisierter Datensammlung

Was ist robots.txt?

robots.txt ist ein Dateiname zur Implementierung des Robots Exclusion Protocol. Dieses Protokoll wird von Websites verwendet, um Teile der Website anzugeben, die der Website-Betreiber bevorzugt nicht von Bots besucht werden sollen. Die Einhaltung von robots.txt ist freiwillig.

Vor- und Nachteile der Einhaltung von robots.txt

➕ Respektiert die Präferenzen der Website.

➖ Kann möglicherweise nicht aktuell sein und daher veraltet sein.

➖ Beinhaltet typischerweise Begriffe, die anzeigen, dass der Website-Betreiber bevorzugt, dass bestimmte öffentliche Bereiche der Website nicht von Bots besucht werden.

robots.txt kann auch ungleichen Zugang für Bots bereitstellen. Beispielsweise können Website-Betreiber angeben, dass sie nicht möchten, dass Bots von Suchmaschinen bestimmte URLs besuchen, die Bots von Antwortmaschinen besuchen.

robots.txt ist kein rechtliches Dokument und kann die Blockierung des Bot-Zugriffs für Seiten anfordern, die rechtlich:

  • erlaubt sind, gescraped zu werden (z. B. öffentliche Daten) oder
  • nicht erlaubt sind, gescraped zu werden (z. B. Daten hinter einem Login, bei denen die AGB des Website-Betreibers das Scraping solcher Daten verbieten).

Webdatensammlungsdienstanbieter können Residential-Proxy-Nutzern anfordern, einen KYC-Prozess abzuschließen und nachzuweisen, dass sie einen legalen und ethischen Anwendungsfall haben, bevor diese Nutzer robots.txt ignorieren können.

Zum Testen sendeten wir Anfragen an Seiten in Unterordnern, die von robots.txt blockiert werden sollen. Die Domains, die wir verwendeten, waren aimultiple.com und 5 Webdomains unter den 100 meistbesuchten Webdomains. Nur Bright Data blockierte diese Anfragen:

CNN-Beispiel

Das robots.txt von CNN blockiert den Ordner /terms12 . Zum Testen navigierten wir mit Residential Proxies zu diesem Ordner und erhielten 200-Meldungen mit den Daten der Seite von allen Anbietern außer Bright Data. Die Antwort von Bright Data lautet: „Residential fehlgeschlagen (bad_endpoint): Die angeforderte Site ist nicht für den sofortigen Residential-Zugriff (ohne KYC) gemäß robots.txt verfügbar. Um vollen Residential-Zugriff für die Zielsetzung dieser Site zu erhalten, füllen Sie das KYC-Formular aus: https://brightdata.com/cp/kyc.

Missbrauchsmanagement

Wir haben eine Methodik zur Bewertung der Missbrauchsmanagementpraktiken von Anbietern dargelegt und Daten gesammelt, um unsere Bewertungskriterien zu erfüllen:

* Nicht anwendbar: Zyte kauft Proxies von anderen Proxy-Anbietern und daher würden Website-Betreiber bei Missbrauch des Dienstes von Zyte dessen Proxy-Anbieter und nicht Zyte erreichen.

Obwohl alle Anbieter Mittel bereitstellen, damit Dritte oder ihre Kunden sie erreichen können, sind diese wichtig für die Problemlösung:

  • Öffentliche Missbrauchspolitik
  • Eine dedizierte E-Mail-Adresse zur Meldung von Missbrauch
  • Eine alternative Kontaktmethode (z. B. Webformular oder Messaging-Interface), die es Meldenden ermöglicht, das Unternehmen zu erreichen. Dies ist hilfreich, da E-Mails gefiltert werden und möglicherweise das Postfach nicht erreichen können.
  • Reaktionsfähigkeit auf Nachrichten

3 Anbieter im Benchmark (Bright Data) stellten eine E-Mail-Adresse zur Meldung von Missbrauch bereit. Alle diese Anbieter legten auch ihre Richtlinien in diesem Bereich dar.

Wir erwarten, dass alle anderen Anbieter dasselbe tun und dass dies kurzfristig eine weit verbreitete Branchenpraxis wird.

Schließlich bewerteten wir die Reaktionsfähigkeit des Missbrauchsmanagements, indem wir Missbrauchsmeldungen von Drittanbieter-Domains (d. h. nicht AIMultiple) per E-Mail versandten und die Antwortzeiten maßen. Wenn wir keine Missbrauch-E-Mail-Adresse finden konnten, sendeten wir sie an das allgemeine Kontaktformular. Wir testeten dies über 3 E-Mail-Serien, die am folgenden Datum versandt wurden:

  • Freitag, 2. Mai 2025 von:
    • Einem Ticketverkaufsservice mit ca. 30.000 monatlichem Traffic
    • Einer Anwaltskanzlei mit ca. 1.000 monatlichem Traffic
  • 17. Mai 2025 vom Ticketverkaufsservice.
  • 24. Mai 2025 von einer Social-Media-Agentur mit begrenztem Online-Traffic.

Die ersten E-Mails, die am 2. Mai 2025 versandt wurden, wurden an Unternehmen gesendet, die dedizierte E-Mail-Adressen bereitstellten. Später erweiterten wir unsere Liste und fügten weitere allgemeine E-Mail-Adressen hinzu, die in den Kontaktabschnitten aller bewerteten Webdatensammlungsdienste aufgeführt waren. Wenn ein Unternehmen auf unsere E-Mails antwortete, hörten wir auf, weitere E-Mails zu senden.

In unseren E-Mails erwähnten wir, dass unsere Websites verdächtigen Bot-Traffic über Proxies erhalten hatten, und baten um ihre Unterstützung bei der Identifizierung der Proxy-Quelle. Wir konnten alle Compliance-Teams außer eines dazu bringen, uns zu antworten. Fast alle Antworten wurden am selben Tag erhalten.

Nutzungstransparenz

Website-Betreiber, die Webdaten bereitstellen, und Webdatensammlungsdienste hatten historisch keinen Datenaustausch über Datensammlungsaktivitäten. Um Crawling-Aktivitäten einzuschränken, konnten Website-Betreiber entweder:

  • Webdatensammlungsdienste kontaktieren, um Missbrauch zu melden
  • Mit Bot-Management-Anbietern wie Cloudflare zusammenarbeiten, um das Crawling schwieriger zu machen.

Jetzt gibt es Initiativen für einen strukturierteren Datenaustausch zwischen diesen Parteien. Bright Data hat die Bright Data Webmaster-Konsole für Webmaster gestartet, um Crawling-Aktivitäten auf ihren Websites zu überwachen. Mehr Transparenz wird wahrscheinlich die Praktiken der Webdatensammlung verbessern.

Unsere Erfahrung mit der Webmaster-Konsole

Wir meldeten uns an, indem wir den Besitz unserer Domain verifizierten und eine collectors.txt-Datei auf der Domain hinzufügten.

Wir haben jetzt Zugriff auf die Bot-Aktivität von Bright Data auf unserer Website:

Benchmark: Ethische Beschaffung

* Bewertungen auf diesen Drittplattformen wurden einbezogen: Amazon Appstore, App Store, Google Play Store, Trustpilot. Der Einfachheit halber wurde dieser Wert für 5 große Apps von Bright Data berechnet, nicht für alle 120 Apps, die auf ihrer Website vorgestellt werden.

Transparenz der Partner

Die von Webdateninfrastrukturunternehmen benötigte Bandbreite kann auf ethische Weise bereitgestellt werden, indem Vorteile (z. B. Zahlungen, Funktionen wie die Möglichkeit, Werbung zu überspringen) im Austausch für die Zustimmung zur Freigabe der Internetverbindung bereitgestellt werden. Es ist jedoch auch möglich, unbefugten Zugriff auf Systeme von Privatkunden zu erhalten und deren Verbindungen zu verkaufen.

Webdateninfrastruktur-Anbieter können Richtlinien und Prozesse formulieren, externe Audits durchführen und ihren Ansatz sowie die Audit-Ergebnisse veröffentlichen, um Transparenz darüber zu schaffen, wie sie ihre Internetverbindungen beschaffen. Dies kann das Vertrauen in die ethische Beschaffung ihres Dienstes fördern.

Wir haben einen Rahmen für Transparenz auf der Beschaffungsseite im Bereich Webdaten erstellt und Anbieter anhand dieses Rahmens bewertet. Wir wendeten diesen Rahmen unabhängig davon an, ob ein Webdatensammlungsdienst Residential IPs selbst oder über andere Proxies erwarb. Unser Ziel ist es, Transparenz in der gesamten Lieferkette von IPs zu schaffen, da unethische Praktiken an jedem Punkt der Lieferkette entstehen können.

Hier finden Sie unsere detaillierten Ergebnisse:

Bright Data

Bright Data wird als Stufe 5 eingestuft, da sie

  • Ihren Beschaffungsansatz und wie App-Entwickler über ihr SDK mit ihnen zusammenarbeiten können, veröffentlichen13 14
  • Details zu 120 Lieferanten öffentlich geteilt wurden. Wir konnten die Bewertungen dieser Lieferanten auf Drittplattformen überprüfen, um abzuschätzen, wie beliebt sie sind. 15

Überprüfung ausgewählter Apps

Bright Data teilt 120 Apps auf ihrer Website. Apps wie Bright VPN werden von Dritten hinsichtlich ihrer Offenlegung und Benutzererfahrung zertifiziert.16 Wir haben diese Apps auch heruntergeladen, um sie detaillierter zu sehen:

  • Bright VPN
  • EarnApp
  • Sling Kong

Opt-in-Formular mit Verpflichtung, keine personenbezogenen Daten zu sammeln: Zustimmungsformular mit klarer Erklärung von

Bright VPN:

Earn App:

Sling Kong:

  • Dem Benutzer wird das Angebot während des Spiels präsentiert:
  • Opt-in:
  • Zusätzliche Informationen während des Opt-in:
  • Opt-out:

Von Apps bereitgestellter Wert:

  • Bright VPN: Kostenlose VPN-Dienstleistung
  • EarnApp: Zahlungen
  • Sling Kong: In-Game-Virtuelle Währung
Andere

Obwohl die meisten Anbieter sich der Ethik beim Web-Scraping bewusst sind und dazu veröffentlicht haben (z. B. 17 , haben wir ihre spezifischen Verpflichtungen in diesem Bereich außer bei Zyte nicht identifiziert.18

Wir erwarten, dass sich dies ändert und die meisten Anbieter kurzfristig zumindest Stufe 1 erreichen.

Externe Zertifizierung

* Zeigt an, dass das Unternehmen alle externen Zertifizierungen in dieser Kategorie erworben hat

Es ist entscheidend, dass Anbieter über die richtigen Systeme, Mitarbeiter und Prozesse verfügen, um die Daten ihrer Kunden zu schützen und die Apps zu sichern, die ihre IPs bereitstellen. Siehe unsere Methodik zur Messung externer Zertifizierung, um die Logik hinter unserer Bewertung zu verstehen.

GDPR- und CCPA-Konformität

Alle Anbieter behaupten öffentlich, konform mit beiden Datenschutzvorschriften zu sein. Daher wurde dies nicht in die Bewertung einbezogen.

Wie wir die organisatorische Reife gemessen haben

Basierend auf den Fähigkeiten, die wir in diesem Bereich identifiziert haben, überprüften wir anhand der öffentlichen Aussagen jedes Anbieters, ob diese Zertifikate vorhanden sind:

  • Datensicherheitszertifizierung & PII-Zertifizierung: 19 20 21 22 23
  • IP-Quelle auf Whitelist: 24
  • Ethische Praktiken bewertet: 25

Einige Anbieter, die nicht über ISO 27018-Zertifikate verfügen, behaupteten, dass sie als zertifiziert angesehen werden sollten, da sie Cloud-Dienstanbieter nutzen, die über ISO 27018-Zertifikate verfügen. Die Meinung unseres Cybersecurity-Beraters war, dass dies zwar die Zertifikatsbeschaffung erleichtern würde, sie jedoch immer noch ihre Richtlinien und Kontrollen zertifizieren lassen müssten, um das Zertifikat zu erhalten.

Versicherungsschutz

3 Webdatensammlungsunternehmen teilten ihre Zertifikate für Versicherungen. Wir veröffentlichen keine Zertifikate, sondern überprüften die Dokumente, um sicherzustellen, dass

  • sie diese 2 Versicherungskategorien abdecken
  • Die Versicherungssumme in jeder Kategorie mindestens im mehrstelligen Millionenbereich in US$ liegt.

Haftungsausschluss und Empfehlungen für nächste Schritte

Alle Anbieter in diesem Benchmark außer Nimble sind Kunden von AIMultiple. Wie immer haben wir unsere ethischen Verpflichtungen während dieser Forschung eingehalten.

Wir haben eine erschöpfende Überprüfung der ethischen Webdatensammlung durchgeführt und sind mit dem Umfang dieses Benchmarks zufrieden, würden jedoch gerne die Teilnahme erhöhen. Wir danken diesen Unternehmen für die Bereitstellung ihres Versicherungsschutzes: Apify, Bright Data, Zyte.

Wir warten auf Antworten von NetNut, Nimble. Wir werden den Bericht aktualisieren, sobald wir weitere Updates von ihnen erhalten. 2 Anbieter haben sich entschieden, an dieser Iteration des Benchmarks nicht teilzunehmen. Wir aktualisieren diesen Bericht immer, wenn einer dieser 7 Unternehmen Änderungsvorschläge macht, die sachlich fundiert, fair gegenüber allen Anbietern sind und Unternehmen helfen, bessere Entscheidungen zu treffen.

Dies ist nach unserer Recherche der erste Bericht, der sich auf ethische Webdaten konzentriert. Wir hoffen, dass diese Transparenz der Webdatenbranche helfen kann, kreative Lösungen für ihre Herausforderungen zu finden. Diese Lösungen müssen die Interessen von Webdatensammlern, Nutzern von Webautomatisierung, Website-Betreibern und privaten Benutzern, die ihre IPs an die Branche liefern, ausbalancieren.

Methodik-Einschränkungen

Dieser Benchmark misst beobachtbare Reifegradindikatoren, einschließlich Kunden-Nutzungssteuerungen, Transparenz der IP-Beschaffung, externe Zertifizierungen und das Teilen von Versicherungen. Die Bewertung bestimmt jedoch nicht vollständig, ob ein Anbieter in jedem Anwendungsfall des Kunden rechtlich konform ist.

Daher sollte eine hohe Benchmark-Bewertung als Eingabe für die Due-Diligence bei der Beschaffung betrachtet werden, nicht als Garantie für Rechtmäßigkeit oder ethische Nutzung.

Referenzen

Diese Forschung zitieren

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Cem Dilmegani (2026) - "Ethischer und konformitätsrelevanter Webdaten-Benchmark". Online veröffentlicht auf AIMultiple.com. Abgerufen am 21. Juni 2026, von: https://aimultiple.com/web-scraping-ethics [Online-Ressource]

Dilmegani, C. (2026, 21. Juni). Ethischer und konformitätsrelevanter Webdaten-Benchmark. AIMultiple. https://aimultiple.com/web-scraping-ethics

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Ethischer und konformitätsrelevanter Webdaten-Benchmark}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/web-scraping-ethics}},
  note   = {AIMultiple. Abgerufen am 21. Juni 2026}
}

Referenzlinks

1.
Workers Fainted at Nike Clothing Factory Despite a Vow to Reform — ProPublica
ProPublica
2.
2023 MOVEit data breach - Wikipedia
Contributors to Wikimedia projects
3.
https://www.courthousenews.com/wp-content/uploads/2024/01/starbucks-labor-rights-violations-suit.pdf
4.
Verifying Device
The Times
5.
Court Rules in Favor of Bright Data in Meta v. Bright Data Case - Bright Data
Bright Data
6.
Popa: From Sourcing to Distribution | Synthient
Synthient
7.
‘Popa’ Botnet Linked to Publicly-Traded Israeli Firm – Krebs on Security
8.
https://media.defense.gov/2024/Sep/18/2003547016/-1/-1/0/CSA-PRC-LINKED-ACTORS-BOTNET.PDF
9.
Internet Crime Complaint Center (IC3) | Home Internet Connected Devices Facilitate Criminal Activity
10.
A Look at the Residential Proxy Market | Intel 471
Website
11.
Satori Threat Intelligence Alert: PROXYLIB and LumiApps Transform Mobile Devices into Proxy Nodes - HUMAN Security
HUMAN Security
12.
Kimwolf Botnet Lurking in Corporate, Govt. Networks – Krebs on Security
13.
Subscribe to read
Financial Times
14.
https://edition.cnn.com/robots.txt
15.
Ethically Sourcing Residential Proxies | Bright Data
Bright Data
16.
homepage - Bright SDK
Bright SDK
17.
How Bright Data Obtains Its Residential IPs - Bright Data
Bright Data
18.
Bright VPN Compliance with guidelines - Google Sheets
19.
What is ethical scraping and how do you do it?
Apify Blog
20.
Web Scraping Data Compliance | Zyte
21.
https://brightdata.com/trustcenter/data-security-overview-protection-measures
22.
Security | Platform | Apify Documentation
23.
https://netnut.com/wp-content/uploads/2024/01/NetNut-ISO.pdf
24.
Nimble Trust Center | Security, Compliance & Reliability
25.
Trust Center | Zyte
Cem Dilmegani
Cem Dilmegani
Leitender Analyst
Cem ist seit 2017 leitender Analyst bei AIMultiple. AIMultiple informiert monatlich Hunderttausende von Unternehmen (laut similarWeb), darunter 55 % der Fortune 500. Cems Arbeit wurde von führenden globalen Publikationen wie Business Insider, Forbes und der Washington Post, von globalen Unternehmen wie Deloitte und HPE sowie von NGOs wie dem Weltwirtschaftsforum und supranationalen Organisationen wie der Europäischen Kommission zitiert. Weitere namhafte Unternehmen und Ressourcen, die AIMultiple referenziert haben, finden Sie hier. Im Laufe seiner Karriere war Cem als Technologieberater, Technologieeinkäufer und Technologieunternehmer tätig. Über ein Jahrzehnt lang beriet er Unternehmen bei McKinsey & Company und Altman Solon in ihren Technologieentscheidungen. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung. Bei einem Telekommunikationsunternehmen leitete er die Technologiestrategie und -beschaffung und berichtete direkt an den CEO. Darüber hinaus verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von null auf einen siebenstelligen jährlichen wiederkehrenden Umsatz und eine neunstellige Unternehmensbewertung kam. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider gewürdigt. Er ist ein gefragter Redner auf internationalen Technologiekonferenzen. Cem absolvierte sein Studium der Informatik an der Bogazici-Universität und besitzt einen MBA der Columbia Business School.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450