A medida que las empresas escalan sus operaciones de datos web, los ejecutivos de cumplimiento, datos y riesgos evalúan cada vez más los riesgos éticos, reputacionales y legales asociados.
Comparamos 5 servicios líderes de recopilación de datos web en 3 dimensiones y probamos cada servicio con más de 20 escenarios potencialmente poco éticos.
Nuestro trabajo le ayuda a evaluar la situación ética de sus prácticas de recopilación de datos y a comprender las posibles consecuencias de los enfoques poco éticos. También ofrecemos directrices para la recopilación ética de datos web y evaluamos los servicios de recopilación de datos web desde una perspectiva de ética y cumplimiento:
Evaluación de los servicios de recopilación de datos web
Evaluamos los principales servicios de recopilación de datos web (también llamados proveedores de datos web o infraestructura de datos web) mediante nuestra lista de verificación de datos web éticos. Estas puntuaciones representan niveles de madurez, siendo 5 el nivel más alto:
Proveedores | Resumen | Uso ético
por parte de los clientes | Suministro
ético | Certificación externa | Cobertura de seguro
compartida** |
|---|---|---|---|---|---|
Nivel 5 | Nivel 5 | Nivel 5 | Seguridad de datos, procesamiento de PII. Fuentes de IP incluidas en lista blanca. Prácticas éticas evaluadas. | ✅ | |
Nivel 1 | Nivel 1 | Nivel 1 | Seguridad de datos | ✅ | |
Nivel 1 | Nivel 1 | Nivel 1 | Seguridad de datos | ✅ | |
Nimble | Nivel 1 | Nivel 1 | Nivel 0 | Seguridad de datos | ❌ |
* Se trata de códigos de nombres de proveedores. Estos proveedores no querían aparecer en este informe y figuran al final de la lista hasta que resolvamos este asunto.
** ✅ indica que la empresa optó por compartir sus certificados de seguro con AIMultiple. ❌ indica que la empresa decidió no compartir sus certificados de seguro con nosotros y, por lo tanto, no pudimos validar su cobertura de seguro. La cobertura de seguro es la categoría en la que dependimos de la participación de las empresas de servicios de datos web para evaluarlas.
Ordenado por la puntuación resumida.
Modelo de puntuación para datos web éticos
A continuación, explicamos cómo se obtienen estas puntuaciones. También puede consultar la justificación de la selección de estas dimensiones de puntuación.
En las 2 primeras categorías, identificamos 5 competencias y las empresas recibieron puntuaciones según el número de competencias que cumplían. El Nivel 5 representa la mayor madurez observada en el mercado y refleja las mejores prácticas actuales más que la perfección.
Capacidades para el uso ético por parte de los clientes
- Procesos eficaces para el uso ético: Evaluamos la capacidad de cada proveedor para impedir el uso poco ético de sus servicios de proxy residencial mediante escenarios de prueba controlados. Si el proveedor bloquea alguna de nuestras solicitudes, se considera cumplido.
- Procesos mejorados para el uso ético: Similar a «procesos eficaces para el uso ético». Sin embargo, esta capacidad indica que el proveedor de servicios bloqueó más de uno de nuestros intentos de usar sus servicios para casos de uso poco éticos.
- Procesos de mejores prácticas para el uso ético: Similar a «procesos eficaces para el uso ético». Sin embargo, esta capacidad indica que el proveedor de servicios bloqueó la mayoría de nuestros intentos de usar sus servicios para casos de uso poco éticos.
- Base de gestión de abusos: Publicación de una política de gestión de abusos y un método para denunciar abusos
- Gestión reactiva de abusos: Medimos cómo respondieron las empresas a múltiples informes de abuso. Incluso si no había una línea directa para denunciar abusos, utilizamos los correos electrónicos publicados por la empresa para contactar con su equipo. Si no recibimos ninguna respuesta a nuestro informe en el plazo de una semana, se consideró que la empresa no respondía.
Capacidades para el suministro ético
El suministro ético implica adquirir direcciones IP de manera ética. Nuestro análisis de mercado identificó los siguientes niveles de transparencia en relación con el suministro ético de IP:
- Nivel 1: Política de obtención de IP publicada.
- Nivel 2: Reveló al menos una fuente (por ejemplo, una aplicación móvil) de IPs que suministra IPs de manera ética. La fuente revelada debe tener en total al menos 10k reseñas en plataformas de terceros, incluidas Google, Apple, las tiendas de aplicaciones de Amazon y Trustpilot.
- Nivel 3: Igual que el Nivel 3 pero con 100k reseñas
- Nivel 4: Igual que el Nivel 3 pero con 1M reseñas
- Nivel 5: Igual que el Nivel 4 pero con 10M reseñas
Las reseñas son un indicador de la popularidad de las aplicaciones y constituyen una señal importante para esta evaluación. Los servicios de recopilación de datos web necesitan trabajar con aplicaciones populares para poder satisfacer las necesidades de IP de sus clientes.
Para la cualificación, las aplicaciones reveladas deben seguir estas mejores prácticas. No lo comprobaremos en cada aplicación revelada, sino en algunas seleccionadas aleatoriamente:
- Consentimiento informado:
- Los usuarios deben aceptar antes de compartir su conexión a internet. La pantalla de aceptación debe explicar:
- El proveedor
- El servicio
- Cómo se utilizará su IP
- Los usuarios deben poder acceder a información detallada sobre
- Cómo se utilizará su conexión a internet
- Política de privacidad
- Los usuarios deben aceptar antes de compartir su conexión a internet. La pantalla de aceptación debe explicar:
- Valor: Los usuarios deben recibir algún valor de la aplicación (por ejemplo, pago, posibilidad de omitir anuncios u otra funcionalidad)
- Privacidad: Recopilación de datos de usuario limitada y transparente.
En el caso de las redes de proxy residencial, los compradores también deben verificar si el consentimiento es específico, informado, revocable y está separado de permisos de aplicación no relacionados. Deben preguntar si los usuarios pueden excluirse fácilmente, si el uso del ancho de banda está limitado, si los menores están excluidos y si el proveedor audita las aplicaciones o los SDK que suministran IP residenciales.
Certificación externa
Evaluamos la certificación externa en función de si las empresas obtuvieron estos certificados relevantes para la seguridad y el cumplimiento de nivel empresarial.
- Certificación de PII: Capacidad demostrada para gestionar la PII mediante la obtención de la ISO 27018
- Certificación de seguridad de datos: Prácticas de seguridad de datos demostradas mediante la obtención de uno de estos certificados: SOC 2 o ISO/IEC 27001
- Fuente de IP en lista blanca: Los proveedores de certificación externa como McAfee certifican:
- Aplicaciones específicas de 3rd partes que suministran IPs
- SDK que recopila IPs de aplicaciones de 3rd partes
- Prácticas éticas evaluadas: Se puede completar un proyecto de aseguramiento ISAE 3000 para evaluar el cumplimiento interno y las prácticas éticas.
Seguros
Pedimos a los proveedores que nos facilitaran estos documentos de seguro:
- Certificado de seguro de responsabilidad profesional que ofrece cobertura para las responsabilidades del proveedor en caso de problemas en el servicio
- Certificado de seguro cibernético que ofrece cobertura para las responsabilidades del proveedor en caso de problemas relacionados con la seguridad de la información.
Puntuación resumida
Esta puntuación es la suma de todas las puntuaciones dividida entre 3. Las puntuaciones son:
- De 0 a 5 por las capacidades para el uso ético por parte de los clientes
- De 0 a 5 por las capacidades para el suministro ético
- De 0 a 3 por la certificación externa
- De 0 a 2 por los seguros
Servicios líderes de recopilación de datos web
AIMultiple seleccionó los 7 servicios de recopilación de datos web más grandes en función del número de empleados en LinkedIn. Elegimos esta métrica porque es pública y debería estar correlacionada con los ingresos y la preparación empresarial de la empresa. Métricas mejores, como los ingresos o el número de empleados en nómina, no están disponibles públicamente para estas empresas privadas.
Todas las empresas seleccionadas tenían más de 100 empleados conectados a sus páginas de perfil de LinkedIn en abril de 2025. Actualmente, 5 de las 7 seleccionadas aparecen en esta página y las 2 empresas restantes han optado por no ser incluidas en el informe.
Productos de recopilación de datos web analizados
Estas empresas ofrecen una gama de productos que incluye proxies, APIs de scraping de datos y datasets. Aunque todos los productos pueden analizarse desde una perspectiva ética, inicialmente nos centramos en el producto que ofrece el mayor nivel de flexibilidad e impulsa la mayoría de los demás productos: los proxies residenciales.
Los productos de recopilación de datos web pueden considerarse una jerarquía en la que los proxies forman la capa central sobre la que se construyen todos los demás servicios. Esto se debe a que los proxies permiten que las máquinas accedan a internet a través de diferentes destinos, lo que permite un conjunto diverso y amplio de conexiones a internet cruciales para la recopilación de datos. Por tanto, los proxies son el producto de recopilación de datos web más capaz; pueden utilizarse para llevar a cabo funciones que no serían posibles con datasets ni con APIs de scraping de datos.
Entre los proxies, los proxies residenciales son el producto que más difícil resulta para los sitios web identificar como proxy. Por ejemplo, otros proxies, como los proxies de centro de datos, son fáciles de identificar por su ubicación. Por tanto, los proxies residenciales impulsan la mayoría de los demás productos de datos web, como las APIs de scraping de datos.
Verificación: ¿Es su recopilación de datos web conforme y ética?
Lo más probable es que su empresa utilice datos web. Sin embargo, el sector se enfrenta a una regulación limitada, por lo que es importante elegir un proveedor ético y conforme. Para lograrlo, preparamos un marco holístico que tiene en cuenta diferentes aspectos de la recopilación de datos web, como la obtención ética, el uso ético y la certificación externa.
Los datos web son un activo operativo común
Como empresa, su negocio depende parcialmente de los datos web debido a sus numerosos casos de uso, como:
- Precios dinámicos para el comercio minorista y electrónico
- Datos alternativos en tiempo real para fondos de inversión
- Proceso KYC en la banca comercial
- Entrenamiento o fine-tuning de modelos de IA
- IA inference o RAG
- Investigación de mercado
Con la IA, los datos web son ahora más importantes
Aunque la recopilación de datos web es tan antigua como la web, su importancia aumentó drásticamente tras el auge de los modelos de IA generativa. Los creadores de estos modelos, como OpenAI y Anthropic, empezaron sin asociaciones de contenido importantes y utilizaron principalmente datos en línea para construir sus modelos iniciales, lo que dio lugar al auge de la industria de la IA de un billón de dólares.
Supervisión regulatoria limitada
Los requisitos regulatorios para la recopilación de datos web varían considerablemente según la jurisdicción. Por tanto, este benchmark se centra en las prácticas éticas y de cumplimiento en lugar de asumir un marco regulatorio uniforme en todos los países.
Las actividades ilegales claras en línea están bien definidas. Sin embargo, existen requisitos regulatorios limitados para que los actores del sector prevengan de forma proactiva el uso indebido de sus servicios por parte de los usuarios.
Corresponde a las propias plataformas establecer las mejores prácticas y los estándares de cumplimiento para garantizar una recopilación de datos y un uso de proxies éticos. Por tanto, la elección del proveedor es más importante en la recopilación de datos que en sectores muy regulados como la banca, donde cada proveedor de servicios está obligado a cumplir numerosas normativas.
La postura ética de sus proveedores forma parte de la reputación de su empresa
Desde una perspectiva ética y de riesgo de proveedores, las empresas deben evaluar cómo se obtienen los datos web, incluso cuando los consumen en lugar de recopilarlos directamente.
La responsabilidad de las empresas por actividades ilícitas en su cadena de suministro depende de la jurisdicción. Por ejemplo, en Alemania, las empresas son responsables de llevar a cabo actividades de KYS y de gestión de riesgos para identificar y prevenir los daños causados por su cadena de suministro. Incluso cuando las empresas no son responsables de los daños causados por su cadena de suministro, pueden sufrir riesgos reputacionales.
¿Cuál es el coste de la recopilación de datos poco ética y no conforme?
Riesgo reputacional
Si se hace público que una empresa utiliza un servicio de recopilación de datos web que incurre en comportamientos poco éticos o en acciones que ponen en peligro su seguridad de los datos, esto puede provocar daños reputacionales importantes, como pérdida de negocio, fuga de clientes, fuga de talento y pérdida de confianza de los inversores.
Ejemplos reales de proveedores empresariales que provocan pérdidas reputacionales:
- Nike ha sufrido daños reputacionales en numerosas ocasiones debido a las prácticas laborales poco éticas de sus proveedores.1
- Muchas empresas como EY perdieron la confianza de sus clientes cuando se vieron afectadas por la brecha del software de transferencia gestionada de archivos MOVEit. 2
Riesgo legal
La pérdida reputacional, especialmente la que provoca indignación pública, suele ir seguida de demandas por parte de los clientes de la empresa u otras partes interesadas que se han visto perjudicadas por las prácticas poco éticas.
Ejemplo real: Starbucks es una de las marcas recientes demandadas por abastecerse de empresas con prácticas poco éticas.3
Lista de verificación de datos web éticos
Los datos web empresariales deben cumplir 3 requisitos para ser éticos:
Uso ético por parte de los clientes
Como parte de sus procesos de Know Your Supplier, las empresas evitan utilizar servicios que permiten actividades poco éticas. El uso de estos servicios expone a las empresas a daños reputacionales.
Ejemplo real: En casos en los que se documentó que un proveedor permitía que su plataforma se utilizara para actividades poco éticas, numerosas empresas se distanciaron del proveedor hasta que mejoró sus prácticas.4
Cómo se relaciona esto con los datos web: Los datos web se recopilan a través de diferentes direcciones IP. Estas direcciones pueden utilizarse para llevar a cabo distintas actividades ilícitas, como ataques DDOS para impedir la prestación de servicios digitales, la recopilación no autorizada de datos no públicos o el fraude publicitario. Los actores maliciosos necesitan IPs para impulsar sus acciones, y los proveedores de infraestructura de datos web/proxy son los mayores suministradores de IPs a usuarios minoristas.
Suministro ético
Los servicios utilizados con fines éticos pueden causar acciones poco éticas y perjudiciales durante su producción. Por ejemplo, marcas como Nike y Nestle sufrieron daños reputacionales y se enfrentaron a demandas debido al uso de trabajo infantil por parte de sus contratistas.
Cómo se relaciona esto con los datos web:
Las empresas necesitan acceder a un gran número y a diversas fuentes de ancho de banda para una recopilación de datos rápida y global. Esto requiere el uso de proxies residenciales: En Estados Unidos, acceder a datos web públicamente disponibles puede no constituir un acceso no autorizado en virtud de la CFAA en algunas circunstancias, aunque pueden seguir aplicándose otras leyes y restricciones contractuales. 5 Los sitios web también pueden optar por bloquear a algunos de sus visitantes. Por ejemplo, pueden bloquear los rastreadores de sus competidores. En esos casos, las empresas deben recurrir a un gran número de conexiones de usuarios minoristas u otras 3rd partes para recopilar datos web.
Los proveedores de proxy recopilan millones de conexiones a internet de diversas fuentes y las proporcionan a empresas que utilizan direcciones IP para acceder a estas conexiones. Algunas de estas IPs proceden de los dispositivos de usuarios residenciales. La recopilación de estas conexiones puede ser legal o ilícita:
- Legal: Las prácticas que cumplen la legalidad implican obtener el consentimiento informado del usuario, ofrecer una compensación y proporcionar mecanismos de exclusión voluntaria de acuerdo con la normativa local. El proveedor de datos web debe
- Informar a los usuarios sobre cómo se utilizará su ancho de banda
- Obtener su consentimiento digitalmente
- Compensarles a cambio
- Permitirles optar por no participar en cualquier momento
- Ilegal: Los actores maliciosos pueden acceder a los dispositivos de los usuarios y utilizar su conexión a internet sin permiso ni compensación. Esto puede ocurrir mediante aplicaciones maliciosas, dispositivos comprometidos, instalaciones enmascaradas, suscripción automática y otros métodos que pueden poner en riesgo al propietario del dispositivo.
Las empresas que utilizan proxies obtenidos ilegalmente pueden pagar inadvertidamente a actores maliciosos por el acceso no autorizado a dispositivos.
Ejemplos reales:
- Se ha documentado que proveedores de proxy residencial que cotizan en bolsa comparten su infraestructura con SDK que utilizan las conexiones de los dispositivos sin el consentimiento del usuario.67
- Se han comprometido enrutadores y dispositivos IoT para operaciones de botnets y se han vendido como proxies residenciales.8 9
- Ciertos proveedores de proxy promocionan sus servicios en foros frecuentados por actores maliciosos. El uso de proxies para falsear la ubicación o la identidad en encuestas remuneradas puede infringir las normas del proveedor de la encuesta y, según la jurisdicción y la intención, también puede plantear problemas legales relacionados con el fraude.10
- Las aplicaciones VPN de Google Play Store también se han utilizado para obtener IP residenciales sin el consentimiento del usuario.11
Aunque estas operaciones se han cerrado, es probable que los actores maliciosos sigan accediendo a IP residenciales sin consentimiento a través de botnets y aplicaciones comprometidas o maliciosas.
Certificación externa
Los compradores empresariales necesitan soluciones seguras y preparadas para la empresa. Identificamos los ingredientes de una organización madura de datos web que pueden documentarse mediante certificación externa:
Seguridad de los datos
La falta de seguridad de los datos en los sistemas de un proveedor puede erosionar la ventaja competitiva de una empresa o provocar pérdida de datos y tiempo de inactividad del sistema. La pérdida de funcionalidad del sistema puede erosionar la confianza y provocar la devaluación de una empresa.
Intrusión en el sistema
Los servicios de recopilación de datos no están tan profundamente integrados en los sistemas de una empresa como los servicios digitales básicos (por ejemplo, un sistema de registro como un CRM). Por tanto, sus credenciales de seguridad no se revisan tan a fondo como las credenciales de un sistema central como un sistema de registro. Sin embargo, la seguridad de los datos es fundamental para los clientes de los servicios de recopilación de datos, ya que estos servicios:
- A veces se integran en sistemas más centrales, como los motores de precios.
- Pueden infectar los sistemas empresariales incluso cuando no están integrados en ellos. Utilizar un servicio de recopilación de datos implica recibir datos de ese servicio. Incluso algunas de las formas más seguras de transferencia de datos conllevan riesgos.
La intrusión en el sistema también puede llevar a los atacantes a dirigirse contra los dispositivos que suministran IP residenciales a los servicios de proxy. Esto puede provocar daños reputacionales a los clientes de esos servicios de proxy.
Ejemplo real de vulnerabilidad en un proveedor de proxy residencial:
Los operadores de la botnet Kimwolf compraron servicios de proxy al proveedor de proxy residencial IPIDEA. Mediante comandos maliciosos, infectaron las redes internas de los dispositivos que suministraban IPs a IPIDEA. A continuación, se escanearon estas redes y también se infectaron otros dispositivos vulnerables de esas redes locales.
Se estima que Kimwolf se ha extendido a más de 2 millones de dispositivos con este método. Los datos recopilados por los clientes de IPIDEA también fluyeron a través de estas redes infectadas.12
Pérdida de datos
Sin seguridad de los datos, los actores maliciosos pueden acceder a los datos recopilados por las empresas para identificar sus actividades y estrategias, lo que provoca una pérdida de ventaja competitiva u oportunidades de negocio.
Ejemplo real:
Aunque los datos web son públicos, las empresas pueden utilizarlos de formas novedosas para obtener ventaja competitiva. Por ejemplo, los inversores destinan hasta un 10 % de su presupuesto de datos de mercado a datos alternativos13, pero rara vez revelan sus estrategias porque creen que puede ayudarles a obtener una ventaja frente a sus competidores. Una fuga de datos puede exponer sus estrategias y, por tanto, ser replicadas por sus competidores.
Gestión de PII
Los datos web incluyen datos privados detrás de un inicio de sesión o PII que pueden divulgarse en sitios web públicos de forma accidental o intencionada. Si los servicios de recopilación de datos web no gestionan correctamente la PII, los actores maliciosos pueden adquirir esos datos. Esto puede provocar daños reputacionales para el servicio de recopilación de datos web y sus clientes.
Seguridad de las aplicaciones
Las aplicaciones o los programas intermedios, como los SDK, que obtienen las IP de los servicios de recopilación de datos web pueden ser incluidos en listas blancas por proveedores de certificación externa como McAfee. Esto aumenta la confianza de la empresa en las prácticas de suministro ético del servicio de recopilación de datos web.
Cobertura de seguro
Las empresas suelen exigir estos seguros a cualquier proveedor digital:
- Seguro de responsabilidad profesional
- Certificado de seguro cibernético
Benchmark detallado: Evaluación de los proveedores de infraestructura de datos web
Benchmark: Uso ético por parte de los clientes
Aquí pretendemos responder a la pregunta: ¿Garantiza la empresa que el uso de su solución es ético y conforme a las leyes y normativas aplicables? Resumen de nuestros hallazgos:
* No aplicable: Dado que Zyte y Apify compran proxies a sus proveedores y no los recopilan directamente de usuarios residenciales, los propietarios de sitios web no se pondrían en contacto con ellos por abusos y, por tanto, no necesitan crear un formulario de contacto para sitios web.
En primer lugar, revisamos las políticas:
Revisión de la política de uso aceptable
Todos los proveedores prohíben las actividades ilegales y ofrecen ejemplos como ataques DoS, mensajes masivos no solicitados, suplantación de identidad o spoofing.
Además, algunos proveedores destacan que prohíben actividades que probablemente sean ilegales. A continuación, enumeramos las actividades prohibidas según las políticas de uso aceptable y sus anexos (por ejemplo, el anexo de procesamiento de datos) de cada proveedor.
Buscamos términos que prohibieran actividades probablemente ilegales y que pudieran identificarse en función de la actividad del usuario. Por ejemplo, una parte significativa de los usuarios que utilizan proxies para realizar encuestas remuneradas podría estar usando proxies para engañar a los proveedores de encuestas sobre su ubicación real. Por tanto, esta actividad probablemente sea ilegal y puede identificarse en función de la actividad del usuario (es decir, cuando un usuario inicia sesión en un sitio web de encuestas remuneradas).
Aunque identificar claramente las actividades prohibidas es beneficioso, no es un requisito y no afecta a nuestras puntuaciones. Las empresas pueden optar por mencionar que no permiten actividades ilegales en lugar de mencionar cada posible caso de actividad ilegal.
Mencionar una actividad como prohibida no significa que dichas actividades vayan a ser revisadas o bloqueadas. Nuestras puntuaciones se basan en cómo se aplican estas políticas, tal como se describe a continuación:
Procesos para el uso ético
Mientras que algunas categorías descritas en las políticas de uso aceptable son bastante amplias (por ejemplo, el scraping de datos o el acceso no autorizados), otras son lo bastante específicas como para convertirse en acciones preventivas (por ejemplo, el bloqueo del acceso) que los servicios de recopilación de datos pueden aplicar a los usuarios que no han completado su proceso KYC.
A partir de estos usos prohibidos específicos, preparamos una lista amplia de usos que probablemente sean usos ilegales de proxies. Para cada caso de uso, identificamos escenarios que incluyen dominios web y acciones relevantes. Por ejemplo, en el escenario de interacción artificial en redes sociales, intentamos iniciar sesión en una red social mediante un proxy para dar me gusta a una publicación existente.
A continuación, para comprobar si las empresas permiten un uso poco ético por parte de los clientes, creamos una cuenta en el servicio de cada proveedor con una dirección de correo electrónico ajena a AIMultiple. No completamos un proceso KYC con esta cuenta y procedimos a utilizar los servicios para entender qué pueden conseguir los usuarios anónimos con cada servicio. El KYC es un paso crucial durante el cual el usuario envía datos para validar la entidad jurídica que representa. Esto vincula la actividad del usuario a una entidad jurídica:
- Que puede ser considerada responsable.
- Cuya justificación de las acciones en línea (por ejemplo, el uso de proxies para iniciar sesión en sitios web gubernamentales) puede examinarse. Por ejemplo, tras comprender su caso de uso, se puede permitir a un investigador o a una agencia gubernamental iniciar sesión en un sitio web gubernamental mediante un proxy.
Esperábamos que estos casos de uso activaran un proceso KYC, pero en la mayoría de los proveedores no ocurrió. Una marca de verificación indica que la solicitud fue bloqueada para los usuarios que aún no habían completado el proceso KYC:
Para mayor claridad, las empresas de servicios de recopilación de datos no tienen ninguna obligación legal de bloquear estos sitios web y algunos de estos escenarios pueden formar parte de un uso legal. Por ejemplo, un investigador puede querer aprovechar proxies para realizar un experimento controlado en redes sociales. Sin embargo, dado el potencial de abuso de estos escenarios, esperábamos que los servicios de recopilación de datos los bloquearan para los usuarios que no han completado el proceso KYC.
Cómo comunican las marcas los dominios que bloquean
- Bright Data enumera categorías de dominios restringidos en su política de uso aceptable.
Respeto de las preferencias de los sitios web en relación con la recopilación automatizada de datos
¿Qué es robots.txt?
robots.txt es un nombre de archivo para aplicar el Protocolo de Exclusión de Robots. Este protocolo lo utilizan los sitios web para indicar las partes del sitio que el propietario prefiere que los bots no visiten. La adhesión a robots.txt es voluntaria.
Ventajas e inconvenientes de adherirse a robots.txt
- Respeta las preferencias del sitio web.
- Puede no estar actualizado recientemente y, por tanto, quedar obsoleto.
- Suele incluir términos que indican que el propietario del sitio web prefiere que los bots no accedan a determinadas secciones públicas del sitio.
robots.txt también puede proporcionar un acceso desigual a los bots. Por ejemplo, los propietarios de sitios web pueden indicar que no prefieren que los bots de los motores de respuestas visiten determinadas URL que sí visitan los bots de los motores de búsqueda.
robots.txt no es un documento legal y puede solicitar el bloqueo del acceso de los bots a páginas que son legalmente:
- que pueden ser objeto de scraping (por ejemplo, datos públicos) o
- que no pueden ser objeto de scraping (por ejemplo, datos detrás de un inicio de sesión cuyos términos y condiciones del propietario del sitio prohíben el scraping de dichos datos).
Los proveedores de servicios de recopilación de datos web pueden pedir a los usuarios de proxy residencial que completen un proceso KYC y demuestren que tienen un caso de uso legal y ético antes de que puedan ignorar robots.txt.
Para las pruebas, enviamos solicitudes a páginas de subcarpetas que robots.txt pide bloquear. Los dominios que utilizamos fueron aimultiple.com y 5 dominios web entre los 100 más visitados. Bright Data bloqueó estas solicitudes:
Ejemplo de CNN
El robots.txt de CNN bloquea la carpeta /terms14. Para las pruebas, navegamos hasta esa carpeta con proxies residenciales y recibimos mensajes 200 con los datos de la página de todos los proveedores excepto Bright Data. La respuesta de Bright Data es: «Fallo residencial (bad_endpoint): El sitio solicitado no está disponible para el modo de acceso residencial inmediato (sin KYC) de acuerdo con robots.txt. Para obtener acceso residencial completo a este sitio, rellene el formulario KYC: https://brightdata.com/cp/kyc».
Gestión de abusos
Describimos una metodología para evaluar las prácticas de gestión de abusos de los proveedores y recopilamos datos para cumplir nuestros criterios de evaluación:
* No aplicable: Zyte compra proxies a otros proveedores de proxy y, por tanto, cuando el servicio de Zyte se utiliza para abusos, los propietarios de sitios web contactarían con sus proveedores de proxy en lugar de con Zyte.
Aunque todos los proveedores ofrecen medios para que 3rd partes o sus clientes se pongan en contacto con ellos, disponer de ellos es importante para la resolución de problemas:
- Política pública de abusos
- Una dirección de correo electrónico dedicada para denunciar abusos
- Un método de contacto alternativo (por ejemplo, un formulario web o una interfaz de mensajería) que permita a los denunciantes contactar con la empresa. Esto es útil, ya que los correos electrónicos pueden filtrarse y no llegar a la bandeja de entrada.
- Capacidad de respuesta a los mensajes
3 proveedores del benchmark (Bright Data) facilitaron un correo electrónico para denunciar abusos. Todos estos proveedores también describieron sus políticas en este ámbito.
Esperamos que todos los demás proveedores hagan lo mismo y que esto se convierta en una práctica generalizada del sector a corto plazo.
Por último, evaluamos la capacidad de respuesta de la gestión de abusos enviando informes de abuso desde dominios de terceros (es decir, ajenos a AIMultiple) y midiendo los tiempos de respuesta. Si no encontrábamos una dirección de correo electrónico para abusos, lo enviábamos al formulario de contacto general. Lo probamos mediante 3 tandas de correos electrónicos enviados el:
- Viernes 2 de mayo de 2025 desde:
- Un servicio de venta de entradas con ~30k de tráfico mensual
- Un bufete de abogados con ~1k de tráfico mensual
- El 17 de mayo de 2025 desde el servicio de venta de entradas.
- El 24 de mayo de 2025 desde una agencia de redes sociales con tráfico en línea limitado.
Los primeros correos enviados el 2 de mayo de 2025 se enviaron a empresas que facilitaban correos electrónicos dedicados. Más adelante, ampliamos la lista e incluimos direcciones de correo electrónico más generales indicadas en las secciones de contacto de todos los servicios de recopilación de datos web evaluados. Si una empresa respondía a nuestros correos, dejábamos de enviarle más mensajes.
En nuestros correos, mencionamos que nuestros sitios web habían recibido tráfico sospechoso de bots a través de proxies y pedimos su ayuda para identificar el origen de los proxies. Conseguimos que todos los equipos de cumplimiento, excepto uno, nos respondieran. Casi todas las respuestas se recibieron el mismo día.
Transparencia de uso
Los propietarios de sitios web que ofrecen datos web y servicios de recopilación web históricamente no han tenido intercambio de datos sobre las actividades de recopilación. Para limitar el rastreo, los propietarios de sitios web podían:
- Ponerse en contacto con los servicios de recopilación de datos web para denunciar abusos
- Trabajar con proveedores de gestión de bots como Cloudflare para dificultar el rastreo.
Ahora existen iniciativas para un intercambio de datos más estructurado entre estas partes. Bright Data lanzó la consola para webmasters de Bright Data para que los webmasters supervisen las actividades de rastreo en sus sitios web. Es probable que una mayor transparencia mejore las prácticas de recopilación de datos web.
Nuestra experiencia con la consola para webmasters
Nos registramos verificando la propiedad de nuestro dominio y añadiendo un archivo collectors.txt en el dominio.
Ahora tenemos acceso a la actividad de bots de Bright Data en nuestro sitio web:
Benchmark: Suministro ético
* Se incluyeron reseñas en estas plataformas de 3rd partes: Amazon Appstore, App Store, Google Play Store y Trustpilot. Por comodidad, este valor se calculó para 5 aplicaciones principales de Bright Data, no para las 120 aplicaciones que aparecen en su sitio web.
Transparencia de los socios
El ancho de banda que necesitan las empresas de infraestructura de datos web puede suministrarse de manera ética ofreciendo beneficios (por ejemplo, pagos o funciones como la posibilidad de omitir anuncios) a cambio del consentimiento para compartir la conexión a internet del usuario. Sin embargo, también es posible obtener acceso no autorizado a los sistemas de los usuarios minoristas y vender sus conexiones.
Los proveedores de infraestructura de datos web pueden formular políticas y procesos, realizar auditorías externas y publicar su enfoque y los resultados de las auditorías para crear transparencia sobre cómo obtienen sus conexiones a internet. Esto puede fomentar la confianza en el suministro ético de su servicio.
Creamos un marco para la transparencia del lado de la oferta en los datos web y puntuamos a los proveedores con este marco. Aplicamos este marco independientemente de que un servicio de recopilación de datos web obtuviera IP residenciales por sí mismo o a través de otros proxies. Nuestro objetivo es aportar transparencia a toda la cadena de suministro de IP, ya que las prácticas poco éticas pueden originarse en cualquier punto de la cadena.
Aquí puede consultar nuestros resultados detallados:
Bright Data
Bright Data está clasificado en el Nivel 5 porque publica
- Su enfoque de obtención y cómo los desarrolladores de aplicaciones pueden trabajar con ellos a través de su SDK15 16
- Se compartieron públicamente detalles de 120 proveedores. Pudimos consultar las reseñas de estos proveedores en plataformas de 3rd partes para estimar su popularidad. 17
Revisión de aplicaciones seleccionadas
Bright Data comparte 120 aplicaciones en su sitio web. Aplicaciones como Bright VPN están certificadas por 3rd partes en cuanto a su divulgación y UX.18 También descargamos estas aplicaciones para verlas con más detalle:
- Bright VPN
- EarnApp
- Sling Kong
Formulario de suscripción con obligación de no recopilar datos de identificación personal: Formulario de consentimiento con una explicación clara de
Bright VPN:
Earn App:

Sling Kong:
- Al usuario se le presenta la oferta durante el juego:

- Suscripción:

- Información adicional durante la suscripción:

- Exclusión voluntaria:


Valor proporcionado por las aplicaciones:
- Bright VPN: servicio VPN gratuito
- EarnApp: pagos
- Sling Kong: moneda virtual del juego
Otros
Aunque la mayoría de los proveedores son conscientes de la ética del web scraping y han publicado sobre el tema (por ejemplo, 19, no hemos identificado sus compromisos específicos en este aspecto, salvo en el caso de Zyte.20
Esperamos que esto cambie y que la mayoría de los proveedores pasen al menos al Nivel 1 a corto plazo.
Certificación externa
* Indica que la empresa obtuvo todas las certificaciones externas de esta categoría
Es fundamental que los proveedores cuenten con los sistemas, el personal y los procesos adecuados para proteger los datos de los clientes y asegurar las aplicaciones que suministran sus IP. Consulte nuestra metodología de medición de la certificación externa para ver la lógica de nuestra puntuación.
Cumplimiento de GDPR y CCPA
Todos los proveedores afirman públicamente que cumplen ambas normativas de privacidad de datos. Por tanto, esto no se incluyó en la puntuación.
Cómo medimos la madurez organizativa
A partir de las capacidades que identificamos en este ámbito, comprobamos la existencia de estos certificados en cada proveedor mediante sus declaraciones públicas:
- Certificación de seguridad de datos y certificación de PII: 21222324
- Fuente de IP en lista blanca: 25
- Prácticas éticas evaluadas: 26
Algunos proveedores que no cuentan con certificados ISO 27018 afirmaron que se les debería considerar certificados porque utilizan proveedores de servicios en la nube que sí tienen certificados ISO 27018. La opinión de nuestro asesor de ciberseguridad fue que, aunque esto facilitaría la obtención del certificado, seguirían necesitando certificar sus políticas y controles para obtenerlo.
Cobertura de seguro
3 empresas de recopilación de datos web compartieron sus certificados de seguro. No publicamos los certificados, pero revisamos los documentos para asegurarnos de que
- cubrieran estas 2 categorías de seguro
- El límite de seguro en cada categoría es al menos de varios millones de dólares estadounidenses.
Alianzas sectoriales y datos web éticos
Existen 2 grandes alianzas sectoriales:
- Alianza para la Recopilación Responsable de Datos, que incluye a Bright Data, Common Crawl y otros
- Iniciativa de Recopilación Ética de Datos Web (EWDCI), que incluye a Oxylabs, ProxyEmpire y Zyte, entre otros. Solía incluir a NetNut hasta que el FBI cerró NetNut, por lo que la participación en una alianza sectorial no ha impedido que las empresas infrinjan la ley.
Avisos legales y recomendaciones para próximos pasos
Todos los proveedores de este benchmark, excepto Nimble, son clientes de AIMultiple. Como siempre, durante esta investigación seguimos nuestros compromisos éticos.
Hemos completado una revisión exhaustiva de la recopilación ética de datos web y, aunque estamos satisfechos con el alcance de este benchmark, nos encantaría aumentar la participación. Agradecemos a estas empresas que compartieran su cobertura de seguro: Apify, Bright Data, Zyte.
Estamos esperando la respuesta de Nimble. Actualizaremos el informe en cuanto tengamos más noticias suyas. 2 proveedores han optado por no participar en esta iteración del benchmark. Siempre actualizamos este informe si alguna de estas 7 empresas sugiere cambios basados en hechos, justos para todos los proveedores y que ayuden a las empresas a tomar mejores decisiones.
NetNut se encontraba entre las empresas que evaluamos cuando publicamos por primera vez este informe en 2025. Tenía la puntuación más baja posible (Nivel 0) en nuestro análisis en profundidad del suministro ético, donde examinamos las fuentes de IP de estos proveedores. NetNut fue cerrado en 2026 después de que el FBI identificara sus vínculos con botnets.27 Esperamos que esto sirva de incentivo para que todos los proveedores sean transparentes sobre su obtención.
Según nuestra investigación, este es el primer informe centrado en los datos web éticos. Esperamos que esta transparencia pueda ayudar al sector de los datos web a encontrar soluciones creativas a sus retos. Estas soluciones tendrán que equilibrar los intereses de los recopiladores de datos web, los usuarios de la automatización web, los propietarios de sitios web y los usuarios residenciales que suministran sus IP al sector.
Limitaciones de la metodología
Este benchmark mide indicadores observables de madurez, como los controles de uso por parte del cliente, la transparencia del suministro de IP, las certificaciones externas y el uso compartido de seguros. Sin embargo, la puntuación no determina plenamente si un proveedor cumple la legalidad en todos los casos de uso de los clientes.
Por tanto, una puntuación alta en el benchmark debe considerarse un dato para la diligencia debida de adquisiciones, no una garantía de legalidad ni de uso ético.
Referencias
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Benchmark de datos web éticos y conformes}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/web-scraping-ethics}},
note = {AIMultiple. Recuperado el 4 de Agosto de 2026}
}Resultados y marcas de tiempo de 66 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene 8 archivos CSV.
Registro de cambios
6 actualizaciones- 2025
Se añadieron códigos de proveedor a la introducción de la sección "Ethical & Compliant Web Data Benchmark".
Se ampliaron los datos de "Ejemplo de la vida real" en la sección "Riesgo reputacional".
Se reemplazó la sección "Ethical & Compliant Web Data Benchmark" con una nueva evaluación de los servicios de recopilación de datos web.
Se añadió Organizaciones para el Raspado Ético de la Web a la sección de Lectura Adicional.
Se actualizaron los resultados de los casos Meta vs Bright Data y X Corp. vs Bright Data en la sección "Historial de las principales demandas de web scraping".
- 2024
Actualizados los datos del caso "eBay vs Bidder's Edge" en la sección "Casos Legales".
Enlaces de referencia
El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]
A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.
Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.
Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.




Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.