Las regulaciones legales han cambiado en el mercado del web scraping. Si bien los litigios se centraron en un principio en el acceso no autorizado, las nuevas demandas relacionadas con el entrenamiento de IA y las soluciones técnicas alternativas están configurando las prácticas aceptables.
Aviso legal: Nuestro trabajo tiene fines informativos y no constituye asesoramiento legal; por favor, obtenga asesoramiento legal profesional para orientación específica.
¿Es legal el web scraping?
El web scraping es legal si se extraen datos disponibles públicamente en la web. Sin embargo, la legalidad del web scraping depende de cómo, qué y por qué se realiza el scraping.
En 2026, las directrices de la Comisión Europea aclararon las normas para la extracción de datos para el entrenamiento de IA en Europa. Ahora se exige a los desarrolladores que respeten las exclusiones legibles por máquina. 1
El web scraping puede ser legal cuando usted:
- Priorice el scraping sin iniciar sesión: Extraiga datos disponibles públicamente de páginas web accesibles sin inicio de sesión, suscripción ni pago.
- Evite la elusión técnica: Respete los términos de servicio del sitio web, el archivo robots.txt y las leyes de derechos de autor.
- Alinee su actividad con las políticas de uso comercial: Asegúrese de que su intención de scraping (por ejemplo, indexación de búsqueda frente a entrenamiento de modelos de IA) se alinee con las políticas de uso comercial del sitio. Casos como Reddit contra Anthropic están definiendo actualmente nuevos límites para el “uso legítimo” cuando los datos se extraen explícitamente para el desarrollo de IA.
- Cumpla con las leyes globales de privacidad: no recopile datos personales o sensibles, como nombres o información de contacto, de una manera que viole las leyes de privacidad, incluido el Reglamento General de Protección de Datos (RGPD) y la Ley de Privacidad del Consumidor de California (CCPA).
Para obtener más información sobre la recopilación ética de datos, consulte nuestro benchmark de datos web ético y conforme.
Últimas actualizaciones legales sobre web scraping
Aunque el web scraping puede ser legal, las empresas no desean ser objeto de scraping. Si estas plataformas pueden demostrar que el hecho de ser extraídas por un bot daña su infraestructura u operaciones, entonces esa actividad puede ser considerada ilegal por el tribunal.
Aquí hemos recopilado las demandas más importantes en las que el tribunal falló a favor del sitio web extraído; estos casos, especialmente de los EE. UU.
Reddit contra Perplexity AI y servicios de scraping
Tribunal: Tribunal de Distrito de los EE. UU. para el Distrito Sur de Nueva York
Cronología: octubre de 2025 – presente (caso activo)
Reddit demandó al motor de búsqueda de IA Perplexity AI y a tres importantes proveedores de scraping/proxy (SerpApi, Oxylabs, AWMProxy) por la recopilación de datos a escala industrial y la elusión de barreras técnicas. 2
Conflicto:
Reddit alega que los demandados participaron en un plan “estilo robo de banco” para robar contenido protegido por derechos de autor. En lugar de celebrar acuerdos de licencia (como OpenAI y Google), Perplexity utilizó herramientas de scraping especializadas para eludir las defensas de Reddit.
Argumentos legales:
- Scraping indirecto a través de Google: Los demandados eludieron los bloqueos propios de Reddit extrayendo el contenido de Reddit directamente de los resultados de búsqueda de Google (SERPs).
- Infracciones de la DMCA: A diferencia de casos anteriores de “datos públicos” (como hiQ), Reddit invoca la Sección 1201 de la Ley de Derechos de Autor de la Era Digital (DMCA). Argumentan que los demandados no “accedieron” a los datos, sino que eludieron deliberadamente las “medidas tecnológicas” (límites de frecuencia, captchas y SearchGuard).
- Negativa a obtener licencia: Reddit destaca que, si bien otros gigantes de la IA pagan por el acceso a los datos, Perplexity aumentó su volumen de scraping 40 veces después de recibir una carta de cese y desistimiento, eligiendo la “elusión en lugar de la cooperación”.
Estado actual:
A finales de 2025, el caso sigue en curso y no se ha emitido ninguna sentencia definitiva.
Reddit contra Anthropic
Tribunal: Tribunal Superior de California en San Francisco
Cronología: finales de 2025 – presente (litigio activo)
Reddit demandó a la startup de IA Anthropic, acusándola de utilizar ilegalmente los datos de sus 100 millones de usuarios diarios para entrenar sus sistemas de IA.
A diferencia de Google y OpenAI, que tienen acuerdos de licencia de pago con Reddit, Anthropic supuestamente se negó a firmar un acuerdo. El equipo legal de Reddit argumenta que, sin un acuerdo formal, no existen barreras de protección que garanticen la privacidad de los usuarios.
Estado actual:
A finales de 2025, no ha habido una sentencia judicial definitiva. El caso se encuentra actualmente en la fase de exhibición de pruebas previa al juicio. Anthropic ha solicitado que se desestimen partes del caso, argumentando que los datos fácticos no son protegibles por derechos de autor.
Caso Linkedin contra hiQ Labs
Tribunal: Tribunal de Distrito de los EE. UU. / Tribunal de Apelaciones del Noveno Circuito
Cronología: 2017–2022
LinkedIn demandó a hiQ Labs, una empresa de análisis de datos, por extraer perfiles disponibles públicamente para realizar un análisis de habilidades profesionales.3 Varios tribunales, incluido el Tribunal Supremo, revisaron el caso:
- El tribunal inicialmente falló a favor de hiQ, dictaminando que el scraping de datos públicos no viola la Ley de Fraude y Abuso Informático (CFAA).4
- En 2022, el Noveno Circuito reafirmó esta postura, declarando que acceder a datos disponibles públicamente sin autorización no constituye “acceso no autorizado” según la CFAA.
El tribunal dictaminó que las acciones de LinkedIn para bloquear a hiQ eran legales. A pesar de las consideraciones de la CFAA, infringir los términos de servicio de un sitio web puede tener consecuencias legales. Las violaciones del acuerdo de usuario de LinkedIn por parte de hiQ desempeñaron un papel importante en la sentencia final.
Meta contra Bright Data
Tribunal: Tribunal de Distrito de los EE. UU. para el Distrito Norte de California
Cronología: 2023–2024
Tipo de caso: Demanda civil por incumplimiento de contrato y extracción de datos no autorizada
En enero de 2023, Meta inició una demanda contra Bright Data, alegando que había extraído ilegalmente datos de las plataformas Facebook e Instagram de Meta. Curiosamente, Bright Data impugnó las afirmaciones de Meta sobre sus derechos de scraping de datos, lo que llevó a ambas partes a los tribunales.
El tribunal falló a favor de Bright Data, al considerar que no había pruebas suficientes para demostrar que Bright Data había extraído datos no públicos o accedido a datos con sesión iniciada en cuentas de usuario. En febrero de 2024, Meta decidió retirar las reclamaciones restantes contra Bright Data.5
¿Prohíbe Meta (Facebook/Instagram) toda la recopilación automatizada de datos?
Si ha leído las condiciones de uso de Instagram, probablemente haya visto la cláusula que establece que “está prohibido el scraping por medios automatizados”.
Sin embargo, la realidad jurídica es más compleja. En el caso histórico Meta contra Bright Data (2024), el tribunal dictaminó que si se extraen datos públicos sin haber iniciado sesión, las condiciones de Meta no se aplican necesariamente porque nunca se firmó un contrato al iniciar sesión.
Muchos sitios web incluyen una advertencia de “condiciones de Facebook, recopilación automatizada de datos, scraping prohibido”. Pero, como se ve en las recientes novedades legales sobre web scraping, los tribunales distinguen cada vez más entre los datos protegidos por un muro de inicio de sesión y los datos disponibles en la web abierta.
X Corp., anteriormente Twitter contra Bright Data
Tribunal: Tribunal de Distrito de los EE. UU. para el Distrito Norte de California
Cronología: 2023–en curso
Tipo de caso: Acceso no autorizado a datos según las leyes de fraude informático, violaciones de propiedad intelectual
En julio de 2023, X Corp. presentó una demanda contra Bright Data, alegando que Bright Data violó sus términos de servicio al extraer y vender grandes cantidades de datos de la plataforma X. 6La acción legal en California se refería al acceso de Bright Data a los datos públicos de Twitter.
El caso fue desestimado y el juez dictaminó que X no pudo alegar de manera plausible que Bright Data hubiera violado su acuerdo de usuario. El tribunal sostuvo que los términos de servicio no podían impedir el scraping de datos porque X Corp no era la propietaria del contenido y, por lo tanto, no podía hacer valer sus derechos de autor.
Ser propietaria del contenido de los usuarios invalidaría la protección de puerto seguro de X Corp, que permite a las empresas de redes sociales desvincularse de las infracciones de derechos de autor y otros delitos cometidos por sus usuarios. Por lo tanto, los tribunales volvieron a fallar a favor de una parte que recopiló datos públicos de una red social.
Caso eBay contra Bidder’s Edge
Tribunal: Tribunal de Distrito de los Estados Unidos para el Distrito Norte de California
Cronología: 1999–2000
Tipo de caso: Demanda civil por intromisión en bienes muebles, en la que eBay acusó a Bidder’s Edge de extraer ilegalmente su sitio mediante bots de recopilación de datos automatizada.
Bidder’s Edge (BE), un sitio web de comparación de precios en línea, utilizó herramientas de web scraping para agregar anuncios de subastas de varias plataformas, incluida eBay, sin permiso. eBay afirmó que los bots automatizados de BE provocaron un uso no autorizado de sus sistemas.
La orden judicial impedía que Bidger’s Edge volviera a extraer contenido de eBay. El principal argumento que ganó eBay fue que Bidger’s Edge estaba sobrecargando su sistema y que otros que siguieran el ejemplo de Bidger’s Edge podrían causar más daños al sistema de eBay.
Caso Facebook contra Power Ventures
Tribunal: Tribunal de Distrito de los EE. UU. para el Distrito Norte de California
Posteriormente, se apeló ante el Tribunal de Apelaciones de los EE. UU. para el Noveno Circuito
Cronología: 2008–2017
Tipo de caso: Demanda civil en virtud de la CFAA y la ley contra la piratería informática de California, en la que Facebook alegó acceso no autorizado a su plataforma.
En 2009, Facebook demandó a Power Ventures por extraer contenido de los sitios web subidos por sus usuarios. Este conjunto de ejemplos corresponde a un caso en el que el web scraping se evaluó desde el punto de vista de la propiedad intelectual. El tribunal falló a favor de Facebook y ordenó una sanción económica para Power Ventures.7
Últimas regulaciones sobre web scraping por país
Estados Unidos
Situación legal: El web scraping de datos disponibles públicamente se considera legal.
No existen leyes federales contra el web scraping en los Estados Unidos siempre que los datos extraídos estén disponibles públicamente y la actividad de scraping no perjudique al sitio web que se está extrayendo. Hay una ley específica de 2016 contra la compra de un número excesivo de entradas de una sola vez mediante bots para evitar los mercados negros.8
Unión Europea y el Reino Unido
Situación legal: En la UE y el Reino Unido, el web scraping de contenido disponible públicamente, no personal y no protegido por derechos de autor es legal, pero el scraping de datos personales sin una base legal está prohibido en virtud del RGPD.
La UE aprobó recientemente la Ley de Servicios Digitales, cuyo objetivo es integrar a todos los países de la UE en el Mercado Único Digital, compartiendo las mismas regulaciones. Según los artículos 3 y 4 de este reglamento, “la reproducción de contenido disponible públicamente” no es ilegal.9 10
Este reglamento aborda el tema desde la perspectiva de la propiedad intelectual y, no hace falta decirlo, consideraría ilegal cualquier web scraping que implique datos personales en virtud del RGPD. Aparte de eso, la situación es similar a la de los EE. UU. en los mercados de la UE y el Reino Unido.
Lo que se debe y no se debe hacer en el web scraping legal y ético
Desde el punto de vista legal, una pregunta que las empresas deberían hacerse es si sus actos de scraping perjudican al sitio web extraído. Si la actividad de scraping:
- Es demasiado intensa, lo que puede interrumpir los servicios del sitio web extraído
- Los datos extraídos se utilizan para duplicar la actividad o el servicio de ese sitio web, aunque no exista ninguna regulación.
El sitio web tendría motivos para presentar una demanda contra el scraper.
Desde el punto de vista ético, dado que el web scraping tiene muchos casos de uso y proveedores profesionales en el mercado, no hay ninguna vergüenza en utilizarlo con fines empresariales. Existen buenas prácticas técnicas de web scraping que aliviarán la carga de tráfico en el sitio web extraído, como:
- Usar las APIs del sitio web en lugar de hacer web scraping, cuando estén disponibles.
- Integrar los scrapers web con proxies.
- Usar navegadores headless.
Siempre que encuentre un scraper web de confianza con quien trabajar o se asegure de que sus recursos técnicos tengan en cuenta estos aspectos, podrá defender su web scraping como ético para sus fines empresariales.
Se debe:
- Extraiga los datos que necesita definiendo el caso de negocio exacto y personalizando su tecnología de rastreo web en consecuencia. Esto minimizará el riesgo de agotar el sitio web extraído con tráfico no deseado.
- Lea siempre los términos de uso del sitio web extraído. Además de los términos de uso comerciales, los sitios web también tienen un archivo robots.txt que especifica los permisos para el contenido del sitio web. Su solución de rastreo web o sus expertos técnicos deberían ayudarle a cumplir con estos permisos.
- Sea transparente acerca de su web scraping y esté preparado para explicar su proceso de scraping para garantizar a los demás que su enfoque es legal y ético.
Lo que no se debe hacer:
- No agote el sitio web extraído con demasiada frecuencia y con extracciones demasiado amplias. Esto también aumentará la probabilidad de que el sitio web extraído bloquee su rastreador.
- No recopile información de identificación personal, o si robots.txt le permite recopilarla, asegúrese de enmascarar los datos para minimizar la exposición durante el procesamiento.
- No exponga los datos extraídos al público. Asegúrese de que se almacenen de forma segura, como los datos de su propia empresa. Nunca se sabe con qué fines podrían utilizarse si se filtran.
Organizaciones para el web scraping ético
Las principales empresas de infraestructura de datos web han formado asociaciones para alinear a su sector y a las partes interesadas en el uso ético del web scraping. Estas asociaciones son:
- Alianza para la Recopilación Responsable de Datos, que incluye a Bright Data y Common Crawl, entre otras partes interesadas.
- Iniciativa de Recopilación Ética de Datos Web (EWDCI), que incluye a Oxylabs, ProxyEmpire, Zyte, entre otros.
¿Es legal el scraping de datos para el entrenamiento de IA?
La situación legal del scraping de datos depende del tipo de datos, su ubicación y los métodos utilizados para acceder a ellos. Muchas leyes pertinentes están siendo interpretadas y establecidas por los tribunales.
Por ejemplo, en los Estados Unidos, los tribunales han sostenido que el scraping de datos de acceso público sin requerir un inicio de sesión ni eludir medidas de seguridad no viola la Ley de Fraude y Abuso Informático (CFAA). Casos como hiQ contra LinkedIn, Meta contra Bright Data y Van Buren contra Estados Unidos confirman que el scraping de datos públicos no infringe la CFAA.
Sin embargo, violar los términos de servicio de un sitio web o extraer datos protegidos por muros de inicio de sesión puede generar responsabilidad. El método de acceso es fundamental, ya que iniciar sesión o eludir barreras técnicas cambia significativamente el análisis jurídico.
Preguntas frecuentes
Si las condiciones de servicio (ToS) de un sitio web prohíben explícitamente el scraping, el acceso o la recopilación de datos de ese sitio por medios automatizados, hacerlo puede constituir una violación de dichas condiciones.
Por ejemplo, en los Estados Unidos, el acceso no autorizado a un sistema informático puede constituir un delito federal en virtud de la Ley de Fraude y Abuso Informático (CFAA). Puede ponerse en contacto con el propietario del sitio para solicitar permiso o utilizar las APIs oficiales para acceder a los datos.
No por sí solo. Los tribunales tratan las violaciones de las condiciones de servicio como una cuestión de contrato civil, no como un delito penal. Sin embargo, una violación puede respaldar reclamaciones por incumplimiento de contrato y reforzar reclamaciones en virtud de otras leyes, especialmente después de un aviso explícito, como una carta de cese y desistimiento.
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{karatas2026,
author = {Karatas, Gulbahar},
title = {{¿Es legal el web scraping? Leyes y mejores prácticas}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/is-web-scraping-legal}},
note = {AIMultiple. Recuperado el 2 de junio de 2026}
}Registro de cambios
2 actualizacionesAñadida la sección "¿Es legal el scraping de datos para entrenar IA?" y la guía de la UE sobre scraping para IA en las FAQ.
Comentarios 1
Comparte tus ideas
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.
Thank you for the great and well-written articles. Can you write an article explaining the limits and/ or usefulness of using a website’s APIs rather than web scraping, when available. Instagram & TikTok website APIs for example are limited to what type of data can be extracted. My understanding is that not everything can be scrapped using their websites API. Looking forward to your response. Thank you.