Servicios
Contáctanos

Las 6 mejores herramientas de código abierto para el descubrimiento de datos confidenciales

Cem Dilmegani
Cem Dilmegani
actualizado el 21 de ago. de 2026

Las siguientes herramientas se seleccionan según la actividad de GitHub y se ordenan por número de estrellas de GitHub en orden descendente. Cubren los principales casos de uso para el descubrimiento de datos confidenciales: catalogación de metadatos con linaje, escaneo sin agentes y detección basada en API de PII, datos PCI y credenciales en reposo.

Una cosa que vale la pena dejar clara antes de la lista: estas seis herramientas no todas hacen lo mismo, y algunos de los nombres de esta lista no son herramientas de descubrimiento de datos confidenciales en sentido estricto.

DataHub, Apache Atlas y Marquez son plataformas de catálogo de metadatos y linaje de datos; le ayudan a comprender qué datos tiene y dónde fluyen, lo cual es un requisito previo para el descubrimiento, pero no es lo mismo que buscar PII.

  • OpenDLP es la única herramienta aquí creada específicamente para encontrar datos confidenciales en reposo.
  • Piiano Vault es un sistema de almacenamiento para datos que ya sabe que son confidenciales.
  • Nightfall es un motor de detección comercial con scripts de escaneo de código abierto a su alrededor.

Cada uno se adapta a una etapa diferente del problema de la seguridad de los datos.

Más información: Herramientas de descubrimiento y clasificación de datos confidenciales, Software DLP.

Funciones administrativas

Herramienta
Panel gráfico
Basado en búsqueda
Linaje de datos
Sistema de base de datos federada
DataHub
Apache – Atlas
Marquez
No se comparte.
OpenDLP
Piiano Vault – ReDiscovery
No se comparte.
Nightfall IA – Sensitive data scanner

Descripciones de las funciones:

  • Panel gráfico – le permite visualizar los resultados de sus datos.
  • Funcionalidad basada en búsqueda – le permite buscar activos de datos.
  • Linaje de datos – permite a los usuarios visualizar cómo se generan, transforman, transmiten y usan los datos en un sistema a lo largo del tiempo.
  • Sistema de base de datos federada – integra múltiples sistemas de bases de datos autónomos en una única base de datos federada.

Esta funcionalidad (especialmente el linaje de datos y las capacidades de búsqueda) permite a las empresas:

  • Descubrir la ubicación de su información personal (PII), sector de tarjetas de pago datos (PCI), etc., almacenados en múltiples bases de datos, aplicaciones y endpoints de usuario.
  • Cumplir con los estándares regulatorios de protección de datos y privacidad de la industria, como el Reglamento General de Protección de Datos (GDPR) y la Ley de Privacidad del Consumidor de California (CCPA).

Funciones de seguridad de datos

Descripciones de las funciones:

  • Enmascaramiento de datos – permite ocultar datos modificando sus letras y números originales, de modo que no tengan valor para intrusos no autorizados y sigan siendo utilizables para empleados autorizados.
  • Prevención de pérdida de datos(DLP) – detecta posibles filtraciones de datos y las previene bloqueando datos confidenciales.

Categorías y GitHub estrellas

Selección y orden de herramientas:

  • Número de reseñas: 10+ estrellas de GitHub.
  • Orden: Las herramientas se ordenan por estrellas de GitHub en orden descendente.

DataHub

DataHub es una plataforma de metadatos de código abierto para el descubrimiento de datos, la observabilidad y la gobernanza, creada originalmente por LinkedIn y actualmente mantenida por Acryl Data tanto como proyecto de código abierto (Apache 2.0) como oferta comercial en la nube. Es la herramienta de esta lista con el desarrollo más activo por amplio margen: 3.000+ organizaciones ejecutan DataHub en producción en todo el mundo, incluidas empresas tecnológicas de hiperescala, instituciones financieras reguladas y proveedores de atención médica.

Qué hace realmente DataHub para el descubrimiento de datos confidenciales

DataHub es un catálogo de metadatos, no un escáner. Le indica qué activos de datos existen en toda su pila, quién los posee, cómo fluyen por los pipelines y cómo se ve su calidad, pero no analiza sistemas de archivos ni bases de datos en busca de patrones de PII como hace OpenDLP. El caso de uso de descubrimiento de datos que resuelve es: “tenemos 200 fuentes de datos y no sabemos qué contienen ni quién las usa”. El caso de uso de descubrimiento de datos confidenciales que no resuelve es: “necesitamos encontrar todos los archivos que contienen números de la Seguridad Social en nuestros endpoints de Windows”.

Funciones clave:

  • Linaje de datos a nivel de columna: Rastrea el flujo de datos desde el origen hasta el consumo en todas las plataformas. El nuevo soporte en 2026 incluye tablas dinámicas de Snowflake, Sigma vinculado de vuelta a los almacenes de origen, Glue e Iceberg, mapeo de Athena al catálogo en lugar de rutas S3 sin procesar y Power BI a través del analizador oficial M-Query de Microsoft.
  • 90+ conectores nativos: Snowflake, BigQuery, Redshift, Hive, Athena, Postgres, MySQL, SQL Server, Looker, Power BI, Tableau, Okta, LDAP, S3, Delta Lake y otros. Los nuevos conectores lanzados en el segundo trimestre de 2026 incluyen Airbyte, Matillion, dltHub, Informatica y ThoughtSpot. En desarrollo: Monte Carlo, SAP Datasphere, AWS QuickSight y conectores de streaming para Firehose y Kinesis.
  • Soporte de servidor MCP: Soporte nativo para agentes de IA a través de MCP, integraciones de LLM y gestión de contexto, lo que significa que los asistentes de IA pueden consultar los metadatos de DataHub directamente sin cambiar de herramientas.
  • Integración ampliada de Google Cloud (abril de 2026): DataHub amplió su conector de Knowledge Catalog de Google Cloud para admitir Gemini Enterprise Agent Platform, Bigtable, Spanner, Pub/Sub y Dataproc Metastore, junto con BigQuery y Google Cloud Storage.

Consideración: La arquitectura de DataHub ejecuta varios servicios interconectados. Las implementaciones en producción normalmente requieren Kubernetes. La complejidad de la configuración es el punto débil más citado en la comunidad, y no se ha vuelto más sencilla con la incorporación de funciones de IA. Si su equipo no tiene experiencia con Kubernetes, reserve tiempo para la curva de aprendizaje antes de comprometerse con un despliegue en producción.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Apache – Atlas

Apache Atlas es una plataforma de gestión y gobernanza de metadatos de código abierto, diseñada principalmente para ecosistemas de Hadoop y big data. Admite clasificación, seguimiento de linaje y búsqueda en activos de datos en entornos creados con Hive, HBase, Kafka, Spark, Sqoop y Storm.

Funciones clave

  • Clasificación dinámica: Atlas permite crear clasificaciones personalizadas como PII, EXPIRES_ON, DATA_QUALITY y SENSITIVE. Se pueden aplicar a nivel de entidad o de atributo, lo que resulta útil para etiquetar columnas confidenciales en tablas de Hive sin crear un catálogo independiente.
  • Tipos de metadatos: La plataforma ofrece tipos de metadatos predefinidos para entornos Hadoop y no Hadoop, que abarcan HBase, Hive, Sqoop, Kafka y Storm.
  • Lenguaje de consulta similar a SQL (DSL): Atlas admite un lenguaje específico de dominio que ofrece funcionalidad de consulta similar a SQL para buscar entidades. Útil para analistas familiarizados con SQL que necesitan consultar el catálogo de metadatos sin aprender una nueva sintaxis.
  • Integración con herramientas externas: Apache Hive, Apache Spark, Kafka y Presto, lo que lo hace adecuado para entornos de big data.

Consideraciones:

  • Configurar Atlas en un entorno multinube es complejo, en particular al conectar AWS, Azure y las API de Databricks. Atlas no tiene conectores nativos para estas plataformas; se requiere configuración adicional para registrar el linaje desde AWS Redshift o Azure Synapse.
  • Los servicios de catalogación nativos de la nube (por ejemplo, AWS Glue) pueden ofrecer un seguimiento de linaje con menos sobrecarga para equipos que ya están comprometidos con un único proveedor de nube.
  • Atlas es más adecuado para organizaciones que ejecutan Hadoop, Spark y Hive a gran escala. Los equipos sin una pila centrada en Hadoop encontrarán que su arquitectura añade una complejidad innecesaria.

Marquez

Marquez es un servicio de metadatos de código abierto para recopilar, agregar y visualizar metadatos del ecosistema de datos. Se creó en WeWork y se publicó como código abierto en 2019. Marquez es un proyecto en etapa de graduación de LF IA & Data Foundation, tras haberse graduado en septiembre de 2023.

Qué hace realmente Marquez

Marquez se centra exclusivamente en el seguimiento de linaje, no en el descubrimiento. Es la implementación de referencia del estándar OpenLineage, la especificación abierta sobre cómo los pipelines informan los metadatos de linaje. Si utiliza Apache Airflow, Apache Spark, Apache Flink, dbt o Dagster, esas herramientas pueden emitir eventos OpenLineage que Marquez recopila y visualiza. El resultado es un gráfico de linaje que muestra cómo fluyen los conjuntos de datos por sus pipelines, qué trabajos los produjeron y cómo son históricamente las ejecuciones.

Esto hace que Marquez sea útil para: comprender qué se rompe cuando cambia un conjunto de datos ascendente, depurar fallos en los pipelines rastreando la procedencia de los datos y saber qué trabajos consumen un conjunto de datos determinado antes de dejarlo obsoleto. No es una herramienta para analizar endpoints en busca de PII.

Nota sobre la actividad de la comunidad

A principios de 2026, los issues abiertos en el GitHub de Marquez que datan de mayo de 2025 siguen sin resolverse. La velocidad de los commits se ha ralentizado en comparación con DataHub y OpenMetadata. Si necesita un catálogo ágil con mantenedores que respondan, Marquez es la opción más lenta. Si necesita un almacén de linaje estable y ligero que implemente el estándar OpenLineage sin la sobrecarga de infraestructura de DataHub, Marquez sigue haciendo bien ese trabajo.

Funciones clave:

  • Implementación de referencia de OpenLineage: Funciona de inmediato con todas las integraciones de OpenLineage. Este es el principal diferenciador de Marquez: ninguna otra herramienta de esta lista es la implementación canónica del estándar de linaje.
  • Visualización del gráfico de linaje: La interfaz web ofrece una vista interactiva de cómo se conectan y transforman los conjuntos de datos a través de los flujos de trabajo. Útil para comprender las dependencias de los pipelines y rastrear errores.
  • API REST y GraphQL: La API de linaje permite automatizar tareas como backfills y análisis de causa raíz al recorrer el árbol de dependencias de forma programática. El endpoint de GraphQL está actualmente en beta.
  • Baja sobrecarga de infraestructura: Marquez se ejecuta sobre PostgreSQL y no requiere Kafka, Elasticsearch ni una base de datos de grafos, a diferencia de DataHub o Atlas. Para los equipos que quieren seguimiento de linaje sin una pila compleja, esa simplicidad es la clave.

Flujo de trabajo de ejemplo: Para inspeccionar los metadatos de linaje, navegue hasta la interfaz de Marquez y busque un trabajo (por ejemplo, etl_delivery_7_days) mediante el cuadro de búsqueda. Desde el conjunto de datos de salida del trabajo, puede ver el nombre del conjunto de datos, el esquema, la descripción y las entradas ascendentes. El gráfico de linaje muestra todo lo que alimenta o depende de ese conjunto de datos.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Piiano Vault – ReDiscovery

Piiano Vault es una bóveda de privacidad para almacenar y proteger datos personales confidenciales dentro de su propio entorno en la nube. No es un escáner de descubrimiento de datos; esta distinción es lo bastante importante como para dejarla clara antes de describir lo que hace.

El caso de uso que resuelve Vault es: “sabemos qué campos son confidenciales (números de tarjetas de crédito, números de la Seguridad Social, nombres, correos electrónicos, números de teléfono) y queremos sacarlos de nuestras bases de datos de aplicaciones para llevarlos a un almacén centralizado con control de acceso”. Vault se convierte en el almacén autorizado de esos campos. La base de datos de la aplicación guarda un token o una referencia; el valor real vive en Vault. Se trata de un patrón de arquitectura de protección de datos, no de una herramienta de descubrimiento.

Vault se despliega mediante Docker o Kubernetes (hay gráficos de Helm disponibles). Existen SDK para Python (Django ORM), TypeScript, Java y Go. El repositorio vault-releases se actualizó por última vez en agosto de 2025.

Nightfall

Nightfall es una plataforma DLP comercial nativa de IA. Sus repositorios de GitHub incluyen scripts de escaneo de código abierto (Apache 2.0) que envuelven la API de detección comercial de Nightfall. Esta distinción es importante para el enfoque de “código abierto”: los scripts de escaneo son de código abierto, pero el motor de detección que realmente identifica PII, credenciales y datos de pago es el servicio propietario de Nightfall. Ejecutar escaneos requiere una clave de API de Nightfall y llama a la API comercial de Nightfall. El plan gratis permite hasta 100 escaneos al mes en repositorios públicos y privados.

Esta es la herramienta más capaz de esta lista para detectar datos confidenciales en entornos modernos. Nightfall cubre repositorios de GitHub, buckets de S3, exportaciones de Salesforce y fuentes similares, pero no es completamente de código abierto. Si su requisito es no depender de un proveedor comercial, Nightfall no lo cumple.

Capacidades del escáner de código abierto (plan gratis):

  • Analiza el historial completo de commits de repositorios públicos y privados.
  • Detecta credenciales, secretos, PII y números de tarjetas de crédito mediante los modelos de detección de aprendizaje automático de Nightfall.
  • Ejecuta hasta 100 escaneos al mes sin costo.
  • Envía alertas a Slack cuando se detectan infracciones.
  • Envía los resultados a una herramienta SIEM, a una herramienta de informes o a un endpoint de webhook.

Función distintiva: Nightfall puede enviar alertas a Slack cuando se detectan infracciones y enviar los resultados a una herramienta SIEM, a una herramienta de informes o a un endpoint de webhook.

Caso de uso de ejemplo: Analice una copia de seguridad de Salesforce para detectar datos confidenciales en reposo. El escáner (1) envía los archivos de copia de seguridad a la API de Nightfall para su análisis, (2) ejecuta un servidor de webhook local para recibir los resultados y (3) exporta los hallazgos a un archivo CSV.

Lecturas adicionales

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani and Sena Sezer (2026) - "Las 6 mejores herramientas de código abierto para el descubrimiento de datos confidenciales". Publicado en línea en AIMultiple.com. Recuperado el 21 de Agosto de 2026, de: https://aimultiple.com/open-source-sensitive-data-discovery [Recurso en línea]

Dilmegani, C., & Sezer, S. (2026, 21 de Agosto). Las 6 mejores herramientas de código abierto para el descubrimiento de datos confidenciales. AIMultiple. https://aimultiple.com/open-source-sensitive-data-discovery

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Sezer, Sena},
  title  = {{Las 6 mejores herramientas de código abierto para el descubrimiento de datos confidenciales}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/open-source-sensitive-data-discovery}},
  note   = {AIMultiple. Recuperado el 21 de Agosto de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 18 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene 3 archivos CSV.

Última actualización: 17 de Agosto de 2026
Descargar

Registro de cambios

2 actualizaciones
  1. 2026

    Ampliadas las características clave de DataHub con más de 90 conectores, nuevas integraciones de 2026 y soporte de servidor MCP.

  2. Se actualizó la introducción a la lista de herramientas.

Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017.

El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]

A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.

Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.

Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo
Investigado por
Sena Sezer
Sena Sezer
Analista de Industria
Sena es analista de industria en AIMultiple. Completó su licenciatura en Bogazici University.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450