As 6 Melhores Ferramentas Open Source de Descoberta de Dados Sensíveis
As seguintes ferramentas são selecionadas com base na atividade no GitHub e ordenadas pela contagem de estrelas do GitHub em ordem decrescente. Elas cobrem os principais casos de uso para descoberta de dados sensíveis: catalogação de metadados com linhagem, varredura sem agentes e detecção baseada em API de PII, dados PCI e credenciais em repouso.
Algo que vale a pena esclarecer antes da lista: estas seis ferramentas não fazem todas a mesma coisa, e alguns dos nomes nesta lista não são ferramentas de descoberta de dados sensíveis no sentido estrito.
DataHub, Apache Atlas e Marquez são plataformas de catálogo de metadados e linhagem de dados; elas ajudam você a entender quais dados você tem e por onde eles fluem, o que é um pré-requisito para a descoberta, mas não é o mesmo que varrer em busca de PII.
- OpenDLP é a única ferramenta aqui criada especificamente para encontrar dados sensíveis em repouso.
- Piiano Vault é um sistema de armazenamento para dados que você já sabe que são sensíveis.
- Nightfall é um motor de detecção comercial com scripts de varredura open-source em torno dele.
Cada uma se encaixa em um estágio diferente do problema de segurança de dados.
Leia mais: Ferramentas de descoberta e classificação de dados sensíveis, Software de DLP.
Funcionalidades administrativas
Ferramenta | Painel gráfico | Baseado em busca | Linhagem de dados | Sistema de banco de dados federado |
|---|---|---|---|---|
DataHub | ✅ | ✅ | ✅ | ✅ |
Apache – Atlas | ✅ | ✅ | ✅ | ❌ |
Marquez | ✅ | ✅ | ✅ | Não compartilhado. |
OpenDLP | ❌ | ❌ | ❌ | ❌ |
Piiano Vault – ReDiscovery | ❌ | Não compartilhado. | ❌ | ❌ |
Nightfall IA – Sensitive data scanner | ✅ | ✅ | ❌ | ❌ |
Descrições das funcionalidades:
- Painel gráfico – permite visualizar suas descobertas de dados.
- Funcionalidade baseada em busca – permite pesquisar ativos de dados.
- Linhagem de dados – permite aos usuários visualizar como os dados são gerados, transformados, transmitidos e usados em um sistema ao longo do tempo.
- Sistema de banco de dados federado – mapeia múltiplos sistemas de banco de dados autônomos em um único banco de dados federado.
Essa funcionalidade (especialmente a linhagem de dados e os recursos de busca) permite que as empresas:
- Descubram a localização de suas informações pessoais (PII), dados da indústria de cartões de pagamento (PCI), etc., armazenados em múltiplos bancos de dados, aplicativos e endpoints de usuários.
- Cumpram os padrões regulatórios do setor de proteção e privacidade de dados, como o Regulamento Geral de Proteção de Dados (GDPR) e a Lei de Privacidade do Consumidor da Califórnia (CCPA).
Funcionalidades de segurança de dados
Descrições das funcionalidades:
- Mascaramento de dados – permite ocultar dados modificando suas letras e números originais, para que não tenham valor para intrusos não autorizados, permanecendo utilizáveis para funcionários autorizados.
- Prevenção de perda de dados (DLP) – detecta possíveis violações de dados e as previne bloqueando dados sensíveis.
Categorias e estrelas do GitHub
Seleção e ordenação das ferramentas:
- Número de avaliações: 10+ estrelas no GitHub.
- Atualização: Pelo menos uma atualização foi lançada na última semana até novembro de 2024.
- Ordenação: As ferramentas são ordenadas por estrelas no GitHub em ordem decrescente.
DataHub
DataHub é uma plataforma de metadados open-source para descoberta, observabilidade e governança de dados, originalmente construída pelo LinkedIn e agora mantida pela Acryl Data como um projeto open-source (Apache 2.0) e uma oferta comercial em nuvem. É a ferramenta mais ativamente desenvolvida nesta lista com larga margem: 3.000+ organizações executam o DataHub em produção em todo o mundo, incluindo empresas de tecnologia em hiperescala, instituições financeiras regulamentadas e provedores de saúde.
O que o DataHub realmente faz pela descoberta de dados sensíveis
DataHub é um catálogo de metadados, não um scanner. Ele informa quais ativos de dados existem em sua stack, quem os possui, como fluem pelos pipelines e qual é a sua qualidade, mas não varre sistemas de arquivos ou bancos de dados em busca de padrões de PII como o OpenDLP faz. O caso de uso de descoberta de dados que ele resolve é: "temos 200 fontes de dados e não sabemos o que há nelas ou quem as está usando." O caso de uso de descoberta de dados sensíveis que ele não resolve é: "precisamos encontrar todos os arquivos contendo números de Seguro Social em nossos endpoints Windows."
Principais funcionalidades:
- Linhagem de dados em nível de coluna: Rastreia o fluxo de dados da origem ao consumo em todas as plataformas. O novo suporte em 2026 inclui tabelas dinâmicas do Snowflake, Sigma costurado de volta aos warehouses de origem, Glue e Iceberg, mapeamento do Athena para o catálogo em vez de caminhos brutos do S3, e Power BI via o parser oficial de M-Query da Microsoft.
- 90+ conectores nativos: Snowflake, BigQuery, Redshift, Hive, Athena, Postgres, MySQL, SQL Server, Looker, Power BI, Tableau, Okta, LDAP, S3, Delta Lake e outros. Novos conectores lançados no Q2 2026 incluem Airbyte, Matillion, dltHub, Informatica e ThoughtSpot. Em desenvolvimento: Monte Carlo, SAP Datasphere, AWS QuickSight e conectores de streaming para Firehose e Kinesis.
- Suporte a servidor MCP: Suporte nativo para agentes de IA via MCP, integrações com LLMs e gerenciamento de contexto, permitindo que assistentes de IA consultem metadados do DataHub diretamente sem trocar de ferramenta.
- Integração aprofundada com o Google Cloud (abril de 2026): O DataHub expandiu seu conector do Google Cloud Knowledge Catalog para oferecer suporte à Gemini Enterprise Agent Platform, Bigtable, Spanner, Pub/Sub e Dataproc Metastore, juntamente com BigQuery e Google Cloud Storage.
Consideração: A arquitetura do DataHub executa vários serviços interconectados. Implantações em produção geralmente exigem Kubernetes. A complexidade de configuração é o ponto problemático mais frequentemente citado na comunidade, e não ficou mais simples com a adição de recursos de IA. Se sua equipe não tem experiência com Kubernetes, reserve tempo para a curva de aprendizado antes de se comprometer com uma implementação em produção.
Apache – Atlas
Apache Atlas é uma plataforma open-source de gerenciamento e governança de metadados, projetada principalmente para ecossistemas Hadoop e big data. Oferece suporte a classificação, rastreamento de linhagem e busca em ativos de dados em ambientes construídos sobre Hive, HBase, Kafka, Spark, Sqoop e Storm.
Principais funcionalidades
- Classificação dinâmica: O Atlas permite criar classificações personalizadas como PII, EXPIRES_ON, DATA_QUALITY e SENSITIVE. Estas podem ser aplicadas em nível de entidade ou atributo, o que é útil para marcar colunas sensíveis em tabelas Hive sem construir um catálogo separado.
- Tipos de metadados: A plataforma fornece tipos de metadados predefinidos para ambientes Hadoop e não-Hadoop, cobrindo HBase, Hive, Sqoop, Kafka e Storm.
- Linguagem de consulta similar a SQL (DSL): O Atlas oferece suporte a uma linguagem específica de domínio que fornece funcionalidade de consulta similar a SQL para buscar entidades. Útil para analistas familiarizados com SQL que precisam consultar o catálogo de metadados sem aprender uma nova sintaxe.
- Integração com ferramentas externas: Apache Hive, Apache Spark, Kafka e Presto, tornando-o adequado para ambientes de big data.
Considerações:
- Configurar o Atlas em um ambiente multi-cloud é complexo, particularmente ao fazer a ponte entre as APIs da AWS, Azure e Databricks. O Atlas não possui conectores nativos para essas plataformas — é necessária configuração adicional para registrar a linhagem do AWS Redshift ou Azure Synapse.
- Serviços de catalogação nativos da nuvem (por exemplo, AWS Glue) podem oferecer rastreamento de linhagem com menor sobrecarga para equipes já comprometidas com um único provedor de nuvem.
- O Atlas é mais adequado para organizações que executam Hadoop, Spark e Hive em escala. Equipes sem uma stack centrada em Hadoop acharão que sua arquitetura adiciona complexidade desnecessária.
Marquez
Marquez é um serviço de metadados open-source para coletar, agregar e visualizar metadados do ecossistema de dados. Foi criado no WeWork e teve seu código aberto em 2019. O Marquez é um projeto em estágio de graduação da LF IA & Data Foundation, tendo se graduado em setembro de 2023.
O que o Marquez realmente faz
O Marquez foca exclusivamente no rastreamento de linhagem, não na descoberta. É a implementação de referência do padrão OpenLineage, a especificação aberta para como os pipelines relatam metadados de linhagem. Se você usa Apache Airflow, Apache Spark, Apache Flink, dbt ou Dagster, essas ferramentas podem emitir eventos OpenLineage que o Marquez coleta e visualiza. O resultado é um gráfico de linhagem mostrando como os datasets fluem pelos seus pipelines, quais jobs os produziram e como são as execuções historicamente.
Isso torna o Marquez útil para: entender o que quebra quando um dataset upstream muda, depurar falhas de pipeline rastreando a proveniência dos dados e saber quais jobs consomem um determinado dataset antes de descontinuá-lo. Não é uma ferramenta para varrer endpoints em busca de PII.
Nota sobre a atividade da comunidade
No início de 2026, issues abertas no GitHub do Marquez datando de maio de 2025 permanecem sem resposta. A velocidade de commits diminuiu em comparação com DataHub e OpenMetadata. Se você precisa de um catálogo em rápida evolução com mantenedores responsivos, o Marquez é a opção mais lenta. Se você precisa de um armazenamento de linhagem estável e leve que implementa o padrão OpenLineage sem a sobrecarga de infraestrutura do DataHub, o Marquez ainda faz esse trabalho bem.
Principais funcionalidades:
- Implementação de referência do OpenLineage: Funciona imediatamente com todas as integrações OpenLineage. Este é o diferenciador mais forte do Marquez: nenhuma outra ferramenta nesta lista é a implementação canônica do padrão de linhagem.
- Visualização de gráfico de linhagem: A interface web fornece uma visão interativa de como os datasets estão conectados e transformados através dos workflows. Útil para entender dependências de pipeline e rastrear erros.
- API REST e GraphQL: A API de linhagem permite automatizar tarefas como backfills e análise de causa raiz percorrendo a árvore de dependência programaticamente. O endpoint GraphQL está atualmente em beta.
- Baixa sobrecarga de infraestrutura: O Marquez funciona sobre PostgreSQL e não requer Kafka, Elasticsearch ou um banco de dados de grafos, diferentemente do DataHub ou Atlas. Para equipes que desejam rastreamento de linhagem sem uma stack complexa, essa simplicidade é o ponto central.
Exemplo de fluxo de trabalho: Para inspecionar metadados de linhagem, navegue até a interface do Marquez e procure por um job (por exemplo, etl_delivery_7_days) usando a caixa de busca. A partir do dataset de saída do job, você pode visualizar o nome do dataset, esquema, descrição e entradas upstream. O gráfico de linhagem mostra tudo o que alimenta ou depende daquele dataset.
Piiano Vault – ReDiscovery
Piiano Vault é um cofre de privacidade para armazenar e proteger dados pessoais sensíveis dentro do seu próprio ambiente de nuvem. Não é um scanner de descoberta de dados; essa distinção é importante o suficiente para ser declarada claramente antes de descrever o que ele faz.
O caso de uso que o Vault resolve é: "sabemos quais campos são sensíveis (números de cartão de crédito, SSNs, nomes, e-mails, números de telefone) e queremos movê-los dos nossos bancos de dados de aplicação para um armazenamento centralizado com controle de acesso." O Vault se torna o armazenamento autoritativo para esses campos. O banco de dados da aplicação mantém um token ou referência; o valor real reside no Vault. Este é um padrão de arquitetura de proteção de dados, não uma ferramenta de descoberta.
O Vault é implantado via Docker ou Kubernetes (Helm charts disponíveis). Existem SDKs para Python (Django ORM), TypeScript, Java e Go. O repositório vault-releases foi atualizado pela última vez em agosto de 2025.
Nightfall
Nightfall é uma plataforma comercial de DLP nativa de IA. Seus repositórios no GitHub incluem scripts de varredura open-source (Apache 2.0) que envolvem a API de detecção comercial do Nightfall. Essa distinção é importante para o enquadramento "open-source": os scripts de varredura são open source, mas o motor de detecção que realmente identifica PII, credenciais e dados de pagamento é o serviço proprietário do Nightfall. A execução de varreduras requer uma chave de API do Nightfall e chama a API comercial do Nightfall. O plano gratuito permite até 100 varreduras por mês em repositórios públicos e privados.
Esta é a ferramenta mais capaz desta lista para detectar dados sensíveis em ambientes modernos. O Nightfall cobre repositórios do GitHub, buckets S3, exportações do Salesforce e fontes similares, mas não é totalmente open source. Se o seu requisito é zero dependência de um fornecedor comercial, o Nightfall não o atende.
Capacidades do scanner open-source (plano gratuito):
- Varre o histórico completo de commits de repositórios públicos e privados.
- Detecta credenciais, segredos, PII e números de cartão de crédito usando os modelos de detecção de ML do Nightfall.
- Executa até 100 varreduras por mês sem custo.
- Envia alertas para o Slack quando violações são detectadas.
- Envia resultados para um SIEM, ferramenta de relatórios ou endpoint de webhook.
Funcionalidade distinta: O Nightfall pode enviar alertas para o Slack quando violações são detectadas e enviar resultados para um SIEM, ferramenta de relatórios ou endpoint de webhook.
Exemplo de caso de uso: Varrer um backup do Salesforce para detectar dados sensíveis em repouso. O scanner (1) envia arquivos de backup para a API do Nightfall para varredura, (2) executa um servidor webhook local para receber os resultados e (3) exporta as descobertas para um arquivo CSV.
Leitura adicional
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sezer, Sena},
title = {{As 6 Melhores Ferramentas Open Source de Descoberta de Dados Sensíveis}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/open-source-sensitive-data-discovery}},
note = {AIMultiple. Acessado em 24 Junho 2026}
}O trabalho de Cem foi citado por publicações globais de destaque, incluindo Business Insider, Forbes, Washington Post, empresas globais como Deloitte, HPE e ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia.
Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas em suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.
Ele liderou a estratégia de tecnologia e aquisições de uma empresa de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de tecnologia profunda Hypatos, que alcançou uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia de destaque como TechCrunch e Business Insider.
Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou na Universidade Bogazici como engenheiro de computação e possui um MBA pela Columbia Business School.


Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.