As 6 Melhores Ferramentas de Código Aberto para Descoberta de Dados Sensíveis
As ferramentas a seguir são selecionadas com base na atividade no GitHub e classificadas pela contagem de estrelas no GitHub em ordem decrescente. Elas cobrem os principais casos de uso para descoberta de dados sensíveis: catalogação de metadados com linhagem, varredura sem agentes e detecção baseada em API de PII, dados PCI e credenciais em repouso.
Uma coisa que vale deixar clara antes da lista: essas seis ferramentas não fazem todas a mesma coisa, e alguns dos nomes desta lista não são ferramentas de descoberta de dados sensíveis em sentido estrito.
DataHub, Apache Atlas e Marquez são plataformas de catálogo de metadados e linhagem de dados; elas ajudam você a entender quais dados você tem e para onde eles fluem, o que é um pré-requisito para a descoberta, mas não é o mesmo que varrer em busca de PII.
- OpenDLP é a única ferramenta aqui criada especificamente para encontrar dados sensíveis em repouso.
- Piiano Vault é um sistema de armazenamento para dados que você já sabe que são sensíveis.
- Nightfall é um mecanismo de detecção comercial com scripts de scanner de código aberto em torno dele.
Cada uma se encaixa em um estágio diferente do problema de segurança de dados.
Leia mais: Ferramentas de descoberta e classificação de dados sensíveis, software DLP.
Recursos administrativos
Ferramenta | Painel gráfico | Baseado em pesquisa | Linhagem de dados | Sistema de banco de dados federado |
|---|---|---|---|---|
DataHub | ✅ | ✅ | ✅ | ✅ |
Apache – Atlas | ✅ | ✅ | ✅ | ❌ |
Marquez | ✅ | ✅ | ✅ | Não compartilhado. |
OpenDLP | ❌ | ❌ | ❌ | ❌ |
Piiano Vault – ReDiscovery | ❌ | Não compartilhado. | ❌ | ❌ |
Nightfall IA – Sensitive data scanner | ✅ | ✅ | ❌ | ❌ |
Descrições dos recursos:
- Painel gráfico – permite visualizar suas descobertas de dados.
- Baseada em pesquisa funcionalidade – permite pesquisar ativos de dados.
- Linhagem de dados – permite aos usuários visualizar como os dados são gerados, transformados, transmitidos e usados em um sistema ao longo do tempo.
- Sistema de banco de dados federado – mapeia vários sistemas de banco de dados autônomos em um único banco de dados federado.
Essa funcionalidade (especialmente linhagem de dados e recursos de pesquisa) permite que as empresas:
- Descobrir a localização de suas informações pessoais (PII), setor de cartões de pagamento dados (PCI), etc., armazenados em vários bancos de dados, aplicativos e endpoints de usuários.
- Cumprir os padrões regulatórios do setor de proteção de dados e privacidade, como o Regulamento Geral sobre a Proteção de Dados (GDPR) e a Lei de Privacidade do Consumidor da Califórnia (CCPA).
Recursos de segurança de dados
Descrições dos recursos:
- Mascaramento de dados – permite ocultar dados modificando suas letras e números originais, para que não tenham valor para invasores não autorizados, mantendo-se utilizáveis para funcionários autorizados.
- Prevenção contra perda de dados(DLP) – detecta possíveis violações de dados e as previne bloqueando dados sensíveis.
Categorias e estrelas no GitHub
Seleção e classificação de ferramentas:
- Número de avaliações: 10+ estrelas no GitHub.
- Classificação: As ferramentas são classificadas pelas estrelas no GitHub em ordem decrescente.
DataHub
DataHub é uma plataforma de metadados de código aberto para descoberta, observabilidade e governança de dados, originalmente criada pelo LinkedIn e agora mantida pela Acryl Data tanto como um projeto de código aberto (Apache 2.0) quanto como uma oferta comercial em nuvem. É a ferramenta desta lista com o desenvolvimento mais ativo, por larga margem: 3.000+ organizações executam o DataHub em produção em todo o mundo, incluindo empresas de tecnologia em hiperescala, instituições financeiras regulamentadas e prestadores de serviços de saúde.
O que o DataHub realmente faz pela descoberta de dados sensíveis
DataHub é um catálogo de metadados, não um scanner. Ele informa quais ativos de dados existem em toda a sua pilha, quem são os proprietários, como fluem pelos pipelines e qual é a qualidade deles, mas não varre sistemas de arquivos ou bancos de dados em busca de padrões de PII como o OpenDLP faz. O caso de uso de descoberta de dados que ele resolve é: “temos 200 fontes de dados e não sabemos o que há nelas nem quem as utiliza.” O caso de uso de descoberta de dados sensíveis que ele não resolve é: “precisamos encontrar todos os arquivos que contenham números de Seguro Social em nossos endpoints Windows.”
Principais recursos:
- Linhagem de dados em nível de coluna: Rastreia o fluxo de dados da origem ao consumo entre plataformas. O novo suporte em 2026 inclui tabelas dinâmicas do Snowflake, Sigma costurado de volta aos data warehouses de origem, Glue e Iceberg, mapeamento do Athena para o catálogo em vez de caminhos S3 brutos e Power BI por meio do parser oficial M-Query da Microsoft.
- 90+ conectores nativos: Snowflake, BigQuery, Redshift, Hive, Athena, Postgres, MySQL, SQL Server, Looker, Power BI, Tableau, Okta, LDAP, S3, Delta Lake e outros. Os novos conectores lançados no segundo trimestre de 2026 incluem Airbyte, Matillion, dltHub, Informatica e ThoughtSpot. Em desenvolvimento: Monte Carlo, SAP Datasphere, AWS QuickSight e conectores de streaming para Firehose e Kinesis.
- Suporte a servidor MCP: Suporte nativo para agentes de IA via MCP, integrações com LLM e gerenciamento de contexto, o que significa que assistentes de IA podem consultar metadados do DataHub diretamente sem trocar de ferramentas.
- Integração aprofundada com o Google Cloud (abril de 2026): O DataHub expandiu seu conector do Knowledge Catalog do Google Cloud para oferecer suporte ao Gemini Enterprise Agent Platform, Bigtable, Spanner, Pub/Sub e Dataproc Metastore, juntamente com BigQuery e Google Cloud Storage.
Consideração: A arquitetura do DataHub executa vários serviços interconectados. As implantações em produção normalmente exigem Kubernetes. A complexidade de configuração é o ponto de dor mais citado na comunidade e não ficou mais simples com a adição de recursos de IA. Se a sua equipe não tem experiência com Kubernetes, reserve tempo para a curva de aprendizado antes de se comprometer com uma implantação em produção.
Apache – Atlas
Apache Atlas é uma plataforma de gerenciamento e governança de metadados de código aberto, projetada principalmente para ecossistemas de Hadoop e big data. Ele oferece suporte a classificação, rastreamento de linhagem e pesquisa entre ativos de dados em ambientes criados com Hive, HBase, Kafka, Spark, Sqoop e Storm.
Principais recursos
- Classificação dinâmica: O Atlas permite criar classificações personalizadas, como PII, EXPIRES_ON, DATA_QUALITY e SENSITIVE. Elas podem ser aplicadas no nível de entidade ou atributo, o que é útil para marcar colunas sensíveis em tabelas do Hive sem criar um catálogo separado.
- Tipos de metadados: A plataforma fornece tipos de metadados predefinidos para ambientes Hadoop e não Hadoop, abrangendo HBase, Hive, Sqoop, Kafka e Storm.
- Linguagem de consulta semelhante a SQL (DSL): O Atlas suporta uma linguagem específica de domínio que oferece funcionalidade de consulta semelhante à SQL para pesquisar entidades. Útil para analistas familiarizados com SQL que precisam consultar o catálogo de metadados sem aprender uma nova sintaxe.
- Integração com ferramentas externas: Apache Hive, Apache Spark, Kafka e Presto, o que o torna adequado para ambientes de big data.
Considerações:
- Configurar o Atlas em um ambiente multicloud é complexo, principalmente ao integrar AWS, Azure e Databricks APIs. O Atlas não possui conectores nativos para essas plataformas; é necessária configuração adicional para registrar a linhagem do AWS Redshift ou do Azure Synapse.
- Serviços de catalogação nativos da nuvem (por exemplo, AWS Glue) podem oferecer rastreamento de linhagem com menos sobrecarga para equipes já comprometidas com um único provedor de nuvem.
- O Atlas é mais adequado para organizações que executam Hadoop, Spark e Hive em escala. Equipes sem uma pilha centrada em Hadoop acharão que sua arquitetura adiciona complexidade desnecessária.
Marquez
Marquez é um serviço de metadados de código aberto para coletar, agregar e visualizar metadados do ecossistema de dados. Foi criado na WeWork e disponibilizado como código aberto em 2019. O Marquez é um projeto em estágio de graduação da LF IA & Data Foundation, tendo se graduado em setembro de 2023.
O que o Marquez realmente faz
O Marquez se concentra exclusivamente no rastreamento de linhagem, não na descoberta. É a implementação de referência do padrão OpenLineage, a especificação aberta para como os pipelines relatam metadados de linhagem. Se você usa Apache Airflow, Apache Spark, Apache Flink, dbt ou Dagster, essas ferramentas podem emitir eventos OpenLineage que o Marquez coleta e visualiza. O resultado é um gráfico de linhagem que mostra como os datasets fluem pelos seus pipelines, quais jobs os produziram e como as execuções se parecem historicamente.
Isso torna o Marquez útil para: entender o que quebra quando um dataset upstream muda, depurar falhas de pipeline rastreando a proveniência dos dados e saber quais jobs consomem um determinado dataset antes de descontinuá-lo. Não é uma ferramenta para varrer endpoints em busca de PII.
Nota sobre a atividade da comunidade
No início de 2026, questões em aberto no GitHub do Marquez datando de maio de 2025 permanecem sem solução. A velocidade de commits diminuiu em comparação com DataHub e OpenMetadata. Se você precisa de um catálogo ágil com mantenedores responsivos, o Marquez é a opção mais lenta. Se você precisa de um armazenamento de linhagem estável e leve que implemente o padrão OpenLineage sem a sobrecarga de infraestrutura do DataHub, o Marquez ainda faz bem esse trabalho.
Principais recursos:
- Implementação de referência do OpenLineage: Funciona imediatamente com todas as integrações OpenLineage. Esse é o maior diferencial do Marquez: nenhuma outra ferramenta desta lista é a implementação canônica do padrão de linhagem.
- Visualização do gráfico de linhagem: A interface web fornece uma visão interativa de como os datasets estão conectados e são transformados por meio de fluxos de trabalho. Útil para entender as dependências de pipeline e rastrear erros.
- REST API e GraphQL: A API de linhagem permite automatizar tarefas como backfills e análise de causa raiz, percorrendo a árvore de dependências programaticamente. O endpoint GraphQL está atualmente em beta.
- Baixa sobrecarga de infraestrutura: O Marquez roda em PostgreSQL e não requer Kafka, Elasticsearch ou um banco de dados de grafos, diferentemente do DataHub ou do Atlas. Para equipes que desejam rastreamento de linhagem sem uma pilha complexa, essa simplicidade é o ponto.
Exemplo de fluxo de trabalho: Para inspecionar metadados de linhagem, navegue até a interface do Marquez e pesquise por um job (por exemplo, etl_delivery_7_days) usando a caixa de pesquisa. A partir do dataset de saída do job, você pode ver o nome do dataset, o esquema, a descrição e as entradas upstream. O gráfico de linhagem mostra tudo o que alimenta ou depende desse dataset.
Piiano Vault – ReDiscovery
O Piiano Vault é um cofre de privacidade para armazenar e proteger dados pessoais sensíveis no seu próprio ambiente de nuvem. Ele não é um scanner de descoberta de dados; essa distinção é importante o suficiente para ser declarada claramente antes de descrever o que ele faz.
O caso de uso que o Vault resolve é: “sabemos quais campos são sensíveis (números de cartão de crédito, SSNs, nomes, e-mails, números de telefone) e queremos movê-los dos bancos de dados de aplicativos para um armazenamento centralizado e com controle de acesso.” O Vault se torna o armazenamento autoritativo desses campos. O banco de dados do aplicativo mantém um token ou referência; o valor real fica no Vault. Esse é um padrão de arquitetura de proteção de dados, não uma ferramenta de descoberta.
O Vault é implantado via Docker ou Kubernetes (Helm charts disponíveis). Existem SDKs para Python (Django ORM), TypeScript, Java e Go. O repositório vault-releases foi atualizado pela última vez em agosto de 2025.
Nightfall
Nightfall é uma plataforma DLP comercial nativa de IA. Seus repositórios no GitHub incluem scripts de scanner de código aberto (Apache 2.0) que envolvem a API comercial de detecção da Nightfall. Essa distinção é importante para o enquadramento de “código aberto”: os scripts do scanner são de código aberto, mas o mecanismo de detecção que realmente identifica PII, credenciais e dados de pagamento é o serviço proprietário da Nightfall. A execução de varreduras requer uma chave de API da Nightfall e chama a API comercial da Nightfall. O plano gratuito permite até 100 varreduras por mês em repositórios públicos e privados.
Esta é a ferramenta mais capaz desta lista para detectar dados sensíveis em ambientes modernos. O Nightfall cobre repositórios do GitHub, buckets S3, exportações do Salesforce e fontes semelhantes, mas não é totalmente de código aberto. Se o seu requisito é dependência zero de um fornecedor comercial, o Nightfall não o atende.
Recursos do scanner de código aberto (plano gratuito):
- Varre todo o histórico de commits de repositórios públicos e privados.
- Detecta credenciais, segredos, PII e números de cartão de crédito usando os models de detecção de ML da Nightfall.
- Executa até 100 varreduras por mês sem custo.
- Envia alertas para o Slack quando violações são detectadas.
- Envia resultados para um SIEM, ferramenta de relatórios ou endpoint de webhook.
Recurso distintivo: O Nightfall pode enviar alertas para o Slack quando violações são detectadas e enviar resultados para um SIEM, ferramenta de relatórios ou endpoint de webhook.
Exemplo de caso de uso: Varra um backup do Salesforce para detectar dados sensíveis em repouso. O scanner (1) envia os arquivos de backup para a API da Nightfall para varredura, (2) executa um servidor de webhook local para receber os resultados e (3) exporta as descobertas para um arquivo CSV.
Leitura adicional
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sezer, Sena},
title = {{As 6 Melhores Ferramentas de Código Aberto para Descoberta de Dados Sensíveis}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/open-source-sensitive-data-discovery}},
note = {AIMultiple. Acessado em 21 Agosto 2026}
}Resultados e carimbos de data/hora de 18 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 3 arquivos CSV.
Registro de alterações
1 atualizações- 2026
Atualizada a introdução à lista de ferramentas.
O trabalho de Cem na AIMultiple foi citado por publicações globais líderes, incluindo Business Insider, Forbes, Morning Brew e Washington Post, por empresas globais como Deloitte e HPE, ONGs como o World Economic Forum e organizações supranacionais como a European Commission. [1], [2], [3], [4], [5]
Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas sobre suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.
Ele liderou a estratégia de tecnologia e as compras de uma operadora de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de deep tech Hypatos, que atingiu uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia líderes como TechCrunch e Business Insider.
Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou como engenheiro da computação pela Bogazici University e possui um MBA pela Columbia Business School.


Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.