Serviços
Contate-nos

As 6 Melhores Ferramentas de Código Aberto para Descoberta de Dados Sensíveis

Cem Dilmegani
Cem Dilmegani
atualizado em 21 ago. 2026

As ferramentas a seguir são selecionadas com base na atividade no GitHub e classificadas pela contagem de estrelas no GitHub em ordem decrescente. Elas cobrem os principais casos de uso para descoberta de dados sensíveis: catalogação de metadados com linhagem, varredura sem agentes e detecção baseada em API de PII, dados PCI e credenciais em repouso.

Uma coisa que vale deixar clara antes da lista: essas seis ferramentas não fazem todas a mesma coisa, e alguns dos nomes desta lista não são ferramentas de descoberta de dados sensíveis em sentido estrito.

DataHub, Apache Atlas e Marquez são plataformas de catálogo de metadados e linhagem de dados; elas ajudam você a entender quais dados você tem e para onde eles fluem, o que é um pré-requisito para a descoberta, mas não é o mesmo que varrer em busca de PII.

  • OpenDLP é a única ferramenta aqui criada especificamente para encontrar dados sensíveis em repouso.
  • Piiano Vault é um sistema de armazenamento para dados que você já sabe que são sensíveis.
  • Nightfall é um mecanismo de detecção comercial com scripts de scanner de código aberto em torno dele.

Cada uma se encaixa em um estágio diferente do problema de segurança de dados.

Leia mais: Ferramentas de descoberta e classificação de dados sensíveis, software DLP.

Recursos administrativos

Ferramenta
Painel gráfico
Baseado em pesquisa
Linhagem de dados
Sistema de banco de dados federado
DataHub
Apache – Atlas
Marquez
Não compartilhado.
OpenDLP
Piiano Vault – ReDiscovery
Não compartilhado.
Nightfall IA – Sensitive data scanner

Descrições dos recursos:

  • Painel gráfico – permite visualizar suas descobertas de dados.
  • Baseada em pesquisa funcionalidade – permite pesquisar ativos de dados.
  • Linhagem de dados – permite aos usuários visualizar como os dados são gerados, transformados, transmitidos e usados em um sistema ao longo do tempo.
  • Sistema de banco de dados federado – mapeia vários sistemas de banco de dados autônomos em um único banco de dados federado.

Essa funcionalidade (especialmente linhagem de dados e recursos de pesquisa) permite que as empresas:

  • Descobrir a localização de suas informações pessoais (PII), setor de cartões de pagamento dados (PCI), etc., armazenados em vários bancos de dados, aplicativos e endpoints de usuários.
  • Cumprir os padrões regulatórios do setor de proteção de dados e privacidade, como o Regulamento Geral sobre a Proteção de Dados (GDPR) e a Lei de Privacidade do Consumidor da Califórnia (CCPA).

Recursos de segurança de dados

Descrições dos recursos:

  • Mascaramento de dados – permite ocultar dados modificando suas letras e números originais, para que não tenham valor para invasores não autorizados, mantendo-se utilizáveis para funcionários autorizados.
  • Prevenção contra perda de dados(DLP) – detecta possíveis violações de dados e as previne bloqueando dados sensíveis.

Categorias e estrelas no GitHub

Seleção e classificação de ferramentas:

  • Número de avaliações: 10+ estrelas no GitHub.
  • Classificação: As ferramentas são classificadas pelas estrelas no GitHub em ordem decrescente.

DataHub

DataHub é uma plataforma de metadados de código aberto para descoberta, observabilidade e governança de dados, originalmente criada pelo LinkedIn e agora mantida pela Acryl Data tanto como um projeto de código aberto (Apache 2.0) quanto como uma oferta comercial em nuvem. É a ferramenta desta lista com o desenvolvimento mais ativo, por larga margem: 3.000+ organizações executam o DataHub em produção em todo o mundo, incluindo empresas de tecnologia em hiperescala, instituições financeiras regulamentadas e prestadores de serviços de saúde.

O que o DataHub realmente faz pela descoberta de dados sensíveis

DataHub é um catálogo de metadados, não um scanner. Ele informa quais ativos de dados existem em toda a sua pilha, quem são os proprietários, como fluem pelos pipelines e qual é a qualidade deles, mas não varre sistemas de arquivos ou bancos de dados em busca de padrões de PII como o OpenDLP faz. O caso de uso de descoberta de dados que ele resolve é: “temos 200 fontes de dados e não sabemos o que há nelas nem quem as utiliza.” O caso de uso de descoberta de dados sensíveis que ele não resolve é: “precisamos encontrar todos os arquivos que contenham números de Seguro Social em nossos endpoints Windows.”

Principais recursos:

  • Linhagem de dados em nível de coluna: Rastreia o fluxo de dados da origem ao consumo entre plataformas. O novo suporte em 2026 inclui tabelas dinâmicas do Snowflake, Sigma costurado de volta aos data warehouses de origem, Glue e Iceberg, mapeamento do Athena para o catálogo em vez de caminhos S3 brutos e Power BI por meio do parser oficial M-Query da Microsoft.
  • 90+ conectores nativos: Snowflake, BigQuery, Redshift, Hive, Athena, Postgres, MySQL, SQL Server, Looker, Power BI, Tableau, Okta, LDAP, S3, Delta Lake e outros. Os novos conectores lançados no segundo trimestre de 2026 incluem Airbyte, Matillion, dltHub, Informatica e ThoughtSpot. Em desenvolvimento: Monte Carlo, SAP Datasphere, AWS QuickSight e conectores de streaming para Firehose e Kinesis.
  • Suporte a servidor MCP: Suporte nativo para agentes de IA via MCP, integrações com LLM e gerenciamento de contexto, o que significa que assistentes de IA podem consultar metadados do DataHub diretamente sem trocar de ferramentas.
  • Integração aprofundada com o Google Cloud (abril de 2026): O DataHub expandiu seu conector do Knowledge Catalog do Google Cloud para oferecer suporte ao Gemini Enterprise Agent Platform, Bigtable, Spanner, Pub/Sub e Dataproc Metastore, juntamente com BigQuery e Google Cloud Storage.

Consideração: A arquitetura do DataHub executa vários serviços interconectados. As implantações em produção normalmente exigem Kubernetes. A complexidade de configuração é o ponto de dor mais citado na comunidade e não ficou mais simples com a adição de recursos de IA. Se a sua equipe não tem experiência com Kubernetes, reserve tempo para a curva de aprendizado antes de se comprometer com uma implantação em produção.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Apache – Atlas

Apache Atlas é uma plataforma de gerenciamento e governança de metadados de código aberto, projetada principalmente para ecossistemas de Hadoop e big data. Ele oferece suporte a classificação, rastreamento de linhagem e pesquisa entre ativos de dados em ambientes criados com Hive, HBase, Kafka, Spark, Sqoop e Storm.

Principais recursos

  • Classificação dinâmica: O Atlas permite criar classificações personalizadas, como PII, EXPIRES_ON, DATA_QUALITY e SENSITIVE. Elas podem ser aplicadas no nível de entidade ou atributo, o que é útil para marcar colunas sensíveis em tabelas do Hive sem criar um catálogo separado.
  • Tipos de metadados: A plataforma fornece tipos de metadados predefinidos para ambientes Hadoop e não Hadoop, abrangendo HBase, Hive, Sqoop, Kafka e Storm.
  • Linguagem de consulta semelhante a SQL (DSL): O Atlas suporta uma linguagem específica de domínio que oferece funcionalidade de consulta semelhante à SQL para pesquisar entidades. Útil para analistas familiarizados com SQL que precisam consultar o catálogo de metadados sem aprender uma nova sintaxe.
  • Integração com ferramentas externas: Apache Hive, Apache Spark, Kafka e Presto, o que o torna adequado para ambientes de big data.

Considerações:

  • Configurar o Atlas em um ambiente multicloud é complexo, principalmente ao integrar AWS, Azure e Databricks APIs. O Atlas não possui conectores nativos para essas plataformas; é necessária configuração adicional para registrar a linhagem do AWS Redshift ou do Azure Synapse.
  • Serviços de catalogação nativos da nuvem (por exemplo, AWS Glue) podem oferecer rastreamento de linhagem com menos sobrecarga para equipes já comprometidas com um único provedor de nuvem.
  • O Atlas é mais adequado para organizações que executam Hadoop, Spark e Hive em escala. Equipes sem uma pilha centrada em Hadoop acharão que sua arquitetura adiciona complexidade desnecessária.

Marquez

Marquez é um serviço de metadados de código aberto para coletar, agregar e visualizar metadados do ecossistema de dados. Foi criado na WeWork e disponibilizado como código aberto em 2019. O Marquez é um projeto em estágio de graduação da LF IA & Data Foundation, tendo se graduado em setembro de 2023.

O que o Marquez realmente faz

O Marquez se concentra exclusivamente no rastreamento de linhagem, não na descoberta. É a implementação de referência do padrão OpenLineage, a especificação aberta para como os pipelines relatam metadados de linhagem. Se você usa Apache Airflow, Apache Spark, Apache Flink, dbt ou Dagster, essas ferramentas podem emitir eventos OpenLineage que o Marquez coleta e visualiza. O resultado é um gráfico de linhagem que mostra como os datasets fluem pelos seus pipelines, quais jobs os produziram e como as execuções se parecem historicamente.

Isso torna o Marquez útil para: entender o que quebra quando um dataset upstream muda, depurar falhas de pipeline rastreando a proveniência dos dados e saber quais jobs consomem um determinado dataset antes de descontinuá-lo. Não é uma ferramenta para varrer endpoints em busca de PII.

Nota sobre a atividade da comunidade

No início de 2026, questões em aberto no GitHub do Marquez datando de maio de 2025 permanecem sem solução. A velocidade de commits diminuiu em comparação com DataHub e OpenMetadata. Se você precisa de um catálogo ágil com mantenedores responsivos, o Marquez é a opção mais lenta. Se você precisa de um armazenamento de linhagem estável e leve que implemente o padrão OpenLineage sem a sobrecarga de infraestrutura do DataHub, o Marquez ainda faz bem esse trabalho.

Principais recursos:

  • Implementação de referência do OpenLineage: Funciona imediatamente com todas as integrações OpenLineage. Esse é o maior diferencial do Marquez: nenhuma outra ferramenta desta lista é a implementação canônica do padrão de linhagem.
  • Visualização do gráfico de linhagem: A interface web fornece uma visão interativa de como os datasets estão conectados e são transformados por meio de fluxos de trabalho. Útil para entender as dependências de pipeline e rastrear erros.
  • REST API e GraphQL: A API de linhagem permite automatizar tarefas como backfills e análise de causa raiz, percorrendo a árvore de dependências programaticamente. O endpoint GraphQL está atualmente em beta.
  • Baixa sobrecarga de infraestrutura: O Marquez roda em PostgreSQL e não requer Kafka, Elasticsearch ou um banco de dados de grafos, diferentemente do DataHub ou do Atlas. Para equipes que desejam rastreamento de linhagem sem uma pilha complexa, essa simplicidade é o ponto.

Exemplo de fluxo de trabalho: Para inspecionar metadados de linhagem, navegue até a interface do Marquez e pesquise por um job (por exemplo, etl_delivery_7_days) usando a caixa de pesquisa. A partir do dataset de saída do job, você pode ver o nome do dataset, o esquema, a descrição e as entradas upstream. O gráfico de linhagem mostra tudo o que alimenta ou depende desse dataset.

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Piiano Vault – ReDiscovery

O Piiano Vault é um cofre de privacidade para armazenar e proteger dados pessoais sensíveis no seu próprio ambiente de nuvem. Ele não é um scanner de descoberta de dados; essa distinção é importante o suficiente para ser declarada claramente antes de descrever o que ele faz.

O caso de uso que o Vault resolve é: “sabemos quais campos são sensíveis (números de cartão de crédito, SSNs, nomes, e-mails, números de telefone) e queremos movê-los dos bancos de dados de aplicativos para um armazenamento centralizado e com controle de acesso.” O Vault se torna o armazenamento autoritativo desses campos. O banco de dados do aplicativo mantém um token ou referência; o valor real fica no Vault. Esse é um padrão de arquitetura de proteção de dados, não uma ferramenta de descoberta.

O Vault é implantado via Docker ou Kubernetes (Helm charts disponíveis). Existem SDKs para Python (Django ORM), TypeScript, Java e Go. O repositório vault-releases foi atualizado pela última vez em agosto de 2025.

Nightfall

Nightfall é uma plataforma DLP comercial nativa de IA. Seus repositórios no GitHub incluem scripts de scanner de código aberto (Apache 2.0) que envolvem a API comercial de detecção da Nightfall. Essa distinção é importante para o enquadramento de “código aberto”: os scripts do scanner são de código aberto, mas o mecanismo de detecção que realmente identifica PII, credenciais e dados de pagamento é o serviço proprietário da Nightfall. A execução de varreduras requer uma chave de API da Nightfall e chama a API comercial da Nightfall. O plano gratuito permite até 100 varreduras por mês em repositórios públicos e privados.

Esta é a ferramenta mais capaz desta lista para detectar dados sensíveis em ambientes modernos. O Nightfall cobre repositórios do GitHub, buckets S3, exportações do Salesforce e fontes semelhantes, mas não é totalmente de código aberto. Se o seu requisito é dependência zero de um fornecedor comercial, o Nightfall não o atende.

Recursos do scanner de código aberto (plano gratuito):

  • Varre todo o histórico de commits de repositórios públicos e privados.
  • Detecta credenciais, segredos, PII e números de cartão de crédito usando os models de detecção de ML da Nightfall.
  • Executa até 100 varreduras por mês sem custo.
  • Envia alertas para o Slack quando violações são detectadas.
  • Envia resultados para um SIEM, ferramenta de relatórios ou endpoint de webhook.

Recurso distintivo: O Nightfall pode enviar alertas para o Slack quando violações são detectadas e enviar resultados para um SIEM, ferramenta de relatórios ou endpoint de webhook.

Exemplo de caso de uso: Varra um backup do Salesforce para detectar dados sensíveis em repouso. O scanner (1) envia os arquivos de backup para a API da Nightfall para varredura, (2) executa um servidor de webhook local para receber os resultados e (3) exporta as descobertas para um arquivo CSV.

Leitura adicional

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani and Sena Sezer (2026) - "As 6 Melhores Ferramentas de Código Aberto para Descoberta de Dados Sensíveis". Publicado on-line em AIMultiple.com. Acessado em 21 Agosto 2026, em: https://aimultiple.com/open-source-sensitive-data-discovery [Recurso on-line]

Dilmegani, C., & Sezer, S. (2026, 21 Agosto). As 6 Melhores Ferramentas de Código Aberto para Descoberta de Dados Sensíveis. AIMultiple. https://aimultiple.com/open-source-sensitive-data-discovery

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Sezer, Sena},
  title  = {{As 6 Melhores Ferramentas de Código Aberto para Descoberta de Dados Sensíveis}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/open-source-sensitive-data-discovery}},
  note   = {AIMultiple. Acessado em 21 Agosto 2026}
}
Baixar todos os dados

Resultados e carimbos de data/hora de 18 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 3 arquivos CSV.

Última atualização: 17 Agosto 2026
Baixar

Registro de alterações

1 atualizações
  1. 2026

    Atualizada a introdução à lista de ferramentas.

Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem é o analista principal da AIMultiple desde 2017.

O trabalho de Cem na AIMultiple foi citado por publicações globais líderes, incluindo Business Insider, Forbes, Morning Brew e Washington Post, por empresas globais como Deloitte e HPE, ONGs como o World Economic Forum e organizações supranacionais como a European Commission. [1], [2], [3], [4], [5]

Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas sobre suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.

Ele liderou a estratégia de tecnologia e as compras de uma operadora de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de deep tech Hypatos, que atingiu uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia líderes como TechCrunch e Business Insider.

Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou como engenheiro da computação pela Bogazici University e possui um MBA pela Columbia Business School.
Ver perfil completo
Pesquisado por
Sena Sezer
Sena Sezer
Analista da Indústria
Sena é analista da indústria na AIMultiple. Ela concluiu seu bacharelado pela Bogazici University.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450