Aşağıdaki araçlar, GitHub etkinliğine göre seçilmiş ve GitHub yıldız sayısına göre azalan sırada sıralanmıştır. Hassas veri keşfinin ana kullanım senaryolarını kapsarlar: köken takibiyle üst veri kataloglama, aracısız tarama ve bekleme halindeki PII, PCI verileri ile kimlik bilgilerinin API tabanlı tespiti.
Listeye geçmeden önce açıkça belirtmekte fayda var: bu altı araç aynı işi yapmaz ve listedeki bazı isimler kesin anlamda hassas veri keşif araçları değildir.
DataHub, Apache Atlas ve Marquez üst veri kataloğu ve veri kökeni platformlarıdır; hangi verilere sahip olduğunuzu ve bunların nereye aktığını anlamanıza yardımcı olurlar; bu, keşif için bir ön koşuldur ancak PII taramasıyla aynı şey değildir.
- OpenDLP, burada bekleyen hassas verileri bulmak için özel olarak üretilmiş tek araçtır.
- Piiano Vault, zaten hassas olduğunu bildiğiniz veriler için bir depolama sistemidir.
- Nightfall, etrafını saran açık kaynak tarayıcı betiklerine sahip ticari bir tespit motorudur.
Her biri veri güvenliği sorununun farklı bir aşamasına uygundur.
Daha fazla bilgi edinin: Hassas veri keşif ve sınıflandırma araçları, DLP yazılımı.
Yönetimsel özellikler
Araç | Grafiksel panel | Aramaya dayalı | Veri kökeni | Federe veritabanı sistemi |
|---|---|---|---|---|
DataHub | ✅ | ✅ | ✅ | ✅ |
Apache – Atlas | ✅ | ✅ | ✅ | ❌ |
Marquez | ✅ | ✅ | ✅ | Paylaşılmadı. |
OpenDLP | ❌ | ❌ | ❌ | ❌ |
Piiano Vault – ReDiscovery | ❌ | Paylaşılmadı. | ❌ | ❌ |
Nightfall AI – Sensitive data scanner | ✅ | ✅ | ❌ | ❌ |
Özellik açıklamaları:
- Grafiksel panel – veri bulgularınızı görselleştirmenizi sağlar.
- Aramaya dayalı işlev – veri varlıklarını aramayı sağlar.
- Veri kökeni – kullanıcıların verilerin zaman içinde bir sistemde nasıl üretildiğini, dönüştürüldüğünü, iletildiğini ve kullanıldığını görselleştirmesini sağlar.
- Federe veritabanı sistemi – birden çok özerk veritabanı sistemini tek bir federe veritabanında eşleştirir.
Bu işlev (özellikle veri kökeni ve arama yetenekleri) işletmelerin şunları yapmasına olanak tanır:
- Birden çok veritabanında, uygulamada ve kullanıcı uç noktasında saklanan kişisel bilgilerinin (PII), ödeme kartı endüstrisi (PCI) verilerinin vb. konumunu ortaya çıkarmak.
- Genel Veri Koruma Yönetmeliği (GDPR) ve Kaliforniya Tüketici Gizliliği Yasası (CCPA) gibi sektör düzenleyici veri koruma ve gizlilik standartlarına uyum sağlamak.
Veri güvenliği özellikleri
Özellik açıklamaları:
- Veri maskeleme – verilerin orijinal harf ve rakamlarını değiştirerek gizlemeyi sağlar; böylece yetkisiz saldırganlar için hiçbir değeri kalmazken yetkili çalışanlar için kullanılabilir kalır.
- Veri kaybı önleme(DLP) – olası veri ihlallerini tespit eder ve hassas verileri engelleyerek bunları önler.
Kategoriler ve GitHub yıldızları
Araç seçimi ve sıralama:
- İnceleme sayısı: 10+ GitHub yıldızı.
- Sıralama: Araçlar GitHub yıldızlarına göre azalan sırada sıralanmıştır.
DataHub
DataHub; veri keşfi, gözlemlenebilirlik ve yönetişim için açık kaynaklı bir üst veri platformudur; başlangıçta LinkedIn tarafından geliştirilmiş ve şu anda Acryl Data tarafından hem açık kaynaklı bir proje (Apache 2.0) hem de ticari bir bulut teklifi olarak sürdürülmektedir. Bu listedeki açık ara en aktif geliştirilen araçtır: dünya genelinde 3.000+ kuruluş DataHub'ı üretimde çalıştırıyor; bunlar arasında hiper ölçekli teknoloji şirketleri, düzenlenmiş finans kurumları ve sağlık hizmeti sağlayıcıları yer alıyor.
DataHub hassas veri keşfi için aslında ne yapar?
DataHub bir üst veri kataloğudur, tarayıcı değildir. Size yığınınızda hangi veri varlıklarının bulunduğunu, bunların sahiplerini, pipeline'lar üzerinden nasıl aktığını ve kalitelerinin nasıl göründüğünü söyler; ancak dosya sistemlerini veya veritabanlarını OpenDLP'nin yaptığı gibi PII desenleri için taramaz. Çözdüğü veri keşfi kullanım senaryosu şudur: “200 veri kaynağımız var ve içlerinde ne olduğunu ya da bunları kimin kullandığını bilmiyoruz.” Çözmediği hassas veri keşfi kullanım senaryosu ise şudur: “Windows uç noktalarımızdaki tüm Sosyal Güvenlik numaralarını içeren dosyaları bulmamız gerekiyor.”
Öne çıkan özellikler:
- Sütun düzeyinde veri kökeni: Platformlar arasında kaynaktan tüketime veri akışını izler. 2026'daki yeni destek şunları içerir: Snowflake dinamik tabloları, kaynak veri ambarlarına geri dikilen Sigma, Glue ve Iceberg, ham S3 yolları yerine kataloğa eşlenen Athena ve Microsoft’un resmi M-Query ayrıştırıcısı aracılığıyla Power BI.
- 90+ yerel bağlayıcı: Snowflake, BigQuery, Redshift, Hive, Athena, Postgres, MySQL, SQL Server, Looker, Power BI, Tableau, Okta, LDAP, S3, Delta Lake ve diğerleri. 2026'nın ikinci çeyreğinde yayınlanan yeni bağlayıcılar arasında Airbyte, Matillion, dltHub, Informatica ve ThoughtSpot bulunur. Geliştirilme aşamasında: Monte Carlo, SAP Datasphere, AWS QuickSight ve Firehose ile Kinesis için akış bağlayıcıları.
- MCP sunucu desteği: MCP, LLM entegrasyonları ve bağlam yönetimi aracılığıyla yapay zeka ajanları için yerel destek; yani yapay zeka asistanları araç değiştirmeden doğrudan DataHub üst verilerini sorgulayabilir.
- Google Cloud entegrasyonunu derinleştirdi (Nisan 2026): DataHub, Google Cloud Knowledge Catalog bağlayıcısını genişleterek Gemini Enterprise Agent Platform, Bigtable, Spanner, Pub/Sub ve Dataproc Metastore ile birlikte BigQuery ve Google Cloud Storage desteği ekledi.
Dikkate alınması gereken nokta: DataHub'ın mimarisi birbirine bağlı birkaç hizmeti çalıştırır. Üretim dağıtımları genellikle Kubernetes gerektirir. Kurulum karmaşıklığı, toplulukta en sık dile getirilen zorluktur ve yapay zeka özelliklerinin eklenmesiyle daha basit hale gelmemiştir. Ekibinizin Kubernetes deneyimi yoksa, üretime geçirmeden önce öğrenme eğrisi için zaman ayırın.
Apache – Atlas
Apache Atlas, öncelikle Hadoop ve büyük veri ekosistemleri için tasarlanmış açık kaynaklı bir üst veri yönetimi ve yönetişim platformudur. Hive, HBase, Kafka, Spark, Sqoop ve Storm üzerine kurulu ortamlardaki veri varlıkları arasında sınıflandırma, köken izleme ve aramayı destekler.
Öne çıkan özellikler
- Dinamik sınıflandırma: Atlas; PII, EXPIRES_ON, DATA_QUALITY ve SENSITIVE gibi özel sınıflandırmalar oluşturmayı sağlar. Bunlar varlık veya öznitelik düzeyinde uygulanabilir; bu, ayrı bir katalog oluşturmadan Hive tablolarındaki hassas sütunları etiketlemek için kullanışlıdır.
- Üst veri türleri: Platform, Hadoop ve Hadoop dışı ortamlar için HBase, Hive, Sqoop, Kafka ve Storm'u kapsayan önceden tanımlanmış üst veri türleri sağlar.
- SQL benzeri sorgu dili (DSL): Atlas, varlıkları aramak için SQL benzeri sorgu işlevi sağlayan alana özgü bir dili destekler. Yeni bir sözdizimi öğrenmeden üst veri kataloğunu sorgulaması gereken, SQL diline aşina analistler için kullanışlıdır.
- Harici araçlarla entegrasyon: Apache Hive, Apache Spark, Kafka ve Presto ile entegrasyon, onu büyük veri ortamları için uygun hale getirir.
Dikkate alınması gerekenler:
- Atlas'ı çoklu bulut ortamında yapılandırmak, özellikle AWS, Azure ve Databricks API'lerini birbirine bağlarken karmaşıktır. Atlas'ın bu platformlar için yerel bağlayıcıları yoktur; AWS Redshift veya Azure Synapse'ten köken kaydetmek için ek yapılandırma gerekir.
- Bulutta yerel kataloglama hizmetleri (ör. AWS Glue), halihazırda tek bir bulut sağlayıcısına bağlı ekipler için daha düşük ek yüklü köken izleme sunabilir.
- Atlas en çok, Hadoop, Spark ve Hive'ı ölçekli olarak çalıştıran kuruluşlar için uygundur. Hadoop merkezli bir yığına sahip olmayan ekipler, mimarisinin gereksiz karmaşıklık eklediğini görecektir.
Marquez
Marquez; veri ekosistemi üst verilerini toplamak, bir araya getirmek ve görselleştirmek için açık kaynaklı bir üst veri hizmetidir. WeWork'te oluşturulmuş ve 2019'da açık kaynak haline getirilmiştir. Marquez, Eylül 2023'te mezun olan LF AI & Data Foundation'ın mezuniyet aşamasındaki bir projesidir.
Marquez aslında ne yapar?
Marquez yalnızca köken izlemeye odaklanır, keşfe değil. Pipeline'ların köken üst verilerini nasıl raporladığına ilişkin açık spesifikasyon olan OpenLineage standardının referans uygulamasıdır. Apache Airflow, Apache Spark, Apache Flink, dbt veya Dagster kullanıyorsanız, bu araçlar Marquez'in toplayıp görselleştirdiği OpenLineage olayları yayabilir. Sonuç; dataset'lerin pipeline'larınız boyunca nasıl aktığını, hangi işlerin onları ürettiğini ve çalıştırmaların geçmişte nasıl göründüğünü gösteren bir köken grafiğidir.
Bu, Marquez'i şunlar için faydalı kılar: bir üst akış dataset'i değiştiğinde neyin bozulduğunu anlama, veri kökenini izleyerek pipeline hatalarını ayıklama ve belirli bir dataset'i kullanımdan kaldırmadan önce hangi işlerin onu tükettiğini bilme. Uç noktaları PII için taramaya yönelik bir araç değildir.
Topluluk etkinliği notu
2026 başı itibarıyla, Marquez'in GitHub üzerinde Mayıs 2025'e kadar uzanan açık sorunları hala ele alınmamış durumda. Commit hızı, DataHub ve OpenMetadata'ye kıyasla yavaşladı. Hızlı hareket eden ve duyarlı bakımcıları olan bir kataloğa ihtiyacınız varsa Marquez daha yavaş seçenektir. DataHub'ın altyapı yükü olmadan OpenLineage standardını uygulayan istikrarlı, hafif bir köken deposuna ihtiyacınız varsa Marquez bu işi hala iyi yapar.
Öne çıkan özellikler:
- OpenLineage referans uygulaması: Her OpenLineage entegrasyonuyla kutudan çıktığı gibi çalışır. Bu, Marquez'in en güçlü farklılaştırıcısıdır: bu listedeki başka hiçbir araç, köken standardının kanonik uygulaması değildir.
- Köken grafiği görselleştirmesi: Web arayüzü, dataset'lerin iş akışları aracılığıyla nasıl bağlandığını ve dönüştürüldüğünü gösteren etkileşimli bir görünüm sunar. Pipeline bağımlılıklarını anlamak ve hataları izlemek için kullanışlıdır.
- REST API ve GraphQL: Köken API'si, bağımlılık ağacını programlı olarak dolaşarak geri doldurma ve kök neden analizi gibi görevlerin otomatikleştirilmesine olanak tanır. GraphQL endpoint'i şu anda beta aşamasındadır.
- Düşük altyapı yükü: Marquez, PostgreSQL üzerinde çalışır ve DataHub veya Atlas'ın aksine Kafka, Elasticsearch veya bir grafik veritabanı gerektirmez. Karmaşık bir yığın olmadan köken izleme isteyen ekipler için asıl mesele bu basitliktir.
Örnek iş akışı: Köken üst verilerini incelemek için Marquez arayüzüne gidin ve arama kutusunu kullanarak bir iş arayın (ör. etl_delivery_7_days). İşin çıktı dataset'inden dataset adını, şemasını, açıklamasını ve üst akış girdilerini görüntüleyebilirsiniz. Köken grafiği, o dataset'e beslenen veya ona bağımlı olan her şeyi gösterir.
Piiano Vault – ReDiscovery
Piiano Vault; kendi bulut ortamınızda hassas kişisel verileri depolamak ve güvence altına almak için bir gizlilik kasasıdır. Bir veri keşif tarayıcısı değildir; bu ayrım, ne yaptığını açıklamadan önce açıkça belirtmeye değecek kadar önemlidir.
Vault'un çözdüğü kullanım senaryosu şudur: “Hangi alanların hassas olduğunu biliyoruz (kredi kartı numaraları, SSN'ler, adlar, e-postalar, telefon numaraları) ve bunları uygulama veritabanlarımızdan çıkarıp merkezi, erişim kontrollü bir depoya taşımak istiyoruz.” Vault, bu alanlar için yetkili depo haline gelir. Uygulama veritabanı bir token veya referans tutar; gerçek değer Vault'ta yaşar. Bu bir veri koruma mimarisi desenidir, keşif aracı değildir.
Vault, Docker veya Kubernetes ile dağıtılır (Helm şemaları mevcuttur). Python (Django ORM), TypeScript, Java ve Go için SDK'lar mevcuttur. vault-releases deposu en son Ağustos 2025'te güncellenmiştir.
Nightfall
Nightfall, yapay zeka yerel ticari bir DLP platformudur. GitHub depoları, Nightfall'ın ticari tespit API'sini sarmalayan açık kaynak tarayıcı betiklerini (Apache 2.0) içerir. Bu ayrım “açık kaynak” çerçevesi açısından önemlidir: tarayıcı betikleri açık kaynaktır; ancak PII, kimlik bilgileri ve ödeme verilerini gerçekten tanımlayan tespit motoru Nightfall'ın tescilli hizmetidir. Taramaları yürütmek için bir Nightfall API anahtarı gerekir ve Nightfall'ın ticari API'si çağrılır. ücretsiz katman, genel ve özel depolarda ayda 100 taramaya kadar izin verir.
Bu, modern ortamlarda hassas verileri tespit etmek için bu listedeki en yetenekli araçtır. Nightfall; GitHub depolarını, S3 bucket'larını, Salesforce dışa aktarımlarını ve benzer kaynakları kapsar; ancak tamamen açık kaynak değildir. Gereksiniminiz ticari bir satıcıya sıfır bağımlılıksa Nightfall bunu karşılamaz.
Açık kaynak tarayıcı yetenekleri (ücretsiz katman):
- Genel ve özel depoların tüm commit geçmişini tarar.
- Nightfall'ın ML tespit modellerini kullanarak kimlik bilgilerini, sırları, PII'yi ve kredi kartı numaralarını tespit eder.
- Ayda 100 taramaya kadar ücretsiz çalışır.
- İhlaller tespit edildiğinde Slack'e uyarılar gönderir.
- Sonuçları bir SIEM'e, raporlama aracına veya webhook endpoint'ine iletir.
Ayırt edici özellik: Nightfall, ihlaller tespit edildiğinde Slack'e uyarı gönderebilir ve sonuçları bir SIEM'e, raporlama aracına veya webhook endpoint'ine iletebilir.
Örnek kullanım senaryosu: Bekleyen hassas verileri tespit etmek için bir Salesforce yedeğini tarayın. Tarayıcı (1) yedek dosyalarını tarama için Nightfall'ın API'sine gönderir, (2) sonuçları almak için yerel bir webhook sunucusu çalıştırır ve (3) bulguları bir CSV dosyasına aktarır.
Daha fazla bilgi
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sezer, Sena},
title = {{En İyi 6 Açık Kaynaklı Hassas Veri Keşif Aracı }},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/open-source-sensitive-data-discovery}},
note = {AIMultiple. Erişim tarihi: 21 Ağustos 2026}
}18 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 3 CSV dosyası içeren ZIP dosyası olarak indirin.
Değişiklik günlüğü
2 güncelleme- 2026
DataHub'ın temel özellikleri 90+ bağlayıcı, yeni 2026 entegrasyonları ve MCP sunucu desteğiyle genişletildi.
Araçlar listesinin girişi güncellendi.


Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.