Hizmetler
Bize Ulaşın

En İyi 6 Açık Kaynaklı Hassas Veri Keşif Aracı 

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 21 Ağu 2026

Aşağıdaki araçlar, GitHub etkinliğine göre seçilmiş ve GitHub yıldız sayısına göre azalan sırada sıralanmıştır. Hassas veri keşfinin ana kullanım senaryolarını kapsarlar: köken takibiyle üst veri kataloglama, aracısız tarama ve bekleme halindeki PII, PCI verileri ile kimlik bilgilerinin API tabanlı tespiti.

Listeye geçmeden önce açıkça belirtmekte fayda var: bu altı araç aynı işi yapmaz ve listedeki bazı isimler kesin anlamda hassas veri keşif araçları değildir.

DataHub, Apache Atlas ve Marquez üst veri kataloğu ve veri kökeni platformlarıdır; hangi verilere sahip olduğunuzu ve bunların nereye aktığını anlamanıza yardımcı olurlar; bu, keşif için bir ön koşuldur ancak PII taramasıyla aynı şey değildir.

  • OpenDLP, burada bekleyen hassas verileri bulmak için özel olarak üretilmiş tek araçtır.
  • Piiano Vault, zaten hassas olduğunu bildiğiniz veriler için bir depolama sistemidir.
  • Nightfall, etrafını saran açık kaynak tarayıcı betiklerine sahip ticari bir tespit motorudur.

Her biri veri güvenliği sorununun farklı bir aşamasına uygundur.

Daha fazla bilgi edinin: Hassas veri keşif ve sınıflandırma araçları, DLP yazılımı.

Yönetimsel özellikler

Araç
Grafiksel panel
Aramaya dayalı
Veri kökeni
Federe veritabanı sistemi
DataHub
Apache – Atlas
Marquez
Paylaşılmadı.
OpenDLP
Piiano Vault – ReDiscovery
Paylaşılmadı.
Nightfall AI – Sensitive data scanner

Özellik açıklamaları:

  • Grafiksel panel – veri bulgularınızı görselleştirmenizi sağlar.
  • Aramaya dayalı işlev – veri varlıklarını aramayı sağlar.
  • Veri kökeni – kullanıcıların verilerin zaman içinde bir sistemde nasıl üretildiğini, dönüştürüldüğünü, iletildiğini ve kullanıldığını görselleştirmesini sağlar.
  • Federe veritabanı sistemi – birden çok özerk veritabanı sistemini tek bir federe veritabanında eşleştirir.

Bu işlev (özellikle veri kökeni ve arama yetenekleri) işletmelerin şunları yapmasına olanak tanır:

  • Birden çok veritabanında, uygulamada ve kullanıcı uç noktasında saklanan kişisel bilgilerinin (PII), ödeme kartı endüstrisi (PCI) verilerinin vb. konumunu ortaya çıkarmak.
  • Genel Veri Koruma Yönetmeliği (GDPR) ve Kaliforniya Tüketici Gizliliği Yasası (CCPA) gibi sektör düzenleyici veri koruma ve gizlilik standartlarına uyum sağlamak.

Veri güvenliği özellikleri

Özellik açıklamaları:

  • Veri maskeleme – verilerin orijinal harf ve rakamlarını değiştirerek gizlemeyi sağlar; böylece yetkisiz saldırganlar için hiçbir değeri kalmazken yetkili çalışanlar için kullanılabilir kalır.
  • Veri kaybı önleme(DLP) – olası veri ihlallerini tespit eder ve hassas verileri engelleyerek bunları önler.

Kategoriler ve GitHub yıldızları

Araç seçimi ve sıralama:

  • İnceleme sayısı: 10+ GitHub yıldızı.
  • Sıralama: Araçlar GitHub yıldızlarına göre azalan sırada sıralanmıştır.

DataHub

DataHub; veri keşfi, gözlemlenebilirlik ve yönetişim için açık kaynaklı bir üst veri platformudur; başlangıçta LinkedIn tarafından geliştirilmiş ve şu anda Acryl Data tarafından hem açık kaynaklı bir proje (Apache 2.0) hem de ticari bir bulut teklifi olarak sürdürülmektedir. Bu listedeki açık ara en aktif geliştirilen araçtır: dünya genelinde 3.000+ kuruluş DataHub'ı üretimde çalıştırıyor; bunlar arasında hiper ölçekli teknoloji şirketleri, düzenlenmiş finans kurumları ve sağlık hizmeti sağlayıcıları yer alıyor.

DataHub hassas veri keşfi için aslında ne yapar?

DataHub bir üst veri kataloğudur, tarayıcı değildir. Size yığınınızda hangi veri varlıklarının bulunduğunu, bunların sahiplerini, pipeline'lar üzerinden nasıl aktığını ve kalitelerinin nasıl göründüğünü söyler; ancak dosya sistemlerini veya veritabanlarını OpenDLP'nin yaptığı gibi PII desenleri için taramaz. Çözdüğü veri keşfi kullanım senaryosu şudur: “200 veri kaynağımız var ve içlerinde ne olduğunu ya da bunları kimin kullandığını bilmiyoruz.” Çözmediği hassas veri keşfi kullanım senaryosu ise şudur: “Windows uç noktalarımızdaki tüm Sosyal Güvenlik numaralarını içeren dosyaları bulmamız gerekiyor.”

Öne çıkan özellikler:

  • Sütun düzeyinde veri kökeni: Platformlar arasında kaynaktan tüketime veri akışını izler. 2026'daki yeni destek şunları içerir: Snowflake dinamik tabloları, kaynak veri ambarlarına geri dikilen Sigma, Glue ve Iceberg, ham S3 yolları yerine kataloğa eşlenen Athena ve Microsoft’un resmi M-Query ayrıştırıcısı aracılığıyla Power BI.
  • 90+ yerel bağlayıcı: Snowflake, BigQuery, Redshift, Hive, Athena, Postgres, MySQL, SQL Server, Looker, Power BI, Tableau, Okta, LDAP, S3, Delta Lake ve diğerleri. 2026'nın ikinci çeyreğinde yayınlanan yeni bağlayıcılar arasında Airbyte, Matillion, dltHub, Informatica ve ThoughtSpot bulunur. Geliştirilme aşamasında: Monte Carlo, SAP Datasphere, AWS QuickSight ve Firehose ile Kinesis için akış bağlayıcıları.
  • MCP sunucu desteği: MCP, LLM entegrasyonları ve bağlam yönetimi aracılığıyla yapay zeka ajanları için yerel destek; yani yapay zeka asistanları araç değiştirmeden doğrudan DataHub üst verilerini sorgulayabilir.
  • Google Cloud entegrasyonunu derinleştirdi (Nisan 2026): DataHub, Google Cloud Knowledge Catalog bağlayıcısını genişleterek Gemini Enterprise Agent Platform, Bigtable, Spanner, Pub/Sub ve Dataproc Metastore ile birlikte BigQuery ve Google Cloud Storage desteği ekledi.

Dikkate alınması gereken nokta: DataHub'ın mimarisi birbirine bağlı birkaç hizmeti çalıştırır. Üretim dağıtımları genellikle Kubernetes gerektirir. Kurulum karmaşıklığı, toplulukta en sık dile getirilen zorluktur ve yapay zeka özelliklerinin eklenmesiyle daha basit hale gelmemiştir. Ekibinizin Kubernetes deneyimi yoksa, üretime geçirmeden önce öğrenme eğrisi için zaman ayırın.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Apache – Atlas

Apache Atlas, öncelikle Hadoop ve büyük veri ekosistemleri için tasarlanmış açık kaynaklı bir üst veri yönetimi ve yönetişim platformudur. Hive, HBase, Kafka, Spark, Sqoop ve Storm üzerine kurulu ortamlardaki veri varlıkları arasında sınıflandırma, köken izleme ve aramayı destekler.

Öne çıkan özellikler

  • Dinamik sınıflandırma: Atlas; PII, EXPIRES_ON, DATA_QUALITY ve SENSITIVE gibi özel sınıflandırmalar oluşturmayı sağlar. Bunlar varlık veya öznitelik düzeyinde uygulanabilir; bu, ayrı bir katalog oluşturmadan Hive tablolarındaki hassas sütunları etiketlemek için kullanışlıdır.
  • Üst veri türleri: Platform, Hadoop ve Hadoop dışı ortamlar için HBase, Hive, Sqoop, Kafka ve Storm'u kapsayan önceden tanımlanmış üst veri türleri sağlar.
  • SQL benzeri sorgu dili (DSL): Atlas, varlıkları aramak için SQL benzeri sorgu işlevi sağlayan alana özgü bir dili destekler. Yeni bir sözdizimi öğrenmeden üst veri kataloğunu sorgulaması gereken, SQL diline aşina analistler için kullanışlıdır.
  • Harici araçlarla entegrasyon: Apache Hive, Apache Spark, Kafka ve Presto ile entegrasyon, onu büyük veri ortamları için uygun hale getirir.

Dikkate alınması gerekenler:

  • Atlas'ı çoklu bulut ortamında yapılandırmak, özellikle AWS, Azure ve Databricks API'lerini birbirine bağlarken karmaşıktır. Atlas'ın bu platformlar için yerel bağlayıcıları yoktur; AWS Redshift veya Azure Synapse'ten köken kaydetmek için ek yapılandırma gerekir.
  • Bulutta yerel kataloglama hizmetleri (ör. AWS Glue), halihazırda tek bir bulut sağlayıcısına bağlı ekipler için daha düşük ek yüklü köken izleme sunabilir.
  • Atlas en çok, Hadoop, Spark ve Hive'ı ölçekli olarak çalıştıran kuruluşlar için uygundur. Hadoop merkezli bir yığına sahip olmayan ekipler, mimarisinin gereksiz karmaşıklık eklediğini görecektir.

Marquez

Marquez; veri ekosistemi üst verilerini toplamak, bir araya getirmek ve görselleştirmek için açık kaynaklı bir üst veri hizmetidir. WeWork'te oluşturulmuş ve 2019'da açık kaynak haline getirilmiştir. Marquez, Eylül 2023'te mezun olan LF AI & Data Foundation'ın mezuniyet aşamasındaki bir projesidir.

Marquez aslında ne yapar?

Marquez yalnızca köken izlemeye odaklanır, keşfe değil. Pipeline'ların köken üst verilerini nasıl raporladığına ilişkin açık spesifikasyon olan OpenLineage standardının referans uygulamasıdır. Apache Airflow, Apache Spark, Apache Flink, dbt veya Dagster kullanıyorsanız, bu araçlar Marquez'in toplayıp görselleştirdiği OpenLineage olayları yayabilir. Sonuç; dataset'lerin pipeline'larınız boyunca nasıl aktığını, hangi işlerin onları ürettiğini ve çalıştırmaların geçmişte nasıl göründüğünü gösteren bir köken grafiğidir.

Bu, Marquez'i şunlar için faydalı kılar: bir üst akış dataset'i değiştiğinde neyin bozulduğunu anlama, veri kökenini izleyerek pipeline hatalarını ayıklama ve belirli bir dataset'i kullanımdan kaldırmadan önce hangi işlerin onu tükettiğini bilme. Uç noktaları PII için taramaya yönelik bir araç değildir.

Topluluk etkinliği notu

2026 başı itibarıyla, Marquez'in GitHub üzerinde Mayıs 2025'e kadar uzanan açık sorunları hala ele alınmamış durumda. Commit hızı, DataHub ve OpenMetadata'ye kıyasla yavaşladı. Hızlı hareket eden ve duyarlı bakımcıları olan bir kataloğa ihtiyacınız varsa Marquez daha yavaş seçenektir. DataHub'ın altyapı yükü olmadan OpenLineage standardını uygulayan istikrarlı, hafif bir köken deposuna ihtiyacınız varsa Marquez bu işi hala iyi yapar.

Öne çıkan özellikler:

  • OpenLineage referans uygulaması: Her OpenLineage entegrasyonuyla kutudan çıktığı gibi çalışır. Bu, Marquez'in en güçlü farklılaştırıcısıdır: bu listedeki başka hiçbir araç, köken standardının kanonik uygulaması değildir.
  • Köken grafiği görselleştirmesi: Web arayüzü, dataset'lerin iş akışları aracılığıyla nasıl bağlandığını ve dönüştürüldüğünü gösteren etkileşimli bir görünüm sunar. Pipeline bağımlılıklarını anlamak ve hataları izlemek için kullanışlıdır.
  • REST API ve GraphQL: Köken API'si, bağımlılık ağacını programlı olarak dolaşarak geri doldurma ve kök neden analizi gibi görevlerin otomatikleştirilmesine olanak tanır. GraphQL endpoint'i şu anda beta aşamasındadır.
  • Düşük altyapı yükü: Marquez, PostgreSQL üzerinde çalışır ve DataHub veya Atlas'ın aksine Kafka, Elasticsearch veya bir grafik veritabanı gerektirmez. Karmaşık bir yığın olmadan köken izleme isteyen ekipler için asıl mesele bu basitliktir.

Örnek iş akışı: Köken üst verilerini incelemek için Marquez arayüzüne gidin ve arama kutusunu kullanarak bir iş arayın (ör. etl_delivery_7_days). İşin çıktı dataset'inden dataset adını, şemasını, açıklamasını ve üst akış girdilerini görüntüleyebilirsiniz. Köken grafiği, o dataset'e beslenen veya ona bağımlı olan her şeyi gösterir.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Piiano Vault – ReDiscovery

Piiano Vault; kendi bulut ortamınızda hassas kişisel verileri depolamak ve güvence altına almak için bir gizlilik kasasıdır. Bir veri keşif tarayıcısı değildir; bu ayrım, ne yaptığını açıklamadan önce açıkça belirtmeye değecek kadar önemlidir.

Vault'un çözdüğü kullanım senaryosu şudur: “Hangi alanların hassas olduğunu biliyoruz (kredi kartı numaraları, SSN'ler, adlar, e-postalar, telefon numaraları) ve bunları uygulama veritabanlarımızdan çıkarıp merkezi, erişim kontrollü bir depoya taşımak istiyoruz.” Vault, bu alanlar için yetkili depo haline gelir. Uygulama veritabanı bir token veya referans tutar; gerçek değer Vault'ta yaşar. Bu bir veri koruma mimarisi desenidir, keşif aracı değildir.

Vault, Docker veya Kubernetes ile dağıtılır (Helm şemaları mevcuttur). Python (Django ORM), TypeScript, Java ve Go için SDK'lar mevcuttur. vault-releases deposu en son Ağustos 2025'te güncellenmiştir.

Nightfall

Nightfall, yapay zeka yerel ticari bir DLP platformudur. GitHub depoları, Nightfall'ın ticari tespit API'sini sarmalayan açık kaynak tarayıcı betiklerini (Apache 2.0) içerir. Bu ayrım “açık kaynak” çerçevesi açısından önemlidir: tarayıcı betikleri açık kaynaktır; ancak PII, kimlik bilgileri ve ödeme verilerini gerçekten tanımlayan tespit motoru Nightfall'ın tescilli hizmetidir. Taramaları yürütmek için bir Nightfall API anahtarı gerekir ve Nightfall'ın ticari API'si çağrılır. ücretsiz katman, genel ve özel depolarda ayda 100 taramaya kadar izin verir.

Bu, modern ortamlarda hassas verileri tespit etmek için bu listedeki en yetenekli araçtır. Nightfall; GitHub depolarını, S3 bucket'larını, Salesforce dışa aktarımlarını ve benzer kaynakları kapsar; ancak tamamen açık kaynak değildir. Gereksiniminiz ticari bir satıcıya sıfır bağımlılıksa Nightfall bunu karşılamaz.

Açık kaynak tarayıcı yetenekleri (ücretsiz katman):

  • Genel ve özel depoların tüm commit geçmişini tarar.
  • Nightfall'ın ML tespit modellerini kullanarak kimlik bilgilerini, sırları, PII'yi ve kredi kartı numaralarını tespit eder.
  • Ayda 100 taramaya kadar ücretsiz çalışır.
  • İhlaller tespit edildiğinde Slack'e uyarılar gönderir.
  • Sonuçları bir SIEM'e, raporlama aracına veya webhook endpoint'ine iletir.

Ayırt edici özellik: Nightfall, ihlaller tespit edildiğinde Slack'e uyarı gönderebilir ve sonuçları bir SIEM'e, raporlama aracına veya webhook endpoint'ine iletebilir.

Örnek kullanım senaryosu: Bekleyen hassas verileri tespit etmek için bir Salesforce yedeğini tarayın. Tarayıcı (1) yedek dosyalarını tarama için Nightfall'ın API'sine gönderir, (2) sonuçları almak için yerel bir webhook sunucusu çalıştırır ve (3) bulguları bir CSV dosyasına aktarır.

Daha fazla bilgi

Bu araştırmayı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Sena Sezer (2026) - "En İyi 6 Açık Kaynaklı Hassas Veri Keşif Aracı ". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 21 Ağustos 2026, kaynak: https://aimultiple.com/open-source-sensitive-data-discovery [Çevrimiçi Kaynak]

Dilmegani, C., & Sezer, S. (2026, 21 Ağustos). En İyi 6 Açık Kaynaklı Hassas Veri Keşif Aracı . AIMultiple. https://aimultiple.com/open-source-sensitive-data-discovery

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Sezer, Sena},
  title  = {{En İyi 6 Açık Kaynaklı Hassas Veri Keşif Aracı }},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/open-source-sensitive-data-discovery}},
  note   = {AIMultiple. Erişim tarihi: 21 Ağustos 2026}
}
Tüm verileri indir

18 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 3 CSV dosyası içeren ZIP dosyası olarak indirin.

Son güncelleme: 17 Ağustos 2026
İndir

Değişiklik günlüğü

2 güncelleme
  1. 2026

    DataHub'ın temel özellikleri 90+ bağlayıcı, yeni 2026 entegrasyonları ve MCP sunucu desteğiyle genişletildi.

  2. Araçlar listesinin girişi güncellendi.

Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple bünyesinde baş analisttir. Cem'in AIMultiple'daki çalışmaları; Business Insider, Forbes, Morning Brew ve Washington Post gibi önde gelen küresel yayınlar, Deloitte ve HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır. [1], [2], [3], [4], [5] Kariyeri boyunca Cem; teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yaptı. On yılı aşkın süre boyunca McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yaptı. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımladı. CEO'ya rapor verirken bir telekom şirketinin teknoloji stratejisini ve satın alma süreçlerini yönetti. Ayrıca 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetti. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alındı. Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun oldu ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Araştıran
Sena Sezer
Sena Sezer
Endüstri Analisti
Sena, AIMultiple bünyesinde endüstri analistidir. Lisans derecesini Boğaziçi Üniversitesi'nden tamamlamıştır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450