Hizmetler
Bize Ulaşın

En İyi 6 Açık Kaynak Hassas Veri Keşif Aracı 

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 24 Haz 2026

Aşağıdaki araçlar GitHub etkinliğine göre seçilmiş ve azalan sırada GitHub yıldız sayısına göre sıralanmıştır. Hassas veri keşfi için ana kullanım durumlarını kapsarlar: köken takibi ile meta veri kataloglama, aracısız tarama ve durağan haldeki PII, PCI verileri ve kimlik bilgilerinin API tabanlı tespiti.

Listeye geçmeden önce açıkça belirtilmesi gereken bir şey: bu altı araç aynı şeyi yapmaz ve bu listedeki bazı isimler tam anlamıyla hassas veri keşif aracı değildir.

DataHub, Apache Atlas ve Marquez, meta veri kataloğu ve veri kökeni platformlarıdır; hangi verilere sahip olduğunuzu ve bunların nereden nereye aktığını anlamanıza yardımcı olurlar; bu, keşif için bir ön koşuldur ancak PII taramasıyla aynı şey değildir.

  • OpenDLP, burada durağan haldeki hassas verileri bulmak için özel olarak oluşturulmuş tek araçtır.
  • Piiano Vault, zaten hassas olduğunu bildiğiniz veriler için bir depolama sistemidir.
  • Nightfall, etrafına açık kaynak tarayıcı betikleri sarılmış ticari bir tespit motorudur.

Her biri, veri güvenliği sorununun farklı bir aşamasına uyar.

Daha fazlasını okuyun: Hassas veri keşfi ve sınıflandırma araçları, DLP yazılımı.

Yönetimsel özellikler

Araç
Grafiksel pano
Arama tabanlı
Veri kökeni
Federa veritabanı sistemi
DataHub
Apache – Atlas
Marquez
Paylaşılmamış.
OpenDLP
Piiano Vault – ReDiscovery
Paylaşılmamış.
Nightfall YZ – Hassas veri tarayıcı

Özellik açıklamaları:

  • Grafiksel pano – veri bulgularınızı görselleştirmenize olanak tanır.
  • Arama tabanlı işlevsellik – veri varlıklarını aramaya olanak tanır.
  • Veri kökeni – kullanıcıların verilerin bir sistemde zaman içinde nasıl oluşturulduğunu, dönüştürüldüğünü, iletildiğini ve kullanıldığını görselleştirmesine olanak tanır.
  • Federa veritabanı sistemi – birden çok otonom veritabanı sistemini tek bir federa veritabanında eşler.

Bu işlevsellik (özellikle veri kökeni ve arama yetenekleri) işletmelerin şunları yapmasına olanak tanır:

  • Birden çok veritabanı, uygulama ve kullanıcı uç noktasında depolanan kişisel bilgilerinin (PII), ödeme kartı endüstrisi (PCI) verilerinin vb. konumunu ortaya çıkarmak.
  • Genel Veri Koruma Yönetmeliği (GDPR) ve Kaliforniya Tüketici Gizliliği Yasası (CCPA) gibi sektör düzenleyici veri koruma ve gizlilik standartlarına uyum sağlamak.

Veri güvenliği özellikleri

Özellik açıklamaları:

  • Veri maskeleme – orijinal harf ve rakamlarını değiştirerek verileri gizlemeye olanak tanır; böylece yetkisiz davetsiz misafirler için hiçbir değer taşımazken yetkili çalışanlar için kullanılabilir kalır.
  • Veri kaybı önleme (DLP) – potansiyel veri ihlallerini tespit eder ve hassas verileri engelleyerek bunları önler.

Kategoriler ve GitHub yıldızları

Araç seçimi ve sıralama:

  • İnceleme sayısı: 10+ GitHub yıldızı.
  • Güncelleme sürümü: Kasım 2024 itibarıyla geçen hafta en az bir güncelleme yayınlandı.
  • Sıralama: Araçlar, azalan sırada GitHub yıldızlarına göre sıralanmıştır.

DataHub

DataHub, veri keşfi, gözlemlenebilirlik ve yönetişim için açık kaynaklı bir meta veri platformudur; başlangıçta LinkedIn tarafından oluşturulmuş olup şu anda Acryl Data tarafından hem açık kaynaklı bir proje (Apache 2.0) hem de ticari bir bulut teklifi olarak sürdürülmektedir. Bu listedeki en aktif şekilde geliştirilen araçtır ve açık ara farkla: dünya genelinde 3.000'den fazla kuruluş DataHub'ı üretim ortamında çalıştırmaktadır; bunlar arasında hiper ölçekli teknoloji şirketleri, düzenlenmiş finans kurumları ve sağlık hizmeti sağlayıcıları bulunmaktadır.

DataHub'ın hassas veri keşfi için gerçekte ne yaptığı

DataHub bir meta veri kataloğudur, tarayıcı değildir. Yığınınızda hangi veri varlıklarının bulunduğunu, bunların kime ait olduğunu, işlem hatları boyunca nasıl aktıklarını ve kalitelerinin ne olduğunu söyler; ancak OpenDLP'nin yaptığı gibi PII kalıpları için dosya sistemlerini veya veritabanlarını taramaz. Çözdüğü veri keşfi kullanım durumu şudur: "200 veri kaynağımız var ve içlerinde ne olduğunu ya da bunları kimin kullandığını bilmiyoruz." Çözmediği hassas veri keşfi kullanım durumu ise şudur: "Windows uç noktalarımızdaki tüm Sosyal Güvenlik numaralarını içeren dosyaları bulmamız gerekiyor."

Temel özellikler:

  • Sütun düzeyinde veri kökeni: Platformlar arasında kaynaktan tüketime veri akışını izler. 2026'daki yeni destek, Snowflake dinamik tabloları, kaynak ambarlara geri dikilen Sigma, Glue ve Iceberg, ham S3 yolları yerine kataloğa Athena eşlemesi ve Microsoft'un resmi M-Query ayrıştırıcısı aracılığıyla Power BI'ı içerir.
  • 90'dan fazla yerel bağlayıcı: Snowflake, BigQuery, Redshift, Hive, Athena, Postgres, MySQL, SQL Server, Looker, Power BI, Tableau, Okta, LDAP, S3, Delta Lake ve diğerleri. 2026'nın ikinci çeyreğinde gönderilen yeni bağlayıcılar arasında Airbyte, Matillion, dltHub, Informatica ve ThoughtSpot bulunmaktadır. Geliştirilmekte olanlar: Monte Carlo, SAP Datasphere, AWS QuickSight ve Firehose ile Kinesis için akış bağlayıcıları.
  • MCP sunucu desteği: MCP, LLM entegrasyonları ve bağlam yönetimi aracılığıyla yapay zeka ajanları için yerel destek; yani yapay zeka asistanları araç değiştirmeden doğrudan DataHub meta verilerini sorgulayabilir.
  • Google Cloud derinleştirilmiş entegrasyonu (Nisan 2026): DataHub, Google Cloud Knowledge Catalog bağlayıcısını BigQuery ve Google Cloud Storage'ın yanı sıra Gemini Enterprise Agent Platform, Bigtable, Spanner, Pub/Sub ve Dataproc Metastore'u destekleyecek şekilde genişletti.

Dikkate alınması gerekenler: DataHub'ın mimarisi, birbirine bağlı birkaç hizmet çalıştırır. Üretim dağıtımları genellikle Kubernetes gerektirir. Kurulum karmaşıklığı, toplulukta en sık dile getirilen sıkıntı noktasıdır ve yapay zeka özelliklerinin eklenmesiyle daha da basitleşmemiştir. Ekibinizin Kubernetes deneyimi yoksa, üretim dağıtımına başlamadan önce öğrenme eğrisi için zaman ayırın.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Apache – Atlas

Apache Atlas, öncelikle Hadoop ve büyük veri ekosistemleri için tasarlanmış açık kaynaklı bir meta veri yönetimi ve yönetişim platformudur. Hive, HBase, Kafka, Spark, Sqoop ve Storm üzerine inşa edilmiş ortamlarda veri varlıkları arasında sınıflandırma, köken takibi ve aramayı destekler.

Temel özellikler

  • Dinamik sınıflandırma: Atlas, PII, EXPIRES_ON, DATA_QUALITY ve SENSITIVE gibi özel sınıflandırmalar oluşturulmasına olanak tanır. Bunlar varlık veya öznitelik düzeyinde uygulanabilir; bu da ayrı bir katalog oluşturmadan Hive tablolarındaki hassas sütunları etiketlemek için kullanışlıdır.
  • Meta veri türleri: Platform, HBase, Hive, Sqoop, Kafka ve Storm'u kapsayan Hadoop ve Hadoop dışı ortamlar için önceden tanımlanmış meta veri türleri sağlar.
  • SQL benzeri sorgu dili (DSL): Atlas, varlıkları aramak için SQL benzeri sorgu işlevselliği sağlayan alana özgü bir dili destekler. Yeni bir sözdizimi öğrenmeden meta veri kataloğunu sorgulaması gereken SQL'e aşina analistler için kullanışlıdır.
  • Harici araçlarla entegrasyon: Apache Hive, Apache Spark, Kafka ve Presto, bu da onu büyük veri ortamları için uygun hale getirir.

Dikkate alınması gerekenler:

  • Atlas'ı çoklu bulut ortamında yapılandırmak, özellikle AWS, Azure ve Databricks API'lerini köprülemek karmaşıktır. Atlas'ın bu platformlar için yerel bağlayıcıları yoktur; AWS Redshift veya Azure Synapse'ten köken kaydetmek için ek yapılandırma gerekir.
  • Bulut yerel kataloglama hizmetleri (örn. AWS Glue), halihazırda tek bir bulut sağlayıcısına bağlı kalmış ekipler için daha düşük ek yük ile köken takibi sunabilir.
  • Atlas, Hadoop, Spark ve Hive'ı ölçekli olarak çalıştıran kuruluşlar için en uygunudur. Hadoop merkezli bir yığını olmayan ekipler, mimarisinin gereksiz karmaşıklık kattığını görecektir.

Marquez

Marquez, veri ekosistemi meta verilerini toplamak, birleştirmek ve görselleştirmek için açık kaynaklı bir meta veri hizmetidir. WeWork'te oluşturulmuş ve 2019'da açık kaynak olarak yayınlanmıştır. Marquez, Eylül 2023'te mezun olarak LF YZ & Data Foundation'ın mezuniyet aşamasındaki bir projesidir.

Marquez'in gerçekte ne yaptığı

Marquez, keşiften ziyade tamamen köken takibine odaklanır. İşlem hatlarının köken meta verilerini nasıl raporladığına dair açık spesifikasyon olan OpenLineage standardının referans uygulamasıdır. Apache Airflow, Apache Spark, Apache Flink, dbt veya Dagster kullanıyorsanız, bu araçlar Marquez'in topladığı ve görselleştirdiği OpenLineage olaylarını yayınlayabilir. Sonuç, veri kümelerinin işlem hatlarınızda nasıl aktığını, bunları hangi işlerin ürettiğini ve çalışmaların geçmişte nasıl göründüğünü gösteren bir köken grafiğidir.

Bu, Marquez'i şunlar için kullanışlı kılar: bir üst akış veri kümesi değiştiğinde neyin bozulduğunu anlamak, veri kökenini izleyerek işlem hattı hatalarında hata ayıklamak ve bir veri kümesini kullanımdan kaldırmadan önce hangi işlerin onu tükettiğini bilmek. Uç noktaları PII için taramaya yönelik bir araç değildir.

Topluluk etkinliği notu

2026'nın başı itibarıyla, Marquez'in GitHub'ındaki Mayıs 2025'e kadar uzanan açık sorunlar yanıtsız kalmaya devam etmektedir. Commit hızı, DataHub ve OpenMetadata'ye kıyasla yavaşlamıştır. Hızlı hareket eden ve duyarlı bakımcıları olan bir kataloğa ihtiyacınız varsa, Marquez daha yavaş seçenektir. DataHub'ın altyapı ek yükü olmadan OpenLineage standardını uygulayan istikrarlı, hafif bir köken deposuna ihtiyacınız varsa, Marquez bu işi hâlâ iyi yapmaktadır.

Temel özellikler:

  • OpenLineage referans uygulaması: Her OpenLineage entegrasyonuyla kutudan çıktığı gibi çalışır. Bu, Marquez'in en güçlü ayırt edici özelliğidir: bu listedeki başka hiçbir araç, köken standardının kanonik uygulaması değildir.
  • Köken grafiği görselleştirmesi: Web arayüzü, veri kümelerinin iş akışları aracılığıyla nasıl bağlandığına ve dönüştürüldüğüne dair etkileşimli bir görünüm sağlar. İşlem hattı bağımlılıklarını anlamak ve hataları izlemek için kullanışlıdır.
  • REST API'si ve GraphQL: Köken API'si, bağımlılık ağacını programatik olarak gezinerek geri doldurma ve kök neden analizi gibi görevlerin otomatikleştirilmesine olanak tanır. GraphQL uç noktası şu anda beta aşamasındadır.
  • Düşük altyapı ek yükü: Marquez, DataHub veya Atlas'ın aksine PostgreSQL üzerinde çalışır ve Kafka, Elasticsearch veya bir grafik veritabanı gerektirmez. Karmaşık bir yığın olmadan köken takibi isteyen ekipler için bu basitlik asıl noktadır.

Örnek iş akışı: Köken meta verilerini incelemek için Marquez arayüzüne gidin ve arama kutusunu kullanarak bir iş arayın (örn. etl_delivery_7_days). İşin çıktı veri kümesinden, veri kümesi adını, şemasını, açıklamasını ve üst akış girdilerini görüntüleyebilirsiniz. Köken grafiği, o veri kümesine beslenen veya ona bağımlı olan her şeyi gösterir.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Piiano Vault – ReDiscovery

Piiano Vault, hassas kişisel verileri kendi bulut ortamınızda depolamak ve güvence altına almak için bir gizlilik kasasıdır. Bir veri keşif tarayıcısı değildir; bu ayrım, ne yaptığını açıklamadan önce açıkça belirtmeye değecek kadar önemlidir.

Vault'un çözdüğü kullanım durumu şudur: "hangi alanların hassas olduğunu biliyoruz (kredi kartı numaraları, SSN'ler, isimler, e-postalar, telefon numaraları) ve bunları uygulama veritabanlarımızdan çıkarıp merkezi, erişim kontrollü bir depoya taşımak istiyoruz." Vault, bu alanlar için yetkili depo haline gelir. Uygulama veritabanı bir token veya referans tutar; asıl değer Vault'ta bulunur. Bu bir veri koruma mimarisi desenidir, bir keşif aracı değildir.

Vault, Docker veya Kubernetes (Helm çizelgeleri mevcuttur) aracılığıyla dağıtılır. Python (Django ORM), TypeScript, Java ve Go için SDK'lar mevcuttur. vault-releases deposu en son Ağustos 2025'te güncellenmiştir.

Nightfall

Nightfall, ticari bir yapay zeka yerel DLP platformudur. GitHub depoları, Nightfall'ın ticari tespit API'sini saran açık kaynaklı tarayıcı betiklerini (Apache 2.0) içerir. Bu ayrım, "açık kaynak" çerçevesi için önemlidir: tarayıcı betikleri açık kaynaktır, ancak PII, kimlik bilgileri ve ödeme verilerini gerçekten tanımlayan tespit motoru, Nightfall'ın tescilli hizmetidir. Taramaları yürütmek bir Nightfall API anahtarı gerektirir ve Nightfall'ın ticari API'sini çağırır. Ücretsiz katman, genel ve özel depolarda ayda 100 taramaya kadar izin verir.

Bu, modern ortamlarda hassas verileri tespit etmek için bu listedeki en yetenekli araçtır. Nightfall, GitHub depolarını, S3 kovalarını, Salesforce dışa aktarımlarını ve benzer kaynakları kapsar, ancak tamamen açık kaynak değildir. Gereksiniminiz ticari bir satıcıya sıfır bağımlılık ise, Nightfall bunu karşılamaz.

Açık kaynak tarayıcı yetenekleri (ücretsiz katman):

  • Genel ve özel depoların tam commit geçmişini tarar.
  • Nightfall'ın makine öğrenimi tespit modellerini kullanarak kimlik bilgilerini, sırları, PII'yi ve kredi kartı numaralarını tespit eder.
  • Ücretsiz olarak ayda 100 taramaya kadar çalıştırır.
  • İhlaller tespit edildiğinde Slack'e uyarılar gönderir.
  • Sonuçları bir SIEM'e, raporlama aracına veya webhook uç noktasına iletir.

Ayırt edici özellik: Nightfall, ihlaller tespit edildiğinde Slack'e uyarılar gönderebilir ve sonuçları bir SIEM'e, raporlama aracına veya webhook uç noktasına iletebilir.

Örnek kullanım durumu: Durağan haldeki hassas verileri tespit etmek için bir Salesforce yedeğini tarayın. Tarayıcı (1) yedekleme dosyalarını tarama için Nightfall'ın API'sine gönderir, (2) sonuçları almak için yerel bir webhook sunucusu çalıştırır ve (3) bulguları bir CSV dosyasına aktarır.

Daha fazla okuma

Bu araştırmayı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Sena Sezer (2026) - "En İyi 6 Açık Kaynak Hassas Veri Keşif Aracı ". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 24 Haziran 2026, kaynak: https://aimultiple.com/open-source-sensitive-data-discovery [Çevrimiçi Kaynak]

Dilmegani, C., & Sezer, S. (2026, 24 Haziran). En İyi 6 Açık Kaynak Hassas Veri Keşif Aracı . AIMultiple. https://aimultiple.com/open-source-sensitive-data-discovery

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Sezer, Sena},
  title  = {{En İyi 6 Açık Kaynak Hassas Veri Keşif Aracı }},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/open-source-sensitive-data-discovery}},
  note   = {AIMultiple. Erişim tarihi: 24 Haziran 2026}
}
Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple'da baş analisttir. AIMultiple, her ay Fortune 500'ün %60'ı dahil olmak üzere (similarWeb'e göre) yüz binlerce işletmeyi bilgilendirmektedir.

Cem'in çalışmaları Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır.

Cem, kariyeri boyunca teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yapmıştır. On yıldan fazla bir süre McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yapmıştır. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımlamıştır.

CEO'ya rapor verirken bir telekomünikasyon şirketinin teknoloji stratejisini ve satın alımını yönetmiştir. Ayrıca, 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetmiştir. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alınmıştır.

Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun olmuş ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Araştıran
Sena Sezer
Sena Sezer
Sektör Analisti
Sena, AIMultiple'da sektör analisti olarak çalışmaktadır. Boğaziçi Üniversitesi'nden lisans derecesini almıştır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450