Semantik-sayısal spektrumu, küçük/yüksek semantik tabloları, karma iş dataset'lerini ve büyük düşük semantik sayısal dataset'leri kapsayan 17 tablo dataset'i üzerinde SAP-RPT-1-OSS'i gradyan boosting'e (LightGBM, CatBoost) karşı benchmark ettik.
Amacımız, ilişkisel bir LLM'in önceden eğitilmiş semantik ön bilgilerinin geleneksel ağaç modellerine göre nerede avantaj sağlayabileceğini ve ölçek veya düşük semantik yapı altında nerede zorluklarla karşılaştığını ölçmektir.
SAP-RPT-1-OSS vs. Gradyan Boosting: Benchmark sonuçları
- Başarı Oranı: Ortalama normalize edilmiş skoru (0.0 ila 1.0) temsil eder. Daha yüksek bir çubuk, modelin o kategorideki dataset'ler için mümkün olan en iyi performansa tutarlı bir şekilde daha yakın olduğunu gösterir.
- 100 – 500 satır (3 Dataset):
- Dahil edilenler: wine (178), sonar (208), vote (435).
- Sonuç: SAP, 3 dataset'in 2'sinde en iyi performansı gösterir. Wine ve sonar'da en yüksek skorları elde ederek, eğitim verisi kıt olduğunda LLM ön bilgilerinin faydalı olabileceğini düşündürür. Ancak, CatBoost vote dataset'inde (%0,1 içinde) dar bir zafer elde ederek, ağaç modellerinin küçük ölçeklerde bile oldukça rekabetçi kaldığını gösterir.
- 501 – 1.000 satır (3 Dataset):
- Dahil edilenler: cylinder_bands (540), breast_cancer (569), credit_g (1.000).
- Sonuç: SAP, 3 dataset'in tamamında en iyi performansı gösterir. Cylinder_bands'te SAP, LightGBM'i %5,5 farkla geride bırakarak, endüstriyel kusurların semantik açıklamalarını daha iyi işlemesinden kaynaklanabileceğini gösterir; ancak bu mekanizmayı doğrulamak için daha fazla ablasyon çalışması gerekecektir.
- 1.000 – 10.000 satır (5 Dataset):
- Dahil edilenler: titanic (1,3K), car_evaluation (1,7K), spambase (4,6K), compas (5,2K), employee_salaries (9,2K).
- Sonuç: SAP, 5 dataset'in 4'ünde en iyi sonuçları elde eder ve özellikle spambase ve titanic gibi metin ağırlıklı görevlerde iyi performans gösterir. Ancak, CatBoost compas'ta SAP'yi %10,4 farkla önemli ölçüde geride bırakarak, bu boyut aralığında bile ağaç modellerini destekleyen dataset'e özgü özellikleri gösterir.
- 10.000+ satır (6 Dataset):
- Dahil edilenler: california_housing (20K), house_sales (21K), default_credit (30K), adult_income (48K), diamonds (53K), higgs_100k (98K).
- Sonuç: Veri hacmi büyüdükçe, LLM'in potansiyel "ön bilgi" avantajı azalır. LightGBM ve CatBoost, 6 dataset'in 5'inde en iyi sonuçları elde ederek, hesaplama maliyetinin çok daha düşük bir kısmıyla daha iyi doğruluk sunar. Tek istisna olan california_housing, SAP için mütevazı bir %1,7 avantaj gösterir.
1. Benchmark sonuçları dataset'leri tablosu
Aşağıda, tüm 17 dataset'teki model performansının eksiksiz dökümü yer almaktadır.
2. Maliyet ve verimlilik analizi
RunPod H200 örnek fiyatlandırması olan $3,59/saat baz alınarak her model için doğrudan hesaplama maliyetini hesapladık.
SAP-RPT-1-OSS, metin embedding ön işlemesi ve LLM mimarisinin ağır bellek yükü nedeniyle gereken süre dolayısıyla önemli ölçüde daha yüksek maliyetlere yol açar. Buna karşılık, LightGBM ve CatBoost bu donanımda görevleri neredeyse anında tamamlar. Aşağıdaki maliyetler, 3 katlı çapraz doğrulama çalıştırması için toplam duvar saati süresini (ön işleme + eğitim) yansıtmaktadır.
Dataset başına ortalama maliyet (17 Dataset Ortalaması)
Dataset boyutuna göre maliyet dökümü
- Küçük Dataset'ler (<1K satır): SAP nispeten ucuzdur (≈ $0,03 çalıştırma başına). Buradaki yüksek kazanma oranı maliyeti ihmal edilebilir kılar.
- Büyük Dataset'ler (>20K satır): SAP pahalı hale gelir.
- Örnek: adult_income (48k satır) üzerinde eğitim, 3 kat için toplam ≈12 dakika sürer.
- Maliyet: 12 dk X $0,06/dk = $0,72 deney başına.
- Karşılaştırma: LightGBM aynı görevi $0,01 karşılığında tamamlar.
Sonuç: Dataset başına $0,22 mutlak anlamda pahalı olmasa da, SAP referansa göre 22x daha pahalıdır. Bu maliyet farkı, SAP'nin anlamlı doğruluk iyileştirmeleri gösterdiği küçük, semantik açıdan zengin dataset'ler için (ör. cylinder_bands +%5,5 artışla) gerekçelendirilebilir, ancak ağaç modellerinin çok daha düşük maliyetle eşit veya daha iyi performans elde ettiği büyük dataset'ler için gerekçelendirilmesi zorlaşır.
3. Analiz çerçevesi: Semantik Spektrum
Bu sonuçları yorumlamak için verileri nasıl seçtiğimizi anlamak çok önemlidir. Dataset'leri rastgele seçmedik; Semantik-Sayısal Spektrumu kapsayacak şekilde özel olarak seçilmiş 17 dataset'ten oluşan bir paket oluşturduk.
Temel hipotezimiz, SAP'nin (LLM tabanlı olarak) verilerin dilsel anlam taşıdığı yerlerde üstün geleceği, Ağaç modellerinin ise ham sayısal hesaplamada baskın olacağıydı. Dataset'lerimizi üç ayrı kümeye ayırdık:
Küme A: Yüksek semantik dataset'ler (6 dataset)
Özellikler: Özellikler zengin metin açıklamaları, gerçek dünya anlamı taşıyan kategorik etiketler (ör. "hekim ücret dondurması") veya alana özgü terminoloji içerir.
- Dataset'ler:
- cylinder_bands: Endüstriyel baskı kusurları.
- titanic: Yolcu adları ve unvanları.
- vote: Kongre oylama kayıtları (Politikalarda kategorik "Evet/Hayır").
- breast_cancer: Tıbbi tümör açıklamaları.
- spambase: E-posta kelime frekansları.
- wine: Kimyasal kökenler.
Küme B: Karma iş verileri (6 dataset)
Özellikler: Çoğu kurumsal veritabanında bulunan standart tablo formatı; sayısal değerler (maaş, yaş) ve kategorik dizelerin (iş unvanı, ırk, departman) bir karışımı.
- Dataset'ler:
- employee_salaries: İş unvanları ve maaş.
- compas: Sabıka geçmişi ve demografik bilgiler (Hassas öznitelikler).
- adult_income: Nüfus sayımı demografisi.
- credit_g: Alman kredi risk profilleri.
- default_credit: Tayvan kredi temerrüt verileri.
- car_evaluation: Araç satın alma parametreleri.
Küme C: Düşük semantik/saf sayısal veriler (5 dataset)
Özellikler: Özellikler soyut ölçümler, sensör okumaları veya fizik koordinatlarıdır. Sütun adları genellikle önemli değildir; matematiksel ilişkiler önemlidir.
- Dataset'ler:
- higgs_100k: Fizik parçacık kinematiği.
- diamonds: Fiziksel boyutlar ve fiyat.
- sonar: Frekans enerji yansımaları.
- california_housing: Enlem/Boylam koordinatları ve nüfus sayımı istatistikleri.
- house_sales: King County gayrimenkul (çoğunlukla sayısal özellikler).
4. Derinlemesine inceleme: SAP'nin kazandığı ve başarısız olduğu yerler
Analiz çerçevesini sonuçlarımıza uygulamak dört farklı performans deseni ortaya çıkarır. Aşağıdaki tablo, SAP'nin tam olarak nerede üstün olduğunu ve nerede başarısız olduğunu özetlemektedir.
İlişkisel temel modellerin kavramsal temelleri
İlişkisel bir temel modelin ana hedefi, yapılandırılmış tablolar üzerinde doğru tahminler yapmak ve çeşitli görevleri yerine getirmektir. Bu modeller, bilginin farklı tablolarda nasıl temsil edildiğini, varlıkların ilişkiler aracılığıyla nasıl bağlandığını ve zamansal bilgilerin sonuçları nasıl etkilediğini anlamalıdır.
Bu tür modellerin temel yetenekleri şunlardır:
- Şema genellemesi: Sıfırdan yeniden eğitmeden yeni ilişkisel şemalara uyum sağlama yeteneği.
- Birleşik girdi temsili: Sayısal, kategorik ve metinsel özellikler gibi farklı sütun türlerini işleme.
- Zamansal ve yapısal bağlamın entegrasyonu: Zaman içindeki ve birincil/yabancı anahtarlarla bağlı varlıklar arasındaki bağımlılıkları yakalama.
- Aktarılabilirlik: Ön eğitim ve sıfır atışlı öğrenme yoluyla yeni dataset'lerde tahmin görevleri gerçekleştirme.
Griffin
Griffin, birleşik bir ilişkisel temel model oluşturmaya yönelik ilk büyük ölçekli girişimlerden biridir. İlişkisel verileri, her satırın bir düğüm haline geldiği ve kenarların yabancı anahtar ilişkilerine karşılık geldiği zamansal, heterojen bir grafik olarak temsil eder. Temel özellikler şunlardır:
Birleşik özellik kodlayıcı
- Kategorik ve metin özellikleri önceden eğitilmiş bir metin kodlayıcı ile kodlanırken, sayısal değerler öğrenilmiş bir float kodlayıcı kullanır.
- Tablo adları, sütun adları ve kenar türleri gibi meta veriler, modelin ilişkisel şemayı tanımasına yardımcı olmak için gömülür.
- Görev embedding'leri, tek bir modelin paylaşılan kod çözücülerle regresyon ve sınıflandırma görevlerini gerçekleştirmesini sağlar.
Mesaj iletimi ve dikkat
Griffin, mesaj iletimli sinir ağlarını bir çapraz dikkat modülü ile entegre eder. Mesaj iletim bileşeni, ilişkiler içinde ve arasında bilgi toplarken, çapraz dikkat her satırdaki ilgili hücrelere odaklanır. Bu tasarım, modelin çeşitli verileri işlemesine ve bağlı varlıklar arasındaki bağlamı korumasına yardımcı olur.
Ön eğitim ve ince ayar
Model, maskelenmiş hücre tamamlama görevi aracılığıyla tek tablolu dataset'ler üzerinde önceden eğitilir ve ardından belirli görevler için ilişkisel veritabanlarında ince ayar yapılır. Büyük ilişkisel benchmark'lar üzerindeki deneyler, Griffin'in hem doğruluk hem de transfer öğrenme verimliliğinde geleneksel GNN referanslarından ve tek tablo modellerinden daha iyi performans gösterdiğini göstermektedir.
Şekil 1: Griffin Model Çerçevesini gösteren grafik.1
İlişkisel Transformer
Griffin grafik toplamaya odaklanırken, İlişkisel Transformer (RT) transformer mimarilerini doğrudan ilişkisel veritabanlarına uygular. Her hücreyi, değeri, sütun adı ve tablo adı ile zenginleştirilmiş bir token olarak ele alır.
Girdi temsili
Her token şunları birleştirir:
- Veri türüne (sayısal, metin veya tarih/saat) bağlı bir değer embedding'i.
- Tablo ve sütun metninden oluşturulan bir şema embedding'i.
- Ön eğitim sırasında değer gizlendiğinde kullanılan bir maske token'ı.
Bu yapı, RT'nin farklı şemalara sahip ilişkisel veritabanlarını tutarlı bir girdi formatını korurken işlemesini sağlar.
İlişkisel dikkat
RT, hücre düzeyinde çalışan bir ilişkisel dikkat mekanizması sunar. Şunları içerir:
- Sütun dikkati: Sütunlar içindeki değer dağılımlarını öğrenmek için.
- Özellik dikkati: Aynı satır veya bağlı üst satırlar içindeki öznitelikleri birleştirmek için.
- Komşu dikkati: Bağlı alt satırlardan bilgi toplamak için.
Together, bu dikkat katmanları satırlar, sütunlar ve tablolar arasındaki bağımlılıkları modelleyen bir ilişkisel grafik transformer'ı oluşturur.
Eğitim ve transfer sonuçları
RT, RelBench'ten ilişkisel veritabanları üzerinde önceden eğitilmiştir. Deneylerde, önceden eğitilmiş model sıfır atış ayarlarında tam denetimli modellerin performansının %94'üne kadar ulaşmıştır. Ayrıca ince ayar sırasında daha hızlı öğrenmiş ve yüksek doğruluğa ulaşmak için daha az eğitim adımı gerektirmiştir.2
Bu yaklaşım, ilişkisel veritabanlarının alanlar arasında aktarılabilir desenler paylaştığını ve hücre düzeyinde tokenleştirmenin yapılandırılmış veriler üzerinde tahmin görevleri için pratik bir temel sağladığını göstermektedir.
RelBench
RelBench, birden çok ilişkili tabloya dağıtılmış verilerden uçtan uca öğrenmeye odaklanan ilişkisel derin öğrenmeyi ilerletmek için tasarlanmıştır.
İlişkisel veritabanları endüstri ve bilimde baskın veri yönetim sistemi olmaya devam ettiğinden, RelBench manuel özellik düzleştirmeye güvenmek yerine doğrudan ilişkisel yapılar üzerinde çalışan modelleri değerlendirmek için standartlaştırılmış ve tekrarlanabilir bir çerçeve sağlar.
RelBench'in önceki sürümleri, sağlık hizmetleri, sosyal ağlar, e-ticaret ve spor gibi alanları kapsayan 11 ilişkisel veritabanı ve hem zorlayıcı hem de alanla ilgili olacak şekilde tasarlanmış 70 tahmin görevi sunmuştur.3
Ocak 2026'da RelBench v2 yayınlandı; dört yeni veritabanı (SALT, RateBeer, arXiv ve MIMIC-IV) ve bir modelin ilişkisel bir veritabanındaki mevcut sütunları tahmin etme yeteneğini değerlendiren yeni bir Otomatik Tamamlama görev sınıfı da dahil olmak üzere 40 ek tahmin görevi eklendi.
Sürüm ayrıca CTU entegrasyonu aracılığıyla veri erişimini genişleterek ReDeLEx aracılığıyla 70'ten fazla ilişkisel dataset'e erişim sağladı; doğrudan SQL veritabanı bağlantısı ekledi; ve 4DBInfer deposundan yedi dataset'i RelBench formatında dahil etti.
Dataset'lerin ve görevlerin ötesinde RelBench, PyTorch Geometric'i grafik oluşturma ve PyTorch Frame'i tablo modellemesi için kullanan, grafik sinir ağlarına dayalı ilişkisel derin öğrenme için açık kaynaklı bir referans uygulaması ve ilerlemeyi takip etmek için herkese açık bir liderlik tablosu sunar.
v2 sürümü ayrıca isteğe bağlı zamana göre sansürlenmiş etiketler, bağlantı tahmininde NDCG metriği desteği, daha hızlı cümle embedding üretimi ve yapılandırılabilir önbellek yönetimi dahil olmak üzere birden çok kullanılabilirlik ve performans iyileştirmesi getirmiştir.4
VIEIRA
VIEIRA, tek bir tahmin motoru oluşturmak yerine temel modellerle programlamaya odaklanarak farklı bir yaklaşım benimser. SCALLOP olasılıksal mantık derleyicisini, büyük dil modellerini, görü modellerini ve diğer önceden eğitilmiş bileşenleri yabancı yüklemler olarak entegre eden bildirimsel bir dil ile genişletir.5
İlişkisel paradigma
VIEIRA'da temel modeller, ilişkisel girdileri ve çıktıları olan durumsuz fonksiyonlar olarak ele alınır. Bu, GPT, CLIP veya SAM gibi modellerin mantıksal kurallara göre oluşturulmasını sağlar. Örneğin:
- Bir program, metinden bilgi çıkarmak ve bunu yapılandırılmış ilişkiler olarak depolamak için GPT'yi kullanabilir.
- CLIP görüntüleri sınıflandırabilir ve bunları bir tablodaki metin etiketlerine bağlayabilir.
Uygulamalar
Çerçeve şunları destekler:
- GPT kullanarak tarih ve matematik akıl yürütme.
- Metin çıkarma ve mantıksal çıkarım kullanarak akrabalık akıl yürütme.
- Geri getirme ve akıl yürütmeyi birleştiren soru cevaplama.
- Çok modlu kompozisyon yoluyla görsel soru cevaplama ve görüntü düzenleme.
Sembolik mantık ve sinirsel çıkarımı birleştirerek VIEIRA, veri analistlerinin ve geliştiricilerin yapılandırılmış veriler ve görüntüler üzerinde tahmin sorgularını yanıtlamak için önceden eğitilmiş temel modelleri kullanan yorumlanabilir sistemler oluşturmasına olanak tanır.
Vaka çalışmaları
SAP Hana Cloud
SAP HANA Cloud, işlemleri, analitiği ve yapay zekayı birleştiren kurumsal uygulamalar için birleşik bir veri temeli olarak hareket etmek üzere tasarlanmış, bulut tabanlı, tamamen yönetilen bir hizmet olarak veritabanıdır. Tek amaçlı bir ilişkisel veritabanı olarak hizmet vermek yerine SAP HANA Cloud, kuruluşların operasyonel iş verileri üzerinde "akıllı veri uygulamaları" oluşturmasını sağlayan çok modelli bir platform olarak konumlandırılmıştır.
SAP HANA Cloud, farklı performans ve maliyet gereksinimlerini desteklemek için bellek içi işlemeyi disk tabanlı depolama ve veri gölü entegrasyonu ile birleştirir. Bu esnek tasarım, veri hacimleri ve kullanım dalgalandıkça dinamik olarak ölçeklenirken gerçek zamanlı iş yüklerini destekler.
Kilit bir farklılaştırıcı, tek bir veritabanı içinde ilişkisel, JSON/belge, grafik, uzamsal ve vektör verilerini destekleyen yerel çok modlu motorudur. Bu, uygulamaların SQL sorgularını, grafik ilişkilerini ve vektör benzerlik aramasını verileri ayrı sistemler arasında taşımadan birleştirmesini sağlar, böylece mimariyi basitleştirir ve gecikmeyi azaltır.
SAP Business Technology Platform'un bir parçası olarak SAP HANA Cloud, replikasyon olmadan canlı erişim de dahil olmak üzere SAP ve SAP dışı veri kaynaklarıyla doğrudan entegre olur ve varsayılan olarak kurumsal düzeyde güvenlik, kullanılabilirlik ve uyumluluk sağlar.
Genel olarak SAP HANA Cloud, ilişkisel veritabanının analitik, çok modelli veri ve kurumsal yapay zeka uygulamaları için temel katman olarak hizmet verdiği, ilişkisel merkezli, yapay zeka yerel bir veri platformudur.
Şekil 2: Hana'nın birleşik veritabanını ve
çok modelli veri işlemeyi gösteren görüntü.6
SAP'nin sap-rpt-1'i
sap-rpt-1, bağlam içi öğrenme yoluyla çok çeşitli tahmin görevlerini yerine getiren tek bir ilişkisel temel model sunar. Her kullanım durumu için yeni bir modeli yeniden eğitmek yerine, kullanıcılar hedef desenlerinin birkaç örneğini sağlar; örneğin "zamanında ödeme yapan müşteriler" ve "geç ödeme yapan müşteriler." Model daha sonra deseni tanır ve yeni veriler için hemen doğru tahminler üretir.
Model, satırlar ve sütunlar arasındaki ilişkileri yakalayan iki boyutlu bir dikkat mekanizması ile tasarlanmıştır ve aynı zamanda tablo ve sütun adları gibi meta verileri vektör embedding'lerine gömer. Bu tasarım, ilişkisel şemaların semantiğini ve iş tablolarındaki zamansal bilgileri anlamasını sağlar.
SAP'nin yaklaşımı, veri analistleri ve iş kullanıcıları için çeşitli avantajlar getirir:
- Birden çok tablo ve alanda çalışan tek bir model.
- Tekrarlanan ince ayar veya özel geliştirme ihtiyacı yok.
- Haftalar yerine dakikalar içinde tahmine dayalı içgörülere erişim.
- Mevcut veri ambarları ve SAP sistemleriyle entegrasyon.
sap-rpt-1'i SAP ekosistemi içine gömerek, iş uzmanları kendi verileriyle doğrudan etkileşime girebilir ve sezgisel arayüzler aracılığıyla tahminler alabilir. Sonuç, manuel özellik mühendisliği olmadan yapılandırılmış verilerden eyleme dönüştürülebilir kararlara giden daha hızlı bir yoldur.
Şekil 3: SAP alanlarında sap-rpt-1-large'ın dar yapay zeka referanslarına karşı hata azaltma faktörü.
2025 sonu itibarıyla SAP, SAP-RPT-1'in SAP YZ Foundation (SAP YZ Core) içindeki üretken yapay zeka hub'ı aracılığıyla kullanılabilir olduğunu doğruladı.
Model iki üretim varyantında sunulmaktadır:
- Düşük gecikme süresi ve yüksek verimli tahminler için optimize edilmiş SAP-RPT-1-small,
- Tahmin doğruluğuna öncelik vermek üzere tasarlanmış SAP-RPT-1-large.
Bu sürüm, SAP-RPT-1'in yalnızca araştırma amaçlı bir yetenek yerine SAP'nin kurumsal yapay zeka yığını içinde dağıtılabilir bir temel model olarak rolünü resmileştirir.
Ayrıca SAP, kullanıcıların kendi verilerini veya SAP tarafından sağlanan örnek verileri kullanarak bağlam içi öğrenmeyi test edebilecekleri kodsuz, web tabanlı bir ortam olan SAP-RPT Playground'u sunar.
SAP-ABAP-1
SAP-ABAP-1, SAP müşterileri ve iş ortakları için yapay zeka tabanlı geliştirici üretkenliği kullanım durumlarını desteklemek üzere tasarlanmış bir temel modeldir.
SAP'nin üretken yapay zeka hub'ı aracılığıyla kullanılabilir ve 250 milyondan fazla satır ABAP kodu, 30 milyon satır CDS kodu ve kapsamlı teknik dokümantasyon üzerinde eğitilmiştir. Model, ABAP kodunu anlamak ve açıklamak, en iyi uygulamaları ortaya çıkarmak ve güncel SAP geliştirme bilgisine erişim sağlamak için optimize edilmiştir.
SAP, üretken yapay zeka hub'ı aracılığıyla SAP-ABAP-1'e ücretsiz deneme erişimi sunar ve 2026'da yayınlanması planlanan ek yetenekler bulunmaktadır.7
Kumo.YZ'nin KumoRFM'i: tahmine dayalı analitik için ilişkisel grafik transformer
Stanford profesörü Jure Leskovec tarafından kurulan Kumo.YZ, ilişkisel veritabanlarını ve veri ambarlarını analiz etmek için ilişkisel bir grafik transformer kullanan ilişkisel bir temel model olan KumoRFM'i oluşturdu. İlişkisel verileri, her varlığın bir düğüm olduğu ve birincil ve yabancı anahtarların tablolar arasında kenarlar oluşturduğu zamansal, heterojen bir grafik olarak temsil eder.
Bu grafik tabanlı yaklaşım, KumoRFM'in birden çok tablodan aynı anda öğrenmesini ve yeni ilişkisel şemalara uyum sağlamasını sağlar. Model, çeşitli veri kaynakları üzerinde önceden eğitilmiştir ve her tahmin görevi için ayrı modeller oluşturmadan yeni dataset'lere genelleme yapabilir.
KumoRFM, kullanıcı uzmanlığına bağlı olarak farklı arayüzler aracılığıyla kullanılabilir:
- PQL (Predictive Query Language): Yapılandırılmış veriler üzerinde tahmin sorguları tanımlamak için özel bir sorgulama dili.
- Doğal dil arayüzü: Teknik olmayan kullanıcılar için doğal dil girdileri otomatik olarak PQL sorgularına çevrilir.
- Python SDK: Geliştiricilerin modeli kurumsal yapay zeka pipeline'larına ve uygulamalarına entegre etmesini sağlar.
KumoRFM mimarisi, bağlam alt grafikleri ve tahmin alt grafikleri oluşturmak için veritabanını dinamik olarak örnekler. Bu alt grafikler, ilgili varlıklar arasındaki bağımlılıkları ve zamansal bilgileri yakalayan ilişkisel grafik transformer tarafından işlenir. Bağlam içi öğrenme yoluyla model doğru tahminler sağlar ve akıl yürütme sürecini açıklayabilir.
Kumo, kurumsal ortamlara uygun iki dağıtım seçeneği sunar:
- SaaS platformu: Kolay erişim ve ölçeklendirme için Apache Spark üzerine inşa edilmiş bulut tabanlı bir hizmet
- Veri ambarı yerel: Kuruluşların kendi verilerini güvenli ortamlarının dışına taşımadan Snowflake veya Databricks'te kullanmalarını sağlar
Manuel şema tanımı gerektiren geleneksel bilgi grafiklerinin aksine, KumoRFM ilişkisel grafiğini yapılandırılmış kaynaklardan otomatik olarak oluşturur. Bu, onu ilişkilerin, zamansal desenlerin ve gelişen bağlamın güvenilir tahminler için gerekli olduğu eTicaret, finans ve sağlık hizmetleri için çok uygun hale getirir.
KumoRFM'in temel yetenekleri şunlardır:
- Farklı tablolar ve şema yapıları arasında esneklik.
- Çeşitli sütun türleri ve özel tanımlayıcılarla uyumluluk.
- Çıkarım zamanında belirli görevlere uyum sağlama.
- Tahmin görevlerinde yüksek doğruluk ve yorumlanabilirlik.
Şekil 4: Görüntü, İlişkisel Temel Modellerin (RFM'ler) eTicaret, finans ve sağlık hizmetleri gibi birden çok alanda tahminler yapmak, açıklamalar sağlamak ve sonuçları değerlendirmek için nasıl çalıştığını gösterir.8
Benchmark metodolojisi
Benchmark kurulumu ve ortam
CPU'ya bağlı ağaçlar ile GPU hızlandırmalı modeller arasında adil karşılaştırmalar sağlamak için her ikisini de verimli bir şekilde işleyebilen yüksek performanslı bir ortam kullandık.
- Donanım: NVIDIA H200 140GB GPU içeren RunPod örneği.
- Yazılım: Python 3.12 ve tekrarlanabilirlik için sabitlenmiş kütüphaneler:
- scikit-learn 1.5.2, lightgbm 4.5.0, catboost 1.2.7
- torch 2.5.1, pandas 2.2.3, numpy 2.1.3
- sap-rpt-oss (Kaynak: Resmi GitHub)
- Tekrarlanabilirlik: Tüm bölmeler, başlatmalar ve modellerde random_state=42 tutarlı bir şekilde kullanıldı.
Dataset'ler: Semantik spektrum
Modelleri OpenML ve Scikit-Learn'den alınan 17 denetimli öğrenme dataset'i üzerinde değerlendirdik. Rastgele seçim yerine, LLM'lerin özelliklerin ham istatistiklerden ziyade dilsel anlam içerdiği yerlerde üstün olduğu hipotezini test ederek "Semantik-Sayısal Spektrumu" kapsayacak şekilde bu paketi oluşturduk.
Envanter:
- Küçük ve semantik (<1K satır):
- wine (178), sonar (208), vote (435), cylinder_bands (540), breast_cancer (569).
- Orta/karma (1K – 10K satır):
- credit_g (1K), titanic (1,3K), car_evaluation (1,7K), spambase (4,6K), compas (5,2K), employee_salaries (9,2K).
- Büyük/sayısal (10K+ satır):
- california_housing (20K), house_sales (21K), default_credit (30K), adult_income (48K), diamonds (53K), higgs (100K olarak örneklendi).
Kapsanan görevler:
- 11 İkili Sınıflandırma görevi
- 2 Çok Sınıflı Sınıflandırma görevi
- 4 Regresyon görevi
Model yapılandırmaları ve ön işleme
Kapsamlı hiperparametre optimizasyonu yerine güçlü varsayılanları kullanarak gerçekçi bir "uygulayıcı karşılaştırması" hedefledik.
LightGBM ve CatBoost
Hesaplama açısından ağır SAP modeline karşı adil bir karşılaştırma sağlamak için sağlam varsayılan tahminci sayısını artırdık.
- LightGBM: n_estimators=500, learning_rate=0,05, num_leaves=31. CPU üzerinde çalışır (n_jobs=-1).
- CatBoost: iterations=500, learning_rate=0,05, depth=6. GPU üzerinde çalışır (task_type="GPU").
- Ön işleme: Kategorikler için basit Etiket Kodlama; sayısallar için ölçeklendirme yok; eksik değerler için medyan/mod ataması.
SAP-RPT-1-OSS
SAP'yi, ön yapılandırma deneylerimize dayanarak performans ve maliyeti dengeleyecek şekilde yapılandırdık.
- Yapılandırma: max_context_size=4096, bagging=4.
- Not:
- Bağlam: adult_income üzerinde yapılan testler, bağlamı 4096'dan 8192'ye çıkarmanın çalışma süresini üç katına çıkardığını (4 dk'dan 12 dk'ya) ve ihmal edilebilir doğruluk kazancı (0.917 vs 0.917 ROC-AUC) sağladığını gösterdi.
- Bagging: Bagging'i 4'ten 8'e çıkarmak (makalede kullanılan SAP'nin varsayılan ayarı9 ) azalan getiriler sundu.
- Ön işleme: Yok. Ham pandas DataFrame doğrudan iletilir. Model, metin embedding'leri (sentence-transformers/all-MiniLM-L6-v2) kullanarak kodlar.
Değerlendirme protokolü
Çapraz doğrulama stratejisi
Karıştırmalı 3-Katlı Çapraz Doğrulama kullandık.
- SAP'nin yavaş çıkarım sürelerine uyum sağlamak için standart 5-katlıyı 3-katlıya düşürdük (%40 zaman tasarrufu) ve istatistiksel geçerliliği koruduk.
- Bölme: Sınıflandırma için StratifiedKFold; Regresyon için Standart K-Fold.
Metrikler ve tanılamalar
Model performansının bütünsel bir görünümünü yakalamak için basit doğruluğun ötesine geçtik:
- Birincil sıralama metrikleri: ROC-AUC (İkili), Dengeli Doğruluk (Çok Sınıflı), R² (Regresyon).
- İkincil tanılamalar: Kazanımların sınıf dengesizliğinin bir sonucu olmadığından emin olmak için Matthews korelasyon katsayısı (MCC) ve log loss ile regresyon hata kalibrasyonu için MAPE takip ettik.
- Maliyet hesaplaması: RunPod H200 örneğindeki ($3,59/sa) toplam duvar saati süresine (ön işleme + eğitim + çıkarım) dayanmaktadır.
İstatistiksel anlamlılık
Performans farklılıklarının istatistiksel olarak anlamlı mı yoksa rastgele gürültü mü olduğunu belirlemek için ikili model karşılaştırmalarına Wilcoxon işaretli sıra testi (p<0,05) uyguladık.
Sınırlamalar ve iç geçerlilik
Metodolojimizdeki aşağıdaki kısıtlamaları açıkça kabul ediyoruz:
- Standartlaştırılmış yapılandırmalar ve ayarlama: Kapsamlı hiperparametre optimizasyonu (ör. iç içe CV veya Optuna taramaları) yapmak yerine tüm modeller için sabit, güçlü varsayılan yapılandırmalar kullandık. Bu tutarlı bir referans çizgisi sağlarken, Ağaç modellerinin genellikle dataset'e özgü ayarlama ile performans kazanımları gördüğünü ve bunun "Rekabetçi" kümedeki farkları daraltabileceğini belirtmek gerekir.
- Veri ölçeği sınırları: Analizimiz, tipik orta ölçekli kurumsal senaryoları simüle etmek için 100k satırın altındaki dataset'lere odaklandı. Veri hacmi büyüdükçe LLM'in avantajının azaldığını gözlemledik, ancak testleri çıkarım gecikmesi ve maliyetinin muhtemelen birincil kısıtlar haline geleceği milyon satır ölçeklerine genişletmedik.
- Altyapı tekdüzeliği: Tutarlı bir test ortamı sağlamak için tüm modelleri aynı NVIDIA H200 donanımında çalıştırdık. LightGBM ve CatBoost, ticari CPU'lar için yüksek düzeyde optimize edilmiştir; bu nedenle, yalnızca Ağaç modellerine ayrılmış bir üretim ortamında maliyet farkı muhtemelen daha geniş olacaktır.
- Semantiğin ötesinde genelleme: "Semantik Spektrum" hipotezimiz birçok sonucu başarıyla tahmin etti, ancak LLM'in sonar ve california_housing gibi soyut dataset'lerdeki güçlü performansı, dilsel anlayışın ötesinde yeteneklere işaret eder. Bu, modelin aynı zamanda yüksek boyutlu düzenlileştirme desenlerinden de yararlanıyor olabileceğini gösterir; bu olgu, bu ilk çalışmanın kapsamının ötesinde daha fazla araştırmayı gerektirir.
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{ermut2026,
author = {Ermut, Sıla and Sarı, Ekrem},
title = {{İlişkisel Temel Modelleri Karşılaştırma}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/relational-foundation-model}},
note = {AIMultiple. Erişim tarihi: 4 Ağustos 2026}
}



Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.