13 zaman serisi sınıflandırma yöntemini, önceden eğitilmiş zaman serisi temel modellerinden 2019'dan 22 özellikli bir temel modele kadar, donmuş bir protokol altında 33 UCR/UEA veri seti üzerinde karşılaştırdık. Bu, 14.638 kayıtlı yöntem-veri seti-yeniden örnekleme hücresidir; bunların 11.874 kadarı puanlanmıştır.
TSC karşılaştırma sonuçları
Grafik, her birinin tamamladığı 15 tek değişkenli veri setinde 12 yöntemi karşılaştırıyor; her veri seti aynı 5 eğitim/test bölünmesinde çalıştırıldı. Çubuklar ortalama doğruluğa göre sıralanmıştır. Aşağıdaki tablo ayrıca ortalama sırayı, yani bir yöntemin bir veri seti içindeki ortalama konumunu içerir ve aynı 12 yöntemi farklı bir sıraya koyar.
Tek bir kazanan yok. HIVE-COTE 2 ortalama sırada birinci (2.400) ve RocketPFN ortalama doğrulukta birinci (0.905). 5.000 çekimli veri seti bootstrap'ında birincilik HIVE-COTE 2'ye çekimlerin %46.6'sında, RocketPFN'e %45.5'inde ve MultiRocket'a %7.9'unda gider. İki sıralama birbiriyle çelişiyor ve bootstrap neredeyse eşit olarak bölünüyor, bu nedenle ikisinden birini adlandırmak seçilen metriğin bir eseri olur.
Üst grup tabloda göründüğünden daha küçüktür. Wilcoxon-Holm kliği HIVE-COTE 2, RocketPFN, MultiRocket ve Hydra'dır. MiniRocket, Hydra'nın 4.700 ile altı onda bir sıra gerisindedir ve bu klikte değildir: üyelik, sıra numaralarının düştüğü yerden değil, düzeltilmiş ikili testlerden gelir.
Bu panelde dönüşümler 3, 4 ve 5. sıraları alırken, önceden eğitilmiş modeller 6, 7, 8 ve 10. sıraları alır. En yüksek sıralı önceden eğitilmiş model olan MOMENT, 6.633 ile MiniRocket'in neredeyse iki tam sıra gerisindedir.
catch22, 2019'da 22 sabit özellikle yayımlandı ve önceden eğitilmiş bantta yer alarak 8.700 ile Mantis-V2'nin (9.733) önünde ve TiRex'in (8.433) arkasında yer alır. Tam 30 yeniden örnekleme derinliğinde de bu bantta kalır; hem aşağıdaki 18 veri setli panelde 7.222 ile, hem de RocketPFN'i düşüren 27 veri setli sekiz yöntemli bir varyantta.
Sıra ve doğruluk altta da çelişiyor. DTW-1NN ortalama doğrulukta TiCT'den daha kötü (0.756'ye karşı 0.776) ancak ortalama sırada daha iyi (9.900'e karşı 10.200). Hangi metriği raporladığınız, tablonun her iki yarısında da sırayı değiştirir.
Tablonun yalnızca ortası istikrarlıdır. Herhangi bir tek veri setini kaldırmak, 15 vakanın 10'unda sıralamayı değiştirir. Bunların altısı HIVE-COTE 2 ile RocketPFN yer değişimidir; Mantis-V2 ile DTW-1NN altıda, DTW-1NN ile TiCT ikide yer değiştirir. 3. sıradan 9. sıraya kadar olan konumlar asla hareket etmez.
Karşılaştırma metriği doğruluktur çünkü beyan edilen birincil metrik olan ROC-AUC, 7 referans temel modelinden 6'sı için mevcut değildir. Panel yalnızca tek değişkenlidir: TiCT ve RocketPFN'in doğal çok değişkenli desteği yoktur, bu nedenle tam vaka kuralı tüm 10 çok değişkenli veri setini kaldırır. Temel model satırları, bu modelleri tek bir sabit transfer protokolü altında ölçer. TimEE, aşağıda belirtilen nedenle sıra taşımaz. Bootstrap birincilik payı, yeniden örneklenen veri seti koleksiyonları arasında birinci sıralama sıklığıdır, başka bir şey değildir.
Sıralamanın kendisi, HIVE-COTE 2 ve ROCKET ailesinin bu problem sınıfında lider olduğunu tespit eden ve HIVE-COTE 2'nin çok daha yavaş olduğunu raporlayan 2024 bake-off'unu tekrarlar.1 Buradaki katkı, 2026 kadrosunda tek bir ortak protokol altında bağımsız olarak kontrol edilen bir ölçümdür ve ayrışmalar aile bazında düzeltildikten sonra nicelendirilmiştir.
RocketPFN, TabPFN'e beslenen ROCKET özellikleridir,2 önceden eğitilmiş bir zaman serisi temel modeli değil, bağlam içi bir tablo modelidir, bu nedenle önceden eğitilmiş satırların üzerindeki konumu bu sınıf hakkında hiçbir şey söylemez.
Her yöntemin ne sıklıkla birinci olduğu
Her çubuk, bir yöntemin 15 veri setinin 5.000 rastgele yeniden çekiminde (tekrarlara izin verilir) birinci sıralandığı paydır. 12 yöntemin dokuzu asla birinci olmaz ve çizilmez. Yeniden çekimler 1729 tohumunda çalıştırılır. Birincilik, hangi veri setlerinin çekildiğine bağlı olarak değişir ve paylar yöntemlerin ne kadar uzakta olduğu hakkında hiçbir şey söylemez.
Bir Bradley-Terry derecelendirmesi, her yöntemin bir veri setinde diğerini yenme şansını modeller ve önemlilik testlerinin bulamadığı bir kazanan üretemez. HIVE-COTE 2'yi 1384.6, RocketPFN'i 1380.6 ve MultiRocket'ı 1338.3 olarak derecelendirir; her biri yeniden çekimler boyunca birinci ile üçüncü arasında yer alır. 1000 çıpası bu 15 veri setine görelidir ve bir derecelendirme, doğruluk puanları değil, bir veri setini kazanma tahmini olasılığıdır.
Birçok karşılaştırmayı aynı anda çalıştırmak için düzeltilmiş donmuş Wilcoxon-Holm testleri, HIVE-COTE 2, RocketPFN, MultiRocket ve Hydra arasında bir fark tespit etmez. Bu, eşit performans gösterdiklerinin kanıtı değildir. Hydra yeniden çekimlerde dördüncü veya beşinci sırada yer alır, bu da onu ilk üçten ayırmaz. Bu konumlar istikrarı özetler, önemliliği değil. Hiçbir benzersiz kazanan desteklenmez.
Hangi farklar düzeltmeden sağ çıkıyor
On dokuz ikili karşıtlık incelendi ve altısı Holm düzeltmesinden sağ çıktı. Her nokta, araç ipucunda %95 aralığını ve Holm ile düzeltilmiş p değerini taşır; bu aralıklar veri seti bootstrap özetleridir ve çokluk için düzeltilmemiştir, bu nedenle yalnızca p değerleri Holm taşır.
Hayatta kalan her karşıtlık, önceden eğitilmiş bir modeli yenen konvolüsyonel bir dönüşümdür.
MultiRocket ikisini hiç veri seti kaybetmeden süpürür. Chronos-2 ve TiRex'e karşı 28 galibiyet, 0 yenilgi, p = 1.4e-07.
On üç karşıtlık sonuçsuzdur, bu da fark olmadığının kanıtı değildir. DTW-1NN ile ilgili hiçbir şey düzeltmeden sağ çıkmaz ve çok değişkenli alt kümede de hiçbir şey sağ çıkmaz.
Her satır, çiftin paylaştığı veri setlerinde hesaplanır, ortak bir panelde değil, bu nedenle satırlar bir lig tablosu değildir ve birbirleriyle karşılaştırılamaz.
Temel model sonuçları tek bir transfer protokolüne koşullanmıştır: son katman ortalama havuzlama ve lojistik prob, MOMENT, Chronos-2, TiRex ve Mantis-V2'ye aynı şekilde uygulanır ve herhangi bir puanlanan hücreden önce dondurulur. Post hoc, sıra ücretsiz bir kol TiRex'in katman çıkarmasını değiştirdi ve ortalama doğruluğu 0.793'ten 0.805'e, 1.13 yüzde puanı taşıdı; 30 veri setinden 23'ü iyileşti ve yedisi kötüleşti. En büyük kayıp olan Heartbeat 7.98 puan ile 30 yeniden örneklemesinin hiçbirinde iyileşmedi, bu nedenle ortalama, veri setine göre tersine dönen bir sonucu gizler. Ayrıntılar ekte.
Bölünme derinliğinin altı katı
Yukarıdaki her tablo 5 eğitim/test bölünmesi çalıştırır, çünkü HIVE-COTE 2 ve DTW-1NN donmuş pahalı hücre istisnası altında yalnızca bu beşini çalıştırır ve eşleştirilmiş yeniden örnekleme kuralı geri kalanını eşleşmeye çeker. Çubuklar 30 bölünme üzerinden ortalama doğruluğu gösterir ve ortalama sıra aynı sırayı verir. Bu ikisini çıkarın, kalan dokuz yöntem 18 veri setinde tüm 30 tohumlanmış katmanlı yeniden örneklemeyi çalıştırır; bu, bake-off'un kullandığı derinliktir.
Sıralama korunur. RocketPFN 1.694, MultiRocket 2.250, Hydra 2.889 ve MiniRocket 3.833 ilk dört sırayı alır; dördü de rastgele konvolüsyonel özellikler üzerine kuruludur. Sonra MOMENT 5.889, Chronos-2 6.444 ve TiRex 7.056, catch22 7.222 ve Mantis-V2 7.722 ile. Friedman ki-kare 105.067, p = 3.9e-19. Beş bölünme bunu üretmedi.
Bu derinlikte iki blok temiz bir şekilde ayrılır. MiniRocket'in %95 bootstrap sıra aralığı 4.278'e ulaşır ve MOMENT'inki 5.111'de başlar; tüm 5.000 bootstrap çekimi boyunca hiçbir önceden eğitilmiş modelin ortalama sırası konvolüsyonel bloğun aralığına girmedi.
Burada on iki dönüşüm-önceden eğitilmiş çiftinin on tanesi Holm düzeltmesinden sağ çıkar. Sağ çıkamayan ikisi, MiniRocket MOMENT'e karşı p = 0.108 ve Hydra MOMENT'e karşı p = 0.105, her ikisi de birincil panelde sağ çıkar. Holm, bu panelin kendi 36 çift ailesini kapsar, bu nedenle bu sayı ve birincil panelin altı hayatta kalanı farklı sorulara cevap verir.
Birincilik daha da az netleşmemiştir. RocketPFN, 5.000 veri seti bootstrap çekiminin %92.9'unda birinci olur; birincil paneldeki %46.6 ve %45.5'e karşı, ancak orada birinciliği paylaştığı HIVE-COTE 2 burada yoktur. Üst klik hâlâ üç genişliktedir: RocketPFN, MultiRocket ve Hydra. MiniRocket yine bunun dışında kalır ve MOMENT ile bir klik paylaşır.
Bu bir derinlik kontrolüdür, bağımsız bir tekrar değildir. 18 veri seti, birincil panelin tüm 15'ini artı ElectricDevices, StarLightCurves ve UWaveGestureLibraryAll'ı içerir; bu nedenle yukarıdaki bir veri seti çıkarıldığında kırılganlık geçerlidir. RocketPFN mevcut olduğundan, aynı nedenle yalnızca tek değişkenlidir. Dışladığı şey, beş belirli bölünmeye bağlı bir sıralamadır.
Parti bileşimi TimEE'nin tahminlerini değiştiriyor
TimEE, yayımlanan manşeti UCR karşılaştırmasında ROC-AUC'de birincilik olan bağlam içi bir sınıflandırıcıdır.3 İki makinede çalıştırdık ve hücre düzeyinde sonuçları karşılaştırdık.
Uyum tam olarak 512 koşum parti boyutunda kırılır. Test setinin tek çağrıya sığdığı 270 hücrenin 270'inde doğruluk aynıdır; sığmadığı 325 hücrenin 146'sında aynıdır. ROC-AUC için bölünme 270'te 221'e karşı 308'de 12'dir. İki makine her iki katmanda da donanım açısından farklıdır, bu nedenle tek başına hiçbir katman bir şey kanıtlamaz; aralarındaki karşıtlık kanıttır.
Veri seti başına kırılma, katman toplamlarının önerdiğinden daha keskindir. Test seti tek çağrıya sığan her veri seti, 30 yeniden örneklemenin 30'unda doğrulukta uyuşur ve eşiğin üzerindeki hiçbir veri seti 30'un 30'una ulaşmaz. ROC-AUC her iki tarafta da daha kötüdür ve sığacak kadar küçük iki veri setinde yarının altına düşer.
Mekanizma kaynaktadır. İstatistiksel gömme işlevi, çıkarım çağrısındaki her satırda her özelliği z-skorlar; destek ve sorgu satırları aynı şekilde, eğitim ve değerlendirme konumlarını ayıran hiçbir koruma olmadan. Otuz satır sonra aynı dosya farklı bir normalleştirme adımına tam olarak böyle bir koruma uygular. Kontrollü bir eş takası bunu doğrular: bir çapa sorgusunu sabit tutup çağrısındaki diğer 511 sorguyu değiştirmek, çapanın tahmin edilen olasılığını 1.163e-04 kadar kaydırır; tekrar çalıştırma gürültüsü ise tam olarak sıfırdır. TiCT ve RocketPFN, aynı şekilde test edildiğinde aynı takas altında bit düzeyinde aynıdır.
Dolayısıyla bir TimEE tahmini yalnızca girdi serisinin bir fonksiyonu değildir. Puanları sabit parti bileşiminde yeniden üretilebilir, bu nedenle tümevarımlı sınıflandırıcılara karşı benzer bir sıralama alamaz ve bu karşılaştırma onu bir sıra olmadan raporlar. Bu, yayımlanan ROC-AUC iddiasını niteler, çünkü ROC-AUC tam olarak çağrıya bağımlı olduğu gösterilen olasılıklardan hesaplanır. Bu, puanların her iki yönde de şişirildiğini göstermez, yayımlanan sıralamayı değiştirmez (bu, bizim tutmadığımız bir lider tablosunda kazanılmıştır) ve incelediğimiz sürümü kapsar.
Üç algılama yolunun dördünden üçü kaynak erişimi gerektirmez. Bir hücreyi iki kez tekrarlayın, parti eşlerini sabit bir çapa etrafında değiştirin ve sonuçları parti sınırına göre katmanlanmış iki makine arasında karşılaştırın. İlgili yayımlanmış çalışma, önceden uydurulmuş ağ çıkarımını verimlilik için kümelenmiş test sorgularıyla partiler ve bileşim bağımlılığı rapor etmez.4
Çok değişkenli panel sonuçları
Geniş panelde oluşturulan bir kısa liste çok değişkenli verilere taşınmaz. MOMENT, 9 veri setli çok değişkenli panelde on yöntemin sonuncusudur; oysa 24 veri setli geniş panelde 6.729 ile en yüksek sıralı önceden eğitilmiş modeldir. Mantis-V2 diğer yönde çalışır: çok değişkenli panelde 5.444, geniş panelde 7.208.
Bu bir modalite etkisi değildir. Geniş panel çok değişkenli veri setlerini bir alt küme olarak içerir, bu nedenle hareket, her iki yöntemin içinde ölçülen bir şey değil, farklı boyut ve görev bileşimine sahip iki kadro arasındaki bir karşıtlıktır. N=9 ve hiçbir karşıtlık düzeltmeden sağ çıkmadığı için, bunu geniş panel kısa listesini çok değişkenli bir dağıtıma taşımaya karşı bir uyarı olarak okuyun, bir seçim sonucu olarak değil.
Denek gruplu bölünme sonuçları
UCR ve UEA arşivleri, bireysel seriler üzerinde tanımlanmış sabit eğitim/test bölünmeleri gönderir; üzerinde bölünecek denek veya kaynak açıklaması yoktur,56 bu nedenle bunları yeniden örneklemek deneklerden ziyade serileri yeniden karıştırır. Bir deneğin birçok pencereye katkıda bulunduğu SleepEDF uyku evrelemesinde ayrıca deneğe göre böldük. MiniRocket, dondurma kesintisi nedeniyle 10 rastgele katlamanın 8'ini taşır.
Rastgele bölme daha yüksek doğruluk rapor eder; catch22 için 0.060 ve MiniRocket için 0.030 farkla.
Varyans sıkışması daha aktarılabilir olan yarıdır. Katlama arası değişkenlik, hem pencere doğruluğunda hem de denek-makro doğruluğunda rastgele bölme altında denek gruplamaya göre kabaca yedi ila dokuz kat daha küçüktür. Rastgele bölünmelerde seçilen bir model, görünmeyen denekler üzerinde dağıtılacağı şekilde değerlendirilen aynı modelden daha iyi ve daha istikrarlı görünür.
Bir bölünme ile ilişkili farkı rapor ediyoruz, asla sızıntı değil. Veriler, farkın denek kimliği sızıntısından mı yoksa denek zorluğu ve aşama karışımındaki gerçek değişkenlikten mi kaynaklandığını söyleyemez; rastgele bölmeler bu değişkenliği her test setine dağıtır ve bu da doğruluğu mekanik olarak istikrara kavuşturur. İkisini ayıracak deney, test deneklerini içeren ve içermeyen eğitim setleri altında aynı test dönemleri, PTB-XL üzerinde çalıştırıldı ve hesaplama için SleepEDF'den çıkarıldı. PTB-XL'nin kendisi rastgele bölme altında %14.9 aynı denek örtüşmesini korur, bu nedenle düşük örtüşmeli bir karşılaştırıcıdır, sıfır kontrol değil.
Dengesiz veri: Earthquakes
Doğruluk, şansa yakın sıralamayı gizler. Her CPU şeridi yöntemi Earthquakes'te 0.72 ila 0.78 doğruluk rapor ederken dengeli doğruluk 0.4996'dan 0.5453'e kadar uzanır. 0.5'i yalnızca dengeli doğruluk ekseninde şans olarak okuyun; normal doğruluk için şans sınıf yaygınlığına bağlıdır.
En yüksek doğruluğa sahip yöntem en düşük dengeli doğruluğa sahiptir. catch22 0.783 doğrulukla 0.4996 dengeli doğruluk elde eder; sayısal olarak 0.5'in hemen altındadır. Tam olarak çoğunluk sınıfını tahmin edip etmediği ölçülmedi; aktarılan rakam belirsizlik taşımaz ve 0.5'e karşı test taşımaz.
Tersine dönme yereldir, yöntemin bir özelliği değildir. Tam panelde catch22 dengeli doğrulukta açıkça sonuncudur; 0.726'ya karşı MultiRocket'ın 0.806'sı. Dengeli doğruluk burada post hoc bir metriktir, dondurulduktan sonra arşivlenmiş tahminlerden hesaplanır. DTW-1NN diğer dört yöntemin 30'una karşı 5 yeniden örnekleme taşır, bu nedenle noktası daha az kanıta dayanır.
Olasılıklar değil, sert etiketler
Altı CPU şeridi yönteminden dördü olasılık döndürmez. MiniRocket, MultiRocket, Hydra ve DTW-1NN tahmin edilen sınıfa 1, başka her yere 0 koyar; bu nedenle log kayıpları başka bir ad altında doğruluktur. Log kaybının kaydedildiği tüm 2.465 hücrede 7.1e-15 içinde hata oranı çarpı 36.0437'ye eşittir. Bu sabit, scikit-learn'ün gerçek sınıf üzerinde sıfır olasılığa atadığı cezadır.
Tarif belgelendiği gibi davranır. Üç konvolüsyonel sınıflandırıcı varsayılan olarak olasılık çıktısı olmayan bir ridge başlığı kullanır ve kütüphane boşluğu one-hot vektörle doldurur; DTW-1NN bir komşuda yapı gereği aynı şekle sahiptir.7
Bu nedenle onlar için hesaplanan ROC-AUC, bir sıralamayı değil etiketi ölçer. Altısının da tam ROC-AUC taşıdığı 27 veri setinde, catch22 0.884 kaydederken MultiRocket'ın 0.866'sına karşı; ancak 7.2 doğruluk puanı geriden gelir: 0.782'ye karşı 0.854. Bunu, catch22'nin kullanılabilir bir puana sahip olduğu ve MultiRocket'ın hiçbir puana sahip olmadığı şeklinde okuyun; yoksa catch22 vakaları daha iyi sıralıyor değil.
Altısının yalnızca ikisi olasılıklar üzerinden karşılaştırılabilir. Tam log kaybına sahip 22 veri setinde HIVE-COTE 2 ortalama 0.344 alır, catch22'nin 0.527'sine karşı; medyanlar 0.265 ve 0.371'dir ve 22'nin 19'unda daha düşüktür. Her iki rakam da arşivlenmiş çıktıyı tanımlar. Hiçbir kalibrasyon deneyi çalıştırılmadı ve hiçbir donmuş test bunları kapsamaz.
Doğruluk tablosu hareket etmez. Taşımadığı şey şudur: vakaları sıralayan veya eşikleyen bir iş yükü, varsayılan MiniRocket, MultiRocket, Hydra veya DTW-1NN tarifinden eşikleyecek hiçbir şey almaz. Aynı özellikler üzerine olasılıksal bir başlık çalıştırılmadı.
Kaydedilen hesaplama
Grafik eşleştirilmiş hücreleri çizer: altısının da çalıştığı 28 veri setiyle sınırlanan her CPU şeridi yöntemi, 0 ila 4 yeniden örneklemelerde, yani her biri 140 hücre. Bu hücrelerde kaydedilen CPU çekirdek saati: HIVE-COTE 2 694.23, DTW-1NN 356.82, MultiRocket 2.81, Hydra 2.12, catch22 0.54 ve MiniRocket 0.48.
Kısıtlama, bir oranı anlamlı kılan şeydir. Kaydedilen hesaplama toplamı tüm CPU şeridinde 1.496.5 çekirdek saattir; bunun 804.8'ini HIVE-COTE 2 oluşturur: 140 sıralı hücresi üzerinde 694.2 ve geri kalanı her tablodan hariç tutulan dört post hoc tanı hücresi üzerindedir. MultiRocket 990 sıralı hücre üzerinde 26.2 oluşturur. Bu iki toplam farklı miktarlarda işi kapsar, bu nedenle aralarındaki hiçbir oran yöntemleri karşılaştırmaz.
Eşleştirilmiş hücreler bunu mümkün kılar. Her CPU şeridi yöntemini altısının da çalıştığı 28 veri setine, 0 ila 4 yeniden örneklemelerde kısıtlamak, her birine 140 hücre verir. Kaydedilen CPU çekirdek saati: HIVE-COTE 2 694.23, DTW-1NN 356.82, MultiRocket 2.81, Hydra 2.12, catch22 0.54 ve MiniRocket 0.48.
Aynı 28 veri setinde HIVE-COTE 2, MultiRocket'ı 18'de yener ve 9'da kaybeder; ortalama doğruluk farkı 0.012'dir ve Holm düzeltmesinden sağ çıkmaz. Bu, bu karşılaştırmanın tespit edemediği bir fark için 247 kat CPU süresidir. Arşiv protokolünün yayımlanan her sonuçtan gerektirdiği temel olan DTW-1NN, aynı hücrelerde MiniRocket'a göre 747 kat daha pahalıdır.
Buradaki her yöntem n_jobs = 1 ile tek iş parçacıklı çalıştı, süreç başına bir hücre; bu nedenle kaydedilen duvar süresi çekirdek süresidir. Her iki oran için hâlâ iki sınır geçerlidir. Süreler, kutu başka ne çalıştırıyorsa onun altında elde edilen iş çıkarma hızıdır, yalnız başına gecikme değildir. Ayrıca HIVE-COTE 2 kendi yapılandırma şeridinde çalışırken diğer beşi bir şeridi paylaştı; bu nedenle oranı iki şeridi kapsar; DTW-1NN'nin MiniRocket'a oranı ise tek bir şerit içinde ölçülür.
Bu karşılaştırmadan klasik yöntemler ile temel modeller arasında hiçbir maliyet karşılaştırması mümkün değildir ve biz hiçbir şey yapmıyoruz. Altı GPU şeridi yöntemi hiçbir duvar süresi kaydetmedi. TimEE'nin kaydedilen duvar süresi vardır ancak sıra taşımadığı için grafikten hariç tutulmuştur.
Karşılaştırılan yöntemler
HIVE-COTE 2
Birincil panelde ortalama sırada birinci (2.400), RocketPFN'den ayrılamaz. 140 sıralı hücreyi 694.2 kayıtlı çekirdek saatiyle çalıştırdı; kaydedilen CPU şeridindeki en pahalı yöntemdir ve FaceDetection'ı (144 kanal) bitiremedi. Shapelet, sözlük, aralık ve konvolüsyonel temsiller üzerinde heterojen bir meta-topluluk.8
RocketPFN
Ortalama doğrulukta birinci (0.905), HIVE-COTE 2'den ayrılamaz. Eş takası testinde bit düzeyinde aynıdır. Yalnızca tek değişkenlidir, bu nedenle UEA paneline asla girmez. ROCKET ailesi konvolüsyonel özellikleri, bağlam içi sınıflandırmayı yapan tablo temel modeli TabPFN v2.5 ile birleştirir; böylece hedef veri setinde hiçbir model uydurulmaz; makalesi 92 UCR veri setinde 0.900 ortalama doğrulukla HIVE-COTE 2 ile eşitlik rapor eder.2
MultiRocket
Ortalama sırada üçüncü (2.800) ve en güçlü ikili kayıt: önceden eğitilmiş modellere karşı incelenen dört karşıtlığının dördü de Holm'dan sağ çıkar; ikisi 28 galibiyete karşı 0 yenilgi ile. 990 hücre için 26.2 kayıtlı çekirdek saati. MiniRocket'ı çoklu havuzlama işleçleri ve birinci dereceden farklarla genişletir.9
Hydra
Ortalama sıra 4.100; MOMENT'e karşı galibiyeti (22/6) düzeltmeden sağ çıkar. Sözlük tarzı bir konvolüsyonel yöntemdir: çekirdekler gruplar halinde yarışır ve kazanan çekirdeklerin sayıları temsili oluşturur.10
MiniRocket
Ortalama sıra 4.700; 990 hücre için 4.9 kayıtlı çekirdek saatiyle kaydedilen CPU şeridindeki en ucuz güçlü yöntemdir; MOMENT'e karşı galibiyeti (24/4) düzeltmeden sağ çıkar. Doğrusal bir sınıflandırıcıyla neredeyse deterministik bir rastgele konvolüsyonel çekirdek dönüşümü.11
MOMENT
Tek değişkenli birincil panelde en yüksek sıralı önceden eğitilmiş model (6.633); sağ çıkan karşıtlıklarla üç konvolüsyonel dönüşümün üçüne de kaybeder. Tahmin, sınıflandırma, anomali tespiti ve imputasyon için çok alanlı bir derlem üzerinde önceden eğitilmiş 385M parametreli T5 tabanlı bir model.12
Chronos-2
Ortalama sıra 7.967; MultiRocket'e 28/0 kaybeder. Burada donmuş bir gömme çıkarıcı olarak kullanılan bir tahmin temel modeli; bu onun doğal görevi değildir.13
TiRex
Ortalama sıra 8.433; MultiRocket'e 28/0 kaybeder. xLSTM tabanlı sıfır atışlı bir tahmin modeli,14 burada da donmuş bir çıkarıcı olarak kullanılır. Post hoc duyarlılık kolunda, son katman çıkarmasını tüm katman birleştirmeye değiştirmek, 30 veri setli paneli boyunca ortalama doğruluğu 1.13 yüzde puanı artırdı: 23 veri seti iyileşti ve yedisi kötüleşti; Heartbeat 7.98 puan ile ve 30 yeniden örneklemesinin hiçbiri iyileşmedi. Donmuş son katman sonucu ve sırası birincil kalır; duyarlılık kolu sıra taşımaz.
Mantis-V2
Tek değişkenlide ortalama sıra 9.733 ve çok değişkenli panelde 5.444; MultiRocket'e 24/3 kaybeder. FaceDetection'ı bitiremedi: 144 kanal doğal sınıflandırma başlığını aşar. V2'de sentetik veri ve test zamanı stratejileri eklenmiş hafif, karşıtlıklı olarak önceden eğitilmiş bir sınıflandırma modeli.15
TimEE
Sırasız rapor edildi; yukarıdaki parti bileşimi bulgusuna bakın. Rapor edilen panelindeki 21 veri seti üzerinde ortalama doğruluk 0.841, sabit parti bileşiminde hesaplanmıştır. Sonuçlardan önce beyan edilen iki hariç tutma geçerlidir: NonInvasiveFetalECGThorax1, 30 yeniden örneklemenin 5'inde kısmidir ve Phoneme yalnızca arşiv bölünmesinde rapor edilir. Sentetik görevlerde meta-eğitilmiş 4.5M parametreli bir model; etiketli bir destek setinden tek bir ileri geçişte uçtan uca bağlam içi sınıflandırır.3
TiCT
Ortalama sıra 10.200. Yalnızca tek değişkenlidir; çalıştırıcısı, Phoneme üzerinde nadir sınıf geçerlilik kuralını uygulayan tek çalıştırıcıydı ve diğer şeritlerin 30 çalıştırdığı yerde bir geçerli hücreye katkıda bulundu. Eş takası testinde bit düzeyinde aynıdır. Rastgele sınıf sayıları için bit tabanlı etiket kodlaması ile sentetik veriler üzerinde önceden eğitilmiş bağlam içi bir transformatör.16
DTW-1NN
Ortalama sıra 9.900. StarLightCurves'i bitirmedi; bölünemez bir hücre için 95 saatte beyan edilmiş bir maliyet DNF'sidir. Dinamik Zaman Bükme mesafesi altında bir en yakın komşu, alandaki en uzun süredir ayakta duran temel.
catch22
Birincil panelde ortalama sıra 8.700. Basit bir sınıflandırıcıya beslenen yirmi iki sabit, yorumlanabilir özet özellik.17
Klasik bir sınıflandırıcı yerine ne zaman temel model seçmeli
- Bol miktarda etiketli eğitim verisi: burada düzeltmeden sağ çıkan her karşıtlık bir konvolüsyonel dönüşümden yanadır ve üçünün ikisi, MultiRocket ve Hydra, HIVE-COTE 2 ve RocketPFN ile birlikte üst klikte yer alır.
- Ciddi şekilde sınırlı etiketler veya soğuk başlangıç dağıtımı: bağlam içi ve sıfır atışlı modeller adaydır ve bu, karşılaştırmamızın ölçmediği rejimdir. Tüm panellerimiz tam arşiv eğitim bölünmelerini kullanır.
- Çok değişkenli veri: önce doğal kapsamı kontrol edin. Bu kadrodaki üç bağlam içi yöntemden ikisi yalnızca tek değişkenlidir.
- Hesaplamadan bağımsız olarak en yüksek doğruluk: HIVE-COTE 2 ve RocketPFN bu kanıtta ayrılamaz. Bu karşılaştırma ne doğruluklarını ne de hesaplamalarını ayırır, çünkü RocketPFN'in kayıtlı zamanlaması yoktur.
Önemli olan bir hesaplama bütçesi: yukarıdaki 140 eşleştirilmiş hücrede MultiRocket, HIVE-COTE 2'nin CPU çekirdek saatinin 1/247'sini kullanır ve bu veri setlerinde aralarındaki hiçbir doğruluk farkı düzeltmeden sağ çıkmaz. - Denetlenebilirlik gereksinimleri: tahminleri yalnızca girdiden yeniden üretilebilir olan yöntemleri tercih edin. Yukarıdaki parti bileşimi bulgusu uyarıcı durumdur.
Zaman serisi sınıflandırma nedir
Zaman serisi sınıflandırma, görünmeyen bir seri için ayrık bir sınıf tahmin etmek üzere etiketli, sıralı sayısal diziler üzerinde bir model eğitir: EKG tanısı, giyilebilir cihazlardan insan aktivitesi tanıma, endüstriyel arıza tespiti. Sınıf etiketi yerine gelecek değerleri çıkaran tahminlemeden farklıdır. Tablo modelleri değerlerin sıralamasını tümevarımsal bir eğilim olarak kodlamaz; her zaman adımını bağımsız bir sütun olarak ele alırlar.
Klasik yöntemler her veri seti için yeni bir model uydurur. Bir zaman serisi temel modeli ise büyük bir derlem üzerinde bir kez önceden eğitilir, sonra yeni veri setlerine sıfır atışla, hafif bir prob aracılığıyla veya çıkarım sırasında sağlanan bir avuç etiketli örnekten bağlam içi olarak uygulanır. Bu önceden eğitimin şu anda standart arşivlerde sınıflandırma doğruluğu satın alıp almadığı, tek bir kontrollü protokol altında, bu karşılaştırmanın ölçtüğü sorudur.
Zaman serisi sınıflandırma karşılaştırma metodolojisi
Yöntemler. Dört aile: bir transfer protokolü aracılığıyla değerlendirilen önceden eğitilmiş temel modeller (MOMENT, Chronos-2, TiRex, Mantis-V2), bağlam içi modeller (TimEE, TiCT, RocketPFN), konvolüsyonel dönüşümler (MiniRocket, MultiRocket, Hydra) ve klasik referanslar (HIVE-COTE 2, DTW-1NN, catch22).
Veri. 23 UCR tek değişkenli ve 10 UEA çok değişkenli veri seti,56 ayrıca SleepEDF ve PTB-XL üzerinde ayrı bir non-IID katman. 14.638 kayıtlı hücre, aşağıdaki kapsam tablosunda bölünmüştür.
Kapsam. Puanlanan hücreler yöntemler arasında eşit dağılmamıştır ve paydalar hangi karşılaştırmaların mümkün olduğunu belirler.
Her sıralı karşılaştırma, adlandırdığı yöntemlerin tam vaka kesişiminde çalışır; asla tek bir yöntemin kendi kapsamında değil. Bu, HIVE-COTE 2'nin 140 hücresinin ve RocketPFN'in 2.760 hücresinin aynı tabloda görünmesini sağlayan şeydir. Tam dışa aktarma 14.638 satır tutar: bu 11.874 puanlanan hücre, RocketPFN'in 2.760 hücreli makale protokolü yeniden üretim kolu ve 4 HIVE-COTE 2 post hoc tanı hücresi.
Yeniden örnekleme. r0 arşiv eğitim/test bölünmesidir; r1'den r29'a kadar arşiv oranlarında katmanlı karıştırmalardır, tohum 1729+r. Çıkarım birimi veri setidir: yöntemler karşılaştırılmadan önce yeniden örneklemeler bir veri seti içinde ortalanır. HIVE-COTE 2 ve DTW-1NN, hücre başına maliyetleri bir ila iki büyüklük mertebesi daha yüksek olduğu için 5 yeniden örnekleme çalıştırır ve birincil tablo her yöntemi aynı 5 eşleştirilmiş yeniden örneklemeyle sınırlar. Arşiv bölünmesi r0, 33 veri setinin 8'inde tohumlanmış yeniden örneklemelerden sistematik olarak daha zordur; doğrulukta 0.218'e kadar fark vardır, bu nedenle beş eşleştirilmiş yeniden örnekleme değiştirilebilir çekimler değildir.
Transfer protokolü. Her referans temel modeli aynı hattı çalıştırır: değişken başına kodlama, son kodlayıcı katmanı, geçerli bağlam belirteçleri üzerinde ortalama havuzlama, değişken başına L2 normalleştirme, kanal birleştirme, yalnızca eğitim standardizasyonu, lojistik regresyon probu. Herhangi bir puanlanan hücreden önce, 2026-07-24 donduruldu.
İstatistikler. Friedman omnibus, ardından tüm 19 incelenen karşıtlık üzerinde Holm düzeltmeli ikili Wilcoxon işaretli sıra, veri seti düzeyinde ortalamalarda, yalnızca tam vaka panelleri. Omnibus yalnızca sıraların bir yerde farklı olduğunu destekler; her ikili ifade düzeltilmiş karşıtlıklardan gelir.
Dondurma. Veriler 2026-07-29 03:00 UTC'de donduruldu; hariç tutma kuralları olağanüstü sonuçlar bilinmeden önce yazıldı. Bir hücre kesimden 22 dakika sonra bitti ve önceden yazılmış kural uyarınca hariç tutuldu. Sürüm, her girdi dosyasının karma karşılaştırması, birincil tablonun dışa aktarmadan yeniden üretilmesi ve hem makalede hem de sürüm tablolarında yayımlanan TimEE rakamının arkasındaki beyan edilen hariç tutmaların uygulanması dahil 120 mekanik doğrulama denetiminden geçer.
Metrikler. Beyan edilen birincil metrik ROC-AUC idi. 7 referans temel modelinin 6'sı için mevcut değildir; bu modellerin çalıştırmaları kalibre edilmiş olasılıklar yerine karar puanları veya sınıf tahminleri arşivler; bu nedenle doğruluk karşılaştırma metriği haline geldi. TimEE, yedisi arasında ROC-AUC taşıyan tek modeldir. Doğruluğu önceden belirlenmiş olarak yeniden etiketlemek yerine bunu belirtiyoruz. Dengeli doğruluk, makro-F1 ve log kaybı, kapsanan alt kümede post hoc duyarlılık analizleridir.
Yeniden üretilebilirlik. Örnek başına tahminler tüm 13 yöntem ve birincil tablonun tüm 12'si için arşivlenmiştir; yeniden üretilen her tahmin donmuş skalerini maksimum 0.000e+00 farkla yeniden üretir (4.260 CPU şeridi hücresi 2026-08-02'de yeniden doğrulandı, sıfır yetim). Birincil tablo, yayımlanan tahminlerden tamamen yeniden hesaplanabilir.
Bu karşılaştırmada olmayan yöntemler
Değerlendirmediğimiz yayımlanmış TSC ile ilgili modeller, kadronun sınırının açık olması için listelenmiştir. Buradaki ifadelerin hiçbiri bizim ölçümlerimiz değildir. UniTS, sınıflandırma, tahmin, imputasyon ve anomali tespitini kapsayan birleşik çok görevli bir modeldir.18 TiViT serileri görüntülere dönüştürür ve dondurulmuş önceden eğitilmiş Vision Transformer'larla sınıflandırır.19 UniShape, sınıflandırma için oluşturulmuş şekil farkındalıklı bir temel modeldir; şekil farkındalıklı bir adaptörle AAAI 2026'da kabul edilmiştir.20 GPT4TS, aynı zamanda One Fits All olarak yayımlanan, GPT-2 omurgasını kullanır; öz-dikkat ve ileri besleme blokları dondurulurken girdi, normalleştirme ve çıktı bileşenleri eğitilir.21 TIC-FM, tüm test örneklerini tek bir ileri geçişte tahmin eden bağlam içi sıfır atışlı bir sınıflandırıcıdır;22 tek çağrılı tasarımını yukarıdaki parti bileşimi bulgusuyla aynı maruz kalma sınıfı olarak okumak, yayımlanan açıklamadan çıkarımımızdır, test edilmiş bir sonuç değildir.
Sınırlamalar
- Hiçbir önceden eğitilmiş model için önceden eğitim örtüşme kaydı yoktur: hiçbiri UCR/UEA serilerinin önceden eğitim derleminde görünüp görünmediğine dair veri seti düzeyinde bir beyan yayımlamaz; bu nedenle transfer, önceki maruziyetten ayrılamaz. Kayıpları güvenli olarak ele almak, hiçbir veri seti düzeyinde kaydın test edemeyeceği bir varsayıma dayanır: önceki maruziyetin, meydana geldiği yerde, bu modelleri kayırmak yerine kötüleştirdiği. Bu varsayım altında avantaja rağmen geride kalırlar ve kayıplar geçerlidir; aynı mantıkla herhangi bir önceden eğitilmiş model galibiyeti, temiz bir şekilde transfere atfedilemez.
- Temel model sonuçları tek donmuş transfer protokolüne koşullanmıştır. Post hoc TiRex kolu yalnızca katman çıkarmasını değiştirdi ve 30 veri setinin yedisini kötüleştirirken ortalama doğruluğu 1.13 yüzde puanı artırdı; Heartbeat 7.98 puan ile ve 30 yeniden örneklemesinin 0'ı iyileşti. Bir modeli test etti, sıra taşımaz ve etkiyi diğer temel modeller için kurmaz.
- Tüm duvar süreleri, paylaşılan bir makinede değişen eşzamanlılık altında yüklenmiş iş çıkarma hızıdır. 13 yöntemin altısı hiçbirini taşımaz.
- Kanıt yalnızca arşiv boyutundaki sorunları kapsar. Burada hiçbir şey ölçeklenebilirlikten bahsetmez.
- Karşılaştırma, her yöntemin donmuş tarihindeki bir sürümünü inceler.
Zaman serisi sınıflandırmayı karşılaştırmada yaygın tuzaklar
Önceden eğitim-test örtüşmesi. 2025 denetimi, 22 yayımlanmış zaman serisi temel modeli boyunca 401 veri setini izledi ve yalnızca %6'sının hiçbir modelin önceden eğitim veya ince ayar derleminde görünmediğini buldu.23 Kadromuzdaki hiçbir model veri seti düzeyinde bir örtüşme beyanı yayımlamaz; bu nedenle sınırlamalar bölümümüz transfer ve önceki maruziyeti ayrılmaz olarak ele alır.
Bölünme tasarımı. Standart UCR arşivi tek bir sabit eğitim/test bölünmesi gönderir; modern uygulama yeniden örnekler ve SleepEDF panelimiz denek yapısının neden yeniden örneklemeden fazlasını gerektirdiğini gösterir: bölünme tasarımı tek başına rapor edilen doğruluğu 0.060'a kadar taşıdı ve varyansını kabaca yedi ila dokuz kat sıkıştırdı. Buradaki hiçbir tek rakam veri setinin bir özelliği değildir; her biri belirtilen bir bölünme tasarımı altında veri setinin bir özelliğidir.
Çokluk. Birçok sınıflandırıcıyı birçok veri setinde düzeltme olmadan karşılaştırmak bulgular üretir. Standart makine, çiftler için Wilcoxon işaretli sıra ve incelenen her karşıtlık üzerinde Holm tarzı aile bazında düzeltmedir;2425 ve düzeltme yalnızca rapor edilenleri değil, incelenen her karşıtlığı kapsamalıdır. Bu karşılaştırmada bu disiplin 19 karşıtlığın 13'ünü eledi.
Ek: TiRex çıkarma duyarlılığı
Bu post hoc kol, donmuş TiRex sonucuyla aynı 30 veri seti, 30 yeniden örnekleme bölünmesi, ölçekleyici ve lojistik probu kullanır. Yalnızca özellik çıkarma değişir; son kodlayıcı katmanından tüm 12 katmanın birleştirilmiş temsillerine. Kol sıra ücretsiz'dir ve donmuş karşılaştırmayı değiştirmez.
Ortalama doğruluk 0.793'ten 0.805'e taşındı, 1.13 yüzde puanı değişim; tohumlanmış veri seti bootstrap aralığı +0.15 ila +2.06 puandır. 30 veri seti deltası üzerinde eşleştirilmiş Wilcoxon işaretli sıra testi, p=0.003'te tam iki taraflı W 92.0 verir. Bu test keşfedicidir: dondurulduktan sonra çalıştırıldı, burada her düzeltilmiş iddiayı yöneten 19 karşıtlıklı Holm ailesinin dışındadır ve sıra taşımaz.
Auer ve arkadaşları, katman birleştirilmiş özellikler ve bir Random Forest kullanarak TiRex'i tahmin temel modelleri arasında birinci sıraya koyar ve kendi ablasyonları daha büyük 5 puanlık bir katman etkisi rapor eder.26 İki çalışma veri setleri, model kadrosu, sınıflandırıcı ve seri uzunluğu filtrelemesi açısından farklılık gösterir; bu nedenle 1.13 ve 5 puan, tek bir etkinin rakip tahminleri değil, protokole özgü duyarlılık tahminleridir. Bu kol, onların sıralamasını ne yeniden üretir ne de çürütür ve çalışmalar arası sıra farkının nedenini belirlemez. Bu karşılaştırma içinde TiRex için katman duyarlılığını kurar. Etkiyi diğer temel modellere genellemez veya herhangi bir modelin ulaşılabilir en iyi sınıflandırma performansını belirlemez.
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{Zaman Serisi Sınıflandırma Karşılaştırması: Temel Modeller ve Klasik Yöntemler}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/time-series-classification}},
note = {AIMultiple. Erişim tarihi: 24 Ağustos 2026}
}61 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 4 CSV dosyası içeren ZIP dosyası olarak indirin.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.