Benchmark sulla classificazione delle serie temporali: modelli foundation vs metodi classici
Abbiamo confrontato 13 metodi di classificazione delle serie temporali, dai modelli foundation preaddestrati per serie temporali a una baseline a 22 feature del 2019, su 33 dataset UCR/UEA con un unico protocollo congelato. Si tratta di 14.638 celle registrate metodo-dataset-ricampionamento, 11.874 delle quali valutate.
Risultati del benchmark TSC
Il grafico confronta 12 metodi sui 15 dataset univariati che tutti hanno completato, ogni dataset eseguito sugli stessi 5 split di addestramento/test. Le barre sono ordinate per accuratezza media. La tabella sottostante include anche il rango medio, la posizione media che un metodo occupa all'interno di un dataset, e dispone gli stessi 12 in un ordine diverso.
Nessun singolo vincitore. HIVE-COTE 2 è primo per rango medio (2.400) e RocketPFN primo per accuratezza media (0.905). Con un bootstrap sui dataset a 5.000 estrazioni, il primo posto va a HIVE-COTE 2 nel 46.6% delle estrazioni, a RocketPFN nel 45.5% e a MultiRocket nel 7.9%. I due ordinamenti non concordano e il bootstrap si divide quasi equamente, quindi indicare uno dei due sarebbe un artefatto della metrica scelta.
Il gruppo di testa è più piccolo di quanto suggerisca la tabella. La cricca di Wilcoxon-Holm è HIVE-COTE 2, RocketPFN, MultiRocket e Hydra. MiniRocket, sei decimi di rango dietro Hydra a 4.700, non ne fa parte: l'appartenenza deriva dai test a coppie corretti, non dalla posizione dei valori di rango.
In questo pannello le trasformate occupano i ranghi 3, 4 e 5 e i modelli preaddestrati occupano 6, 7, 8 e 10. MOMENT, il modello preaddestrato con il rango più alto a 6.633, si trova quasi due ranghi pieni sotto MiniRocket.
catch22, pubblicato nel 2019 con 22 feature fisse, si colloca all'interno della fascia dei preaddestrati a 8.700, davanti a Mantis-V2 (9.733) e dietro a TiRex (8.433). Alla profondità completa di 30 ricampionamenti rimane in quella fascia, sia nel pannello da 18 dataset qui sotto a 7.222, sia in una sua variante da 27 dataset e otto metodi che esclude RocketPFN.
Anche in fondo rango e accuratezza non concordano. DTW-1NN ha un'accuratezza media peggiore di TiCT (0.756 contro 0.776) e un rango medio migliore (9.900 contro 10.200). La metrica che si riporta cambia l'ordine in entrambe le metà della tabella.
Solo la parte centrale della tabella è stabile. La rimozione di un singolo dataset cambia l'ordinamento in 10 casi su 15. Sei di questi sono lo scambio tra HIVE-COTE 2 e RocketPFN; Mantis-V2 e DTW-1NN si scambiano di posizione in sei casi e DTW-1NN e TiCT in due. Le posizioni dalla 3 alla 9 non cambiano mai.
La metrica di confronto è l'accuratezza perché la metrica primaria dichiarata, ROC-AUC, non è disponibile per 6 dei 7 modelli foundation di riferimento. Il pannello è solo univariato: TiCT e RocketPFN non hanno supporto multivariato nativo, quindi la regola dei casi completi rimuove tutti i 10 dataset multivariati. Le righe dei modelli foundation misurano quei modelli con un unico protocollo di trasferimento fisso. TimEE non ha rango, per il motivo indicato di seguito. Una quota di primi posti al bootstrap è la frequenza con cui un metodo si classifica primo tra raccolte di dataset ricampionate, e nient'altro.
L'ordinamento stesso replica il bake-off del 2024, che ha stabilito che HIVE-COTE 2 e la famiglia ROCKET guidano questa classe di problemi e riporta che HIVE-COTE 2 è molto più lento.1 Il contributo qui è una misurazione indipendente e controllata su un roster 2026 con un unico protocollo comune, con le separazioni quantificate dopo correzione familywise.
RocketPFN è costituito da feature ROCKET date in ingresso a TabPFN,2 un modello tabulare in-context piuttosto che un modello foundation preaddestrato per serie temporali, quindi la sua posizione sopra le righe dei preaddestrati non dice nulla su quella classe.
Quanto spesso ogni metodo si classifica primo
Ogni barra è la quota di 5.000 riestrazioni casuali dei 15 dataset, con ripetizioni consentite, in cui un metodo si classifica primo. Nove dei 12 metodi non lo fanno mai e non vengono disegnati. Le riestrazioni vengono eseguite con seed 1729. Il primo posto cambia a seconda dei dataset estratti e le quote non dicono nulla sulla distanza tra i metodi.
Un rating di Bradley-Terry modella la probabilità di ciascun metodo di battere un altro su un dataset e non può produrre un vincitore che i test di significatività non abbiano trovato. Assegna a HIVE-COTE 2 1384,6, a RocketPFN 1380,6 e a MultiRocket 1338,3, ciascuno dal primo al terzo posto nelle riestrazioni. L'ancoraggio a 1000 è relativo a questi 15 dataset e un rating è una probabilità modellata di vincere un dataset, non punti di accuratezza.
I test di Wilcoxon-Holm congelati, corretti per l'esecuzione simultanea di molti confronti, non rilevano differenze tra HIVE-COTE 2, RocketPFN, MultiRocket e Hydra. Questo non è una prova che abbiano prestazioni uguali. Hydra si classifica quarto o quinto nelle riestrazioni, il che non lo separa nemmeno dai primi tre. Quelle posizioni riassumono la stabilità, non la significatività. Nessun vincitore unico è supportato.
Quali divari sopravvivono alla correzione
Sono stati esaminati diciannove contrasti a coppie e sei sopravvivono alla correzione di Holm. Ogni punto riporta il suo intervallo al 95% e il p-value corretto con Holm nel tooltip; quegli intervalli sono sintesi bootstrap sui dataset e non sono corretti per la molteplicità, quindi solo i p-value portano la correzione di Holm.
Ogni contrasto che sopravvive è una trasformata convoluzionale che batte un modello preaddestrato.
MultiRocket ne travolge due senza perdere un dataset. 28 vittorie a 0 contro sia Chronos-2 sia TiRex, con p = 1.4e-07.
Tredici contrasti sono inconcludenti, il che non è una prova di assenza di differenze. Nessun contrasto che coinvolga DTW-1NN sopravvive alla correzione, e nemmeno alcuno nel sottoinsieme multivariato.
Ogni riga è calcolata sui dataset condivisi dalla coppia, non su un pannello comune, quindi le righe non sono una classifica unica e non vanno lette l'una contro l'altra.
I risultati dei modelli foundation sono condizionati a un protocollo di trasferimento: mean pooling dell'ultimo strato con una sonda logistica, applicato identicamente a MOMENT, Chronos-2, TiRex e Mantis-V2 e congelato prima di qualsiasi cella valutata. Un braccio post hoc rank-free ha cambiato l'estrazione dello strato di TiRex e ha portato l'accuratezza media da 0.793 a 0.805, 1.13 punti percentuali, con 23 dataset su 30 in miglioramento e sette in peggioramento. La perdita maggiore, Heartbeat con 7.98 punti, non è migliorata in nessuno dei suoi 30 ricampionamenti, quindi la media nasconde un risultato che si inverte a seconda del dataset. I dettagli sono nell'appendice.
Sei volte la profondità di split
Ogni tabella sopra esegue 5 split di addestramento/test, perché HIVE-COTE 2 e DTW-1NN eseguono solo quei cinque in base all'eccezione per celle costose congelata e la regola dei ricampionamenti abbinati riduce il resto per corrispondere. Le barre mostrano l'accuratezza media sui 30 split e il rango medio dà lo stesso ordine. Escludendo quei due, i restanti nove metodi eseguono tutti i 30 ricampionamenti stratificati con seed su 18 dataset, la profondità usata dal bake-off.
L'ordinamento regge. RocketPFN 1.694, MultiRocket 2.250, Hydra 2.889 e MiniRocket 3.833 occupano i primi quattro posti, tutti e quattro basati su feature convoluzionali casuali. Poi MOMENT 5.889, Chronos-2 6.444 e TiRex 7.056, con catch22 a 7.222 e Mantis-V2 a 7.722. Il chi-quadrato di Friedman è 105.067 con p = 3.9e-19. Cinque split non l'hanno prodotto artificialmente.
I due blocchi si separano nettamente a questa profondità. L'intervallo di rango bootstrap al 95% di MiniRocket raggiunge 4.278 e quello di MOMENT parte da 5.111, e in tutte le 5.000 estrazioni bootstrap nessun rango medio di un modello preaddestrato è entrato nell'intervallo del blocco convoluzionale.
Dieci delle dodici coppie trasformata-contro-preaddestrato sopravvivono qui alla correzione di Holm. Le due che non sopravvivono, MiniRocket su MOMENT con p = 0.108 e Hydra su MOMENT con p = 0.105, sopravvivono entrambe nel pannello primario. Holm copre la famiglia di 36 coppie di questo pannello, quindi quel conteggio e i sei sopravvissuti del pannello primario rispondono a domande diverse.
Il primo posto non è affatto più definito. RocketPFN lo ottiene nel 92.9% delle 5.000 estrazioni bootstrap sui dataset, contro il 46.6% e il 45.5% nel pannello primario, ma HIVE-COTE 2, il metodo con cui lì si divide il primo posto, è assente qui. La cricca di testa è ancora composta da tre elementi: RocketPFN, MultiRocket e Hydra. MiniRocket ne rimane di nuovo fuori, condividendo una cricca con MOMENT.
Questo è un controllo di profondità, non una replicazione indipendente. I 18 dataset contengono tutti i 15 del pannello primario più ElectricDevices, StarLightCurves e UWaveGestureLibraryAll, quindi la fragilità leave-one-dataset-out sopra rimane. È solo univariato per lo stesso motivo, data la presenza di RocketPFN. Ciò che esclude è un ordinamento che dipende da cinque split particolari.
La composizione del batch cambia le previsioni di TimEE
TimEE è un classificatore in-context il cui risultato di punta pubblicato è il primo posto in ROC-AUC sul benchmark UCR.3 Lo abbiamo eseguito su due macchine e confrontato i risultati a livello di cella.
La concordanza si interrompe esattamente alla dimensione del batch del harness di 512. L'accuratezza è identica su 270 di 270 celle dove il set di test entra in una singola chiamata, e su 146 di 325 celle dove non entra. Per ROC-AUC la divisione è 221 di 270 contro 12 di 308. Le due macchine differiscono in hardware in entrambi gli strati, quindi nessuno strato da solo prova qualcosa; il contrasto tra loro è la prova.
Per singolo dataset la rottura è più netta di quanto suggeriscano i totali per strato. Ogni dataset il cui set di test entra in una singola chiamata concorda sull'accuratezza in 30 di 30 ricampionamenti, e nessun dataset sopra la soglia raggiunge 30 di 30. ROC-AUC è peggiore su entrambi i lati della linea, scendendo sotto la metà su due dataset abbastanza piccoli da entrare.
Il meccanismo è nel sorgente. La funzione di embedding statistico calcola lo z-score di ogni feature su ogni riga nella chiamata di inferenza, sia righe di supporto sia di query, senza alcuna guardia che separi le posizioni di addestramento da quelle di valutazione. Trenta righe dopo lo stesso file applica esattamente una tale guardia a un diverso passaggio di normalizzazione. Uno scambio controllato dei peer lo conferma: mantenendo fissa una query àncora e sostituendo le altre 511 query nella sua chiamata, la probabilità prevista dell'àncora si sposta di 1.163e-04, contro un rumore di esecuzioni ripetute esattamente zero. TiCT e RocketPFN, testati in modo identico, sono bit-identici con lo stesso scambio.
Una previsione di TimEE non è quindi funzione della sola serie di input. I suoi punteggi sono riproducibili a composizione di batch fissa, quindi non può ricevere un rango confrontabile con classificatori induttivi e questo benchmark lo riporta senza. Questo qualifica l'affermazione pubblicata su ROC-AUC, poiché ROC-AUC è calcolato esattamente sulle probabilità che si sono dimostrate dipendenti dalla chiamata. Non mostra che i punteggi siano gonfiati in un senso o nell'altro, non cambia il rango pubblicato, che è stato ottenuto su una leaderboard che non possediamo, e riguarda la versione che abbiamo ispezionato.
Tre delle quattro vie di rilevamento non richiedono accesso al sorgente. Ripetere una cella due volte, scambiare i peer del batch attorno a un'àncora fissa e confrontare i risultati su due macchine stratificate per il confine del batch. Un lavoro pubblicato correlato raggruppa l'inferenza di reti prior-fitted per query di test in cluster per efficienza e non segnala dipendenza dalla composizione.4
Risultati del pannello multivariato
Una shortlist costruita sul pannello ampio non si trasferisce ai dati multivariati. MOMENT è ultimo su dieci nel pannello multivariato da 9 dataset, mentre è il modello preaddestrato con il rango più alto nel pannello ampio da 24 dataset a 6.729. Mantis-V2 va nella direzione opposta: 5.444 nel pannello multivariato contro 7.208 in quello ampio.
Non è un effetto di modalità. Il pannello ampio contiene i dataset multivariati come sottoinsieme, quindi il movimento è un contrasto tra due roster di dimensioni e composizione di task diverse, non qualcosa di misurato all'interno di un singolo metodo. Con N=9 e nessun contrasto che sopravvive alla correzione, va letto come un avvertimento contro il portare una shortlist del pannello ampio in una distribuzione multivariata, non come un risultato di selezione.
Risultati degli split raggruppati per soggetto
Gli archivi UCR e UEA distribuiscono split di addestramento/test fissi definiti sulle singole serie, senza annotazioni di soggetto o fonte su cui dividere,56 quindi ricampionarli rimescola le serie piuttosto che i soggetti. Nella stadiazione del sonno SleepEDF, dove un soggetto contribuisce con molte finestre, abbiamo anche diviso per soggetto. MiniRocket porta 8 delle 10 pieghe casuali a causa del cutoff di congelamento.
La divisione casuale riporta un'accuratezza più alta, di 0.060 per catch22 e di 0.030 per MiniRocket.
La compressione della varianza è la metà più trasferibile. La variabilità piega per piega è circa da sette a nove volte più piccola con la divisione casuale rispetto al raggruppamento per soggetto, sia sull'accuratezza per finestra sia sull'accuratezza macro per soggetto. Un modello selezionato su split casuali appare migliore e più stabile dello stesso modello valutato nel modo in cui verrà distribuito, su soggetti mai visti.
Riportiamo un divario associato allo split, mai un leakage. I dati non possono dire se il divario derivi dal leakage dell'identità del soggetto o da una variazione genuina nella difficoltà dei soggetti e nel mix degli stadi, e gli split casuali distribuiscono tale variazione su ogni set di test, il che stabilizza meccanicamente l'accuratezza. L'esperimento che separerebbe i due, epoche di test identiche con set di addestramento che contengono o non contengono i soggetti di test, è stato eseguito su PTB-XL ed è stato scartato da SleepEDF per motivi di calcolo. PTB-XL stesso conserva una sovrapposizione tra soggetti del 14.9% con la divisione casuale, quindi è un comparatore a bassa sovrapposizione, non un controllo nullo.
Dati sbilanciati: Earthquakes
L'accuratezza nasconde un ranking quasi casuale. Ogni metodo della corsia CPU riporta un'accuratezza da 0.72 a 0.78 su Earthquakes, mentre l'accuratezza bilanciata va da 0.4996 a 0.5453. Si legga 0.5 come caso solo sull'asse dell'accuratezza bilanciata; il caso per l'accuratezza ordinaria dipende dalla prevalenza di classe.
Il metodo con l'accuratezza più alta ha l'accuratezza bilanciata più bassa. catch22 con accuratezza 0.783 ottiene 0.4996 bilanciata, numericamente appena sotto 0.5. Non è stato misurato se stia letteralmente predicendo la classe maggioritaria; la cifra citata non ha incertezza né test contro 0.5.
L'inversione è locale, non una proprietà del metodo. Nell'intero pannello catch22 è chiaramente ultimo per accuratezza bilanciata, 0.726 contro 0.806 di MultiRocket. L'accuratezza bilanciata è qui una metrica post hoc, calcolata dopo il congelamento a partire dalle previsioni archiviate. DTW-1NN porta 5 ricampionamenti contro i 30 degli altri quattro metodi, quindi il suo punto si basa su meno evidenza.
Etichette hard, non probabilità
Quattro dei sei metodi della corsia CPU non restituiscono probabilità. MiniRocket, MultiRocket, Hydra e DTW-1NN mettono 1 sulla classe predetta e 0 altrove, quindi la loro perdita logaritmica è l'accuratezza sotto un altro nome. È uguale al tasso di errore moltiplicato per 36.0437 in tutte le 2.465 celle in cui è stata registrata la perdita logaritmica, entro 7.1e-15. Quella costante è la penalità che scikit-learn assegna a una probabilità zero sulla classe vera.
La ricetta si comporta come documentato. I tre classificatori convoluzionali usano di default una testa ridge senza output di probabilità, e la libreria colma il vuoto con un vettore one-hot; DTW-1NN con un vicino ha la stessa forma per costruzione.7
Il ROC-AUC calcolato per loro misura quindi l'etichetta, non un ranking. Sui 27 dataset in cui tutti e sei hanno ROC-AUC completo, catch22 registra 0.884 contro 0.866 di MultiRocket, pur essendo indietro di 7.2 punti di accuratezza, 0.782 contro 0.854. Si legga come catch22 ha un punteggio utilizzabile e MultiRocket non ne ha, non come catch22 ordina meglio i casi.
Solo due dei sei possono essere confrontati sulle probabilità. Sui 22 dataset con perdita logaritmica completa, HIVE-COTE 2 ha una media di 0.344 contro 0.527 di catch22, mediane 0.265 e 0.371, ed è più basso su 19 di 22. Entrambe le cifre descrivono output archiviati. Nessun esperimento di calibrazione è stato eseguito e nessun test congelato li copre.
La tabella dell'accuratezza non cambia. Ciò che non riporta è questo: un carico di lavoro che classifica o soglia i casi non ottiene nulla da sogliare dalla ricetta predefinita di MiniRocket, MultiRocket, Hydra o DTW-1NN. Non è stata eseguita una testa probabilistica sulle stesse feature.
Calcolo registrato
Il grafico mostra celle abbinate: ogni metodo della corsia CPU ristretto ai 28 dataset che tutti e sei hanno eseguito, ai ricampionamenti da 0 a 4, ovvero 140 celle ciascuno. Ore-core CPU registrate su quelle celle: HIVE-COTE 2 694.23, DTW-1NN 356.82, MultiRocket 2.81, Hydra 2.12, catch22 0.54 e MiniRocket 0.48.
La restrizione è ciò che rende significativo un rapporto. Il calcolo registrato totale è di 1.496.5 ore-core sull'intera corsia CPU, di cui HIVE-COTE 2 rappresenta 804.8: 694.2 sulle sue 140 celle classificate e il resto su quattro celle diagnostiche post hoc escluse da ogni tabella. MultiRocket rappresenta 26.2 su 990 celle classificate. Questi due totali coprono quantità di lavoro diverse, quindi nessun rapporto tra loro confronta i metodi.
Le celle abbinate ne rendono possibile uno. Limitando ogni metodo della corsia CPU ai 28 dataset che tutti e sei hanno eseguito, ai ricampionamenti da 0 a 4, si ottengono 140 celle ciascuno. Ore-core CPU registrate: HIVE-COTE 2 694.23, DTW-1NN 356.82, MultiRocket 2.81, Hydra 2.12, catch22 0.54 e MiniRocket 0.48.
Su quegli stessi 28 dataset HIVE-COTE 2 batte MultiRocket su 18 e perde su 9, un divario di accuratezza media di 0.012 che non sopravvive alla correzione di Holm. Si tratta di 247 volte il tempo CPU per una differenza che questo benchmark non può rilevare. DTW-1NN, la baseline che il protocollo dell'archivio richiede per ogni risultato pubblicato, costa 747 volte MiniRocket sulle stesse celle.
Ogni metodo qui è stato eseguito single-threaded con n_jobs = 1, una cella per processo, quindi il tempo di parete registrato è tempo core. Due limiti si applicano ancora a entrambi i rapporti. I tempi sono throughput con qualunque altro carico la macchina stesse eseguendo, non latenza in solitaria. E HIVE-COTE 2 ha girato nella propria corsia di configurazione mentre gli altri cinque condividevano una corsia, quindi il suo rapporto attraversa due corsie; il rapporto tra DTW-1NN e MiniRocket è misurato all'interno di una singola corsia.
Da questo benchmark non è possibile alcun confronto di costo tra metodi classici e modelli foundation, e non ne facciamo nessuno. I sei metodi della corsia GPU non hanno registrato tempo di parete. TimEE ha un tempo di parete registrato ma è escluso dal grafico perché non ha rango.
Metodi confrontati
HIVE-COTE 2
Primo per rango medio (2.400) nel pannello primario, non separabile da RocketPFN. Ha eseguito 140 celle classificate per 694.2 ore-core registrate, il metodo più costoso della corsia CPU registrata, e non ha completato FaceDetection (144 canali). Un meta-ensemble eterogeneo su rappresentazioni shapelet, dictionary, interval e convoluzionali.8
RocketPFN
Primo per accuratezza media (0.905), non separabile da HIVE-COTE 2. Bit-identico nel test di scambio dei peer. Solo univariato, quindi non entra mai nel pannello UEA. Combina feature convoluzionali della famiglia ROCKET con la classificazione in-context tramite il modello foundation tabulare TabPFN v2.5, quindi nessun modello viene addestrato sul dataset di destinazione; il suo articolo riporta parità con HIVE-COTE 2 a 0.900 di accuratezza media su 92 dataset UCR.2
MultiRocket
Terzo per rango medio (2.800) e il miglior record a coppie: tutti e quattro i suoi contrasti ispezionati contro modelli preaddestrati sopravvivono a Holm, due con 28 vittorie a 0. 26.2 ore-core registrate per 990 celle. Estende MiniRocket con più operatori di pooling e differenze del primo ordine.9
Hydra
Rango medio 4.100; la sua vittoria su MOMENT (22/6) sopravvive alla correzione. Un metodo convoluzionale in stile dictionary: i kernel competono in gruppi e i conteggi dei kernel vincenti formano la rappresentazione.10
MiniRocket
Rango medio 4.700 con 4.9 ore-core registrate per 990 celle, il metodo forte più economico della corsia CPU registrata; la sua vittoria su MOMENT (24/4) sopravvive alla correzione. Una trasformazione a kernel convoluzionali casuali quasi deterministica con un classificatore lineare.11
MOMENT
Modello preaddestrato con il rango più alto nel pannello primario univariato (6.633); perde contro tutte e tre le trasformate convoluzionali con contrasti che sopravvivono. Un modello basato su T5 da 385M parametri preaddestrato su un corpus multi-dominio per previsione, classificazione, rilevamento di anomalie e imputazione.12
Chronos-2
Rango medio 7.967; perde contro MultiRocket 28/0. Un modello foundation di previsione usato qui come estrattore di embedding congelato, che non è il suo compito nativo.13
TiRex
Rango medio 8.433; perde contro MultiRocket 28/0. Un modello di previsione zero-shot basato su xLSTM,14 usato anche qui come estrattore congelato. Nel braccio di sensibilità post hoc, cambiando l'estrazione dell'ultimo strato in concatenazione di tutti gli strati ha aumentato l'accuratezza media di 1.13 punti percentuali nel suo pannello da 30 dataset: 23 dataset sono migliorati e sette sono peggiorati, Heartbeat di 7.98 punti senza che nessuno dei suoi 30 ricampionamenti migliorasse. Il risultato congelato dell'ultimo strato e il rango restano primari; il braccio di sensibilità non ha rango.
Mantis-V2
Rango medio 9.733 sull'univariato e 5.444 sul pannello multivariato; perde contro MultiRocket 24/3. Non ha completato FaceDetection: 144 canali sovraccaricano la sua testa di classificazione nativa. Un modello di classificazione leggero preaddestrato in modo contrastivo con dati sintetici e strategie test-time aggiunte nella V2.15
TimEE
Riportato senza rango; si veda il risultato sulla composizione del batch sopra. Accuratezza media 0.841 sui 21 dataset del suo pannello riportato, calcolata a composizione di batch fissa. Due esclusioni dichiarate prima dei risultati si applicano: NonInvasiveFetalECGThorax1 è parziale a 5 di 30 ricampionamenti, e Phoneme è riportato solo al suo split d'archivio. Un modello da 4.5M parametri meta-addestrato su task sintetici che classifica end-to-end in-context, in un singolo passaggio in avanti a partire da un set di supporto etichettato.3
TiCT
Rango medio 10.200. Solo univariato; il suo runner è stato l'unico a imporre la regola di validità per classi rare su Phoneme, contribuendo con una cella valida dove altre corsie ne hanno eseguite 30. Bit-identico nel test di scambio dei peer. Un transformer in-context preaddestrato su dati sintetici con codifica delle etichette basata su bit per conteggi di classi arbitrari.16
DTW-1NN
Rango medio 9.900. Non ha completato StarLightCurves, un DNF di costo dichiarato a 95 ore per una cella non divisibile. Un nearest-neighbour con Dynamic Time Warping, la baseline più longeva del campo.
catch22
Rango medio 8.700 nel pannello primario. Ventidue feature riassuntive fisse e interpretabili che alimentano un classificatore semplice.17
Quando scegliere un modello foundation invece di un classificatore classico
- Molti dati di addestramento etichettati: ogni contrasto che sopravvive alla correzione qui favorisce una trasformata convoluzionale, e due dei tre, MultiRocket e Hydra, si trovano nella cricca di testa insieme a HIVE-COTE 2 e RocketPFN.
- Etichette fortemente limitate o distribuzione a freddo: i modelli in-context e zero-shot sono i candidati, e questo è il regime che il nostro benchmark non misura. Tutti i nostri pannelli usano gli split di addestramento completi dell'archivio.
- Dati multivariati: verificare prima la copertura nativa. Due dei tre metodi in-context in questo roster sono solo univariati.
- Massima accuratezza indipendentemente dal calcolo: HIVE-COTE 2 e RocketPFN non sono separabili sulla base di queste evidenze. Questo benchmark non separa né la loro accuratezza né il loro calcolo, perché RocketPFN non ha tempi registrati.
Un budget di calcolo che conta: sulle 140 celle abbinate sopra, MultiRocket usa 1/247 delle ore-core CPU di HIVE-COTE 2 e nessuna differenza di accuratezza tra loro sopravvive alla correzione su quei dataset. - Requisiti di verificabilità: preferire metodi le cui previsioni sono riproducibili dal solo input. Il risultato sulla composizione del batch sopra è il caso di avvertimento.
Che cos'è la classificazione delle serie temporali
La classificazione delle serie temporali addestra un modello su sequenze numeriche ordinate ed etichettate per prevedere una classe discreta per una serie non vista: diagnosi ECG, riconoscimento dell'attività umana da dispositivi indossabili, rilevamento di guasti industriali. Si differenzia dalla previsione, che produce valori futuri anziché un'etichetta di classe. I modelli tabulari non codificano l'ordinamento dei valori come bias induttivo; trattano ogni passo temporale come una colonna indipendente.
I metodi classici addestrano un nuovo modello per ogni dataset. Un modello foundation per serie temporali viene preaddestrato una volta su un ampio corpus, poi applicato a nuovi dataset zero-shot, tramite una sonda leggera oppure in-context a partire da una manciata di esempi etichettati forniti al momento dell'inferenza. Se questo preaddestramento attualmente garantisca accuratezza nella classificazione sugli archivi standard, sotto un protocollo controllato, è la domanda che questo benchmark misura.
Metodologia del benchmark sulla classificazione delle serie temporali
Metodi. Quattro famiglie: modelli foundation preaddestrati valutati tramite un protocollo di trasferimento (MOMENT, Chronos-2, TiRex, Mantis-V2), modelli in-context (TimEE, TiCT, RocketPFN), trasformate convoluzionali (MiniRocket, MultiRocket, Hydra) e riferimenti classici (HIVE-COTE 2, DTW-1NN, catch22).
Dati. 23 dataset univariati UCR e 10 dataset multivariati UEA,56 più un livello non-IID separato su SleepEDF e PTB-XL. 14.638 celle registrate, suddivise nella tabella di copertura qui sotto.
Copertura. Le celle valutate non sono distribuite uniformemente tra i metodi e i denominatori decidono quali confronti sono possibili.
Ogni confronto classificato viene eseguito sull'intersezione dei casi completi dei metodi che nomina, mai sulla copertura di un singolo metodo, ed è questo che fa sì che le 140 celle di HIVE-COTE 2 e le 2.760 di RocketPFN compaiano nella stessa tabella. L'export completo contiene 14.638 righe: queste 11.874 celle valutate, il braccio di riproduzione del protocollo dell'articolo da 2.760 celle di RocketPFN e 4 celle diagnostiche post hoc di HIVE-COTE 2.
Ricampionamento. r0 è lo split di addestramento/test dell'archivio; da r1 a r29 sono mescolamenti stratificati alle proporzioni dell'archivio, con seed 1729+r. L'unità inferenziale è il dataset: i ricampionamenti vengono mediati all'interno di un dataset prima di confrontare i metodi. HIVE-COTE 2 e DTW-1NN eseguono 5 ricampionamenti perché il loro costo per cella è di uno o due ordini di grandezza più alto, e la tabella primaria limita ogni metodo agli stessi 5 ricampionamenti abbinati. Lo split d'archivio r0 è sistematicamente più difficile dei ricampionamenti con seed su 8 dei 33 dataset, fino a 0.218 di accuratezza, quindi i cinque ricampionamenti abbinati non sono estrazioni intercambiabili.
Protocollo di trasferimento. Ogni modello foundation di riferimento esegue la stessa pipeline: codifica per variabile, ultimo strato dell'encoder, mean-pool sui token di contesto validi, normalizzazione L2 per variabile, concatenazione dei canali, standardizzazione solo sul train, sonda di regressione logistica. Congelato il 2026-07-24, prima di qualsiasi cella valutata.
Statistiche. Test omnibus di Friedman, poi Wilcoxon signed-rank a coppie con correzione di Holm su tutti i 19 contrasti ispezionati, su medie a livello di dataset e solo su pannelli a casi completi. L'omnibus supporta solo che i ranghi differiscano da qualche parte; ogni affermazione a coppie deriva dai contrasti corretti.
Congelamento. I dati sono stati congelati il 2026-07-29 03:00 UTC, con regole di esclusione scritte prima che i risultati in sospeso fossero noti. Una cella ha terminato 22 minuti dopo il cutoff ed è esclusa in base alla regola predefinita. La release supera 120 controlli di asserzione meccanici, inclusi il confronto hash di ogni file di input, la rigenerazione della tabella primaria dall'export e l'applicazione delle esclusioni dichiarate dietro la cifra pubblicata di TimEE sia nell'articolo sia nelle tabelle della release.
Metriche. ROC-AUC era la metrica primaria dichiarata. Non è disponibile per 6 dei 7 modelli foundation di riferimento, le cui esecuzioni archiviano punteggi di decisione o previsioni di classe invece di probabilità calibrate, quindi l'accuratezza è diventata la metrica di confronto. TimEE è l'unico dei sette a disporre di ROC-AUC. Lo dichiariamo esplicitamente invece di rietichettare l'accuratezza come pre-specificata. Accuratezza bilanciata, macro-F1 e perdita logaritmica sono analisi di sensibilità post hoc sul sottoinsieme coperto.
Riproducibilità. Le previsioni per singola istanza sono archiviate per tutti i 13 metodi e per tutti i 12 della tabella primaria; ogni previsione rigenerata riproduce il proprio scalare congelato con una differenza massima di 0.000e+00 (4.260 celle della corsia CPU riverificate il 2026-08-02, zero orfane). La tabella primaria è completamente ricalcolabile dalle previsioni rilasciate.
Metodi non inclusi in questo benchmark
Modelli pubblicati rilevanti per la TSC che non abbiamo valutato, elencati affinché il confine del roster sia esplicito. Nessuna delle affermazioni qui presenti è una nostra misurazione. UniTS è un modello multi-task unificato che copre classificazione, previsione, imputazione e rilevamento di anomalie.18 TiViT converte le serie in immagini e classifica con Vision Transformer preaddestrati congelati.19 UniShape è un modello foundation shape-aware progettato per la classificazione, con un adattatore shape-aware, accettato ad AAAI 2026.20 GPT4TS, pubblicato anche come One Fits All, usa una backbone GPT-2 i cui blocchi di self-attention e feedforward restano congelati mentre vengono addestrati i componenti di input, normalizzazione e output.21 TIC-FM è un classificatore zero-shot in-context che prevede tutte le istanze di test in un singolo passaggio in avanti;22 leggere il suo design a chiamata singola come la stessa classe di esposizione del risultato sulla composizione del batch sopra è una nostra inferenza dalla descrizione pubblicata, non un risultato testato.
Limitazioni
- Non esiste alcun registro di sovrapposizione del preaddestramento per nessun modello preaddestrato: nessuno pubblica una dichiarazione a livello di dataset sul fatto che serie UCR/UEA compaiano nel proprio corpus di preaddestramento, quindi il trasferimento non può essere separato dall'esposizione precedente. Trattare le sconfitte come sicure si basa su un presupposto che nessun registro a livello di dataset può verificare: che l'esposizione precedente, laddove avvenuta, abbia favorito questi modelli anziché danneggiarli. Con questo presupposto restano indietro nonostante il vantaggio e le sconfitte reggono; qualsiasi vittoria di un modello preaddestrato, per la stessa logica, non può essere attribuita in modo netto al trasferimento.
- I risultati dei modelli foundation sono condizionati all'unico protocollo di trasferimento congelato. Il braccio post hoc su TiRex ha cambiato solo l'estrazione degli strati e ha aumentato l'accuratezza media di 1.13 punti percentuali peggiorando sette dei suoi 30 dataset, Heartbeat di 7.98 punti con 0 dei suoi 30 ricampionamenti in miglioramento. Ha testato un solo modello, non ha rango e non stabilisce l'effetto per gli altri modelli foundation.
- Tutti i tempi di parete sono throughput sotto carico con concorrenza variabile su una macchina condivisa. Sei dei 13 metodi non ne registrano.
- Le evidenze coprono solo problemi di dimensioni d'archivio. Nulla qui riguarda la scalabilità.
- Il benchmark esamina una versione di ciascun metodo alla sua data di congelamento.
Insidie comuni nel benchmarking della classificazione delle serie temporali
Sovrapposizione tra preaddestramento e test. Una verifica del 2025 ha tracciato 401 dataset attraverso 22 modelli foundation per serie temporali pubblicati e ha rilevato che solo il 6% non era mai comparso in alcun corpus di preaddestramento o fine-tuning.23 Nessun modello del nostro roster pubblica una dichiarazione di sovrapposizione a livello di dataset, motivo per cui la nostra sezione sulle limitazioni tratta trasferimento ed esposizione precedente come inseparabili.
Disegno dello split. L'archivio UCR standard fornisce un unico split di addestramento/test fisso; la pratica moderna ricampiona e il nostro pannello SleepEDF mostra perché la struttura dei soggetti richieda più del ricampionamento: il solo disegno dello split ha spostato l'accuratezza riportata fino a 0.060 e ne ha compresso la varianza di circa sette-nove volte. Nessuna singola cifra qui è una proprietà del dataset; ciascuna è una proprietà del dataset sotto un determinato disegno di split.
Molteplicità. Confrontare molti classificatori su molti dataset senza correzione produce risultati artefatti. Lo strumentario standard è il Wilcoxon signed-rank per coppie e la correzione familywise in stile Holm su ogni contrasto ispezionato,2425 e la correzione deve coprire ogni contrasto ispezionato, non solo quelli riportati. In questo benchmark tale disciplina ha eliminato 13 dei 19 contrasti.
Appendice: sensibilità dell'estrazione di TiRex
Questo braccio post hoc usa gli stessi 30 dataset, 30 split di ricampionamento, scaler e sonda logistica del risultato congelato di TiRex. Cambia solo l'estrazione delle feature, dall'ultimo strato dell'encoder a rappresentazioni concatenate di tutti i 12 strati. Il braccio è rank-free e non altera il benchmark congelato.
L'accuratezza media è passata da 0.793 a 0.805, una variazione di 1.13 punti percentuali, con un intervallo bootstrap sui dataset con seed da +0.15 a +2.06 punti. Un test di Wilcoxon signed-rank a coppie sui 30 delta dei dataset dà una W bilaterale esatta di 92.0 con p=0.003. Quel test è esplorativo: è stato eseguito dopo il congelamento, si colloca al di fuori della famiglia di 19 contrasti di Holm che governa ogni affermazione corretta qui presente e non ha rango.
Auer et al. classificano TiRex primo tra i modelli foundation di previsione usando feature concatenate degli strati e una Random Forest, e la loro ablazione riporta un effetto di strato più ampio di 5 punti.26 I due studi differiscono per dataset, roster di modelli, classificatore e filtraggio sulla lunghezza delle serie, quindi 1.13 e 5 punti sono stime di sensibilità specifiche del protocollo piuttosto che stime concorrenti di un unico effetto. Questo braccio non riproduce né confuta la loro classifica e non identifica la causa della differenza di rango tra gli studi. Stabilisce la sensibilità allo strato per TiRex all'interno di questo benchmark. Non generalizza l'effetto agli altri modelli foundation né identifica la migliore prestazione di classificazione raggiungibile da alcun modello.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{Benchmark sulla classificazione delle serie temporali: modelli foundation vs metodi classici}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/time-series-classification}},
note = {AIMultiple. Consultato il 24 Agosto 2026}
}Risultati e timestamp di 61 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente 4 file CSV.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.