Services
Contactez-nous

Benchmark de classification de séries temporelles: modèles de fondation contre méthodes classiques

Berk Kalelioğlu
Berk Kalelioğlu
mis à jour le 24 août 2026

Nous avons évalué 13 méthodes de classification de séries temporelles, depuis des modèles de fondation de séries temporelles pré-entraînés jusqu'à une référence à 22 caractéristiques datant de 2019, sur 33 jeux de données UCR/UEA sous un protocole gelé unique. Cela représente 14 638 cellules méthode-jeu de données-rééchantillonnage enregistrées, dont 11 874 ont été évaluées.

Résultats du benchmark TSC

Loading Chart

Le graphique compare 12 méthodes sur les 15 jeux de données univariés que chacune a terminés, chaque jeu de données étant exécuté sur les mêmes 5 divisions entraînement/test. Les barres sont triées par exactitude moyenne. Le tableau ci-dessous inclut également le rang moyen, la position moyenne qu'une méthode occupe au sein d'un jeu de données, et il ordonne différemment les 12 mêmes méthodes.

Aucun gagnant unique. HIVE-COTE 2 se classe premier au rang moyen (2.400) et RocketPFN premier en exactitude moyenne (0.905). Sous un bootstrap de jeux de données à 5 000 tirages, la première place revient à HIVE-COTE 2 dans 46.6 % des tirages, à RocketPFN dans 45.5 % et à MultiRocket dans 7.9 %. Les deux classements sont en désaccord et le bootstrap se partage presque également, si bien que nommer l'un ou l'autre serait un artefact de la métrique choisie.

Le groupe de tête est plus petit que ne le suggère le tableau. La clique de Wilcoxon-Holm est HIVE-COTE 2, RocketPFN, MultiRocket et Hydra. MiniRocket, à six dixièmes de rang derrière Hydra à 4.700, n'en fait pas partie : l'appartenance provient des tests par paires corrigés, et non de la position des rangs.

Sur ce panel, les transformées occupent les rangs 3, 4 et 5 et les modèles pré-entraînés les rangs 6, 7, 8 et 10. MOMENT, le modèle pré-entraîné le mieux classé à 6.633, se situe presque deux rangs complets en dessous de MiniRocket.

catch22, publié en 2019 avec 22 caractéristiques fixes, se situe dans la bande des pré-entraînés à 8.700, devant Mantis-V2 (9.733) et derrière TiRex (8.433). À une profondeur complète de 30 rééchantillonnages, il reste dans cette bande, à la fois sur le panel de 18 jeux de données ci-dessous à 7.222 et sur une variante à 27 jeux de données et huit méthodes qui exclut RocketPFN.

Le rang et l'exactitude divergent aussi en bas du tableau. DTW-1NN a une exactitude moyenne moins bonne que TiCT (0.756 contre 0.776) et un meilleur rang moyen (9.900 contre 10.200). La métrique que vous rapportez modifie l'ordre dans les deux moitiés du tableau.

Seul le milieu du tableau est stable. Retirer un seul jeu de données modifie l'ordre dans 10 cas sur 15. Six de ces cas sont l'échange entre HIVE-COTE 2 et RocketPFN ; Mantis-V2 et DTW-1NN échangent leurs places dans six cas et DTW-1NN et TiCT dans deux. Les positions 3 à 9 ne bougent jamais.

La métrique de comparaison est l'exactitude car la métrique principale déclarée, ROC-AUC, n'est pas disponible pour 6 des 7 modèles de fondation de référence. Le panel est uniquement univarié : TiCT et RocketPFN n'ont pas de prise en charge multivariée native, de sorte que la règle des cas complets écarte tous les 10 jeux de données multivariés. Les lignes des modèles de fondation mesurent ces modèles sous un protocole de transfert gelé unique. TimEE n'a pas de rang, pour la raison expliquée ci-dessous. Une part de première place au bootstrap est la fréquence de classement en première position sur des collections de jeux de données rééchantillonnées, et rien de plus.

Le classement lui-même reproduit le bake-off de 2024, qui a établi que HIVE-COTE 2 et la famille ROCKET dominent cette classe de problèmes et indique que HIVE-COTE 2 est beaucoup plus lent.1 La contribution ici est une mesure contrôlée de manière indépendante sur un effectif de 2026 sous un protocole commun unique, avec des séparations quantifiées après correction familywise.

RocketPFN est constitué de caractéristiques ROCKET transmises à TabPFN,2 un modèle tabulaire en contexte plutôt qu'un modèle de fondation de séries temporelles pré-entraîné, de sorte que sa position au-dessus des lignes pré-entraînées ne dit rien sur cette classe.

Fréquence de classement en première position de chaque méthode

Chaque barre représente la part des 5 000 rééchantillonnages aléatoires des 15 jeux de données, avec remise, dans laquelle une méthode se classe première. Neuf des 12 méthodes ne le sont jamais et ne sont pas représentées. Les rééchantillonnages sont exécutés à la graine 1729. La première place varie selon les jeux de données tirés, et les parts ne disent rien sur l'écart entre les méthodes.

Un modèle de Bradley-Terry modélise la chance de chaque méthode de battre une autre sur un jeu de données, et il ne peut pas fabriquer un gagnant que les tests de significativité n'ont pas trouvé. Il estime HIVE-COTE 2 à 1384.6, RocketPFN à 1380.6 et MultiRocket à 1338.3, chacun d'eux se classant premier à troisième selon les rééchantillonnages. L'ancre de 1000 est relative à ces 15 jeux de données, et une note modélise les chances de gagner un jeu de données, pas des points d'exactitude.

Les tests gelés de Wilcoxon-Holm, corrigés pour la réalisation de nombreuses comparaisons à la fois, ne détectent aucune différence entre HIVE-COTE 2, RocketPFN, MultiRocket et Hydra. Cela ne prouve pas qu'ils sont équivalents. Hydra se classe quatrième ou cinquième selon les rééchantillonnages, ce qui ne le sépare pas non plus des trois premiers. Ces positions résument une stabilité, pas une significativité. Aucun gagnant unique n'est soutenu.

Quels écarts survivent à la correction

Dix-neuf contrastes par paires ont été examinés et six survivent à la correction de Holm. Chaque point porte son intervalle à 95 % et sa p-value ajustée de Holm dans l'infobulle ; ces intervalles sont des résumés de bootstrap sur jeux de données et ne sont pas ajustés pour la multiplicité, de sorte que seules les p-values portent la correction de Holm.

Chaque contraste survivant est une transformée convolutionnelle battant un modèle pré-entraîné.

MultiRocket balaye deux d'entre eux sans perdre un jeu de données. 28 victoires pour 0 contre à la fois Chronos-2 et TiRex, à p = 1.4e-07.

Treize contrastes sont non concluants, ce qui ne prouve pas l'absence de différence. Rien n'impliquant DTW-1NN ne survit à la correction, et rien sur le sous-ensemble multivarié non plus.

Chaque ligne est calculée sur les jeux de données que la paire partage, et non sur un panel commun. Les lignes ne constituent donc pas un classement global et ne peuvent pas être comparées entre elles.

Les résultats des modèles de fondation sont conditionnés par un protocole de transfert unique : regroupement par moyenne de la dernière couche avec une sonde logistique, appliqué de manière identique à MOMENT, Chronos-2, TiRex et Mantis-V2 et gelé avant toute cellule évaluée. Un bras post hoc, sans rang, a modifié l'extraction de couche de TiRex et a fait passer l'exactitude moyenne de 0.793 à 0.805, soit 1.13 point de pourcentage, avec 23 jeux de données sur 30 en amélioration et sept en dégradation. La plus grande perte, Heartbeat à 7.98 points, ne s'est améliorée sur aucun de ses 30 rééchantillonnages, de sorte que la moyenne masque un résultat qui s'inverse selon le jeu de données. Les détails figurent en annexe.

Six fois la profondeur de division

Tous les tableaux ci-dessus utilisent 5 divisions entraînement/test, car HIVE-COTE 2 et DTW-1NN n'exécutent que ces cinq-là sous l'exception gelée des cellules coûteuses, et la règle de rééchantillonnage apparié aligne le reste sur ce nombre. Les barres montrent l'exactitude moyenne sur les 30 divisions, et le rang moyen donne le même ordre. Si l'on retire ces deux-là, les neuf méthodes restantes exécutent l'ensemble des 30 rééchantillonnages stratifiés aléatoires sur 18 jeux de données, profondeur utilisée par le bake-off.

L'ordre tient. RocketPFN 1.694, MultiRocket 2.250, Hydra 2.889 et MiniRocket 3.833 occupent les quatre premières places, toutes quatre construites sur des caractéristiques convolutionnelles aléatoires. Puis MOMENT 5.889, Chronos-2 6.444 et TiRex 7.056, avec catch22 à 7.222 et Mantis-V2 à 7.722. Le chi-carré de Friedman est de 105.067 à p = 3.9e-19. Les cinq divisions ne l'ont pas fabriqué.

Les deux blocs se séparent nettement à cette profondeur. L'intervalle de rang bootstrap à 95 % de MiniRocket atteint 4.278 et celui de MOMENT commence à 5.111, et sur l'ensemble des 5 000 tirages bootstrap, aucun rang moyen de modèle pré-entraîné n'a croisé l'intervalle du bloc convolutionnel.

Dix des douze paires transformée contre pré-entraîné survivent ici à la correction de Holm. Les deux qui n'y survivent pas, MiniRocket sur MOMENT à p = 0.108 et Hydra sur MOMENT à p = 0.105, survivent toutes deux sur le panel principal. La correction de Holm couvre la famille propre de ce panel de 36 paires, de sorte que ce décompte et les six survivants du panel principal répondent à des questions différentes.

La première place n'est pas mieux établie. RocketPFN l'obtient dans 92.9 % des 5 000 tirages bootstrap de jeux de données, contre 46.6 % et 45.5 % sur le panel principal, mais HIVE-COTE 2, la méthode avec laquelle il partage la première place là-bas, est absent ici. La clique de tête reste large de trois : RocketPFN, MultiRocket et Hydra. MiniRocket en est de nouveau exclu, partageant une clique avec MOMENT.

Il s'agit d'une vérification de profondeur, pas d'une réplication indépendante. Les 18 jeux de données contiennent l'ensemble des 15 du panel principal plus ElectricDevices, StarLightCurves et UWaveGestureLibraryAll, de sorte que la fragilité par retrait d'un jeu de données mentionnée ci-dessus tient toujours. Le panel est uniquement univarié pour la même raison, RocketPFN étant présent. Ce qu'il exclut, c'est un ordre qui dépend de cinq divisions particulières.

La composition des lots modifie les prédictions de TimEE

TimEE est un classifieur en contexte dont le titre publié est la première place en ROC-AUC sur le benchmark UCR.3 Nous l'avons exécuté sur deux machines et avons comparé les résultats au niveau des cellules.

L'accord se rompt exactement à la taille de lot du harnais de 512. L'exactitude est identique sur 270 des 270 cellules où l'ensemble de test tient dans un seul appel, et sur 146 des 325 cellules où ce n'est pas le cas. Pour la ROC-AUC, la séparation est de 221 sur 270 contre 12 sur 308. Les deux machines diffèrent par le matériel dans les deux strates, de sorte qu'aucune strate ne prouve rien à elle seule ; le contraste entre elles est la preuve.

Par jeu de données, la rupture est plus nette que ne le suggèrent les totaux par strate. Chaque jeu de données dont l'ensemble de test tient dans un seul appel concorde sur l'exactitude dans 30 des 30 rééchantillonnages, et aucun jeu de données au-dessus du seuil n'atteint 30 sur 30. La ROC-AUC est pire des deux côtés de la ligne, tombant sous la moitié sur deux jeux de données assez petits pour tenir.

Le mécanisme se trouve dans le code source. La fonction statistique d'incorporation normalise chaque caractéristique par z-score sur chaque ligne de l'appel d'inférence, lignes de support et de requête confondues, sans garde séparant les positions d'entraînement de celles d'évaluation. Trente lignes plus loin, le même fichier applique exactement une telle garde à une étape de normalisation différente. Un échange par les pairs contrôlé le confirme : en maintenant une requête d'ancrage fixe et en remplaçant les 511 autres requêtes de son appel, la probabilité prédite de l'ancre est décalée de 1.163e-04, contre un bruit de répétition exactement nul. TiCT et RocketPFN, testés de manière identique, sont bit-identiques sous le même échange.

Une prédiction de TimEE n'est donc pas une fonction de la série d'entrée seule. Ses scores sont reproductibles à composition de lot fixe, de sorte qu'elle ne peut pas recevoir un rang comparable à celui des classifieurs inductifs, et ce benchmark la rapporte sans rang. Cela nuance l'affirmation publiée de ROC-AUC, puisque la ROC-AUC est calculée exactement à partir des probabilités dont on a montré qu'elles dépendent de l'appel. Cela ne montre pas que les scores sont gonflés dans un sens ou dans l'autre, cela ne change pas le rang publié, acquis sur un classement que nous ne détenons pas, et cela couvre la version que nous avons inspectée.

Trois des quatre voies de détection ne nécessitent pas d'accès au code source. Répéter une cellule deux fois, permuter les pairs de lot autour d'une ancre fixe, et comparer les résultats entre deux machines stratifiées par la frontière de lot. Des travaux publiés connexes traitent l'inférence de réseaux préalablement ajustés par regroupement des requêtes de test en grappes pour l'efficacité et ne signalent pas de dépendance à la composition.4

Résultats du panel multivarié

Une liste restreinte établie sur le panel large ne s'étend pas aux données multivariées. MOMENT est dernier sur dix sur le panel multivarié de 9 jeux de données, alors qu'il est le modèle pré-entraîné le mieux classé sur le panel large de 24 jeux de données à 6.729. Mantis-V2 va dans l'autre sens : 5.444 sur le panel multivarié contre 7.208 sur le panel large.

Ce n'est pas un effet de modalité. Le panel large contient les jeux de données multivariés comme sous-ensemble, de sorte que le mouvement est un contraste entre deux listes de taille et de composition de tâches différentes, et non quelque chose de mesuré à l'intérieur de l'une ou l'autre méthode. Avec N=9 et aucun contraste ne survivant à la correction, il faut le lire comme un avertissement contre le transfert d'une liste restreinte du panel large vers un déploiement multivarié, et non comme un résultat de sélection.

Résultats des divisions groupées par sujet

Les archives UCR et UEA fournissent des divisions entraînement/test fixes définies sur des séries individuelles, sans annotation de sujet ou de source pour diviser,56 de sorte que les rééchantillonner remélange des séries plutôt que des sujets. Sur la stadification du sommeil SleepEDF, où un sujet contribue à de nombreuses fenêtres, nous avons également divisé par sujet. MiniRocket porte 8 des 10 plis aléatoires en raison de la limite de gel.

La division aléatoire rapporte une exactitude plus élevée, de 0.060 pour catch22 et de 0.030 pour MiniRocket.

La compression de variance est la moitié la plus transférable. La variabilité pli à pli est environ sept à neuf fois plus faible sous division aléatoire que sous regroupement par sujet, tant pour l'exactitude par fenêtre que pour l'exactitude macro par sujet. Un modèle sélectionné sur des divisions aléatoires semble meilleur et plus stable que le même modèle évalué tel qu'il sera déployé, sur des sujets non vus.

Nous rapportons un écart associé à la division, jamais une fuite. Les données ne peuvent pas dire si l'écart provient d'une fuite d'identité de sujet ou d'une variation réelle de la difficulté des sujets et du mélange des stades, et les divisions aléatoires répartissent cette variation sur chaque ensemble de test, ce qui stabilise mécaniquement l'exactitude. L'expérience qui séparerait les deux, des époques de test identiques avec des ensembles d'entraînement contenant ou non les sujets de test, a été exécutée sur PTB-XL et abandonnée sur SleepEDF pour des raisons de calcul. PTB-XL lui-même conserve un chevauchement de mêmes sujets de 14.9 % sous division aléatoire, ce qui en fait un comparateur à faible chevauchement, et non un contrôle nul.

Données déséquilibrées : Earthquakes

L'exactitude masque un classement proche du hasard. Toute méthode du couloir CPU rapporte une exactitude de 0.72 à 0.78 sur Earthquakes, tandis que l'exactitude équilibrée va de 0.4996 à 0.5453. Lisez 0.5 comme le hasard uniquement sur l'axe d'exactitude équilibrée ; le hasard pour l'exactitude ordinaire dépend de la prévalence des classes.

La méthode avec l'exactitude la plus élevée a l'exactitude équilibrée la plus basse. catch22 à une exactitude de 0.783 obtient une exactitude équilibrée de 0.4996, numériquement juste en dessous de 0.5. On n'a pas mesuré s'il prédit littéralement la classe majoritaire ; le chiffre cité ne porte ni incertitude ni test contre 0.5.

L'inversion est locale, pas une propriété de la méthode. Sur l'ensemble du panel, catch22 est clairement dernier en exactitude équilibrée, 0.726 contre 0.806 pour MultiRocket. L'exactitude équilibrée est ici une métrique post hoc, calculée après le gel à partir de prédictions archivées. DTW-1NN porte 5 rééchantillonnages contre 30 pour les quatre autres méthodes, de sorte que son point repose sur moins de preuves.

Étiquettes dures, pas de probabilités

Quatre des six méthodes du couloir CPU ne renvoient aucune probabilité. MiniRocket, MultiRocket, Hydra et DTW-1NN mettent 1 sur la classe prédite et 0 partout ailleurs, de sorte que leur perte logarithmique est l'exactitude sous un autre nom. Elle égale le taux d'erreur multiplié par 36.0437 dans toutes les 2 465 cellules où la perte logarithmique a été enregistrée, à 7.1e-15 près. Cette constante est la pénalité que scikit-learn attribue à une probabilité nulle sur la vraie classe.

La recette se comporte comme documenté. Les trois classifieurs convolutionnels utilisent par défaut une tête ridge sans sortie de probabilité, et la bibliothèque comble le vide avec un vecteur one-hot ; DTW-1NN à un voisin a la même forme par construction.7

La ROC-AUC calculée pour eux mesure donc l'étiquette, pas un classement. Sur les 27 jeux de données où les six portent une ROC-AUC complète, catch22 enregistre 0.884 contre 0.866 pour MultiRocket, tout en accusant un retard de 7.2 points d'exactitude, 0.782 contre 0.854. Lisez cela comme catch22 disposant d'un score utilisable et MultiRocket n'en ayant aucun, et non comme catch22 ordonnant mieux les cas.

Deux des six peuvent être comparées sur les probabilités. Sur les 22 jeux de données avec perte logarithmique complète, HIVE-COTE 2 a une moyenne de 0.344 contre 0.527 pour catch22, des médianes de 0.265 et 0.371, et est inférieur sur 19 des 22. Les deux chiffres décrivent une sortie archivée. Aucune expérience de calibration n'a été exécutée et aucun test gelé ne les couvre.

Le tableau d'exactitude ne bouge pas. Ce qu'il ne dit pas, c'est ceci : une charge de travail qui classe ou seuille des cas n'a rien à seuiller avec la recette par défaut de MiniRocket, MultiRocket, Hydra ou DTW-1NN. Une tête probabiliste sur les mêmes caractéristiques n'a pas été exécutée.

Calcul enregistré

Le graphique trace les cellules appariées : chaque méthode du couloir CPU restreinte aux 28 jeux de données que les six ont tous exécutés, aux rééchantillonnages 0 à 4, soit 140 cellules chacune. Heures-cœur CPU enregistrées sur ces cellules : HIVE-COTE 2 694.23, DTW-1NN 356.82, MultiRocket 2.81, Hydra 2.12, catch22 0.54 et MiniRocket 0.48.

La restriction est ce qui rend le ratio significatif. Le calcul enregistré totalise 1 496.5 heures-cœur sur l'ensemble du couloir CPU, dont HIVE-COTE 2 représente 804.8 : 694.2 sur ses 140 cellules classées et le reste sur quatre cellules diagnostiques post hoc exclues de tous les tableaux. MultiRocket représente 26.2 sur 990 cellules classées. Ces deux totaux couvrent des quantités de travail différentes, de sorte qu'aucun ratio entre eux ne compare les méthodes.

Les cellules appariées en rendent un possible. En restreignant chaque méthode du couloir CPU aux 28 jeux de données que les six ont tous exécutés, aux rééchantillonnages 0 à 4, on obtient 140 cellules chacune. Heures-cœur CPU enregistrées : HIVE-COTE 2 694.23, DTW-1NN 356.82, MultiRocket 2.81, Hydra 2.12, catch22 0.54 et MiniRocket 0.48.

Sur ces mêmes 28 jeux de données, HIVE-COTE 2 bat MultiRocket sur 18 et perd sur 9, un écart d'exactitude moyenne de 0.012 qui ne survit pas à la correction de Holm. C'est 247 fois le temps CPU pour une différence que ce benchmark ne peut pas détecter. DTW-1NN, la référence que le protocole d'archive exige de chaque résultat publié, coûte 747 fois MiniRocket sur les mêmes cellules.

Chaque méthode ici a été exécutée en monothread à n_jobs = 1, une cellule par processus, de sorte que le temps horloge enregistré est du temps cœur. Deux limites s'appliquent toutefois aux deux ratios. Les temps sont des débits sous ce que la machine exécutait par ailleurs, et non une latence isolée. Et HIVE-COTE 2 a été exécuté dans son propre couloir de configuration tandis que les cinq autres partageaient le même, de sorte que son ratio couvre deux couloirs ; le ratio DTW-1NN par rapport à MiniRocket est mesuré dans un seul couloir.

Aucune comparaison de coût entre méthodes classiques et modèles de fondation n'est possible à partir de ce benchmark, et nous n'en faisons aucune. Les six méthodes du couloir GPU n'ont enregistré aucun temps horloge. TimEE a un temps horloge enregistré mais est exclu du graphique car il ne porte aucun rang.

Méthodes comparées

HIVE-COTE 2

Premier au rang moyen (2.400) sur le panel principal, non séparable de RocketPFN. A exécuté 140 cellules classées pour 694.2 heures-cœur enregistrées, la méthode la plus coûteuse sur le couloir CPU enregistré, et n'a pas terminé FaceDetection (144 canaux). Méta-ensemble hétérogène sur des représentations shapelet, dictionnaire, intervalle et convolutionnelle.8

RocketPFN

Premier en exactitude moyenne (0.905), non séparable de HIVE-COTE 2. Bit-identique sous le test d'échange par les pairs. Univarié uniquement, il n'entre donc jamais dans le panel UEA. Combine des caractéristiques convolutionnelles de la famille ROCKET avec une classification en contexte par le modèle de fondation tabulaire TabPFN v2.5, de sorte qu'aucun modèle n'est ajusté sur le jeu de données cible ; son article rapporte une parité avec HIVE-COTE 2 à une exactitude moyenne de 0.900 sur 92 jeux de données UCR.2

MultiRocket

Troisième au rang moyen (2.800) et le meilleur bilan par paires : ses quatre contrastes inspectés contre des modèles pré-entraînés survivent à Holm, dont deux à 28 victoires pour 0. 26.2 heures-cœur enregistrées pour 990 cellules. Étend MiniRocket avec plusieurs opérateurs de regroupement et des différences de premier ordre.9

Hydra

Rang moyen 4.100 ; sa victoire sur MOMENT (22/6) survit à la correction. Méthode convolutionnelle de type dictionnaire : les noyaux sont en compétition par groupes et les comptes de noyaux gagnants forment la représentation.10

MiniRocket

Rang moyen 4.700 à 4.9 heures-cœur enregistrées pour 990 cellules, la méthode forte la moins chère sur le couloir CPU enregistré ; sa victoire sur MOMENT (24/4) survit à la correction. Transformée à noyaux convolutionnels aléatoires quasi déterministes avec un classifieur linéaire.11

MOMENT

Modèle pré-entraîné le mieux classé sur le panel principal univarié (6.633) ; perd face aux trois transformées convolutionnelles avec des contrastes survivants. Modèle T5 à 385M de paramètres pré-entraîné sur un corpus multi-domaine pour la prévision, la classification, la détection d'anomalies et l'imputation.12

Chronos-2

Rang moyen 7.967 ; perd face à MultiRocket 28/0. Modèle de fondation de prévision utilisé ici comme extracteur d'incorporations gelé, ce qui n'est pas sa tâche native.13

TiRex

Rang moyen 8.433 ; perd face à MultiRocket 28/0. Modèle de prévision zéro-shot fondé sur xLSTM,14 également utilisé ici comme extracteur gelé. Dans le bras de sensibilité post hoc, le passage de l'extraction de la dernière couche à la concaténation de toutes les couches a augmenté l'exactitude moyenne de 1.13 points de pourcentage sur son panel de 30 jeux de données : 23 jeux de données se sont améliorés et sept se sont dégradés, Heartbeat de 7.98 points sans qu'aucun de ses 30 rééchantillonnages ne s'améliore. Le résultat gelé de la dernière couche et son rang restent primaires ; le bras de sensibilité ne porte aucun rang.

Mantis-V2

Rang moyen 9.733 en univarié et 5.444 sur le panel multivarié ; perd face à MultiRocket 24/3. N'a pas terminé FaceDetection : ses 144 canaux submergent sa tête de classification native. Modèle de classification léger pré-entraîné contrastivement avec des données synthétiques et des stratégies de test ajoutées dans la V2.15

TimEE

Rapporté sans rang ; voir le constat sur la composition des lots ci-dessus. Exactitude moyenne de 0.841 sur les 21 jeux de données de son panel rapporté, calculée à composition de lot fixe. Deux exclusions déclarées avant les résultats s'appliquent : NonInvasiveFetalECGThorax1 est partiel à 5 des 30 rééchantillonnages, et Phoneme n'est rapporté que sur sa division d'archive. Modèle à 4.5M de paramètres méta-entraîné sur des tâches synthétiques qui classifie de bout en bout en contexte, en une seule passe avant à partir d'un ensemble de support étiqueté.3

TiCT

Rang moyen 10.200. Univarié uniquement ; son exécutant a été le seul à appliquer la règle de validité des classes rares sur Phoneme, contribuant une cellule valide là où les autres couloirs en ont exécuté 30. Bit-identique sous le test d'échange par les pairs. Transformer en contexte pré-entraîné sur des données synthétiques avec encodage d'étiquettes fondé sur les bits pour un nombre arbitraire de classes.16

DTW-1NN

Rang moyen 9.900. N'a pas terminé StarLightCurves, un abandon déclaré pour coût à 95 heures pour une cellule indivisible. Un plus proche voisin sous distance de déformation temporelle dynamique, la référence la plus ancienne du domaine.

catch22

Rang moyen 8.700 sur le panel principal. Vingt-deux caractéristiques récapitulatives fixes et interprétables alimentant un classifieur simple.17

Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Quand choisir un modèle de fondation plutôt qu'un classifieur classique

  • Beaucoup de données d'entraînement étiquetées : chaque contraste qui survit à la correction favorise ici une transformée convolutionnelle, et deux des trois, MultiRocket et Hydra, siègent dans la clique de tête aux côtés de HIVE-COTE 2 et RocketPFN.
  • Étiquettes très limitées ou déploiement à froid : les modèles en contexte et zéro-shot sont les candidats, et c'est le régime que notre benchmark ne mesure pas. Tous nos panels utilisent des divisions d'entraînement complètes issues de l'archive.
  • Données multivariées : vérifiez d'abord la prise en charge native. Deux des trois méthodes en contexte de cette liste sont univariées uniquement.
  • Exactitude maximale indépendamment du calcul : HIVE-COTE 2 et RocketPFN ne sont pas séparables sur ces preuves. Ce benchmark ne distingue ni leur exactitude ni leur calcul, car RocketPFN n'a pas de temps enregistré.
    Un budget de calcul qui compte : sur les 140 cellules appariées ci-dessus, MultiRocket utilise 1/247 des heures-cœur CPU de HIVE-COTE 2, et aucune différence d'exactitude entre eux ne survit à la correction sur ces jeux de données.
  • Exigences d'auditabilité : préférez les méthodes dont les prédictions sont reproductibles à partir de la seule entrée. Le constat sur la composition des lots ci-dessus est le cas de prudence.

Qu'est-ce que la classification de séries temporelles

La classification de séries temporelles entraîne un modèle sur des séquences numériques ordonnées et étiquetées afin de prédire une classe discrète pour une série non vue : diagnostic ECG, reconnaissance d'activité humaine à partir de dispositifs portables, détection de pannes industrielles. Elle diffère de la prévision, qui produit des valeurs futures plutôt qu'une étiquette de classe. Les modèles tabulaires n'encodent pas l'ordre des valeurs comme biais inductif ; ils traitent chaque pas de temps comme une colonne indépendante.

Les méthodes classiques ajustent un nouveau modèle par jeu de données. Un modèle de fondation de séries temporelles est pré-entraîné une fois sur un grand corpus, puis appliqué à de nouveaux jeux de données en zéro-shot, via une sonde légère, ou en contexte à partir de quelques exemples étiquetés fournis au moment de l'inférence. La question que mesure ce benchmark est de savoir si ce pré-entraînement achète actuellement une exactitude de classification sur les archives standard, sous un protocole contrôlé unique.

Ne manquez pas nos benchmarks et analyses basées sur les données. Le bouton ouvre Google ; sélectionner AIMultiple confirme que vous souhaitez voir AIMultiple plus souvent dans les résultats de recherche Google.
GoogleAjouter comme source préférée

Méthodologie du benchmark de classification de séries temporelles

Méthodes. Quatre familles : modèles de fondation pré-entraînés évalués via un protocole de transfert (MOMENT, Chronos-2, TiRex, Mantis-V2), modèles en contexte (TimEE, TiCT, RocketPFN), transformées convolutionnelles (MiniRocket, MultiRocket, Hydra), et références classiques (HIVE-COTE 2, DTW-1NN, catch22).

Données. 23 jeux de données univariés UCR et 10 jeux de données multivariés UEA,56 plus une couche non-IID séparée sur SleepEDF et PTB-XL. 14 638 cellules enregistrées, réparties dans le tableau de couverture ci-dessous.

Couverture. Les cellules évaluées ne sont pas réparties uniformément entre les méthodes, et les dénominateurs déterminent quelles comparaisons sont possibles.

Chaque comparaison classée s'exécute sur l'intersection des cas complets des méthodes qu'elle nomme, jamais sur la couverture propre d'une seule méthode, ce qui permet aux 140 cellules de HIVE-COTE 2 et aux 2 760 de RocketPFN d'apparaître dans le même tableau. L'export complet contient 14 638 lignes : ces 11 874 cellules évaluées, le bras de reproduction du protocole papier de RocketPFN à 2 760 cellules, et 4 cellules diagnostiques post hoc de HIVE-COTE 2.

Rééchantillonnage. r0 est la division entraînement/test d'archive ; r1 à r29 sont des permutations stratifiées aux proportions d'archive, seedées 1729+r. L'unité inférentielle est le jeu de données : les rééchantillonnages sont moyennés au sein d'un jeu de données avant que les méthodes ne soient comparées. HIVE-COTE 2 et DTW-1NN exécutent 5 rééchantillonnages car leur coût par cellule est supérieur d'un à deux ordres de grandeur, et le tableau principal restreint chaque méthode aux mêmes 5 rééchantillonnages appariés. La division d'archive r0 est systématiquement plus difficile que les rééchantillonnages seedés sur 8 des 33 jeux de données, jusqu'à 0.218 d'exactitude, de sorte que les cinq rééchantillonnages appariés ne sont pas des tirages échangeables.

Protocole de transfert. Chaque modèle de fondation de référence exécute le même pipeline : encodage par variable, dernière couche d'encodeur, regroupement moyen sur les tokens de contexte valides, normalisation L2 par variable, concaténation des canaux, standardisation sur l'entraînement uniquement, sonde de régression logistique. Gelé le 2026-07-24, avant toute cellule évaluée.

Statistiques. Omnibus de Friedman, puis Wilcoxon signé par paires avec correction de Holm sur l'ensemble des 19 contrastes inspectés, sur des moyennes au niveau des jeux de données, panels de cas complets uniquement. L'omnibus soutient seulement que les rangs diffèrent quelque part ; chaque énoncé par paires provient des contrastes corrigés.

Gel. Les données ont gelé le 2026-07-29 03:00 UTC, avec des règles d'exclusion écrites avant que les résultats exceptionnels ne soient connus. Une cellule s'est terminée 22 minutes après la limite et est exclue en vertu de la règle pré-écrite. La publication passe 120 vérifications mécaniques d'assertion, y compris la comparaison de hachage de chaque fichier d'entrée, la régénération du tableau principal à partir de l'export et l'application des exclusions déclarées derrière le chiffre publié de TimEE tant dans l'article que dans les tableaux de publication.

Métriques. La ROC-AUC était la métrique principale déclarée. Elle n'est pas disponible pour 6 des 7 modèles de fondation de référence, dont les exécutions archivent des scores de décision ou des prédictions de classe plutôt que des probabilités calibrées, de sorte que l'exactitude est devenue la métrique de comparaison. TimEE est le seul des sept à porter une ROC-AUC. Nous le disons plutôt que de requalifier l'exactitude comme pré-spécifiée. L'exactitude équilibrée, la macro-F1 et la perte logarithmique sont des analyses de sensibilité post hoc sur le sous-ensemble couvert.

Reproductibilité. Les prédictions par instance sont archivées pour les 13 méthodes et l'ensemble des 12 du tableau principal ; chaque prédiction régénérée reproduit son scalaire gelé à une différence maximale de 0.000e+00 (4 260 cellules du couloir CPU revérifiées le 2026-08-02, zéro orphelin). Le tableau principal est entièrement recalculable à partir des prédictions publiées.

Méthodes absentes de ce benchmark

Modèles publiés pertinents pour la classification de séries temporelles que nous n'avons pas évalués, listés afin que la frontière de la liste soit explicite. Aucun des énoncés ici ne sont nos mesures. UniTS est un modèle multi-tâches unifié couvrant classification, prévision, imputation et détection d'anomalies.18 TiViT convertit des séries en images et classifie avec des Vision Transformers pré-entraînés gelés.19 UniShape est un modèle de fondation sensible à la forme construit pour la classification, avec un adaptateur sensible à la forme, accepté à AAAI 2026.20 GPT4TS, également publié sous le nom One Fits All, utilise un squelette GPT-2 dont les blocs d'auto-attention et de feedforward restent gelés tandis que les composants d'entrée, de normalisation et de sortie sont entraînés.21 TIC-FM est un classifieur zéro-shot en contexte prédisant toutes les instances de test en une seule passe avant ;22 lire sa conception à appel unique comme appartenant à la même classe d'exposition que le constat de composition des lots ci-dessus est notre inférence à partir de la description publiée, pas un résultat testé.

Limites

  • Aucun registre de chevauchement de pré-entraînement n'existe pour aucun modèle pré-entraîné : aucun ne publie de déclaration au niveau des jeux de données indiquant si des séries UCR/UEA apparaissent dans son corpus de pré-entraînement, de sorte que le transfert ne peut pas être séparé d'une exposition antérieure. Traiter les défaites comme sûres repose sur une hypothèse qu'aucun registre au niveau des jeux de données ne peut tester : que l'exposition antérieure, lorsqu'elle a eu lieu, a flatté ces modèles plutôt que de leur nuire. Sous cette hypothèse, ils sont à la traîne malgré l'avantage et les défaites tiennent ; toute victoire d'un modèle pré-entraîné, par la même logique, ne peut pas être proprement attribuée au transfert.
  • Les résultats des modèles de fondation sont conditionnés par le protocole de transfert gelé unique. Le bras post hoc de TiRex n'a modifié que l'extraction de couche et a augmenté l'exactitude moyenne de 1.13 points de pourcentage tout en dégradant sept de ses 30 jeux de données, Heartbeat de 7.98 points avec 0 de ses 30 rééchantillonnages en amélioration. Il a testé un modèle, ne porte aucun rang et n'établit pas l'effet pour les autres modèles de fondation.
  • Tous les temps horloge sont des débits chargés sous une concurrence variable sur une machine partagée. Six des 13 méthodes n'en portent aucun.
  • Les preuves ne couvrent que des problèmes de taille d'archive. Rien ici ne parle de scalabilité.
  • Le benchmark inspecte une version de chaque méthode à sa date de gel.

Pièges courants dans l'évaluation comparative de la classification de séries temporelles

Chevauchement pré-entraînement/test. Un audit de 2025 a tracé 401 jeux de données à travers 22 modèles de fondation de séries temporelles publiés et a constaté que seulement 6 % n'étaient jamais apparus dans le corpus de pré-entraînement ou d'ajustement fin d'aucun modèle.23 Aucun modèle de notre liste ne publie de déclaration de chevauchement au niveau des jeux de données, raison pour laquelle notre section des limites traite le transfert et l'exposition antérieure comme inséparables.

Conception des divisions. L'archive UCR standard fournit une division entraînement/test fixe unique ; la pratique moderne rééchantillonne, et notre panel SleepEDF montre pourquoi la structure par sujet exige plus que du rééchantillonnage : la seule conception des divisions a déplacé l'exactitude rapportée jusqu'à 0.060 et compressé sa variance d'environ sept à neuf fois. Aucun chiffre unique ici n'est une propriété du jeu de données ; chacun est une propriété du jeu de données sous une conception de division donnée.

Multiplicité. Comparer de nombreux classifieurs sur de nombreux jeux de données sans correction fabrique des résultats. L'appareillage standard est le Wilcoxon signé pour les paires et une correction familywise de type Holm sur chaque contraste inspecté,2425 et la correction doit couvrir chaque contraste inspecté, pas seulement ceux rapportés. Dans ce benchmark, cette discipline a éliminé 13 des 19 contrastes.

Annexe : sensibilité de l'extraction de TiRex

Ce bras post hoc utilise les mêmes 30 jeux de données, 30 divisions de rééchantillonnage, scaler et sonde logistique que le résultat gelé de TiRex. Seule l'extraction de caractéristiques change, passant de la dernière couche d'encodeur à des représentations concaténées des 12 couches. Le bras est sans rang et ne modifie pas le benchmark gelé.

L'exactitude moyenne est passée de 0.793 à 0.805, soit un changement de 1.13 point de pourcentage, avec un intervalle de bootstrap sur jeux de données seedés de +0.15 à +2.06 points. Un test de Wilcoxon signé par paires sur les 30 deltas de jeux de données donne un W exact bilatéral de 92.0 à p=0.003. Ce test est exploratoire : il a été exécuté après le gel, il se situe en dehors de la famille Holm à 19 contrastes qui gouverne toute affirmation corrigée ici, et il ne porte aucun rang.

Auer et al. classent TiRex premier parmi les modèles de fondation de prévision en utilisant des caractéristiques concaténées de couches et une Random Forest, et leur propre ablation rapporte un effet de couche plus grand de 5 points.26 Les deux études diffèrent par les jeux de données, la liste des modèles, le classifieur et le filtrage de longueur des séries, de sorte que 1.13 et 5 points sont des estimations de sensibilité spécifiques au protocole plutôt que des estimations concurrentes d'un même effet. Ce bras ne reproduit ni ne réfute leur classement, et n'identifie pas la cause de la différence de rang entre études. Il établit la sensibilité à la couche pour TiRex dans ce benchmark. Il ne généralise pas l'effet aux autres modèles de fondation et n'identifie pas la meilleure performance de classification atteignable d'aucun modèle.

Citer cette recherche

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Berk Kalelioğlu (2026) - "Benchmark de classification de séries temporelles: modèles de fondation contre méthodes classiques". Publié en ligne sur AIMultiple.com. Consulté le 24 Août 2026, à : https://aimultiple.com/time-series-classification [Ressource en ligne]

Kalelioğlu, B. (2026, 24 Août). Benchmark de classification de séries temporelles: modèles de fondation contre méthodes classiques. AIMultiple. https://aimultiple.com/time-series-classification

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk},
  title  = {{Benchmark de classification de séries temporelles: modèles de fondation contre méthodes classiques}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/time-series-classification}},
  note   = {AIMultiple. Consulté le 24 Août 2026}
}
Télécharger toutes les données

Résultats et horodatages de 61 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant 4 fichiers CSV.

Dernière mise à jour : 17 Août 2026
Télécharger

Liens de référence

1.
Client Challenge
2.
[2606.21786] RocketPFN: Accurate Time Series Classification via In-Context Learning
3.
[2607.07500] TimEE: End-to-end Time Series Classification via In-Context Learning
4.
[2606.11473] CRUMB: Efficient Prior Fitted Network Inference via Distributionally Matched Context Batching
5.
[1810.07758] The UCR Time Series Archive
6.
[1811.00075] The UEA multivariate time series classification archive, 2018
7.
aeon/aeon/classification/convolution_based/_minirocket.py at main · aeon-toolkit/aeon · GitHub
8.
Client Challenge
9.
[2102.00457] MultiRocket: Multiple pooling operators and transformations for fast and effective time series classification
10.
[2203.13652] HYDRA: Competing convolutional kernels for fast and accurate time series classification
11.
[2012.08791] MINIROCKET: A Very Fast (Almost) Deterministic Transform for Time Series Classification
12.
[2402.03885] MOMENT: A Family of Open Time-series Foundation Models
13.
[2510.15821] Chronos-2: From Univariate to Universal Forecasting
14.
[2505.23719] TiRex: Zero-Shot Forecasting Across Long and Short Horizons with Enhanced In-Context Learning
15.
[2602.17868] MantisV2: Closing the Zero-Shot Gap in Time Series Classification with Synthetic Data and Test-Time Strategies
16.
[2511.19694] TiCT: A Synthetically Pre-Trained Foundation Model for Time Series Classification
17.
Client Challenge
18.
[2403.00131] UniTS: A Unified Multi-Task Time Series Model
19.
[2506.08641] Time Series Representations for Classification Lie Hidden in Pretrained Vision Transformers
20.
[2601.06429] A Unified Shape-Aware Foundation Model for Time Series Classification
21.
[2302.11939] One Fits All:Power General Time Series Analysis by Pretrained LM
22.
[2602.00620] Rethinking Zero-Shot Time Series Classification: From Task-specific Classifiers to In-Context Inference
23.
[2510.13654] Rethinking Evaluation in the Era of Time Series Foundation Models: (Un)known Information Leakage Challenges
24.
Statistical Comparisons of Classifiers over Multiple Data Sets
25.
An Extension on Statistical Comparisons of Classifiers over Multiple Data Sets for all Pairwise Comparisons
26.
[2510.26777] Pre-trained Forecasting Models: Strong Zero-Shot Feature Extractors for Time Series Classification
Berk Kalelioğlu
Berk Kalelioğlu
Chercheur en IA
Berk est chercheur en IA au sein de l’équipe benchmark d’AIMultiple, se concentrant sur l’IA agentique, l’apprentissage automatique et les grands et petits modèles de langage (LLMs & SLMs).
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450