Servicios
Contáctanos

Benchmark de Clasificación de Series Temporales: Foundation Models vs Métodos Clásicos

Berk Kalelioğlu
Berk Kalelioğlu
actualizado el 24 de ago. de 2026

Evaluamos 13 métodos de clasificación de series temporales, desde time series foundation models preentrenados hasta una línea base de 22 características de 2019, en 33 conjuntos de datos UCR/UEA bajo un protocolo congelado. Eso son 14.638 celdas registradas de método-conjunto de datos-remuestreo, 11.874 de ellas puntuadas.

Resultados del benchmark TSC

Loading Chart

El gráfico compara 12 métodos en los 15 conjuntos de datos univariados que todos completaron, cada conjunto ejecutado con las mismas 5 divisiones de entrenamiento/prueba. Las barras están ordenadas por precisión media. La tabla de abajo también incluye el rango medio, la posición promedio que ocupa un método dentro de un conjunto de datos, y coloca los mismos 12 en un orden diferente.

No hay un único ganador. HIVE-COTE 2 ocupa el primer lugar en rango medio (2.400) y RocketPFN el primero en precisión media (0.905). Bajo un bootstrap de conjuntos de datos con 5.000 extracciones, el primer lugar corresponde a HIVE-COTE 2 en el 46.6 % de las extracciones, a RocketPFN en el 45.5 % y a MultiRocket en el 7.9 %. Los dos ordenamientos no coinciden y el bootstrap se divide casi por igual, por lo que nombrar a cualquiera de los dos sería un artefacto de la métrica elegida.

El grupo superior es más pequeño de lo que la tabla sugiere. El grupo de Wilcoxon-Holm es HIVE-COTE 2, RocketPFN, MultiRocket y Hydra. MiniRocket, seis décimas de rango por detrás de Hydra en 4.700, no está en él: la pertenencia proviene de las pruebas pareadas corregidas, no de dónde caen los números de rango.

En este panel, las transformadas ocupan los rangos 3, 4 y 5 y los models preentrenados ocupan 6, 7, 8 y 10. MOMENT, el model preentrenado mejor clasificado con 6.633, se sitúa casi dos rangos completos por debajo de MiniRocket.

catch22, publicado en 2019 con 22 características fijas, cae dentro de la banda de preentrenados en 8.700, por delante de Mantis-V2 (9.733) y por detrás de TiRex (8.433). A profundidad completa de 30 remuestreos se mantiene en esa banda, tanto en el panel de 18 conjuntos de datos de abajo en 7.222 como en una variante de 27 conjuntos de datos y ocho métodos que descarta a RocketPFN.

El rango y la precisión tampoco coinciden en la parte inferior. DTW-1NN tiene peor precisión media que TiCT (0.756 contra 0.776) y un mejor rango medio (9.900 contra 10.200). La métrica que se informe cambia el orden en ambas mitades de la tabla.

Solo la mitad de la tabla es estable. Eliminar cualquier conjunto de datos cambia el orden en 10 de 15 casos. Seis de esos son el intercambio entre HIVE-COTE 2 y RocketPFN; Mantis-V2 y DTW-1NN intercambian lugares en seis y DTW-1NN y TiCT en dos. Las posiciones 3 a 9 nunca se mueven.

La métrica de comparación es la precisión porque la métrica primaria declarada, ROC-AUC, no está disponible para 6 de los 7 foundation models de referencia. El panel es solo univariado: TiCT y RocketPFN no tienen soporte multivariado nativo, por lo que la regla de casos completos elimina los 10 conjuntos de datos multivariados. Las filas de los foundation models miden esos models bajo un protocolo de transferencia fijo. TimEE no lleva rango, por la razón que se indica abajo. La proporción de primer lugar en bootstrap es la frecuencia de ocupar el primer lugar entre colecciones de conjuntos de datos remuestreadas, y nada más.

El orden en sí replica el bake-off de 2024, que estableció que HIVE-COTE 2 y la familia ROCKET lideran esta clase de problemas y señala que HIVE-COTE 2 es mucho más lento.1 La contribución aquí es una medición controlada de forma independiente en un roster de 2026 bajo un protocolo común, con las separaciones cuantificadas tras corrección por familia.

RocketPFN son características ROCKET alimentadas a TabPFN,2 un tabular model en contexto en lugar de un time series foundation model preentrenado, por lo que su posición por encima de las filas de preentrenados no dice nada sobre esa clase.

Con qué frecuencia cada método ocupa el primer lugar

Cada barra es la proporción de 5.000 remuestreos aleatorios de los 15 conjuntos de datos, con repeticiones permitidas, en los que un método ocupa el primer lugar. Nueve de los 12 métodos nunca lo hacen y no se dibujan. Los remuestreos se ejecutan con semilla 1729. El primer lugar cambia según los conjuntos de datos extraídos, y las proporciones no dicen nada sobre cuán separados están los métodos.

Una calificación Bradley-Terry modela la probabilidad de cada método de vencer a otro en un conjunto de datos, y no puede fabricar un ganador que las pruebas de significación no encontraron. Califica a HIVE-COTE 2 con 1384.6, a RocketPFN con 1380.6 y a MultiRocket con 1338.3, cada uno de ellos del primero al tercero en los remuestreos. El ancla de 1000 es relativa a estos 15 conjuntos de datos, y una calificación son probabilidades modeladas de ganar un conjunto de datos, no puntos de precisión.

Las pruebas congeladas de Wilcoxon-Holm, corregidas por ejecutar muchas comparaciones a la vez, no detectan diferencias entre HIVE-COTE 2, RocketPFN, MultiRocket y Hydra. Eso no es evidencia de que rindan igual. Hydra ocupa el cuarto o quinto lugar en los remuestreos, lo que tampoco lo separa de los tres primeros. Esas posiciones resumen estabilidad, no significación. No se respalda un ganador único.

Qué brechas sobreviven a la corrección

Se inspeccionaron diecinueve contrastes pareados y seis sobreviven a la corrección de Holm. Cada punto lleva su intervalo del 95 % y su valor p ajustado por Holm en la descripción emergente; esos intervalos son resúmenes de bootstrap de conjuntos de datos y no están ajustados por multiplicidad, por lo que solo los valores p llevan Holm.

Cada contraste que sobrevive es una transformada convolucional que vence a un model preentrenado.

MultiRocket barre dos de ellos sin perder un conjunto de datos. 28 victorias a 0 contra Chronos-2 y TiRex, con p = 1.4e-07.

Trece contrastes son inconclusos, lo que no es evidencia de que no haya diferencia. Nada que involucre a DTW-1NN sobrevive a la corrección, y nada en el subconjunto multivariado lo hace.

Cada fila se calcula sobre los conjuntos de datos que el par comparte, no sobre un panel común, por lo que las filas no son una tabla de clasificación y no se pueden leer unas contra otras.

Los resultados de los foundation models son condicionales a un protocolo de transferencia: mean pooling de la última capa con una sonda logística, aplicado de forma idéntica a MOMENT, Chronos-2, TiRex y Mantis-V2 y congelado antes de cualquier celda puntuada. Un brazo post hoc, rango-free, cambió la extracción de capas de TiRex y movió la precisión media de 0.793 a 0.805, 1.13 puntos porcentuales, con 23 de 30 conjuntos de datos mejorando y siete empeorando. La mayor pérdida, Heartbeat con 7.98 puntos, no mejoró en ninguno de sus 30 remuestreos, por lo que la media oculta un resultado que se invierte según el conjunto de datos. Los detalles están en el apéndice.

Seis veces la profundidad de división

Cada tabla de arriba ejecuta 5 divisiones de entrenamiento/prueba, porque HIVE-COTE 2 y DTW-1NN ejecutan solo esas cinco bajo la excepción congelada de celdas costosas y la regla de remuestreo emparejado reduce el resto para igualar. Las barras muestran la precisión media sobre las 30 divisiones, y el rango medio da el mismo orden. Si se descartan esos dos, los nueve métodos restantes ejecutan todos los 30 remuestreos estratificados con semilla en 18 conjuntos de datos, la profundidad que usa el bake-off.

El orden se mantiene. RocketPFN 1.694, MultiRocket 2.250, Hydra 2.889 y MiniRocket 3.833 ocupan los cuatro primeros lugares, todos construidos sobre características convolucionales aleatorias. Luego MOMENT 5.889, Chronos-2 6.444 y TiRex 7.056, con catch22 en 7.222 y Mantis-V2 en 7.722. El chi-cuadrado de Friedman es 105.067 con p = 3.9e-19. Cinco divisiones no lo fabricaron.

Los dos bloques se separan limpiamente a esta profundidad. El rango de rango bootstrap del 95 % de MiniRocket alcanza 4.278 y el de MOMENT comienza en 5.111, y en todos los 5.000 sorteos bootstrap ningún rango medio de un model preentrenado cruzó al rango del bloque convolucional.

Diez de los doce pares transformada-contra-pretrenado sobreviven a la corrección de Holm aquí. Los dos que no, MiniRocket sobre MOMENT con p = 0.108 y Hydra sobre MOMENT con p = 0.105, ambos sobreviven en el panel primario. Holm cubre la propia familia de 36 pares de este panel, por lo que ese recuento y los seis sobrevivientes del panel primario responden preguntas diferentes.

El primer lugar no está más resuelto. RocketPFN lo ocupa en el 92.9 % de 5.000 sorteos de bootstrap de conjuntos de datos, contra 46.6 % y 45.5 % en el panel primario, pero HIVE-COTE 2, el método con el que comparte el primer lugar allí, está ausente aquí. El grupo superior sigue siendo de tres: RocketPFN, MultiRocket y Hydra. MiniRocket queda fuera de él otra vez, compartiendo grupo con MOMENT.

Esto es una verificación de profundidad, no una replicación independiente. Los 18 conjuntos de datos contienen los 15 del panel primario más ElectricDevices, StarLightCurves y UWaveGestureLibraryAll, por lo que la fragilidad de dejar-un-conjunto-fuera de arriba se mantiene. Es solo univariado por la misma razón, la presencia de RocketPFN. Lo que descarta es un orden que dependa de cinco divisiones particulares.

La composición del lote cambia las predicciones de TimEE

TimEE es un clasificador en contexto cuyo titular publicado es el primer lugar en ROC-AUC en el benchmark UCR.3 Lo ejecutamos en dos máquinas y comparamos resultados a nivel de celda.

El acuerdo se rompe exactamente en el tamaño de lote del harness de 512. La precisión es idéntica en 270 de 270 celdas donde el conjunto de prueba cabe en una llamada, y en 146 de 325 celdas donde no. Para ROC-AUC la división es 221 de 270 contra 12 de 308. Las dos máquinas difieren en hardware en ambos estratos, por lo que ningún estrato por sí solo prueba algo; el contraste entre ellos es la evidencia.

Por conjunto de datos, la ruptura es más aguda de lo que sugieren los totales del estrato. Cada conjunto de datos cuyo conjunto de prueba cabe en una llamada coincide en precisión en 30 de 30 remuestreos, y ningún conjunto de datos por encima del umbral alcanza 30 de 30. ROC-AUC es peor en ambos lados de la línea, cayendo por debajo de la mitad en dos conjuntos de datos lo bastante pequeños como para caber.

El mecanismo está en el código fuente. La función de embedding estadístico calcula z-scores de cada característica en cada fila de la llamada de inferencia, tanto filas de soporte como de consulta, sin ninguna protección que separe las posiciones de entrenamiento de las de evaluación. Treinta líneas después, el mismo archivo aplica exactamente esa protección a un paso de normalización diferente. Un intercambio controlado de pares lo confirma: manteniendo una consulta ancla fija y reemplazando las otras 511 consultas en su llamada, la probabilidad predicha del ancla cambia en 1.163e-04, contra un ruido de repetición de exactamente cero. TiCT y RocketPFN, probados de forma idéntica, son idénticos a nivel de bits bajo el mismo intercambio.

Por lo tanto, una predicción de TimEE no es una función únicamente de la serie de entrada. Sus puntuaciones son reproducibles con una composición de lote fija, por lo que no puede recibir un rango equivalente frente a clasificadores inductivos y este benchmark lo informa sin uno. Esto matiza la afirmación publicada de ROC-AUC, ya que ROC-AUC se calcula exactamente a partir de las probabilidades que se muestran dependientes de la llamada. No muestra que las puntuaciones estén infladas en ninguna dirección, no cambia el rango publicado, que se obtuvo en una tabla de clasificación que no poseemos, y cubre la versión que inspeccionamos.

Tres de las cuatro rutas de detección no requieren acceso al código fuente. Repetir una celda dos veces, intercambiar pares de lote alrededor de un ancla fija y comparar resultados entre dos máquinas estratificadas por el límite del lote. Trabajo publicado relacionado agrupa la inferencia de redes ajustadas previamente por consultas de prueba agrupadas por eficiencia y no informa dependencia de la composición.4

Resultados del panel multivariado

Una lista corta construida sobre el panel amplio no se traslada a datos multivariados. MOMENT es el último de diez en el panel multivariado de 9 conjuntos de datos, mientras que es el model preentrenado mejor clasificado en el panel amplio de 24 conjuntos de datos con 6.729. Mantis-V2 va en sentido contrario: 5.444 en el panel multivariado contra 7.208 en el amplio.

Esto no es un efecto de modalidad. El panel amplio contiene los conjuntos de datos multivariados como un subconjunto, por lo que el movimiento es un contraste entre dos rosters de diferente tamaño y composición de tareas, no algo medido dentro de ningún método. Con N=9 y sin contrastes que sobrevivan a la corrección, léase como una advertencia contra llevar una lista corta del panel amplio a un despliegue multivariado, no como un resultado de selección.

Resultados de divisiones agrupadas por sujeto

Los archivos UCR y UEA incluyen divisiones fijas de entrenamiento/prueba definidas sobre series individuales, sin anotación de sujeto o fuente para dividir,56 por lo que remuestrearlos baraja series en lugar de sujetos. En la estadificación del sueño SleepEDF, donde un sujeto contribuye muchas ventanas, también dividimos por sujeto. MiniRocket lleva 8 de 10 pliegues aleatorios debido al corte de congelación.

La división aleatoria reporta mayor precisión, por 0.060 para catch22 y 0.030 para MiniRocket.

La compresión de la varianza es la mitad más transferible. La variabilidad entre pliegues es aproximadamente de siete a nueve veces menor bajo división aleatoria que bajo agrupación por sujeto, tanto en precisión por ventana como en precisión macro por sujeto. Un model seleccionado con divisiones aleatorias se ve mejor y más estable que el mismo model evaluado de la forma en que se desplegará, en sujetos no vistos.

Reportamos una brecha asociada a la división, nunca fugas. Los datos no pueden decir si la brecha proviene de fuga de identidad de sujeto o de variación genuina en la dificultad del sujeto y la mezcla de etapas, y las divisiones aleatorias distribuyen esa variación en cada conjunto de prueba, lo que estabiliza la precisión mecánicamente. El experimento que separaría las dos, épocas de prueba idénticas bajo conjuntos de entrenamiento que contienen y no contienen los sujetos de prueba, se ejecutó en PTB-XL y se descartó de SleepEDF por cómputo. PTB-XL mismo conserva 14.9 % de superposición del mismo sujeto bajo división aleatoria, por lo que es un comparador de baja superposición, no un control nulo.

Datos desequilibrados: Earthquakes

La precisión oculta un ranking casi aleatorio. Cada método del carril CPU reporta una precisión de 0.72 a 0.78 en Earthquakes, mientras que la precisión balanceada va de 0.4996 a 0.5453. Léase 0.5 como azar solo en el eje de precisión balanceada; el azar para la precisión ordinaria depende de la prevalencia de clase.

El método con la mayor precisión tiene la menor precisión balanceada. catch22 con 0.783 de precisión obtiene 0.4996 balanceada, numéricamente justo por debajo de 0.5. Si está literalmente prediciendo la clase mayoritaria no se midió; la cifra citada no lleva incertidumbre ni prueba contra 0.5.

La inversión es local, no una propiedad del método. En todo el panel, catch22 es claramente el último en precisión balanceada, 0.726 contra 0.806 de MultiRocket. La precisión balanceada es una métrica post hoc aquí, calculada después de la congelación a partir de predicciones archivadas. DTW-1NN lleva 5 remuestreos contra los 30 de los otros cuatro métodos, por lo que su punto se basa en menos evidencia.

Etiquetas duras, no probabilidades

Cuatro de los seis métodos del carril CPU no devuelven probabilidad. MiniRocket, MultiRocket, Hydra y DTW-1NN ponen 1 en la clase predicha y 0 en todas las demás, por lo que su pérdida logarítmica es precisión con otro nombre. Es igual a la tasa de error por 36.0437 en todas las 2.465 celdas donde se registró la pérdida logarítmica, dentro de 7.1e-15. Esa constante es la penalización que scikit-learn asigna a una probabilidad cero en la clase verdadera.

La receta se comporta como está documentado. Los tres clasificadores convolucionales usan por defecto una cabeza ridge sin salida de probabilidad, y la biblioteca llena el vacío con un vector one-hot; DTW-1NN con un vecino tiene la misma forma por construcción.7

El ROC-AUC calculado para ellos mide, por lo tanto, la etiqueta, no un ranking. En los 27 conjuntos de datos donde los seis llevan ROC-AUC completo, catch22 registra 0.884 contra 0.866 de MultiRocket, mientras queda por detrás por 7.2 puntos de precisión, 0.782 contra 0.854. Léase eso como que catch22 tiene una puntuación utilizable y MultiRocket no tiene ninguna, no como que catch22 ordena mejor los casos.

Dos de los seis pueden compararse en probabilidades en absoluto. En los 22 conjuntos de datos con pérdida logarítmica completa, HIVE-COTE 2 promedia 0.344 contra 0.527 de catch22, medianas 0.265 y 0.371, y es menor en 19 de 22. Ambas cifras describen salida archivada. No se ejecutó ningún experimento de calibración y ninguna prueba congelada las cubre.

La tabla de precisión no se mueve. Lo que no lleva es esto: una carga de trabajo que ordena o aplica umbrales a casos no obtiene nada para aplicar umbrales de la receta predeterminada de MiniRocket, MultiRocket, Hydra o DTW-1NN. No se ejecutó una cabeza probabilística sobre las mismas características.

Cómputo registrado

El gráfico muestra celdas emparejadas: cada método del carril CPU restringido a los 28 conjuntos de datos que los seis ejecutaron, en remuestreos 0 a 4, lo que son 140 celdas cada uno. Horas-núcleo de CPU registradas en esas celdas: HIVE-COTE 2 694.23, DTW-1NN 356.82, MultiRocket 2.81, Hydra 2.12, catch22 0.54 y MiniRocket 0.48.

La restricción es lo que hace significativa una proporción. El cómputo registrado totaliza 1.496.5 horas-núcleo en todo el carril CPU, de las cuales HIVE-COTE 2 representa 804.8: 694.2 en sus 140 celdas clasificadas y el resto en cuatro celdas de diagnóstico post hoc excluidas de cada tabla. MultiRocket representa 26.2 en 990 celdas clasificadas. Esos dos totales cubren diferentes cantidades de trabajo, por lo que ninguna proporción entre ellos compara los métodos.

Las celdas emparejadas hacen posible una. Restringir cada método del carril CPU a los 28 conjuntos de datos que los seis ejecutaron, en remuestreos 0 a 4, da 140 celdas cada uno. Horas-núcleo de CPU registradas: HIVE-COTE 2 694.23, DTW-1NN 356.82, MultiRocket 2.81, Hydra 2.12, catch22 0.54 y MiniRocket 0.48.

En esos mismos 28 conjuntos de datos, HIVE-COTE 2 vence a MultiRocket en 18 y pierde en 9, una brecha de precisión media de 0.012 que no sobrevive a la corrección de Holm. Eso es 247 veces el tiempo de CPU para una diferencia que este benchmark no puede detectar. DTW-1NN, la línea base que el protocolo del archivo exige de cada resultado publicado, cuesta 747 veces MiniRocket en las mismas celdas.

Cada método aquí se ejecutó en un solo hilo con n_jobs = 1, una celda por proceso, por lo que el tiempo de pared registrado es tiempo de núcleo. Aún se aplican dos límites a ambas proporciones. Los tiempos son rendimiento bajo cualquier otra cosa que la máquina estuviera ejecutando, no latencia en solitario. Y HIVE-COTE 2 se ejecutó en su propio carril de configuración mientras los otros cinco compartían uno, por lo que su proporción abarca dos carriles; la proporción de DTW-1NN a MiniRocket se mide dentro de un solo carril.

No es posible una comparación de costes entre métodos clásicos y foundation models a partir de este benchmark, y no hacemos ninguna. Los seis métodos del carril GPU no registraron tiempo de pared. TimEE tiene tiempo de pared registrado pero está excluido del gráfico porque no lleva rango.

Métodos comparados

HIVE-COTE 2

Primero en rango medio (2.400) en el panel primario, no separable de RocketPFN. Ejecutó 140 celdas clasificadas por 694.2 horas-núcleo registradas, el método más costoso en el carril CPU registrado, y no terminó FaceDetection (144 canales). Un meta-ensamble heterogéneo sobre representaciones de shapelet, diccionario, intervalo y convolucionales.8

RocketPFN

Primero en precisión media (0.905), no separable de HIVE-COTE 2. Idéntico a nivel de bits bajo la prueba de intercambio de pares. Solo univariado, por lo que nunca entra en el panel UEA. Combina características convolucionales de la familia ROCKET con clasificación en contexto por el tabular foundation model TabPFN v2.5, por lo que no se ajusta ningún model en el conjunto de datos objetivo; su artículo reporta paridad con HIVE-COTE 2 con 0.900 de precisión media en 92 conjuntos de datos UCR.2

MultiRocket

Tercero en rango medio (2.800) y el registro pareado más fuerte: los cuatro contrastes inspeccionados contra models preentrenados sobreviven a Holm, dos con 28 victorias a 0. 26.2 horas-núcleo registradas para 990 celdas. Extiende MiniRocket con múltiples operadores de pooling y diferencias de primer orden.9

Hydra

Rango medio 4.100; su victoria sobre MOMENT (22/6) sobrevive a la corrección. Un método convolucional de estilo diccionario: los kernels compiten en grupos y los conteos de kernels ganadores forman la representación.10

MiniRocket

Rango medio 4.700 con 4.9 horas-núcleo registradas para 990 celdas, el método fuerte más barato en el carril CPU registrado; su victoria sobre MOMENT (24/4) sobrevive a la corrección. Una transformada de kernel convolucional aleatorio casi determinista con un clasificador lineal.11

MOMENT

El model preentrenado mejor clasificado en el panel primario univariado (6.633); pierde contra las tres transformadas convolucionales con contrastes que sobreviven. Un model basado en T5 de 385M parámetros preentrenado en un corpus multidominio para pronóstico, clasificación, detección de anomalías e imputación.12

Chronos-2

Rango medio 7.967; pierde contra MultiRocket 28/0. Un foundation model de pronóstico utilizado aquí como extractor de embeddings congelado, lo que no es su tarea nativa.13

TiRex

Rango medio 8.433; pierde contra MultiRocket 28/0. Un model de pronóstico zero-shot basado en xLSTM,14 también utilizado aquí como extractor congelado. En el brazo de sensibilidad post hoc, cambiar la extracción de la capa final por la concatenación de todas las capas elevó la precisión media en 1.13 puntos porcentuales en su panel de 30 conjuntos de datos: 23 conjuntos de datos mejoraron y siete empeoraron, Heartbeat en 7.98 puntos sin que ninguno de sus 30 remuestreos mejorara. El resultado y el rango congelados de la capa final siguen siendo primarios; el brazo de sensibilidad no lleva rango.

Mantis-V2

Rango medio 9.733 en univariado y 5.444 en el panel multivariado; pierde contra MultiRocket 24/3. No terminó FaceDetection: 144 canales abruman su cabeza de clasificación nativa. Un model de clasificación ligero preentrenado contrastivamente con datos sintéticos y estrategias de tiempo de prueba agregadas en V2.15

TimEE

Reportado sin rango; véase el hallazgo de composición de lote arriba. Precisión media 0.841 en los 21 conjuntos de datos de su panel reportado, calculada con composición de lote fija. Dos exclusiones declaradas antes de que apliquen los resultados: NonInvasiveFetalECGThorax1 está parcial en 5 de 30 remuestreos, y Phoneme se reporta solo en su división de archivo. Un model de 4.5M parámetros meta-entrenado en tareas sintéticas que clasifica de extremo a extremo en contexto, en una sola pasada hacia adelante a partir de un conjunto de soporte etiquetado.3

TiCT

Rango medio 10.200. Solo univariado; su ejecutor fue el único en aplicar la regla de validez de clase rara en Phoneme, contribuyendo una celda válida donde otros carriles ejecutaron 30. Idéntico a nivel de bits bajo la prueba de intercambio de pares. Un transformer en contexto preentrenado en datos sintéticos con codificación de etiquetas basada en bits para conteos arbitrarios de clases.16

DTW-1NN

Rango medio 9.900. No terminó StarLightCurves, un DNF declarado por costo a 95 horas para una celda no divisible. Vecino más cercano bajo distancia Dynamic Time Warping, la línea base más antigua en el campo.

catch22

Rango medio 8.700 en el panel primario. Veintidós características de resumen fijas e interpretables que alimentan un clasificador simple.17

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Cuándo elegir un foundation model sobre un clasificador clásico

  • Muchos datos de entrenamiento etiquetados: cada contraste que sobrevive a la corrección aquí favorece una transformada convolucional, y dos de los tres, MultiRocket y Hydra, están en el grupo superior junto con HIVE-COTE 2 y RocketPFN.
  • Etiquetas severamente limitadas o despliegue en frío: los models en contexto y zero-shot son los candidatos, y este es el régimen que nuestro benchmark no mide. Todos nuestros paneles usan divisiones de entrenamiento completas del archivo.
  • Datos multivariados: verifique primero la cobertura nativa. Dos de los tres métodos en contexto de este roster son solo univariados.
  • Mayor precisión sin importar el cómputo: HIVE-COTE 2 y RocketPFN no son separables con esta evidencia. Este benchmark no separa ni su precisión ni su cómputo, porque RocketPFN no tiene tiempos registrados.
    Un presupuesto de cómputo que importa: en las 140 celdas emparejadas de arriba, MultiRocket usa 1/247 de las horas-núcleo de CPU de HIVE-COTE 2 y ninguna diferencia de precisión entre ellos sobrevive a la corrección en esos conjuntos de datos.
  • Requisitos de auditabilidad: prefiera métodos cuyas predicciones sean reproducibles solo a partir de la entrada. El hallazgo de composición de lote de arriba es el caso de advertencia.

Qué es la clasificación de series temporales

La clasificación de series temporales entrena un model en secuencias numéricas etiquetadas y ordenadas para predecir una clase discreta para una serie no vista: diagnóstico de ECG, reconocimiento de actividad humana con wearables, detección de fallas industriales. Se diferencia del pronóstico, que produce valores futuros en lugar de una etiqueta de clase. Los tabular models no codifican el orden de los valores como un sesgo inductivo; tratan cada paso temporal como una columna independiente.

Los métodos clásicos ajustan un model nuevo por conjunto de datos. Un time series foundation model se preentrena una vez en un corpus grande, luego se aplica a nuevos conjuntos de datos zero-shot, mediante una sonda ligera, o en contexto a partir de un puñado de ejemplos etiquetados suministrados en tiempo de inferencia. Si ese preentrenamiento compra actualmente precisión de clasificación en archivos estándar, bajo un protocolo controlado, es la pregunta que este benchmark mide.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Metodología del benchmark de clasificación de series temporales

Métodos. Cuatro familias: foundation models preentrenados evaluados mediante un protocolo de transferencia (MOMENT, Chronos-2, TiRex, Mantis-V2), models en contexto (TimEE, TiCT, RocketPFN), transformadas convolucionales (MiniRocket, MultiRocket, Hydra) y referencias clásicas (HIVE-COTE 2, DTW-1NN, catch22).

Datos. 23 conjuntos de datos univariados UCR y 10 multivariados UEA,56 más una capa no-IID separada en SleepEDF y PTB-XL. 14.638 celdas registradas, divididas en la tabla de cobertura de abajo.

Cobertura. Las celdas puntuadas no están distribuidas uniformemente entre los métodos, y los denominadores deciden qué comparaciones son posibles en absoluto.

Cada comparación clasificada se ejecuta en la intersección de casos completos de los métodos que nombra, nunca en la cobertura de un solo método, que es lo que permite que las 140 celdas de HIVE-COTE 2 y las 2.760 de RocketPFN aparezcan en la misma tabla. La exportación completa contiene 14.638 filas: estas 11.874 celdas puntuadas, el brazo de reproducción del protocolo de papel de 2.760 celdas de RocketPFN y 4 celdas de diagnóstico post hoc de HIVE-COTE 2.

Remuestreo. r0 es la división de entrenamiento/prueba del archivo; r1 a r29 son barajados estratificados en las proporciones del archivo, con semilla 1729+r. La unidad inferencial es el conjunto de datos: los remuestreos se promedian dentro de un conjunto de datos antes de comparar los métodos. HIVE-COTE 2 y DTW-1NN ejecutan 5 remuestreos porque su costo por celda es de uno a dos órdenes de magnitud mayor, y la tabla primaria restringe cada método a los mismos 5 remuestreos emparejados. La división de archivo r0 es sistemáticamente más difícil que los remuestreos con semilla en 8 de 33 conjuntos de datos, hasta por 0.218 de precisión, por lo que los cinco remuestreos emparejados no son sorteos intercambiables.

Protocolo de transferencia. Cada foundation model de referencia ejecuta el mismo pipeline: codificación por variable, capa final del codificador, mean-pool sobre tokens de contexto válidos, normalización L2 por variable, concatenación de canales, estandarización solo de entrenamiento, sonda de regresión logística. Congelado 2026-07-24, antes de cualquier celda puntuada.

Estadísticas. Friedman omnibus, luego Wilcoxon de rangos con signo pareado con corrección de Holm sobre los 19 contrastes inspeccionados, en medias a nivel de conjunto de datos, solo paneles de casos completos. El omnibus solo respalda que los rangos difieren en algún lugar; cada afirmación pareada proviene de los contrastes corregidos.

Congelación. Los datos se congelaron el 2026-07-29 a las 03:00 UTC, con reglas de exclusión escritas antes de que se conocieran los resultados pendientes. Una celda terminó 22 minutos después del corte y se excluye bajo la regla preescrita. La publicación pasa 120 verificaciones mecánicas de aserción, incluida la comparación de hash de cada archivo de entrada, la regeneración de la tabla primaria a partir de la exportación y la aplicación de las exclusiones declaradas detrás de la cifra publicada de TimEE tanto en el artículo como en las tablas de publicación.

Métricas. ROC-AUC fue la métrica primaria declarada. No está disponible para 6 de los 7 foundation models de referencia, cuyas ejecuciones archivan puntuaciones de decisión o predicciones de clase en lugar de probabilidades calibradas, por lo que la precisión se convirtió en la métrica de comparación. TimEE es el único de los siete que lleva ROC-AUC. Lo declaramos en lugar de reetiquetar la precisión como preespecificada. La precisión balanceada, macro-F1 y log-loss son análisis de sensibilidad post hoc en el subconjunto cubierto.

Reproducibilidad. Las predicciones por instancia están archivadas para los 13 métodos y los 12 de la tabla primaria; cada predicción regenerada reproduce su escalar congelado con una diferencia máxima de 0.000e+00 (4.260 celdas del carril CPU reverificadas el 2026-08-02, cero huérfanos). La tabla primaria es completamente recalculable a partir de las predicciones publicadas.

Métodos no incluidos en este benchmark

Models relevantes para TSC publicados que no evaluamos, listados para que el límite del roster sea explícito. Ninguna de las afirmaciones aquí son nuestras mediciones. UniTS es un model unificado multi-tarea que cubre clasificación, pronóstico, imputación y detección de anomalías.18 TiViT convierte series en imágenes y clasifica con Vision Transformers preentrenados congelados.19 UniShape es un foundation model consciente de la forma construido para clasificación, con un adaptador consciente de la forma, aceptado en AAAI 2026.20 GPT4TS, también publicado como One Fits All, usa una espina dorsal GPT-2 cuyos bloques de auto-atención y feedforward permanecen congelados mientras se entrenan los componentes de entrada, normalización y salida.21 TIC-FM es un clasificador zero-shot en contexto que predice todas las instancias de prueba en una sola pasada hacia adelante;22 leer su diseño de una sola llamada como la misma clase de exposición que el hallazgo de composición de lote de arriba es nuestra inferencia de la descripción publicada, no un resultado probado.

Limitaciones

  • No existe un registro de superposición de preentrenamiento para ningún model preentrenado: ninguno publica una declaración a nivel de conjunto de datos sobre si las series UCR/UEA aparecen en su corpus de preentrenamiento, por lo que la transferencia no puede separarse de la exposición previa. Tratar las pérdidas como seguras descansa en una suposición que ningún registro a nivel de conjunto de datos puede probar: que la exposición previa, donde ocurrió, favoreció a estos models en lugar de perjudicarlos. Bajo esa suposición, quedan rezagados a pesar de la ventaja y las pérdidas se mantienen; cualquier victoria de un model preentrenado, por la misma lógica, no puede atribuirse limpiamente a la transferencia.
  • Los resultados de los foundation models son condicionales al protocolo de transferencia congelado único. El brazo post hoc de TiRex cambió solo la extracción de capas y elevó la precisión media en 1.13 puntos porcentuales mientras empeoraba siete de sus 30 conjuntos de datos, Heartbeat en 7.98 puntos con 0 de sus 30 remuestreos mejorando. Probó un model, no lleva rango y no establece el efecto para los otros foundation models.
  • Todos los tiempos de pared son rendimiento cargado bajo concurrencia variable en una máquina compartida. Seis de 13 métodos no llevan ninguno.
  • La evidencia cubre solo problemas del tamaño del archivo. Nada aquí habla de escalabilidad.
  • El benchmark inspecciona una versión de cada método en su fecha congelada.

Errores comunes al hacer benchmark de clasificación de series temporales

Superposición preentrenamiento-prueba. Una auditoría de 2025 rastreó 401 conjuntos de datos a través de 22 time series foundation models publicados y encontró que solo el 6 % nunca había aparecido en el corpus de preentrenamiento o fine-tuning de ningún model.23 Ningún model en nuestro roster publica una declaración de superposición a nivel de conjunto de datos, por lo que nuestra sección de limitaciones trata la transferencia y la exposición previa como inseparables.

Diseño de divisiones. El archivo UCR estándar incluye una división fija de entrenamiento/prueba; la práctica moderna remuestrea, y nuestro panel SleepEDF muestra por qué la estructura de sujetos necesita más que remuestreo: el diseño de división por sí solo movió la precisión reportada hasta 0.060 y comprimió su varianza aproximadamente de siete a nueve veces. Ninguna cifra única aquí es una propiedad del conjunto de datos; cada una es una propiedad del conjunto de datos bajo un diseño de división declarado.

Multiplicidad. Comparar muchos clasificadores en muchos conjuntos de datos sin corrección fabrica hallazgos. La maquinaria estándar es Wilcoxon de rangos con signo para pares y corrección por familia estilo Holm sobre cada contraste inspeccionado,2425 y la corrección debe cubrir cada contraste inspeccionado, no solo los reportados. En este benchmark esa disciplina eliminó 13 de 19 contrastes.

Apéndice: Sensibilidad de extracción de TiRex

Este brazo post hoc usa los mismos 30 conjuntos de datos, 30 divisiones de remuestreo, escalador y sonda logística que el resultado congelado de TiRex. Solo cambia la extracción de características, de la capa final del codificador a representaciones concatenadas de las 12 capas. El brazo es rango-free y no altera el benchmark congelado.

La precisión media se movió de 0.793 a 0.805, un cambio de 1.13 puntos porcentuales, con un intervalo de bootstrap de conjuntos de datos con semilla de +0.15 a +2.06 puntos. Una prueba de Wilcoxon de rangos con signo pareada sobre las 30 deltas de conjuntos de datos da una W exacta de dos colas de 92.0 con p=0.003. Esa prueba es exploratoria: se ejecutó después de la congelación, está fuera de la familia Holm de 19 contrastes que gobierna cada afirmación corregida aquí, y no lleva rango.

Auer et al. clasifican a TiRex primero entre los foundation models de pronóstico usando características concatenadas de capas y un Random Forest, y su propia ablación reporta un efecto de capa mayor de 5 puntos.26 Los dos estudios difieren en conjuntos de datos, roster de models, clasificador y filtrado de longitud de series, por lo que 1.13 y 5 puntos son estimaciones de sensibilidad específicas del protocolo en lugar de estimaciones competidoras de un efecto. Este brazo no reproduce ni refuta su clasificación, y no identifica la causa de la diferencia de rango entre estudios. Establece sensibilidad de capa para TiRex dentro de este benchmark. No generaliza el efecto a los otros foundation models ni identifica el mejor rendimiento de clasificación alcanzable de ningún model.

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Berk Kalelioğlu (2026) - "Benchmark de Clasificación de Series Temporales: Foundation Models vs Métodos Clásicos". Publicado en línea en AIMultiple.com. Recuperado el 24 de Agosto de 2026, de: https://aimultiple.com/time-series-classification [Recurso en línea]

Kalelioğlu, B. (2026, 24 de Agosto). Benchmark de Clasificación de Series Temporales: Foundation Models vs Métodos Clásicos. AIMultiple. https://aimultiple.com/time-series-classification

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk},
  title  = {{Benchmark de Clasificación de Series Temporales: Foundation Models vs Métodos Clásicos}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/time-series-classification}},
  note   = {AIMultiple. Recuperado el 24 de Agosto de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 61 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene 4 archivos CSV.

Última actualización: 17 de Agosto de 2026
Descargar

Enlaces de referencia

1.
Client Challenge
2.
[2606.21786] RocketPFN: Accurate Time Series Classification via In-Context Learning
3.
[2607.07500] TimEE: End-to-end Time Series Classification via In-Context Learning
4.
[2606.11473] CRUMB: Efficient Prior Fitted Network Inference via Distributionally Matched Context Batching
5.
[1810.07758] The UCR Time Series Archive
6.
[1811.00075] The UEA multivariate time series classification archive, 2018
7.
aeon/aeon/classification/convolution_based/_minirocket.py at main · aeon-toolkit/aeon · GitHub
8.
Client Challenge
9.
[2102.00457] MultiRocket: Multiple pooling operators and transformations for fast and effective time series classification
10.
[2203.13652] HYDRA: Competing convolutional kernels for fast and accurate time series classification
11.
[2012.08791] MINIROCKET: A Very Fast (Almost) Deterministic Transform for Time Series Classification
12.
[2402.03885] MOMENT: A Family of Open Time-series Foundation Models
13.
[2510.15821] Chronos-2: From Univariate to Universal Forecasting
14.
[2505.23719] TiRex: Zero-Shot Forecasting Across Long and Short Horizons with Enhanced In-Context Learning
15.
[2602.17868] MantisV2: Closing the Zero-Shot Gap in Time Series Classification with Synthetic Data and Test-Time Strategies
16.
[2511.19694] TiCT: A Synthetically Pre-Trained Foundation Model for Time Series Classification
17.
Client Challenge
18.
[2403.00131] UniTS: A Unified Multi-Task Time Series Model
19.
[2506.08641] Time Series Representations for Classification Lie Hidden in Pretrained Vision Transformers
20.
[2601.06429] A Unified Shape-Aware Foundation Model for Time Series Classification
21.
[2302.11939] One Fits All:Power General Time Series Analysis by Pretrained LM
22.
[2602.00620] Rethinking Zero-Shot Time Series Classification: From Task-specific Classifiers to In-Context Inference
23.
[2510.13654] Rethinking Evaluation in the Era of Time Series Foundation Models: (Un)known Information Leakage Challenges
24.
Statistical Comparisons of Classifiers over Multiple Data Sets
25.
An Extension on Statistical Comparisons of Classifiers over Multiple Data Sets for all Pairwise Comparisons
26.
[2510.26777] Pre-trained Forecasting Models: Strong Zero-Shot Feature Extractors for Time Series Classification
Berk Kalelioğlu
Berk Kalelioğlu
Investigador de IA
Berk es Investigador de IA en el equipo de benchmark de AIMultiple, centrándose en IA agéntica, aprendizaje automático y modelos de lenguaje grandes y pequeños (LLMs y SLMs).
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450