Benchmark de Classificação de Séries Temporais: Foundation Models vs Métodos Clássicos
Avaliamos 13 métodos de classificação de séries temporais, de foundation models de séries temporais pré-treinados a uma baseline de 22 features de 2019, em 33 datasets UCR/UEA sob um único protocolo congelado. São 14.638 células registradas de método-dataset-reamostragem, 11.874 delas pontuadas.
Resultados do benchmark TSC
O gráfico compara 12 métodos nos 15 datasets univariados que todos completaram, cada dataset executado com as mesmas 5 divisões de treino/teste. As barras são ordenadas pela acurácia média. A tabela abaixo também inclui o rank médio, a posição média que um método ocupa dentro de um dataset, e coloca os mesmos 12 em uma ordem diferente.
Não há um único vencedor. HIVE-COTE 2 ocupa o primeiro lugar em rank médio (2.400) e RocketPFN em acurácia média (0.905). Em um bootstrap de datasets com 5.000 sorteios, o primeiro lugar fica com HIVE-COTE 2 em 46.6% dos sorteios, RocketPFN em 45.5% e MultiRocket em 7.9%. As duas ordenações discordam e o bootstrap divide quase igualmente, então nomear qualquer um deles seria um artefato da métrica escolhida.
O grupo do topo é menor do que a tabela sugere. O clique de Wilcoxon-Holm é HIVE-COTE 2, RocketPFN, MultiRocket e Hydra. MiniRocket, seis décimos de rank atrás do Hydra em 4.700, não está nele: a inclusão vem dos testes pareados corrigidos, não de onde os números de rank caem.
Neste painel, as transformadas ocupam os ranks 3, 4 e 5 e os models pré-treinados ocupam 6, 7, 8 e 10. MOMENT, o model pré-treinado mais bem ranqueado com 6.633, fica quase dois ranks completos abaixo do MiniRocket.
catch22, publicado em 2019 com 22 features fixas, cai dentro da faixa dos pré-treinados em 8.700, à frente do Mantis-V2 (9.733) e atrás do TiRex (8.433). Em profundidade completa de 30 reamostragens, ele permanece nessa faixa, tanto no painel de 18 datasets abaixo, com 7.222, quanto em uma variante de 27 datasets e oito métodos que omite o RocketPFN.
Rank e acurácia discordam também na parte de baixo. DTW-1NN tem acurácia média pior que o TiCT (0.756 contra 0.776) e rank médio melhor (9.900 contra 10.200). Qual métrica você relata muda a ordem nas duas metades da tabela.
Apenas o meio da tabela é estável. Remover qualquer dataset individual altera a ordenação em 10 de 15 casos. Seis deles são a troca entre HIVE-COTE 2 e RocketPFN; Mantis-V2 e DTW-1NN trocam de posição em seis e DTW-1NN e TiCT em dois. As posições 3 a 9 nunca mudam.
A métrica de comparação é a acurácia porque a métrica primária declarada, ROC-AUC, não está disponível para 6 dos 7 foundation models de referência. O painel é apenas univariado: TiCT e RocketPFN não têm suporte multivariado nativo, então a regra de caso completo remove todos os 10 datasets multivariados. As linhas de foundation models medem esses models sob um único protocolo de transferência congelado. TimEE não recebe rank, pelo motivo abaixo. Uma participação de primeiro lugar em bootstrap é a frequência de ficar em primeiro entre coleções de datasets reamostradas, e nada mais.
A própria ordenação replica o bake-off de 2024, que estabeleceu que HIVE-COTE 2 e a família ROCKET lideram essa classe de problema e relata que HIVE-COTE 2 é muito mais lento.1 A contribuição aqui é uma medição independente e controlada em um elenco de 2026 sob um protocolo comum, com as separações quantificadas após correção por família de testes.
RocketPFN são features ROCKET fornecidas ao TabPFN,2 em contexto model tabular em vez de um foundation model de séries temporais pré-treinado, então sua posição acima das linhas pré-treinadas não diz nada sobre essa classe.
Com que frequência cada método fica em primeiro lugar
Cada barra é a proporção de 5.000 sorteios aleatórios dos 15 datasets, com repetições permitidas, em que um método fica em primeiro. Nove dos 12 métodos nunca ficam e não são desenhados. Os sorteios rodam com seed 1729. O primeiro lugar muda conforme os datasets sorteados, e as proporções não dizem nada sobre quão distantes os métodos estão.
Uma classificação Bradley-Terry modela a chance de cada método vencer outro em um dataset, e não pode fabricar um vencedor que os testes de significância não encontraram. Ela classifica HIVE-COTE 2 em 1384.6, RocketPFN em 1380.6 e MultiRocket em 1338.3, cada um deles do primeiro ao terceiro lugar ao longo dos sorteios. A âncora 1000 é relativa a estes 15 datasets, e uma classificação é a probabilidade modelada de vencer um dataset, não pontos de acurácia.
Os testes congelados de Wilcoxon-Holm, corrigidos por executar muitas comparações ao mesmo tempo, não detectam diferença entre HIVE-COTE 2, RocketPFN, MultiRocket e Hydra. Isso não é evidência de que tenham desempenho igual. Hydra fica em quarto ou quinto ao longo dos sorteios, o que também não o separa do topo. Essas posições resumem estabilidade, não significância. Nenhum vencedor único é sustentado.
Quais lacunas sobrevivem à correção
Dezenove contrastes pareados foram inspecionados e seis sobrevivem à correção de Holm. Cada ponto carrega seu intervalo de 95% e p-valor ajustado por Holm na tooltip; esses intervalos são resumos de bootstrap de datasets e não são ajustados por multiplicidade, então apenas os p-valores carregam Holm.
Cada contraste sobrevivente é uma transformada convolucional vencendo um model pré-treinado.
MultiRocket varre dois deles sem perder um dataset. 28 vitórias a 0 contra Chronos-2 e TiRex, com p = 1.4e-07.
Treze contrastes são inconclusivos, o que não é evidência de ausência de diferença. Nada envolvendo DTW-1NN sobrevive à correção, e nada no subconjunto multivariado sobrevive.
Cada linha é calculada nos datasets que o par compartilha, não em um painel comum, portanto as linhas não formam uma tabela de liga e não podem ser lidas umas contra as outras.
Os resultados de foundation models são condicionais a um protocolo de transferência: mean pooling da última camada com uma probe logística, aplicado de forma idêntica a MOMENT, Chronos-2, TiRex e Mantis-V2 e congelado antes de qualquer célula pontuada. Um braço post hoc, rank-free, mudou a extração de camada do TiRex e moveu a acurácia média de 0.793 para 0.805, 1.13 pontos percentuais, com 23 de 30 datasets melhorando e sete piorando. A maior perda, Heartbeat com 7.98 pontos, não melhorou em nenhuma de suas 30 reamostragens, então a média esconde um resultado que se inverte por dataset. Detalhes estão no apêndice.
Seis vezes a profundidade de divisão
Todas as tabelas acima rodam 5 divisões de treino/teste, porque HIVE-COTE 2 e DTW-1NN rodam apenas essas cinco sob a exceção congelada de células caras e a regra de reamostragem pareada puxa o restante para baixo para igualar. As barras mostram a acurácia média nas 30 divisões, e o rank médio dá a mesma ordem. Retirando esses dois, os nove métodos restantes rodam todas as 30 reamostragens estratificadas com seed em 18 datasets, a profundidade que o bake-off usa.
A ordenação se mantém. RocketPFN 1.694, MultiRocket 2.250, Hydra 2.889 e MiniRocket 3.833 ocupam os quatro primeiros lugares, todos os quatro construídos sobre features convolucionais aleatórias. Depois MOMENT 5.889, Chronos-2 6.444 e TiRex 7.056, com catch22 em 7.222 e Mantis-V2 em 7.722. O qui-quadrado de Friedman é 105.067 com p = 3.9e-19. Cinco divisões não o fabricaram.
Os dois blocos se separam claramente nessa profundidade. O intervalo de rank bootstrap de 95% do MiniRocket alcança 4.278 e o do MOMENT começa em 5.111, e em todos os 5.000 sorteios bootstrap, nenhum model pré-treinado teve rank médio que cruzasse para o intervalo do bloco convolucional.
Dez dos doze pares transformada-contra-pré-treinado sobrevivem à correção de Holm aqui. Os dois que não sobrevivem, MiniRocket sobre MOMENT com p = 0.108 e Hydra sobre MOMENT com p = 0.105, ambos sobrevivem no painel primário. Holm cobre a própria família de 36 pares deste painel, então essa contagem e os seis sobreviventes do painel primário respondem a perguntas diferentes.
O primeiro lugar não está mais definido. RocketPFN o assume em 92.9% dos 5.000 sorteios bootstrap de datasets, contra 46.6% e 45.5% no painel primário, mas HIVE-COTE 2, o método com quem divide o primeiro lugar lá, está ausente aqui. O clique do topo ainda tem três integrantes: RocketPFN, MultiRocket e Hydra. MiniRocket fica fora dele novamente, compartilhando um clique com MOMENT.
Isto é uma verificação de profundidade, não uma replicação independente. Os 18 datasets contêm todos os 15 do painel primário mais ElectricDevices, StarLightCurves e UWaveGestureLibraryAll, então a fragilidade por omissão de um dataset acima permanece. É apenas univariado pelo mesmo motivo, a presença de RocketPFN. O que ele descarta é uma ordenação que dependa de cinco divisões específicas.
A composição do lote altera as previsões do TimEE
TimEE é um classificador em contexto cuja manchete publicada é o primeiro lugar em ROC-AUC no benchmark UCR.3 Nós o executamos em duas máquinas e comparamos resultados em nível de célula.
A concordância quebra exatamente no tamanho de batch do harness de 512. A acurácia é idêntica em 270 de 270 células onde o conjunto de teste cabe em uma chamada, e em 146 de 325 células onde não cabe. Para ROC-AUC, a divisão é 221 de 270 contra 12 de 308. As duas máquinas diferem em hardware em ambos os estratos, então nenhum estrato isoladamente prova algo; o contraste entre eles é a evidência.
Por dataset, a quebra é mais nítida do que os totais por estrato sugerem. Todos os datasets cujo conjunto de teste cabe em uma chamada concordam em acurácia em 30 de 30 reamostragens, e nenhum dataset acima do limiar chega a 30 de 30. ROC-AUC é pior em ambos os lados da linha, caindo abaixo da metade em dois datasets pequenos o bastante para caber.
O mecanismo está no código-fonte. A função de embedding estatístico calcula z-score de cada feature em todas as linhas da chamada de inference, tanto linhas de suporte quanto de consulta, sem nenhuma proteção separando posições de treinamento das de avaliação. Trinta linhas depois, o mesmo arquivo aplica exatamente essa proteção a uma etapa de normalização diferente. Uma troca controlada de pares confirma isso: mantendo uma consulta âncora fixa e substituindo as outras 511 consultas na chamada, a probabilidade prevista da âncora muda em 1.163e-04, contra um ruído de repetição exatamente zero. TiCT e RocketPFN, testados de forma idêntica, são bit-idênticos sob a mesma troca.
Uma previsão do TimEE, portanto, não é função apenas da série de entrada. Seus escores são reproduzíveis em composição de batch fixa, então ele não pode receber um rank equivalente ao de classificadores indutivos e este benchmark o relata sem um. Isso qualifica a alegação publicada de ROC-AUC, já que ROC-AUC é calculado exatamente a partir das probabilidades que se mostraram dependentes da chamada. Isso não mostra que os escores estão inflacionados em nenhuma direção, não altera o rank publicado, que foi obtido em um leaderboard que não controlamos, e cobre a versão que inspecionamos.
Três das quatro rotas de detecção não precisam de acesso ao código-fonte. Repita uma célula duas vezes, troque os pares do batch em torno de uma âncora fixa e compare os resultados entre duas máquinas estratificadas pela fronteira do batch. Trabalhos publicados relacionados agrupam em batch a inference de redes pré-ajustadas por consultas de teste agrupadas por eficiência e não relatam dependência da composição.4
Resultados do painel multivariado
Uma lista restrita construída no painel amplo não se transfere para dados multivariados. MOMENT é o último dos dez no painel multivariado de 9 datasets, embora seja o model pré-treinado mais bem ranqueado no painel amplo de 24 datasets, com 6.729. Mantis-V2 vai no sentido oposto: 5.444 no painel multivariado contra 7.208 no amplo.
Isso não é um efeito de modalidade. O painel amplo contém os datasets multivariados como um subconjunto, então o movimento é um contraste entre dois elencos de tamanho e composição de tarefas diferentes, não algo medido dentro de nenhum método. Com N=9 e nenhum contraste sobrevivendo à correção, leia isso como um aviso contra levar uma lista restrita do painel amplo para uma implantação multivariada, não como um resultado de seleção.
Resultados de divisões agrupadas por sujeito
Os arquivos UCR e UEA fornecem divisões fixas de treino/teste definidas sobre séries individuais, sem anotação de sujeito ou origem para dividir,56 então reamostrá-los embaralha séries em vez de sujeitos. No estadiamento do sono SleepEDF, em que um sujeito contribui com muitas janelas, também dividimos por sujeito. MiniRocket carrega 8 de 10 folds aleatórios por causa do corte de congelamento.
A divisão aleatória reporta acurácia maior, em 0.060 para catch22 e 0.030 para MiniRocket.
A compressão de variância é a metade mais transferível. A variabilidade fold a fold é aproximadamente sete a nove vezes menor sob divisão aleatória do que sob agrupamento por sujeito, tanto na acurácia por janela quanto na acurácia macro por sujeito. Um model selecionado em divisões aleatórias parece melhor e mais estável do que o mesmo model avaliado da forma como será implantado, em sujeitos não vistos.
Relatamos uma lacuna associada à divisão, nunca vazamento. Os dados não podem dizer se a lacuna vem de vazamento de identidade de sujeito ou de variação genuína dificuldade do sujeito e na mistura de estágios, e as divisões aleatórias distribuem essa variação por todos os conjuntos de teste, o que estabiliza a acurácia mecanicamente. O experimento que separaria os dois, épocas de teste idênticas sob conjuntos de treinamento que contêm e não contêm os sujeitos de teste, rodou em PTB-XL e foi descartado do SleepEDF por questão de computação. O próprio PTB-XL mantém 14.9% de sobreposição de mesmo sujeito sob divisão aleatória, portanto é um comparador de baixa sobreposição, não um controle nulo.
Dados desbalanceados: Earthquakes
A acurácia esconde um ranking quase aleatório. Todos os métodos da via de CPU relatam acurácia de 0.72 a 0.78 em Earthquakes, enquanto a acurácia balanceada vai de 0.4996 a 0.5453. Leia 0.5 como acaso apenas no eixo de acurácia balanceada; o acaso para acurácia comum depende da prevalência de classe.
O método com a maior acurácia tem a menor acurácia balanceada. catch22 com acurácia de 0.783 registra 0.4996 balanceada, numericamente logo abaixo de 0.5. Se ele está literalmente prevendo a classe majoritária não foi medido; o valor citado não carrega incerteza nem teste contra 0.5.
A inversão é local, não uma propriedade do método. Em todo o painel, catch22 está claramente por último em acurácia balanceada, 0.726 contra 0.806 do MultiRocket. A acurácia balanceada é uma métrica post hoc aqui, calculada após o congelamento a partir de previsões arquivadas. DTW-1NN carrega 5 reamostragens contra 30 dos outros quatro métodos, então seu ponto se baseia em menos evidência.
Rótulos rígidos, não probabilidades
Quatro dos seis métodos da via de CPU não retornam probabilidade. MiniRocket, MultiRocket, Hydra e DTW-1NN colocam 1 na classe prevista e 0 em todas as outras, então sua log loss é a acurácia sob outro nome. Ela é igual à taxa de erro vezes 36.0437 em todas as 2.465 células onde log loss foi registrada, com precisão de 7.1e-15. Essa constante é a penalidade que o scikit-learn atribui a uma probabilidade zero na classe verdadeira.
A receita se comporta como documentada. Os três classificadores convolucionais usam por padrão uma cabeça ridge sem saída de probabilidade, e a biblioteca preenche a lacuna com um vetor one-hot; DTW-1NN com um vizinho tem a mesma forma por construção.7
O ROC-AUC calculado para eles, portanto, mede o rótulo, não um ranking. Nos 27 datasets em que todos os seis carregam ROC-AUC completo, catch22 registra 0.884 contra 0.866 do MultiRocket, embora fique atrás por 7.2 pontos de acurácia, 0.782 contra 0.854. Leia isso como catch22 tendo um escore utilizável e MultiRocket não tendo nenhum, não como catch22 ordenando casos melhor.
Apenas dois dos seis podem ser comparados em probabilidades. Nos 22 datasets com log loss completo, HIVE-COTE 2 tem média 0.344 contra catch22 com 0.527, medianas 0.265 e 0.371, e é menor em 19 de 22. Ambos os valores descrevem saída arquivada. Nenhum experimento de calibração rodou e nenhum teste congelado os cobre.
A tabela de acurácia não se move. O que ela não carrega é isto: uma carga de trabalho que ranqueia ou aplica limiar a casos não ganha nada para limiar com a receita padrão de MiniRocket, MultiRocket, Hydra ou DTW-1NN. Uma cabeça probabilística nas mesmas features não foi executada.
Computação registrada
O gráfico plota células pareadas: cada método da via de CPU restrito aos 28 datasets que todos os seis rodaram, nas reamostragens 0 a 4, o que dá 140 células cada. Horas-núcleo de CPU registradas nessas células: HIVE-COTE 2 694.23, DTW-1NN 356.82, MultiRocket 2.81, Hydra 2.12, catch22 0.54 e MiniRocket 0.48.
A restrição é o que torna uma razão significativa. A computação registrada totaliza 1.496.5 horas-núcleo em toda a via de CPU, das quais HIVE-COTE 2 responde por 804.8: 694.2 ao longo de suas 140 células ranqueadas e o restante em quatro células de diagnóstico post hoc excluídas de todas as tabelas. MultiRocket responde por 26.2 ao longo de 990 células ranqueadas. Esses dois totais cobrem quantidades de trabalho diferentes, então nenhuma razão entre eles compara os métodos.
Células pareadas tornam uma razão possível. Restringir cada método da via de CPU aos 28 datasets que todos os seis rodaram, nas reamostragens 0 a 4, dá 140 células cada. Horas-núcleo de CPU registradas: HIVE-COTE 2 694.23, DTW-1NN 356.82, MultiRocket 2.81, Hydra 2.12, catch22 0.54 e MiniRocket 0.48.
Nesses mesmos 28 datasets, HIVE-COTE 2 vence MultiRocket em 18 e perde em 9, uma diferença média de acurácia de 0.012 que não sobrevive à correção de Holm. Isso é 247 vezes o tempo de CPU para uma diferença que este benchmark não consegue detectar. DTW-1NN, a baseline que o protocolo do arquivo exige de todo resultado publicado, custa 747 vezes MiniRocket nas mesmas células.
Todos os métodos aqui rodaram com uma única thread em n_jobs = 1, uma célula por processo, então o tempo de parede registrado é tempo de núcleo. Dois limites ainda se aplicam a ambas as razões. Os tempos são vazão sob o que quer que a máquina estivesse executando, não latência solo. E HIVE-COTE 2 rodou em sua própria via de configuração, enquanto os outros cinco compartilharam uma, então sua razão atravessa duas vias; a razão DTW-1NN para MiniRocket é medida dentro de uma única via.
Nenhuma comparação de custo entre métodos clássicos e foundation models é possível a partir deste benchmark, e não fazemos nenhuma. Os seis métodos da via de GPU não registraram tempo de parede. TimEE tem tempo de parede registrado, mas é excluído gráfico porque não carrega rank.
Métodos comparados
HIVE-COTE 2
Primeiro em rank médio (2.400) no painel primário, não separável do RocketPFN. Rodou 140 células ranqueadas por 694.2 horas-núcleo registradas, o método mais caro da via de CPU registrada, e não concluiu FaceDetection (144 canais). Um meta-ensemble heterogêneo sobre representações shapelet, de dicionário, de intervalo e convolucionais.8
RocketPFN
Primeiro em acurácia média (0.905), não separável do HIVE-COTE 2. Bit-idêntico no teste de troca de pares. Apenas univariado, então nunca entra no painel UEA. Combina features convolucionais da família ROCKET com classificação em contexto pelo foundation model tabular TabPFN v2.5, portanto nenhum model é ajustado no dataset alvo; seu artigo relata paridade com HIVE-COTE 2 em acurácia média de 0.900 em 92 datasets UCR.2
MultiRocket
Terceiro em rank médio (2.800) e o recorde pareado mais forte: todos os quatro contrastes inspecionados contra models pré-treinados sobrevivem a Holm, dois com 28 vitórias a 0. 26.2 horas-núcleo registradas para 990 células. Estende MiniRocket com múltiplos operadores de pooling e diferenças de primeira ordem.9
Hydra
Rank médio 4.100; sua vitória sobre MOMENT (22/6) sobrevive à correção. Um método convolucional estilo dicionário: kernels competem em grupos e as contagens de kernels vencedores formam a representação.10
MiniRocket
Rank médio 4.700 com 4.9 horas-núcleo registradas para 990 células, o método forte mais barato da via de CPU registrada; sua vitória sobre MOMENT (24/4) sobrevive à correção. Uma transformada de kernel convolucional aleatória quase determinística com um classificador linear.11
MOMENT
Model pré-treinado mais bem ranqueado no painel primário univariado (6.633); perde para todas as três transformadas convolucionais com contrastes sobreviventes. Um model baseado em T5 com 385M de parâmetros pré-treinado em um corpus multidomínio para previsão, classificação, detecção de anomalias e imputação.12
Chronos-2
Rank médio 7.967; perde para MultiRocket por 28/0. Um foundation model de previsão usado aqui como um extrator congelado de embeddings, o que não é sua tarefa nativa.13
TiRex
Rank médio 8.433; perde para MultiRocket por 28/0. Um model de previsão zero-shot baseado em xLSTM,14 também usado aqui como um extrator congelado. No braço de sensibilidade post hoc, mudar a extração da última camada para concatenação de todas as camadas elevou a acurácia média em 1.13 pontos percentuais em seu painel de 30 datasets: 23 datasets melhoraram e sete pioraram, Heartbeat em 7.98 pontos sem nenhuma de suas 30 reamostragens melhorando. O resultado congelado da última camada e o rank permanecem primários; o braço de sensibilidade não carrega rank.
Mantis-V2
Rank médio 9.733 no painel univariado e 5.444 no multivariado; perde para MultiRocket por 24/3. Não concluiu FaceDetection: 144 canais sobrecarregam sua cabeça de classificação nativa. Um model de classificação leve pré-treinado por contraste, com dados sintéticos e estratégias de tempo de teste adicionadas na V2.15
TimEE
Relatado sem rank; veja a descoberta sobre composição de batch acima. Acurácia média 0.841 nos 21 datasets de seu painel relatado, calculada com composição de batch fixa. Duas exclusões declaradas antes dos resultados se aplicam: NonInvasiveFetalECGThorax1 está parcial em 5 de 30 reamostragens, e Phoneme é relatado apenas em sua divisão de arquivo. Um model de 4.5M de parâmetros meta-treinado em tarefas sintéticas que classifica de ponta a ponta em contexto, em uma única passagem para frente a partir de um conjunto de suporte rotulado.3
TiCT
Rank médio 10.200. Apenas univariado; seu runner foi o único a aplicar a regra de validade de classe rara em Phoneme, contribuindo com uma célula válida onde outras vias rodaram 30. Bit-idêntico no teste de troca de pares. Um transformer em contexto pré-treinado em dados sintéticos com codificação de rótulos baseada em bits para contagens arbitrárias de classes.16
DTW-1NN
Rank médio 9.900. Não concluiu StarLightCurves, um DNF declarado por custo em 95 horas para uma célula indivisível. Um vizinho mais próximo sob distância Dynamic Time Warping, a baseline mais antiga do campo.
catch22
Rank médio 8.700 no painel primário. Vinte e duas features sumárias fixas e interpretáveis alimentando um classificador simples.17
Quando escolher um foundation model em vez de um classificador clássico
- Muitos dados de treinamento rotulados: todos os contrastes que sobrevivem à correção aqui favorecem uma transformada convolucional, e dois dos três, MultiRocket e Hydra, estão no clique do topo ao lado de HIVE-COTE 2 e RocketPFN.
- Rótulos severamente limitados ou implantação cold-start: models em contexto e zero-shot são os candidatos, e este é o regime que nosso benchmark não mede. Todos os nossos painéis usam divisões de treinamento completas do arquivo.
- Dados multivariados: verifique primeiro a cobertura nativa. Dois dos três métodos em contexto deste elenco são apenas univariados.
- Maior acurácia independentemente de computação: HIVE-COTE 2 e RocketPFN não são separáveis com esta evidência. Este benchmark não separa nem a acurácia nem a computação deles, porque RocketPFN não tem tempo registrado.
Um orçamento de computação que importa: nas 140 células pareadas acima, MultiRocket usa 1/247 das horas-núcleo de CPU do HIVE-COTE 2 e nenhuma diferença de acurácia entre eles sobrevive à correção nesses datasets. - Requisitos de auditabilidade: prefira métodos cujas previsões sejam reproduzíveis apenas a partir da entrada. A descoberta sobre composição de batch acima é o caso de advertência.
O que é classificação de séries temporais
A classificação de séries temporais treina um model em sequências numéricas ordenadas e rotuladas para prever uma classe discreta para uma série não vista: diagnóstico de ECG, reconhecimento de atividade humana a partir de wearables, detecção de falhas industriais. Ela difere da previsão, que produz valores futuros em vez de um rótulo de classe. Models tabulares não codificam a ordem dos valores como um viés indutivo; eles tratam cada timestep como uma coluna independente.
Métodos clássicos ajustam um novo model por dataset. Um foundation model de séries temporais é pré-treinado uma vez em um grande corpus e, então, aplicado a novos datasets zero-shot, por meio de uma probe leve, ou em contexto a partir de um punhado de exemplos rotulados fornecidos no momento da inference. Se esse pré-treinamento atualmente compra acurácia de classificação em arquivos padrão, sob um protocolo controlado, é a pergunta que este benchmark mede.
Metodologia do benchmark de classificação de séries temporais
Métodos. Quatro famílias: foundation models pré-treinados avaliados por meio de um protocolo de transferência (MOMENT, Chronos-2, TiRex, Mantis-V2), models em contexto (TimEE, TiCT, RocketPFN), transformadas convolucionais (MiniRocket, MultiRocket, Hydra) e referências clássicas (HIVE-COTE 2, DTW-1NN, catch22).
Dados. 23 datasets univariados UCR e 10 datasets multivariados UEA,56 além de uma camada não IID separada em SleepEDF e PTB-XL. 14.638 células registradas, divididas na tabela de cobertura abaixo.
Cobertura. As células pontuadas não são distribuídas uniformemente entre os métodos, e os denominadores decidem quais comparações são possíveis.
Toda comparação ranqueada roda na interseção de casos completos dos métodos que nomeia, nunca na cobertura de um único método, o que permite que as 140 células do HIVE-COTE 2 e as 2.760 de RocketPFN apareçam na mesma tabela. A exportação completa contém 14.638 linhas: essas 11.874 células pontuadas, o braço de reprodução do protocolo do artigo com 2.760 células de RocketPFN e 4 células de diagnóstico post hoc do HIVE-COTE 2.
Reamostragem. r0 é a divisão de treino/teste do arquivo; r1 a r29 são embaralhamentos estratificados nas proporções do arquivo, com seed 1729+r. A unidade inferencial é o dataset: as reamostragens são agregadas dentro de um dataset antes de os métodos serem comparados. HIVE-COTE 2 e DTW-1NN rodam 5 reamostragens porque seu custo por célula é uma a duas ordens de magnitude maior, e a tabela primária restringe todos os métodos às mesmas 5 reamostragens pareadas. A divisão de arquivo r0 é sistematicamente mais difícil do que as reamostragens com seed em 8 de 33 datasets, em até 0.218 de acurácia, então as cinco reamostragens pareadas não são sorteios intercambiáveis.
Protocolo de transferência. Todos os foundation models de referência rodam o mesmo pipeline: codificação por variável, última camada do codificador, mean-pool sobre tokens de contexto válidos, normalização L2 por variável, concatenação de canais, padronização apenas no treino e probe de regressão logística. Congelado em 2026-07-24, antes de qualquer célula pontuada.
Estatísticas. Omnibus de Friedman e, em seguida, Wilcoxon pareado com correção de Holm sobre todos os 19 contrastes inspecionados, em médias por dataset, apenas painéis de casos completos. O omnibus sustenta apenas que os ranks diferem em algum lugar; toda afirmação pareada vem dos contrastes corrigidos.
Congelamento. Os dados congelaram em 2026-07-29 03:00 UTC, com regras de exclusão escritas antes de os resultados pendentes serem conhecidos. Uma célula terminou 22 minutos após o corte e é excluída sob a regra pré-escrita. A liberação passa por 120 verificações mecânicas de asserção, incluindo comparação de hash de todos os arquivos de entrada, regeneração da tabela primária a partir da exportação e aplicação das exclusões declaradas por trás do número publicado de TimEE tanto no artigo quanto nas tabelas de liberação.
Métricas. ROC-AUC era a métrica primária declarada. Ela não está disponível para 6 dos 7 foundation models de referência, cujas execuções arquivam escores de decisão ou previsões de classe em vez de probabilidades calibradas, então a acurácia se tornou a métrica de comparação. TimEE é o único dos sete que carrega ROC-AUC. Declaramos isso em vez de rotular a acurácia como pré-especificada. Acurácia balanceada, macro-F1 e log-loss são análises de sensibilidade post hoc no subconjunto coberto.
Reprodutibilidade. Previsões por instância são arquivadas para todos os 13 métodos e todos os 12 da tabela primária; cada previsão regenerada reproduz seu escalar congelado com diferença máxima de 0.000e+00 (4.260 células da via de CPU reverificadas em 2026-08-02, zero órfãs). A tabela primária é totalmente recalculável a partir das previsões liberadas.
Métodos que não estão neste benchmark
Models relevantes para TSC publicados e que não avaliamos, listados para que a fronteira do elenco fique explícita. Nenhuma das afirmações aqui são medições nossas. UniTS é um model multitarefa unificado que cobre classificação, previsão, imputação e detecção de anomalias.18 TiViT converte séries em imagens e classifica com Vision Transformers pré-treinados congelados.19 UniShape é um foundation model com consciência de forma construído para classificação, com um adaptador shape-aware, aceito na AAAI 2026.20 GPT4TS, também publicado como One Fits All, usa um backbone GPT-2 cujos blocos de self-attention e feedforward permanecem congelados enquanto os componentes de entrada, normalização e saída são treinados.21 TIC-FM é um classificador zero-shot em contexto que prevê todas as instâncias de teste em uma única passagem para frente;22 ler seu design de chamada única como a mesma classe de exposição da descoberta sobre composição de batch acima é uma inferência nossa a partir da descrição publicada, não um resultado testado.
Limitações
- Não existe um registro de sobreposição de pré-treinamento para nenhum model pré-treinado: nenhum publica uma declaração em nível de dataset se as séries UCR/UEA aparecem em seu corpus de pré-treinamento, então a transferência não pode ser separada da exposição anterior. Tratar as perdas como seguras repousa em uma suposição que nenhum registro em nível de dataset pode testar: a de que a exposição anterior, quando ocorreu, favoreceu esses models em vez de prejudicá-los. Sob essa suposição, eles ficam atrás apesar da vantagem e as perdas permanecem; qualquer vitória de model pré-treinado, pela mesma lógica, não pode ser creditada claramente à transferência.
- Resultados de foundation models são condicionais ao único protocolo de transferência congelado. O braço post hoc do TiRex mudou apenas a extração de camadas e elevou a acurácia média em 1.13 pontos percentuais, enquanto piorou sete de seus 30 datasets, Heartbeat em 7.98 pontos com 0 de suas 30 reamostragens melhorando. Ele testou um model, não carrega rank e não estabelece o efeito para os outros foundation models.
- Todos os tempos de parede são vazão sob concorrência variável em uma máquina compartilhada. Seis de 13 métodos não carregam nenhum.
- A evidência cobre apenas problemas do tamanho de arquivos. Nada aqui fala sobre escalabilidade.
- O benchmark inspeciona uma versão de cada método em sua data congelada.
Armadilhas comuns em benchmark de classificação de séries temporais
Sobreposição pré-treinamento-teste. Uma auditoria de 2025 rastreou 401 datasets em 22 foundation models de séries temporais publicados e descobriu que apenas 6% nunca haviam aparecido no corpus de pré-treinamento ou fine-tuning de nenhum model.23 Nenhum model em nosso elenco publica uma declaração de sobreposição em nível de dataset, razão pela qual nossa seção de limitações trata transferência e exposição anterior como inseparáveis.
Design de divisão. O arquivo UCR padrão fornece uma divisão fixa de treino/teste; a prática moderna reamostra, e nosso painel SleepEDF mostra por que a estrutura de sujeitos precisa de mais do que reamostragem: apenas o design da divisão moveu a acurácia relatada em até 0.060 e comprimiu sua variância em aproximadamente sete a nove vezes. Nenhum número isolado aqui é uma propriedade do dataset; cada um é uma propriedade do dataset sob um design de divisão declarado.
Multiplicidade. Comparar muitos classificadores em muitos datasets sem correção fabrica descobertas. O aparato padrão é Wilcoxon pareado para pares e correção familiar do tipo Holm em todos os contrastes inspecionados,2425 e a correção deve cobrir todos os contrastes inspecionados, não apenas os relatados. Neste benchmark, essa disciplina eliminou 13 de 19 contrastes.
Apêndice: sensibilidade da extração do TiRex
Este braço post hoc usa os mesmos 30 datasets, 30 divisões de reamostragem, scaler e probe logística do resultado congelado do TiRex. Apenas a extração de features muda, da última camada do codificador para representações concatenadas de todas as 12 camadas. O braço é rank-free e não altera o benchmark congelado.
A acurácia média passou de 0.793 para 0.805, uma mudança de 1.13 ponto percentual, com um intervalo bootstrap de datasets com seed de +0.15 a +2.06 pontos. Um teste Wilcoxon pareado sobre os 30 deltas de dataset dá um W bicaudal exato de 92.0 com p=0.003. Esse teste é exploratório: foi executado após o congelamento, está fora da família Holm de 19 contrastes que governa toda afirmação corrigida aqui e não carrega rank.
Auer et al. ranqueiam TiRex primeiro entre foundation models de previsão usando features concatenadas por camadas e uma Random Forest, e a própria ablação deles relata um efeito de camada maior, de 5 pontos.26 Os dois estudos diferem em datasets, elenco de models, classificador e filtragem por comprimento de série, então 1.13 e 5 pontos são estimativas de sensibilidade específicas de protocolo, em vez de estimativas concorrentes de um único efeito. Este braço não reproduz nem refuta o ranking deles e não identifica a causa da diferença de rank entre estudos. Ele estabelece sensibilidade de camada para o TiRex dentro deste benchmark. Ele não generaliza o efeito para os outros foundation models nem identifica o melhor desempenho de classificação atingível de qualquer model.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{Benchmark de Classificação de Séries Temporais: Foundation Models vs Métodos Clássicos}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/time-series-classification}},
note = {AIMultiple. Acessado em 24 Agosto 2026}
}Resultados e carimbos de data/hora de 61 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 4 arquivos CSV.
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.