Benchmark de Modelos Tabulares: Rendimiento en 19 Conjuntos de Datos
Evaluamos 8 modelos de aprendizaje tabular en 19 conjuntos de datos del mundo real que cubren aproximadamente 260,000 muestras, con tamaños de conjunto desde 435 hasta 48,800 filas. Cada modelo se ejecutó en la misma máquina con validación cruzada de 5 pliegues y divisiones idénticas.
Resultados del benchmark de modelos de aprendizaje tabular
Cada conjunto de datos es un round-robin de enfrentamientos cabeza a cabeza entre modelos, decidido por la métrica principal. Elo agrega todos los 483 enfrentamientos en una sola calificación por modelo; una diferencia de 200 puntos significa que el modelo con mayor calificación gana aproximadamente 3 de cada 4 enfrentamientos. Los detalles se encuentran en la metodología.
TabFM, lanzado por Google Research el 30 de junio de 20261 , ganó en 15 de los 19 conjuntos de datos. Se sitúa 218 puntos Elo por encima del siguiente modelo y 538 por encima del mejor árbol potenciado por gradiente. Ningún árbol potenciado ganó un solo conjunto de datos.
Elo también maneja la cobertura parcial de manera justa: Mitra se califica solo en los enfrentamientos que pudo disputar, es decir, los 12 conjuntos de datos dentro de su límite de entrenamiento de 10,000 filas2 .
- Las 15 victorias de TabFM incluyen todos los conjuntos de datos grandes y difíciles: adult (0.9318 ROC-AUC), electricity (0.9936), bank-marketing-full (0.9465), y house_sales (RMSE 97,704).
- Su mayor margen es vehicle, el único conjunto de datos multiclase: 0.9136 macro-F1 contra 0.7492 de XGBoost.
- Las cuatro victorias no de TabFM: Regresión Logística en amazon_employee_access, TabICLv2 en compas-two-years, Mitra en breast-w, y un empate a tres bandas de modelos fundacionales con una puntuación perfecta de 1.0000 en monks-problems-2.
- La victoria de Regresión Logística es más ajustada de lo que sugiere la tabla: 0.8631 ROC-AUC contra 0.8627 de TabFM y 0.8621 de CatBoost, con desviaciones estándar a nivel de pliegue de 0.010 a 0.015. En datos categóricos de cardinalidad extrema, los mejores modelos clásicos y TabFM están estadísticamente empatados, y el argumento clásico se basa en el costo más que en la precisión.
Un límite en el titular: la ventaja de TabFM sobre los cuatro modelos clásicos es estadísticamente significativa (prueba de Friedman, luego diferencia crítica de Nemenyi; cada brecha la supera). Su ventaja sobre TabPFN 3 y TabICLv2 no está resuelta con 19 conjuntos de datos: esas brechas se mantienen por debajo de la diferencia crítica, y los intervalos Elo se solapan en el borde. Que los modelos fundacionales superen al gradient boosting es la afirmación respaldada estadísticamente; que TabFM lidere el grupo de fundacionales es un resultado de rango medio que espera más conjuntos de datos. Los detalles de la prueba están en la metodología.
Latencia de los modelos tabulares
- El precio de GPU utiliza la tarifa bajo demanda B200 de RunPod de $5.89 por GPU-hora al 2 de julio de 20263 . Los modelos clásicos se ejecutaron en CPU (62 núcleos); cada modelo fundacional se ejecutó en una B200.
- TabFM promedió 173.6 segundos por pliegue (mediana 16.9). Su peor conjunto de datos, adult con 48,800 filas, tomó 893 segundos por pliegue. El benchmark completo le costó a TabFM alrededor de $27 en tiempo de GPU; TabPFN 3 hizo el mismo trabajo por $0.65 y LightGBM prácticamente nada en CPU.
- Esas cifras excluyen el arranque en frío de TabFM. Antes de su primera predicción, el backend JAX de TabFM pasa aproximadamente de 20 a 25 minutos compilando kernels de GPU. Una caché de compilación persistente elimina esto en ejecuciones posteriores; cualquier despliegue nuevo lo paga una vez.
- TabFM también tuvo la mayor carga de configuración de los ocho modelos. Requiere una GPU de centro de datos reciente, y en hardware B200 la pila CUDA 12 predeterminada desencadena un error documentado de cuBLAS que JAX señala como un riesgo silencioso de corrupción de datos. Una de nuestras ejecuciones tuvo que ser descartada y repetida en la pila CUDA 13 debido a ello. Ningún otro modelo tuvo un modo de fallo comparable.
- TabFM traslada el costo a la inferencia: cada lote de predicción reprocesa los datos de entrenamiento como contexto. Servido una vez por conjunto de datos, esto está bien. Para puntuaciones repetidas en datos grandes, el costo por llamada se acumula, mientras que un modelo XGBoost entrenado predice en microsegundos.
Resultados por tamaño del conjunto de datos y tipo de característica
- Conjuntos de datos pequeños (menos de 1,000 filas): los cuatro modelos fundacionales ocupan los cuatro primeros puestos tanto en datos numéricos como híbridos. Mitra, diseñado para datos pequeños, gana en breast-w y empata monks-problems-2 con una puntuación perfecta. La Regresión Logística se mantiene en datos numéricos (91.2% ROC-AUC promedio) y colapsa en híbridos (77.5%).
- Conjuntos de datos medianos (de 1,000 a 10,000 filas): los modelos fundacionales lideran en ambos tipos de características. La brecha híbrida es amplia: TabFM 85.3% ROC-AUC promedio contra 83.4% para el mejor modelo clásico, CatBoost.
- Conjuntos de datos grandes (más de 10,000 filas): el viejo patrón de “el boosting alcanza a escala” ha desaparecido. En datos numéricos grandes TabFM promedia 99.4% frente al 97.0% de XGBoost. En datos híbridos grandes TabFM lidera con 88.4% frente al 87.6% de LightGBM.
Rango promedio por régimen
La vista de rangos añade dos cosas que los promedios ROC-AUC ocultan.
- TabFM mantiene el rango promedio más alto en los seis regímenes, incluyendo un perfecto 8.0 en datos numéricos medianos, donde quedó primero en todos los conjuntos de datos.
- Cuán reñida está la carrera depende del régimen. En datos pequeños los cuatro modelos fundacionales están a menos de un punto de rango entre sí, por lo que los usuarios de datos pequeños pueden elegir cualquiera de ellos y perder poca precisión. En datos híbridos grandes el campo se divide: TabFM en 6.8, el segundo lugar en 4.4. El tercer lugar de LightGBM allí (4.2) es la mejor actuación clásica en cualquier régimen.
Victorias de modelos por régimen
TabFM obtiene puntos de victoria en los seis regímenes; ningún otro modelo puntúa en más de dos. El único punto de los modelos clásicos en toda la cuadrícula es la victoria de Regresión Logística en amazon_employee_access. Todos los puntos de Mitra se sitúan en la fila de datos pequeños, en consonancia con su diseño.
El régimen sigue importando, pero para elegir cuánto cómputo gastar, ya no para elegir qué familia de modelos gana.
Observaciones específicas de cada modelo
TabFM (Google Research, junio de 2026)
Mejor rango medio (1.42), 15 victorias absolutas, primer modelo en cada régimen. Arquitectónicamente es un híbrido: atención por filas y columnas al estilo TabICL sobre celdas brutas, compresión de filas, luego un transformador en contexto al estilo TabPFN sobre las filas comprimidas, preentrenado en cientos de millones de tablas sintéticas. Las contrapartidas: aproximadamente 40x el cómputo de TabPFN 3, una compilación inicial de más de 20 minutos, un límite de 500 características y 10 clases, y despliegue solo en GPU de centro de datos.
TabICLv2 (Inria SODA, febrero de 2026)
Segundo mejor rango medio (2.74) con 3.1 segundos por pliegue4 . Añade soporte para regresión, del que carecía el TabICL original. Completó los 19 conjuntos de datos, incluyendo amazon_employee_access, cuya columna categórica de 7,518 valores abruma a los modelos en contexto cuando se codifica con one-hot. La mejor precisión por GPU-segundo en el benchmark.
TabPFN 3 (Prior Labs)
Tercer rango medio (3.00), completó todo, 6.6 GPU-minutos en total5 . El troceado de filas le permite manejar conjuntos de datos que desbordan a otros modelos en contexto en el mismo hardware. SAP anunció la adquisición de Prior Labs en mayo de 20266 , lo cual es relevante para compradores empresariales que evalúan la estabilidad del proveedor.
Mitra (Amazon, vía AutoGluon)
Un especialista en datos pequeños por diseño: un límite estricto de entrenamiento de 10,000 filas lo convierte en N/D en 7 de los 19 conjuntos de datos. Dentro de su ámbito es competitivo: rango medio 4.50 en sus 12 conjuntos de datos y una victoria absoluta. Elíjalo cuando los datos sean genuinamente pequeños y AutoGluon ya esté en la pila.
Gradient boosting: LightGBM, CatBoost, XGBoost
Sigue siendo el predeterminado de despliegue, ya no es el líder en precisión en ningún régimen. LightGBM fue el mejor modelo clásico (rango medio 5.16). CatBoost sigue siendo la opción clásica más segura en datos con muchas categóricas. XGBoost terminó último en rango medio (6.42) y mostró una debilidad notable: con divisiones categóricas nativas en la regresión de alta cardinalidad employee_salaries, obtuvo RMSE 10,894 mientras que LightGBM obtuvo 4,367 con entradas idénticas. Es un resultado de un solo conjunto de datos, pero vale la pena verificarlo antes de confiar en el modo categórico de XGBoost.
El argumento de los árboles potenciados en 2026 es operativo: entrenamiento en menos de un segundo, inferencia en microsegundos, sin GPU, sin límites de filas, herramientas maduras.
Regresión Logística
Rango medio 6.21, sin embargo posee una parte del empate en amazon_employee_access. One-hot disperso más un modelo lineal sigue siendo una línea base sólida, casi gratuita, en datos categóricos de alta cardinalidad. Manténgala en cada benchmark.
Conclusiones clave
Los modelos fundacionales superan a los árboles potenciados por gradiente en precisión, con significación estadística, en datos tabulares pequeños, medianos y grandes. Esto se mantiene solo cuando cada modelo recibe la entrada categórica para la que está diseñado; forzar la codificación one-hot en modelos en contexto los paraliza en datos de alta cardinalidad.
TabFM lidera en precisión pero cuesta aproximadamente 40x el cómputo de TabPFN 3 o TabICLv2 y conlleva la mayor carga de configuración. TabICLv2 con 3 segundos por pliegue es la elección de valor. TabPFN 3 es el punto medio probado y respaldado empresarialmente.
En datos categóricos de alta cardinalidad, los modelos clásicos más fuertes y TabFM están estadísticamente empatados. El argumento clásico es costo, simplicidad y libertad de despliegue.
Zero-shot significa cero entrenamiento, no cero cómputo. Evalúe el volumen de predicción de su carga de trabajo antes de elegir TabFM.
¿Qué son los modelos fundacionales tabulares?
Los modelos tabulares tradicionales se entrenan desde cero en cada conjunto de datos. Los modelos fundacionales tabulares (TFM) se preentrenan una vez en grandes colecciones de problemas tabulares, en su mayoría sintéticos, y se adaptan a nuevos conjuntos de datos en el momento de la inferencia: las filas de entrenamiento entran como contexto y las predicciones salen de un pase hacia adelante. Sin entrenamiento por gradiente, sin ajuste de hiperparámetros.
TabPFN replantea el aprendizaje tabular como inferencia bayesiana amortizada: un transformador preentrenado en millones de tareas sintéticas condiciona el conjunto de datos observado para producir predicciones7 . TabPFN 3 elevó los límites a 100,000 filas y 2,000 características con manejo nativo de categóricas.
TabICL extiende el aprendizaje en contexto a tablas: las filas se convierten en tokens estructurados, y el modelo infiere reglas de decisión a partir de ejemplos de contexto8 . TabICLv2 añadió soporte para regresión en febrero de 2026.
TabFM combina los dos enfoques: atención alterna por filas y columnas sobre celdas brutas, compresión de cada fila en un vector denso, luego un transformador en contexto sobre las filas comprimidas. Fue entrenado en cientos de millones de conjuntos de datos sintéticos generados a partir de modelos causales estructurales.
Mitra sigue la línea TabPFN dentro de AutoGluon, ajustado para datos pequeños.
Metodología del Benchmark de Modelos Tabulares
Modelos (8): LogisticRegression, XGBoost, LightGBM, CatBoost, TabPFN 3, TabICLv2, TabFM, Mitra.
Conjuntos de datos (19, OpenML): 15 clasificación binaria, 1 multiclase, 3 regresión; de 435 a 48,800 filas. Se eliminaron las columnas con fugas conocidas.
Evaluación: validación cruzada estratificada de 5 pliegues (CV simple para regresión), semilla 42, divisiones idénticas para cada modelo. Métricas principales: ROC-AUC (binaria), macro-F1 (multiclase), RMSE (regresión). Hiperparámetros por defecto, sin ajuste. Esto favorece a los modelos sin ajuste: un XGBoost ajustado puntuaría más alto, y los presupuestos de ajuste son en sí mismos un costo que no modelamos.
Manejo de categóricas, según el diseño de cada modelo: tipo de dato categórico nativo para CatBoost, XGBoost y LightGBM; características brutas con índices categóricos para TabPFN 3 y TabFM; codificación ordinal para TabICLv2; one-hot más StandardScaler solo para Regresión Logística. Ningún modelo que admite categóricas nativas se fuerza a one-hot. La contrapartida: las celdas difieren en la representación de entrada por diseño. Forzar una representación en cada modelo parece más justo pero penaliza a los modelos construidos para una entrada diferente.
Entorno: un pod de RunPod con 2x NVIDIA B200 (183 GB), controlador 580, Ubuntu 24.04. Modelos clásicos en CPU (62 núcleos), cada modelo fundacional en una B200. PyTorch 2.8.0 cu128 para TabPFN 3, TabICLv2 y Mitra; JAX 0.10.1 con ruedas CUDA 13 para TabFM.
Latencia: tiempo de pared de ajuste más predicción por pliegue, registrado dentro del arnés. La compilación única de TabFM se excluye de los tiempos de pliegue y se reporta por separado.
Política de N/D: una celda es N/D solo por un límite documentado del modelo, con la razón capturada en los registros. Las únicas N/D en los datos finales son los 7 conjuntos de datos de Mitra que superan su límite de 10,000 filas.
Métricas de rango: dentro de cada conjunto de datos, los modelos se clasifican del 1 (mejor) a k según la métrica principal; el rango medio de un modelo promedia estos sobre los conjuntos de datos que completó. El gráfico de régimen muestra el rango invertido, k + 1 menos rango, de modo que más alto es mejor y 8 significa primero entre ocho. Los puntos de victoria otorgan el punto único de cada conjunto de datos a la mejor puntuación; los empates exactos lo dividen por igual, por lo que un empate a tres bandas paga 0.33 a cada uno.
Estadísticas: prueba de Friedman más diferencia crítica de Nemenyi sobre los 7 modelos de cobertura completa (Mitra excluido; los rangos se recalculan dentro de estos 7, por lo que quedan ligeramente por debajo de los rangos medios de 8 modelos citados en las secciones de modelos). La prueba de Friedman da chi-cuadrado 72.8, p por debajo de 10^-12. La diferencia crítica es CD = q × sqrt(k(k+1) / (6N)), con q = 2.949 a alfa 0.05 para k = 7 modelos y N = 19 conjuntos de datos, dando CD = 2.07: dos modelos difieren significativamente solo si sus rangos medios están separados por más de 2.07. Las brechas de TabFM con los modelos clásicos van desde 3.47 (LightGBM) hasta 4.58 (XGBoost), todas por encima del umbral; sus brechas con TabICLv2 (1.34) y TabPFN 3 (1.55) están por debajo. Los intervalos de confianza del rango medio provienen de un bootstrap de 10,000 muestras sobre los conjuntos de datos.
Calificaciones Elo: cada conjunto de datos es un round-robin entre todos los modelos que lo completaron, 483 enfrentamientos por pares en total. El modelo con la mejor métrica principal gana un enfrentamiento (puntuación 1); los empates exactos puntúan 0.5 cada uno.
Las fórmulas utilizan cuatro cantidades. R(A) es la calificación actual del modelo A, el número que reporta el gráfico; cada modelo comienza en R = 1000. S(A) es la puntuación real que el modelo A obtuvo de un enfrentamiento: 1 por una victoria, 0.5 por un empate, 0 por una derrota. E(A) es la puntuación esperada, la probabilidad de victoria que las calificaciones actuales predicen para A antes de que se cuente el enfrentamiento. K = 32 es el paso de actualización, que limita cuánto puede mover la calificación un solo enfrentamiento.
Antes de un enfrentamiento entre los modelos A y B, la puntuación esperada es E(A) = 1 / (1 + 10^((R(B) − R(A)) / 400)): cuando las calificaciones son iguales, da 0.5, y se aproxima a 1 a medida que la calificación de A se adelanta. Después del enfrentamiento, la calificación se actualiza mediante R(A) = R(A) + K × (S(A) − E(A)), por lo que A gana cuando lo hace mejor de lo esperado y pierde puntos cuando lo hace peor; una victoria sorpresa sobre un modelo mejor calificado paga más que una victoria rutinaria sobre uno más débil. La actualización es de suma cero, por lo que el promedio del grupo se mantiene en 1000, y una calificación de 994 se lee como un modelo promedio en este campo. El divisor 400 establece la escala: con una brecha de 200 puntos la puntuación esperada es 1 / (1 + 10^(−0.5)) = 0.76, que es de donde viene “gana aproximadamente 3 de cada 4 enfrentamientos”.
Un solo pase Elo depende del orden de los enfrentamientos, y los 19 conjuntos de datos son en sí mismos una muestra. Por lo tanto, ejecutamos 1,000 rondas de bootstrap; cada ronda remuestrea los 19 conjuntos de datos con reemplazo, reconstruye la lista de enfrentamientos, baraja el orden de los enfrentamientos y ejecuta Elo desde cero. La calificación publicada es la media entre rondas, y los intervalos del 95% son los percentiles 2.5 y 97.5, cubriendo tanto el muestreo de conjuntos de datos como el ruido de ordenamiento. Elo es la visualización resumida; la prueba de Friedman y Nemenyi sigue siendo el árbitro de significación.
Reproducibilidad: semilla fija 42, divisiones idénticas, resultados por pliegue y todos los scripts de combinación, estadísticas y Elo en el repositorio del benchmark.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{kaleliolu2026,
author = {Kalelioğlu, Berk and Dilmegani, Cem},
title = {{Benchmark de Modelos Tabulares: Rendimiento en 19 Conjuntos de Datos}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/tabular-models}},
note = {AIMultiple. Recuperado el 3 de Julio de 2026}
}Resultados y marcas de tiempo de 16 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene 2 archivos CSV y un README.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.