Modelos de IA
Los modelos de IA realizan predicciones basándose en sus datos de entrenamiento. Pueden funcionar en cualquier ámbito, como números, texto o multimedia.
Benchmark de 40+ LLMs en finanzas: Claude Fable 5 y GPT-5.6 Sol
Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto aborda las tareas de razonamiento financiero más desafiantes, evaluando razonamiento cuantitativo complejo de múltiples pasos que implica conceptos y fórmulas financieras. Nuestra evaluación empleó un diseño de prompt personalizado y criterios de puntuación de exactitud y consumo de tokens. Para una…
Text-to-SQL: Comparación de la precisión de los LLM
Ejecutamos 36 grandes modelos de lenguaje sobre 759 preguntas de BIRD-SQL; cada modelo escribió SQL contra una base de datos que tuvo que identificar por sí mismo entre 11 candidatas. Todas las consultas analizables se ejecutaron contra la base de datos real y su conjunto de resultados se comparó con el conjunto de resultados de…
Comparativa de Models de IA Multimodal en Razonamiento Visual
Realizamos un benchmark de 15 models de IA multimodal líderes en razonamiento visual utilizando 200 preguntas basadas en imágenes. La evaluación consistió en dos áreas: 100 preguntas de comprensión de gráficos que evaluaban la interpretación de visualizaciones de datos, y 100 preguntas de lógica visual que evaluaban el reconocimiento de patrones y el razonamiento espacial.…
Grandes models multimodales (LMMs) vs LLMs
Evaluamos el rendimiento de los grandes models multimodales (LMMs) en tareas de razonamiento financiero mediante un dataset cuidadosamente seleccionado. Al analizar un subconjunto de muestras financieras de alta calidad, evaluamos las capacidades de los models para procesar y razonar con datos multimodales en el dominio financiero. La sección de metodología ofrece información detallada sobre el…
LLM Calculadora de VRAM para alojamiento propio
Alojar por tu cuenta un LLM implica ejecutar la inferencia en hardware que controla el operador, en lugar de a través de una API de terceros, lo que cambia el coste, el control de los datos y el perfil de privacidad. El hecho de que un modelo pueda ejecutarse depende de la memoria. La calculadora…
TI agéntica: ¿Pueden los agentes de IA diseñar un benchmark?
Probamos 16 modelos en un diseño de benchmark de texto a SQL y llamada de herramientas. Cada modelo creó un benchmark por tema, para un total de 32 envíos. Ningún envío superó todos los criterios de la rúbrica. Los agentes pudieron construir y ejecutar pruebas, pero ninguno demostró a la vez una prueba de respuesta…
AIM Enterprise: Benchmark empresarial agéntico
Las empresas usan LLM todos los días para sus tareas habituales. Para encontrar los LLM más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde usamos 69 tareas empresariales reales en estrategia, marketing, RR. HH., ventas y operaciones. Dos modelos jueces puntuaron cada archivo que superó las comprobaciones. En el 32,7 % de las puntuaciones individuales,…
El futuro de los Large Language Models
Vea el futuro de los large language models profundizando en enfoques prometedores, como el autoentrenamiento, la verificación de hechos y la experiencia dispersa, que podrían abordar las limitaciones de los LLM. Comparación de la tasa de éxito de los LLM Claude Sonnet 4.6 lideró el benchmark con una puntuación general de 0.748, con las variantes…
Modelos Fundamentales del Mundo: 10 casos de uso
Entrenar robots y vehículos autónomos (AV) en el mundo físico puede ser costoso, lento y arriesgado. Los Modelos Fundamentales del Mundo ofrecen una alternativa escalable al permitir simulaciones realistas de entornos del mundo real. Estos modelos aceleran el desarrollo y la implementación en robótica, vehículos autónomos y otros ámbitos al reducir la dependencia de las…
Modelos fundacionales de series temporales: casos de uso y beneficios
Los modelos fundacionales de series temporales (TSFM) son modelos preentrenados que pronostican, clasifican, imputan y detectan anomalías en datos de series temporales sin necesidad de un modelo separado para cada conjunto de datos o industria. Los TSFM utilizan arquitecturas basadas en transformadores y conjuntos de datos de series temporales a gran escala para generalizar en…