Modelos de IA
Los modelos de IA realizan predicciones basándose en sus datos de entrenamiento. Pueden funcionar en cualquier ámbito, como números, texto o multimedia.
Benchmark de 40+ LLMs en Finanzas: Claude Fable 5 y GPT-5.6 Sol
Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto se centra en las tareas de razonamiento financiero más desafiantes, evaluando el razonamiento cuantitativo complejo de varios pasos que involucra conceptos y fórmulas financieras. Nuestra evaluación empleó un diseño de prompt personalizado y criterios de puntuación de precisión y consumo de…
Modelos fundacionales de series temporales: casos de uso y beneficios
Los modelos fundacionales de series temporales (TSFM) son modelos preentrenados que pronostican, clasifican, imputan y detectan anomalías en datos de series temporales sin necesidad de un modelo separado para cada conjunto de datos o industria. Los TSFM utilizan arquitecturas basadas en transformadores y conjuntos de datos de series temporales a gran escala para generalizar en…
AIM Enterprise: Benchmark empresarial agéntico
Las empresas utilizan LLMs a diario para sus tareas habituales. Para encontrar los LLMs más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde utilizamos 69 tareas empresariales en diferentes categorías. Cada modelo entregó un archivo por tarea. Las puntuaciones son relativas: los jueces clasifican cada respuesta frente a las demás respuestas de la misma…
LLM Leyes de escalado: análisis de investigadores de IA
Large language models predicen el siguiente token a partir de patrones aprendidos de datos de texto. El término leyes de escalado de LLM se refiere a regularidades empíricas que vinculan el rendimiento de los model con la cantidad de cómputo, datos de entrenamiento y parámetros de los model utilizados durante el entrenamiento. Para comprender cómo…
LLM Herramientas de observabilidad: Weights & Biases, Langsmith
Las aplicaciones de LLM han evolucionado de chats de un solo turno a agentes de varios pasos que usan herramientas, consultan bases de datos y se coordinan con otros modelos, lo que hace que su comportamiento sea más difícil de interpretar. La observabilidad de LLM proporciona visibilidad continua de estos flujos de trabajo complejos, ayudando…
Grandes models multimodales (LMMs) vs LLMs
Evaluamos el rendimiento de los grandes models multimodales (LMMs) en tareas de razonamiento financiero utilizando un dataset cuidadosamente seleccionado. Al analizar un subconjunto de muestras financieras de alta calidad, evaluamos las capacidades de los models para procesar y razonar con datos multimodales en el dominio financiero. La sección de metodología proporciona información detallada sobre el…
ChatGPT para Servicio al Cliente: Top 10 Casos de Uso
ChatGPT ha pasado de ser una novedad a una infraestructura en el servicio al cliente. Las empresas lo están utilizando para reducir los tiempos de respuesta, manejar el volumen que sus equipos no pueden absorber y reducir el costo de las interacciones rutinarias. Pero los resultados varían drásticamente dependiendo de cómo se implemente. OpenAI lanzó…
Evaluación comparativa de clasificación de series temporales: Modelos fundacionales vs métodos clásicos
Evaluamos 13 métodos de clasificación de series temporales, desde modelos fundacionales de series temporales preentrenados hasta una línea base de 22 características de 2019, en 33 conjuntos de datos UCR/UEA bajo un protocolo congelado. Esto suma 14.638 celdas registradas de método-conjunto-remuestreo, de las cuales 11.874 fueron puntuadas. El gráfico muestra la comparación principal del benchmark:…
LLM Comparativa de latencia por casos de uso
Evaluamos 11 modelos de lenguaje grandes principales con un total de 1.320 solicitudes, dividiendo modelos de razonamiento y no razonamiento, y medimos la latencia del primer token, la latencia por token y el tiempo de respuesta total. Puede encontrar detalles sobre cómo medimos la latencia aquí. Presentamos por separado los modelos con razonamiento y sin…
Herramientas de LLMOps principales y comparación con MLOps
Las plataformas de LLMOps gestionan el aspecto operativo de ejecutar modelos de lenguaje grandes: despliegue, monitoreo, evaluación y gestión de costes. Examinamos las principales herramientas de LLMOps, sus funciones centrales, modelos de precios y cómo se diferencian entre sí para ayudar a identificar la opción más adecuada para diversos casos de uso. A continuación se…