Inteligencia Artificial
Explore perspectivas prácticas, investigaciones y puntos de referencia sobre inteligencia artificial, incluyendo IA generativa, modelos de lenguaje a gran escala, RAG, marcos de gobernanza, prácticas MLOps y hardware de IA. Comprenda las herramientas clave, las estrategias de implementación y los casos de uso empresariales que dan forma al panorama de la IA.
Explorar Inteligencia Artificial
Grandes models multimodales (LMMs) vs LLMs
Evaluamos el rendimiento de los grandes models multimodales (LMMs) en tareas de razonamiento financiero mediante un dataset cuidadosamente seleccionado. Al analizar un subconjunto de muestras financieras de alta calidad, evaluamos las capacidades de los models para procesar y razonar con datos multimodales en el dominio financiero. La sección de metodología ofrece información detallada sobre el…
LLM Calculadora de VRAM para alojamiento propio
Alojar por tu cuenta un LLM implica ejecutar la inferencia en hardware que controla el operador, en lugar de a través de una API de terceros, lo que cambia el coste, el control de los datos y el perfil de privacidad. El hecho de que un modelo pueda ejecutarse depende de la memoria. La calculadora…
Benchmark multi-GPU: B200 vs H200 vs H100 vs MI300X
Durante más de dos décadas, optimizar el rendimiento computacional ha sido un pilar de mi trabajo. Evaluamos la B200 y H200 de NVIDIA, la H100 y la MI300X de AMD para evaluar qué tan bien escalan en la inference de Large Language Model (LLM). Utilizando el framework vLLM con el model meta-llama/Llama-3.1-8B-Instruct, ejecutamos pruebas en…
GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X
He pasado los últimos 20 años centrado en la optimización del rendimiento computacional a nivel de sistema. Evaluamos las NVIDIA GPU más recientes, incluidas las H100, H200 y B200 de NVIDIA, y la MI300X de AMD, para el análisis de escalado de concurrencia. Utilizando el framework vLLM con el gpt-oss-20b model, probamos cómo estas GPU…
TI agéntica: ¿Pueden los agentes de IA diseñar un benchmark?
Probamos 16 modelos en un diseño de benchmark de texto a SQL y llamada de herramientas. Cada modelo creó un benchmark por tema, para un total de 32 envíos. Ningún envío superó todos los criterios de la rúbrica. Los agentes pudieron construir y ejecutar pruebas, pero ninguno demostró a la vez una prueba de respuesta…
AIM Enterprise: Benchmark empresarial agéntico
Las empresas usan LLM todos los días para sus tareas habituales. Para encontrar los LLM más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde usamos 69 tareas empresariales reales en estrategia, marketing, RR. HH., ventas y operaciones. Dos modelos jueces puntuaron cada archivo que superó las comprobaciones. En el 32,7 % de las puntuaciones individuales,…
El futuro de los Large Language Models
Vea el futuro de los large language models profundizando en enfoques prometedores, como el autoentrenamiento, la verificación de hechos y la experiencia dispersa, que podrían abordar las limitaciones de los LLM. Comparación de la tasa de éxito de los LLM Claude Sonnet 4.6 lideró el benchmark con una puntuación general de 0.748, con las variantes…
Alternativas a DGX Spark: RTX, Ryzen IA Halo y Mac Studio
Comparamos los benchmarks de inference publicados de DGX Spark, RTX y Ryzen IA Halo, cubriendo el procesamiento de prompt, la generación de tokens y contextos más largos. Las alternativas incluyen Framework Desktop, Mac Studio y sistemas GB10 de otros fabricantes. La velocidad de decodificación mide los tokens de salida generados por segundo. Valores más altos…
Gratuitas GPUs en la nube: modelos, límites y requisitos de acceso
Las GPUs gratuitas en la nube están disponibles a través de notebooks de Python, demos de IA y créditos de cómputo mensuales. Compare el hardware de GPU, las asignaciones gratis y los requisitos de acceso, o compruebe qué servicios se adaptan a su carga de trabajo. Dos T4 proporcionan dos asignaciones de memoria de 16…
Benchmark de codificación con IA: Claude Code vs Cursor
En la programación con IA, el mercado se ha fragmentado en dos categorías: herramientas de CLI agéntico y editores de código con IA integrados en IDE. Cada una afirma automatizar el desarrollo. Pocas comparaciones muestran cómo difieren bajo cargas de trabajo idénticas. Evaluamos a cada agente en 10 tareas de desarrollo web de pila completa,…