Modelos de IA
Los modelos de IA realizan predicciones basándose en sus datos de entrenamiento. Pueden funcionar en cualquier ámbito, como números, texto o multimedia.
Comparación de modelos fundacionales relacionales
Comparamos SAP-RPT-1-OSS contra el gradient boosting (LightGBM, CatBoost) en 17 conjuntos de datos tabulares que abarcan el espectro semántico-numérico, tablas pequeñas/de alta semántica, conjuntos de datos de negocio mixtos y grandes conjuntos de datos numéricos de baja semántica. Nuestro objetivo es medir dónde los priores semánticos preentrenados de un LLM relacional pueden ofrecer ventajas frente…
Modelos de lenguaje de gran tamaño en ciberseguridad
Evaluamos 7 grandes modelos de lenguaje en 9 dominios de ciberseguridad usando SecBench, un benchmark a gran escala y multiformato para tareas de seguridad. Probamos cada modelo con 44.823 preguntas de opción múltiple (MCQs) y 3.087 preguntas de respuesta corta (SAQs), que abarcan seguridad de datos, gestión de identidades y accesos, seguridad de redes, gestión…
LLM Leyes de escalado: análisis de investigadores de IA
Large language models predicen el siguiente token a partir de patrones aprendidos de datos de texto. El término leyes de escalado de LLM se refiere a regularidades empíricas que vinculan el rendimiento de los model con la cantidad de cómputo, datos de entrenamiento y parámetros de los model utilizados durante el entrenamiento. Para comprender cómo…
Comparativa de 9 grandes modelos de lenguaje en atención médica
Evaluamos comparativamente 9 LLMs utilizando el dataset MedQA, un benchmark de examen clínico de nivel de posgrado derivado de preguntas del USMLE. Cada modelo respondió los mismos escenarios clínicos de opción múltiple mediante un prompt estandarizado, lo que permite una comparación directa de la precisión. También registramos la latencia por pregunta dividiendo el tiempo de…
Simulación de audiencia: ¿Pueden los LLMs predecir el comportamiento humano?
En marketing, evaluar con qué precisión los LLMs predicen el comportamiento humano es crucial para valorar su efectividad en la anticipación de las necesidades de la audiencia y reconocer los riesgos de desalineación, comunicación ineficaz o influencia no deseada. La simulación de audiencias con LLMs permite modelar audiencias virtuales, ayudando a las organizaciones a prever…
HALC-Bench: LLM Alucinación en Benchmark de Recuperación de Contexto Largo
HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mide la resistencia de un LLM a fabricar evidencia para una métrica que no existe en el documento objetivo mediante el uso de 3 pajares colocados al principio, en el medio y al final de la ventana de contexto del modelo, con 204 preguntas. claude-fable-5 respondió correctamente a…
Puertas de enlace de IA para OpenAI: alternativas a OpenRouter
Comparamos OpenRouter, SambaNova, TogetherAI, Groq y IA/ML API en tres indicadores (latencia del primer token, latencia total y número de tokens de salida), con 300 pruebas usando prompts cortos (aprox. 18 tokens) y prompts largos (aprox. 203 tokens) para la latencia total. Si planea usar una de estas puertas de enlace de IA, puede: En…
Mejores proveedores de LLM API de tarifa plana
Los proveedores de LLM de tarifa plana venden uso ilimitado del modelo por un precio mensual fijo en lugar de facturar por token. Este modelo se extendió porque las sesiones de codificación agentiva pueden usar decenas de millones de tokens, por lo que una factura por token es difícil de predecir. Muy pocos proveedores ofrecen…
LLM Herramientas de observabilidad: Weights & Biases, Langsmith
Las aplicaciones de LLM han evolucionado de chats de un solo turno a agentes de varios pasos que usan herramientas, consultan bases de datos y se coordinan con otros modelos, lo que hace que su comportamiento sea más difícil de interpretar. La observabilidad de LLM proporciona visibilidad continua de estos flujos de trabajo complejos, ayudando…
Comparar Modelos de Visión Grandes: GPT-4o vs YOLOv8n
Los modelos de visión grandes (LVMs) pueden automatizar y mejorar tareas visuales como la detección de defectos, diagnóstico médico y monitoreo ambiental. Realizamos pruebas de referencia a tres modelos de detección de objetos: YOLOv8n, DETR y GPT-4o Vision, en 1.000 imágenes cada uno, midiendo métricas como mAP@0.5, velocidad de inferencia, FLOPs y cantidad de parámetros.…