Modèles d'IA
Les modèles d'IA prédisent des résultats à partir de leurs données d'entraînement. Ils peuvent fonctionner dans tous les domaines, tels que les nombres, le texte ou le multimédia.
Comparaison des modèles de fondation relationnels
Nous avons comparé SAP-RPT-1-OSS au gradient boosting (LightGBM, CatBoost) sur 17 jeux de données tabulaires couvrant le spectre sémantique‑numérique, des petites tables à haute sémantique, des jeux de données métier mixtes et de grands jeux de données numériques à faible sémantique. Notre objectif est de mesurer où les priors sémantiques pré‑entraînés d’un LLM relationnel peuvent…
Grands modèles de langage en cybersécurité
Nous avons évalué 7 grands modèles de langage dans 9 domaines de la cybersécurité en utilisant SecBench, un benchmark à grande échelle et multi-format pour les tâches de sécurité. Nous avons testé chaque modèle sur 44 823 questions à choix multiples (QCM) et 3 087 questions à réponse courte (QRC), couvrant des domaines tels que…
Lois d'échelle des LLM: analyse de chercheurs en IA
Les grands modèles de langage prédisent le token suivant à partir de motifs appris dans les données textuelles. Le terme lois d'échelle des LLM désigne des régularités empiriques qui relient les performances du modèle à la quantité de calcul, aux données d'entraînement et aux paramètres du modèle utilisés pendant l'entraînement. Pour comprendre comment ces relations…
Comparer 9 grands modèles de langage dans le domaine de la santé
Nous avons évalué 9 LLMs à l'aide du dataset MedQA, un benchmark d'examen clinique de niveau universitaire dérivé des questions de l'USMLE. Chaque modèle a répondu aux mêmes scénarios cliniques à choix multiples à l'aide d'un prompt standardisé, permettant une comparaison directe de la précision. Nous avons également enregistré la latence par question en divisant…
Simulation d'audience: Les LLM peuvent-elles prédire le comportement humain ?
En marketing, évaluer avec quelle précision les LLMs prédisent le comportement humain est crucial pour estimer leur efficacité à anticiper les besoins du public et pour reconnaître les risques de décalage, de communication inefficace ou d'influence non désirée. La simulation d'audience avec des LLMs permet de modéliser des publics virtuels, aidant les organisations à anticiper…
HALC-Bench: LLM Hallucination sur un benchmark de récupération en contexte long
HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mesure la résistance d'un LLM à fabriquer des preuves pour une métrique qui n'existe pas dans le document cible en utilisant 3 bottes de foin placées au début, au milieu et à la fin de la fenêtre de contexte du modèle, avec 204 questions. claude-fable-5 a répondu correctement…
Passerelles IA pour OpenAI: alternatives à OpenRouter
Nous avons évalué OpenRouter, SambaNova, TogetherAI, Groq et IA/ML API selon trois indicateurs (latence du premier token, latence totale et nombre de tokens de sortie), avec 300 tests utilisant des prompts courts (environ 18 tokens) et des prompts longs (environ 203 tokens) pour la latence totale. Si vous prévoyez d'utiliser l'une de ces passerelles IA,…
Meilleurs fournisseurs LLM API à tarif fixe
Les fournisseurs LLM à tarif fixe proposent une utilisation illimitée des modèles pour un prix mensuel fixe au lieu de facturer par token. Ce modèle s'est répandu car les sessions de codage agentique peuvent utiliser des dizaines de millions de tokens, rendant la facture par token difficile à prévoir. Très peu de fournisseurs offrent un…
LLM Outils d'observabilité: Weights & Biases, Langsmith
Les applications LLM sont passées de chats à un seul tour à des agents multi-étapes qui utilisent des outils, interrogent des bases de données et se coordonnent avec d’autres modèles, ce qui rend leur comportement plus difficile à interpréter. L’observabilité des LLM offre une visibilité continue sur ces flux de travail complexes, aidant les organisations…
Comparer les grands modèles de vision: GPT-4o vs YOLOv8n
Les grands modèles de vision (LVMs) peuvent automatiser et améliorer des tâches visuelles telles que la détection de défauts, le diagnostic médical, et la surveillance environnementale. Nous avons évalué trois modèles de détection d'objets : YOLOv8n, DETR, et GPT-4o Vision, sur 1 000 images chacun, en mesurant des métriques telles que mAP@0.5, la vitesse d'inférence,…