Modèles d'IA
Les modèles d'IA prédisent des résultats à partir de leurs données d'entraînement. Ils peuvent fonctionner dans tous les domaines, tels que les nombres, le texte ou le multimédia.
Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol
Nous avons évalué des LLMs sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, évaluant un raisonnement quantitatif complexe en plusieurs étapes impliquant des concepts et des formules financières. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de notation…
Text-to-SQL: Comparaison de la précision des LLM
Nous avons exécuté 36 large language models sur 759 questions de BIRD-SQL, chaque model écrivant SQL contre une base de données qu’il devait identifier lui-même parmi 11 candidates. Toute requête analysable a été exécutée sur la base de données réelle et son ensemble de résultats comparé à l’ensemble de résultats de la requête de référence…
Comparer les modèles d'IA multimodaux sur le raisonnement visuel
Nous avons évalué 15 modèles d'IA multimodaux leaders sur le raisonnement visuel en utilisant 200 questions basées sur l'image. L'évaluation comprenait deux pistes : 100 questions de compréhension de graphiques testant l'interprétation de visualisations de données, et 100 questions de logique visuelle évaluant la reconnaissance de motifs et le raisonnement spatial. Chaque question a été…
Grands modèles multimodaux (LMM) vs LLMs
Nous avons évalué les performances des grands modèles multimodaux (LMM) dans des tâches de raisonnement financier en utilisant un jeu de données soigneusement sélectionné. En analysant un sous-ensemble d’échantillons financiers de haute qualité, nous évaluons les capacités des modèles à traiter et à raisonner avec des données multimodales dans le domaine financier. La section méthodologie…
LLM Calculateur de VRAM pour l'auto-hébergement
Auto-héberger un LLM signifie exécuter l'inférence sur du matériel contrôlé par l'opérateur plutôt que via une API tierce, ce qui modifie le coût, le contrôle des données et le profil de confidentialité. Qu'un modèle puisse s'exécuter dépend de la mémoire. Le calculateur estime la VRAM ou la mémoire unifiée dont un modèle a besoin pour…
IT agentique: les agents IA peuvent-ils concevoir un benchmark ?
Nous avons testé 16 modèles sur une conception de benchmark en text-to-SQL et en appel d'outils. Chaque modèle a construit un benchmark par sujet, pour un total de 32 soumissions. Aucune soumission n'a réussi tous les critères de la grille d'évaluation. Les agents ont pu construire et exécuter des tests, mais aucun n'a démontré à…
AIM Enterprise: Benchmark d'entreprise agentique
Les entreprises utilisent des LLM tous les jours pour leurs tâches courantes. Pour trouver les LLM les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, dans lequel nous avons utilisé 69 tâches d'entreprise réelles couvrant la stratégie, le marketing, les RH, la vente et les opérations. Deux models juges ont noté chaque…
L'avenir des grands modèles linguistiques
Découvrez l’avenir des grands modèles linguistiques en explorant des approches prometteuses, comme l’auto-entraînement, la vérification des faits et l’expertise parcimonieuse, qui pourraient remédier aux limites des LLM. Comparaison du taux de réussite des LLM Claude Sonnet 4.6 a dominé le benchmark avec un score global de 0.748, les variantes de base et de réflexion étant…
Modèles de fondation mondiaux: 10 cas d'utilisation
Former des robots et des véhicules autonomes (AV) dans le monde physique peut être coûteux, long et risqué. Les modèles de fondation mondiaux offrent une alternative évolutive en permettant des simulations réalistes d’environnements du monde réel. Ces modèles accélèrent le développement et le déploiement en robotique, dans les véhicules autonomes et dans d’autres domaines en…
Modèles de fondation de séries temporelles: cas d'utilisation et avantages
Les modèles de fondation de séries temporelles (TSFM) sont des modèles pré-entraînés qui prévoient, classent, imputent et détectent les anomalies dans les données de séries temporelles sans nécessiter un modèle distinct pour chaque dataset ou secteur. Les TSFM utilisent des architectures basées sur des transformers et des datasets de séries temporelles à grande échelle pour…