Modèles d'IA
Les modèles d'IA prédisent des résultats à partir de leurs données d'entraînement. Ils peuvent fonctionner dans tous les domaines, tels que les nombres, le texte ou le multimédia.
Benchmark de 40+ LLM en finance: Claude Fable 5 & GPT-5.6 Sol
Nous avons évalué les LLM sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, en évaluant le raisonnement quantitatif complexe à plusieurs étapes impliquant des concepts et des formules financiers. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de…
Modèles de fondation de séries temporelles: cas d'utilisation et avantages
Les modèles de fondation de séries temporelles (TSFM) sont des modèles pré-entraînés qui prévoient, classent, imputent et détectent les anomalies dans les données de séries temporelles sans nécessiter un modèle distinct pour chaque dataset ou secteur. Les TSFM utilisent des architectures basées sur des transformers et des datasets de séries temporelles à grande échelle pour…
AIM Enterprise: Benchmark d'entreprise agentique
Les entreprises utilisent des LLM au quotidien pour leurs tâches habituelles. Pour trouver les LLM les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, où nous avons utilisé 69 tâches d'entreprise dans différentes catégories. Chaque modèle a livré un fichier par tâche. Les scores sont relatifs : les juges classent chaque réponse…
Lois d'échelle des LLM: analyse de chercheurs en IA
Les grands modèles de langage prédisent le token suivant à partir de motifs appris dans les données textuelles. Le terme lois d'échelle des LLM désigne des régularités empiriques qui relient les performances du modèle à la quantité de calcul, aux données d'entraînement et aux paramètres du modèle utilisés pendant l'entraînement. Pour comprendre comment ces relations…
LLM Outils d'observabilité: Weights & Biases, Langsmith
Les applications LLM sont passées de chats à un seul tour à des agents multi-étapes qui utilisent des outils, interrogent des bases de données et se coordonnent avec d’autres modèles, ce qui rend leur comportement plus difficile à interpréter. L’observabilité des LLM offre une visibilité continue sur ces flux de travail complexes, aidant les organisations…
Grands modèles multimodaux (LMM) vs LLMs
Nous avons évalué les performances des grands modèles multimodaux (LMM) dans des tâches de raisonnement financier à l'aide d'un ensemble de données soigneusement sélectionné. En analysant un sous-ensemble d'échantillons financiers de haute qualité, nous évaluons les capacités des modèles à traiter et à raisonner avec des données multimodales dans le domaine financier. La section méthodologie…
ChatGPT pour le service client: Top 10 cas d'utilisation
ChatGPT est passé de la nouveauté à l'infrastructure dans le service client. Les entreprises l'utilisent pour réduire les délais de réponse, absorber des volumes que leurs équipes ne peuvent pas gérer et diminuer le coût des interactions courantes. Mais les résultats varient fortement selon la manière dont il est déployé. OpenAI a lancé GPT-5.6, un…
Benchmark de classification de séries temporelles: modèles fondation vs méthodes classiques
Nous avons évalué 13 méthodes de classification de séries temporelles, des modèles fondation de séries temporelles pré-entraînés à une référence à 22 caractéristiques de 2019, sur 33 datasets UCR/UEA sous un protocole figé. Cela représente 14 638 cellules méthode-dataset-échantillon enregistrées, dont 11 874 ont été notées. Le graphique montre la comparaison principale du benchmark :…
LLM Benchmark de latence par cas d'usage
Nous avons benchmarké 11 des meilleurs grands modèles de langage avec un total de 1 320 requêtes, en séparant les modèles de raisonnement et de non-raisonnement, et mesuré la latence du premier token, la latence par token et le temps de réponse global. Vous trouverez des détails sur la façon dont nous avons mesuré la…
Meilleurs outils LLMOps & comparaison avec MLOPs
Les plateformes LLMOps gèrent l'aspect opérationnel de l'exécution des grands modèles de langage : déploiement, surveillance, évaluation et gestion des coûts. Nous avons examiné les principaux outils LLMOps, leurs fonctionnalités de base, leurs modèles de tarification et leurs différences afin d'aider à identifier le meilleur choix pour divers cas d'utilisation. Une ventilation de chaque métrique…