Berk Kalelioğlu
Intérêts de recherche
Berk se concentre sur l’apprentissage automatique, les outils d’IA agentique et les grands et petits modèles de langage (LLM et SLM).Il fait partie de l’équipe benchmark d’AIMultiple, réalisant des évaluations et fournissant des analyses pour aider les lecteurs à comprendre les technologies émergentes et leurs applications concrètes.
Expérience professionnelle
Il a commencé sa carrière en tant que chef de projet technique chez ODTU IVME-R, où il a dirigé un projet visant à construire des générateurs quantiques physiques et des générateurs de nombres pseudo-aléatoires.Après son passage chez IVME-R, il a cofondé une société de développement de jeux vidéo et a sorti un jeu sur Steam.
Il a ensuite réorienté sa carrière vers l’IA et a rejoint AIMultiple en tant que chercheur.
Formation
Berk est titulaire d’une licence de mathématiques d’Ankara University.Derniers articles de Berk
DecisionBench: Jev vs Kev vs LLMs
Les modèles de décision, également appelés modèles System One,1 choisissent la prochaine action d’un agent en une seule passe au lieu de générer du texte token par token. Pour voir s’ils peuvent rendre l’automatisation du navigateur moins chère que les LLMs, nous avons exécuté trois modèles de décision et deux LLMs, Gemini 3.8 Flash et…
AIM Agentic Web Benchmark
Agents rely on web interfaces to complete tasks on the web. To measure how interface choice affects task completion, we built the AIM Agentic Web Benchmark and attempted 3 500 tasks (100 tasks completed via 7 web interfaces across 5 runs). A Bright Data interface led every run. The Bright Data CLI retrieved 8 more tasks…
IT agentique: les agents IA peuvent-ils concevoir un benchmark ?
Nous avons testé 16 modèles sur une conception de benchmark en text-to-SQL et en appel d'outils. Chaque modèle a construit un benchmark par sujet, pour un total de 32 soumissions. Aucune soumission n'a réussi tous les critères de la grille d'évaluation. Les agents ont pu construire et exécuter des tests, mais aucun n'a démontré à…
AIM Enterprise: Benchmark d'entreprise agentique
Les entreprises utilisent des LLM tous les jours pour leurs tâches courantes. Pour trouver les LLM les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, dans lequel nous avons utilisé 69 tâches d'entreprise réelles couvrant la stratégie, le marketing, les RH, la vente et les opérations. Deux models juges ont noté chaque…
Recherche approfondie par IA: Claude vs ChatGPT vs Grok
La recherche approfondie par IA offre aux utilisateurs un éventail plus large de résultats de recherche que les moteurs de recherche IA. Pour voir les performances des différents outils de recherche approfondie par IA, nous présentons trois nouveaux benchmarks : DR-50 (Deep Research 50) Bench, qui évalue les outils sur 50 questions couvrant six types…
Meilleurs fournisseurs LLM API à tarif fixe
Les fournisseurs LLM à tarif fixe proposent une utilisation illimitée des modèles pour un prix mensuel fixe au lieu de facturer par token. Ce modèle s'est répandu car les sessions de codage agentique peuvent utiliser des dizaines de millions de tokens, rendant la facture par token difficile à prévoir. Très peu de fournisseurs offrent un…
IA VC Benchmark: 16 agents IA sur l'identification des clients
L’identification des clients fait partie de la due diligence commerciale. Nous avons testé 16 modèles sur la recherche de listes de clients pour trois sites de recherche et d’avis, dont AIMultiple, en notant leurs soumissions par rapport aux corrigés que nous avons compilés et aux pages qu’ils ont citées. Nous n’avons défini aucun niveau d’effort…
Alternatives à OpenClaw: Hermes vs ZeroClaw vs Grok Bot
Les agents IA autonomes, comme OpenClaw et l’agent Hermes, automatisent des tâches en plusieurs étapes qui nécessiteraient normalement une intervention humaine constante. Bien qu’OpenClaw soit devenu l’agent autonome toujours actif le plus largement adopté, de nombreux utilisateurs cherchent des alternatives en raison de son processus de déploiement difficile et de ses exigences de configuration complexes.…
Agents d'utilisation d'ordinateur: Benchmark et architecture
Les agents d'utilisation d'ordinateur opèrent sur de vrais bureaux et applications web. Leurs conceptions, limites et compromis sont souvent peu clairs. Nous décomposons le fonctionnement des principaux systèmes, leur manière d'apprendre et les différences entre leurs architectures. Nous faisons également référence à un benchmark ciblé de grounding UI sur 100 captures d'écran de bureau, couvrant…
MCP Benchmark des passerelles: latence et sécurité de 6 passerelles
Une passerelle MCP se situe entre un agent IA et les outils qu'il appelle, et les fournisseurs la positionnent comme la couche de sécurité pour ce trafic. Nous avons comparé six passerelles MCP à un backend instrumenté sur une seule machine, en mesurant la latence ajoutée, l'autorisation par outil, la protection du contenu et l'exhaustivité…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.