Premium
Services
Premium
Berk Kalelioğlu

Berk Kalelioğlu

Chercheur en IA
15 Articles
Restez informé des dernières technologies B2B
Berk est chercheur en IA chez AIMultiple. Il a une expérience antérieure dans le développement de jeux vidéo et dans la conception de générateurs de nombres pseudo-aléatoires utilisant des systèmes chaotiques.

Intérêts de recherche

Berk se concentre sur l’apprentissage automatique, les outils d’IA agentique et les grands et petits modèles de langage (LLM et SLM).

Il fait partie de l’équipe benchmark d’AIMultiple, réalisant des évaluations et fournissant des analyses pour aider les lecteurs à comprendre les technologies émergentes et leurs applications concrètes.

Expérience professionnelle

Il a commencé sa carrière en tant que chef de projet technique chez ODTU IVME-R, où il a dirigé un projet visant à construire des générateurs quantiques physiques et des générateurs de nombres pseudo-aléatoires.

Après son passage chez IVME-R, il a cofondé une société de développement de jeux vidéo et a sorti un jeu sur Steam.

Il a ensuite réorienté sa carrière vers l’IA et a rejoint AIMultiple en tant que chercheur.

Formation

Berk est titulaire d’une licence de mathématiques d’Ankara University.

Derniers articles de Berk

IA
Benchmark
24 sep

DecisionBench: Jev vs Kev vs LLMs

Les modèles de décision, également appelés modèles System One,1 choisissent la prochaine action d’un agent en une seule passe au lieu de générer du texte token par token. Pour voir s’ils peuvent rendre l’automatisation du navigateur moins chère que les LLMs, nous avons exécuté trois modèles de décision et deux LLMs, Gemini 3.8 Flash et…

Agentic AI
21 sep

AIM Agentic Web Benchmark

Agents rely on web interfaces to complete tasks on the web. To measure how interface choice affects task completion, we built the AIM Agentic Web Benchmark and attempted 3 500 tasks (100 tasks completed via 7 web interfaces across 5 runs). A Bright Data interface led every run. The Bright Data CLI retrieved 8 more tasks…

IA
Benchmark
18 sep

IT agentique: les agents IA peuvent-ils concevoir un benchmark ?

Nous avons testé 16 modèles sur une conception de benchmark en text-to-SQL et en appel d'outils. Chaque modèle a construit un benchmark par sujet, pour un total de 32 soumissions. Aucune soumission n'a réussi tous les critères de la grille d'évaluation. Les agents ont pu construire et exécuter des tests, mais aucun n'a démontré à…

IA
Benchmark
17 sep

AIM Enterprise: Benchmark d'entreprise agentique

Les entreprises utilisent des LLM tous les jours pour leurs tâches courantes. Pour trouver les LLM les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, dans lequel nous avons utilisé 69 tâches d'entreprise réelles couvrant la stratégie, le marketing, les RH, la vente et les opérations. Deux models juges ont noté chaque…

Agentic AI
Benchmark
12 sep

Recherche approfondie par IA: Claude vs ChatGPT vs Grok

La recherche approfondie par IA offre aux utilisateurs un éventail plus large de résultats de recherche que les moteurs de recherche IA. Pour voir les performances des différents outils de recherche approfondie par IA, nous présentons trois nouveaux benchmarks : DR-50 (Deep Research 50) Bench, qui évalue les outils sur 50 questions couvrant six types…

IA
Évaluation en Monde Ouvert
10 sep

Meilleurs fournisseurs LLM API à tarif fixe

Les fournisseurs LLM à tarif fixe proposent une utilisation illimitée des modèles pour un prix mensuel fixe au lieu de facturer par token. Ce modèle s'est répandu car les sessions de codage agentique peuvent utiliser des dizaines de millions de tokens, rendant la facture par token difficile à prévoir. Très peu de fournisseurs offrent un…

Agentic AI
Benchmark
10 sep

IA VC Benchmark: 16 agents IA sur l'identification des clients

L’identification des clients fait partie de la due diligence commerciale. Nous avons testé 16 modèles sur la recherche de listes de clients pour trois sites de recherche et d’avis, dont AIMultiple, en notant leurs soumissions par rapport aux corrigés que nous avons compilés et aux pages qu’ils ont citées. Nous n’avons défini aucun niveau d’effort…

Agentic AI
Comparaison des Fonctionnalités
3 sep

Alternatives à OpenClaw: Hermes vs ZeroClaw vs Grok Bot

Les agents IA autonomes, comme OpenClaw et l’agent Hermes, automatisent des tâches en plusieurs étapes qui nécessiteraient normalement une intervention humaine constante. Bien qu’OpenClaw soit devenu l’agent autonome toujours actif le plus largement adopté, de nombreux utilisateurs cherchent des alternatives en raison de son processus de déploiement difficile et de ses exigences de configuration complexes.…

Agentic AI
Benchmark
31 août

Agents d'utilisation d'ordinateur: Benchmark et architecture

Les agents d'utilisation d'ordinateur opèrent sur de vrais bureaux et applications web. Leurs conceptions, limites et compromis sont souvent peu clairs. Nous décomposons le fonctionnement des principaux systèmes, leur manière d'apprendre et les différences entre leurs architectures. Nous faisons également référence à un benchmark ciblé de grounding UI sur 100 captures d'écran de bureau, couvrant…

Agentic AI
Benchmark
24 août

MCP Benchmark des passerelles: latence et sécurité de 6 passerelles

Une passerelle MCP se situe entre un agent IA et les outils qu'il appelle, et les fournisseurs la positionnent comme la couche de sécurité pour ce trafic. Nous avons comparé six passerelles MCP à un backend instrumenté sur une seule machine, en mesurant la latence ajoutée, l'autorisation par outil, la protection du contenu et l'exhaustivité…