Services
Contactez-nous
Berk Kalelioğlu

Berk Kalelioğlu

Chercheur en IA
13 Articles
Restez informé des dernières technologies B2B
Berk est chercheur en IA chez AIMultiple. Il a une expérience préalable en développement de jeux et en développement de générateurs de nombres pseudo-aléatoires à l'aide de systèmes chaotiques.

Intérêts de recherche

Berk se concentre sur l'apprentissage automatique, les outils d'IA agentiques et les grands et petits modèles de langage (LLMs et SLMs).

Il fait partie de l'équipe benchmark de AIMultiple, réalisant des évaluations et fournissant des informations pour aider les lecteurs à comprendre les technologies émergentes et leurs applications concrètes.

Expérience professionnelle

Il a commencé sa carrière en tant que chef de projet technique chez ODTU IVME-R, où il a dirigé un projet visant à construire des générateurs physiques quantiques et pseudo-aléatoires.

Après son passage chez IVME-R, il a cofondé une société de développement de jeux et a publié un jeu sur Steam.

Il a ensuite réorienté sa carrière vers l'IA et a rejoint AIMultiple en tant que chercheur.

Formation

Berk est titulaire d'une licence de mathématiques de l'Université d'Ankara.

Derniers articles de Berk

IA
Benchmark
14 Août

AIM Enterprise: Benchmark d'entreprise agentique

Les entreprises utilisent des LLM au quotidien pour leurs tâches habituelles. Pour trouver les LLM les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, où nous avons utilisé 69 tâches d'entreprise dans différentes catégories. Chaque modèle a livré un fichier par tâche. Les scores sont relatifs : les juges classent chaque réponse…

Agentic AI
Benchmark
12 Août

Benchmark Agentic Marketing AIM

Nous présentons le Benchmark Agentic Marketing AIM, qui mesure les performances des agents sur trois workflows marketing : analyse des lacunes concurrentielles, préparation de listes de cibles ABM et un deck de vente personnalisé. Nous avons également mené un audit séparé de la réputation du site web dans lequel les agents ont examiné le contenu…

IA12 Août

Benchmark de classification de séries temporelles: modèles fondation vs méthodes classiques

Nous avons évalué 13 méthodes de classification de séries temporelles, des modèles fondation de séries temporelles pré-entraînés à une référence à 22 caractéristiques de 2019, sur 33 datasets UCR/UEA sous un protocole figé. Cela représente 14 638 cellules méthode-dataset-échantillon enregistrées, dont 11 874 ont été notées. Le graphique montre la comparaison principale du benchmark :…

Agentic AI
Benchmark
12 Août

A-CODE-LLM Bench: Benchmark de codage agentique

Nous avons évalué les meilleurs grands modèles de langage (LLMs) sur 10 tâches de développement logiciel à l'aide d'un outil CLI agentique. Nous avons exécuté environ 3 500 étapes de validation automatisées par modèle à la fois sur les couches API et UI. Chaque alias a été exécuté 3 fois sur 10 tâches (30 échantillons par…

Agentic AI
Benchmark
12 Août

A-CODE-CLI Bench: Benchmark CLI Agentique

Les outils CLI agentiques sont des outils de codage IA qui peuvent créer et supprimer des fichiers, exécuter des commandes, planifier et réaliser le codage de l'ensemble du projet. Nous avons évalué les principaux outils sur 10 scénarios réels de développement web, en effectuant environ 600 vérifications de validation atomiques par agent et plus de…

Agentic AI12 Août

Moltbook: Médias Sociaux Pilotés par des Agents

La croissance rapide d'OpenClaw a déclenché une expérience sociale inhabituelle : Moltbook, une plateforme sociale semblable à Reddit où les agents interagissent entre eux. Lancée le 28 janvier 2026, elle a commencé à attirer l'attention en peu de temps. Elle a atteint plus de 1.5m d'agents lors de sa première semaine. Pour d'autres plateformes destinées…

Agentic AI12 Août

Cas d'utilisation et sécurité d'OpenClaw (Moltbot/Clawdbot)

OpenClaw (anciennement Moltbot et Clawdbot) est un assistant IA open source auto-hébergé conçu pour exécuter des tâches informatiques locales et interagir avec les utilisateurs via des plateformes de messagerie standard. Contrairement aux chatbots traditionnels qui fonctionnent comme des conseillers générant du texte, OpenClaw agit comme un agent autonome capable d’exécuter des commandes shell, de gérer…

Logiciel d'entreprise
Benchmark
12 Août

Benchmark VPS: Hetzner vs Digital Ocean

Nous avons comparé 6 fournisseurs de serveurs privés virtuels (VPS) en exécutant environ 1 200 tests automatisés par serveur sur le CPU, la mémoire, les E/S disque et la vitesse réseau à l'aide de sysbench, fio et speedtest-cli. Nous avons également documenté l'expérience complète de l'inscription à SSH pour chaque fournisseur. Nous avons utilisé des…

IA
Benchmark
11 Août

Agentic IT: Can LLMs Design a Benchmark

We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…

IA
Évaluation en Monde Ouvert
7 Août

Meilleurs fournisseurs LLM API à tarif fixe

Les fournisseurs LLM à tarif fixe proposent une utilisation illimitée des modèles pour un prix mensuel fixe au lieu de facturer par token. Ce modèle s'est répandu car les sessions de codage agentique peuvent utiliser des dizaines de millions de tokens, rendant la facture par token difficile à prévoir. Très peu de fournisseurs offrent un…