Services
Contactez-nous
Berk Kalelioğlu

Berk Kalelioğlu

Chercheur en IA
13 Articles
Restez informé des dernières technologies B2B
Berk est chercheur en IA chez AIMultiple. Il a une expérience antérieure dans le développement de jeux vidéo et dans la conception de générateurs de nombres pseudo-aléatoires utilisant des systèmes chaotiques.

Intérêts de recherche

Berk se concentre sur l’apprentissage automatique, les outils d’IA agentique et les grands et petits modèles de langage (LLM et SLM).

Il fait partie de l’équipe benchmark d’AIMultiple, réalisant des évaluations et fournissant des analyses pour aider les lecteurs à comprendre les technologies émergentes et leurs applications concrètes.

Expérience professionnelle

Il a commencé sa carrière en tant que chef de projet technique chez ODTU IVME-R, où il a dirigé un projet visant à construire des générateurs quantiques physiques et des générateurs de nombres pseudo-aléatoires.

Après son passage chez IVME-R, il a cofondé une société de développement de jeux vidéo et a sorti un jeu sur Steam.

Il a ensuite réorienté sa carrière vers l’IA et a rejoint AIMultiple en tant que chercheur.

Formation

Berk est titulaire d’une licence de mathématiques d’Ankara University.

Derniers articles de Berk

Agentic AI
Comparaison des Fonctionnalités
3 Sep

Alternatives à OpenClaw: Hermes vs ZeroClaw vs Grok Bot

Les agents IA autonomes, comme OpenClaw et l’agent Hermes, automatisent des tâches en plusieurs étapes qui nécessiteraient normalement une intervention humaine constante. Bien qu’OpenClaw soit devenu l’agent autonome toujours actif le plus largement adopté, de nombreux utilisateurs cherchent des alternatives en raison de son processus de déploiement difficile et de ses exigences de configuration complexes.…

Agentic AI
Benchmark
31 Août

Agents d'utilisation d'ordinateur: Benchmark et architecture

Les agents d'utilisation d'ordinateur opèrent sur de vrais bureaux et applications web. Leurs conceptions, limites et compromis sont souvent peu clairs. Nous décomposons le fonctionnement des principaux systèmes, leur manière d'apprendre et les différences entre leurs architectures. Nous faisons également référence à un benchmark ciblé de grounding UI sur 100 captures d'écran de bureau, couvrant…

Agentic AI
Benchmark
27 Août

Benchmark IA VC: 11 agents IA sur des tâches réelles de capital-risque

En partenariat avec des VC early stage, nous avons converti deux flux de travail d'analyste en benchmarks avec une vérité terrain vérifiée humainement et avons évalué 11 agents IA sur ceux-ci. Découvrez les tâches, les résultats et la méthode de notation : Chacun des 11 modèles a exécuté chaque tâche une fois. Les scores sont…

IA
Benchmark
24 Août

AIM Enterprise: Benchmark d'entreprise agentique

Les entreprises utilisent des LLMs tous les jours pour leurs tâches courantes. Pour trouver les LLMs les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, dans lequel nous avons utilisé 69 tâches d'entreprise réelles couvrant la stratégie, le marketing, les RH, les ventes et les opérations. Deux modèles de juge ont noté…

Agentic AI
Benchmark
24 Août

MCP Benchmark des passerelles: latence et sécurité de 6 passerelles

Une passerelle MCP se situe entre un agent IA et les outils qu'il appelle, et les fournisseurs la positionnent comme la couche de sécurité pour ce trafic. Nous avons comparé six passerelles MCP à un backend instrumenté sur une seule machine, en mesurant la latence ajoutée, l'autorisation par outil, la protection du contenu et l'exhaustivité…

IA24 Août

Benchmark de classification de séries temporelles: modèles de fondation contre méthodes classiques

Nous avons évalué 13 méthodes de classification de séries temporelles, depuis des modèles de fondation de séries temporelles pré-entraînés jusqu'à une référence à 22 caractéristiques datant de 2019, sur 33 jeux de données UCR/UEA sous un protocole gelé unique. Cela représente 14 638 cellules méthode-jeu de données-rééchantillonnage enregistrées, dont 11 874 ont été évaluées. Le graphique compare…

Agentic AI
Benchmark
21 Août

A-CODE-CLI Bench: benchmark des CLI agentiques

Les outils CLI agentiques sont des outils de codage IA qui peuvent créer et supprimer des fichiers, exécuter des commandes, planifier et réaliser le codage de l'ensemble du projet. Nous avons évalué les principaux outils sur 10 scénarios réels de développement web, en effectuant environ 600 contrôles de validation atomiques par agent et plus de…

Logiciel d'entreprise
Benchmark
21 Août

Benchmark VPS: Hetzner vs Digital Ocean

Nous avons comparé 6 fournisseurs de serveurs privés virtuels (VPS) en exécutant environ 1 200 tests automatisés par serveur sur le CPU, la mémoire, les E/S disque et la vitesse réseau à l'aide de sysbench, fio et speedtest-cli. Nous avons également documenté l'expérience complète de l'inscription à SSH pour chaque fournisseur. Nous avons utilisé des…

Agentic AI
Benchmark
19 Août

A-CODE-LLM Bench: Benchmark de codage agentique

Nous avons évalué les meilleurs grands modèles de langage (LLMs) sur 10 tâches de développement logiciel à l'aide d'un outil CLI agentique. Nous avons exécuté environ 3 500 étapes de validation automatisées par modèle à la fois sur les couches API et UI. Chaque alias a été exécuté 3 fois sur 10 tâches (30 échantillons par…

Agentic AI
Benchmark
19 Août

Benchmark Agentic Marketing AIM

Nous présentons le Benchmark Agentic Marketing AIM, qui mesure les performances des agents sur trois workflows marketing : analyse des lacunes concurrentielles, préparation de listes de cibles ABM et un deck de vente personnalisé. Nous avons également mené un audit séparé de la réputation du site web dans lequel les agents ont examiné le contenu…