Berk Kalelioğlu
Intérêts de recherche
Berk se concentre sur l'apprentissage automatique, les outils d'IA agentique, et les grands et petits modèles de langage (LLMs et SLMs).Il fait partie de l'équipe benchmark d'AIMultiple, menant des évaluations et fournissant des aperçus pour aider les lecteurs à comprendre les technologies émergentes et leurs applications concrètes.
Expérience professionnelle
Il a commencé sa carrière en tant que chef de projet technique chez ODTU IVME-R, où il a dirigé un projet de construction de générateurs de nombres quantiques physiques et pseudo-aléatoires.Après son passage chez IVME-R, il a cofondé une entreprise de développement de jeux et a sorti un jeu sur Steam.
Il a ensuite réorienté sa carrière vers l'IA et a rejoint AIMultiple en tant que chercheur.
Formation
Berk est titulaire d'une licence en mathématiques de l'université d'Ankara.Derniers articles de Berk
Moltbook: Médias Sociaux Pilotés par des Agents
La croissance rapide d'OpenClaw a déclenché une expérience sociale inhabituelle : Moltbook, une plateforme sociale semblable à Reddit où les agents interagissent entre eux. Lancée le 28th janvier 2026, elle a commencé à attirer l'attention en peu de temps. Elle a atteint plus de 1.5m d'agents lors de sa première semaine. Pour d'autres plateformes destinées…
Cas d'utilisation et sécurité d'OpenClaw (Moltbot/Clawdbot)
OpenClaw (anciennement Moltbot et Clawdbot) est un assistant IA open source auto-hébergé conçu pour exécuter des tâches informatiques locales et interagir avec les utilisateurs via des plateformes de messagerie standard. Contrairement aux chatbots traditionnels qui fonctionnent comme des conseillers générant du texte, OpenClaw agit comme un agent autonome capable d’exécuter des commandes shell, de gérer…
A-CODE-LLM: Benchmark de codage agentique
Nous avons évalué les principaux grands modèles de langage (LLMs) sur 10 tâches de développement logiciel à l’aide d’un outil CLI agentique. Nous avons exécuté environ 3 500 étapes de validation automatisées par modèle, à la fois sur les couches API et UI. Chaque alias a été exécuté 3 fois sur 10 tâches (30 échantillons…
A-CODE-CLI Bench: Benchmark CLI Agentique
Les outils CLI agentiques sont des outils de codage IA qui peuvent créer et supprimer des fichiers, exécuter des commandes, planifier et réaliser le codage de l'ensemble du projet. Nous avons évalué les principaux outils sur 10 scénarios réels de développement web, en effectuant environ 600 vérifications de validation atomiques par agent et plus de…
Benchmark des modèles tabulaires: performances sur 19 jeux de données
Nous avons testé 8 modèles d’apprentissage tabulaire sur 19 jeux de données réels totalisant environ 260,000 échantillons, avec des tailles allant de 435 à 48,800 lignes. Chaque modèle a tourné sur la même machine avec une validation croisée en 5 plis et des partitions identiques. Chaque jeu de données est un tournoi en tête-à-tête entre…
Benchmark VPS: Hetzner vs Digital Ocean
Nous avons comparé 6 fournisseurs de serveurs privés virtuels (VPS) en exécutant environ 1 200 tests automatisés par serveur sur le CPU, la mémoire, les E/S disque et la vitesse réseau à l'aide de sysbench, fio et speedtest-cli. Nous avons également documenté l'expérience complète de l'inscription à SSH pour chaque fournisseur. Nous avons utilisé des…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.