Berk Kalelioğlu
Intérêts de recherche
Berk se concentre sur l’apprentissage automatique, les outils d’IA agentique et les grands et petits modèles de langage (LLM et SLM).Il fait partie de l’équipe benchmark d’AIMultiple, réalisant des évaluations et fournissant des analyses pour aider les lecteurs à comprendre les technologies émergentes et leurs applications concrètes.
Expérience professionnelle
Il a commencé sa carrière en tant que chef de projet technique chez ODTU IVME-R, où il a dirigé un projet visant à construire des générateurs quantiques physiques et des générateurs de nombres pseudo-aléatoires.Après son passage chez IVME-R, il a cofondé une société de développement de jeux vidéo et a sorti un jeu sur Steam.
Il a ensuite réorienté sa carrière vers l’IA et a rejoint AIMultiple en tant que chercheur.
Formation
Berk est titulaire d’une licence de mathématiques d’Ankara University.Derniers articles de Berk
Benchmark de classification de séries temporelles: modèles de fondation contre méthodes classiques
Nous avons évalué 13 méthodes de classification de séries temporelles, depuis des modèles de fondation de séries temporelles pré-entraînés jusqu'à une référence à 22 caractéristiques datant de 2019, sur 33 jeux de données UCR/UEA sous un protocole gelé unique. Cela représente 14 638 cellules méthode-jeu de données-rééchantillonnage enregistrées, dont 11 874 ont été évaluées. Le graphique compare…
A-CODE-CLI Bench: benchmark des CLI agentiques
Les outils CLI agentiques sont des outils de codage IA qui peuvent créer et supprimer des fichiers, exécuter des commandes, planifier et réaliser le codage de l'ensemble du projet. Nous avons évalué les principaux outils sur 10 scénarios réels de développement web, en effectuant environ 600 contrôles de validation atomiques par agent et plus de…
Benchmark VPS: Hetzner vs Digital Ocean
Nous avons comparé 6 fournisseurs de serveurs privés virtuels (VPS) en exécutant environ 1 200 tests automatisés par serveur sur le CPU, la mémoire, les E/S disque et la vitesse réseau à l'aide de sysbench, fio et speedtest-cli. Nous avons également documenté l'expérience complète de l'inscription à SSH pour chaque fournisseur. Nous avons utilisé des…
Benchmark Agentic Marketing AIM
Nous présentons le Benchmark Agentic Marketing AIM, qui mesure les performances des agents sur trois workflows marketing : analyse des lacunes concurrentielles, préparation de listes de cibles ABM et un deck de vente personnalisé. Nous avons également mené un audit séparé de la réputation du site web dans lequel les agents ont examiné le contenu…
Benchmark des modèles tabulaires: performances sur 19 jeux de données
Nous avons testé 8 modèles d’apprentissage tabulaire sur 19 jeux de données réels totalisant environ 260 000 échantillons, avec des tailles allant de 435 à 48 800 lignes. Chaque modèle a tourné sur la même machine avec une validation croisée en 5 plis et des partitions identiques. Chaque jeu de données est un tournoi en tête-à-tête entre…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.