Berk Kalelioğlu
Forschungsinteressen
Berk konzentriert sich auf maschinelles Lernen, agentische KI-Tools sowie große und kleine Language Models (LLMs und SLMs).Er ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und bietet Einblicke, um Lesern zu helfen, aufkommende Technologien und ihre praktischen Anwendungen zu verstehen.
Berufserfahrung
Er begann seine Karriere als technischer Projektleiter bei ODTU IVME-R, wo er ein Projekt zum Bau von physischen Quanten- und Pseudozufallszahlengeneratoren leitete.Nach seiner Zeit bei IVME-R war er Mitgründer eines Spieleentwicklungsunternehmens und veröffentlichte ein Spiel auf Steam.
Später verlagerte er seinen Karriereweg in Richtung KI und kam als Forscher zu AIMultiple.
Ausbildung
Berk hat einen Bachelor-Abschluss in Mathematik von der Ankara University.Neueste Artikel von Berk
Computer-Use-Agenten: Benchmark & Architektur
Computer-Use-Agenten bedienen echte Desktops und Web-Apps. Ihre Designs, Grenzen und Kompromisse sind oft unklar. Wir analysieren, wie führende Systeme arbeiten, wie sie lernen und wie sich ihre Architekturen unterscheiden. Wir beziehen uns auch auf einen fokussierten UI-Grounding-Benchmark mit 100 Desktop-Screenshots, über 4 Aufgabentypen und 5 Durchläufe pro Stichprobe. Er isoliert die Qualität der visuellen Wahrnehmung…
KI VC Benchmark: 11 KI-Agenten bei echten Venture-Capital-Aufgaben
In Zusammenarbeit mit Frühphasen-VCs haben wir zwei Analysten-Workflows in Benchmarks mit menschlich verifizierter Ground Truth umgewandelt und 11 KI-Agenten daran gemessen. Hier sind die Aufgaben, Ergebnisse und die Bewertungsmethode: Jedes der 11 Modelle führte jede Aufgabe einmal aus. Die Punktzahlen gehen bis 100. Kimi K3 lieferte keinen bewertbaren Deal-Sourcing-Durchlauf und wird mit 0 geführt. Beide…
Benchmark für tabellarische Modelle: Leistung über 19 Datensätze
Wir haben 8 tabellarische Lernmodelle auf 19 realen Datensätzen mit rund 260.000 Stichproben verglichen, mit Datensatzgrößen von 435 bis 48.800 Zeilen. Jedes Modell lief auf derselben Maschine mit 5-facher Kreuzvalidierung und identischen Aufteilungen. Jeder Datensatz ist ein Round-Robin von direkten Vergleichen zwischen Modellen, entschieden durch die primäre Metrik. Elo fasst alle 483 Vergleiche zu einer…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.