Berk Kalelioğlu
Forschungsinteressen
Berk konzentriert sich auf maschinelles Lernen, agentische KI-Tools sowie große und kleine Sprachmodelle (LLMs und SLMs).Er ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und liefert Erkenntnisse, um Lesern zu helfen, neue Technologien und ihre realen Anwendungen zu verstehen.
Berufserfahrung
Er begann seine Karriere als Tech-Projektleiter bei ODTU IVME-R, wo er ein Projekt zum Bau physischer Quanten- und Pseudozufallszahlengeneratoren leitete.Nach seiner Zeit bei IVME-R war er Mitgründer eines Spieleentwicklungsunternehmens und veröffentlichte ein Spiel auf Steam.
Später verlagerte er seinen beruflichen Schwerpunkt auf KI und kam als Forscher zu AIMultiple.
Ausbildung
Berk hat einen Bachelor-Abschluss in Mathematik von der Ankara University.Neueste Artikel von Berk
OpenClaw-Alternativen: Hermes vs. ZeroClaw vs. Grok Bot
Autonome KI-Agenten wie OpenClaw und der Hermes-Agent automatisieren mehrstufige Aufgaben, die normalerweise ständige menschliche Eingaben erfordern würden. Obwohl OpenClaw zum am weitesten verbreiteten Always-on-Agenten geworden ist, suchen viele Nutzer wegen des schwierigen Bereitstellungsprozesses und der komplexen Konfigurationsanforderungen nach Alternativen. Wir stellen 5 führende OpenClaw-Alternativen vor und beleuchten ihre wichtigsten Fähigkeiten sowie die Unterschiede zu OpenClaws…
Computer-Use-Agenten: Benchmark & Architektur
Computer-Use-Agenten bedienen echte Desktops und Web-Apps. Ihre Designs, Grenzen und Kompromisse sind oft unklar. Wir analysieren, wie führende Systeme arbeiten, wie sie lernen und wie sich ihre Architekturen unterscheiden. Wir beziehen uns auch auf einen fokussierten UI-Grounding-Benchmark mit 100 Desktop-Screenshots, über 4 Aufgabentypen und 5 Durchläufe pro Stichprobe. Er isoliert die Qualität der visuellen Wahrnehmung…
KI VC Benchmark: 11 KI-Agenten bei echten Venture-Capital-Aufgaben
In Zusammenarbeit mit Frühphasen-VCs haben wir zwei Analysten-Workflows in Benchmarks mit menschlich verifizierter Ground Truth umgewandelt und 11 KI-Agenten daran gemessen. Hier sind die Aufgaben, Ergebnisse und die Bewertungsmethode: Jedes der 11 Modelle führte jede Aufgabe einmal aus. Die Punktzahlen gehen bis 100. Kimi K3 lieferte keinen bewertbaren Deal-Sourcing-Durchlauf und wird mit 0 geführt. Beide…
AIM Enterprise: Agentischer Unternehmens-Benchmark
Unternehmen nutzen LLMs täglich für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Unternehmens-Benchmark, bei dem wir 69 reale Unternehmensaufgaben aus Strategie, Marketing, HR, Vertrieb und Betrieb verwendet haben. Zwei Bewerter-Modelle bewerteten jede Datei und waren oft unterschiedlicher Meinung. Bei etwa einem Drittel der Einzelbewertungen lagen die…
MCP Gateway Benchmark: Latenz & Sicherheit von 6 Gateways
Ein MCP Gateway sitzt zwischen einem KI-Agenten und den Tools, die er aufruft, und Anbieter positionieren es als Sicherheitsschicht für diesen Datenverkehr. Wir haben sechs MCP Gateways mit einem instrumentierten Backend auf einer einzigen Maschine verglichen und dabei die zusätzliche Latenz, die Berechtigung pro Tool, den Inhaltsschutz und die Vollständigkeit der Prüfung gemessen. Ein Produkt…
Zeitreihenklassifikations-Benchmark: Foundation Models vs. klassische Methoden
Wir haben 13 Methoden zur Zeitreihenklassifikation verglichen – von vortrainierten Time-Series-Foundation-Models bis zu einer 22-Feature-Baseline von 2019 – auf 33 UCR/UEA-Datensätzen unter einem eingefrorenen Protokoll. Das sind 14.638 erfasste Methoden-Datensatz-Resample-Zellen, von denen 11.874 bewertet wurden. Die Grafik vergleicht 12 Methoden auf den 15 univariaten Datensätzen, die jede von ihnen vollständig bearbeitet hat; jeder Datensatz wurde…
A-CODE-CLI Bench: Agentic-CLI-Benchmark
Agentic-CLI-Tools sind KI-Coding-Tools, die Dateien erstellen und löschen, Befehle ausführen, planen und die Codierung des gesamten Projekts ausführen können. Wir haben die führenden Tools in 10 realen Webentwicklungsszenarien bewertet und dabei ~600 atomare Validierungsprüfungen pro Agent sowie mehr als ~5.000 automatisierte Testausführungen insgesamt durchgeführt, einschließlich Backend-Logik, Frontend-Funktionalität und Konsistenzüberprüfung über mehrere Läufe hinweg. Die Backend-Korrektheit…
VPS-Benchmark: Hetzner vs Digital Ocean
Wir haben 6 Anbieter virtueller privater Server (VPS) getestet, indem wir pro Server etwa 1.200 automatisierte Tests für CPU, Speicher, Datenträger-I/O und Netzwerkgeschwindigkeit mit sysbench, fio und speedtest-cli durchführten. Außerdem dokumentierten wir die gesamte Erfahrung vom Anmelden bis zum SSH-Zugriff für jeden Anbieter. Wir verwendeten 4 vCPU (Shared) / 8 GB Pläne jedes Anbieters, ohne…
A-CODE-LLM Bench: Agentischer Programmier-Benchmark
Wir haben die besten Large Language Models (LLMs) bei 10 Softwareentwicklungsaufgaben mit einem agentischen CLI-Tool getestet. Wir führten ~3.500 automatisierte Validierungsschritte pro Modell sowohl auf API- als auch auf UI-Ebene durch. Jeder Alias wurde 3 Mal über 10 Aufgaben hinweg ausgeführt (30 Stichproben pro Alias, 400 Zellen pro Iteration über 40 Aliase hinweg). Weitere Details…
AIM Agentic Marketing Benchmark
Wir stellen den AIM Agentic Marketing Benchmark vor, der die Leistung von Agenten bei drei Marketing-Workflows misst: Wettbewerbsanalyse, ABM-Ziellisten-Erstellung und ein personalisiertes Sales-Deck. Wir führten außerdem ein separates Website-Reputations-Audit durch, bei dem Agenten die englischsprachigen Inhalte von AIMultiple untersuchten und überprüfbare Probleme hinsichtlich Faktenrichtigkeit, Zitaten, Konsistenz, Aktualität, Funktionalität, Grammatik und Formatierung meldeten, die das Vertrauen…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.