Berk Kalelioğlu
Forschungsinteressen
Berk konzentriert sich auf maschinelles Lernen, agentenbasierte KI-Tools sowie große und kleine Sprachmodelle (LLMs und SLMs).Er ist Teil des AIMultiple Benchmark-Teams, führt Bewertungen durch und bietet Einblicke, um Lesern zu helfen, neue Technologien und ihre realen Anwendungen zu verstehen.
Berufserfahrung
Er begann seine Karriere als Technischer Projektleiter bei ODTU IVME-R, wo er ein Projekt zum Bau physischer Quanten- und Pseudozufallszahlengeneratoren leitete.Nach seiner Zeit bei IVME-R war er Mitbegründer einer Spieleentwicklungsfirma und veröffentlichte ein Spiel auf Steam.
Später verlagerte er seine Karriere in Richtung KI und trat AIMultiple als Forscher bei.
Ausbildung
Berk hat einen Bachelor-Abschluss in Mathematik von der Ankara University.Neueste Artikel von Berk
AIM Agentenbasierter Marketing-Benchmark
Wir stellen den AIM Agentenbasierter Marketing-Benchmark vor, der die Agentenleistung bei der Wettbewerbslückenanalyse und der Erstellung von ABM-Ziellisten misst. Wir haben die Leistung von 11 Modellen getestet und die End-to-End-Ausführungsleistung gemessen: Die Aufgabenbewertungen sind auf eine Skala von 0–100 normalisiert. Die Gesamtwertung ist das arithmetische Mittel der beiden Aufgabenbewertungen, wobei jede Aufgabe trotz unterschiedlicher Bewertungsumfänge…
Moltbook: Agentengesteuerte soziale Medien
Das schnelle Wachstum von OpenClaw hat ein ungewöhnliches soziales Experiment ausgelöst: Moltbook, eine Reddit-ähnliche soziale Plattform, auf der Agenten miteinander interagieren. Gestartet am 28th Januar 2026 und begann innerhalb kurzer Zeit Aufmerksamkeit zu erregen. Es erreichte 1.5m+ Agenten in seiner ersten Woche. Für weitere Plattformen für KI-Agenten lesen Sie Im Inneren des OpenClaw-Ökosystems: 8 KI-Agenten-gesteuerte…
OpenClaw (Moltbot/Clawdbot) Anwendungsfälle und Sicherheit
OpenClaw (ehemals Moltbot und Clawdbot) ist ein quelloffener, selbst gehosteter KI-Assistent, der für die Ausführung lokaler Rechenaufgaben und die Interaktion mit Benutzern über Standard-Messaging-Plattformen entwickelt wurde. Anders als herkömmliche Chatbots, die als Berater fungieren und Text generieren, arbeitet OpenClaw als autonomer Agent, der Shell-Befehle ausführen, Dateien verwalten und Browser-Operationen auf der Host-Maschine automatisieren kann. Anfang…
A-CODE-LLM Bench: Agentischer Codierungs-Benchmark
Wir haben die besten Large Language Models (LLMs) in 10 Softwareentwicklungsaufgaben mit einem agentischen CLI-Tool verglichen. Wir führten ~3.500 automatisierte Validierungsschritte pro Modell über API- und UI-Ebenen durch. Jeder Alias wurde 3-mal in 10 Aufgaben ausgeführt (30 Stichproben pro Alias, 380 Zellen pro Iteration über 38 Aliase). Weitere Details zur Methodik. Kein Modell hat jeden…
A-CODE-CLI Bench: Agentic CLI Benchmark
Agentic CLI-Tools sind KI-Coding-Tools, die Dateien erstellen und löschen, Befehle ausführen, planen und die Codierung des gesamten Projekts durchführen können. Wir haben die führenden Tools in 10 realen Webentwicklungsszenarien einem Benchmark unterzogen, wobei wir ~600 atomare Validierungsprüfungen pro Agent und insgesamt mehr als ~5.000 automatisierte Testausführungen durchgeführt haben – einschließlich Backend-Logik, Frontend-Funktionalität und Konsistenzprüfungen über…
Benchmark für tabellarische Modelle: Leistung über 19 Datensätze
Wir haben 8 tabellarische Lernmodelle auf 19 realen Datensätzen mit rund 260.000 Stichproben verglichen, mit Datensatzgrößen von 435 bis 48.800 Zeilen. Jedes Modell lief auf derselben Maschine mit 5-facher Kreuzvalidierung und identischen Aufteilungen. Jeder Datensatz ist ein Round-Robin von direkten Vergleichen zwischen Modellen, entschieden durch die primäre Metrik. Elo fasst alle 483 Vergleiche zu einer…
VPS-Benchmark: Hetzner vs Digital Ocean
Wir haben 6 Anbieter virtueller privater Server (VPS) getestet, indem wir pro Server etwa 1.200 automatisierte Tests für CPU, Speicher, Datenträger-I/O und Netzwerkgeschwindigkeit mit sysbench, fio und speedtest-cli durchführten. Außerdem dokumentierten wir die gesamte Erfahrung vom Anmelden bis zum SSH-Zugriff für jeden Anbieter. Wir verwendeten 4 vCPU (Shared) / 8 GB Pläne jedes Anbieters, ohne…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.