Berk Kalelioğlu
Forschungsinteressen
Berk konzentriert sich auf maschinelles Lernen, agentische KI-Tools sowie große und kleine Language Models (LLMs und SLMs).Er ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und bietet Einblicke, um Lesern zu helfen, aufkommende Technologien und ihre praktischen Anwendungen zu verstehen.
Berufserfahrung
Er begann seine Karriere als technischer Projektleiter bei ODTU IVME-R, wo er ein Projekt zum Bau von physischen Quanten- und Pseudozufallszahlengeneratoren leitete.Nach seiner Zeit bei IVME-R war er Mitgründer eines Spieleentwicklungsunternehmens und veröffentlichte ein Spiel auf Steam.
Später verlagerte er seinen Karriereweg in Richtung KI und kam als Forscher zu AIMultiple.
Ausbildung
Berk hat einen Bachelor-Abschluss in Mathematik von der Ankara University.Neueste Artikel von Berk
AIM Enterprise: Agentischer Enterprise-Benchmark
Unternehmen nutzen LLMs täglich für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Enterprise-Benchmark, bei dem wir 69 Unternehmensaufgaben aus verschiedenen Kategorien verwendet haben. Jedes Modell lieferte eine Datei pro Aufgabe. Die Punktzahlen sind relativ: Die Juroren stufen jede Antwort im Vergleich zu den anderen Antworten auf…
AIM Agentic Marketing Benchmark
Wir stellen den AIM Agentic Marketing Benchmark vor, der die Leistung von Agenten bei drei Marketing-Workflows misst: Wettbewerbsanalyse, ABM-Ziellisten-Erstellung und ein personalisiertes Sales-Deck. Wir führten außerdem ein separates Website-Reputations-Audit durch, bei dem Agenten die englischsprachigen Inhalte von AIMultiple untersuchten und überprüfbare Probleme hinsichtlich Faktenrichtigkeit, Zitaten, Konsistenz, Aktualität, Funktionalität, Grammatik und Formatierung meldeten, die das Vertrauen…
Zeitreihen-Klassifikations-Benchmark: Foundation-Models vs klassische Methoden
Wir haben 13 Methoden zur Zeitreihenklassifikation verglichen, von vortrainierten Zeitreihen-Foundation-Models bis zu einer 22-Merkmals-Baseline aus dem Jahr 2019, an 33 UCR/UEA-Datasets unter einem eingefrorenen Protokoll. Das sind 14.638 aufgezeichnete Methode-Dataset-Resample-Zellen, 11.874 davon bewertet. Das Diagramm zeigt den Hauptvergleich des Benchmarks: 12 Methoden auf den 15 univariaten Datasets, bei denen jede Methode ein Ergebnis lieferte, jedes…
A-CODE-LLM Bench: Agentischer Programmier-Benchmark
Wir haben die besten Large Language Models (LLMs) bei 10 Softwareentwicklungsaufgaben mit einem agentischen CLI-Tool getestet. Wir führten ~3.500 automatisierte Validierungsschritte pro Modell sowohl auf API- als auch auf UI-Ebene durch. Jeder Alias wurde 3 Mal über 10 Aufgaben hinweg ausgeführt (30 Stichproben pro Alias, 400 Zellen pro Iteration über 40 Aliase hinweg). Weitere Details…
A-CODE-CLI Bench: Agentic CLI Benchmark
Agentic CLI-Tools sind KI-Coding-Tools, die Dateien erstellen und löschen, Befehle ausführen, planen und die Codierung des gesamten Projekts durchführen können. Wir haben die führenden Tools in 10 realen Webentwicklungsszenarien einem Benchmark unterzogen, wobei wir ~600 atomare Validierungsprüfungen pro Agent und insgesamt mehr als ~5.000 automatisierte Testausführungen durchgeführt haben – einschließlich Backend-Logik, Frontend-Funktionalität und Konsistenzprüfungen über…
Moltbook: Agentengesteuerte soziale Medien
Das schnelle Wachstum von OpenClaw hat ein ungewöhnliches soziales Experiment ausgelöst: Moltbook, eine Reddit-ähnliche soziale Plattform, auf der Agenten miteinander interagieren. Gestartet am 28th Januar 2026 und begann innerhalb kurzer Zeit Aufmerksamkeit zu erregen. Es erreichte 1.5m+ Agenten in seiner ersten Woche. Für weitere Plattformen für KI-Agenten lesen Sie Im Inneren des OpenClaw-Ökosystems: 8 KI-Agenten-gesteuerte…
OpenClaw (Moltbot/Clawdbot) Anwendungsfälle und Sicherheit
OpenClaw (ehemals Moltbot und Clawdbot) ist ein quelloffener, selbst gehosteter KI-Assistent, der für die Ausführung lokaler Rechenaufgaben und die Interaktion mit Benutzern über Standard-Messaging-Plattformen entwickelt wurde. Anders als herkömmliche Chatbots, die als Berater fungieren und Text generieren, arbeitet OpenClaw als autonomer Agent, der Shell-Befehle ausführen, Dateien verwalten und Browser-Operationen auf der Host-Maschine automatisieren kann. Anfang…
VPS-Benchmark: Hetzner vs Digital Ocean
Wir haben 6 Anbieter virtueller privater Server (VPS) getestet, indem wir pro Server etwa 1.200 automatisierte Tests für CPU, Speicher, Datenträger-I/O und Netzwerkgeschwindigkeit mit sysbench, fio und speedtest-cli durchführten. Außerdem dokumentierten wir die gesamte Erfahrung vom Anmelden bis zum SSH-Zugriff für jeden Anbieter. Wir verwendeten 4 vCPU (Shared) / 8 GB Pläne jedes Anbieters, ohne…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
Beste Flatrate-LLM-API-Anbieter
Flatrate-LLM-Anbieter verkaufen unbegrenzte Modellnutzung zu einem festen monatlichen Preis statt pro Token abzurechnen. Dieses Modell verbreitete sich, weil agentische Codierungssitzungen Dutzende Millionen Token verbrauchen können, sodass eine Token-basierte Rechnung schwer vorhersehbar ist. Nur sehr wenige Anbieter bieten eine echte Flatrate; die meisten als Pauschalpreis vermarkteten Pläne enthalten darunter ein Nutzungskontingent. Im Folgenden vergleichen wir die…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.