Berk Kalelioğlu
Forschungsinteressen
Berk konzentriert sich auf maschinelles Lernen, agentische KI-Tools sowie große und kleine Sprachmodelle (LLMs und SLMs).Er ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und liefert Erkenntnisse, um Lesern zu helfen, neue Technologien und ihre realen Anwendungen zu verstehen.
Berufserfahrung
Er begann seine Karriere als Tech-Projektleiter bei ODTU IVME-R, wo er ein Projekt zum Bau physischer Quanten- und Pseudozufallszahlengeneratoren leitete.Nach seiner Zeit bei IVME-R war er Mitgründer eines Spieleentwicklungsunternehmens und veröffentlichte ein Spiel auf Steam.
Später verlagerte er seinen beruflichen Schwerpunkt auf KI und kam als Forscher zu AIMultiple.
Ausbildung
Berk hat einen Bachelor-Abschluss in Mathematik von der Ankara University.Neueste Artikel von Berk
DecisionBench: Jev vs. Kev vs. LLMs
Entscheidungsmodelle, auch System-One-Modelle genannt,1 wählen die nächste Aktion eines Agenten in einem einzigen Durchgang, statt Text Token für Token zu erzeugen. Um zu sehen, ob sie Browser-Automatisierung günstiger machen können als LLMs, haben wir drei Entscheidungsmodelle und zwei LLMs, Gemini 3.8 Flash und GPT-6 Astra, an denselben 50 Browser-Aufgaben getestet, insgesamt 250 Versuche. Kev-9B erledigte…
AIM Agentic Web Benchmark
Agents rely on web interfaces to complete tasks on the web. To measure how interface choice affects task completion, we built the AIM Agentic Web Benchmark and attempted 3.500 tasks (100 tasks completed via 7 web interfaces across 5 runs). A Bright Data interface led every run. The Bright Data CLI retrieved 8 more tasks…
Agentic IT: Können KI-Agenten einen Benchmark entwerfen
Wir haben 16 Models anhand eines Benchmark-Entwurfs in Text-zu-SQL und Tool-Calling getestet. Jedes Model erstellte einen Benchmark pro Thema, insgesamt 32 Einreichungen. Keine Einreichung erfüllte jedes Rubrik-Kriterium. Die Agenten konnten Tests erstellen und ausführen, aber keiner führte sowohl einen Leerantwort-Test als auch einen Richtigantwort-Test des eigenen Scorers vor. Text-zu-SQL wandelt eine Frage in natürlicher Sprache…
AIM Enterprise: Agentischer Unternehmens-Benchmark
Unternehmen nutzen LLMs jeden Tag für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Unternehmens-Benchmark, bei dem wir 69 reale Unternehmensaufgaben aus Strategie, Marketing, HR, Vertrieb und Betrieb verwendet haben. Zwei Bewerter-Models bewerteten jede Datei, die Prüfungen bestand. Bei 32,7 % der Einzelbewertungen wichen die beiden um…
KI Deep Research: Claude vs ChatGPT vs Grok
KI-Deep-Research bietet Nutzern eine breitere Palette an Suchergebnissen als KI-Suchmaschinen. Um die Leistung verschiedener KI-Deep-Research-Tools zu vergleichen, führen wir drei neue Benchmarks ein: DR-50 (Deep Research 50) Bench, der die Tools anhand von 50 Fragen aus sechs Fragetypen bewertet, DR-2T (Deep Research 2 Tasks) Bench, der die Tools durch zwei praxisnahe Forschungsaufgaben mit Fokus auf…
Beste Flatrate-LLM-API-Anbieter
Flatrate-LLM-Anbieter verkaufen unbegrenzte Modellnutzung zu einem festen monatlichen Preis statt pro Token abzurechnen. Dieses Modell verbreitete sich, weil agentische Codierungssitzungen Dutzende Millionen Token verbrauchen können, sodass eine Token-basierte Rechnung schwer vorhersehbar ist. Nur sehr wenige Anbieter bieten eine echte Flatrate; die meisten als Pauschalpreis vermarkteten Pläne enthalten darunter ein Nutzungskontingent. Im Folgenden vergleichen wir die…
KI VC Benchmark: 16 KI-Agenten zur Kundenidentifikation
Die Kundenidentifikation ist Teil der kommerziellen Due Diligence. Wir haben 16 Models bei der Kundenlisten-Recherche für drei Forschungs- und Bewertungsseiten getestet, eine davon AIMultiple, und ihre Einreichungen anhand von Antwortschlüsseln, die wir erstellt haben, und der von ihnen zitierten Seiten bewertet. Wir haben bei keinem Model einen Reasoning-Aufwand festgelegt. Jedes lief mit dem Standard seines…
OpenClaw-Alternativen: Hermes vs. ZeroClaw vs. Grok Bot
Autonome KI-Agenten wie OpenClaw und der Hermes-Agent automatisieren mehrstufige Aufgaben, die normalerweise ständige menschliche Eingaben erfordern würden. Obwohl OpenClaw zum am weitesten verbreiteten Always-on-Agenten geworden ist, suchen viele Nutzer wegen des schwierigen Bereitstellungsprozesses und der komplexen Konfigurationsanforderungen nach Alternativen. Wir stellen 5 führende OpenClaw-Alternativen vor und beleuchten ihre wichtigsten Fähigkeiten sowie die Unterschiede zu OpenClaws…
Computer-Use-Agenten: Benchmark & Architektur
Computer-Use-Agenten bedienen echte Desktops und Web-Apps. Ihre Designs, Grenzen und Kompromisse sind oft unklar. Wir analysieren, wie führende Systeme arbeiten, wie sie lernen und wie sich ihre Architekturen unterscheiden. Wir beziehen uns auch auf einen fokussierten UI-Grounding-Benchmark mit 100 Desktop-Screenshots, über 4 Aufgabentypen und 5 Durchläufe pro Stichprobe. Er isoliert die Qualität der visuellen Wahrnehmung…
MCP Gateway Benchmark: Latenz & Sicherheit von 6 Gateways
Ein MCP Gateway sitzt zwischen einem KI-Agenten und den Tools, die er aufruft, und Anbieter positionieren es als Sicherheitsschicht für diesen Datenverkehr. Wir haben sechs MCP Gateways mit einem instrumentierten Backend auf einer einzigen Maschine verglichen und dabei die zusätzliche Latenz, die Berechtigung pro Tool, den Inhaltsschutz und die Vollständigkeit der Prüfung gemessen. Ein Produkt…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.