Premium
Dienstleistungen
Premium
Berk Kalelioğlu

Berk Kalelioğlu

KI-Forscher
15 Artikel
Bleiben Sie über B2B-Technologie auf dem Laufenden
Berk ist KI-Forscher bei AIMultiple. Er hat bereits Erfahrung in der Spieleentwicklung und in der Entwicklung von Pseudozufallszahlengeneratoren mithilfe chaotischer Systeme.

Forschungsinteressen

Berk konzentriert sich auf maschinelles Lernen, agentische KI-Tools sowie große und kleine Sprachmodelle (LLMs und SLMs).

Er ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und liefert Erkenntnisse, um Lesern zu helfen, neue Technologien und ihre realen Anwendungen zu verstehen.

Berufserfahrung

Er begann seine Karriere als Tech-Projektleiter bei ODTU IVME-R, wo er ein Projekt zum Bau physischer Quanten- und Pseudozufallszahlengeneratoren leitete.

Nach seiner Zeit bei IVME-R war er Mitgründer eines Spieleentwicklungsunternehmens und veröffentlichte ein Spiel auf Steam.

Später verlagerte er seinen beruflichen Schwerpunkt auf KI und kam als Forscher zu AIMultiple.

Ausbildung

Berk hat einen Bachelor-Abschluss in Mathematik von der Ankara University.

Neueste Artikel von Berk

KI
Benchmark
23. Sep

DecisionBench: Jev vs. Kev vs. LLMs

Entscheidungsmodelle, auch System-One-Modelle genannt,1 wählen die nächste Aktion eines Agenten in einem einzigen Durchgang, statt Text Token für Token zu erzeugen. Um zu sehen, ob sie Browser-Automatisierung günstiger machen können als LLMs, haben wir drei Entscheidungsmodelle und zwei LLMs, Gemini 3.8 Flash und GPT-6 Astra, an denselben 50 Browser-Aufgaben getestet, insgesamt 250 Versuche. Kev-9B erledigte…

Agentische KI
21. Sep

AIM Agentic Web Benchmark

Agents rely on web interfaces to complete tasks on the web. To measure how interface choice affects task completion, we built the AIM Agentic Web Benchmark and attempted 3.500 tasks (100 tasks completed via 7 web interfaces across 5 runs). A Bright Data interface led every run. The Bright Data CLI retrieved 8 more tasks…

KI
Benchmark
18. Sep

Agentic IT: Können KI-Agenten einen Benchmark entwerfen

Wir haben 16 Models anhand eines Benchmark-Entwurfs in Text-zu-SQL und Tool-Calling getestet. Jedes Model erstellte einen Benchmark pro Thema, insgesamt 32 Einreichungen. Keine Einreichung erfüllte jedes Rubrik-Kriterium. Die Agenten konnten Tests erstellen und ausführen, aber keiner führte sowohl einen Leerantwort-Test als auch einen Richtigantwort-Test des eigenen Scorers vor. Text-zu-SQL wandelt eine Frage in natürlicher Sprache…

KI
Benchmark
17. Sep

AIM Enterprise: Agentischer Unternehmens-Benchmark

Unternehmen nutzen LLMs jeden Tag für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Unternehmens-Benchmark, bei dem wir 69 reale Unternehmensaufgaben aus Strategie, Marketing, HR, Vertrieb und Betrieb verwendet haben. Zwei Bewerter-Models bewerteten jede Datei, die Prüfungen bestand. Bei 32,7 % der Einzelbewertungen wichen die beiden um…

Agentische KI
Benchmark
12. Sep

KI Deep Research: Claude vs ChatGPT vs Grok

KI-Deep-Research bietet Nutzern eine breitere Palette an Suchergebnissen als KI-Suchmaschinen. Um die Leistung verschiedener KI-Deep-Research-Tools zu vergleichen, führen wir drei neue Benchmarks ein: DR-50 (Deep Research 50) Bench, der die Tools anhand von 50 Fragen aus sechs Fragetypen bewertet, DR-2T (Deep Research 2 Tasks) Bench, der die Tools durch zwei praxisnahe Forschungsaufgaben mit Fokus auf…

KI
Open-World-Bewertung
10. Sep

Beste Flatrate-LLM-API-Anbieter

Flatrate-LLM-Anbieter verkaufen unbegrenzte Modellnutzung zu einem festen monatlichen Preis statt pro Token abzurechnen. Dieses Modell verbreitete sich, weil agentische Codierungssitzungen Dutzende Millionen Token verbrauchen können, sodass eine Token-basierte Rechnung schwer vorhersehbar ist. Nur sehr wenige Anbieter bieten eine echte Flatrate; die meisten als Pauschalpreis vermarkteten Pläne enthalten darunter ein Nutzungskontingent. Im Folgenden vergleichen wir die…

Agentische KI
Benchmark
10. Sep

KI VC Benchmark: 16 KI-Agenten zur Kundenidentifikation

Die Kundenidentifikation ist Teil der kommerziellen Due Diligence. Wir haben 16 Models bei der Kundenlisten-Recherche für drei Forschungs- und Bewertungsseiten getestet, eine davon AIMultiple, und ihre Einreichungen anhand von Antwortschlüsseln, die wir erstellt haben, und der von ihnen zitierten Seiten bewertet. Wir haben bei keinem Model einen Reasoning-Aufwand festgelegt. Jedes lief mit dem Standard seines…

Agentische KI
Funktionsvergleich
3. Sep

OpenClaw-Alternativen: Hermes vs. ZeroClaw vs. Grok Bot

Autonome KI-Agenten wie OpenClaw und der Hermes-Agent automatisieren mehrstufige Aufgaben, die normalerweise ständige menschliche Eingaben erfordern würden. Obwohl OpenClaw zum am weitesten verbreiteten Always-on-Agenten geworden ist, suchen viele Nutzer wegen des schwierigen Bereitstellungsprozesses und der komplexen Konfigurationsanforderungen nach Alternativen. Wir stellen 5 führende OpenClaw-Alternativen vor und beleuchten ihre wichtigsten Fähigkeiten sowie die Unterschiede zu OpenClaws…

Agentische KI
Benchmark
31. Aug

Computer-Use-Agenten: Benchmark & Architektur

Computer-Use-Agenten bedienen echte Desktops und Web-Apps. Ihre Designs, Grenzen und Kompromisse sind oft unklar. Wir analysieren, wie führende Systeme arbeiten, wie sie lernen und wie sich ihre Architekturen unterscheiden. Wir beziehen uns auch auf einen fokussierten UI-Grounding-Benchmark mit 100 Desktop-Screenshots, über 4 Aufgabentypen und 5 Durchläufe pro Stichprobe. Er isoliert die Qualität der visuellen Wahrnehmung…

Agentische KI
Benchmark
24. Aug

MCP Gateway Benchmark: Latenz & Sicherheit von 6 Gateways

Ein MCP Gateway sitzt zwischen einem KI-Agenten und den Tools, die er aufruft, und Anbieter positionieren es als Sicherheitsschicht für diesen Datenverkehr. Wir haben sechs MCP Gateways mit einem instrumentierten Backend auf einer einzigen Maschine verglichen und dabei die zusätzliche Latenz, die Berechtigung pro Tool, den Inhaltsschutz und die Vollständigkeit der Prüfung gemessen. Ein Produkt…