Dienstleistungen
Kontaktieren
Berk Kalelioğlu

Berk Kalelioğlu

KI-Forscher
13 Artikel
Bleiben Sie über B2B-Technologie auf dem Laufenden
Berk ist KI-Forscher bei AIMultiple. Er hat bereits Erfahrung in der Spieleentwicklung und in der Entwicklung von Pseudozufallszahlengeneratoren mithilfe chaotischer Systeme.

Forschungsinteressen

Berk konzentriert sich auf maschinelles Lernen, agentische KI-Tools sowie große und kleine Sprachmodelle (LLMs und SLMs).

Er ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und liefert Erkenntnisse, um Lesern zu helfen, neue Technologien und ihre realen Anwendungen zu verstehen.

Berufserfahrung

Er begann seine Karriere als Tech-Projektleiter bei ODTU IVME-R, wo er ein Projekt zum Bau physischer Quanten- und Pseudozufallszahlengeneratoren leitete.

Nach seiner Zeit bei IVME-R war er Mitgründer eines Spieleentwicklungsunternehmens und veröffentlichte ein Spiel auf Steam.

Später verlagerte er seinen beruflichen Schwerpunkt auf KI und kam als Forscher zu AIMultiple.

Ausbildung

Berk hat einen Bachelor-Abschluss in Mathematik von der Ankara University.

Neueste Artikel von Berk

Agentische KI
Funktionsvergleich
3. Sep

OpenClaw-Alternativen: Hermes vs. ZeroClaw vs. Grok Bot

Autonome KI-Agenten wie OpenClaw und der Hermes-Agent automatisieren mehrstufige Aufgaben, die normalerweise ständige menschliche Eingaben erfordern würden. Obwohl OpenClaw zum am weitesten verbreiteten Always-on-Agenten geworden ist, suchen viele Nutzer wegen des schwierigen Bereitstellungsprozesses und der komplexen Konfigurationsanforderungen nach Alternativen. Wir stellen 5 führende OpenClaw-Alternativen vor und beleuchten ihre wichtigsten Fähigkeiten sowie die Unterschiede zu OpenClaws…

Agentische KI
Benchmark
31. Aug

Computer-Use-Agenten: Benchmark & Architektur

Computer-Use-Agenten bedienen echte Desktops und Web-Apps. Ihre Designs, Grenzen und Kompromisse sind oft unklar. Wir analysieren, wie führende Systeme arbeiten, wie sie lernen und wie sich ihre Architekturen unterscheiden. Wir beziehen uns auch auf einen fokussierten UI-Grounding-Benchmark mit 100 Desktop-Screenshots, über 4 Aufgabentypen und 5 Durchläufe pro Stichprobe. Er isoliert die Qualität der visuellen Wahrnehmung…

Agentische KI
Benchmark
27. Aug

KI VC Benchmark: 11 KI-Agenten bei echten Venture-Capital-Aufgaben

In Zusammenarbeit mit Frühphasen-VCs haben wir zwei Analysten-Workflows in Benchmarks mit menschlich verifizierter Ground Truth umgewandelt und 11 KI-Agenten daran gemessen. Hier sind die Aufgaben, Ergebnisse und die Bewertungsmethode: Jedes der 11 Modelle führte jede Aufgabe einmal aus. Die Punktzahlen gehen bis 100. Kimi K3 lieferte keinen bewertbaren Deal-Sourcing-Durchlauf und wird mit 0 geführt. Beide…

KI
Benchmark
24. Aug

AIM Enterprise: Agentischer Unternehmens-Benchmark

Unternehmen nutzen LLMs täglich für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Unternehmens-Benchmark, bei dem wir 69 reale Unternehmensaufgaben aus Strategie, Marketing, HR, Vertrieb und Betrieb verwendet haben. Zwei Bewerter-Modelle bewerteten jede Datei und waren oft unterschiedlicher Meinung. Bei etwa einem Drittel der Einzelbewertungen lagen die…

Agentische KI
Benchmark
24. Aug

MCP Gateway Benchmark: Latenz & Sicherheit von 6 Gateways

Ein MCP Gateway sitzt zwischen einem KI-Agenten und den Tools, die er aufruft, und Anbieter positionieren es als Sicherheitsschicht für diesen Datenverkehr. Wir haben sechs MCP Gateways mit einem instrumentierten Backend auf einer einzigen Maschine verglichen und dabei die zusätzliche Latenz, die Berechtigung pro Tool, den Inhaltsschutz und die Vollständigkeit der Prüfung gemessen. Ein Produkt…

KI24. Aug

Zeitreihenklassifikations-Benchmark: Foundation Models vs. klassische Methoden

Wir haben 13 Methoden zur Zeitreihenklassifikation verglichen – von vortrainierten Time-Series-Foundation-Models bis zu einer 22-Feature-Baseline von 2019 – auf 33 UCR/UEA-Datensätzen unter einem eingefrorenen Protokoll. Das sind 14.638 erfasste Methoden-Datensatz-Resample-Zellen, von denen 11.874 bewertet wurden. Die Grafik vergleicht 12 Methoden auf den 15 univariaten Datensätzen, die jede von ihnen vollständig bearbeitet hat; jeder Datensatz wurde…

Agentische KI
Benchmark
21. Aug

A-CODE-CLI Bench: Agentic-CLI-Benchmark

Agentic-CLI-Tools sind KI-Coding-Tools, die Dateien erstellen und löschen, Befehle ausführen, planen und die Codierung des gesamten Projekts ausführen können. Wir haben die führenden Tools in 10 realen Webentwicklungsszenarien bewertet und dabei ~600 atomare Validierungsprüfungen pro Agent sowie mehr als ~5.000 automatisierte Testausführungen insgesamt durchgeführt, einschließlich Backend-Logik, Frontend-Funktionalität und Konsistenzüberprüfung über mehrere Läufe hinweg. Die Backend-Korrektheit…

Unternehmenssoftware
Benchmark
21. Aug

VPS-Benchmark: Hetzner vs Digital Ocean

Wir haben 6 Anbieter virtueller privater Server (VPS) getestet, indem wir pro Server etwa 1.200 automatisierte Tests für CPU, Speicher, Datenträger-I/O und Netzwerkgeschwindigkeit mit sysbench, fio und speedtest-cli durchführten. Außerdem dokumentierten wir die gesamte Erfahrung vom Anmelden bis zum SSH-Zugriff für jeden Anbieter. Wir verwendeten 4 vCPU (Shared) / 8 GB Pläne jedes Anbieters, ohne…

Agentische KI
Benchmark
19. Aug

A-CODE-LLM Bench: Agentischer Programmier-Benchmark

Wir haben die besten Large Language Models (LLMs) bei 10 Softwareentwicklungsaufgaben mit einem agentischen CLI-Tool getestet. Wir führten ~3.500 automatisierte Validierungsschritte pro Modell sowohl auf API- als auch auf UI-Ebene durch. Jeder Alias wurde 3 Mal über 10 Aufgaben hinweg ausgeführt (30 Stichproben pro Alias, 400 Zellen pro Iteration über 40 Aliase hinweg). Weitere Details…

Agentische KI
Benchmark
19. Aug

AIM Agentic Marketing Benchmark

Wir stellen den AIM Agentic Marketing Benchmark vor, der die Leistung von Agenten bei drei Marketing-Workflows misst: Wettbewerbsanalyse, ABM-Ziellisten-Erstellung und ein personalisiertes Sales-Deck. Wir führten außerdem ein separates Website-Reputations-Audit durch, bei dem Agenten die englischsprachigen Inhalte von AIMultiple untersuchten und überprüfbare Probleme hinsichtlich Faktenrichtigkeit, Zitaten, Konsistenz, Aktualität, Funktionalität, Grammatik und Formatierung meldeten, die das Vertrauen…