Dienstleistungen
Kontaktieren
Şevval Alper

Şevval Alper

KI-Forscherin
21 Artikel
Bleiben Sie über B2B-Technologie auf dem Laufenden
Şevval ist KI-Forscherin bei AIMultiple. Sie hat bereits Forschungserfahrung in der Erzeugung von Pseudozufallszahlen mithilfe chaotischer Systeme.

Forschungsinteressen

Şevval konzentriert sich auf KI-Programmierwerkzeuge, KI-Agenten und Quantentechnologien.

Sie ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und bietet Einblicke, um Lesern zu helfen, verschiedene aufstrebende Technologien und ihre Anwendungen zu verstehen.

Berufserfahrung

Sie trug zur Organisation und Betreuung der Teilnehmer bei drei Veranstaltungen “CERN International Masterclasses - hands-on particle physics” in der Türkei bei und arbeitete mit Dozierenden zusammen, um das Lernen zu unterstützen.

Ausbildung

Şevval hat einen Bachelorabschluss in Physik von der Middle East Technical University.

Neueste Artikel von Şevval

KI
Benchmark
1. Sep

Zielgruppensimulation: Können LLMs menschliches Verhalten vorhersagen?

Im Marketing ist die Bewertung, wie genau LLMs menschliches Verhalten vorhersagen, entscheidend für die Beurteilung ihrer Wirksamkeit bei der Antizipation von Zielgruppenbedürfnissen und der Erkennung der Risiken von Fehlausrichtung, ineffektiver Kommunikation oder unbeabsichtigter Beeinflussung. Die Zielgruppensimulation mit LLMs ermöglicht die Modellierung virtueller Zielgruppen und hilft Organisationen, Reaktionen auf Inhalte oder Produkte vorherzusehen, ohne auf teure…

Agentische KI28. Aug

KI-Agenten: Operator vs Browser Use vs Project Mariner

KI-Agenten werden zunehmend als durchgängige digitale Arbeitskräfte vermarktet, aber die Leistung in der Praxis kann je nach Aufgabe, Tools und Ausführungsumgebung stark variieren. Um zu verstehen, was diese Systeme heute wirklich leisten können, haben wir praktische Benchmarks in realistischen Geschäftsszenarien durchgeführt. Wir haben mehr als 40 Stunden damit verbracht, die Top 5 KI-Agenten zu testen,…

Agentische KI
Benchmark
27. Aug

Code-Ausführung mit MCP: Ein neuer Ansatz für KI-Agenten-Effizienz

Anthropic stellte eine Methode vor, bei der KI-Agenten mit Model Context Protocol (MCP) -Servern interagieren, indem sie ausführbaren Code schreiben, anstatt direkte Aufrufe an Tools zu tätigen. Der Agent behandelt Tools als Dateien auf einem Computer, findet, was er benötigt, und verwendet sie direkt mit Code, sodass Zwischendaten nicht durch den Speicher des Modells laufen…

KI
Benchmark
24. Aug

KI-Coding-Benchmark: Claude Code vs Cursor

Im KI-Coding hat sich der Markt in zwei Kategorien zersplittert: Agentic CLI-Tools und KI-Code-Editoren, die in IDEs eingebettet sind. Jede behauptet, die Entwicklung zu automatisieren. Wenige Vergleiche zeigen, wie sie sich unter identischen Arbeitslasten unterscheiden. Wir haben jeden Agenten anhand von 10 Full-Stack-Webentwicklungsaufgaben bewertet und dabei ~600 atomare Validierungsprüfungen pro Agent und mehr als 9.600…

Agentische KI
Benchmark
21. Aug

KI-Agenten-Plattformen-Benchmark: Claude Managed Agents vs. Google Vertex Agent Engine

Wir haben 4 KI-Agenten-Plattformen in 3 Dimensionen bewertet: Aufgabenabschluss (10 Programmieraufgaben × 3 Läufe), harness-spezifische Fähigkeiten (Steuerung, Wiederverbindung, Erinnerung an lange Konversationen, Verarbeitung großer Dateien) und Kosten. Claude Managed Agents und Vertex KI Agent Engine erreichen beide eine Bestehensquote von 100 % in der Aufgabensuite, wobei Vertex bei den Kosten gewinnt ($1,45 vs. $2,50). Bei harness-spezifischen…

Agentische KI
Benchmark
21. Aug

RELC-Bench: Retrieval auf Langkontext-Benchmark

RELC-Bench (RELC-Bench: Retrieval auf Langkontext-Benchmark) zielt darauf ab, die Fähigkeit eines Modells zu messen, einen bestimmten numerischen Wert aus einem oder mehreren Dokumenten innerhalb seines Kontexts zu finden und zu extrahieren. Es testet, ob das Modell eine bestimmte Tatsache, die es gerade in der Eingabe gesehen hat, sich merken und abrufen kann. claude-fable-5 erzielt 97.0 %…

Agentische KI
Benchmark
21. Aug

MCP-Benchmark: Top-MCP-Server für Webzugriff

Wir haben 8 MCP-Server hinsichtlich Websuche und -extraktion sowie Browserautomatisierungsaufgaben einem Benchmark unterzogen, indem wir 4 verschiedene Aufgaben 5 Mal auf allen geeigneten MCPs ausgeführt haben. Wir haben außerdem einen Lasttest mit 250 gleichzeitigen KI-Agenten durchgeführt. *Aufgaben zur Websuche & -extraktion werden mit dem Standard-MCP-Server von Bright Data ausgeführt, Aufgaben zur Browserautomatisierung mit dem MCP…

KI
Einblick
21. Aug

LLM Parameter: GPT-5 High, Mittel, Niedrig und Minimal

Einige LLMs, wie die GPT-5-Familie von OpenAI, sind in verschiedenen Versionen verfügbar (z. B. GPT-5, GPT-5-mini und GPT-5-nano) und mit verschiedenen Parametereinstellungen, einschließlich hoch, mittel, niedrig und minimal. Im Folgenden untersuchen wir die Unterschiede zwischen diesen Modellversionen, indem wir ihre Benchmark-Leistung und die Kosten für die Durchführung der Benchmarks erfassen. Wir haben die GPT-5-Familie in…

KI
Benchmark
21. Aug

HALC-Bench: LLM Halluzination im Long-Context Retrieval Benchmark

HALC-Bench (LLM Halluzination im Long-Context Retrieval Benchmark) misst die Widerstandsfähigkeit eines großen Sprachmodells gegenüber dem Erfinden von Beweisen für eine Kennzahl, die im Zieldokument nicht existiert, indem es 3 Heuhaufen verwendet, die am Anfang, in der Mitte und am Ende des Kontextfensters des Modells platziert sind, mit 204 Fragen. claude-fable-5 beantwortete alle 204 Fallen an…

KI
Benchmark
21. Aug

Bester KI-Code-Editor: Cursor vs Windsurf vs Replit

Apps ohne Programmierkenntnisse zu erstellen, ist derzeit stark im Trend. Aber können diese Tools erfolgreich eine App erstellen und bereitstellen? Wir haben 6 KI-Code-Editoren in 10 realen Webentwicklungs-Herausforderungen einem Benchmark unterzogen. Jede Aufgabe erforderte Implementierungen wie Backend, Frontend, Authentifizierung, State Management. Wir bewerteten die Backend-Korrektheit, das Frontend-Verhalten und die kombinierte Leistung und analysierten, wie jeder…