Şevval Alper
Forschungsinteressen
Şevval konzentriert sich auf KI-Programmierwerkzeuge, KI-Agenten und Quantentechnologien.Sie ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und bietet Einblicke, um Lesern zu helfen, verschiedene aufstrebende Technologien und ihre Anwendungen zu verstehen.
Berufserfahrung
Sie trug zur Organisation und Betreuung der Teilnehmer bei drei Veranstaltungen “CERN International Masterclasses - hands-on particle physics” in der Türkei bei und arbeitete mit Dozierenden zusammen, um das Lernen zu unterstützen.Ausbildung
Şevval hat einen Bachelorabschluss in Physik von der Middle East Technical University.Neueste Artikel von Şevval
Zielgruppensimulation: Können LLMs menschliches Verhalten vorhersagen?
Im Marketing ist die Bewertung, wie genau LLMs menschliches Verhalten vorhersagen, entscheidend für die Beurteilung ihrer Wirksamkeit bei der Antizipation von Zielgruppenbedürfnissen und der Erkennung der Risiken von Fehlausrichtung, ineffektiver Kommunikation oder unbeabsichtigter Beeinflussung. Die Zielgruppensimulation mit LLMs ermöglicht die Modellierung virtueller Zielgruppen und hilft Organisationen, Reaktionen auf Inhalte oder Produkte vorherzusehen, ohne auf teure…
KI-Agenten: Operator vs Browser Use vs Project Mariner
KI-Agenten werden zunehmend als durchgängige digitale Arbeitskräfte vermarktet, aber die Leistung in der Praxis kann je nach Aufgabe, Tools und Ausführungsumgebung stark variieren. Um zu verstehen, was diese Systeme heute wirklich leisten können, haben wir praktische Benchmarks in realistischen Geschäftsszenarien durchgeführt. Wir haben mehr als 40 Stunden damit verbracht, die Top 5 KI-Agenten zu testen,…
Code-Ausführung mit MCP: Ein neuer Ansatz für KI-Agenten-Effizienz
Anthropic stellte eine Methode vor, bei der KI-Agenten mit Model Context Protocol (MCP) -Servern interagieren, indem sie ausführbaren Code schreiben, anstatt direkte Aufrufe an Tools zu tätigen. Der Agent behandelt Tools als Dateien auf einem Computer, findet, was er benötigt, und verwendet sie direkt mit Code, sodass Zwischendaten nicht durch den Speicher des Modells laufen…
KI-Coding-Benchmark: Claude Code vs Cursor
Im KI-Coding hat sich der Markt in zwei Kategorien zersplittert: Agentic CLI-Tools und KI-Code-Editoren, die in IDEs eingebettet sind. Jede behauptet, die Entwicklung zu automatisieren. Wenige Vergleiche zeigen, wie sie sich unter identischen Arbeitslasten unterscheiden. Wir haben jeden Agenten anhand von 10 Full-Stack-Webentwicklungsaufgaben bewertet und dabei ~600 atomare Validierungsprüfungen pro Agent und mehr als 9.600…
KI-Agenten-Plattformen-Benchmark: Claude Managed Agents vs. Google Vertex Agent Engine
Wir haben 4 KI-Agenten-Plattformen in 3 Dimensionen bewertet: Aufgabenabschluss (10 Programmieraufgaben × 3 Läufe), harness-spezifische Fähigkeiten (Steuerung, Wiederverbindung, Erinnerung an lange Konversationen, Verarbeitung großer Dateien) und Kosten. Claude Managed Agents und Vertex KI Agent Engine erreichen beide eine Bestehensquote von 100 % in der Aufgabensuite, wobei Vertex bei den Kosten gewinnt ($1,45 vs. $2,50). Bei harness-spezifischen…
RELC-Bench: Retrieval auf Langkontext-Benchmark
RELC-Bench (RELC-Bench: Retrieval auf Langkontext-Benchmark) zielt darauf ab, die Fähigkeit eines Modells zu messen, einen bestimmten numerischen Wert aus einem oder mehreren Dokumenten innerhalb seines Kontexts zu finden und zu extrahieren. Es testet, ob das Modell eine bestimmte Tatsache, die es gerade in der Eingabe gesehen hat, sich merken und abrufen kann. claude-fable-5 erzielt 97.0 %…
MCP-Benchmark: Top-MCP-Server für Webzugriff
Wir haben 8 MCP-Server hinsichtlich Websuche und -extraktion sowie Browserautomatisierungsaufgaben einem Benchmark unterzogen, indem wir 4 verschiedene Aufgaben 5 Mal auf allen geeigneten MCPs ausgeführt haben. Wir haben außerdem einen Lasttest mit 250 gleichzeitigen KI-Agenten durchgeführt. *Aufgaben zur Websuche & -extraktion werden mit dem Standard-MCP-Server von Bright Data ausgeführt, Aufgaben zur Browserautomatisierung mit dem MCP…
LLM Parameter: GPT-5 High, Mittel, Niedrig und Minimal
Einige LLMs, wie die GPT-5-Familie von OpenAI, sind in verschiedenen Versionen verfügbar (z. B. GPT-5, GPT-5-mini und GPT-5-nano) und mit verschiedenen Parametereinstellungen, einschließlich hoch, mittel, niedrig und minimal. Im Folgenden untersuchen wir die Unterschiede zwischen diesen Modellversionen, indem wir ihre Benchmark-Leistung und die Kosten für die Durchführung der Benchmarks erfassen. Wir haben die GPT-5-Familie in…
HALC-Bench: LLM Halluzination im Long-Context Retrieval Benchmark
HALC-Bench (LLM Halluzination im Long-Context Retrieval Benchmark) misst die Widerstandsfähigkeit eines großen Sprachmodells gegenüber dem Erfinden von Beweisen für eine Kennzahl, die im Zieldokument nicht existiert, indem es 3 Heuhaufen verwendet, die am Anfang, in der Mitte und am Ende des Kontextfensters des Modells platziert sind, mit 204 Fragen. claude-fable-5 beantwortete alle 204 Fallen an…
Bester KI-Code-Editor: Cursor vs Windsurf vs Replit
Apps ohne Programmierkenntnisse zu erstellen, ist derzeit stark im Trend. Aber können diese Tools erfolgreich eine App erstellen und bereitstellen? Wir haben 6 KI-Code-Editoren in 10 realen Webentwicklungs-Herausforderungen einem Benchmark unterzogen. Jede Aufgabe erforderte Implementierungen wie Backend, Frontend, Authentifizierung, State Management. Wir bewerteten die Backend-Korrektheit, das Frontend-Verhalten und die kombinierte Leistung und analysierten, wie jeder…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.