Şevval Alper
Forschungsinteressen
Şevval konzentriert sich auf KI-Programmierwerkzeuge, KI-Agenten und Quantentechnologien.Sie ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und bietet Einblicke, um Lesern zu helfen, verschiedene aufstrebende Technologien und ihre Anwendungen zu verstehen.
Berufserfahrung
Sie trug zur Organisation und Betreuung der Teilnehmer bei drei Veranstaltungen “CERN International Masterclasses - hands-on particle physics” in der Türkei bei und arbeitete mit Dozierenden zusammen, um das Lernen zu unterstützen.Ausbildung
Şevval hat einen Bachelorabschluss in Physik von der Middle East Technical University.Neueste Artikel von Şevval
A-CODE-LLM Bench: Agentischer Programmier-Benchmark
Wir haben die besten Large Language Models (LLMs) bei 10 Softwareentwicklungsaufgaben mit einem agentischen CLI-Tool getestet. Wir führten ~3.500 automatisierte Validierungsschritte pro Modell sowohl auf API- als auch auf UI-Ebene durch. Jeder Alias wurde 3 Mal über 10 Aufgaben hinweg ausgeführt (30 Stichproben pro Alias, 400 Zellen pro Iteration über 40 Aliase hinweg). Weitere Details…
KI-Code-Review-Tools Benchmark
Mit dem zunehmenden Einsatz von KI-Coding-Tools sind Codebases anfälliger für Schwachstellen geworden, was den Bedarf an effektiven Code-Reviews erhöht hat. Um dem zu begegnen, stellen wir RevEval (KI Code Review Eval) vor, das die vier führenden KI-Code-Review-Tools über 309 Pull Requests aus Repositories unterschiedlicher Größe benchmarkt und ihre Leistung anhand von Beiträgen von 10 Entwicklern…
Agent-Benchmarks
Agentic IT: Können KI-Agenten einen Benchmark entwerfen
Wir haben 16 Models anhand eines Benchmark-Entwurfs in Text-zu-SQL und Tool-Calling getestet. Jedes Model erstellte einen Benchmark pro Thema, insgesamt 32 Einreichungen. Keine Einreichung erfüllte jedes Rubrik-Kriterium. Die Agenten konnten Tests erstellen und ausführen, aber keiner führte sowohl einen Leerantwort-Test als auch einen Richtigantwort-Test des eigenen Scorers vor. Text-zu-SQL wandelt eine Frage in natürlicher Sprache…
KI-Coding-Benchmark: Claude Code vs Cursor
Im KI-Coding hat sich der Markt in zwei Kategorien aufgesplittert: Agentic CLI-Tools und in IDEs eingebettete KI-Code-Editoren. Jede behauptet, die Entwicklung zu automatisieren. Nur wenige Vergleiche zeigen, wie sie sich unter identischen Arbeitslasten unterscheiden. Wir haben jeden Agenten über 10 Full-Stack-Webentwicklungsaufgaben hinweg getestet, dabei ~600 atomare Validierungsprüfungen pro Agent und mehr als 9.600 automatische Testausführungen…
VELC-Bench: Verifikation im Langkontext-Benchmark
Die Fähigkeit des Modells, eine bestimmte Metrik im Kontext zu lokalisieren, ihren Wert mit einer Behauptung zu vergleichen und sie zu bestätigen oder abzulehnen. Dies testet die feingranulare Werteübereinstimmung unter Langkontext-Bedingungen. Das Modell muss den Wert sowohl abrufen als auch einen präzisen Vergleich durchführen. Die Modelle werden in den folgenden Kontextfenstern getestet: claude-fable-5 erzielt 90,0 %…
RELC-Bench: Retrieval auf Langkontext-Benchmark
RELC-Bench (RELC-Bench: Retrieval auf Langkontext-Benchmark) zielt darauf ab, die Fähigkeit eines Modells zu messen, einen bestimmten numerischen Wert aus einem oder mehreren Dokumenten innerhalb seines Kontexts zu finden und zu extrahieren. Es testet, ob das Modell eine bestimmte Tatsache, die es gerade in der Eingabe gesehen hat, sich merken und abrufen kann. claude-fable-5 erzielt 97,0 %…
Zielgruppensimulation: Können LLMs menschliches Verhalten vorhersagen?
Im Marketing ist die Bewertung, wie genau LLMs menschliches Verhalten vorhersagen, entscheidend für die Beurteilung ihrer Wirksamkeit bei der Antizipation von Zielgruppenbedürfnissen und der Erkennung der Risiken von Fehlausrichtung, ineffektiver Kommunikation oder unbeabsichtigter Beeinflussung. Die Zielgruppensimulation mit LLMs ermöglicht die Modellierung virtueller Zielgruppen und hilft Organisationen, Reaktionen auf Inhalte oder Produkte vorherzusehen, ohne auf teure…
HALC-Bench: LLM Halluzination im Long-Context Retrieval Benchmark
HALC-Bench (LLM Halluzination im Long-Context Retrieval Benchmark) misst die Widerstandsfähigkeit eines großen Sprachmodells gegenüber dem Erfinden von Beweisen für eine Kennzahl, die im Zieldokument nicht existiert, indem es 3 Heuhaufen verwendet, die am Anfang, in der Mitte und am Ende des Kontextfensters des Modells platziert sind, mit 204 Fragen. claude-fable-5 beantwortete alle 204 Fallen an…
Codeausführung mit MCP: Ein neuer Ansatz für die Effizienz von KI-Agenten
Anthropic hat eine Methode eingeführt, bei der KI-Agenten mit Model Context Protocol (MCP) -Servern interagieren, indem sie ausführbaren Code schreiben, anstatt direkte Aufrufe an Tools zu tätigen. Der Agent behandelt Tools wie Dateien auf einem Computer, findet, was er benötigt, und nutzt sie direkt mit Code, sodass Zwischendaten nicht durch den Speicher des Modells laufen…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.