Premium
Dienstleistungen
Premium
Şevval Alper

Şevval Alper

KI-Forscherin
19 Artikel
Bleiben Sie über B2B-Technologie auf dem Laufenden
Şevval ist KI-Forscherin bei AIMultiple. Sie hat bereits Forschungserfahrung in der Erzeugung von Pseudozufallszahlen mithilfe chaotischer Systeme.

Forschungsinteressen

Şevval konzentriert sich auf KI-Programmierwerkzeuge, KI-Agenten und Quantentechnologien.

Sie ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und bietet Einblicke, um Lesern zu helfen, verschiedene aufstrebende Technologien und ihre Anwendungen zu verstehen.

Berufserfahrung

Sie trug zur Organisation und Betreuung der Teilnehmer bei drei Veranstaltungen “CERN International Masterclasses - hands-on particle physics” in der Türkei bei und arbeitete mit Dozierenden zusammen, um das Lernen zu unterstützen.

Ausbildung

Şevval hat einen Bachelorabschluss in Physik von der Middle East Technical University.

Neueste Artikel von Şevval

Agentische KI
Benchmark
22. Sep

A-CODE-LLM Bench: Agentischer Programmier-Benchmark

Wir haben die besten Large Language Models (LLMs) bei 10 Softwareentwicklungsaufgaben mit einem agentischen CLI-Tool getestet. Wir führten ~3.500 automatisierte Validierungsschritte pro Modell sowohl auf API- als auch auf UI-Ebene durch. Jeder Alias wurde 3 Mal über 10 Aufgaben hinweg ausgeführt (30 Stichproben pro Alias, 400 Zellen pro Iteration über 40 Aliase hinweg). Weitere Details…

KI
Benchmark
22. Sep

KI-Code-Review-Tools Benchmark

Mit dem zunehmenden Einsatz von KI-Coding-Tools sind Codebases anfälliger für Schwachstellen geworden, was den Bedarf an effektiven Code-Reviews erhöht hat. Um dem zu begegnen, stellen wir RevEval (KI Code Review Eval) vor, das die vier führenden KI-Code-Review-Tools über 309 Pull Requests aus Repositories unterschiedlicher Größe benchmarkt und ihre Leistung anhand von Beiträgen von 10 Entwicklern…

Agentische KI
21. Sep

Agent-Benchmarks

KI
Benchmark
18. Sep

Agentic IT: Können KI-Agenten einen Benchmark entwerfen

Wir haben 16 Models anhand eines Benchmark-Entwurfs in Text-zu-SQL und Tool-Calling getestet. Jedes Model erstellte einen Benchmark pro Thema, insgesamt 32 Einreichungen. Keine Einreichung erfüllte jedes Rubrik-Kriterium. Die Agenten konnten Tests erstellen und ausführen, aber keiner führte sowohl einen Leerantwort-Test als auch einen Richtigantwort-Test des eigenen Scorers vor. Text-zu-SQL wandelt eine Frage in natürlicher Sprache…

KI
Benchmark
16. Sep

KI-Coding-Benchmark: Claude Code vs Cursor

Im KI-Coding hat sich der Markt in zwei Kategorien aufgesplittert: Agentic CLI-Tools und in IDEs eingebettete KI-Code-Editoren. Jede behauptet, die Entwicklung zu automatisieren. Nur wenige Vergleiche zeigen, wie sie sich unter identischen Arbeitslasten unterscheiden. Wir haben jeden Agenten über 10 Full-Stack-Webentwicklungsaufgaben hinweg getestet, dabei ~600 atomare Validierungsprüfungen pro Agent und mehr als 9.600 automatische Testausführungen…

Agentische KI
Benchmark
15. Sep

VELC-Bench: Verifikation im Langkontext-Benchmark

Die Fähigkeit des Modells, eine bestimmte Metrik im Kontext zu lokalisieren, ihren Wert mit einer Behauptung zu vergleichen und sie zu bestätigen oder abzulehnen. Dies testet die feingranulare Werteübereinstimmung unter Langkontext-Bedingungen. Das Modell muss den Wert sowohl abrufen als auch einen präzisen Vergleich durchführen. Die Modelle werden in den folgenden Kontextfenstern getestet: claude-fable-5 erzielt 90,0 %…

Agentische KI
Benchmark
15. Sep

RELC-Bench: Retrieval auf Langkontext-Benchmark

RELC-Bench (RELC-Bench: Retrieval auf Langkontext-Benchmark) zielt darauf ab, die Fähigkeit eines Modells zu messen, einen bestimmten numerischen Wert aus einem oder mehreren Dokumenten innerhalb seines Kontexts zu finden und zu extrahieren. Es testet, ob das Modell eine bestimmte Tatsache, die es gerade in der Eingabe gesehen hat, sich merken und abrufen kann. claude-fable-5 erzielt 97,0 %…

KI
Benchmark
15. Sep

Zielgruppensimulation: Können LLMs menschliches Verhalten vorhersagen?

Im Marketing ist die Bewertung, wie genau LLMs menschliches Verhalten vorhersagen, entscheidend für die Beurteilung ihrer Wirksamkeit bei der Antizipation von Zielgruppenbedürfnissen und der Erkennung der Risiken von Fehlausrichtung, ineffektiver Kommunikation oder unbeabsichtigter Beeinflussung. Die Zielgruppensimulation mit LLMs ermöglicht die Modellierung virtueller Zielgruppen und hilft Organisationen, Reaktionen auf Inhalte oder Produkte vorherzusehen, ohne auf teure…

KI
Benchmark
15. Sep

HALC-Bench: LLM Halluzination im Long-Context Retrieval Benchmark

HALC-Bench (LLM Halluzination im Long-Context Retrieval Benchmark) misst die Widerstandsfähigkeit eines großen Sprachmodells gegenüber dem Erfinden von Beweisen für eine Kennzahl, die im Zieldokument nicht existiert, indem es 3 Heuhaufen verwendet, die am Anfang, in der Mitte und am Ende des Kontextfensters des Modells platziert sind, mit 204 Fragen. claude-fable-5 beantwortete alle 204 Fallen an…

Agentische KI
Benchmark
11. Sep

Codeausführung mit MCP: Ein neuer Ansatz für die Effizienz von KI-Agenten

Anthropic hat eine Methode eingeführt, bei der KI-Agenten mit Model Context Protocol (MCP) -Servern interagieren, indem sie ausführbaren Code schreiben, anstatt direkte Aufrufe an Tools zu tätigen. Der Agent behandelt Tools wie Dateien auf einem Computer, findet, was er benötigt, und nutzt sie direkt mit Code, sodass Zwischendaten nicht durch den Speicher des Modells laufen…