Şevval Alper
Şevval ist KI-Forscherin bei AIMultiple. Sie verfügt über Forschungserfahrung im Bereich der Pseudozufallszahlengenerierung mithilfe chaotischer Systeme.
Forschungsschwerpunkte
Şevval konzentriert sich auf KI-Codierungswerkzeuge, KI-Agenten und Quantentechnologien.
Sie ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und liefert Erkenntnisse, um den Lesern das Verständnis verschiedener neuer Technologien und ihrer Anwendungen zu erleichtern.
Berufserfahrung
Sie wirkte an der Organisation und Betreuung von Teilnehmern an drei „CERN International Masterclasses - hands-on particle physics“-Veranstaltungen in der Türkei mit und arbeitete dabei eng mit den Dozenten zusammen, um das Lernen zu erleichtern.
Ausbildung
Şevval besitzt einen Bachelor-Abschluss in Physik von der Technischen Universität des Nahen Ostens.
Neueste Artikel von Şevval
KI-Code-Review-Tools Benchmark
Mit dem zunehmenden Einsatz von KI-Coding-Tools sind Codebases anfälliger für Schwachstellen geworden, was den Bedarf an effektiven Code-Reviews erhöht hat. Um dem zu begegnen, stellen wir RevEval (KI Code Review Eval) vor, das die vier führenden KI-Code-Review-Tools über 309 Pull Requests aus Repositories unterschiedlicher Größe benchmarkt und ihre Leistung anhand von Beiträgen von 10 Entwicklern…
KI-Agenten-Plattformen-Benchmark: Claude Managed Agents vs. Google Vertex Agent Engine
Wir haben 4 KI-Agenten-Plattformen in 3 Dimensionen bewertet: Aufgabenabschluss (10 Programmieraufgaben × 3 Läufe), harness-spezifische Fähigkeiten (Steuerung, Wiederverbindung, Erinnerung an lange Konversationen, Verarbeitung großer Dateien) und Kosten. Claude Managed Agents und Vertex KI Agent Engine erreichen beide eine Bestehensquote von 100 % in der Aufgabensuite, wobei Vertex bei den Kosten gewinnt ($1.45 vs. $2.50). Bei harness-spezifischen…
Code-Ausführung mit MCP: Ein neuer Ansatz für KI-Agenten-Effizienz
Anthropic stellte eine Methode vor, bei der KI-Agenten mit Model Context Protocol (MCP) -Servern interagieren, indem sie ausführbaren Code schreiben, anstatt direkte Aufrufe an Tools zu tätigen. Der Agent behandelt Tools als Dateien auf einem Computer, findet, was er benötigt, und verwendet sie direkt mit Code, sodass Zwischendaten nicht durch den Speicher des Modells laufen…
OCR-Benchmark: Textextraktion / Erfassungsgenauigkeit
Die Genauigkeit von OCR ist für viele Dokumentenverarbeitungsaufgaben entscheidend, und multimodale SOTA-LLMs bieten jetzt eine Alternative zu OCR. Wir haben führende OCR-Dienste im DeltOCR-Benchmark getestet, um ihre Genauigkeitsstufen bei verschiedenen Dokumententypen zu ermitteln: Die vollständigen Namen der oben genannten Produkte und ihre zum Stand November 2025 verwendeten Versionen sind unten aufgeführt. Unsere Studie umfasst sowohl…
Bester KI-Code-Editor: Cursor vs Windsurf vs Replit
Apps ohne Programmierkenntnisse zu erstellen, ist derzeit stark im Trend. Aber können diese Tools erfolgreich eine App erstellen und bereitstellen? Wir haben 6 KI-Code-Editoren in 10 realen Webentwicklungs-Herausforderungen einem Benchmark unterzogen. Jede Aufgabe erforderte Implementierungen wie Backend, Frontend, Authentifizierung, State Management. Wir bewerteten die Backend-Korrektheit, das Frontend-Verhalten und die kombinierte Leistung und analysierten, wie jeder…
Top-Agenten-Harnische: Claude Code vs Codex
Agenten-Harnische dienen als Produktionslaufzeitumgebung für KI-Agenten, wobei Designentscheidungen zu Leistungsunterschieden bei identischen zugrunde liegenden Modellen führen. Wir haben 17 Agenten-Harnische anhand von 10 Programmieraufgaben gebenchmarkt. Um den Harnisch und nicht das Modell zu isolieren, haben wir jede agentische CLI auf einem einzelnen Foundation-Modell, Claude Sonnet 4.6 (nicht-schlussfolgernd), und KI-Code-Editoren mit Claude Opus 4.6 ausgeführt, sodass…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
VELC-Bench: Verifikation im Langkontext-Benchmark
Die Fähigkeit des Modells, eine bestimmte Metrik im Kontext zu lokalisieren, ihren Wert mit einer Behauptung zu vergleichen und sie zu bestätigen oder abzulehnen. Dies testet die feingranulare Werteübereinstimmung unter Langkontext-Bedingungen. Das Modell muss den Wert sowohl abrufen als auch einen präzisen Vergleich durchführen. Die Modelle werden in den folgenden Kontextfenstern getestet: claude-fable-5 erzielt 90.0 %…
Screenshot zu Code: Lovable vs v0 vs Bolt
Während meiner 20 Jahre als Softwareentwickler habe ich viele Frontend-Teams geleitet, die Seiten auf der Grundlage von Designs entwickelten, die von Screenshots inspiriert waren. Designs können mithilfe von KI-Tools in Code umgewandelt werden. Obwohl die Erwartung einer pixelgenauen Übertragung beim aktuellen Stand der Tools falsch ist, können sie Entwicklern eine Grundlage bieten, auf der sie…
Zielgruppensimulation: Können LLMs menschliches Verhalten vorhersagen?
Im Marketing ist die Bewertung, wie genau LLMs menschliches Verhalten vorhersagen, entscheidend für die Beurteilung ihrer Wirksamkeit bei der Antizipation von Zielgruppenbedürfnissen und der Erkennung der Risiken von Fehlausrichtung, ineffektiver Kommunikation oder unbeabsichtigter Beeinflussung. Die Zielgruppensimulation mit LLMs ermöglicht die Modellierung virtueller Zielgruppen und hilft Organisationen, Reaktionen auf Inhalte oder Produkte vorherzusehen, ohne auf teure…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.