Dienstleistungen
Kontaktieren
Şevval Alper

Şevval Alper

KI-Forscher
19 Artikel
Bleiben Sie über B2B-Technologie auf dem Laufenden

Şevval ist KI-Forscherin bei AIMultiple. Sie verfügt über Forschungserfahrung im Bereich der Pseudozufallszahlengenerierung mithilfe chaotischer Systeme.

Forschungsschwerpunkte

Şevval konzentriert sich auf KI-Codierungswerkzeuge, KI-Agenten und Quantentechnologien.

Sie ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und liefert Erkenntnisse, um den Lesern das Verständnis verschiedener neuer Technologien und ihrer Anwendungen zu erleichtern.

Berufserfahrung

Sie wirkte an der Organisation und Betreuung von Teilnehmern an drei „CERN International Masterclasses - hands-on particle physics“-Veranstaltungen in der Türkei mit und arbeitete dabei eng mit den Dozenten zusammen, um das Lernen zu erleichtern.

Ausbildung

Şevval besitzt einen Bachelor-Abschluss in Physik von der Technischen Universität des Nahen Ostens.

Neueste Artikel von Şevval

KI
Benchmark
14. Aug

KI-Code-Review-Tools Benchmark

Mit dem zunehmenden Einsatz von KI-Coding-Tools sind Codebases anfälliger für Schwachstellen geworden, was den Bedarf an effektiven Code-Reviews erhöht hat. Um dem zu begegnen, stellen wir RevEval (KI Code Review Eval) vor, das die vier führenden KI-Code-Review-Tools über 309 Pull Requests aus Repositories unterschiedlicher Größe benchmarkt und ihre Leistung anhand von Beiträgen von 10 Entwicklern…

Agentische KI
Benchmark
14. Aug

KI-Agenten-Plattformen-Benchmark: Claude Managed Agents vs. Google Vertex Agent Engine

Wir haben 4 KI-Agenten-Plattformen in 3 Dimensionen bewertet: Aufgabenabschluss (10 Programmieraufgaben × 3 Läufe), harness-spezifische Fähigkeiten (Steuerung, Wiederverbindung, Erinnerung an lange Konversationen, Verarbeitung großer Dateien) und Kosten. Claude Managed Agents und Vertex KI Agent Engine erreichen beide eine Bestehensquote von 100 % in der Aufgabensuite, wobei Vertex bei den Kosten gewinnt ($1.45 vs. $2.50). Bei harness-spezifischen…

Agentische KI
Benchmark
14. Aug

Code-Ausführung mit MCP: Ein neuer Ansatz für KI-Agenten-Effizienz

Anthropic stellte eine Methode vor, bei der KI-Agenten mit Model Context Protocol (MCP) -Servern interagieren, indem sie ausführbaren Code schreiben, anstatt direkte Aufrufe an Tools zu tätigen. Der Agent behandelt Tools als Dateien auf einem Computer, findet, was er benötigt, und verwendet sie direkt mit Code, sodass Zwischendaten nicht durch den Speicher des Modells laufen…

KI
Benchmark
12. Aug

OCR-Benchmark: Textextraktion / Erfassungsgenauigkeit

Die Genauigkeit von OCR ist für viele Dokumentenverarbeitungsaufgaben entscheidend, und multimodale SOTA-LLMs bieten jetzt eine Alternative zu OCR. Wir haben führende OCR-Dienste im DeltOCR-Benchmark getestet, um ihre Genauigkeitsstufen bei verschiedenen Dokumententypen zu ermitteln: Die vollständigen Namen der oben genannten Produkte und ihre zum Stand November 2025 verwendeten Versionen sind unten aufgeführt. Unsere Studie umfasst sowohl…

KI
Benchmark
12. Aug

Bester KI-Code-Editor: Cursor vs Windsurf vs Replit

Apps ohne Programmierkenntnisse zu erstellen, ist derzeit stark im Trend. Aber können diese Tools erfolgreich eine App erstellen und bereitstellen? Wir haben 6 KI-Code-Editoren in 10 realen Webentwicklungs-Herausforderungen einem Benchmark unterzogen. Jede Aufgabe erforderte Implementierungen wie Backend, Frontend, Authentifizierung, State Management. Wir bewerteten die Backend-Korrektheit, das Frontend-Verhalten und die kombinierte Leistung und analysierten, wie jeder…

Agentische KI
Benchmark
11. Aug

Top-Agenten-Harnische: Claude Code vs Codex

Agenten-Harnische dienen als Produktionslaufzeitumgebung für KI-Agenten, wobei Designentscheidungen zu Leistungsunterschieden bei identischen zugrunde liegenden Modellen führen. Wir haben 17 Agenten-Harnische anhand von 10 Programmieraufgaben gebenchmarkt. Um den Harnisch und nicht das Modell zu isolieren, haben wir jede agentische CLI auf einem einzelnen Foundation-Modell, Claude Sonnet 4.6 (nicht-schlussfolgernd), und KI-Code-Editoren mit Claude Opus 4.6 ausgeführt, sodass…

KI
Benchmark
11. Aug

Agentic IT: Can LLMs Design a Benchmark

We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…

Agentische KI
Benchmark
10. Aug

VELC-Bench: Verifikation im Langkontext-Benchmark

Die Fähigkeit des Modells, eine bestimmte Metrik im Kontext zu lokalisieren, ihren Wert mit einer Behauptung zu vergleichen und sie zu bestätigen oder abzulehnen. Dies testet die feingranulare Werteübereinstimmung unter Langkontext-Bedingungen. Das Modell muss den Wert sowohl abrufen als auch einen präzisen Vergleich durchführen. Die Modelle werden in den folgenden Kontextfenstern getestet: claude-fable-5 erzielt 90.0 %…

KI
Benchmark
4. Aug

Screenshot zu Code: Lovable vs v0 vs Bolt

Während meiner 20 Jahre als Softwareentwickler habe ich viele Frontend-Teams geleitet, die Seiten auf der Grundlage von Designs entwickelten, die von Screenshots inspiriert waren. Designs können mithilfe von KI-Tools in Code umgewandelt werden. Obwohl die Erwartung einer pixelgenauen Übertragung beim aktuellen Stand der Tools falsch ist, können sie Entwicklern eine Grundlage bieten, auf der sie…

KI
Benchmark
4. Aug

Zielgruppensimulation: Können LLMs menschliches Verhalten vorhersagen?

Im Marketing ist die Bewertung, wie genau LLMs menschliches Verhalten vorhersagen, entscheidend für die Beurteilung ihrer Wirksamkeit bei der Antizipation von Zielgruppenbedürfnissen und der Erkennung der Risiken von Fehlausrichtung, ineffektiver Kommunikation oder unbeabsichtigter Beeinflussung. Die Zielgruppensimulation mit LLMs ermöglicht die Modellierung virtueller Zielgruppen und hilft Organisationen, Reaktionen auf Inhalte oder Produkte vorherzusehen, ohne auf teure…