Şevval Alper
Forschungsinteressen
Şevval konzentriert sich auf KI-Programmierwerkzeuge, KI-Agenten und Quantentechnologien.Sie ist Teil des AIMultiple-Benchmark-Teams, führt Bewertungen durch und bietet Einblicke, um Lesern zu helfen, verschiedene aufstrebende Technologien und ihre Anwendungen zu verstehen.
Berufserfahrung
Sie trug zur Organisation und Betreuung der Teilnehmer bei drei Veranstaltungen “CERN International Masterclasses - hands-on particle physics” in der Türkei bei und arbeitete mit Dozierenden zusammen, um das Lernen zu unterstützen.Ausbildung
Şevval hat einen Bachelorabschluss in Physik von der Middle East Technical University.Neueste Artikel von Şevval
KI-Agenten-Plattformen-Benchmark: Claude Managed Agents vs. Google Vertex Agent Engine
Wir haben 4 KI-Agenten-Plattformen in 3 Dimensionen bewertet: Aufgabenabschluss (10 Programmieraufgaben × 3 Läufe), harness-spezifische Fähigkeiten (Steuerung, Wiederverbindung, Erinnerung an lange Konversationen, Verarbeitung großer Dateien) und Kosten. Claude Managed Agents und Vertex AI Agent Engine erreichen beide eine Bestehensquote von 100 % in der Aufgabensuite, wobei Vertex bei den Kosten gewinnt ($1,45 vs. $2,50). Bei harness-spezifischen…
MCP-Benchmark: Top-MCP-Server für Webzugriff
Wir haben 8 MCP-Server hinsichtlich Websuche und -extraktion sowie Browserautomatisierungsaufgaben einem Benchmark unterzogen, indem wir 4 verschiedene Aufgaben 5 Mal auf allen geeigneten MCPs ausgeführt haben. Wir haben außerdem einen Lasttest mit 250 gleichzeitigen KI-Agenten durchgeführt. *Aufgaben zur Websuche & -extraktion werden mit dem Standard-MCP-Server von Bright Data ausgeführt, Aufgaben zur Browserautomatisierung mit dem MCP…
LLM Parameter: GPT-5 High, Mittel, Niedrig und Minimal
Einige LLMs, wie die GPT-5-Familie von OpenAI, sind in verschiedenen Versionen verfügbar (z. B. GPT-5, GPT-5-mini und GPT-5-nano) und mit verschiedenen Parametereinstellungen, einschließlich hoch, mittel, niedrig und minimal. Im Folgenden untersuchen wir die Unterschiede zwischen diesen Modellversionen, indem wir ihre Benchmark-Leistung und die Kosten für die Durchführung der Benchmarks erfassen. Wir haben die GPT-5-Familie in…
Bester KI-Code-Editor: Cursor vs Windsurf vs Replit
Apps ohne Programmierkenntnisse zu erstellen, ist derzeit stark im Trend. Aber können diese Tools erfolgreich eine App erstellen und bereitstellen? Wir haben 6 KI-Code-Editoren in 10 realen Webentwicklungs-Herausforderungen einem Benchmark unterzogen. Jede Aufgabe erforderte Implementierungen wie Backend, Frontend, Authentifizierung, State Management. Wir bewerteten die Backend-Korrektheit, das Frontend-Verhalten und die kombinierte Leistung und analysierten, wie jeder…
Spracherkennungs-Benchmark: Deepgram vs. Whisper
Wir haben die führenden Spracherkennungsanbieter (STT) einem Benchmark unterzogen, mit besonderem Fokus auf Anwendungen im Gesundheitswesen. Unser Benchmark verwendete reale Beispiele, um die Transkriptionsgenauigkeit in medizinischen Kontexten zu bewerten, wo Präzision entscheidend ist. Basierend auf den Ergebnissen sowohl der Wortfehlerrate (WER) als auch der Zeichenfehlerrate (CER) zeigt GPT-4o-transcribe die höchste Transkriptionsgenauigkeit unter allen bewerteten Spracherkennungssystemen.…
OCR-Benchmark: Textextraktion / Erfassungsgenauigkeit
Die Genauigkeit von OCR ist für viele Dokumentenverarbeitungsaufgaben entscheidend, und multimodale SOTA-LLMs bieten jetzt eine Alternative zu OCR. Wir haben führende OCR-Dienste im DeltOCR-Benchmark getestet, um ihre Genauigkeitsstufen bei verschiedenen Dokumententypen zu ermitteln: Die vollständigen Namen der oben genannten Produkte und ihre zum Stand November 2025 verwendeten Versionen sind unten aufgeführt. Unsere Studie umfasst sowohl…
Quantum Annealing: Praktisches Quantencomputing
Quantum Annealing ist eine vielversprechende Quantentechnologie für Unternehmen mit dringenden Optimierungsproblemen, die herkömmliche Computer nicht schnell lösen können. Es kann eingesetzt werden, um Optimierungsprobleme effektiver zu lösen als herkömmliche Computer. Es wird jedoch noch hauptsächlich in der akademischen Forschung eingesetzt, und weitere F&E ist erforderlich, um kommerzielle Quantum Annealer zu entwickeln. Es gibt verschiedene Ansätze…
Top-Agenten-Harnische: Claude Code vs Codex
Agenten-Harnische dienen als Produktionslaufzeitumgebung für KI-Agenten, wobei Designentscheidungen zu Leistungsunterschieden bei identischen zugrunde liegenden Modellen führen. Wir haben 17 Agenten-Harnische anhand von 10 Programmieraufgaben gebenchmarkt. Um den Harnisch und nicht das Modell zu isolieren, haben wir jede agentische CLI auf einem einzelnen Foundation-Modell, Claude Sonnet 4.6 (nicht-schlussfolgernd), und KI-Code-Editoren mit Claude Opus 4.6 ausgeführt, sodass…
Top 8 Open-Source-KI-Coding-Agenten
In früheren Evaluierungen haben wir sowohl Open-Source- als auch proprietäre Agentic CLIs verglichen und dabei den Fokus auf ihre Leistung bei Webentwicklungsaufgaben gelegt. Einige Open-Source-Agenten schnitten dabei genauso erfolgreich ab wie die kostenpflichtigen Optionen. Daher haben wir auch die besten Open-Source-Coding-Agenten für Nutzer mit Datenschutzbedenken aufgelistet. Informationen zur Methodik finden Sie im KI-Coding-Benchmark. Weitere Details…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.