Şevval Alper
Şevval è una ricercatrice di intelligenza artificiale presso AIMultiple. Ha maturato esperienza nella generazione di numeri pseudocasuali utilizzando sistemi caotici.
Interessi di ricerca
Şevval si concentra su strumenti di programmazione per l'intelligenza artificiale, agenti di intelligenza artificiale e tecnologie quantistiche.
Fa parte del team di benchmarking di AIMultiple, dove conduce valutazioni e fornisce approfondimenti per aiutare i lettori a comprendere le diverse tecnologie emergenti e le loro applicazioni.
Esperienza professionale
Ha contribuito all'organizzazione e alla guida dei partecipanti a tre eventi "CERN International Masterclasses - hands-on particle physics" in Turchia, collaborando con i docenti per facilitare l'apprendimento.
Preparazione
Şevval ha conseguito una laurea in Fisica presso l'Università Tecnica del Medio Oriente.
Ultimi articoli di Şevval
Benchmark degli strumenti di revisione del codice IA
Con il crescente utilizzo di strumenti di codifica IA, le codebase sono diventate più soggette a vulnerabilità, il che ha aumentato la necessità di revisioni del codice efficaci. Per affrontare questo, introduciamo RevEval (AI Code Review Eval), che confronta i quattro principali strumenti di revisione del codice IA su 309 pull request provenienti da repository…
Benchmark delle piattaforme di agenti IA: Claude Managed Agents vs Google Vertex Agent Engine
Abbiamo confrontato 4 piattaforme di agenti IA su 3 dimensioni: completamento delle attività (10 attività di codifica × 3 esecuzioni), capacità specifiche dell'harness (steering, riconnessione, richiamo di conversazioni lunghe, gestione di file di grandi dimensioni) e costo. Claude Managed Agents e Vertex IA Agent Engine raggiungono entrambi tassi di superamento del 100% nella suite di…
Esecuzione di codice con MCP: un nuovo approccio all'efficienza degli agenti IA
Anthropic ha introdotto un metodo in cui gli agenti IA interagiscono con Model Context Protocol (MCP) server scrivendo codice eseguibile piuttosto che effettuare chiamate dirette agli strumenti. L'agente tratta gli strumenti come file su un computer, trova ciò di cui ha bisogno e li usa direttamente con il codice, così i dati intermedi non devono…
OCR Confronto: Estrazione del testo / Accuratezza della cattura
OCR accuratezza è critica per molti processi di elaborazione documentale, e i modelli multi-modali SOTA LLM stanno ora offrendo un'alternativa al OCR. Abbiamo confrontato i principali servizi OCR in DeltOCR Bench per identificare i loro livelli di accuratezza in diversi tipi di documenti: I nomi completi dei prodotti sopra elencati e le loro versioni in…
Miglior editor di codice IA: Cursor vs Windsurf vs Replit
Creare un'app senza competenze di programmazione è molto di tendenza in questo momento. Ma questi strumenti possono davvero creare e distribuire un'app con successo? Abbiamo sottoposto a benchmark 6 editor di codice IA in 10 sfide reali di sviluppo web. Ogni attività richiedeva implementazioni come backend, frontend, autenticazione e gestione dello stato. Abbiamo valutato la…
I Migliori Agent Harness: Claude Code vs Codex
Gli agent harness fungono da runtime di produzione per gli agenti IA, con scelte di progettazione che creano variazioni di performance tra modelli sottostanti identici. Abbiamo sottoposto a benchmark 17 agent harness su 10 attività di coding. Per isolare l'harness piuttosto che il modello, abbiamo eseguito ogni CLI agentic su un singolo modello di fondazione,…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
VELC-Bench: Verifica su Benchmark a Contesto Lungo
La capacità del modello di individuare una metrica specifica nel contesto, confrontare il suo valore con un'affermazione e confermarla o respingerla. Questo testa il confronto preciso di valori in condizioni di contesto lungo. Il modello deve sia recuperare il valore sia eseguire un confronto preciso. I modelli sono testati nelle seguenti finestre di contesto: claude-fable-5…
Da screenshot a codice: Lovable vs v0 vs Bolt
Durante i miei 20 anni come sviluppatore software, ho guidato molti team front-end nello sviluppo di pagine basate su design ispirati da screenshot. I design possono essere trasferiti in codice utilizzando strumenti IA. Sebbene aspettarsi un trasferimento pixel-perfect sia errato allo stato attuale degli strumenti, essi possono fornire agli sviluppatori una base su cui lavorare.…
Simulazione del pubblico: gli LLM possono prevedere il comportamento umano?
Nel marketing, valutare con quanta precisione gli LLM prevedono il comportamento umano è fondamentale per valutare la loro efficacia nell'anticipare le esigenze del pubblico e riconoscere i rischi di disallineamento, comunicazione inefficace o influenza non intenzionale. La simulazione del pubblico con gli LLM consente la modellazione di pubblici virtuali, aiutando le organizzazioni ad anticipare le…
Newsletter AI Multiple
Una email gratuita a settimana con le ultime notizie tecnologiche B2B e approfondimenti di esperti per dare impulso alla tua azienda.