Servizi
Contattaci
Şevval Alper

Şevval Alper

Ricercatore di intelligenza artificiale
19 Articoli
Rimani aggiornato sulle novità tecnologiche B2B.

Şevval è una ricercatrice di intelligenza artificiale presso AIMultiple. Ha maturato esperienza nella generazione di numeri pseudocasuali utilizzando sistemi caotici.

Interessi di ricerca

Şevval si concentra su strumenti di programmazione per l'intelligenza artificiale, agenti di intelligenza artificiale e tecnologie quantistiche.

Fa parte del team di benchmarking di AIMultiple, dove conduce valutazioni e fornisce approfondimenti per aiutare i lettori a comprendere le diverse tecnologie emergenti e le loro applicazioni.

Esperienza professionale

Ha contribuito all'organizzazione e alla guida dei partecipanti a tre eventi "CERN International Masterclasses - hands-on particle physics" in Turchia, collaborando con i docenti per facilitare l'apprendimento.

Preparazione

Şevval ha conseguito una laurea in Fisica presso l'Università Tecnica del Medio Oriente.

Ultimi articoli di Şevval

IA
Benchmark
14 Ago

Benchmark degli strumenti di revisione del codice IA

Con il crescente utilizzo di strumenti di codifica IA, le codebase sono diventate più soggette a vulnerabilità, il che ha aumentato la necessità di revisioni del codice efficaci. Per affrontare questo, introduciamo RevEval (AI Code Review Eval), che confronta i quattro principali strumenti di revisione del codice IA su 309 pull request provenienti da repository…

IA agentica
Benchmark
14 Ago

Benchmark delle piattaforme di agenti IA: Claude Managed Agents vs Google Vertex Agent Engine

Abbiamo confrontato 4 piattaforme di agenti IA su 3 dimensioni: completamento delle attività (10 attività di codifica × 3 esecuzioni), capacità specifiche dell'harness (steering, riconnessione, richiamo di conversazioni lunghe, gestione di file di grandi dimensioni) e costo. Claude Managed Agents e Vertex IA Agent Engine raggiungono entrambi tassi di superamento del 100% nella suite di…

IA agentica
Benchmark
14 Ago

Esecuzione di codice con MCP: un nuovo approccio all'efficienza degli agenti IA

Anthropic ha introdotto un metodo in cui gli agenti IA interagiscono con Model Context Protocol (MCP) server scrivendo codice eseguibile piuttosto che effettuare chiamate dirette agli strumenti. L'agente tratta gli strumenti come file su un computer, trova ciò di cui ha bisogno e li usa direttamente con il codice, così i dati intermedi non devono…

IA
Benchmark
12 Ago

OCR Confronto: Estrazione del testo / Accuratezza della cattura

OCR accuratezza è critica per molti processi di elaborazione documentale, e i modelli multi-modali SOTA LLM stanno ora offrendo un'alternativa al OCR. Abbiamo confrontato i principali servizi OCR in DeltOCR Bench per identificare i loro livelli di accuratezza in diversi tipi di documenti: I nomi completi dei prodotti sopra elencati e le loro versioni in…

IA
Benchmark
12 Ago

Miglior editor di codice IA: Cursor vs Windsurf vs Replit

Creare un'app senza competenze di programmazione è molto di tendenza in questo momento. Ma questi strumenti possono davvero creare e distribuire un'app con successo? Abbiamo sottoposto a benchmark 6 editor di codice IA in 10 sfide reali di sviluppo web. Ogni attività richiedeva implementazioni come backend, frontend, autenticazione e gestione dello stato. Abbiamo valutato la…

IA agentica
Benchmark
11 Ago

I Migliori Agent Harness: Claude Code vs Codex

Gli agent harness fungono da runtime di produzione per gli agenti IA, con scelte di progettazione che creano variazioni di performance tra modelli sottostanti identici. Abbiamo sottoposto a benchmark 17 agent harness su 10 attività di coding. Per isolare l'harness piuttosto che il modello, abbiamo eseguito ogni CLI agentic su un singolo modello di fondazione,…

IA
Benchmark
11 Ago

Agentic IT: Can LLMs Design a Benchmark

We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…

IA agentica
Benchmark
10 Ago

VELC-Bench: Verifica su Benchmark a Contesto Lungo

La capacità del modello di individuare una metrica specifica nel contesto, confrontare il suo valore con un'affermazione e confermarla o respingerla. Questo testa il confronto preciso di valori in condizioni di contesto lungo. Il modello deve sia recuperare il valore sia eseguire un confronto preciso. I modelli sono testati nelle seguenti finestre di contesto: claude-fable-5…

IA
Benchmark
4 Ago

Da screenshot a codice: Lovable vs v0 vs Bolt

Durante i miei 20 anni come sviluppatore software, ho guidato molti team front-end nello sviluppo di pagine basate su design ispirati da screenshot. I design possono essere trasferiti in codice utilizzando strumenti IA. Sebbene aspettarsi un trasferimento pixel-perfect sia errato allo stato attuale degli strumenti, essi possono fornire agli sviluppatori una base su cui lavorare.…

IA
Benchmark
4 Ago

Simulazione del pubblico: gli LLM possono prevedere il comportamento umano?

Nel marketing, valutare con quanta precisione gli LLM prevedono il comportamento umano è fondamentale per valutare la loro efficacia nell'anticipare le esigenze del pubblico e riconoscere i rischi di disallineamento, comunicazione inefficace o influenza non intenzionale. La simulazione del pubblico con gli LLM consente la modellazione di pubblici virtuali, aiutando le organizzazioni ad anticipare le…