Şevval Alper
Interessi di ricerca
Şevval si concentra su strumenti di programmazione IA, agenti IA e tecnologie quantistiche.Fa parte del team benchmark di AIMultiple, conducendo valutazioni e fornendo approfondimenti per aiutare i lettori a comprendere varie tecnologie emergenti e le loro applicazioni.
Esperienza professionale
Ha contribuito all'organizzazione e alla guida dei partecipanti in tre eventi “CERN International Masterclasses - hands-on particle physics” in Turchia, collaborando con il corpo docente per facilitare l'apprendimento.Formazione
Şevval ha conseguito una laurea triennale in Fisica presso la Middle East Technical University.Ultimi articoli di Şevval
A-CODE-LLM Bench: Benchmark di Codifica Agentica
Abbiamo testato i migliori Large Language Models (LLM) su 10 attività di sviluppo software utilizzando uno strumento CLI agentico. Abbiamo eseguito circa 3.500 passaggi di validazione automatizzati per modello sia a livello API che UI. Ogni alias è stato eseguito 3 volte su 10 attività (30 campioni per alias, 400 celle per iterazione su 40…
Benchmark degli strumenti di revisione del codice IA
Con il crescente utilizzo di strumenti di codifica IA, le codebase sono diventate più soggette a vulnerabilità, il che ha aumentato la necessità di revisioni del codice efficaci. Per affrontare questo, introduciamo RevEval (AI Code Review Eval), che confronta i quattro principali strumenti di revisione del codice IA su 309 pull request provenienti da repository…
Benchmark degli agenti
IT agentico: gli agenti IA possono progettare un benchmark
Abbiamo testato 16 modelli sulla progettazione di un benchmark in text-to-SQL e tool calling. Ogni modello ha creato un benchmark per argomento, per un totale di 32 proposte. Nessuna proposta ha superato ogni criterio della rubrica. Gli agenti sono riusciti a creare ed eseguire test, ma nessuno ha dimostrato sia un test con risposta vuota…
Benchmark di codifica IA: Claude Code vs Cursor
Nella codifica IA, il mercato si è frammentato in due categorie: strumenti CLI agentici e editor di codice IA integrati negli IDE. Ognuno afferma di automatizzare lo sviluppo. Pochi confronti mostrano come differiscono sotto carichi di lavoro identici. Abbiamo confrontato ciascun agente su 10 attività di sviluppo web full-stack, eseguendo ~600 controlli di validazione atomica…
VELC-Bench: Verifica su Benchmark a Contesto Lungo
La capacità del modello di individuare una metrica specifica nel contesto, confrontare il suo valore con un'affermazione e confermarla o respingerla. Questo testa il confronto preciso di valori in condizioni di contesto lungo. Il modello deve sia recuperare il valore sia eseguire un confronto preciso. I modelli sono testati nelle seguenti finestre di contesto: claude-fable-5…
RELC-Bench: Benchmark di recupero su contesto lungo
RELC-Bench (RELC-Bench: Benchmark di recupero su contesto lungo) mira a misurare la capacità di un modello di trovare ed estrarre un valore numerico specifico da uno o più documenti all'interno del suo contesto. Verifica se il modello è in grado di ricordare e recuperare un fatto specifico che ha appena visto nell'input. claude-fable-5 ottiene un…
Simulazione del pubblico: gli LLM possono prevedere il comportamento umano?
Nel marketing, valutare con quanta precisione gli LLM prevedono il comportamento umano è fondamentale per valutare la loro efficacia nell'anticipare le esigenze del pubblico e riconoscere i rischi di disallineamento, comunicazione inefficace o influenza non intenzionale. La simulazione del pubblico con gli LLM consente la modellazione di pubblici virtuali, aiutando le organizzazioni ad anticipare le…
HALC-Bench: LLM Allucinazione su benchmark di recupero a lungo contesto
HALC-Bench (benchmark di allucinazione di LLM su recupero a lungo contesto) misura la resistenza di un grande modello linguistico a fabbricare prove per una metrica che non esiste nel documento di destinazione, utilizzando 3 pagliai posizionati all'inizio, a metà e alla fine della finestra di contesto del modello, con 204 domande. claude-fable-5 ha risposto correttamente…
Esecuzione di codice con MCP: un nuovo approccio all'efficienza degli agenti IA
Anthropic ha introdotto un metodo in cui gli agenti IA interagiscono con Model Context Protocol (MCP) server scrivendo codice eseguibile invece di effettuare chiamate dirette agli strumenti. L'agente tratta gli strumenti come file su un computer, trova ciò di cui ha bisogno e li usa direttamente con il codice, così i dati intermedi non devono…
Newsletter AI Multiple
Una email gratuita a settimana con le ultime notizie tecnologiche B2B e approfondimenti di esperti per dare impulso alla tua azienda.