Servizi
Contattaci
Ekrem Sarı

Ekrem Sarı

Ricercatore IA
35 Articoli
Rimani aggiornato sulle novità tecnologiche B2B.

Ekrem è un Ricercatore IA e Data Scientist presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di IA e LLM.

Esperienza professionale

Presso AIMultiple, Ekrem esegue benchmark su sistemi di IA end-to-end e realizza i flussi di lavoro dei dati e le dashboard utilizzate per monitorare le metriche di benchmark e di prodotto. I suoi benchmark coprono modelli di embedding e reranker, database vettoriali e a grafo, motori di inference, quantizzazione, concorrenza GPU e scaling multi-GPU, prezzi e provider di GPU cloud, text-to-SQL e framework RAG e RAG agentici.

Prima di AIMultiple, ha lavorato come Data Scientist presso Yandex, dove ha interrogato e analizzato grandi dataset con SQL per valutare la qualità di ricerca e ranking rispetto a linee guida dettagliate.

Interessi di ricerca

Il lavoro di Ekrem si concentra sulla misurazione delle prestazioni pratiche dei sistemi LLM e di retrieval. Progetta il test harness, esegue i carichi di lavoro su hardware reale e confronta modelli, framework e infrastrutture in termini di accuratezza, throughput, latenza, costo e scalabilità, lungo l'intero stack dai modelli di embedding e database vettoriali ai motori di inference e all'infrastruttura GPU. La sua tesi di laurea magistrale automatizza le revisioni sistematiche della letteratura con una pipeline basata su RAG.

Formazione

Ekrem ha conseguito una laurea magistrale in Sistemi Informativi Gestionali presso la Başkent University, dove la sua tesi ha automatizzato le revisioni sistematiche della letteratura con una pipeline basata su RAG, e sta conseguendo una seconda laurea magistrale in Ingegneria dei Dati e della Conoscenza presso la Hacettepe University.

Ultimi articoli di Ekrem

IA
Benchmark
14 Ago

Benchmark di 40+ LLM nella finanza: Claude Fable 5 & GPT-5.6 Sol

Abbiamo valutato 40+ LLM nel settore finanziario su 238 domande difficili del benchmark FinanceReasoning per identificare quali modelli eccellano in compiti complessi di ragionamento finanziario come analisi di bilancio, previsioni e calcoli di rapporti. Abbiamo valutato LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme punta ai compiti più impegnativi di…

Software aziendale
Benchmark
14 Ago

Benchmark sul software di archiviazione email

Abbiamo predisposto un tenant Microsoft 365, lo abbiamo popolato con un corpus sintetico di 10.000 email e 1.700 allegati in 8 sottotipi di file, quindi abbiamo confrontato NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving e MailPiler sullo stesso tenant rispetto a 10 dimensioni che coprono inserimento, ricerca, richiamo degli…

Sicurezza informatica
Valutazione in Mondo Aperto
14 Ago

Benchmark sul disaster recovery: Acronis vs Comet vs MSP360

Abbiamo confrontato Acronis Cyber Protect Cloud, Comet Backup e MSP360 Managed Backup sul disaster recovery. Ogni fornitore ha acquisito l'immagine di un server Windows Server 2022 attivo e di un server Ubuntu 24.04 attivo con lo stesso carico di lavoro deterministico, un servizio web, un database da 10.000 righe e 50 file, quindi ha recuperato…

Dati
Benchmark
14 Ago

Benchmark di database a grafo: Neo4j vs FalkorDB vs Memgraph

Abbiamo confrontato Neo4j, FalkorDB e Memgraph su un grafo sintetico derivato da 120.000 recensioni di prodotti Amazon (381K nodi, 804K archi). Abbiamo eseguito 12 modelli di query con 1.000 misurazioni ciascuno, testato l'ingestione a 6 dimensioni di batch, sostenuto un carico concorrente per 60 secondi fino a 32 thread e misurato memoria, avvio a freddo,…

IA
Benchmark
11 Ago

Agentic RAG Benchmark: Instradamento Multi-Database su 36 LLM

Abbiamo confrontato 36 modelli linguistici di grandi dimensioni sull'instradamento cross-database. Ogni modello riceve una domanda in linguaggio naturale e 11 SQL database descritti a livello di paragrafo, quindi deve decidere quale database contiene la risposta prima di scrivere qualsiasi SQL. Gli 11 database sono stati estratti da 80 candidati BIRD-SQL raggruppando gli embedding delle loro…

Sicurezza informatica
Benchmark
4 Ago

Benchmark del software DLP

Abbiamo confrontato Acronis DeviceLock DLP e ManageEngine DLP Plus su macchine virtuali identiche con Windows Server 2022 con 28 scenari: 23 test di fuga di dati (inclusi 12 file di evasione avversaria), 3 test di sicurezza dell'agente e 2 test con elevato consumo di CPU e memoria. Per gli altri prodotti DLP, Netwrix Endpoint Protector,…

Dati
Benchmark
30 Lug

Web Scraping su Larga Scala: 7 Fornitori Confrontati

Abbiamo eseguito due benchmark su siti web live, da 5 a 5.000 richieste concorrenti. Il primo ha inviato 260.000 richieste attraverso quattro web unblocker sui primi 10.000 domini Tranco, più un test di estrazione markdown su 10.000 URL. Il secondo ha recuperato 65.000 pagine prodotto e di ricerca da ciascuno dei cinque fornitori di scraping…

IA
Valutazione in Mondo Aperto
23 Lug

Confronto dei 6 migliori servizi cloud GPU gratuiti

Il miglior tier gratuito GPU vale circa $19 al mese ai prezzi di noleggio, e otto piattaforme offrono una GPU reale senza carta di credito. Sei di esse limitano l'uso gratuito su base mensile, e le abbiamo valutate al tasso on-demand più economico attuale per ogni GPU nei nostri dati di cloud GPU prezzi. Ogni…

IA
Benchmark
20 Lug

Calcolatore per il dimensionamento e la scelta di database vettoriali

La domanda pratica dietro un database vettoriale self-hosted per RAG è quale motore si adatta a un dato server, e quale il carico di lavoro esclude. Il calcolatore qui sotto risponde a entrambe, dal nostro benchmark di sette database vettoriali self-hosted eseguiti con recall abbinata su embedding identici. Cinque caselle di controllo nella parte superiore…

IA
Benchmark
18 Lug

Benchmark di Database Vettoriali: 7 Motori Open-Source per RAG

Abbiamo sottoposto a benchmark sette database vettoriali open-source e self-hosted come livello di recupero di una pipeline RAG, ciascuno eseguito singolarmente sugli stessi embedding bge-m3 e su query mediche e tecniche reali, in modo che l'indice del database fosse l'unica variabile. Il carico di lavoro ha coperto MedRAG-50k, TechQA-28k e un corpus di 2.25M di…