Ekrem Sarı
Ekrem è un Ricercatore IA e Data Scientist presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di IA e LLM.
Esperienza professionale
Presso AIMultiple, Ekrem esegue benchmark su sistemi di IA end-to-end e realizza i flussi di lavoro dei dati e le dashboard utilizzate per monitorare le metriche di benchmark e di prodotto. I suoi benchmark coprono modelli di embedding e reranker, database vettoriali e a grafo, motori di inference, quantizzazione, concorrenza GPU e scaling multi-GPU, prezzi e provider di GPU cloud, text-to-SQL e framework RAG e RAG agentici.
Prima di AIMultiple, ha lavorato come Data Scientist presso Yandex, dove ha interrogato e analizzato grandi dataset con SQL per valutare la qualità di ricerca e ranking rispetto a linee guida dettagliate.
Interessi di ricerca
Il lavoro di Ekrem si concentra sulla misurazione delle prestazioni pratiche dei sistemi LLM e di retrieval. Progetta il test harness, esegue i carichi di lavoro su hardware reale e confronta modelli, framework e infrastrutture in termini di accuratezza, throughput, latenza, costo e scalabilità, lungo l'intero stack dai modelli di embedding e database vettoriali ai motori di inference e all'infrastruttura GPU. La sua tesi di laurea magistrale automatizza le revisioni sistematiche della letteratura con una pipeline basata su RAG.
Formazione
Ekrem ha conseguito una laurea magistrale in Sistemi Informativi Gestionali presso la Başkent University, dove la sua tesi ha automatizzato le revisioni sistematiche della letteratura con una pipeline basata su RAG, e sta conseguendo una seconda laurea magistrale in Ingegneria dei Dati e della Conoscenza presso la Hacettepe University.
Ultimi articoli di Ekrem
Benchmark di 40+ LLM nella finanza: Claude Fable 5 & GPT-5.6 Sol
Abbiamo valutato 40+ LLM nel settore finanziario su 238 domande difficili del benchmark FinanceReasoning per identificare quali modelli eccellano in compiti complessi di ragionamento finanziario come analisi di bilancio, previsioni e calcoli di rapporti. Abbiamo valutato LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme punta ai compiti più impegnativi di…
Benchmark sul software di archiviazione email
Abbiamo predisposto un tenant Microsoft 365, lo abbiamo popolato con un corpus sintetico di 10.000 email e 1.700 allegati in 8 sottotipi di file, quindi abbiamo confrontato NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving e MailPiler sullo stesso tenant rispetto a 10 dimensioni che coprono inserimento, ricerca, richiamo degli…
Benchmark sul disaster recovery: Acronis vs Comet vs MSP360
Abbiamo confrontato Acronis Cyber Protect Cloud, Comet Backup e MSP360 Managed Backup sul disaster recovery. Ogni fornitore ha acquisito l'immagine di un server Windows Server 2022 attivo e di un server Ubuntu 24.04 attivo con lo stesso carico di lavoro deterministico, un servizio web, un database da 10.000 righe e 50 file, quindi ha recuperato…
Benchmark di database a grafo: Neo4j vs FalkorDB vs Memgraph
Abbiamo confrontato Neo4j, FalkorDB e Memgraph su un grafo sintetico derivato da 120.000 recensioni di prodotti Amazon (381K nodi, 804K archi). Abbiamo eseguito 12 modelli di query con 1.000 misurazioni ciascuno, testato l'ingestione a 6 dimensioni di batch, sostenuto un carico concorrente per 60 secondi fino a 32 thread e misurato memoria, avvio a freddo,…
Agentic RAG Benchmark: Instradamento Multi-Database su 36 LLM
Abbiamo confrontato 36 modelli linguistici di grandi dimensioni sull'instradamento cross-database. Ogni modello riceve una domanda in linguaggio naturale e 11 SQL database descritti a livello di paragrafo, quindi deve decidere quale database contiene la risposta prima di scrivere qualsiasi SQL. Gli 11 database sono stati estratti da 80 candidati BIRD-SQL raggruppando gli embedding delle loro…
Benchmark del software DLP
Abbiamo confrontato Acronis DeviceLock DLP e ManageEngine DLP Plus su macchine virtuali identiche con Windows Server 2022 con 28 scenari: 23 test di fuga di dati (inclusi 12 file di evasione avversaria), 3 test di sicurezza dell'agente e 2 test con elevato consumo di CPU e memoria. Per gli altri prodotti DLP, Netwrix Endpoint Protector,…
Web Scraping su Larga Scala: 7 Fornitori Confrontati
Abbiamo eseguito due benchmark su siti web live, da 5 a 5.000 richieste concorrenti. Il primo ha inviato 260.000 richieste attraverso quattro web unblocker sui primi 10.000 domini Tranco, più un test di estrazione markdown su 10.000 URL. Il secondo ha recuperato 65.000 pagine prodotto e di ricerca da ciascuno dei cinque fornitori di scraping…
Confronto dei 6 migliori servizi cloud GPU gratuiti
Il miglior tier gratuito GPU vale circa $19 al mese ai prezzi di noleggio, e otto piattaforme offrono una GPU reale senza carta di credito. Sei di esse limitano l'uso gratuito su base mensile, e le abbiamo valutate al tasso on-demand più economico attuale per ogni GPU nei nostri dati di cloud GPU prezzi. Ogni…
Calcolatore per il dimensionamento e la scelta di database vettoriali
La domanda pratica dietro un database vettoriale self-hosted per RAG è quale motore si adatta a un dato server, e quale il carico di lavoro esclude. Il calcolatore qui sotto risponde a entrambe, dal nostro benchmark di sette database vettoriali self-hosted eseguiti con recall abbinata su embedding identici. Cinque caselle di controllo nella parte superiore…
Benchmark di Database Vettoriali: 7 Motori Open-Source per RAG
Abbiamo sottoposto a benchmark sette database vettoriali open-source e self-hosted come livello di recupero di una pipeline RAG, ciascuno eseguito singolarmente sugli stessi embedding bge-m3 e su query mediche e tecniche reali, in modo che l'indice del database fosse l'unica variabile. Il carico di lavoro ha coperto MedRAG-50k, TechQA-28k e un corpus di 2.25M di…
Newsletter AI Multiple
Una email gratuita a settimana con le ultime notizie tecnologiche B2B e approfondimenti di esperti per dare impulso alla tua azienda.