Ekrem Sarı
Ekrem è un Ricercatore IA e Data Scientist presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di IA e LLM.
Esperienza professionale
Presso AIMultiple, Ekrem esegue benchmark su sistemi di IA end-to-end e realizza i flussi di lavoro dei dati e le dashboard utilizzate per monitorare le metriche di benchmark e di prodotto. I suoi benchmark coprono modelli di embedding e reranker, database vettoriali e a grafo, motori di inference, quantizzazione, concorrenza GPU e scaling multi-GPU, prezzi e provider di GPU cloud, text-to-SQL e framework RAG e RAG agentici.
Prima di AIMultiple, ha lavorato come Data Scientist presso Yandex, dove ha interrogato e analizzato grandi dataset con SQL per valutare la qualità di ricerca e ranking rispetto a linee guida dettagliate.
Interessi di ricerca
Il lavoro di Ekrem si concentra sulla misurazione delle prestazioni pratiche dei sistemi LLM e di retrieval. Progetta il test harness, esegue i carichi di lavoro su hardware reale e confronta modelli, framework e infrastrutture in termini di accuratezza, throughput, latenza, costo e scalabilità, lungo l'intero stack dai modelli di embedding e database vettoriali ai motori di inference e all'infrastruttura GPU. La sua tesi di laurea magistrale automatizza le revisioni sistematiche della letteratura con una pipeline basata su RAG.
Formazione
Ekrem ha conseguito una laurea magistrale in Sistemi Informativi Gestionali presso la Başkent University, dove la sua tesi ha automatizzato le revisioni sistematiche della letteratura con una pipeline basata su RAG, e sta conseguendo una seconda laurea magistrale in Ingegneria dei Dati e della Conoscenza presso la Hacettepe University.
Ultimi articoli di Ekrem
Benchmark sul software di archiviazione email
Abbiamo predisposto un tenant Microsoft 365, lo abbiamo popolato con un corpus sintetico di 10.000 email e 1.700 allegati in 8 sottotipi di file, quindi abbiamo confrontato NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving e MailPiler sullo stesso tenant rispetto a 10 dimensioni che coprono inserimento, ricerca, richiamo degli…
Benchmark di database a grafo: Neo4j vs FalkorDB vs Memgraph
Abbiamo confrontato Neo4j, FalkorDB e Memgraph su un grafo sintetico derivato da 120.000 recensioni di prodotti Amazon (381K nodi, 804K archi). Abbiamo eseguito 12 modelli di query con 1.000 misurazioni ciascuno, testato l'ingestione a 6 dimensioni di batch, sostenuto un carico concorrente per 60 secondi fino a 32 thread e misurato memoria, avvio a freddo,…
Calcolatore per il dimensionamento e la scelta di database vettoriali
La domanda pratica dietro un database vettoriale self-hosted per RAG è quale motore si adatta a un dato server, e quale il carico di lavoro esclude. Il calcolatore qui sotto risponde a entrambe, dal nostro benchmark di sette database vettoriali self-hosted eseguiti con recall abbinata su embedding identici. Cinque caselle di controllo nella parte superiore…
Le migliori funzioni serverless: Vercel vs Azure vs AWS
Le funzioni serverless consentono agli sviluppatori di eseguire codice senza dover gestire un server. Ciò consente loro di concentrarsi sulla scrittura e il deployment delle applicazioni mentre il ridimensionamento e la manutenzione dell'infrastruttura sono gestiti automaticamente in background. In questo benchmark, abbiamo valutato 7 popolari fornitori di servizi cloud seguendo la nostra metodologia per testare…
LLM Motori di inferenza: vLLM vs LMDeploy vs SGLang
Abbiamo testato 3 principali motori di inferenza LLM su NVIDIA H100: vLLM, LMDeploy e SGLang. Ogni motore ha elaborato carichi di lavoro identici: 1.000 prompt ShareGPT utilizzando Llama 3.1 8B-Instruct per isolare il reale impatto sulle prestazioni delle loro scelte architetturali e strategie di ottimizzazione. Abbiamo misurato il throughput batch offline su 10.000 operazioni di…
I migliori 10 modelli di embedding multilingue per RAG
Abbiamo testato 10 modelli di embedding multilingue su ~606k recensioni Amazon in 6 lingue (tedesco, inglese, spagnolo, francese, giapponese, cinese). Abbiamo generato 1.800 query (300 per lingua), ciascuna con riferimenti a dettagli concreti della recensione di origine. I modelli addestrati per la ricerca (separazione query vs documento) superano modelli più grandi addestrati per la similarità…
LLM Quantizzazione: BF16 vs FP8 vs INT4
Abbiamo benchmarkato Qwen3-32B a 4 livelli di precisione (BF16, FP8, GPTQ-Int8, GPTQ-Int4) su una singola NVIDIA H100 80GB GPU. Ogni configurazione è stata valutata su 2 benchmark (~12,2K domande) che coprono conoscenza e generazione di codice, oltre a oltre 2.000 esecuzioni di inferenza per misurare il throughput. Int4 è 2,7x più veloce di BF16 pur…
Newsletter AI Multiple
Una email gratuita a settimana con le ultime notizie tecnologiche B2B e approfondimenti di esperti per dare impulso alla tua azienda.