Ekrem Sarı
Ekrem è un Ricercatore IA e Data Scientist presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di IA e LLM.
Esperienza professionale
Presso AIMultiple, Ekrem esegue benchmark su sistemi di IA end-to-end e realizza i flussi di lavoro dei dati e le dashboard utilizzate per monitorare le metriche di benchmark e di prodotto. I suoi benchmark coprono modelli di embedding e reranker, database vettoriali e a grafo, motori di inference, quantizzazione, concorrenza GPU e scaling multi-GPU, prezzi e provider di GPU cloud, text-to-SQL e framework RAG e RAG agentici.
Prima di AIMultiple, ha lavorato come Data Scientist presso Yandex, dove ha interrogato e analizzato grandi dataset con SQL per valutare la qualità di ricerca e ranking rispetto a linee guida dettagliate.
Interessi di ricerca
Il lavoro di Ekrem si concentra sulla misurazione delle prestazioni pratiche dei sistemi LLM e di retrieval. Progetta il test harness, esegue i carichi di lavoro su hardware reale e confronta modelli, framework e infrastrutture in termini di accuratezza, throughput, latenza, costo e scalabilità, lungo l'intero stack dai modelli di embedding e database vettoriali ai motori di inference e all'infrastruttura GPU. La sua tesi di laurea magistrale automatizza le revisioni sistematiche della letteratura con una pipeline basata su RAG.
Formazione
Ekrem ha conseguito una laurea magistrale in Sistemi Informativi Gestionali presso la Başkent University, dove la sua tesi ha automatizzato le revisioni sistematiche della letteratura con una pipeline basata su RAG, e sta conseguendo una seconda laurea magistrale in Ingegneria dei Dati e della Conoscenza presso la Hacettepe University.
Ultimi articoli di Ekrem
Le migliori funzioni serverless: Vercel vs Azure vs AWS
Le funzioni serverless consentono agli sviluppatori di eseguire codice senza dover gestire un server. Ciò consente loro di concentrarsi sulla scrittura e il deployment delle applicazioni mentre il ridimensionamento e la manutenzione dell'infrastruttura sono gestiti automaticamente in background. In questo benchmark, abbiamo valutato 7 popolari fornitori di servizi cloud seguendo la nostra metodologia per testare…
LLM Motori di inferenza: vLLM vs LMDeploy vs SGLang
Abbiamo testato 3 principali motori di inferenza LLM su NVIDIA H100: vLLM, LMDeploy e SGLang. Ogni motore ha elaborato carichi di lavoro identici: 1.000 prompt ShareGPT utilizzando Llama 3.1 8B-Instruct per isolare il reale impatto sulle prestazioni delle loro scelte architetturali e strategie di ottimizzazione. Abbiamo misurato il throughput batch offline su 10.000 operazioni di…
I migliori 10 modelli di embedding multilingue per RAG
Abbiamo testato 10 modelli di embedding multilingue su ~606k recensioni Amazon in 6 lingue (tedesco, inglese, spagnolo, francese, giapponese, cinese). Abbiamo generato 1.800 query (300 per lingua), ciascuna con riferimenti a dettagli concreti della recensione di origine. I modelli addestrati per la ricerca (separazione query vs documento) superano modelli più grandi addestrati per la similarità…
Benchmark Multi-GPU: B200 vs H200 vs H100 vs MI300X
Per oltre due decenni, l'ottimizzazione delle prestazioni di calcolo è stata una pietra angolare del mio lavoro. Abbiamo eseguito benchmark sulle NVIDIA B200, H200, H100 e sulle AMD MI300X per valutare la loro scalabilità nell'inferenza dei Large Language Model (LLM). Utilizzando il framework vLLM con il modello meta-llama/Llama-3.1-8B-Instruct, abbiamo eseguito test su 1, 2, 4…
LLM Quantizzazione: BF16 vs FP8 vs INT4
Abbiamo benchmarkato Qwen3-32B a 4 livelli di precisione (BF16, FP8, GPTQ-Int8, GPTQ-Int4) su una singola NVIDIA H100 80GB GPU. Ogni configurazione è stata valutata su 2 benchmark (~12,2K domande) che coprono conoscenza e generazione di codice, oltre a oltre 2.000 esecuzioni di inferenza per misurare il throughput. Int4 è 2,7x più veloce di BF16 pur…
Newsletter AI Multiple
Una email gratuita a settimana con le ultime notizie tecnologiche B2B e approfondimenti di esperti per dare impulso alla tua azienda.