Ekrem Sarı
Ekrem è Ricercatore AI e analista di dati presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di AI e LLM.
Esperienza professionale
Presso AIMultiple, Ekrem esegue benchmark su sistemi AI end-to-end e costruisce i flussi di lavoro relativi ai dati e le dashboard utilizzate per monitorare le metriche di benchmark e di prodotto. I suoi benchmark coprono model di embedding e reranker, database vettoriali e a grafo, motori di inference, quantizzazione, concorrenza GPU e scalabilità multi-GPU, prezzi e provider di GPU cloud, text-to-SQL, e framework RAG e RAG agentici.
Prima di AIMultiple, ha lavorato come valutatore presso Yandex, dove ha valutato la qualità della ricerca ed etichettato grandi volumi di dati seguendo linee guida dettagliate per supportare il ranking e la qualità dei model.
Interessi di ricerca
Il lavoro di Ekrem si concentra sul ciclo di vita di MLOps e LLMOps e sulla misurazione delle prestazioni dei sistemi AI. Confronta model, framework e infrastrutture su metriche quali accuratezza, throughput, costo API e scalabilità, lungo l'intero stack, dai model di embedding e database vettoriali fino all'infrastruttura GPU e cloud. La sua tesi magistrale automatizza le revisioni sistematiche della letteratura con una pipeline basata su RAG.
Formazione
Ekrem ha conseguito una laurea triennale presso l'Università Hacettepe e sta completando un Master presso l'Università Başkent.
Ultimi articoli di Ekrem
Browser Remoti: Infrastruttura Web per Agenti IA a Confronto
Gli agenti IA si affidano ai browser remoti per automatizzare le attività web senza essere bloccati dalle misure anti-scraping. Le prestazioni di questa infrastruttura browser sono fondamentali per il successo di un agente. Abbiamo confrontato 8 fornitori in termini di tasso di successo, velocità e funzionalità. Per farlo, abbiamo eseguito 160 attività automatizzate, eseguendo 4…
LLM Motori di inferenza: vLLM vs LMDeploy vs SGLang
Abbiamo testato 3 principali motori di inferenza LLM su NVIDIA H100: vLLM, LMDeploy e SGLang. Ogni motore ha elaborato carichi di lavoro identici: 1.000 prompt ShareGPT utilizzando Llama 3.1 8B-Instruct per isolare il reale impatto sulle prestazioni delle loro scelte architetturali e strategie di ottimizzazione. Abbiamo misurato il throughput batch offline su 10.000 operazioni di…
I migliori 10 modelli di embedding multilingue per RAG
Abbiamo testato 10 modelli di embedding multilingue su ~606k recensioni Amazon in 6 lingue (tedesco, inglese, spagnolo, francese, giapponese, cinese). Abbiamo generato 1.800 query (300 per lingua), ciascuna con riferimenti a dettagli concreti della recensione di origine. I modelli addestrati per la ricerca (separazione query vs documento) superano modelli più grandi addestrati per la similarità…
Benchmark Multi-GPU: B200 vs H200 vs H100 vs MI300X
Per oltre due decenni, l'ottimizzazione delle prestazioni di calcolo è stata una pietra angolare del mio lavoro. Abbiamo eseguito benchmark sulle NVIDIA B200, H200, H100 e sulle AMD MI300X per valutare la loro scalabilità nell'inferenza dei Large Language Model (LLM). Utilizzando il framework vLLM con il modello meta-llama/Llama-3.1-8B-Instruct, abbiamo eseguito test su 1, 2, 4…
LLM Quantizzazione: BF16 vs FP8 vs INT4
Abbiamo benchmarkato Qwen3-32B a 4 livelli di precisione (BF16, FP8, GPTQ-Int8, GPTQ-Int4) su una singola NVIDIA H100 80GB GPU. Ogni configurazione è stata valutata su 2 benchmark (~12,2K domande) che coprono conoscenza e generazione di codice, oltre a oltre 2.000 esecuzioni di inferenza per misurare il throughput. Int4 è 2,7x più veloce di BF16 pur…
Newsletter AI Multiple
Una email gratuita a settimana con le ultime notizie tecnologiche B2B e approfondimenti di esperti per dare impulso alla tua azienda.