Ekrem Sarı
Ekrem è un Ricercatore IA e Data Scientist presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di IA e LLM.
Esperienza professionale
Presso AIMultiple, Ekrem esegue benchmark su sistemi di IA end-to-end e realizza i flussi di lavoro dei dati e le dashboard utilizzate per monitorare le metriche di benchmark e di prodotto. I suoi benchmark coprono modelli di embedding e reranker, database vettoriali e a grafo, motori di inference, quantizzazione, concorrenza GPU e scaling multi-GPU, prezzi e provider di GPU cloud, text-to-SQL e framework RAG e RAG agentici.
Prima di AIMultiple, ha lavorato come Data Scientist presso Yandex, dove ha interrogato e analizzato grandi dataset con SQL per valutare la qualità di ricerca e ranking rispetto a linee guida dettagliate.
Interessi di ricerca
Il lavoro di Ekrem si concentra sulla misurazione delle prestazioni pratiche dei sistemi LLM e di retrieval. Progetta il test harness, esegue i carichi di lavoro su hardware reale e confronta modelli, framework e infrastrutture in termini di accuratezza, throughput, latenza, costo e scalabilità, lungo l'intero stack dai modelli di embedding e database vettoriali ai motori di inference e all'infrastruttura GPU. La sua tesi di laurea magistrale automatizza le revisioni sistematiche della letteratura con una pipeline basata su RAG.
Formazione
Ekrem ha conseguito una laurea magistrale in Sistemi Informativi Gestionali presso la Başkent University, dove la sua tesi ha automatizzato le revisioni sistematiche della letteratura con una pipeline basata su RAG, e sta conseguendo una seconda laurea magistrale in Ingegneria dei Dati e della Conoscenza presso la Hacettepe University.
Ultimi articoli di Ekrem
Benchmark di disaster recovery: Acronis vs Comet vs MSP360
Abbiamo confrontato Acronis Cyber Protect Cloud, Comet Backup e MSP360 Managed Backup in termini di disaster recovery. Ogni fornitore ha acquisito un'immagine di un server Windows Server 2022 attivo e di un server Ubuntu 24.04 attivo con lo stesso carico di lavoro deterministico, un servizio web, un database da 10.000 righe e 50 file, quindi…
Benchmark di database vettoriali: 7 motori open-source per RAG
Abbiamo confrontato sette database vettoriali open-source e self-hosted come livello di recupero di una pipeline RAG, eseguiti uno alla volta su embedding bge-m3 identici e query reali mediche e tecniche, così che l'indice del database fosse l'unica variabile. Il carico di lavoro ha coperto MedRAG-50k, TechQA-28k e un corpus di 2.25M vettori attraverso otto dimensioni,…
Prezzi, prestazioni e confronto tra i provider di GPU cloud
I prezzi di listino delle GPU cloud per lo stesso modello possono differire di diverse volte da un provider all'altro. Abbiamo selezionato la tariffa più bassa, il fornitore, l'intervallo di mercato e la mediana per oltre 40 configurazioni di GPU su tutti e tre i livelli di prezzo, oltre a un benchmark di throughput per…
Strumenti di valutazione RAG: Weights & Biases vs Ragas vs DeepEval
Quando una pipeline RAG recupera il contesto sbagliato, il LLM genera con sicurezza la risposta sbagliata. I valutatori di rilevanza contestuale sono la principale difesa. Abbiamo confrontato cinque strumenti su 1.460 domande e oltre 14.600 contesti valutati in condizioni identiche: stesso modello giudice (GPT-4o), configurazioni predefinite e nessun prompt personalizzato. In condizioni standard, WandB, TruLens…
Modelli di embedding: OpenAI vs Gemini vs Voyage
Abbiamo confrontato 15 modelli di embedding testuali in inglese e una baseline BM25 su oltre 500 query curate manualmente in tre domini di recupero: contratti legali (CUAD), assistenza clienti (IBM TechQA) e sanità (MedRAG PubMed). Voyage-3.5 è al primo posto in assoluto. Perplexity Embed V1 0.6b raggiunge la fascia medio-alta al prezzo più basso del…
RAG Framework: LangChain vs LangGraph vs LlamaIndex
Abbiamo confrontato 5 RAG framework: LangChain, LangGraph, LlamaIndex, Haystack e DSPy, costruendo lo stesso flusso di lavoro RAG agentico con componenti standardizzati: modelli identici (GPT-4.1-mini), embedding (BGE-small), retriever (Qdrant) e strumenti (ricerca web Tavily). Questo isola il vero overhead e l'efficienza dei token di ciascun framework. Il benchmark era composto da 100 query, e ciascun…
Benchmark di Open Source Embedding Models per RAG
NVIDIA Llama-Embed-Nemotron-8B guida in accuratezza. Sul costo, EmbeddingGemma-300m di Google costa circa 4x in meno rispetto a Nemotron a fronte di una piccola perdita di accuratezza. nDCG@3: Guadagno cumulativo scontato normalizzato al cutoff 3. Con un solo documento rilevante per query, è 1 / log2(rank + 1) quando il documento gold rientra nei primi 3,…
Migliori strumenti, framework e librerie RAG
RAG migliora le risposte degli LLM fondandole su dati esterni invece che solo su ciò che il modello ha memorizzato durante l'addestramento. Abbiamo confrontato i componenti da cui è costruito un sistema RAG e raccolto i risultati in un unico posto, con una guida pratica alla scelta di ogni parte dello stack. Consulta i nostri…
Ricerca agentica: benchmark di 8 API di ricerca per agenti
La ricerca agentica svolge un ruolo cruciale nel colmare il divario tra i motori di ricerca tradizionali e le capacità di ricerca dell'IA. Le API di ricerca sono il primo livello di uno strumento agentico, dove le prestazioni limitano la qualità di tutto ciò che si trova a valle. Abbiamo confrontato 8 API di ricerca…
Model di embedding multimodali: Apple vs Meta vs OpenAI
I model di embedding multimodali eccellono nell'identificare oggetti ma faticano con le relazioni. I model attuali faticano a distinguere “telefono su una mappa” da “mappa su un telefono”. Abbiamo benchmarkato 7 model di punta su MS-COCO e Winoground per misurare questa specifica limitazione. Per garantire un confronto equo, abbiamo valutato ogni model in condizioni identiche…
Newsletter AI Multiple
Una email gratuita a settimana con le ultime notizie tecnologiche B2B e approfondimenti di esperti per dare impulso alla tua azienda.