Premium
Servizi
Premium
Ekrem Sarı

Ekrem Sarı

Ricercatore IA
37 Articoli
Rimani aggiornato sulle novità tecnologiche B2B.

Ekrem è un Ricercatore IA e Data Scientist presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di IA e LLM.

Esperienza professionale

Presso AIMultiple, Ekrem esegue benchmark su sistemi di IA end-to-end e realizza i flussi di lavoro dei dati e le dashboard utilizzate per monitorare le metriche di benchmark e di prodotto. I suoi benchmark coprono modelli di embedding e reranker, database vettoriali e a grafo, motori di inference, quantizzazione, concorrenza GPU e scaling multi-GPU, prezzi e provider di GPU cloud, text-to-SQL e framework RAG e RAG agentici.

Prima di AIMultiple, ha lavorato come Data Scientist presso Yandex, dove ha interrogato e analizzato grandi dataset con SQL per valutare la qualità di ricerca e ranking rispetto a linee guida dettagliate.

Interessi di ricerca

Il lavoro di Ekrem si concentra sulla misurazione delle prestazioni pratiche dei sistemi LLM e di retrieval. Progetta il test harness, esegue i carichi di lavoro su hardware reale e confronta modelli, framework e infrastrutture in termini di accuratezza, throughput, latenza, costo e scalabilità, lungo l'intero stack dai modelli di embedding e database vettoriali ai motori di inference e all'infrastruttura GPU. La sua tesi di laurea magistrale automatizza le revisioni sistematiche della letteratura con una pipeline basata su RAG.

Formazione

Ekrem ha conseguito una laurea magistrale in Sistemi Informativi Gestionali presso la Başkent University, dove la sua tesi ha automatizzato le revisioni sistematiche della letteratura con una pipeline basata su RAG, e sta conseguendo una seconda laurea magistrale in Ingegneria dei Dati e della Conoscenza presso la Hacettepe University.

Ultimi articoli di Ekrem

Sicurezza informatica
Valutazione in Mondo Aperto
10 set

Benchmark di disaster recovery: Acronis vs Comet vs MSP360

Abbiamo confrontato Acronis Cyber Protect Cloud, Comet Backup e MSP360 Managed Backup in termini di disaster recovery. Ogni fornitore ha acquisito un'immagine di un server Windows Server 2022 attivo e di un server Ubuntu 24.04 attivo con lo stesso carico di lavoro deterministico, un servizio web, un database da 10.000 righe e 50 file, quindi…

IA
Benchmark
4 set

Benchmark di database vettoriali: 7 motori open-source per RAG

Abbiamo confrontato sette database vettoriali open-source e self-hosted come livello di recupero di una pipeline RAG, eseguiti uno alla volta su embedding bge-m3 identici e query reali mediche e tecniche, così che l'indice del database fosse l'unica variabile. Il carico di lavoro ha coperto MedRAG-50k, TechQA-28k e un corpus di 2.25M vettori attraverso otto dimensioni,…

IA
Benchmark
31 ago

Prezzi, prestazioni e confronto tra i provider di GPU cloud

I prezzi di listino delle GPU cloud per lo stesso modello possono differire di diverse volte da un provider all'altro. Abbiamo selezionato la tariffa più bassa, il fornitore, l'intervallo di mercato e la mediana per oltre 40 configurazioni di GPU su tutti e tre i livelli di prezzo, oltre a un benchmark di throughput per…

IA
Benchmark
31 ago

Strumenti di valutazione RAG: Weights & Biases vs Ragas vs DeepEval

Quando una pipeline RAG recupera il contesto sbagliato, il LLM genera con sicurezza la risposta sbagliata. I valutatori di rilevanza contestuale sono la principale difesa. Abbiamo confrontato cinque strumenti su 1.460 domande e oltre 14.600 contesti valutati in condizioni identiche: stesso modello giudice (GPT-4o), configurazioni predefinite e nessun prompt personalizzato. In condizioni standard, WandB, TruLens…

IA
Benchmark
31 ago

Modelli di embedding: OpenAI vs Gemini vs Voyage

Abbiamo confrontato 15 modelli di embedding testuali in inglese e una baseline BM25 su oltre 500 query curate manualmente in tre domini di recupero: contratti legali (CUAD), assistenza clienti (IBM TechQA) e sanità (MedRAG PubMed). Voyage-3.5 è al primo posto in assoluto. Perplexity Embed V1 0.6b raggiunge la fascia medio-alta al prezzo più basso del…

IA
Benchmark
31 ago

RAG Framework: LangChain vs LangGraph vs LlamaIndex

Abbiamo confrontato 5 RAG framework: LangChain, LangGraph, LlamaIndex, Haystack e DSPy, costruendo lo stesso flusso di lavoro RAG agentico con componenti standardizzati: modelli identici (GPT-4.1-mini), embedding (BGE-small), retriever (Qdrant) e strumenti (ricerca web Tavily). Questo isola il vero overhead e l'efficienza dei token di ciascun framework. Il benchmark era composto da 100 query, e ciascun…

IA
Benchmark
31 ago

Benchmark di Open Source Embedding Models per RAG

NVIDIA Llama-Embed-Nemotron-8B guida in accuratezza. Sul costo, EmbeddingGemma-300m di Google costa circa 4x in meno rispetto a Nemotron a fronte di una piccola perdita di accuratezza. nDCG@3: Guadagno cumulativo scontato normalizzato al cutoff 3. Con un solo documento rilevante per query, è 1 / log2(rank + 1) quando il documento gold rientra nei primi 3,…

IA
Benchmark
31 ago

Migliori strumenti, framework e librerie RAG

RAG migliora le risposte degli LLM fondandole su dati esterni invece che solo su ciò che il modello ha memorizzato durante l'addestramento. Abbiamo confrontato i componenti da cui è costruito un sistema RAG e raccolto i risultati in un unico posto, con una guida pratica alla scelta di ogni parte dello stack. Consulta i nostri…

IA agentica
Benchmark
20 ago

Ricerca agentica: benchmark di 8 API di ricerca per agenti

La ricerca agentica svolge un ruolo cruciale nel colmare il divario tra i motori di ricerca tradizionali e le capacità di ricerca dell'IA. Le API di ricerca sono il primo livello di uno strumento agentico, dove le prestazioni limitano la qualità di tutto ciò che si trova a valle. Abbiamo confrontato 8 API di ricerca…

IA
Benchmark
14 ago

Model di embedding multimodali: Apple vs Meta vs OpenAI

I model di embedding multimodali eccellono nell'identificare oggetti ma faticano con le relazioni. I model attuali faticano a distinguere “telefono su una mappa” da “mappa su un telefono”. Abbiamo benchmarkato 7 model di punta su MS-COCO e Winoground per misurare questa specifica limitazione. Per garantire un confronto equo, abbiamo valutato ogni model in condizioni identiche…