Ekrem Sarı
Ekrem è Ricercatore AI e analista di dati presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di AI e LLM.
Esperienza professionale
Presso AIMultiple, Ekrem esegue benchmark su sistemi AI end-to-end e costruisce i flussi di lavoro relativi ai dati e le dashboard utilizzate per monitorare le metriche di benchmark e di prodotto. I suoi benchmark coprono model di embedding e reranker, database vettoriali e a grafo, motori di inference, quantizzazione, concorrenza GPU e scalabilità multi-GPU, prezzi e provider di GPU cloud, text-to-SQL, e framework RAG e RAG agentici.
Prima di AIMultiple, ha lavorato come valutatore presso Yandex, dove ha valutato la qualità della ricerca ed etichettato grandi volumi di dati seguendo linee guida dettagliate per supportare il ranking e la qualità dei model.
Interessi di ricerca
Il lavoro di Ekrem si concentra sul ciclo di vita di MLOps e LLMOps e sulla misurazione delle prestazioni dei sistemi AI. Confronta model, framework e infrastrutture su metriche quali accuratezza, throughput, costo API e scalabilità, lungo l'intero stack, dai model di embedding e database vettoriali fino all'infrastruttura GPU e cloud. La sua tesi magistrale automatizza le revisioni sistematiche della letteratura con una pipeline basata su RAG.
Formazione
Ekrem ha conseguito una laurea triennale presso l'Università Hacettepe e sta completando un Master presso l'Università Başkent.
Ultimi articoli di Ekrem
Benchmark dei modelli di embedding open source per RAG
NVIDIA Llama-Embed-Nemotron-8B è leader in accuratezza. Sul fronte dei costi, Google EmbeddingGemma-300m costa circa 4x in meno di Nemotron a fronte di una piccola perdita di accuratezza. nDCG@3: Guadagno cumulativo scontato normalizzato con cutoff 3. Con un solo documento rilevante per query, vale 1 / log2(rank + 1) quando il documento gold rientra nei primi…
Model di embedding multimodali: Apple vs Meta vs OpenAI
I model di embedding multimodali eccellono nell'identificare oggetti ma faticano con le relazioni. I model attuali faticano a distinguere “telefono su una mappa” da “mappa su un telefono”. Abbiamo benchmarkato 7 model di punta su MS-COCO e Winoground per misurare questa specifica limitazione. Per garantire un confronto equo, abbiamo valutato ogni model in condizioni identiche…
Benchmark di 40+ LLM nella finanza: Claude Fable 5 & GPT-5.6 Sol
Abbiamo valutato 40+ LLM nel settore finanziario su 238 domande difficili del benchmark FinanceReasoning per identificare quali modelli eccellano in compiti complessi di ragionamento finanziario come analisi di bilancio, previsioni e calcoli di rapporti. Abbiamo valutato LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme punta ai compiti più impegnativi di…
Modelli di embedding: OpenAI vs Gemini vs Voyage
Abbiamo confrontato 15 modelli di embedding testuale in inglese e una baseline BM25 su oltre 500 query curate manualmente in tre domini di recupero: contratti legali (CUAD), assistenza clienti (IBM TechQA) e sanità (MedRAG PubMed). Voyage-3.5 si classifica primo in assoluto. Perplexity Embed V1 0.6b raggiunge la fascia medio-alta al prezzo più basso del nostro…
Benchmark sul software di archiviazione email
Abbiamo predisposto un tenant Microsoft 365, lo abbiamo popolato con un corpus sintetico di 10.000 email e 1.700 allegati in 8 sottotipi di file, quindi abbiamo confrontato NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving e MailPiler sullo stesso tenant rispetto a 10 dimensioni che coprono inserimento, ricerca, richiamo degli…
Scraper e-commerce: 4 fornitori a confronto
Abbiamo confrontato quattro fornitori di dati web su 100 domini e-commerce, recuperando 65.000 pagine di prodotto e di ricerca ciascuno con da 5 a 5.000 richieste simultanee. Nella media tra i livelli di concorrenza, Bright Data ha raggiunto il tasso di successo più alto (76%) con una mediana di 16 secondi. Apify ha registrato il…
Benchmark sul disaster recovery: Acronis vs Comet vs MSP360
Abbiamo confrontato Acronis Cyber Protect Cloud, Comet Backup e MSP360 Managed Backup sul disaster recovery. Ogni fornitore ha acquisito l'immagine di un server Windows Server 2022 attivo e di un server Ubuntu 24.04 attivo con lo stesso carico di lavoro deterministico, un servizio web, un database da 10.000 righe e 50 file, quindi ha recuperato…
Benchmark di database a grafo: Neo4j vs FalkorDB vs Memgraph
Abbiamo confrontato Neo4j, FalkorDB e Memgraph su un grafo sintetico derivato da 120.000 recensioni di prodotti Amazon (381K nodi, 804K archi). Abbiamo eseguito 12 modelli di query con 1.000 misurazioni ciascuno, testato l'ingestione a 6 dimensioni di batch, sostenuto un carico concorrente per 60 secondi fino a 32 thread e misurato memoria, avvio a freddo,…
Rilevamento bot: 9 fornitori anti-bot messi a confronto
Abbiamo eseguito due benchmark su siti web live, quindi abbiamo identificato l'azienda anti-bot davanti a ogni dominio e misurato quanto spesso i domini di ciascuna azienda restituivano il contenuto richiesto. Questo copre oltre 3.800 domini etichettati e oltre 50.000 richieste. Il primo benchmark ha prelevato pagine prodotto e di ricerca su 100 domini e-commerce, 50…
I migliori 30+ produttori di chip IA: NVIDIA e i suoi concorrenti
Sulla base della nostra esperienza nell'esecuzione del benchmark cloud GPU di AIMultiple con 10 diversi modelli di GPU in 4 diversi scenari, queste sono le migliori aziende di hardware IA per i carichi di lavoro dei data center. *Il chip IA selezionato è la parte, la piattaforma o il progetto annunciato che meglio rappresenta ciascun…
Newsletter AI Multiple
Una email gratuita a settimana con le ultime notizie tecnologiche B2B e approfondimenti di esperti per dare impulso alla tua azienda.