Servizi
Contattaci
Ekrem Sarı

Ekrem Sarı

Ricercatore AI
35 Articoli
Rimani aggiornato sulle novità tecnologiche B2B.

Ekrem è Ricercatore AI e analista di dati presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di AI e LLM.

Esperienza professionale

Presso AIMultiple, Ekrem esegue benchmark su sistemi AI end-to-end e costruisce i flussi di lavoro relativi ai dati e le dashboard utilizzate per monitorare le metriche di benchmark e di prodotto. I suoi benchmark coprono model di embedding e reranker, database vettoriali e a grafo, motori di inference, quantizzazione, concorrenza GPU e scalabilità multi-GPU, prezzi e provider di GPU cloud, text-to-SQL, e framework RAG e RAG agentici.

Prima di AIMultiple, ha lavorato come valutatore presso Yandex, dove ha valutato la qualità della ricerca ed etichettato grandi volumi di dati seguendo linee guida dettagliate per supportare il ranking e la qualità dei model.

Interessi di ricerca

Il lavoro di Ekrem si concentra sul ciclo di vita di MLOps e LLMOps e sulla misurazione delle prestazioni dei sistemi AI. Confronta model, framework e infrastrutture su metriche quali accuratezza, throughput, costo API e scalabilità, lungo l'intero stack, dai model di embedding e database vettoriali fino all'infrastruttura GPU e cloud. La sua tesi magistrale automatizza le revisioni sistematiche della letteratura con una pipeline basata su RAG.

Formazione

Ekrem ha conseguito una laurea triennale presso l'Università Hacettepe e sta completando un Master presso l'Università Başkent.

Ultimi articoli di Ekrem

IA
Benchmark
14 Ago

Benchmark dei modelli di embedding open source per RAG

NVIDIA Llama-Embed-Nemotron-8B è leader in accuratezza. Sul fronte dei costi, Google EmbeddingGemma-300m costa circa 4x in meno di Nemotron a fronte di una piccola perdita di accuratezza. nDCG@3: Guadagno cumulativo scontato normalizzato con cutoff 3. Con un solo documento rilevante per query, vale 1 / log2(rank + 1) quando il documento gold rientra nei primi…

IA
Benchmark
14 Ago

Model di embedding multimodali: Apple vs Meta vs OpenAI

I model di embedding multimodali eccellono nell'identificare oggetti ma faticano con le relazioni. I model attuali faticano a distinguere “telefono su una mappa” da “mappa su un telefono”. Abbiamo benchmarkato 7 model di punta su MS-COCO e Winoground per misurare questa specifica limitazione. Per garantire un confronto equo, abbiamo valutato ogni model in condizioni identiche…

IA
Benchmark
14 Ago

Benchmark di 40+ LLM nella finanza: Claude Fable 5 & GPT-5.6 Sol

Abbiamo valutato 40+ LLM nel settore finanziario su 238 domande difficili del benchmark FinanceReasoning per identificare quali modelli eccellano in compiti complessi di ragionamento finanziario come analisi di bilancio, previsioni e calcoli di rapporti. Abbiamo valutato LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme punta ai compiti più impegnativi di…

IA
Benchmark
14 Ago

Modelli di embedding: OpenAI vs Gemini vs Voyage

Abbiamo confrontato 15 modelli di embedding testuale in inglese e una baseline BM25 su oltre 500 query curate manualmente in tre domini di recupero: contratti legali (CUAD), assistenza clienti (IBM TechQA) e sanità (MedRAG PubMed). Voyage-3.5 si classifica primo in assoluto. Perplexity Embed V1 0.6b raggiunge la fascia medio-alta al prezzo più basso del nostro…

Software aziendale
Benchmark
14 Ago

Benchmark sul software di archiviazione email

Abbiamo predisposto un tenant Microsoft 365, lo abbiamo popolato con un corpus sintetico di 10.000 email e 1.700 allegati in 8 sottotipi di file, quindi abbiamo confrontato NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving e MailPiler sullo stesso tenant rispetto a 10 dimensioni che coprono inserimento, ricerca, richiamo degli…

Dati
Benchmark
14 Ago

Scraper e-commerce: 4 fornitori a confronto

Abbiamo confrontato quattro fornitori di dati web su 100 domini e-commerce, recuperando 65.000 pagine di prodotto e di ricerca ciascuno con da 5 a 5.000 richieste simultanee. Nella media tra i livelli di concorrenza, Bright Data ha raggiunto il tasso di successo più alto (76%) con una mediana di 16 secondi. Apify ha registrato il…

Sicurezza informatica
Valutazione in Mondo Aperto
14 Ago

Benchmark sul disaster recovery: Acronis vs Comet vs MSP360

Abbiamo confrontato Acronis Cyber Protect Cloud, Comet Backup e MSP360 Managed Backup sul disaster recovery. Ogni fornitore ha acquisito l'immagine di un server Windows Server 2022 attivo e di un server Ubuntu 24.04 attivo con lo stesso carico di lavoro deterministico, un servizio web, un database da 10.000 righe e 50 file, quindi ha recuperato…

Dati
Benchmark
14 Ago

Benchmark di database a grafo: Neo4j vs FalkorDB vs Memgraph

Abbiamo confrontato Neo4j, FalkorDB e Memgraph su un grafo sintetico derivato da 120.000 recensioni di prodotti Amazon (381K nodi, 804K archi). Abbiamo eseguito 12 modelli di query con 1.000 misurazioni ciascuno, testato l'ingestione a 6 dimensioni di batch, sostenuto un carico concorrente per 60 secondi fino a 32 thread e misurato memoria, avvio a freddo,…

Sicurezza informatica
Benchmark
12 Ago

Rilevamento bot: 9 fornitori anti-bot messi a confronto

Abbiamo eseguito due benchmark su siti web live, quindi abbiamo identificato l'azienda anti-bot davanti a ogni dominio e misurato quanto spesso i domini di ciascuna azienda restituivano il contenuto richiesto. Questo copre oltre 3.800 domini etichettati e oltre 50.000 richieste. Il primo benchmark ha prelevato pagine prodotto e di ricerca su 100 domini e-commerce, 50…

IA
Confronto delle Funzionalità
11 Ago

I migliori 30+ produttori di chip IA: NVIDIA e i suoi concorrenti

Sulla base della nostra esperienza nell'esecuzione del benchmark cloud GPU di AIMultiple con 10 diversi modelli di GPU in 4 diversi scenari, queste sono le migliori aziende di hardware IA per i carichi di lavoro dei data center. *Il chip IA selezionato è la parte, la piattaforma o il progetto annunciato che meglio rappresenta ciascun…