Servizi
Contattaci
Ekrem Sarı

Ekrem Sarı

Ricercatore AI
35 Articoli
Rimani aggiornato sulle novità tecnologiche B2B.

Ekrem è Ricercatore AI e analista di dati presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di AI e LLM.

Esperienza professionale

Presso AIMultiple, Ekrem esegue benchmark su sistemi AI end-to-end e costruisce i flussi di lavoro relativi ai dati e le dashboard utilizzate per monitorare le metriche di benchmark e di prodotto. I suoi benchmark coprono model di embedding e reranker, database vettoriali e a grafo, motori di inference, quantizzazione, concorrenza GPU e scalabilità multi-GPU, prezzi e provider di GPU cloud, text-to-SQL, e framework RAG e RAG agentici.

Prima di AIMultiple, ha lavorato come valutatore presso Yandex, dove ha valutato la qualità della ricerca ed etichettato grandi volumi di dati seguendo linee guida dettagliate per supportare il ranking e la qualità dei model.

Interessi di ricerca

Il lavoro di Ekrem si concentra sul ciclo di vita di MLOps e LLMOps e sulla misurazione delle prestazioni dei sistemi AI. Confronta model, framework e infrastrutture su metriche quali accuratezza, throughput, costo API e scalabilità, lungo l'intero stack, dai model di embedding e database vettoriali fino all'infrastruttura GPU e cloud. La sua tesi magistrale automatizza le revisioni sistematiche della letteratura con una pipeline basata su RAG.

Formazione

Ekrem ha conseguito una laurea triennale presso l'Università Hacettepe e sta completando un Master presso l'Università Başkent.

Ultimi articoli di Ekrem

IA
Benchmark
11 Ago

Agentic RAG Benchmark: Instradamento Multi-Database su 36 LLM

Abbiamo confrontato 36 modelli linguistici di grandi dimensioni sull'instradamento cross-database. Ogni modello riceve una domanda in linguaggio naturale e 11 SQL database descritti a livello di paragrafo, quindi deve decidere quale database contiene la risposta prima di scrivere qualsiasi SQL. Gli 11 database sono stati estratti da 80 candidati BIRD-SQL raggruppando gli embedding delle loro…

IA
Valutazione in Mondo Aperto
11 Ago

I migliori oltre 60 fornitori di cloud GPU

I fornitori di cloud GPU si dividono in tre livelli. Gli hyperscaler gestiscono ampie piattaforme cloud con il noleggio di GPU come uno dei tanti prodotti. Le neocloud specializzate si concentrano su GPU e infrastrutture IA come prodotto principale. I marketplace comunitari aggregano l'inventario da molti piccoli operatori, spesso al prezzo minimo della fascia pubblicata.…

IA
Benchmark
9 Ago

Text-to-SQL: Confronto dell'accuratezza degli LLM

Abbiamo eseguito 36 grandi modelli linguistici su 759 domande del dataset BIRD-SQL, ciascun modello scrivendo SQL su un database che doveva identificare autonomamente tra 11 candidati. Ogni query analizzabile è stata eseguita sul database reale e il suo set di risultati confrontato con quello della query gold di BIRD. Le query mancanti, malformate o che…

IA
Benchmark
4 Ago

RAG Frameworks: LangChain vs LangGraph vs LlamaIndex

Abbiamo testato 5 framework RAG: LangChain, LangGraph, LlamaIndex, Haystack e DSPy, costruendo lo stesso flusso di lavoro RAG agentico con componenti standardizzati: modelli identici (GPT-4.1-mini), embedding (BGE-small), retriever (Qdrant) e strumenti (ricerca web Tavily). Questo isola il vero overhead e l'efficienza di token di ciascun framework. Il benchmark consisteva in 100 query, con ogni framework…

Sicurezza informatica
Benchmark
4 Ago

Benchmark del software di backup: Acronis vs NinjaOne vs Comet vs MSP360

Abbiamo confrontato le prestazioni di NinjaOne Backup, Acronis Cyber Protect Cloud Backup, Comet Backup e MSP360 Managed Backup su infrastrutture AWS identiche. Ogni fornitore ha eseguito un backup in modalità file dello stesso carico di lavoro di 625.946 file / 50 GB e un backup completo dell'immagine del disco di sistema, per poi ripristinare la…

IA
Benchmark
4 Ago

Confronto dei modelli fondazionali relazionali

Abbiamo confrontato SAP-RPT-1-OSS con il gradient boosting (LightGBM, CatBoost) su 17 dataset tabulari che coprono lo spettro semantico-numerico, tabelle piccole/ad alta semantica, dataset aziendali misti e grandi dataset numerici a bassa semantica. Il nostro obiettivo è misurare dove i priori semantici pre-addestrati di un LLM relazionale possano offrire vantaggi rispetto ai modelli ad albero tradizionali…

IA agentica
Benchmark
4 Ago

Ricerca agentica: Benchmark 8 API di ricerca per agenti

La ricerca agentica gioca un ruolo cruciale nel colmare il divario tra motori di ricerca tradizionali e capacità di ricerca IA. Le API di ricerca sono il primo strato di uno strumento agentico, dove le prestazioni limitano la qualità di tutto ciò che segue. Abbiamo confrontato 8 API di ricerca su 100 query reali IA/LLM,…

Sicurezza informatica
Benchmark
4 Ago

Benchmark del software DLP

Abbiamo confrontato Acronis DeviceLock DLP e ManageEngine DLP Plus su macchine virtuali identiche con Windows Server 2022 con 28 scenari: 23 test di fuga di dati (inclusi 12 file di evasione avversaria), 3 test di sicurezza dell'agente e 2 test con elevato consumo di CPU e memoria. Per gli altri prodotti DLP, Netwrix Endpoint Protector,…

IA
Benchmark
4 Ago

Benchmark sui reranker: i migliori 8 modelli a confronto

Abbiamo benchmarkato 8 modelli di reranker su ~145k recensioni Amazon in inglese per misurare quanto uno stadio di reranking migliori il retrieval denso. Abbiamo recuperato i primi 100 candidati con multilingual-e5-base, li abbiamo riordinati con ciascun modello e abbiamo valutato i primi 10 risultati rispetto a 300 query, ciascuna delle quali fa riferimento a dettagli…

IA
Benchmark
2 Ago

GPU Benchmark di concorrenza: H100 vs H200 vs B200 vs MI300X

Ho trascorso gli ultimi 20 anni concentrandomi sull'ottimizzazione computazionale delle prestazioni a livello di sistema. Abbiamo testato le più recenti NVIDIA GPU, tra cui NVIDIA’s H100, H200 e B200, e AMD’s MI300X, per un'analisi della scalabilità della concorrenza. Utilizzando il framework vLLM con il gpt-oss-20b modello, abbiamo testato come queste GPU gestiscono richieste concorrenti, da…