Ekrem Sarı
Ekrem è Ricercatore AI e analista di dati presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di AI e LLM.
Esperienza professionale
Presso AIMultiple, Ekrem esegue benchmark su sistemi AI end-to-end e costruisce i flussi di lavoro relativi ai dati e le dashboard utilizzate per monitorare le metriche di benchmark e di prodotto. I suoi benchmark coprono model di embedding e reranker, database vettoriali e a grafo, motori di inference, quantizzazione, concorrenza GPU e scalabilità multi-GPU, prezzi e provider di GPU cloud, text-to-SQL, e framework RAG e RAG agentici.
Prima di AIMultiple, ha lavorato come valutatore presso Yandex, dove ha valutato la qualità della ricerca ed etichettato grandi volumi di dati seguendo linee guida dettagliate per supportare il ranking e la qualità dei model.
Interessi di ricerca
Il lavoro di Ekrem si concentra sul ciclo di vita di MLOps e LLMOps e sulla misurazione delle prestazioni dei sistemi AI. Confronta model, framework e infrastrutture su metriche quali accuratezza, throughput, costo API e scalabilità, lungo l'intero stack, dai model di embedding e database vettoriali fino all'infrastruttura GPU e cloud. La sua tesi magistrale automatizza le revisioni sistematiche della letteratura con una pipeline basata su RAG.
Formazione
Ekrem ha conseguito una laurea triennale presso l'Università Hacettepe e sta completando un Master presso l'Università Başkent.
Ultimi articoli di Ekrem
Agentic RAG Benchmark: Instradamento Multi-Database su 36 LLM
Abbiamo confrontato 36 modelli linguistici di grandi dimensioni sull'instradamento cross-database. Ogni modello riceve una domanda in linguaggio naturale e 11 SQL database descritti a livello di paragrafo, quindi deve decidere quale database contiene la risposta prima di scrivere qualsiasi SQL. Gli 11 database sono stati estratti da 80 candidati BIRD-SQL raggruppando gli embedding delle loro…
I migliori oltre 60 fornitori di cloud GPU
I fornitori di cloud GPU si dividono in tre livelli. Gli hyperscaler gestiscono ampie piattaforme cloud con il noleggio di GPU come uno dei tanti prodotti. Le neocloud specializzate si concentrano su GPU e infrastrutture IA come prodotto principale. I marketplace comunitari aggregano l'inventario da molti piccoli operatori, spesso al prezzo minimo della fascia pubblicata.…
Text-to-SQL: Confronto dell'accuratezza degli LLM
Abbiamo eseguito 36 grandi modelli linguistici su 759 domande del dataset BIRD-SQL, ciascun modello scrivendo SQL su un database che doveva identificare autonomamente tra 11 candidati. Ogni query analizzabile è stata eseguita sul database reale e il suo set di risultati confrontato con quello della query gold di BIRD. Le query mancanti, malformate o che…
RAG Frameworks: LangChain vs LangGraph vs LlamaIndex
Abbiamo testato 5 framework RAG: LangChain, LangGraph, LlamaIndex, Haystack e DSPy, costruendo lo stesso flusso di lavoro RAG agentico con componenti standardizzati: modelli identici (GPT-4.1-mini), embedding (BGE-small), retriever (Qdrant) e strumenti (ricerca web Tavily). Questo isola il vero overhead e l'efficienza di token di ciascun framework. Il benchmark consisteva in 100 query, con ogni framework…
Benchmark del software di backup: Acronis vs NinjaOne vs Comet vs MSP360
Abbiamo confrontato le prestazioni di NinjaOne Backup, Acronis Cyber Protect Cloud Backup, Comet Backup e MSP360 Managed Backup su infrastrutture AWS identiche. Ogni fornitore ha eseguito un backup in modalità file dello stesso carico di lavoro di 625.946 file / 50 GB e un backup completo dell'immagine del disco di sistema, per poi ripristinare la…
Confronto dei modelli fondazionali relazionali
Abbiamo confrontato SAP-RPT-1-OSS con il gradient boosting (LightGBM, CatBoost) su 17 dataset tabulari che coprono lo spettro semantico-numerico, tabelle piccole/ad alta semantica, dataset aziendali misti e grandi dataset numerici a bassa semantica. Il nostro obiettivo è misurare dove i priori semantici pre-addestrati di un LLM relazionale possano offrire vantaggi rispetto ai modelli ad albero tradizionali…
Ricerca agentica: Benchmark 8 API di ricerca per agenti
La ricerca agentica gioca un ruolo cruciale nel colmare il divario tra motori di ricerca tradizionali e capacità di ricerca IA. Le API di ricerca sono il primo strato di uno strumento agentico, dove le prestazioni limitano la qualità di tutto ciò che segue. Abbiamo confrontato 8 API di ricerca su 100 query reali IA/LLM,…
Benchmark del software DLP
Abbiamo confrontato Acronis DeviceLock DLP e ManageEngine DLP Plus su macchine virtuali identiche con Windows Server 2022 con 28 scenari: 23 test di fuga di dati (inclusi 12 file di evasione avversaria), 3 test di sicurezza dell'agente e 2 test con elevato consumo di CPU e memoria. Per gli altri prodotti DLP, Netwrix Endpoint Protector,…
Benchmark sui reranker: i migliori 8 modelli a confronto
Abbiamo benchmarkato 8 modelli di reranker su ~145k recensioni Amazon in inglese per misurare quanto uno stadio di reranking migliori il retrieval denso. Abbiamo recuperato i primi 100 candidati con multilingual-e5-base, li abbiamo riordinati con ciascun modello e abbiamo valutato i primi 10 risultati rispetto a 300 query, ciascuna delle quali fa riferimento a dettagli…
GPU Benchmark di concorrenza: H100 vs H200 vs B200 vs MI300X
Ho trascorso gli ultimi 20 anni concentrandomi sull'ottimizzazione computazionale delle prestazioni a livello di sistema. Abbiamo testato le più recenti NVIDIA GPU, tra cui NVIDIA’s H100, H200 e B200, e AMD’s MI300X, per un'analisi della scalabilità della concorrenza. Utilizzando il framework vLLM con il gpt-oss-20b modello, abbiamo testato come queste GPU gestiscono richieste concorrenti, da…
Newsletter AI Multiple
Una email gratuita a settimana con le ultime notizie tecnologiche B2B e approfondimenti di esperti per dare impulso alla tua azienda.