Ekrem Sarı
Ekrem è un Ricercatore IA e Data Scientist presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di IA e LLM.
Esperienza professionale
Presso AIMultiple, Ekrem esegue benchmark su sistemi di IA end-to-end e realizza i flussi di lavoro dei dati e le dashboard utilizzate per monitorare le metriche di benchmark e di prodotto. I suoi benchmark coprono modelli di embedding e reranker, database vettoriali e a grafo, motori di inference, quantizzazione, concorrenza GPU e scaling multi-GPU, prezzi e provider di GPU cloud, text-to-SQL e framework RAG e RAG agentici.
Prima di AIMultiple, ha lavorato come Data Scientist presso Yandex, dove ha interrogato e analizzato grandi dataset con SQL per valutare la qualità di ricerca e ranking rispetto a linee guida dettagliate.
Interessi di ricerca
Il lavoro di Ekrem si concentra sulla misurazione delle prestazioni pratiche dei sistemi LLM e di retrieval. Progetta il test harness, esegue i carichi di lavoro su hardware reale e confronta modelli, framework e infrastrutture in termini di accuratezza, throughput, latenza, costo e scalabilità, lungo l'intero stack dai modelli di embedding e database vettoriali ai motori di inference e all'infrastruttura GPU. La sua tesi di laurea magistrale automatizza le revisioni sistematiche della letteratura con una pipeline basata su RAG.
Formazione
Ekrem ha conseguito una laurea magistrale in Sistemi Informativi Gestionali presso la Başkent University, dove la sua tesi ha automatizzato le revisioni sistematiche della letteratura con una pipeline basata su RAG, e sta conseguendo una seconda laurea magistrale in Ingegneria dei Dati e della Conoscenza presso la Hacettepe University.
Ultimi articoli di Ekrem
Browser remoti: infrastruttura web per agenti IA a confronto
Gli agenti IA si affidano ai browser remoti per automatizzare le attività web senza essere bloccati da misure anti-scraping. Le prestazioni di questa infrastruttura browser sono fondamentali per il successo di un agente. Abbiamo confrontato 8 fornitori in base a tasso di successo, velocità e funzionalità. Per farlo, abbiamo eseguito 160 attività automatizzate, eseguendo 4…
Migliori strumenti, framework e librerie RAG
RAG migliora le risposte degli LLM fondandole su dati esterni invece che solo su ciò che il modello ha memorizzato durante l'addestramento. Abbiamo confrontato i componenti da cui è costruito un sistema RAG e raccolto i risultati in un unico posto, con una guida pratica alla scelta di ogni parte dello stack. Consulta i nostri…
I migliori 30+ produttori di chip IA: NVIDIA e i suoi concorrenti
Sulla base della nostra esperienza nell'esecuzione del benchmark cloud GPU di AIMultiple con 10 diversi modelli GPU in 4 scenari diversi, queste sono le principali aziende di hardware IA per i carichi di lavoro dei data center. *Il chip IA selezionato è il componente, la piattaforma o il progetto annunciato che meglio rappresenta ciascun fornitore.…
Indice dei prezzi di noleggio delle GPU cloud
Le tariffe on-demand per le GPU cloud di ultima generazione (B200, B300, MI300X, RTX 5090) sono quasi raddoppiate nell'ultimo anno, mentre le schede mainstream (H100, H200, A100) sono rimaste in una fascia ristretta. Compiliamo l'indice delle GPU mensilmente da 69 fornitori e 17 modelli di GPU, coprendo i livelli on-demand, spot e riservati a 1…
Text-to-SQL: Confronto dell'accuratezza degli LLM
Abbiamo eseguito 36 grandi modelli linguistici su 759 domande di BIRD-SQL, ciascun modello scrivendo SQL contro un database che doveva identificare da solo tra 11 candidati. Ogni query analizzabile è stata eseguita sul database reale e il suo set di risultati confrontato con il set di risultati della query gold di BIRD. Le query mancanti,…
GPU Benchmark di concorrenza: H100 vs H200 vs B200 vs MI300X
Ho trascorso gli ultimi 20 anni concentrandomi sull'ottimizzazione delle prestazioni computazionali a livello di sistema. Abbiamo sottoposto a benchmark le più recenti NVIDIA GPU, tra cui la NVIDIA H100, H200 e B200, e la AMD MI300X, per l'analisi della scalabilità della concorrenza. Utilizzando il framework vLLM con il gpt-oss-20b model, abbiamo testato come queste GPU…
Rilevamento bot: 9 fornitori anti-bot messi a confronto
Abbiamo eseguito due benchmark su siti web live, quindi abbiamo identificato l'azienda anti-bot davanti a ogni dominio e misurato quanto spesso i domini di ciascuna azienda restituivano il contenuto richiesto. Questo copre oltre 3.800 domini etichettati e oltre 50.000 richieste. Il primo benchmark ha prelevato pagine prodotto e di ricerca su 100 domini e-commerce, 50…
Scraper per e-commerce: 4 fornitori a confronto
Abbiamo confrontato quattro fornitori di dati web su 100 domini e-commerce, recuperando 65.000 pagine prodotto e di ricerca con livelli da 5 a 5.000 richieste concorrenti. In media tra i livelli di concorrenza, Bright Data ha raggiunto il tasso di successo più alto (76%) con un tempo mediano di 16 secondi. Apify ha registrato il…
Ricerca agentica: benchmark di 8 API di ricerca per agenti
La ricerca agentica svolge un ruolo cruciale nel colmare il divario tra i motori di ricerca tradizionali e le capacità di ricerca dell'IA. Le API di ricerca sono il primo livello di uno strumento agentico, dove le prestazioni limitano la qualità di tutto ciò che si trova a valle. Abbiamo confrontato 8 API di ricerca…
Model di embedding multimodali: Apple vs Meta vs OpenAI
I model di embedding multimodali eccellono nell'identificare oggetti ma faticano con le relazioni. I model attuali faticano a distinguere “telefono su una mappa” da “mappa su un telefono”. Abbiamo benchmarkato 7 model di punta su MS-COCO e Winoground per misurare questa specifica limitazione. Per garantire un confronto equo, abbiamo valutato ogni model in condizioni identiche…
Newsletter AI Multiple
Una email gratuita a settimana con le ultime notizie tecnologiche B2B e approfondimenti di esperti per dare impulso alla tua azienda.