Servizi
Contattaci
Ekrem Sarı

Ekrem Sarı

Ricercatore di intelligenza artificiale
32 Articoli
Rimani aggiornato sulle novità tecnologiche B2B.

Ekrem è un ricercatore di intelligenza artificiale presso AIMultiple, specializzato in automazione intelligente, GPU, agenti di IA e LLMOps per framework RAG.

Esperienza professionale

Durante il suo incarico come valutatore presso Yandex, ha analizzato i risultati di ricerca utilizzando framework proprietari e protocolli automatizzati. Ha implementato test di controllo qualità tramite annotazione dei dati, punteggio di pertinenza e mappatura dell'intento dell'utente su oltre 10.000 query al mese, conducendo al contempo valutazioni tecniche, tra cui il monitoraggio delle prestazioni e il rilevamento dello spam tramite cicli di feedback basati sull'apprendimento automatico.

Capacità di ricerca

Presso AIMultiple, la sua ricerca si concentra sul ciclo di vita MLOps e sulle prestazioni e il benchmarking di sistemi di intelligenza artificiale end-to-end. Contribuisce a una vasta gamma di progetti, tra cui l'ottimizzazione del Retrieval-Augmented Generation (RAG), un ampio benchmarking di Large Language Model (LLM) e la progettazione di framework di intelligenza artificiale agentica. Ekrem è specializzato nello sviluppo di metodologie basate sui dati per misurare e migliorare le prestazioni della tecnologia IA in base a metriche operative critiche come accuratezza, efficienza, costo delle API e scalabilità. La sua analisi copre l'intero stack tecnologico, dai componenti fondamentali come i modelli di embedding e i database vettoriali fino alle GPU ad alte prestazioni e all'infrastruttura cloud necessarie per implementare agenti IA.

Preparazione

Ekrem ha conseguito una laurea presso la Hacettepe Üniversitesi e un master presso la Başkent Üniversitesi.

Ultimi articoli di Ekrem

IA
Benchmark
17 Lug

I migliori 20+ Framework Agentic RAG

L'Agentic RAG potenzia il RAG tradizionale migliorando le prestazioni degli LLM e consentendo una maggiore specializzazione. Abbiamo condotto un benchmark per valutarne le capacità di routing tra più database e di generazione delle query. Esplora i framework e le librerie agentic RAG, le differenze chiave rispetto al RAG standard, i vantaggi e le sfide per…

IA
Benchmark
16 Lug

Cloud GPU Prezzi, Prestazioni & Confronto tra Provider

I prezzi di listino delle cloud GPU per lo stesso modello possono differire anche di diverse volte da un provider all’altro. Abbiamo raccolto la tariffa più bassa, il provider, l’intervallo di mercato e la mediana per oltre 40 configurazioni di GPU in tutti e tre i livelli di prezzo, più un benchmark di throughput per…

IA
Confronto delle Funzionalità
16 Lug

Cloud GPU Indice dei prezzi di noleggio

Le tariffe on-demand per le GPU cloud di ultima generazione (B200, B300, MI300X, RTX 5090) sono più o meno raddoppiate nell'ultimo anno, mentre le schede mainstream (H100, H200, A100) hanno mantenuto una fascia ristretta. Compiliamo l'indice delle GPU ogni mese da 63 fornitori e 17 modelli di GPU, coprendo le fasce on-demand, spot e prenotate…

IA
Approfondimento
12 Lug

LLM Calcolatore VRAM per Auto-Hosting

Auto-ospitare un LLM significa eseguire l'inferenza su hardware controllato dall'operatore anziché tramite un'API di terze parti, il che cambia il profilo di costi, controllo dei dati e privacy. Se un modello possa essere eseguito o meno dipende dalla memoria. Il calcolatore stima la VRAM o memoria unificata necessaria per eseguire un modello in locale, basandosi…

IA
Benchmark
10 Lug

Benchmark di 40+ LLM nella finanza: Claude Fable 5 & GPT-5.6 Sol

Abbiamo valutato 40+ LLM nel settore finanziario su 238 domande difficili del benchmark FinanceReasoning per identificare quali modelli eccellano in compiti complessi di ragionamento finanziario come analisi di bilancio, previsioni e calcoli di rapporti. Abbiamo valutato LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme punta ai compiti più impegnativi di…

IA
Benchmark
3 Lug

Benchmark di modelli di embedding open source per RAG

Abbiamo testato 14 modelli di embedding open source, auto-ospitati su una singola H100, su oltre 500 query di recupero curate manualmente che spaziano tra contratti legali, note tecniche di assistenza clienti e abstract medici. NVIDIA Llama-Embed-Nemotron-8B primeggia in accuratezza. In termini di costo, Google’s EmbeddingGemma-300m costa circa 4x meno di Nemotron, a fronte di una…

IA
Benchmark
2 Lug

Confronta i Modelli Fondamentali Relazionali

Abbiamo eseguito benchmark su SAP-RPT-1-OSS contro il gradient boosting (LightGBM, CatBoost) su 17 dataset tabulari che coprono lo spettro semantico-numerico, tabelle a bassa/alta semantica, dataset aziendali misti e grandi dataset numerici a bassa semantica. Il nostro obiettivo è misurare dove i priori semantici preaddestrati di un LLM relazionale possano fornire vantaggi rispetto ai modelli ad…

Software aziendale
Benchmark
2 Lug

Benchmark Software di Archiviazione Email

Abbiamo provisioning un tenant Microsoft 365, lo abbiamo popolato con un corpus sintetico di 10.000 email e 1.700 allegati in 8 sottotipi di file, quindi abbiamo eseguito il benchmark di NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving, e MailPiler sullo stesso tenant rispetto a 10 dimensioni che coprono ingestion,…

Software aziendale
Benchmark
2 Lug

Le migliori funzioni serverless: Vercel vs Azure vs AWS

Le funzioni serverless consentono agli sviluppatori di eseguire codice senza dover gestire un server. Ciò consente loro di concentrarsi sulla scrittura e il deployment delle applicazioni mentre il ridimensionamento e la manutenzione dell'infrastruttura sono gestiti automaticamente in background. In questo benchmark, abbiamo valutato 7 popolari fornitori di servizi cloud seguendo la nostra metodologia per testare…

IA
Benchmark
2 Lug

Multimodale Embedding Models: Apple vs Meta vs OpenAI

I models di embedding multimodale eccellono nell'identificare gli oggetti ma hanno difficoltà con le relazioni. I models attuali faticano a distinguere “telefono su una mappa” da “mappa su un telefono”. Abbiamo valutato 7 principali models su MS-COCO e Winoground per misurare questa specifica limitazione. Per garantire un confronto equo, abbiamo valutato ogni model in condizioni…