Servizi
Contattaci
Ekrem Sarı

Ekrem Sarı

Ricercatore di intelligenza artificiale
32 Articoli
Rimani aggiornato sulle novità tecnologiche B2B.

Ekrem è un ricercatore di intelligenza artificiale presso AIMultiple, specializzato in automazione intelligente, GPU, agenti di IA e LLMOps per framework RAG.

Esperienza professionale

Durante il suo incarico come valutatore presso Yandex, ha analizzato i risultati di ricerca utilizzando framework proprietari e protocolli automatizzati. Ha implementato test di controllo qualità tramite annotazione dei dati, punteggio di pertinenza e mappatura dell'intento dell'utente su oltre 10.000 query al mese, conducendo al contempo valutazioni tecniche, tra cui il monitoraggio delle prestazioni e il rilevamento dello spam tramite cicli di feedback basati sull'apprendimento automatico.

Capacità di ricerca

Presso AIMultiple, la sua ricerca si concentra sul ciclo di vita MLOps e sulle prestazioni e il benchmarking di sistemi di intelligenza artificiale end-to-end. Contribuisce a una vasta gamma di progetti, tra cui l'ottimizzazione del Retrieval-Augmented Generation (RAG), un ampio benchmarking di Large Language Model (LLM) e la progettazione di framework di intelligenza artificiale agentica. Ekrem è specializzato nello sviluppo di metodologie basate sui dati per misurare e migliorare le prestazioni della tecnologia IA in base a metriche operative critiche come accuratezza, efficienza, costo delle API e scalabilità. La sua analisi copre l'intero stack tecnologico, dai componenti fondamentali come i modelli di embedding e i database vettoriali fino alle GPU ad alte prestazioni e all'infrastruttura cloud necessarie per implementare agenti IA.

Preparazione

Ekrem ha conseguito una laurea presso la Hacettepe Üniversitesi e un master presso la Başkent Üniversitesi.

Ultimi articoli di Ekrem

IA
Benchmark
2 Lug

RAG Strumenti di Valutazione: Weights & Biases vs Ragas vs DeepEval

Quando una pipeline RAG recupera il contesto sbagliato, l'LLM genera con sicurezza la risposta errata. I valutatori di rilevanza del contesto sono la prima linea di difesa. Abbiamo confrontato cinque strumenti su 1.460 domande e oltre 14.600 contesti valutati in condizioni identiche: stesso modello giudice (GPT-4o), configurazioni predefinite e nessun prompt personalizzato. In condizioni standard,…

Dati
Benchmark
2 Lug

Browser Remoti: Infrastruttura Web per Agenti IA a Confronto

Gli agenti IA si affidano ai browser remoti per automatizzare le attività web senza essere bloccati dalle misure anti-scraping. Le prestazioni di questa infrastruttura browser sono fondamentali per il successo di un agente. Abbiamo confrontato 8 fornitori in termini di tasso di successo, velocità e funzionalità. Per farlo, abbiamo eseguito 160 attività automatizzate, eseguendo 4…

Dati
Benchmark
1 Lug

Benchmark di Database a Grafo: Neo4j vs FalkorDB vs Memgraph

Abbiamo confrontato Neo4j, FalkorDB e Memgraph su un grafo sintetico derivato da 120.000 recensioni di prodotti Amazon (381K nodi, 804K archi). Abbiamo eseguito 12 modelli di query con 1.000 misurazioni ciascuna, testato l'ingestione a 6 dimensioni di batch, sostenuto carichi concorrenti per 60 secondi fino a 32 thread e misurato memoria, avvio a freddo, carico…

IA
Benchmark
1 Lug

LLM Motori di inferenza: vLLM vs LMDeploy vs SGLang

Abbiamo testato 3 principali motori di inferenza LLM su NVIDIA H100: vLLM, LMDeploy e SGLang. Ogni motore ha elaborato carichi di lavoro identici: 1,000 prompt ShareGPT utilizzando Llama 3.1 8B-Instruct per isolare il reale impatto sulle prestazioni delle loro scelte architetturali e strategie di ottimizzazione. Abbiamo misurato il throughput batch offline su 10,000 operazioni di…

IA
Benchmark
30 Giu

I migliori 10 modelli di embedding multilingue per RAG

Abbiamo testato 10 modelli di embedding multilingue su ~606k recensioni Amazon in 6 lingue (tedesco, inglese, spagnolo, francese, giapponese, cinese). Abbiamo generato 1,800 query (300 per lingua), ciascuna con riferimenti a dettagli concreti della recensione di origine. I modelli addestrati per la ricerca (separazione query vs documento) superano modelli più grandi addestrati per la similarità…

IA
Benchmark
30 Giu

Benchmark Multi-GPU: B200 vs H200 vs H100 vs MI300X

Per oltre due decenni, l'ottimizzazione delle prestazioni di calcolo è stata una pietra angolare del mio lavoro. Abbiamo eseguito benchmark sulle NVIDIA B200, H200, H100 e sulle AMD MI300X per valutare la loro scalabilità nell'inferenza dei Large Language Model (LLM). Utilizzando il framework vLLM con il modello meta-llama/Llama-3.1-8B-Instruct, abbiamo eseguito test su 1, 2, 4…

IA
Benchmark
29 Giu

Modelli di Embedding: OpenAI vs Gemini vs Voyage

Abbiamo valutato 15 modelli di embedding di testo in inglese e una baseline BM25 su oltre 500 query curate manualmente in tre domini di recupero: contratti legali (CUAD), assistenza clienti (IBM TechQA) e sanità (MedRAG PubMed). Voyage-3.5 si classifica primo in assoluto. Perplexity Embed V1 0.6b raggiunge la fascia medio-alta al prezzo più basso nel…

IA
Benchmark
29 Giu

RAG Framework: LangChain vs LangGraph vs LlamaIndex

Abbiamo testato 5 framework RAG: LangChain, LangGraph, LlamaIndex, Haystack e DSPy, costruendo lo stesso flusso di lavoro RAG agentico con componenti standardizzati: modelli identici (GPT-4.1-mini), embedding (BGE-small), retriever (Qdrant) e strumenti (ricerca web Tavily). Questo isola il vero sovraccarico e l'efficienza dei token di ciascun framework. Il benchmark consisteva in 100 query, con ciascun framework…

IA
Benchmark
29 Giu

Benchmark Reranker: 8 Modelli Principali Confrontati

Abbiamo eseguito benchmark su 8 modelli reranker su circa 145k recensioni Amazon in inglese per misurare quanto una fase di riclassificazione migliori il recupero denso. Abbiamo recuperato i primi 100 candidati con multilingual-e5-base, li abbiamo riclassificati con ciascun modello e abbiamo valutato i primi 10 risultati rispetto a 300 query, ciascuna che fa riferimento a…

IA agentica
Benchmark
29 Giu

Ricerca Agentica: Benchmark di 8 API di Ricerca per Agenti

La ricerca agentica gioca un ruolo cruciale nel colmare il divario tra i motori di ricerca tradizionali e le capacità di ricerca dell'IA. Le API di ricerca sono il primo strato di uno strumento agentico, dove le prestazioni limitano la qualità di tutto ciò che segue a valle. Abbiamo confrontato 8 API di ricerca su…