Premium
Servizi
Premium
Berk Kalelioğlu

Berk Kalelioğlu

Ricercatore di IA
15 Articoli
Rimani aggiornato sulle novità tecnologiche B2B.
Berk è un ricercatore di IA presso AIMultiple. Ha esperienza pregressa nello sviluppo di videogiochi e nello sviluppo di generatori di numeri pseudocasuali basati su sistemi caotici.

Interessi di ricerca

Berk si concentra su apprendimento automatico, strumenti di IA agentica e modelli linguistici grandi e piccoli (LLM e SLM).

Fa parte del team benchmark di AIMultiple, conducendo valutazioni e fornendo approfondimenti per aiutare i lettori a comprendere le tecnologie emergenti e le loro applicazioni nel mondo reale.

Esperienza professionale

Ha iniziato la carriera come Responsabile di progetto tecnico presso ODTU IVME-R, dove ha guidato un progetto per realizzare generatori quantistici fisici e di numeri pseudocasuali.

Dopo l'esperienza presso IVME-R, ha cofondato una società di sviluppo di videogiochi e ha pubblicato un gioco su Steam.

In seguito ha orientato la sua carriera verso l'IA ed è entrato in AIMultiple come ricercatore.

Formazione

Berk ha conseguito una laurea triennale in Matematica presso Ankara University.

Ultimi articoli di Berk

IA
Benchmark
24 set

AIM-Decision: Jev contro Kev contro LLMs

I modelli decisionali, detti anche modelli System One,1 scelgono l’azione successiva di un agente in un unico passaggio invece di generare testo token per token. Per verificare se possono rendere l’automazione del browser più economica rispetto agli LLM, abbiamo eseguito tre modelli decisionali e due LLM, Gemini 3.8 Flash e GPT-6 Astra, sugli stessi 50…

IA agentica
21 set

AIM Benchmark Web Agentico

Gli agenti si affidano alle interfacce web per completare le attività sul web. Per misurare come la scelta dell'interfaccia influisca sul completamento delle attività, abbiamo creato l'AIM Benchmark Web Agentico e abbiamo tentato 3.500 attività (100 attività completate tramite 7 interfacce web in 5 esecuzioni). Un'Bright Data interfaccia ha guidato ogni esecuzione. La CLI di…

IA
Benchmark
18 set

IT agentico: gli agenti IA possono progettare un benchmark

Abbiamo testato 16 modelli sulla progettazione di un benchmark in text-to-SQL e tool calling. Ogni modello ha creato un benchmark per argomento, per un totale di 32 proposte. Nessuna proposta ha superato ogni criterio della rubrica. Gli agenti sono riusciti a creare ed eseguire test, ma nessuno ha dimostrato sia un test con risposta vuota…

IA
Benchmark
17 set

AIM Enterprise: benchmark aziendale agentico

Le aziende usano gli LLM ogni giorno per le loro attività regolari. Per trovare gli LLM più convenienti, abbiamo progettato AIM Enterprise, un benchmark aziendale agentico, in cui abbiamo utilizzato 69 attività aziendali reali tra strategia, marketing, HR, vendite e operazioni. Due modelli giudici hanno valutato ogni file che ha superato i controlli. Nel 32,7%…

IA agentica
Benchmark
12 set

Deep Research IA: Codex vs Claude vs Grok vs Exa

Uno strumento di deep research risponde a una domanda con un report scritto invece di una pagina di link. Abbiamo eseguito cinque modi per produrne uno sugli stessi 20 brief di ricerca aziendale e abbiamo valutato ogni report in base a regole scritte prima delle esecuzioni per trovare il miglior strumento per la deep research.…

IA
Valutazione in Mondo Aperto
10 set

Migliori fornitori di LLM API a tariffa fissa

I fornitori di LLM a tariffa fissa vendono un utilizzo illimitato del modello a un prezzo mensile fisso invece di fatturare a token. Questo modello si è diffuso perché le sessioni di coding agentico possono utilizzare decine di milioni di token, rendendo difficile prevedere una fattura a consumo. Pochissimi fornitori offrono una vera tariffa fissa;…

IA agentica
Benchmark
10 set

Benchmark IA VC: 16 agenti IA sull'identificazione dei clienti

L'identificazione dei clienti fa parte della due diligence commerciale. Abbiamo testato 16 modelli nella ricerca di elenchi clienti per tre siti di ricerca e recensioni, uno dei quali AIMultiple, valutando i loro invii rispetto alle chiavi di risposta da noi compilate e alle pagine citate. Non abbiamo impostato alcun livello di ragionamento per nessun modello.…

IA agentica
Confronto delle Funzionalità
3 set

Alternative a OpenClaw: Hermes vs ZeroClaw vs Grok Bot

Gli agenti IA autonomi, come OpenClaw e l'agente Hermes, automatizzano attività multi-step che normalmente richiederebbero un input umano costante. Sebbene OpenClaw sia diventato l'agente autonomo sempre attivo più adottato, molti utenti cercano alternative a causa del suo processo di distribuzione impegnativo e dei complessi requisiti di configurazione. Forniamo 5 alternative principali a OpenClaw, evidenziandone le…

IA agentica
Benchmark
31 ago

Agenti per l'uso del computer: Benchmark e Architettura

Gli agenti per l'uso del computer operano su desktop reali e applicazioni web. I loro design, limiti e compromessi sono spesso poco chiari. Analizziamo come funzionano i sistemi principali, come apprendono e come le loro architetture differiscono. Facciamo anche riferimento a un benchmark focalizzato sul grounding dell'UI su 100 screenshot desktop, attraverso 4 tipi di…

IA agentica
Benchmark
24 ago

MCP Gateway Benchmark: latenza e sicurezza di 6 gateway

Un MCP gateway si trova tra un agente IA e i tool che chiama, e i vendor lo posizionano come livello di sicurezza per quel traffico. Abbiamo confrontato sei MCP gateway con un backend strumentato su una singola macchina, misurando la latenza aggiunta, l'autorizzazione per-tool, la protezione dei contenuti e la completezza dell'audit. Un prodotto…