Servizi
Contattaci
Berk Kalelioğlu

Berk Kalelioğlu

Ricercatore IA
12 Articoli
Rimani aggiornato sulle novità tecnologiche B2B.
Berk è un ricercatore IA presso AIMultiple. Ha precedenti esperienze nello sviluppo di videogiochi e nello sviluppo di generatori di numeri pseudocasuali che utilizzano sistemi caotici.

Interessi di ricerca

Berk si concentra su apprendimento automatico, strumenti di IA agentica e modelli linguistici grandi e piccoli (LLM e SLM).

Fa parte del team di benchmark di AIMultiple, conducendo valutazioni e fornendo approfondimenti per aiutare i lettori a comprendere le tecnologie emergenti e le loro applicazioni nel mondo reale.

Esperienza professionale

Ha iniziato la sua carriera come Responsabile Tecnico di Progetto presso ODTU IVME-R, dove ha guidato un progetto per costruire generatori fisici quantistici e di numeri pseudocasuali.

Dopo la sua esperienza presso IVME-R, ha co-fondato una società di sviluppo di videogiochi e ha pubblicato un gioco su Steam.

In seguito ha orientato la sua carriera verso l'IA ed è entrato in AIMultiple come Ricercatore.

Istruzione

Berk ha conseguito una laurea triennale in Matematica presso Ankara University.

Ultimi articoli di Berk

IA
Benchmark
14 Ago

AIM Enterprise: Benchmark aziendale agentico

Le aziende usano gli LLM ogni giorno per le loro attività regolari. Per trovare gli LLM più efficienti in termini di costi, abbiamo progettato AIM Enterprise, un benchmark aziendale agentico, dove abbiamo usato 69 attività aziendali in diverse categorie. Ogni modello ha consegnato un file per attività. I punteggi sono relativi: i giudici classificano ogni…

IA agentica
Benchmark
12 Ago

Benchmark di Marketing Agentic di AIM

Presentiamo il Benchmark di Marketing Agentic di AIM, che misura le prestazioni degli agenti su tre flussi di lavoro di marketing: analisi del gap competitivo, preparazione della lista di target ABM e un deck di vendita personalizzato. Abbiamo anche eseguito un audit separato della reputazione del sito web in cui gli agenti hanno esaminato i…

IA12 Ago

Benchmark di classificazione delle serie temporali: Foundation Models vs Metodi Classici

Abbiamo benchmarked 13 metodi di classificazione di serie temporali, dai foundation models pre-addestrati per serie temporali a una baseline di 22 feature del 2019, su 33 dataset UCR/UEA sotto un protocollo congelato. Si tratta di 14.638 celle registrate metodo-dataset-ricampionamento, di cui 11.874 valutate. Il grafico mostra il confronto principale del benchmark: 12 metodi sui 15…

IA agentica
Benchmark
12 Ago

A-CODE-LLM Bench: Benchmark di Codifica Agentica

Abbiamo testato i migliori Large Language Models (LLM) su 10 attività di sviluppo software utilizzando uno strumento CLI agentico. Abbiamo eseguito circa 3.500 passaggi di validazione automatizzati per modello sia a livello API che UI. Ogni alias è stato eseguito 3 volte su 10 attività (30 campioni per alias, 400 celle per iterazione su 40…

IA agentica
Benchmark
12 Ago

A-CODE-CLI Bench: Benchmark CLI Agentico

Gli strumenti CLI agentici sono strumenti di codifica IA che possono creare ed eliminare file, eseguire comandi, pianificare ed eseguire la codifica dell'intero progetto. Abbiamo confrontato i principali strumenti in 10 scenari reali di sviluppo web, eseguendo circa 600 controlli di validazione atomici per agente e oltre circa 5.000 esecuzioni totali di test automatizzati, inclusi…

IA agentica12 Ago

Moltbook: Social Media Guidato da Agenti

La rapida crescita di OpenClaw ha innescato un insolito esperimento sociale: Moltbook, una piattaforma social simile a Reddit dove gli agenti interagiscono tra loro. Lanciata il 28 gennaio 2026, ha iniziato a ricevere attenzione in breve tempo, raggiungendo oltre 1.5 milioni di agenti nella prima settimana. Per altre piattaforme per agenti IA, leggi Dentro l'Ecosistema…

Software aziendale
Benchmark
12 Ago

Confronto VPS: Hetzner vs Digital Ocean

Abbiamo confrontato 6 fornitori di Virtual Private Server (VPS) eseguendo circa 1.200 test automatizzati per server su CPU, memoria, I/O del disco e velocità di rete utilizzando sysbench, fio e speedtest-cli. Abbiamo anche documentato l'intera esperienza dall'iscrizione all'accesso SSH per ciascun fornitore. Abbiamo utilizzato piani da 4 vCPU (condivisi) / 8 GB di ciascun fornitore,…

IA
Benchmark
11 Ago

Agentic IT: Can LLMs Design a Benchmark

We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…

IA
Valutazione in Mondo Aperto
7 Ago

Migliori fornitori di LLM API a tariffa fissa

I fornitori di LLM a tariffa fissa vendono un utilizzo illimitato del modello a un prezzo mensile fisso invece di fatturare a token. Questo modello si è diffuso perché le sessioni di coding agentico possono utilizzare decine di milioni di token, rendendo difficile prevedere una fattura a consumo. Pochissimi fornitori offrono una vera tariffa fissa;…

IA agentica
Benchmark
29 Lug

Agenti per l'uso del computer: Benchmark e Architettura

Gli agenti per l'uso del computer operano su desktop reali e applicazioni web. I loro design, limiti e compromessi sono spesso poco chiari. Analizziamo come funzionano i sistemi principali, come apprendono e come le loro architetture differiscono. Facciamo anche riferimento a un benchmark focalizzato sul grounding dell'UI su 100 screenshot desktop, attraverso 4 tipi di…