Premium
Servizi
Premium
Berk Kalelioğlu

Berk Kalelioğlu

Ricercatore di IA
13 Articoli
Rimani aggiornato sulle novità tecnologiche B2B.
Berk è un ricercatore di IA presso AIMultiple. Ha esperienza pregressa nello sviluppo di videogiochi e nello sviluppo di generatori di numeri pseudocasuali basati su sistemi caotici.

Interessi di ricerca

Berk si concentra su apprendimento automatico, strumenti di IA agentica e modelli linguistici grandi e piccoli (LLM e SLM).

Fa parte del team benchmark di AIMultiple, conducendo valutazioni e fornendo approfondimenti per aiutare i lettori a comprendere le tecnologie emergenti e le loro applicazioni nel mondo reale.

Esperienza professionale

Ha iniziato la carriera come Responsabile di progetto tecnico presso ODTU IVME-R, dove ha guidato un progetto per realizzare generatori quantistici fisici e di numeri pseudocasuali.

Dopo l'esperienza presso IVME-R, ha cofondato una società di sviluppo di videogiochi e ha pubblicato un gioco su Steam.

In seguito ha orientato la sua carriera verso l'IA ed è entrato in AIMultiple come ricercatore.

Formazione

Berk ha conseguito una laurea triennale in Matematica presso Ankara University.

Ultimi articoli di Berk

IA agentica
Confronto delle Funzionalità
3 Set

Alternative a OpenClaw: Hermes vs ZeroClaw vs Grok Bot

Gli agenti IA autonomi, come OpenClaw e l'agente Hermes, automatizzano attività multi-step che normalmente richiederebbero un input umano costante. Sebbene OpenClaw sia diventato l'agente autonomo sempre attivo più adottato, molti utenti cercano alternative a causa del suo processo di distribuzione impegnativo e dei complessi requisiti di configurazione. Forniamo 5 alternative principali a OpenClaw, evidenziandone le…

IA agentica
Benchmark
31 Ago

Agenti per l'uso del computer: Benchmark e Architettura

Gli agenti per l'uso del computer operano su desktop reali e applicazioni web. I loro design, limiti e compromessi sono spesso poco chiari. Analizziamo come funzionano i sistemi principali, come apprendono e come le loro architetture differiscono. Facciamo anche riferimento a un benchmark focalizzato sul grounding dell'UI su 100 screenshot desktop, attraverso 4 tipi di…

IA agentica
Benchmark
27 Ago

IA VC Benchmark: 11 IA Agents su Compiti Reali di Venture Capital

Collaborando con VC in fase iniziale, abbiamo convertito due flussi di lavoro di analista in benchmark con verità fondante verificata da umani e valutato 11 agenti IA su di essi. Vedi i compiti, i risultati e il metodo di valutazione: Ciascuno dei 11 modelli ha eseguito ogni compito una volta. I punteggi sono su 100.…

IA
Benchmark
24 Ago

AIM Enterprise: benchmark enterprise agentico

Le imprese usano gli LLM ogni giorno per le loro attività ordinarie. Per trovare gli LLM più convenienti, abbiamo progettato AIM Enterprise, un benchmark enterprise agentico, in cui abbiamo utilizzato 69 attività aziendali reali tra strategia, marketing, HR, vendite e operations. Due judge model hanno valutato ogni file e spesso non erano d'accordo. In circa…

IA agentica
Benchmark
24 Ago

MCP Gateway Benchmark: latenza e sicurezza di 6 gateway

Un MCP gateway si trova tra un agente IA e i tool che chiama, e i vendor lo posizionano come livello di sicurezza per quel traffico. Abbiamo confrontato sei MCP gateway con un backend strumentato su una singola macchina, misurando la latenza aggiunta, l'autorizzazione per-tool, la protezione dei contenuti e la completezza dell'audit. Un prodotto…

IA24 Ago

Benchmark sulla classificazione delle serie temporali: modelli foundation vs metodi classici

Abbiamo confrontato 13 metodi di classificazione delle serie temporali, dai modelli foundation preaddestrati per serie temporali a una baseline a 22 feature del 2019, su 33 dataset UCR/UEA con un unico protocollo congelato. Si tratta di 14.638 celle registrate metodo-dataset-ricampionamento, 11.874 delle quali valutate. Il grafico confronta 12 metodi sui 15 dataset univariati che tutti…

IA agentica
Benchmark
21 Ago

A-CODE-CLI Bench: Benchmark dei CLI agentici

Gli strumenti CLI agentici sono strumenti di codifica IA in grado di creare ed eliminare file, eseguire comandi, pianificare ed eseguire la codifica dell'intero progetto. Abbiamo confrontato i principali strumenti in 10 scenari reali di sviluppo web, eseguendo circa 600 controlli di validazione atomici per agente e più di circa 5.000 esecuzioni di test automatizzate…

Software aziendale
Benchmark
21 Ago

Confronto VPS: Hetzner vs Digital Ocean

Abbiamo confrontato 6 fornitori di Virtual Private Server (VPS) eseguendo circa 1.200 test automatizzati per server su CPU, memoria, I/O del disco e velocità di rete utilizzando sysbench, fio e speedtest-cli. Abbiamo anche documentato l'intera esperienza dall'iscrizione all'accesso SSH per ciascun fornitore. Abbiamo utilizzato piani da 4 vCPU (condivisi) / 8 GB di ciascun fornitore,…

IA agentica
Benchmark
19 Ago

A-CODE-LLM Bench: Benchmark di Codifica Agentica

Abbiamo testato i migliori Large Language Models (LLM) su 10 attività di sviluppo software utilizzando uno strumento CLI agentico. Abbiamo eseguito circa 3.500 passaggi di validazione automatizzati per modello sia a livello API che UI. Ogni alias è stato eseguito 3 volte su 10 attività (30 campioni per alias, 400 celle per iterazione su 40…

IA agentica
Benchmark
19 Ago

Benchmark di Marketing Agentic di AIM

Presentiamo il Benchmark di Marketing Agentic di AIM, che misura le prestazioni degli agenti su tre flussi di lavoro di marketing: analisi del gap competitivo, preparazione della lista di target ABM e un deck di vendita personalizzato. Abbiamo anche eseguito un audit separato della reputazione del sito web in cui gli agenti hanno esaminato i…