Berk Kalelioğlu
Interessi di ricerca
Berk si concentra su apprendimento automatico, strumenti di IA agentica e modelli linguistici grandi e piccoli (LLM e SLM).Fa parte del team benchmark di AIMultiple, conducendo valutazioni e fornendo approfondimenti per aiutare i lettori a comprendere le tecnologie emergenti e le loro applicazioni nel mondo reale.
Esperienza professionale
Ha iniziato la carriera come Responsabile di progetto tecnico presso ODTU IVME-R, dove ha guidato un progetto per realizzare generatori quantistici fisici e di numeri pseudocasuali.Dopo l'esperienza presso IVME-R, ha cofondato una società di sviluppo di videogiochi e ha pubblicato un gioco su Steam.
In seguito ha orientato la sua carriera verso l'IA ed è entrato in AIMultiple come ricercatore.
Formazione
Berk ha conseguito una laurea triennale in Matematica presso Ankara University.Ultimi articoli di Berk
Alternative a OpenClaw: Hermes vs ZeroClaw vs Grok Bot
Gli agenti IA autonomi, come OpenClaw e l'agente Hermes, automatizzano attività multi-step che normalmente richiederebbero un input umano costante. Sebbene OpenClaw sia diventato l'agente autonomo sempre attivo più adottato, molti utenti cercano alternative a causa del suo processo di distribuzione impegnativo e dei complessi requisiti di configurazione. Forniamo 5 alternative principali a OpenClaw, evidenziandone le…
Agenti per l'uso del computer: Benchmark e Architettura
Gli agenti per l'uso del computer operano su desktop reali e applicazioni web. I loro design, limiti e compromessi sono spesso poco chiari. Analizziamo come funzionano i sistemi principali, come apprendono e come le loro architetture differiscono. Facciamo anche riferimento a un benchmark focalizzato sul grounding dell'UI su 100 screenshot desktop, attraverso 4 tipi di…
IA VC Benchmark: 11 IA Agents su Compiti Reali di Venture Capital
Collaborando con VC in fase iniziale, abbiamo convertito due flussi di lavoro di analista in benchmark con verità fondante verificata da umani e valutato 11 agenti IA su di essi. Vedi i compiti, i risultati e il metodo di valutazione: Ciascuno dei 11 modelli ha eseguito ogni compito una volta. I punteggi sono su 100.…
AIM Enterprise: benchmark enterprise agentico
Le imprese usano gli LLM ogni giorno per le loro attività ordinarie. Per trovare gli LLM più convenienti, abbiamo progettato AIM Enterprise, un benchmark enterprise agentico, in cui abbiamo utilizzato 69 attività aziendali reali tra strategia, marketing, HR, vendite e operations. Due judge model hanno valutato ogni file e spesso non erano d'accordo. In circa…
MCP Gateway Benchmark: latenza e sicurezza di 6 gateway
Un MCP gateway si trova tra un agente IA e i tool che chiama, e i vendor lo posizionano come livello di sicurezza per quel traffico. Abbiamo confrontato sei MCP gateway con un backend strumentato su una singola macchina, misurando la latenza aggiunta, l'autorizzazione per-tool, la protezione dei contenuti e la completezza dell'audit. Un prodotto…
Benchmark sulla classificazione delle serie temporali: modelli foundation vs metodi classici
Abbiamo confrontato 13 metodi di classificazione delle serie temporali, dai modelli foundation preaddestrati per serie temporali a una baseline a 22 feature del 2019, su 33 dataset UCR/UEA con un unico protocollo congelato. Si tratta di 14.638 celle registrate metodo-dataset-ricampionamento, 11.874 delle quali valutate. Il grafico confronta 12 metodi sui 15 dataset univariati che tutti…
A-CODE-CLI Bench: Benchmark dei CLI agentici
Gli strumenti CLI agentici sono strumenti di codifica IA in grado di creare ed eliminare file, eseguire comandi, pianificare ed eseguire la codifica dell'intero progetto. Abbiamo confrontato i principali strumenti in 10 scenari reali di sviluppo web, eseguendo circa 600 controlli di validazione atomici per agente e più di circa 5.000 esecuzioni di test automatizzate…
Confronto VPS: Hetzner vs Digital Ocean
Abbiamo confrontato 6 fornitori di Virtual Private Server (VPS) eseguendo circa 1.200 test automatizzati per server su CPU, memoria, I/O del disco e velocità di rete utilizzando sysbench, fio e speedtest-cli. Abbiamo anche documentato l'intera esperienza dall'iscrizione all'accesso SSH per ciascun fornitore. Abbiamo utilizzato piani da 4 vCPU (condivisi) / 8 GB di ciascun fornitore,…
A-CODE-LLM Bench: Benchmark di Codifica Agentica
Abbiamo testato i migliori Large Language Models (LLM) su 10 attività di sviluppo software utilizzando uno strumento CLI agentico. Abbiamo eseguito circa 3.500 passaggi di validazione automatizzati per modello sia a livello API che UI. Ogni alias è stato eseguito 3 volte su 10 attività (30 campioni per alias, 400 celle per iterazione su 40…
Benchmark di Marketing Agentic di AIM
Presentiamo il Benchmark di Marketing Agentic di AIM, che misura le prestazioni degli agenti su tre flussi di lavoro di marketing: analisi del gap competitivo, preparazione della lista di target ABM e un deck di vendita personalizzato. Abbiamo anche eseguito un audit separato della reputazione del sito web in cui gli agenti hanno esaminato i…
Newsletter AI Multiple
Una email gratuita a settimana con le ultime notizie tecnologiche B2B e approfondimenti di esperti per dare impulso alla tua azienda.