Berk Kalelioğlu
Interessi di ricerca
Berk si concentra su apprendimento automatico, strumenti di IA agentica e modelli linguistici grandi e piccoli (LLM e SLM).Fa parte del team benchmark di AIMultiple, conducendo valutazioni e fornendo approfondimenti per aiutare i lettori a comprendere le tecnologie emergenti e le loro applicazioni nel mondo reale.
Esperienza professionale
Ha iniziato la carriera come Responsabile di progetto tecnico presso ODTU IVME-R, dove ha guidato un progetto per realizzare generatori quantistici fisici e di numeri pseudocasuali.Dopo l'esperienza presso IVME-R, ha cofondato una società di sviluppo di videogiochi e ha pubblicato un gioco su Steam.
In seguito ha orientato la sua carriera verso l'IA ed è entrato in AIMultiple come ricercatore.
Formazione
Berk ha conseguito una laurea triennale in Matematica presso Ankara University.Ultimi articoli di Berk
AIM-Decision: Jev contro Kev contro LLMs
I modelli decisionali, detti anche modelli System One,1 scelgono l’azione successiva di un agente in un unico passaggio invece di generare testo token per token. Per verificare se possono rendere l’automazione del browser più economica rispetto agli LLM, abbiamo eseguito tre modelli decisionali e due LLM, Gemini 3.8 Flash e GPT-6 Astra, sugli stessi 50…
AIM Benchmark Web Agentico
Gli agenti si affidano alle interfacce web per completare le attività sul web. Per misurare come la scelta dell'interfaccia influisca sul completamento delle attività, abbiamo creato l'AIM Benchmark Web Agentico e abbiamo tentato 3.500 attività (100 attività completate tramite 7 interfacce web in 5 esecuzioni). Un'Bright Data interfaccia ha guidato ogni esecuzione. La CLI di…
IT agentico: gli agenti IA possono progettare un benchmark
Abbiamo testato 16 modelli sulla progettazione di un benchmark in text-to-SQL e tool calling. Ogni modello ha creato un benchmark per argomento, per un totale di 32 proposte. Nessuna proposta ha superato ogni criterio della rubrica. Gli agenti sono riusciti a creare ed eseguire test, ma nessuno ha dimostrato sia un test con risposta vuota…
AIM Enterprise: benchmark aziendale agentico
Le aziende usano gli LLM ogni giorno per le loro attività regolari. Per trovare gli LLM più convenienti, abbiamo progettato AIM Enterprise, un benchmark aziendale agentico, in cui abbiamo utilizzato 69 attività aziendali reali tra strategia, marketing, HR, vendite e operazioni. Due modelli giudici hanno valutato ogni file che ha superato i controlli. Nel 32,7%…
Deep Research IA: Codex vs Claude vs Grok vs Exa
Uno strumento di deep research risponde a una domanda con un report scritto invece di una pagina di link. Abbiamo eseguito cinque modi per produrne uno sugli stessi 20 brief di ricerca aziendale e abbiamo valutato ogni report in base a regole scritte prima delle esecuzioni per trovare il miglior strumento per la deep research.…
Migliori fornitori di LLM API a tariffa fissa
I fornitori di LLM a tariffa fissa vendono un utilizzo illimitato del modello a un prezzo mensile fisso invece di fatturare a token. Questo modello si è diffuso perché le sessioni di coding agentico possono utilizzare decine di milioni di token, rendendo difficile prevedere una fattura a consumo. Pochissimi fornitori offrono una vera tariffa fissa;…
Benchmark IA VC: 16 agenti IA sull'identificazione dei clienti
L'identificazione dei clienti fa parte della due diligence commerciale. Abbiamo testato 16 modelli nella ricerca di elenchi clienti per tre siti di ricerca e recensioni, uno dei quali AIMultiple, valutando i loro invii rispetto alle chiavi di risposta da noi compilate e alle pagine citate. Non abbiamo impostato alcun livello di ragionamento per nessun modello.…
Alternative a OpenClaw: Hermes vs ZeroClaw vs Grok Bot
Gli agenti IA autonomi, come OpenClaw e l'agente Hermes, automatizzano attività multi-step che normalmente richiederebbero un input umano costante. Sebbene OpenClaw sia diventato l'agente autonomo sempre attivo più adottato, molti utenti cercano alternative a causa del suo processo di distribuzione impegnativo e dei complessi requisiti di configurazione. Forniamo 5 alternative principali a OpenClaw, evidenziandone le…
Agenti per l'uso del computer: Benchmark e Architettura
Gli agenti per l'uso del computer operano su desktop reali e applicazioni web. I loro design, limiti e compromessi sono spesso poco chiari. Analizziamo come funzionano i sistemi principali, come apprendono e come le loro architetture differiscono. Facciamo anche riferimento a un benchmark focalizzato sul grounding dell'UI su 100 screenshot desktop, attraverso 4 tipi di…
MCP Gateway Benchmark: latenza e sicurezza di 6 gateway
Un MCP gateway si trova tra un agente IA e i tool che chiama, e i vendor lo posizionano come livello di sicurezza per quel traffico. Abbiamo confrontato sei MCP gateway con un backend strumentato su una singola macchina, misurando la latenza aggiunta, l'autorizzazione per-tool, la protezione dei contenuti e la completezza dell'audit. Un prodotto…
Newsletter AI Multiple
Una email gratuita a settimana con le ultime notizie tecnologiche B2B e approfondimenti di esperti per dare impulso alla tua azienda.