Berk Kalelioğlu
Interesses de pesquisa
Berk concentra-se em aprendizado de máquina, ferramentas de IA agêntica e grandes e pequenos language models (LLMs e SLMs).Ele faz parte da equipe de benchmark da AIMultiple, realizando avaliações e fornecendo percepções para ajudar os leitores a entender tecnologias emergentes e suas aplicações no mundo real.
Experiência profissional
Ele começou sua carreira como Líder de Projeto Técnico na ODTU IVME-R, onde liderou um projeto para construir geradores físicos quânticos e de números pseudoaleatórios.Após sua passagem pela IVME-R, ele cofundou uma empresa de desenvolvimento de jogos e lançou um jogo na Steam.
Mais tarde, mudou sua carreira para a área de IA e ingressou na AIMultiple como Pesquisador.
Educação
Berk é bacharel em Matemática pela Ankara University.Últimos artigos de Berk
Agentes de Uso de Computador: Benchmark & Arquitetura
Os agentes de uso de computador operam desktops e aplicativos web reais. Seus designs, limites e compensações muitas vezes não são claros. Nós detalhamos como os sistemas líderes funcionam, como aprendem e como suas arquiteturas diferem. Também referenciamos um benchmark focado de ancoragem de IU em 100 capturas de tela de desktop, em 4 tipos…
Benchmark de Classificação de Séries Temporais: Foundation Models vs Métodos Clássicos
Avaliamos 13 métodos de classificação de séries temporais, de foundation models de séries temporais pré-treinados a uma baseline de 22 features de 2019, em 33 datasets UCR/UEA sob um único protocolo congelado. São 14.638 células registradas de método-dataset-reamostragem, 11.874 delas pontuadas. O gráfico compara 12 métodos nos 15 datasets univariados que todos completaram, cada dataset…
A-CODE-CLI Bench: Benchmark de CLI agêntica
As ferramentas CLI agênticas são ferramentas de codificação de IA que podem criar e excluir arquivos, executar comandos, planejar e executar a codificação de todo o projeto. Avaliamos as principais ferramentas em 10 cenários reais de desenvolvimento web, realizando ~600 verificações atômicas de validação por agente e mais de ~5.000 execuções de teste automatizadas no…
Benchmark VPS: Hetzner vs Digital Ocean
Nós fizemos benchmark de 6 provedores de Servidor Virtual Privado (VPS) executando ~1.200 testes automatizados por servidor em CPU, memória, E/S de disco e velocidade de rede usando sysbench, fio e speedtest-cli. Também documentamos a experiência completa de cadastro até SSH para cada provedor. Usamos planos de 4 vCPU (Compartilhado) / 8 GB de cada…
Benchmark AIM de Marketing Agêntico
Estamos a apresentar o Benchmark AIM de Marketing Agêntico, que mede o desempenho dos agentes em três fluxos de trabalho de marketing: análise de lacunas competitivas, preparação de listas de alvos ABM e um deck de vendas personalizado. Também realizámos uma auditoria de reputação do site separada, na qual os agentes examinaram o conteúdo em…
Benchmark de Modelos Tabulares: Desempenho em 19 Datasets
Comparamos 8 modelos de aprendizagem tabular em 19 datasets reais que abrangem aproximadamente 260.000 amostras, com tamanhos de dataset de 435 a 48.800 linhas. Todos os modelos foram executados na mesma máquina com validação cruzada de 5 dobras e divisões idênticas. Cada dataset é um round-robin de confrontos diretos entre modelos, decididos pela métrica principal.…
Boletim informativo AIMultiple
Receba um e-mail gratuito por semana com as últimas notícias de tecnologia B2B e insights de especialistas para impulsionar o seu negócio.