Berk Kalelioğlu
Interesses de pesquisa
Berk concentra-se em aprendizado de máquina, ferramentas de IA agêntica e grandes e pequenos language models (LLMs e SLMs).Ele faz parte da equipe de benchmark da AIMultiple, realizando avaliações e fornecendo percepções para ajudar os leitores a entender tecnologias emergentes e suas aplicações no mundo real.
Experiência profissional
Ele começou sua carreira como Líder de Projeto Técnico na ODTU IVME-R, onde liderou um projeto para construir geradores físicos quânticos e de números pseudoaleatórios.Após sua passagem pela IVME-R, ele cofundou uma empresa de desenvolvimento de jogos e lançou um jogo na Steam.
Mais tarde, mudou sua carreira para a área de IA e ingressou na AIMultiple como Pesquisador.
Educação
Berk é bacharel em Matemática pela Ankara University.Últimos artigos de Berk
Teste de Referência VPS: Hetzner vs Digital Ocean
Testamos 6 provedores de Servidor Virtual Privado (VPS) executando ~1.200 testes automatizados por servidor em CPU, memória, I/O de disco e velocidade de rede usando sysbench, fio e speedtest-cli. Também documentamos a experiência completa de cadastro ao SSH para cada provedor. Utilizamos planos de 4 vCPU (Compartilhada) / 8 GB de cada provedor, sem adicionar…
A-CODE-LLM Bench: Benchmark de Codificação Agêntica
Avaliamos os melhores Grandes Modelos de Linguagem (LLMs) em 10 tarefas de desenvolvimento de software usando uma ferramenta CLI agentiva. Executamos ~3.500 etapas de validação automatizadas por modelo, tanto na camada API quanto na de UI. Cada alias foi executado 3 vezes em 10 tarefas (30 amostras por alias, 400 células por iteração em 40…
Benchmark AIM de Marketing Agêntico
Estamos a apresentar o Benchmark AIM de Marketing Agêntico, que mede o desempenho dos agentes em três fluxos de trabalho de marketing: análise de lacunas competitivas, preparação de listas de alvos ABM e um deck de vendas personalizado. Também realizámos uma auditoria de reputação do site separada, na qual os agentes examinaram o conteúdo em…
Benchmark de Modelos Tabulares: Desempenho em 19 Datasets
Comparamos 8 modelos de aprendizagem tabular em 19 datasets reais que abrangem aproximadamente 260.000 amostras, com tamanhos de dataset de 435 a 48.800 linhas. Todos os modelos foram executados na mesma máquina com validação cruzada de 5 dobras e divisões idênticas. Cada dataset é um round-robin de confrontos diretos entre modelos, decididos pela métrica principal.…
Boletim informativo AIMultiple
Receba um e-mail gratuito por semana com as últimas notícias de tecnologia B2B e insights de especialistas para impulsionar o seu negócio.