Serviços
Contate-nos
Şevval Alper

Şevval Alper

Pesquisadora de IA
21 Artigos
Mantenha-se atualizado sobre tecnologia B2B.
Şevval é pesquisadora de IA na AIMultiple. Ela tem experiência anterior de pesquisa em geração de números pseudoaleatórios usando sistemas caóticos.

Interesses de pesquisa

Şevval se concentra em ferramentas de codificação de IA, agentes de IA e tecnologias quânticas.

Ela faz parte da equipe de benchmark da AIMultiple, conduzindo avaliações e fornecendo percepções para ajudar os leitores a entender várias tecnologias emergentes e suas aplicações.

Experiência profissional

Ela contribuiu para a organização e orientação de participantes em três eventos “CERN International Masterclasses - hands-on particle physics” na Türkiye, trabalhando junto ao corpo docente para facilitar o aprendizado.

Educação

Şevval possui bacharelado em Física pela Middle East Technical University.

Últimos artigos de Şevval

IA
Benchmark
1 Set

Simulação de Audiência: LLMs Podem Prever o Comportamento Humano?

Em marketing, avaliar com que precisão os LLMs preveem o comportamento humano é crucial para avaliar sua eficácia em antecipar as necessidades do público e reconhecer os riscos de desalinhamento, comunicação ineficaz ou influência não intencional. A simulação de audiência com LLMs permite a modelagem de públicos virtuais, ajudando as organizações a antecipar reações a…

IA Agêntica28 Ago

Agentes de IA: Operator vs Uso do Navegador vs Projeto Mariner

Agentes de IA são cada vez mais comercializados como trabalhadores digitais de ponta a ponta, mas o desempenho no mundo real pode variar amplamente dependendo da tarefa, ferramentas e ambiente de execução. Para entender o que esses sistemas podem realmente entregar hoje, realizamos testes práticos em cenários comerciais reais. Passamos mais de 40 horas testando…

IA Agêntica
Benchmark
27 Ago

Execução de Código com MCP: Uma Nova Abordagem para a Eficiência dos Agentes de IA

Anthropic apresentou um método no qual os agentes de IA interagem com os servidores Model Context Protocol (MCP) escrevendo código executável em vez de fazer chamadas diretas às ferramentas. O agente trata as ferramentas como arquivos em um computador, encontra o que precisa e as utiliza diretamente com código, para que os dados intermediários não…

IA
Benchmark
24 Ago

Benchmark de Codificação de IA: Claude Code vs Cursor

Na codificação com IA, o mercado se fragmentou em duas categorias: ferramentas de CLI agêntica e editores de código de IA incorporados em IDEs. Cada uma afirma automatizar o desenvolvimento. Poucas comparações mostram como elas diferem sob cargas de trabalho idênticas. Avaliamos cada agente em 10 tarefas de desenvolvimento web full-stack, realizando ~600 verificações de…

IA Agêntica
Benchmark
21 Ago

Benchmark de Plataformas de Agentes de IA: Claude Managed Agents vs Google Vertex Agent Engine

Comparamos 4 plataformas de agentes de IA em 3 dimensões: conclusão de tarefas (10 tarefas de programação × 3 execuções), capacidades específicas do harness (direcionamento, reconexão, recuperação em conversas longas, tratamento de arquivos grandes) e custo. Claude Managed Agents e Vertex IA Agent Engine alcançam ambos taxas de aprovação de 100% no conjunto de tarefas,…

IA Agêntica
Benchmark
21 Ago

RELC-Bench: Benchmark de Recuperação em Contexto Longo

O RELC-Bench (RELC-Bench: Benchmark de Recuperação em Contexto Longo) visa medir a capacidade de um modelo de encontrar e extrair um valor numérico específico de um ou mais documentos dentro do seu contexto. Testa se o modelo consegue lembrar e recuperar um facto específico que acabou de ver na entrada. claude-fable-5 obtém 97.0% nos 100…

IA Agêntica
Benchmark
21 Ago

MCP Benchmark: Principais Servidores MCP para Acesso à Web

Avaliámos 8 MCP servidores em tarefas de pesquisa e extração web, bem como automação de navegador, executando 4 tarefas diferentes 5 vezes em todos os MCPs adequados. Também realizámos um teste de carga envolvendo 250 agentes de IA simultâneos. *As tarefas de pesquisa e extração web são executadas com o servidor MCP padrão do Bright…

IA
Análise
21 Ago

LLM Parameters: GPT-5 High, Medium, Low and Minimal

Alguns LLMs, como a família GPT-5 da OpenAI, vêm em diferentes versões (por exemplo, GPT-5, GPT-5-mini e GPT-5-nano) e com várias configurações de parâmetros, incluindo alta, média, baixa e mínima. Abaixo, exploramos as diferenças entre essas versões de modelo reunindo seu desempenho em benchmarks e os custos para executá-los. Usamos a família GPT-5 em nossa…

IA
Benchmark
21 Ago

HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Contexto Longo

HALC-Bench (LLM Alucinação em Benchmark de Recuperação de Contexto Longo) mede a resistência de um modelo de linguagem grande a fabricar evidência para uma métrica que não existe no documento alvo, usando 3 palheiros colocados no início, meio e fim da janela de contexto do modelo, com 204 questões. claude-fable-5 respondeu corretamente a todas as…

IA
Benchmark
21 Ago

Melhor Editor de Código com IA: Cursor vs Windsurf vs Replit

Criar um aplicativo sem habilidades de programação está em alta neste momento. Mas essas ferramentas conseguem criar e implantar um aplicativo com sucesso? Avaliamos 6 editores de código com IA em 10 desafios reais de desenvolvimento web. Cada tarefa exigia implementações como backend, frontend, autenticação e gerenciamento de estado. Avaliamos a correção do backend, o…