Şevval Alper
Şevval é pesquisadora de IA na AIMultiple. Ela possui experiência prévia em pesquisa na geração de números pseudoaleatórios utilizando sistemas caóticos.
Interesses de pesquisa
Şevval concentra-se em ferramentas de codificação de IA, agentes de IA e tecnologias quânticas.
Ela faz parte da equipe de avaliação comparativa da AIMultiple, realizando análises e fornecendo informações para ajudar os leitores a compreender diversas tecnologias emergentes e suas aplicações.
Experiência profissional
Ela contribuiu para a organização e orientação dos participantes em três eventos "CERN International Masterclasses - física de partículas prática" na Turquia, trabalhando em conjunto com o corpo docente para facilitar o aprendizado.
Educação
Şevval é bacharel em Física pela Universidade Técnica do Oriente Médio.
Últimos artigos de Şevval
Benchmark de Ferramentas de Revisão de Código com IA
Com o aumento do uso de ferramentas de codificação com IA, as bases de código se tornaram mais propensas a vulnerabilidades, o que aumentou a necessidade de revisões de código eficazes. Para resolver isso, apresentamos o RevEval (Avaliação de Revisão de Código com IA), que avalia comparativamente as quatro principais ferramentas de revisão de código…
Benchmark de Plataformas de Agentes de IA: Claude Managed Agents vs Google Vertex Agent Engine
Comparamos 4 plataformas de agentes de IA em 3 dimensões: conclusão de tarefas (10 tarefas de programação × 3 execuções), capacidades específicas do harness (direcionamento, reconexão, recuperação em conversas longas, tratamento de arquivos grandes) e custo. Claude Managed Agents e Vertex IA Agent Engine alcançam ambos taxas de aprovação de 100% no conjunto de tarefas,…
Execução de Código com MCP: Uma Nova Abordagem para a Eficiência dos Agentes de IA
Anthropic apresentou um método no qual os agentes de IA interagem com os servidores Model Context Protocol (MCP) escrevendo código executável em vez de fazer chamadas diretas às ferramentas. O agente trata as ferramentas como arquivos em um computador, encontra o que precisa e as utiliza diretamente com código, para que os dados intermediários não…
OCR Benchmark: Precisão na Extração/Captura de Texto
A precisão do OCR é crítica para muitas tarefas de processamento de documentos, e os LLMs multimodais de última geração estão agora a oferecer uma alternativa ao OCR. Comparámos os principais serviços de OCR no DeltOCR Bench para identificar os seus níveis de precisão em diferentes tipos de documentos: Os nomes completos dos produtos acima…
Melhor Editor de Código com IA: Cursor vs Windsurf vs Replit
Criar um aplicativo sem habilidades de programação está em alta neste momento. Mas essas ferramentas conseguem criar e implantar um aplicativo com sucesso? Avaliamos 6 editores de código com IA em 10 desafios reais de desenvolvimento web. Cada tarefa exigia implementações como backend, frontend, autenticação e gerenciamento de estado. Avaliamos a correção do backend, o…
Principais Arreios de Agente: Claude Code vs Codex
Os arreios de agente servem como tempo de execução de produção para agentes de IA, com escolhas de design que criam variação de desempenho entre modelos subjacentes idênticos. Avaliamos 17 arreios de agente em 10 tarefas de codificação. Para isolar o arco em vez do modelo, executámos cada CLI agêntica num único modelo de base,…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
VELC-Bench: Verificação em Benchmark de Contexto Longo
A capacidade do modelo de localizar uma métrica específica no contexto, comparar seu valor com uma afirmação e confirmá-la ou rejeitá-la. Isso testa a correspondência precisa de valores em condições de contexto longo. O modelo deve tanto recuperar o valor quanto realizar uma comparação precisa. Os modelos são testados nas seguintes janelas de contexto: claude-fable-5…
Captura de tela para código: Lovable vs v0 vs Bolt
Durante meus 20 anos como desenvolvedor de software, liderei muitas equipes de front-end no desenvolvimento de páginas com base em designs que foram inspirados por capturas de tela. Os designs podem ser transferidos para código usando ferramentas de IA. Embora esperar uma transferência pixel-perfeita seja errado no estado atual das ferramentas, elas podem dar aos…
Simulação de Audiência: LLMs Podem Prever o Comportamento Humano?
Em marketing, avaliar com que precisão os LLMs preveem o comportamento humano é crucial para avaliar sua eficácia em antecipar as necessidades do público e reconhecer os riscos de desalinhamento, comunicação ineficaz ou influência não intencional. A simulação de audiência com LLMs permite a modelagem de públicos virtuais, ajudando as organizações a antecipar reações a…
Boletim informativo AIMultiple
Receba um e-mail gratuito por semana com as últimas notícias de tecnologia B2B e insights de especialistas para impulsionar o seu negócio.