Premium
Serviços
Premium
Şevval Alper

Şevval Alper

Pesquisadora de IA
19 Artigos
Mantenha-se atualizado sobre tecnologia B2B.
Şevval é pesquisadora de IA na AIMultiple. Ela tem experiência anterior de pesquisa em geração de números pseudoaleatórios usando sistemas caóticos.

Interesses de pesquisa

Şevval se concentra em ferramentas de codificação de IA, agentes de IA e tecnologias quânticas.

Ela faz parte da equipe de benchmark da AIMultiple, conduzindo avaliações e fornecendo percepções para ajudar os leitores a entender várias tecnologias emergentes e suas aplicações.

Experiência profissional

Ela contribuiu para a organização e orientação de participantes em três eventos “CERN International Masterclasses - hands-on particle physics” na Türkiye, trabalhando junto ao corpo docente para facilitar o aprendizado.

Educação

Şevval possui bacharelado em Física pela Middle East Technical University.

Últimos artigos de Şevval

IA Agêntica
Benchmark
22 set

A-CODE-LLM Bench: Benchmark de Codificação Agêntica

Avaliamos os melhores Grandes Modelos de Linguagem (LLMs) em 10 tarefas de desenvolvimento de software usando uma ferramenta CLI agentiva. Executamos ~3.500 etapas de validação automatizadas por modelo, tanto na camada API quanto na de UI. Cada alias foi executado 3 vezes em 10 tarefas (30 amostras por alias, 400 células por iteração em 40…

IA
Benchmark
22 set

Benchmark de Ferramentas de Revisão de Código com IA

Com o aumento do uso de ferramentas de codificação com IA, as bases de código se tornaram mais propensas a vulnerabilidades, o que aumentou a necessidade de revisões de código eficazes. Para resolver isso, apresentamos o RevEval (Avaliação de Revisão de Código com IA), que avalia comparativamente as quatro principais ferramentas de revisão de código…

IA Agêntica
21 set

Benchmarks de agentes

IA
Benchmark
18 set

TI Agêntica: Podem os Agentes de IA Conceber um Benchmark

Testámos 16 models na conceção de um benchmark em text-to-SQL e chamada de ferramentas. Cada model criou um benchmark por tópico, num total de 32 submissões. Nenhuma submissão passou em todos os critérios da rubrica. Os agentes conseguiram criar e executar testes, mas nenhum demonstrou simultaneamente um teste de resposta em branco e um teste…

IA
Benchmark
16 set

Benchmark de Codificação de IA: Claude Code vs Cursor

Na codificação com IA, o mercado se fragmentou em duas categorias: ferramentas de CLI agêntica e editores de código de IA incorporados em IDEs. Cada uma afirma automatizar o desenvolvimento. Poucas comparações mostram como elas diferem sob cargas de trabalho idênticas. Avaliamos cada agente em 10 tarefas de desenvolvimento web full-stack, realizando ~600 verificações de…

IA Agêntica
Benchmark
15 set

VELC-Bench: Verificação em Benchmark de Contexto Longo

A capacidade do modelo de localizar uma métrica específica no contexto, comparar seu valor com uma afirmação e confirmá-la ou rejeitá-la. Isso testa a correspondência precisa de valores em condições de contexto longo. O modelo deve tanto recuperar o valor quanto realizar uma comparação precisa. Os modelos são testados nas seguintes janelas de contexto: claude-fable-5…

IA Agêntica
Benchmark
15 set

RELC-Bench: Benchmark de Recuperação em Contexto Longo

O RELC-Bench (RELC-Bench: Benchmark de Recuperação em Contexto Longo) visa medir a capacidade de um modelo de encontrar e extrair um valor numérico específico de um ou mais documentos dentro do seu contexto. Testa se o modelo consegue lembrar e recuperar um facto específico que acabou de ver na entrada. claude-fable-5 obtém 97,0% nos 100…

IA
Benchmark
15 set

Simulação de Audiência: LLMs Podem Prever o Comportamento Humano?

Em marketing, avaliar com que precisão os LLMs preveem o comportamento humano é crucial para avaliar sua eficácia em antecipar as necessidades do público e reconhecer os riscos de desalinhamento, comunicação ineficaz ou influência não intencional. A simulação de audiência com LLMs permite a modelagem de públicos virtuais, ajudando as organizações a antecipar reações a…

IA
Benchmark
15 set

HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Contexto Longo

HALC-Bench (LLM Alucinação em Benchmark de Recuperação de Contexto Longo) mede a resistência de um modelo de linguagem grande a fabricar evidência para uma métrica que não existe no documento alvo, usando 3 palheiros colocados no início, meio e fim da janela de contexto do modelo, com 204 questões. claude-fable-5 respondeu corretamente a todas as…

IA Agêntica
Benchmark
11 set

Execução de código com MCP: uma nova abordagem para a eficiência de agentes de IA

Anthropic apresentou um método no qual os agentes de IA interagem com Model Context Protocol (MCP) servidores escrevendo código executável em vez de fazer chamadas diretas a ferramentas. O agente trata as ferramentas como arquivos em um computador, encontra o que precisa e as utiliza diretamente com código, de modo que os dados intermediários não…