Premium
Servicios
Premium
Şevval Alper

Şevval Alper

Investigadora de IA
19 Artículos
Mantente al día sobre tecnología B2B.
Şevval es investigadora de IA en AIMultiple. Tiene experiencia previa en investigación sobre la generación de números pseudoaleatorios mediante sistemas caóticos.

Intereses de investigación

Şevval se centra en herramientas de codificación con IA, agentes de IA y tecnologías cuánticas.

Forma parte del equipo de benchmark de AIMultiple, realiza evaluaciones y aporta información para ayudar a los lectores a comprender diversas tecnologías emergentes y sus aplicaciones.

Experiencia profesional

Contribuyó a organizar y guiar a los participantes en tres eventos “CERN International Masterclasses - hands-on particle physics” en Türkiye, colaborando con el profesorado para facilitar el aprendizaje.

Formación académica

Şevval tiene una licenciatura en Física por la Middle East Technical University.

Últimos artículos de Şevval

Agentic AI
Benchmark
22 de sep

A-CODE-LLM Bench: Evaluación comparativa de codificación agéntica

Evaluamos los principales grandes modelos de lenguaje (LLMs) en 10 tareas de desarrollo de software utilizando una herramienta CLI agéntica. Ejecutamos aproximadamente 3.500 pasos de validación automatizados por modelo en ambas capas API y UI. Cada alias se ejecutó 3 veces en 10 tareas (30 muestras por alias, 400 celdas por iteración en 40 alias).…

IA
Benchmark
22 de sep

Benchmark de herramientas de revisión de código con IA

Con el mayor uso de herramientas de programación con IA, los repositorios de código se han vuelto más propensos a vulnerabilidades, lo que aumentó la necesidad de revisiones de código eficaces. Para abordar esto, presentamos RevEval (IA Code Review Eval), que compara las cuatro principales herramientas de revisión de código con IA en 309 solicitudes…

Agentic AI
21 de sep

Benchmarks de agentes

IA
Benchmark
18 de sep

TI agéntica: ¿Pueden los agentes de IA diseñar un benchmark?

Probamos 16 modelos en un diseño de benchmark de texto a SQL y llamada de herramientas. Cada modelo creó un benchmark por tema, para un total de 32 envíos. Ningún envío superó todos los criterios de la rúbrica. Los agentes pudieron construir y ejecutar pruebas, pero ninguno demostró a la vez una prueba de respuesta…

IA
Benchmark
16 de sep

Benchmark de codificación con IA: Claude Code vs Cursor

En la programación con IA, el mercado se ha fragmentado en dos categorías: herramientas de CLI agéntico y editores de código con IA integrados en IDE. Cada una afirma automatizar el desarrollo. Pocas comparaciones muestran cómo difieren bajo cargas de trabajo idénticas. Evaluamos a cada agente en 10 tareas de desarrollo web de pila completa,…

Agentic AI
Benchmark
15 de sep

VELC-Bench: Verificación en el Benchmark de Contexto Largo

La capacidad del modelo para localizar una métrica específica en el contexto, comparar su valor con una afirmación y confirmarla o rechazarla. Esto evalúa la coincidencia precisa de valores en condiciones de contexto largo. El modelo debe recuperar el valor y realizar una comparación precisa. Los modelos se evalúan en las siguientes ventanas de contexto:…

Agentic AI
Benchmark
15 de sep

RELC-Bench: Evaluación de Recuperación en Contexto Largo

RELC-Bench (RELC-Bench: Evaluación de Recuperación en Contexto Largo) tiene como objetivo medir la capacidad de un modelo para encontrar y extraer un valor numérico específico de uno o más documentos dentro de su contexto. Comprueba si el modelo puede recordar y recuperar un hecho específico que acaba de ver en la entrada. claude-fable-5 obtiene 97,0 %…

IA
Benchmark
15 de sep

Simulación de audiencia: ¿Pueden los LLMs predecir el comportamiento humano?

En marketing, evaluar con qué precisión los LLMs predicen el comportamiento humano es crucial para valorar su efectividad en la anticipación de las necesidades de la audiencia y reconocer los riesgos de desalineación, comunicación ineficaz o influencia no deseada. La simulación de audiencias con LLMs permite modelar audiencias virtuales, ayudando a las organizaciones a prever…

IA
Benchmark
15 de sep

HALC-Bench: LLM Alucinación en Benchmark de Recuperación de Contexto Largo

HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mide la resistencia de un LLM a fabricar evidencia para una métrica que no existe en el documento objetivo mediante el uso de 3 pajares colocados al principio, en el medio y al final de la ventana de contexto del modelo, con 204 preguntas. claude-fable-5 respondió correctamente a…

Agentic AI
Benchmark
11 de sep

Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA

Anthropic presentó un método en el que los agentes de IA interactúan con servidores de Model Context Protocol (MCP) escribiendo código ejecutable en lugar de realizar llamadas directas a herramientas. El agente trata las herramientas como archivos en un ordenador, encuentra lo que necesita y las usa directamente con código, por lo que los datos…