Şevval Alper
Intereses de investigación
Şevval se centra en herramientas de codificación con IA, agentes de IA y tecnologías cuánticas.Forma parte del equipo de benchmark de AIMultiple, realiza evaluaciones y aporta información para ayudar a los lectores a comprender diversas tecnologías emergentes y sus aplicaciones.
Experiencia profesional
Contribuyó a organizar y guiar a los participantes en tres eventos “CERN International Masterclasses - hands-on particle physics” en Türkiye, colaborando con el profesorado para facilitar el aprendizaje.Formación académica
Şevval tiene una licenciatura en Física por la Middle East Technical University.Últimos artículos de Şevval
A-CODE-LLM Bench: Evaluación comparativa de codificación agéntica
Evaluamos los principales grandes modelos de lenguaje (LLMs) en 10 tareas de desarrollo de software utilizando una herramienta CLI agéntica. Ejecutamos aproximadamente 3.500 pasos de validación automatizados por modelo en ambas capas API y UI. Cada alias se ejecutó 3 veces en 10 tareas (30 muestras por alias, 400 celdas por iteración en 40 alias).…
Benchmark de herramientas de revisión de código con IA
Con el mayor uso de herramientas de programación con IA, los repositorios de código se han vuelto más propensos a vulnerabilidades, lo que aumentó la necesidad de revisiones de código eficaces. Para abordar esto, presentamos RevEval (IA Code Review Eval), que compara las cuatro principales herramientas de revisión de código con IA en 309 solicitudes…
Benchmarks de agentes
TI agéntica: ¿Pueden los agentes de IA diseñar un benchmark?
Probamos 16 modelos en un diseño de benchmark de texto a SQL y llamada de herramientas. Cada modelo creó un benchmark por tema, para un total de 32 envíos. Ningún envío superó todos los criterios de la rúbrica. Los agentes pudieron construir y ejecutar pruebas, pero ninguno demostró a la vez una prueba de respuesta…
Benchmark de codificación con IA: Claude Code vs Cursor
En la programación con IA, el mercado se ha fragmentado en dos categorías: herramientas de CLI agéntico y editores de código con IA integrados en IDE. Cada una afirma automatizar el desarrollo. Pocas comparaciones muestran cómo difieren bajo cargas de trabajo idénticas. Evaluamos a cada agente en 10 tareas de desarrollo web de pila completa,…
VELC-Bench: Verificación en el Benchmark de Contexto Largo
La capacidad del modelo para localizar una métrica específica en el contexto, comparar su valor con una afirmación y confirmarla o rechazarla. Esto evalúa la coincidencia precisa de valores en condiciones de contexto largo. El modelo debe recuperar el valor y realizar una comparación precisa. Los modelos se evalúan en las siguientes ventanas de contexto:…
RELC-Bench: Evaluación de Recuperación en Contexto Largo
RELC-Bench (RELC-Bench: Evaluación de Recuperación en Contexto Largo) tiene como objetivo medir la capacidad de un modelo para encontrar y extraer un valor numérico específico de uno o más documentos dentro de su contexto. Comprueba si el modelo puede recordar y recuperar un hecho específico que acaba de ver en la entrada. claude-fable-5 obtiene 97,0 %…
Simulación de audiencia: ¿Pueden los LLMs predecir el comportamiento humano?
En marketing, evaluar con qué precisión los LLMs predicen el comportamiento humano es crucial para valorar su efectividad en la anticipación de las necesidades de la audiencia y reconocer los riesgos de desalineación, comunicación ineficaz o influencia no deseada. La simulación de audiencias con LLMs permite modelar audiencias virtuales, ayudando a las organizaciones a prever…
HALC-Bench: LLM Alucinación en Benchmark de Recuperación de Contexto Largo
HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mide la resistencia de un LLM a fabricar evidencia para una métrica que no existe en el documento objetivo mediante el uso de 3 pajares colocados al principio, en el medio y al final de la ventana de contexto del modelo, con 204 preguntas. claude-fable-5 respondió correctamente a…
Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA
Anthropic presentó un método en el que los agentes de IA interactúan con servidores de Model Context Protocol (MCP) escribiendo código ejecutable en lugar de realizar llamadas directas a herramientas. El agente trata las herramientas como archivos en un ordenador, encuentra lo que necesita y las usa directamente con código, por lo que los datos…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.