Şevval Alper
Intereses de investigación
Şevval se centra en herramientas de codificación con IA, agentes de IA y tecnologías cuánticas.Forma parte del equipo de benchmark de AIMultiple, realiza evaluaciones y aporta información para ayudar a los lectores a comprender diversas tecnologías emergentes y sus aplicaciones.
Experiencia profesional
Contribuyó a organizar y guiar a los participantes en tres eventos “CERN International Masterclasses - hands-on particle physics” en Türkiye, colaborando con el profesorado para facilitar el aprendizaje.Formación académica
Şevval tiene una licenciatura en Física por la Middle East Technical University.Últimos artículos de Şevval
Simulación de audiencia: ¿Pueden los LLMs predecir el comportamiento humano?
En marketing, evaluar con qué precisión los LLMs predicen el comportamiento humano es crucial para valorar su efectividad en la anticipación de las necesidades de la audiencia y reconocer los riesgos de desalineación, comunicación ineficaz o influencia no deseada. La simulación de audiencias con LLMs permite modelar audiencias virtuales, ayudando a las organizaciones a prever…
Agentes de IA: Operador vs Uso del Navegador vs Proyecto Mariner
Los agentes de IA se comercializan cada vez más como trabajadores digitales de extremo a extremo, pero el rendimiento en el mundo real puede variar ampliamente dependiendo de la tarea, las herramientas y el entorno de ejecución. Para comprender lo que estos sistemas pueden entregar genuinamente hoy, realizamos pruebas de referencia prácticas en escenarios comerciales…
Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA
Anthropic presentó un método en el que los agentes de IA interactúan con Model Context Protocol (MCP) servidores escribiendo código ejecutable en lugar de hacer llamadas directas a herramientas. El agente trata las herramientas como archivos en una computadora, encuentra lo que necesita y las usa directamente con código, de modo que los datos intermedios…
Benchmark de codificación con IA: Claude Code vs Cursor
En la programación con IA, el mercado se ha fragmentado en dos categorías: herramientas de CLI agéntico y editores de código con IA integrados en IDE. Cada una afirma automatizar el desarrollo. Pocas comparaciones muestran cómo difieren bajo cargas de trabajo idénticas. Evaluamos a cada agente en 10 tareas de desarrollo web de pila completa,…
Benchmark de plataformas de agentes de IA: Claude Managed Agents vs Google Vertex Agent Engine
Evaluamos 4 plataformas de agentes de IA en 3 dimensiones: finalización de tareas (10 tareas de programación × 3 ejecuciones), capacidades específicas del harness (dirección, reconexión, recuperación en conversaciones largas, manejo de archivos grandes) y costo. Claude Managed Agents y Vertex IA Agent Engine logran ambos tasas de aprobación del 100 % en el conjunto de…
RELC-Bench: Evaluación de Recuperación en Contexto Largo
RELC-Bench (RELC-Bench: Evaluación de Recuperación en Contexto Largo) tiene como objetivo medir la capacidad de un modelo para encontrar y extraer un valor numérico específico de uno o más documentos dentro de su contexto. Comprueba si el modelo puede recordar y recuperar un hecho específico que acaba de ver en la entrada. claude-fable-5 obtiene 97.0 %…
MCP Benchmark: Los mejores MCP servidores para acceso web
Evaluamos 8 MCP servidores en tareas de búsqueda y extracción web, así como de automatización de navegadores, ejecutando 4 tareas diferentes 5 veces en todos los MCP adecuados. También realizamos una prueba de carga con 250 agentes de IA concurrentes. *Las tareas de búsqueda y extracción web se ejecutan con el Bright Data servidor MCP…
LLM Parámetros: GPT-5 High, Medio, Bajo y Mínimo
Algunos LLM, como la familia GPT-5 de OpenAI, vienen en diferentes versiones (por ejemplo, GPT-5, GPT-5-mini y GPT-5-nano) y con varios ajustes de parámetros, incluyendo alto, medio, bajo y mínimo. A continuación, exploramos las diferencias entre estas versiones de modelo comparando su rendimiento en benchmarks y los costes para ejecutar dichos benchmarks. Utilizamos la familia…
HALC-Bench: LLM Alucinación en Benchmark de Recuperación de Contexto Largo
HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mide la resistencia de un LLM a fabricar evidencia para una métrica que no existe en el documento objetivo mediante el uso de 3 pajares colocados al principio, en el medio y al final de la ventana de contexto del modelo, con 204 preguntas. claude-fable-5 respondió correctamente a…
Mejor editor de código con IA: Cursor vs Windsurf vs Replit
Crear una app sin saber programar es una gran tendencia ahora mismo. ¿Pero pueden estas herramientas construir y desplegar una app con éxito? Evaluamos 6 editores de código con IA en 10 desafíos reales de desarrollo web. Cada tarea requería implementaciones como backend, frontend, autenticación y gestión de estado. Evaluamos la corrección del backend, el…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.