Servicios
Contáctanos
Şevval Alper

Şevval Alper

Investigadora de IA
21 Artículos
Mantente al día sobre tecnología B2B.
Şevval es investigadora de IA en AIMultiple. Tiene experiencia previa en investigación sobre la generación de números pseudoaleatorios mediante sistemas caóticos.

Intereses de investigación

Şevval se centra en herramientas de codificación con IA, agentes de IA y tecnologías cuánticas.

Forma parte del equipo de benchmark de AIMultiple, realiza evaluaciones y aporta información para ayudar a los lectores a comprender diversas tecnologías emergentes y sus aplicaciones.

Experiencia profesional

Contribuyó a organizar y guiar a los participantes en tres eventos “CERN International Masterclasses - hands-on particle physics” en Türkiye, colaborando con el profesorado para facilitar el aprendizaje.

Formación académica

Şevval tiene una licenciatura en Física por la Middle East Technical University.

Últimos artículos de Şevval

IA
Benchmark
1 de Sep

Simulación de audiencia: ¿Pueden los LLMs predecir el comportamiento humano?

En marketing, evaluar con qué precisión los LLMs predicen el comportamiento humano es crucial para valorar su efectividad en la anticipación de las necesidades de la audiencia y reconocer los riesgos de desalineación, comunicación ineficaz o influencia no deseada. La simulación de audiencias con LLMs permite modelar audiencias virtuales, ayudando a las organizaciones a prever…

Agentic AI28 de Ago

Agentes de IA: Operador vs Uso del Navegador vs Proyecto Mariner

Los agentes de IA se comercializan cada vez más como trabajadores digitales de extremo a extremo, pero el rendimiento en el mundo real puede variar ampliamente dependiendo de la tarea, las herramientas y el entorno de ejecución. Para comprender lo que estos sistemas pueden entregar genuinamente hoy, realizamos pruebas de referencia prácticas en escenarios comerciales…

Agentic AI
Benchmark
27 de Ago

Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA

Anthropic presentó un método en el que los agentes de IA interactúan con Model Context Protocol (MCP) servidores escribiendo código ejecutable en lugar de hacer llamadas directas a herramientas. El agente trata las herramientas como archivos en una computadora, encuentra lo que necesita y las usa directamente con código, de modo que los datos intermedios…

IA
Benchmark
24 de Ago

Benchmark de codificación con IA: Claude Code vs Cursor

En la programación con IA, el mercado se ha fragmentado en dos categorías: herramientas de CLI agéntico y editores de código con IA integrados en IDE. Cada una afirma automatizar el desarrollo. Pocas comparaciones muestran cómo difieren bajo cargas de trabajo idénticas. Evaluamos a cada agente en 10 tareas de desarrollo web de pila completa,…

Agentic AI
Benchmark
21 de Ago

Benchmark de plataformas de agentes de IA: Claude Managed Agents vs Google Vertex Agent Engine

Evaluamos 4 plataformas de agentes de IA en 3 dimensiones: finalización de tareas (10 tareas de programación × 3 ejecuciones), capacidades específicas del harness (dirección, reconexión, recuperación en conversaciones largas, manejo de archivos grandes) y costo. Claude Managed Agents y Vertex IA Agent Engine logran ambos tasas de aprobación del 100 % en el conjunto de…

Agentic AI
Benchmark
21 de Ago

RELC-Bench: Evaluación de Recuperación en Contexto Largo

RELC-Bench (RELC-Bench: Evaluación de Recuperación en Contexto Largo) tiene como objetivo medir la capacidad de un modelo para encontrar y extraer un valor numérico específico de uno o más documentos dentro de su contexto. Comprueba si el modelo puede recordar y recuperar un hecho específico que acaba de ver en la entrada. claude-fable-5 obtiene 97.0 %…

Agentic AI
Benchmark
21 de Ago

MCP Benchmark: Los mejores MCP servidores para acceso web

Evaluamos 8 MCP servidores en tareas de búsqueda y extracción web, así como de automatización de navegadores, ejecutando 4 tareas diferentes 5 veces en todos los MCP adecuados. También realizamos una prueba de carga con 250 agentes de IA concurrentes. *Las tareas de búsqueda y extracción web se ejecutan con el Bright Data servidor MCP…

IA
Análisis
21 de Ago

LLM Parámetros: GPT-5 High, Medio, Bajo y Mínimo

Algunos LLM, como la familia GPT-5 de OpenAI, vienen en diferentes versiones (por ejemplo, GPT-5, GPT-5-mini y GPT-5-nano) y con varios ajustes de parámetros, incluyendo alto, medio, bajo y mínimo. A continuación, exploramos las diferencias entre estas versiones de modelo comparando su rendimiento en benchmarks y los costes para ejecutar dichos benchmarks. Utilizamos la familia…

IA
Benchmark
21 de Ago

HALC-Bench: LLM Alucinación en Benchmark de Recuperación de Contexto Largo

HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mide la resistencia de un LLM a fabricar evidencia para una métrica que no existe en el documento objetivo mediante el uso de 3 pajares colocados al principio, en el medio y al final de la ventana de contexto del modelo, con 204 preguntas. claude-fable-5 respondió correctamente a…

IA
Benchmark
21 de Ago

Mejor editor de código con IA: Cursor vs Windsurf vs Replit

Crear una app sin saber programar es una gran tendencia ahora mismo. ¿Pero pueden estas herramientas construir y desplegar una app con éxito? Evaluamos 6 editores de código con IA en 10 desafíos reales de desarrollo web. Cada tarea requería implementaciones como backend, frontend, autenticación y gestión de estado. Evaluamos la corrección del backend, el…