Şevval Alper
Şevval es investigadora de IA en AIMultiple. Cuenta con experiencia previa en la generación de números pseudoaleatorios mediante sistemas caóticos.
Intereses de investigación
Şevval se centra en herramientas de codificación de IA, agentes de IA y tecnologías cuánticas.
Forma parte del equipo de evaluación comparativa de AIMultiple, donde realiza análisis y aporta información para ayudar a los lectores a comprender diversas tecnologías emergentes y sus aplicaciones.
Experiencia profesional
Contribuyó a la organización y orientación de los participantes en tres eventos de "Clases Magistrales Internacionales del CERN: física de partículas práctica" en Turquía, trabajando junto con el profesorado para facilitar el aprendizaje.
Educación
Şevval posee una licenciatura en Física por la Universidad Técnica de Oriente Medio.
Últimos artículos de Şevval
Benchmark de herramientas de revisión de código con IA
Con el mayor uso de herramientas de programación con IA, los repositorios de código se han vuelto más propensos a vulnerabilidades, lo que aumentó la necesidad de revisiones de código eficaces. Para abordar esto, presentamos RevEval (IA Code Review Eval), que compara las cuatro principales herramientas de revisión de código con IA en 309 solicitudes…
Benchmark de plataformas de agentes de IA: Claude Managed Agents vs Google Vertex Agent Engine
Evaluamos 4 plataformas de agentes de IA en 3 dimensiones: finalización de tareas (10 tareas de programación × 3 ejecuciones), capacidades específicas del harness (dirección, reconexión, recuperación en conversaciones largas, manejo de archivos grandes) y costo. Claude Managed Agents y Vertex IA Agent Engine logran ambos tasas de aprobación del 100 % en el conjunto de…
Ejecución de código con MCP: un nuevo enfoque para la eficiencia de los agentes de IA
Anthropic presentó un método en el que los agentes de IA interactúan con Model Context Protocol (MCP) servidores escribiendo código ejecutable en lugar de hacer llamadas directas a herramientas. El agente trata las herramientas como archivos en una computadora, encuentra lo que necesita y las usa directamente con código, de modo que los datos intermedios…
Benchmark de OCR: Precisión en la Extracción / Captura de Texto
La precisión del OCR es crítica para muchas tareas de procesamiento de documentos, y los LLM multimodales SOTA ahora ofrecen una alternativa al OCR. Evaluamos los principales servicios de OCR en DeltOCR Bench para identificar sus niveles de precisión en diferentes tipos de documentos: Los nombres completos de los productos anteriores y sus versiones en…
Mejor editor de código con IA: Cursor vs Windsurf vs Replit
Crear una app sin saber programar es una gran tendencia ahora mismo. ¿Pero pueden estas herramientas construir y desplegar una app con éxito? Evaluamos 6 editores de código con IA en 10 desafíos reales de desarrollo web. Cada tarea requería implementaciones como backend, frontend, autenticación y gestión de estado. Evaluamos la corrección del backend, el…
Principales Arneses de Agente: Claude Code vs Codex
Los arneses de agente sirven como runtime de producción para los agentes de IA, con decisiones de diseño que crean variaciones de rendimiento entre modelos subyacentes idénticos. Comparamos 17 arneses de agente en 10 tareas de codificación. Para aislar el arnés en lugar del modelo, ejecutamos cada CLI agéntica en un único modelo base, Claude…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
VELC-Bench: Verificación en el Benchmark de Contexto Largo
La capacidad del modelo para localizar una métrica específica en el contexto, comparar su valor con una afirmación y confirmarla o rechazarla. Esto evalúa la coincidencia precisa de valores en condiciones de contexto largo. El modelo debe recuperar el valor y realizar una comparación precisa. Los modelos se evalúan en las siguientes ventanas de contexto:…
De captura de pantalla a código: Lovable vs v0 vs Bolt
Durante mis 20 años como desarrollador de software, lideré muchos equipos de front-end en el desarrollo de páginas basadas en diseños que se inspiraban en capturas de pantalla. Los diseños pueden transferirse a código utilizando herramientas de IA. Aunque esperar una transferencia píxel perfecta es incorrecto en el estado actual de las herramientas, pueden dar…
Simulación de audiencia: ¿Pueden los LLMs predecir el comportamiento humano?
En marketing, evaluar con qué precisión los LLMs predicen el comportamiento humano es crucial para valorar su efectividad en la anticipación de las necesidades de la audiencia y reconocer los riesgos de desalineación, comunicación ineficaz o influencia no deseada. La simulación de audiencias con LLMs permite modelar audiencias virtuales, ayudando a las organizaciones a prever…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.