Agent Stress Test
Usuarios que escalan, acusan e insisten.
¿Qué contiene este dataset?
Escaladas de celos, evaluaciones de desempeño que salen mal, intentos de cortar la relación con alguien. Las conversaciones que peor maneja un agente de soporte o de coaching, disponibles antes de que tus clientes te las hagan en producción.
Cada turno lleva lo que el hablante pretendía, lo que quería, lo que creía en ese momento y cómo se movió la relación, calculado antes de generar el texto, no deducido de él después, más el acto comunicativo que declara el generador junto con el texto.
¿Por qué existe?
Los sistemas conversacionales se suelen evaluar con usuarios que colaboran. Los fallos que importan ocurren con el otro tipo de usuario, y esos llegan en producción, no en el conjunto de prueba.
¿Cómo se construyó?
- Tres escenarios: escalada de celos, evaluaciones de desempeño difíciles, intentos de distanciamiento.
- El hablante difícil mantiene una postura coherente en lugar de escalar al azar.
- Cada turno incluye la intención y el objetivo que hay detrás, así que se puede localizar un fallo.
¿Qué demuestra y qué no?
Dónde falla un sistema, antes de que el experimento lo haga la producción.
Aquí "adverso" significa socialmente difícil, no una prueba de seguridad. No es un corpus de jailbreak ni de inyección de prompts y no debe usarse como tal.
¿Para qué puedes usarlo?
- Hacer red-teaming de un agente de soporte, coaching o ventas antes del lanzamiento.
- Construir pruebas de regresión en torno a los turnos en los que un sistema ya cedió antes.
- Medir si un modelo abandona una postura bajo presión repetida.