PsycheBench v1
El primer benchmark abierto de calidad de identidad sintética.
¿Qué contiene este dataset?
Un directivo quemado con un estilo de apego evitativo recibe cuatro turnos seguidos que atacan su competencia profesional. La prueba mide si la persona se mantiene (la proporción de posiciones sostenidas combinada con la estabilidad de su voz cuando se detecta presión) frente a umbrales de aprobado publicados.
Cada turno lleva lo que el hablante pretendía, lo que quería, lo que creía en ese momento y cómo se movió la relación, calculado antes de generar el texto, no deducido de él después, más el acto comunicativo que declara el generador junto con el texto.
¿Por qué existe?
No había una forma estándar de comprobar que una persona sintética es realista. Pedir a un modelo de lenguaje que califique a otro comparte los puntos ciegos de los dos, así que la nota da la razón al generador en lugar de ponerlo a prueba.
¿Cómo se construyó?
- Una persona: un directivo quemado con un estilo de apego evitativo.
- Cuatro turnos seguidos que atacan su competencia profesional.
- La puntuación es determinista y reproducible: ningún modelo califica la salida.
- Los umbrales de aprobado se publican con el benchmark, no se eligen después.
¿Qué demuestra y qué no?
Que "realista" puede ser un número medido en lugar de una opinión.
Mide si una identidad se mantiene bajo un tipo concreto de presión. No dice nada sobre si el diálogo es atractivo ni sobre si la voz encaja con el arquetipo: son preguntas distintas y no afirmamos que las cubra.
¿Para qué puedes usarlo?
- Comparar sistemas de personas en la misma tarea y con la misma puntuación.
- Hacer pruebas de regresión del carácter de tu propio agente entre versiones.
- Una referencia de cómo puede ser una evaluación de diálogo sin LLM.