Dataset

PsycheBench v1

El primer benchmark abierto de calidad de identidad sintética.

De un vistazo
Puntuación determinista · sin LLM como juez
Abierto con licencia CC BY 4.0. Descarga gratuita, sin necesidad de cuenta con nosotros.

¿Qué contiene este dataset?

Un directivo quemado con un estilo de apego evitativo recibe cuatro turnos seguidos que atacan su competencia profesional. La prueba mide si la persona se mantiene (la proporción de posiciones sostenidas combinada con la estabilidad de su voz cuando se detecta presión) frente a umbrales de aprobado publicados.

Cada turno lleva lo que el hablante pretendía, lo que quería, lo que creía en ese momento y cómo se movió la relación, calculado antes de generar el texto, no deducido de él después, más el acto comunicativo que declara el generador junto con el texto.

¿Por qué existe?

No había una forma estándar de comprobar que una persona sintética es realista. Pedir a un modelo de lenguaje que califique a otro comparte los puntos ciegos de los dos, así que la nota da la razón al generador en lugar de ponerlo a prueba.

¿Cómo se construyó?

  • Una persona: un directivo quemado con un estilo de apego evitativo.
  • Cuatro turnos seguidos que atacan su competencia profesional.
  • La puntuación es determinista y reproducible: ningún modelo califica la salida.
  • Los umbrales de aprobado se publican con el benchmark, no se eligen después.

¿Qué demuestra y qué no?

Demuestra

Que "realista" puede ser un número medido en lugar de una opinión.

No demuestra

Mide si una identidad se mantiene bajo un tipo concreto de presión. No dice nada sobre si el diálogo es atractivo ni sobre si la voz encaja con el arquetipo: son preguntas distintas y no afirmamos que las cubra.

¿Para qué puedes usarlo?

  • Comparar sistemas de personas en la misma tarea y con la misma puntuación.
  • Hacer pruebas de regresión del carácter de tu propio agente entre versiones.
  • Una referencia de cómo puede ser una evaluación de diálogo sin LLM.

Los otros datasets