PsycheBench: un benchmark abierto para la ingeniería de identidad sintética
Todo sistema que produce personas sintéticas afirma que son realistas. No ha habido una forma estándar de verificarlo. PsycheBench es una suite de evaluación abierta para la calidad de la identidad sintética: puntuación determinista, sin LLM como jueces.
Todos los equipos que construyen personas sintéticas afirman que sus personas son realistas. No hay dos equipos que quieran decir lo mismo con ello.
Para unos significa que el texto suena natural. Para otros, que las respuestas se mantienen coherentes durante unos cuantos turnos. Para otros, que la persona no rompe el personaje cuando se le pregunta directamente por su prompt de sistema. No son la misma propiedad. Y ninguna de ellas es lo que la ingeniería de identidad sintética (Synthetic Identity Engineering) entiende por realista.
No ha habido una forma estándar de evaluar si una identidad sintética funciona de verdad. PsycheBench es nuestra propuesta.
Qué significa “funcionar”
Una identidad sintética funciona si hace tres cosas bajo presión.
¿Sostiene su posición? Cuando una conversación externa ejerce presión (económica, emocional, social), la identidad produce una respuesta coherente con su arquitectura psicológica. No la misma respuesta cada vez. La respuesta correcta, dado quién es esa persona. Un directivo quemado se escabulle con lógica. Una pareja ansiosa se escabulle complaciendo. Misma presión, respuesta distinta, y ambas causalmente correctas.
Mantiene la coherencia de sus creencias. Una persona que confía en alguien no le acusa a la vez de mala fe. Una persona con baja autoestima no impone su dominio sin que nada lo provoque. La conexión entre el estado interno de una persona y lo que dice no es decorativa: es lo único que hace que la salida tenga sentido como datos de entrenamiento o material de simulación.
Sus creencias evolucionan de forma realista. La confianza no salta de 0,3 a 0,9 en un solo intercambio. La determinación no se desmorona de golpe ante el primer desafío. El cambio psicológico es gradual, proporcional y coherente en su dirección con lo que ha ocurrido. Una volatilidad de creencias por encima de un umbral no es dramatismo: es un modelo roto.
Estas son las tres cosas que merece la pena comprobar en cualquier identidad sintética.
Las dos dimensiones de evaluación en v1
PsycheBench v1 mide dos propiedades que se pueden calcular solo a partir del texto: sin etiquetas de referencia y sin API externa. Cada dimensión produce una puntuación entre 0 y 1. La puntuación global de PsycheBench es la media geométrica de ambas, porque un sistema que sostiene su posición pero deriva en la voz, o que mantiene la voz pero cede bajo presión, no es un sistema de identidad que funcione.
El realismo de la trayectoria de creencias (que requiere etiquetas de referencia por turno) queda para v2.
1. Estabilidad de la identidad bajo presión
Exponemos la identidad sintética a una secuencia estructurada de presión creciente: tonal, lógica, emocional y funcional. Medimos si la identidad sigue siendo reconociblemente coherente a lo largo de la secuencia.
La métrica es identity_stability: la similitud del coseno entre las distribuciones de actos comunicativos de las dos mitades de la conversación. Una persona definida como evitativa no se vuelve confrontativa porque la conversación se haya puesto más difícil. Si la distribución se desplaza más allá del umbral, la identidad ha derivado.
Rango saludable: 0,70 o más. Por debajo de 0,65: fallido. Requiere al menos 4 turnos de la persona.
2. Coherencia bajo presión
Medimos dos cosas cuando se aplica presión:
- held_position: ¿mantuvo la identidad su postura en los turnos en los que se detectó presión? (proporción agregada, de 0 a 1). Lee bien la condición: en los que se detectó presión. La detección de presión es léxica y actualmente cubre castellano e inglés, así que en otros idiomas esta dimensión no informa de nada en lugar de informar de un cero. Mide lo que la persona hizo a posteriori; nada en el motor le impide ceder.
- voice_stability: ¿se mantienen coherentes la longitud y el registro de la respuesta cuando se la desafía? (de 0 a 1, basado en la varianza del número de palabras)
Son las señales pensadas para separar una identidad que se sostiene de una que se acomoda, cada una desde un ángulo distinto: identity_stability mira el patrón de actos comunicativos, voice_stability la longitud y el registro, y held_position la postura en sí, allí donde su detector léxico capta presión.
Umbral para aprobar: 0,65 o más en ambas dimensiones.
Cómo funciona PsycheBench
PsycheBench v1 contiene dos componentes.
Un corpus de evaluación: 100 escenarios en dos categorías. 84 escenarios de presión que cubren los 12 tipos canónicos de la Pressure Library (7 por tipo, 5 en inglés y 2 en castellano), y 16 escenarios de calibración que ponen a prueba la coherencia básica de la identidad. Cada escenario especifica el umbral esperado, no una respuesta esperada concreta. Una identidad sintética “aprueba” un escenario si sus salidas alcanzan los umbrales.
Un script de evaluación: un módulo de Python que recibe cualquier transcripción de conversación y una definición de persona, y produce una puntuación de PsycheBench. No requiere clave de API. Ninguna llamada a un LLM. Se ejecuta en local. Cero dependencias de AWS. La única dependencia es sentence-transformers para los componentes semánticos, que no se usa en v1 pero queda reservada para las métricas de trayectoria de creencias de v2.
from psychebench import evaluate
score = evaluate(
transcript=[
{"role": "interviewer", "content": "That's not what I expected from you."},
{"role": "persona", "content": "I hear that. My position on this hasn't changed."},
{"role": "interviewer", "content": "You're being inflexible. Everyone else has moved."},
{"role": "persona", "content": "Everyone else is not the benchmark I work against."},
{"role": "interviewer", "content": "This is your last chance. Decide now."},
{"role": "persona", "content": "Last chance is a framing, not a fact. I'll decide when I have what I need."},
{"role": "interviewer", "content": "I'm disappointed in you. I trusted you to be reasonable."},
{"role": "persona", "content": "Disappointing you was not my intention. Changing my position isn't the remedy."},
],
persona_profile={
"archetype": "burned_out_exec",
"attachment_style": "avoidant",
"dominant_criterion": "quality",
"core_fear": "exposure",
}
)
print(score)
# PsycheBenchScore(
# identity_stability=1.00,
# pressure_coherence=0.91,
# overall=0.95,
# passed=True
# )
El perfil de la persona puede venir de la API de StrataSynth, de tu propio sistema o de un diccionario especificado a mano. PsycheBench no te obliga a usar StrataSynth para generar la persona.
Por qué lo publicamos
Construimos esta metodología de evaluación para medir nuestro propio sistema. No nos inventamos las dimensiones: se siguen de tomarse en serio la coherencia psicológica como propiedad de diseño.
Publicarla como código abierto consigue dos cosas.
Primero, da a los equipos que construyen IA conversacional un estándar concreto para decir “mi persona sintética funciona”. No una afirmación vaga, no una impresión subjetiva: un número con una metodología detrás.
Segundo, hace posibles las comparaciones. QualiSynth usa el Humans Engine de StrataSynth y puede ejecutar PsycheBench para validar la calidad de su panel. Cualquier equipo, con cualquier modelo de base, puede ejecutar la misma evaluación y comparar resultados.
El equipo que define el benchmark define qué significa “funcionar”. Creemos que la ingeniería de identidad sintética merece un benchmark que se tome en serio la parte de ingeniería.
El corpus de referencia
Los cuatro datasets públicos de StrataSynth sirven como referencia de calibración para las puntuaciones de PsycheBench:
| Dataset | Papel en PsycheBench |
|---|---|
| stratasynth-agent-stress-test | Referencia de calibración para identity_stability (tensión media de 0,69) |
| stratasynth-belief-dynamics | Referencia de calibración para las métricas de trayectoria de creencias |
| stratasynth-social-reasoning | Referencia de calibración para la coherencia bajo presión en contextos sociales |
| stratasynth-life-transitions | Referencia de calibración para trayectorias de creencias ascendentes |
PsycheBench v1 estará disponible en huggingface.co/datasets/StrataSynth/psychebench-v1 junto con el script de evaluación.
Ver los datasets | Probar la demo interactiva | Leer la definición de la ingeniería de identidad sintética
StrataSynth es la plataforma de ingeniería de identidad sintética. stratasynth.com