8.404 turnos de diálogo con base psicológica, ya en Hugging Face
Publicamos cuatro datasets de diálogo en los que la intención, el objetivo, el estado de creencias y la dinámica de la relación los calculó el motor antes de generar el texto, no se infirieron después. 400 conversaciones, 8.404 turnos, 23 columnas.
La mayoría de los datasets de diálogo te dan el texto y una etiqueta de hablante. Y ya está.
A: I told you this would happen.
B: Can we not do this right now?
A: No, we can't not do this. We've been avoiding it for months.
Sabes qué se dijo. No tienes ni idea de por qué. No sabes si A cree que B está siendo sincero, si B se retrae porque tiene miedo o porque le da igual, ni si la relación se está rompiendo poco a poco o está a punto de recuperarse. El texto es una sombra de lo que de verdad ocurrió.
Llevamos tiempo trabajando en arreglar esto. Hoy publicamos cuatro datasets en Hugging Face (400 conversaciones, 8.404 turnos) en los que cada turno lleva el estado que el motor calculó antes de escribir el texto.
Qué hay en cada turno
Cada fila incluye 23 campos. Este es el mismo fragmento de conversación con el registro completo:
speaker: persona_a
archetype: working_mother
text: I told you this would happen.
intent: confront
goal: test_trust
communication_act: accusation
rel_trust: 0.412
rel_tension: 0.781
rel_connection: 0.334
belief_trust_other: 0.29
belief_hostility: 0.71
belief_self_worth: 0.55
belief_resolution: 0.38
tension: 0.85
connection: 0.10
vulnerability: 0.40
arc_type: escalation_partial_resolution
is_noisy: False
El texto no ha cambiado. Pero ahora sabes que este hablante tiene poca confianza en la otra persona (0,29), percibe mucha hostilidad (0,71), no cree que sea posible una resolución (0,38) y que la relación está sometida a una tensión intensa (0,78). La intención confront no es aleatoria: el motor la seleccionó a partir de ese estado de creencias antes de que existiera ningún texto. El acto accusation es la etiqueta que el generador devolvió junto con el turno, y coincide.
Esto es lo que entendemos por diálogo con base psicológica.
De dónde salen estas etiquetas
La forma habitual de añadir etiquetas a datos de diálogo es generar primero el texto y luego pedir a un LLM que clasifique lo que acaba de pasar. Eso es inferencia a posteriori: la etiqueta es una suposición sobre la intención, no un registro de ella.
Nosotros lo hacemos al revés.
El pipeline ejecuta la cognición antes que el lenguaje:
- PsycheGraph: cada persona se define por su estilo de apego, sus rasgos Big Five, sus patrones de comunicación, sus miedos centrales, sus mecanismos de defensa, sus factores de estrés actuales y 12 creencias activas. Ese es el estado psicológico de partida.
- Motor de creencias (Belief Engine): en cada turno, las creencias del hablante se actualizan a partir del acto comunicativo de ese turno, no del texto en sí, mediante tablas fijas basadas en reglas, no mediante llamadas a un LLM.
- Capa de decisión: dado el estado de creencias actual, el sistema selecciona la intención, el objetivo y el acto comunicativo. Esta selección ocurre antes de escribir ningún texto.
- Redacción del lenguaje: solo en este punto se ejecuta el LLM. El estado decidido entra en sus instrucciones y el modelo escribe el turno a partir de ahí.
intent, goal, belief_state, belief_delta y las columnas de la relación existen porque el motor las calculó antes de generar el texto, no porque algo las infiriera de él después. La etiqueta intent: confront de arriba no es una predicción: es el valor que se usó como entrada del modelo de lenguaje.
Una columna funciona de otra manera, y conviene saber cuál: communication_act es la etiqueta que el generador informa junto con su turno. Trata las columnas calculadas por el motor y esa como lo que son: no son el mismo tipo de evidencia.
Los cuatro datasets
stratasynth-social-reasoning: 2.108 turnos, 100 conversaciones Conflicto familiar y de pareja. Una madre trabajadora y su hijo adulto lidiando con años de disfunción acumulada. Una pareja que se desmorona tras una mudanza que lo trastoca todo. Un padre y una hija distanciados que intentan reencontrarse después de una década.
stratasynth-agent-stress-test: 2.068 turnos, 100 conversaciones Diálogo de alto riesgo diseñado para llevar al límite a los sistemas de IA conversacional. Rupturas de pareja, conflictos entre jefe y subordinado, disputas de herencia entre hermanos. Tensión media de la relación: 0,69, la más alta de los cuatro datasets.
stratasynth-belief-dynamics: 2.114 turnos, 100 conversaciones
Duelo, enfermedad crónica, crisis profesional. Escenarios en los que las creencias están bajo la máxima presión. El campo belief_resolution cae de forma medible a lo largo de los arcos pure_conflict y se recupera en los arcos reconnection.
stratasynth-life-transitions: 2.114 turnos, 100 conversaciones
Burnout, nuevas relaciones de pareja, la adaptación tras el primer hijo. Las puntuaciones de rel_connection más altas de los cuatro datasets (media de 0,69), porque son escenarios en los que la conexión se está construyendo, no destruyendo.
Cómo son los datos a escala
En el conjunto de las 400 conversaciones:
- 6 tipos de arco: escalation_partial_resolution, pure_conflict, reconnection, shallow_smalltalk, crisis_support, gradual_reveal, con una distribución aproximadamente uniforme
- 10 arquetipos: working_mother, avoidant_father, anxious_partner, estranged_daughter, grieving_son, caregiver_burnout, disillusioned_professional, burned_out_exec, ambitious_twenties, first_gen_immigrant
- ~12 % de turnos con ruido, etiquetados con
is_noisy: True, en los que una persona introduce incoherencia deliberada (mentiras, retractaciones, contradicciones) - De 15 a 30 turnos por conversación, con una media de 21
Los campos rel_trust y rel_tension están correlacionados negativamente (r = -0,51). belief_trust_other sigue a rel_trust (r = +0,48). Estas correlaciones proceden de las reglas de actualización que produjeron las columnas, no del texto: un sistema que calcula primero las creencias y después el lenguaje mete esa estructura en los datos. Conviene saberlo por lo que es: evidencia de que el pipeline es coherente consigo mismo, que es lo que necesitas si vas a entrenar con estas etiquetas.
Esquema
Los cuatro datasets comparten las mismas 23 columnas:
| Columna | Descripción |
|---|---|
scenario_id | FAM-01, ROM-01, PRO-02… |
conversation_id | Conversación única |
arc_type | Arco narrativo |
turn_index | Posición en la conversación |
speaker | persona_a o persona_b |
archetype | Arquetipo psicológico |
text | El enunciado |
intent | Por qué lo dijo |
goal | Qué quiere sacar del intercambio |
communication_act | Movimiento pragmático |
tension | Tensión emocional del turno |
connection | Conexión del turno |
vulnerability | Vulnerabilidad del turno |
rel_trust | Confianza en la relación, de 0 a 1 |
rel_tension | Tensión en la relación, de 0 a 1 |
rel_connection | Conexión en la relación, de 0 a 1 |
rel_dominance | Equilibrio de poder, de -1 a 1 |
belief_trust_other | Creencia: confianza en la otra persona |
belief_hostility | Creencia: hostilidad percibida |
belief_self_worth | Creencia: valía propia en este intercambio |
belief_resolution | Creencia: ¿es posible una resolución? |
is_noisy | Turno etiquetado como ruido |
Casos de uso
Fine-tuning de modelos de diálogo: los campos intent + communication_act te permiten entrenar con base psicológica, no solo con predicción del siguiente token.
Clasificación de intención y objetivo: más de 2.100 ejemplos etiquetados por dataset, en los que las etiquetas fueron entradas de la generación y no clasificaciones a posteriori.
Investigación sobre seguimiento de creencias: cada conversación es una serie temporal de la evolución de las creencias. Los campos belief_* aportan 4 dimensiones de creencia calculadas por el motor para sistemas que modelan el estado mental.
Pruebas de estrés de agentes: el dataset agent-stress-test está diseñado explícitamente para romper la IA conversacional: tensión alta, manipulación, contradicciones, turnos con ruido.
Evaluación de la robustez frente al ruido: las etiquetas is_noisy te permiten medir lo bien que un sistema gestiona la incoherencia deliberada.
Cuadernos de análisis en Kaggle
Hay tres cuadernos públicos con análisis prácticos del corpus completo de 8.404 turnos: trayectorias del estado de la relación y mapas de calor de actos comunicativos, dinámica de creencias bajo presión emocional, y una comparación entre datasets de la entropía de comportamiento y la erosión de la confianza por escenario.
Pruébalo como sistema en vivo
Estos datasets muestran lo que pasó en una conversación.
También puedes hablar directamente con uno de nuestros humanos sintéticos. La demo pública ejecuta nuestro motor de sesiones conversacionales y te permite hablar con una persona muestreada a partir de datos de población. Genera tu propio humano sintético y habla con él:
Describe a la persona (su trayectoria, su personalidad, su situación) y empieza una conversación. Prueba a preguntarle algo que genere fricción y mira cómo responde.
StrataSynth en Hugging Face stratasynth.com SDK: pip install stratasynth-client
StrataSynth es una plataforma de datos sintéticos para IA conversacional. Generamos datasets de diálogo psicológicamente coherentes con PsycheGraph, un modelo estructurado de la cognición humana.