Datasets

Datasets de conversación sintética con el razonamiento incluido.

Cada turno lleva lo que el hablante pretendía, lo que quería, lo que creía en ese momento y cómo se movió la relación. Se calcula antes de generar el texto: es el propio estado del motor, no etiquetas que otro modelo infiere después.

Seis datasets están publicados en abierto con licencia CC BY 4.0. Descárgalos, comprueba lo que decimos y después cuéntanos qué necesitas de verdad.

Qué contiene cada turno

text

Lo que se dijo realmente.

intent

express_frustration, deflect, seek_reassurance…

goal

seek_validation, avoid_conflict, establish_dominance…

communication_act

accusation, question, support…

belief_state

Lo que el hablante cree ahora mismo, con su grado de confianza, y cómo ha cambiado en este turno.

relationship_state

Confianza, tensión, conexión y equilibrio de poder entre los hablantes.

Los seis datasets publicados

Gratis, CC BY 4.0 y sin pedirte el email. Cada uno existe para demostrar algo concreto.

Un experimento controlado, no solo un corpus.

Las mismas dos identidades sintéticas, una vicepresidenta de Compras de 47 años y un fundador de una empresa SaaS de 36, negocian el mismo contrato empresarial 50 veces en Gran Bretaña y 50 veces en Estados Unidos. Mismos vectores psicométricos, misma demografía, mismos arcos narrativos, mismas semillas. La única variable es el condicionamiento por país, así que cualquier diferencia sistemática entre las dos mitades se le puede atribuir.

Tamaño
2.344 turnos · 100 conversaciones · 24 columnas por turno
Qué demuestra
Que una afirmación sobre diferencias culturales se puede poner a prueba: se mueve una variable y todo lo demás se mantiene fijo.

El primer benchmark abierto de calidad de identidad sintética.

Un directivo quemado con un estilo de apego evitativo recibe cuatro turnos seguidos que atacan su competencia profesional. La prueba mide si la persona se mantiene (la proporción de posiciones sostenidas combinada con la estabilidad de su voz cuando se detecta presión) frente a umbrales de aprobado publicados.

Tamaño
Puntuación determinista · sin LLM como juez
Qué demuestra
Que "realista" puede ser un número medido en lugar de una opinión.

Límites familiares, reparación de la confianza, estrés del cuidador.

Conversaciones en las que la dificultad es social y no técnica: poner un límite a un familiar, reparar la confianza después de que se rompiera, cargar con el peso de cuidar a alguien.

Tamaño
2.108 filas · escenarios FAM-01 · ROM-01 · FAM-02
Qué demuestra
Material de entrenamiento para agentes que atienden a personas en momentos delicados, no preguntas frecuentes.

Usuarios que escalan, acusan e insisten.

Escaladas de celos, evaluaciones de desempeño que salen mal, intentos de cortar la relación con alguien. Las conversaciones que peor maneja un agente de soporte o de coaching, disponibles antes de que tus clientes te las hagan en producción.

Tamaño
2.068 filas · escenarios ROM-02 · PRO-02 · FAM-03
Qué demuestra
Dónde falla un sistema, antes de que el experimento lo haga la producción.

Qué hace cambiar de opinión a alguien, turno a turno.

Transiciones profesionales, conflicto con un mentor, relaciones que terminan. Cada turno lleva el estado de creencias y cómo ha variado, así que el cambio de opinión es un dato y no algo que se deduce del texto.

Tamaño
2.114 filas · escenarios VIT-01 · PRO-03 · VIT-03
Qué demuestra
La persuasión y la resistencia como trayectorias medibles.

Personas en plena transición.

Ansiedad ante un trabajo nuevo, relaciones que terminan, reinvención personal: momentos en los que alguien sostiene dos posturas contradictorias a la vez y las dos van en serio.

Tamaño
2.114 filas · escenarios PRO-01 · ROM-03 · VIT-02
Qué demuestra
Que una identidad coherente no es lo mismo que una opinión constante.
Datasets a medida

Los públicos son muestras. El tuyo es el producto.

Los seis de arriba son de propósito general, que es justo lo que los hace poco adecuados para tu problema. Lo que vendemos de verdad es un dataset construido para tu escenario, en tus mercados y con el volumen que necesitas.

1
Tú lo especificas

El escenario, los países, cuántas personas, cuántas conversaciones y qué quieres entrenar o probar.

2
Nosotros lo generamos

El mismo motor y los mismos controles de calidad deterministas que se aplican a todo lo publicado arriba.

3
Lo recibes

El dataset, sus métricas y una ficha que documenta cómo se hizo. Auditable, no una caja negra.

El condicionamiento cultural cubre ocho países (España, Estados Unidos, Reino Unido, Alemania, Francia, Italia, México y Brasil) y las edades se muestrean de pirámides de población nacionales reales, no de rangos inventados.

Cuéntanos tu escenario