¿Sobrevive el condicionamiento cultural a la presión de una negociación?
Hicimos que los mismos dos negociadores sintéticos cerraran el mismo acuerdo B2B 100 veces, 50 en Gran Bretaña y 50 en Estados Unidos, sin cambiar nada salvo el condicionamiento por país. Algunas señales culturales se debilitaron bajo presión. Otras se reforzaron. Esa asimetría es el hallazgo.
La mayoría de los datasets sintéticos que dicen capturar la cultura lo cambian todo a la vez: país, personalidad, edad, sector, escenario. Y luego atribuyen a la “cultura” cualquier diferencia que aparezca.
Nosotros queríamos saber qué pasa cuando cambias solo el país.
Así que montamos un experimento controlado: las mismas dos identidades sintéticas (una vicepresidenta de Compras de 47 años, la compradora, y un fundador de 36 años de una startup de SaaS, el vendedor) negocian el mismo acuerdo de compras corporativas 100 veces. Cincuenta conversaciones se generan con condicionamiento cultural británico y cincuenta con estadounidense. Los mismos vectores psicométricos. Los mismos datos demográficos. Los mismos arcos narrativos. Las mismas semillas. Los mismos actos comunicativos planificados.
El resultado ya es público: stratasynth-cross-cultural-negotiation en Hugging Face.
Este artículo cuenta la historia que hay detrás: por qué lo construimos, qué intentábamos medir, qué nos sorprendió y qué seguimos sin saber.
Por qué lo construimos
A principios de este año, nuestro equipo de investigación de QualiSynth contrastó retrospectivamente nuestras personas sintéticas con datos reales de encuestas a personas de varios países. El resultado fue incómodo: nuestras personas de EE. UU. y de GB eran, psicométricamente, casi intercambiables. El contraste de referencia entre ambos países en confianza interpersonal, bien documentado en los datos humanos, salía completamente plano.
El diagnóstico era estructural. Las normas de personalidad de dos países anglófonos son casi idénticas, y las actitudes que sí difieren entre países (confianza en las instituciones, relación con la autoridad, comodidad con la franqueza) no son rasgos de personalidad en absoluto. Son contexto cultural e institucional. Nuestras personas, sencillamente, no tenían dónde guardarlos.
Así que construimos una capa de condicionamiento cultural con una regla estricta: prohibido usar datos de encuestas. El condicionamiento se deriva de fuentes independientes de cualquier referencia actitudinal: índices culturales e institucionales publicados a nivel de país. Si de esos datos de partida emergen diferencias entre países y resulta que coinciden con patrones observados en datos humanos, eso es generalización fuera de la fuente, no una inyección circular.
Luego llegó la pregunta que este benchmark existe para responder. Un investigador de otro equipo que trabaja en simulación de negociaciones hizo una predicción antes de ver ninguno de nuestros resultados:
La cultura aparece cuando el sistema tiene que elegir entre normas en conflicto.
Dicho de otro modo: cualquiera puede salpicar de “perhaps” las frases británicas. La prueba de verdad es qué ocurre bajo presión, cuando la cortesía compite con la necesidad de plantarse.
Esa es una afirmación medible. Decidimos medirla.
Qué intentábamos medir
El objetivo del diseño era eliminar todos los factores de confusión que se nos ocurrieran:
| Se mantiene constante | Cómo |
|---|---|
| Personalidad | Semillas psicométricas explícitas (Big Five + valores de Schwartz + apego), idénticas en ambas mitades |
| Datos demográficos | Fijados explícitamente: compradora, mujer de 47 años, vicepresidenta de Compras; vendedor, hombre de 36 años, fundador de SaaS |
| Escenario | Negociación de compras corporativas, restringida a arcos narrativos profesionales |
| Estructura de la conversación | Distribución de arcos idéntica (17/17/16), número de turnos idéntico (1.172 por país) |
| Plan de comportamiento | El motor de decisión selecciona el acto comunicativo de cada turno antes de generar el texto, a partir de la misma semilla, y se lo pasa al modelo como instrucción |
| Varía | Condicionamiento por país: GB frente a EE. UU. |
Aquí importa un detalle: en nuestro pipeline, la intención, el objetivo y un acto comunicativo planificado se calculan a partir del estado de creencias de la persona antes de que se ejecute ningún modelo de lenguaje, y con semillas compartidas ambas mitades del corpus parten del mismo plan, que llega al modelo como instrucción. Así que las diferencias que siguen son diferencias en cómo se puso en palabras ese mismo plan en cada país.
Lo que este diseño no puede hacer es decir de quién es la cultura. Cambiar el país cambia el token de país en el prompt, y el modelo base interpreta el país y el idioma por su cuenta. Aquí nuestra capa de condicionamiento y lo que el propio modelo trae aprendido se mueven a la vez, y este experimento no puede separarlos. Un estudio posterior, prerregistrado, con 2.600 encuestados sintéticos en ocho mercados, fue a buscar esa separación y encontró que la estructura entre mercados se mantenía sin nuestra capa psicométrica. Así que lee las cifras que siguen como el efecto, medido, de cambiar el país en el prompt, no como prueba de que nuestra capa produzca cultura.
También definimos de antemano qué aspecto tendría el fracaso. Si un lector pudiera identificar el país en treinta segundos, estaríamos ante estereotipos. Una diferencia detectable nula significaría que el condicionamiento no hace nada. El objetivo honesto era el punto medio incómodo: real, sistemático, sutil.
Qué nos sorprendió
Sorpresa 1: nuestras descripciones de escenario nunca llegaban al modelo de lenguaje
La primera ejecución piloto produjo conversaciones profesionalmente verosímiles… sobre logs de servidores y plazos de proyectos. No sobre compras. No sobre negociación. Solo un ~2 % de los turnos contenía algún vocabulario de negociación.
Al rastrear el pipeline apareció un hueco embarazoso e instructivo: la descripción del escenario existía en nuestro catálogo, nuestra API la validaba y era visible en todas partes, salvo en el prompt que genera los turnos de la conversación. Los temas habían ido emergiendo solo de la personalidad y de los arcos emocionales. Nuestros datasets de familia y de pareja nunca lo pusieron de manifiesto, porque los dominios relacionales sí emergen de la psicología. Una negociación de compras B2B, no.
Tras un arreglo pequeño y de alcance explícitamente acotado (anclaje de dominio solo para este escenario, con salida idéntica byte a byte para todos los escenarios existentes), el vocabulario de negociación pasó de un ~2 % a un ~30 % de los turnos, con los papeles de comprador y vendedor bien asignados. La lección se generaliza: en los pipelines de generación de varias etapas, comprueba qué llega realmente al prompt. Unos metadatos que todas las demás capas pueden ver pueden ser invisibles para la única capa que importa.
Sorpresa 2: la señal vive en el estilo, no en el contenido
Con el tema fijado por diseño, ambas mitades del corpus hablan de lo mismo: SLA, niveles de precios, cumplimiento normativo, referencias. Las distribuciones de temas convergen. Lo que diverge es cómo se comporta el mismo negociador:
| Métrica | Ratio GB/EE. UU. |
|---|---|
| Atenuación (“perhaps”, “I wonder”, “a bit”…) | 1,38x |
| Desacuerdo atenuado | 1,79x |
| Referencias a la autoridad (consejo, departamento jurídico, comité…) | 1,5x a 2,1x |
| Palabras por turno | 1,07x |
Y sin tópicos: al revisar una muestra de conversaciones con una lista de comprobación, no encontramos expresiones británicas ni estadounidenses estereotipadas. La primera impresión de un revisor externo fue que las conversaciones parecían “sorprendentemente homogéneas”, algo que ahora consideramos una virtud. Si la cultura se viera en treinta segundos, sería disfraz, no condicionamiento.
Sorpresa 3: la presión no borra la señal, la transforma
Cada turno lleva su valor de tensión planificado por el arco, idéntico en ambos países gracias a la semilla compartida. Eso permite una comparación limpia: ¿cómo se comportan los mismos marcadores culturales a presión baja, media y alta?
| Marcador (ratio GB/EE. UU.) | Tensión baja | Media | Alta |
|---|---|---|---|
| Atenuación | 1,73 | 1,34 | 0,66 |
| Desacuerdo directo | 0,84 | 1,96 | 1,91 |
| Apelación a la autoridad | 2,12 | 1,54 | 1,56 |
| Disculpa explícita | 0,94 | 0,47 | 0,52 |
Vuelve a leer la primera fila. Con tensión baja, la mitad GB atenúa un 73 % más que la mitad EE. UU. Con tensión alta, atenúa un 34 % menos. El clásico escudo de cortesía británico es real en este corpus, y cae cuando la negociación se pone difícil, dejando paso al desacuerdo directo (1,91x) y a las apelaciones a la autoridad institucional (1,56x). La mitad EE. UU. hace algo distinto: mantiene su registro y repara la fricción con disculpas explícitas, aproximadamente al doble de la tasa británica bajo presión.
Algunas señales culturales se debilitan bajo presión. Otras se refuerzan. El contraste entre las dos mitades no es un desplazamiento constante: es un perfil que depende de la presión.
Lo cual es, hasta donde podemos ver, lo que predijo el investigador del otro equipo antes de ver nuestros resultados: la cultura no es un vocabulario. Es qué normas ganan cuando las normas entran en conflicto.
Qué seguimos sin saber
Queremos ser precisos sobre los límites, porque aquí el diseño es el producto.
Dos individuos sintéticos no son una cultura. El diseño de pareja fija es lo que hace limpio el experimento, y lo que limita la generalización. Medimos cómo el condicionamiento por país desplaza el comportamiento de una pareja comprador-vendedor, no cómo negocian los profesionales británicos o estadounidenses. La ficha del dataset lo dice explícitamente, y lo decimos en serio.
Nuestros marcadores son aproximaciones léxicas. La atenuación, la franqueza y las apelaciones a la autoridad se miden con expresiones regulares deterministas sobre el texto: cualquiera puede reproducirlas a partir de las columnas publicadas, pero son superficiales comparadas con una anotación pragmática completa. Instrumentos mejores podrían encontrar estructura que se nos ha escapado, o debilitar hallazgos que presentamos.
El análisis de presión se apoya en ~190 turnos de tensión alta por país. Las tendencias monótonas a lo largo de las franjas son más fiables que cualquier extremo aislado, y las filas con pocos casos (las disculpas con tensión alta) deben leerse como indicativas de una dirección.
La validación ciega está pendiente. La prueba correcta de “real pero no caricaturesco” es si evaluadores independientes (expertos humanos y modelos de otras familias) pueden clasificar el país a partir del texto con un acierto claramente superior al azar, pero muy por debajo de la certeza. Nuestra propia expectativa es un acierto del 60 al 75 %. Existe una versión ciega del corpus precisamente para este protocolo, y preferimos publicar la cifra a predecirla.
Un escenario, una díada, dos países. Si el perfil dependiente de la presión se replica en otros escenarios, otras parejas de personas y los demás países de nuestra capa de condicionamiento es el siguiente experimento evidente. Si “la atenuación converge, la autoridad persiste” resulta ser una propiedad general del condicionamiento, o se rompe en algún punto revelador, cualquiera de los dos resultados nos enseña algo.
La cuestión de fondo
Los datos sintéticos suelen evaluarse preguntando “¿parece real?”. Creemos que la pregunta más útil es “¿puede aislar una variable que los datos reales no pueden?”.
Ningún dataset humano puede darte los mismos dos negociadores, con las mismas personalidades y el mismo plan, llevando la misma negociación en dos países. Un pipeline sintético sí puede, si la arquitectura separa la cognición de la redacción y si estás dispuesto a publicar los controles junto con las conversaciones.
El dataset, la metodología, las cifras principales y la lista completa de limitaciones están en Hugging Face. Los marcadores se reproducen a partir de las columnas publicadas con unas pocas líneas de pandas. Si encuentras algo que se nos haya escapado, en cualquier dirección, queremos saberlo.