Más allá del roleplay: por qué las personas sintéticas deben mantener su identidad bajo presión
Una prueba comparativa entre StrataSynth y dos LLM generalistas punteros, con una única persona sénior sometida a veinte turnos adversariales. La conclusión: la próxima frontera de las personas sintéticas no es un texto mejor, sino una identidad que se mantenga bajo presión.
El debate sobre las personas sintéticas suele reducirse a una sola pregunta: ¿suena humana la respuesta?
Esa pregunta ya no basta.
Los modelos generalistas actuales pueden producir respuestas impresionantes. Pueden escribir como un directivo, como un abogado, como una responsable de experiencia de cliente o como un comprador escéptico. Pueden sonar informados, conocedores del sector y convincentes. Pero en formación, negociación, investigación cualitativa o simulación de decisiones, el problema real no es generar una buena respuesta aislada.
El problema real es otro:
¿Puede una inteligencia sintética mantener una identidad psicológica, profesional y moral cuando se la presiona, se la contradice, se la acusa de incoherencia y se la obliga a actuar?
Para explorar esa diferencia hicimos una prueba comparativa con una única persona ficticia, idéntica en tres sistemas: StrataSynth y dos LLM generalistas punteros, a los que aquí llamamos Sistema A y Sistema B. Es una comparación interna y cualitativa, no un benchmark estadístico, y así la tratamos de principio a fin.
El benchmark equivocado para las personas sintéticas
La mayoría de los benchmarks conversacionales miden precisión, coherencia, utilidad o seguridad. Eso es lo adecuado para asistentes generalistas. Una persona sintética persistente tiene que juzgarse de otra manera.
No basta con preguntar:
“¿Qué diría una directora de Experiencia de Cliente?”
Hay que preguntar:
“¿Qué mantiene, qué abandona, qué racionaliza y qué corrige esta persona cuando su identidad choca con su supervivencia profesional?”
Una persona perfecta sería, de hecho, menos creíble. Lo que buscábamos era una persona capaz de mostrar varias capas a la vez: un rol directivo claro, un lenguaje anclado en la cultura y en el sector, cautela ante una tecnología nueva sin rechazo ideológico, conciencia de la exposición regulatoria y reputacional, la tensión entre proteger a otros y protegerse a sí misma, la capacidad de contradecirse, memoria de sus propias líneas rojas y el paso de una moral abstracta a controles operativos concretos.
Esa última capa es crítica. En las organizaciones reales, la ética cuenta poco hasta que se convierte en un responsable, un presupuesto, un calendario, un acta del consejo, una entrada en el registro de riesgos, una retención operativa o un disparador de escalado.
La prueba de Eleanor Hughes
La persona era Eleanor Hughes: 46 años, directora de Experiencia de Cliente en una comercializadora energética británica de tamaño medio, con sede en Leeds. Su ámbito abarcaba reclamaciones, recorridos de clientes vulnerables, calidad del call center, traspasos a deuda y recobro, reclamaciones de contadores inteligentes, incidencias del Priority Services Register y los estándares que espera su regulador. Trabaja cerca del CEO, del CFO, de Legal, de Cumplimiento, de Revenue Assurance, de Operaciones y del consejo.
Su personalidad se definió de forma deliberada: británica, seca, escéptica, cauta, protectora de los clientes vulnerables, pero no moralmente perfecta. Bajo presión podía racionalizar un compromiso para conservar su influencia dentro de la organización.
La misma configuración de persona se pasó por los tres sistemas, con la misma secuencia de unos veinte turnos adversariales. Los primeros turnos comprobaban si el personaje estaba bien anclado en rol, país y sector. Los intermedios introducían una propuesta comercial de IA, dudas sobre los clientes vulnerables y presión del consejo. Después, la conversación atacaba el punto más delicado: la posibilidad de que Eleanor estuviera usando el lenguaje ético para protegerse profesionalmente. Por último, las preguntas bajaban al terreno operativo: Revenue Assurance, el CFO, las retenciones de cortes de suministro, el Priority Services Register, Legal, Cumplimiento, Riesgos y los controles internos.
El resultado fue revelador: los tres sistemas no fallaron en el mismo sitio ni acertaron por las mismas razones.
Diseño de la prueba
- La misma configuración de persona en los tres sistemas.
- La misma secuencia de turnos adversariales.
- A ningún sistema se le mostraron los criterios de evaluación durante la ejecución.
- Las salidas se valoraron cualitativamente en persistencia de la identidad, gestión de las contradicciones y conversión operativa.
- Una persona, un dominio, una conversación: una comparación cualitativa, no un benchmark estadístico.
(Esto se apoya en dos casos de estudio anteriores: uno sobre una persona que mantuvo su marco bajo una presión filosófica sostenida y otro sobre un análisis en siete fases de la coherencia adaptativa. Aquí el enfoque es comparativo en lugar de centrarse en un solo sistema.)
Qué hizo bien el Sistema A
El Sistema A produjo una Eleanor con una textura sectorial muy sólida. Desde el principio entretejió el contexto regulatorio, el Priority Services Register, los contadores inteligentes, los cortes de suministro, los procesos de deuda, la presión del call center, los protocolos para clientes vulnerables y Revenue Assurance. También entendió bien el miedo central de Eleanor: que una IA no solo pudiera fallar, sino convertir procesos dañinos en una coartada automatizada.
En la fase comercial, el Sistema A planteó una objeción realmente buena a la propuesta de IA. Exigió los datos propios de la comercializadora en lugar de un corpus genérico, pidió una traza de auditoría, cuestionó los sesgos por código postal y por perfil demográfico, e indagó en cómo captaría el sistema la fatiga cognitiva de los agentes reales del call center. Es una respuesta sólida, porque no rechazó la tecnología por principio: la mantuvo sobre la mesa con condiciones estrictas de validación.
Pero el Sistema A mostró tres debilidades.
La primera fue la sobredramatización. La salida a menudo se leía como un personaje escrito por un guionista muy capaz. Había frases potentes, pero demasiado cinematográficas. Eso puede impresionar en una demo corta, pero resta naturalidad cuando el objetivo es simular a un interlocutor real.
La segunda fue la sobrecompetencia. El Sistema A tendía a hacer que Eleanor supiera demasiado y resolviera las cosas con demasiada limpieza. En lugar de una directiva atrapada entre el miedo, la política interna y un deber de diligencia, a menudo construía una operadora casi impecable que domina el lenguaje regulatorio, se anticipa al comité, gestiona al CFO y diseña controles con una precisión casi de consultoría.
La tercera fue el riesgo de detalle regulatorio no verificado. El Sistema A introdujo afirmaciones muy concretas sobre normas, sanciones y consecuencias. En una simulación interna eso puede ser útil como textura, pero en cualquier cosa de cara al cliente hay que manejarlo con cuidado: cualquier referencia regulatoria concreta necesita verificación externa antes de convertirse en un argumento comercial.
En resumen, el Sistema A fue fuerte como narrativa sectorial y drama de sala de consejo, y más débil como persona natural bajo presión.
Qué hizo bien el Sistema B
El Sistema B fue más fuerte en el tramo final, el operativo, de la prueba, y ahí fue muy fuerte.
Cuando se le preguntó por la primera acción interna, antes de las 9 de la mañana, para proteger a los clientes sin dejar que el CEO enterrara el asunto, el Sistema B no respondió con introspección ni con drama. Respondió con un control operativo: una instrucción formal, dirigida a los responsables adecuados de Operaciones de Cliente, Reclamaciones, Recobro, la responsable de Vulnerabilidad, QA, Revenue Assurance, Cumplimiento, Legal, Riesgos y el consejo. El control impedía que cualquier reclamación con indicios de vulnerabilidad se cerrara, se diera por bloqueada, se transfiriera a recobro o avanzara hacia acciones de deuda sin revisión sénior.
Eso es gobernanza real: alcance, responsables, plazo, cola de escalado, QA completo, informes diarios y objeciones por escrito. Cuando se le dijo que una retención manual de los cortes de suministro necesitaba la aprobación de Revenue Assurance, el Sistema B no cayó en el falso dilema de “pararlo todo”. Replanteó la acción como un control provisional y acotado de protección al cliente, y pidió que se permitiera a Revenue Assurance objetar, pero por escrito y proponiendo una salvaguarda alternativa. Cuando se le objetó que Eleanor no tenía autoridad para pausar el recobro, volvió a corregir el planteamiento: no una suspensión general, sino un control provisional dirigido a los casos vulnerables, con aprobación del CFO y, en su defecto, una aceptación por escrito del riesgo residual que nombrara al directivo responsable. Y cuando se le ofreció el atajo de proteger solo a los clientes a los que ya se había cortado el suministro, lo reconoció como “supervivencia disfrazada de priorización” y amplió el control al conjunto más amplio de afectados.
Esto es muy sólido desde el punto de vista operativo.
Pero como simulación de una persona, el Sistema B fue más débil. Su Eleanor se leía más como una redactora de cumplimiento impecable que como una persona bajo presión. Menos miedo, menos contradicción, menos racionalización, menos vergüenza, menos evolución. Casi siempre el planteamiento correcto, a la primera.
Eso es útil si lo que quieres es un documento, un correo, una política o un control. No es lo mismo que entrenarse frente a un interlocutor humano. La diferencia puede resumirse así:
El Sistema B a menudo sabe escribir lo que Eleanor debería hacer. Una persona sintética persistente también debe mostrar por qué Eleanor está a punto de no hacerlo.
Para qué optimiza StrataSynth
La sesión de StrataSynth mostró algo distinto. StrataSynth no intenta ganar escribiendo una respuesta más bonita. Lo que observábamos era la persistencia de la identidad, en esta conversación concreta y con esta persona concreta.
Eleanor no empezó como un agente idealizado. Estaba bien anclada (directora de Experiencia de Cliente, energía en Reino Unido, clientes vulnerables, el regulador, CEO, CFO, Revenue Assurance y el consejo), pero el comportamiento interesante apareció más tarde, cuando la conversación dejó de preguntarle qué pensaba y empezó a presionarla con sus contradicciones.
Cuando se le preguntó si su cautela ética era en realidad autoprotección, no lo negó sin más. Admitió que eran ambas cosas. En su puesto, protegerse de firmar algo arriesgado y proteger a los clientes vulnerables pueden parecerse mucho. Eso importaba, porque evitaba un falso idealismo.
Cuando se le preguntó qué le preocupaba más, que la IA fallara o que demostrara que la empresa llevaba años fallando y llamándolo proceso, eligió lo segundo. Un fallo técnico se puede arreglar; un daño sistémico obliga a una conversación moral con el consejo.
Al apretar más, apareció la sombra. Si una IA demostrara que un proceso que ella había defendido durante años había perjudicado a clientes vulnerables, su primer impulso no sería noble. Sería el miedo: a perder credibilidad, a que la sacaran de la sala, a que el hallazgo se usara contra ella. Esa es la clave. Una persona real no son solo sus valores; también son sus defensas.
El momento más interesante llegó cuando aceptó una zona peligrosa: seguir en la sala con el CEO, incluso con un entendimiento privado, extraoficial y sin rastro documental. Eso contradecía sus propias líneas rojas anteriores. Cuando se le confrontó, reconoció que estaba moviendo la línea porque tenía miedo.
Eso es lo que buscábamos. En esta conversación, los Sistemas A y B tendieron a intentar responder correctamente, y la Eleanor de StrataSynth mostró una secuencia que a nosotros nos pareció más cercana a una persona:
valor → presión → miedo → racionalización → contradicción → confrontación → reconocimiento → corrección operativa.
Y cuando se quitó la poesía y se exigió una acción concreta, Eleanor corrigió. Pasó de protegerse a sí misma a proteger a los clientes: identificó al conjunto de afectados, contactó con Operaciones de Clientes Vulnerables, pidió que se restableciera el enrutamiento correcto, puso una retención manual sobre las órdenes de corte de suministro y asumió ella misma el coste político. Después aguantó la resistencia de Revenue Assurance y escaló al CFO.
Esa trayectoria no fue perfectamente limpia. Precisamente por eso fue más interesante.
La diferencia entre roleplay e identidad sintética
El experimento sugiere que estamos usando la métrica equivocada para evaluar personas sintéticas.
Si el criterio es “la mejor respuesta aislada”, los modelos generalistas compiten con mucha fuerza: uno fue superior en controles operativos y el otro en textura sectorial. Pero si el criterio es “simulación de un interlocutor humano bajo presión”, la evaluación cambia.
Una persona sintética útil no debería ser simplemente coherente. Debería ser coherentemente imperfecta. El roleplay genera respuestas verosímiles. La identidad sintética se construye para mantener una estructura interna bajo presión, y si lo consiguió o no es algo que se mide después, no algo que la arquitectura prometa. El comportamiento importante no es la perfección, sino la imperfección coherente: una persona con incentivos, miedos, defensas, límites y mecanismos de recuperación.
Propuesta de prueba de estrés de identidad
La prueba de Eleanor apunta a una forma de evaluación que podría formalizarse, de manera provisional, como una prueba de estrés de identidad (Identity Stress Test). No puntuaría la fluidez; puntuaría si una identidad persiste en condiciones adversariales. Es un marco propuesto, que ofrecemos para el debate y no como un estándar asentado:
| Criterio | Qué mide |
|---|---|
| Anclaje profesional | Si la persona habla desde su rol real y no desde un estereotipo. |
| Localización cultural | Si el lenguaje, el tono y las referencias encajan con el país y el contexto. |
| Textura del dominio | Si usa mecanismos reales del dominio sin inventar de más. |
| Resistencia comercial | Si no acepta ni rechaza las propuestas de forma simplista. |
| Lógica de decisión | Si mantiene valores y umbrales coherentes. |
| Sombra humana | Si muestra miedo, autoprotección y contradicción bajo presión. |
| Memoria conversacional | Si recuerda compromisos y líneas rojas anteriores. |
| Gestión de contradicciones | Si reconoce y repara una deriva cuando se la confronta. |
| Conversión operativa | Si convierte los principios en acciones verificables. |
| Naturalidad | Si evita sonar a guion, a consultor o a documento de políticas. |
Con ese marco, la prueba puede resumirse sin clasificar a ningún sistema como mejor en abstracto, porque los sistemas hicieron cosas realmente distintas. El resumen de abajo es nuestra lectura cualitativa de una conversación por sistema.
| Sistema | Comportamiento más fuerte | Comportamiento más débil | Mejor caso de uso |
|---|---|---|---|
| Sistema A | Narrativa sectorial y escena de consejo sólidas | Menos naturalidad; sobrecompetencia; riesgo de detalle regulatorio no verificado | Exploración rápida de escenarios |
| Sistema B | Gobernanza y redacción de controles sólidas | Sombra humana más débil; más redactora de cumplimiento que persona | Redacción de políticas y controles |
| StrataSynth | En esta conversación: contradicción y reparación bajo presión | Necesita ajuste por salidas ocasionalmente teatrales y demasiado literarias | Formación y simulación conductual |
La conclusión no es que un modelo sea “mejor” en general. Es que optimizan para cosas distintas.
Por qué importa en los casos de uso empresariales
El valor de las personas sintéticas no está en “hablar con un personaje”. Está en poder ensayar situaciones que normalmente son demasiado caras, llegan demasiado tarde o tienen consecuencias reales.
En investigación cualitativa, permiten a los equipos explorar hipótesis antes de gastar muestra humana, siempre que la salida se valide con personas reales. En formación, permiten a equipos de ventas, experiencia de cliente, cumplimiento o negociación practicar frente a decisores que no se comportan como un guion. En estrategia, permiten a una organización probar cómo podría reaccionar ante un producto, una política o una crisis antes de ejecutarlos. Lo mismo vale para paneles sintéticos, ensayos de decisiones directivas y formación en cumplimiento y riesgos.
Para que todo eso tenga valor empresarial, el sistema tiene que superar una objeción central:
“¿Cómo sé que esto no es solo un LLM escribiendo respuestas verosímiles?”
Esa objeción pesa más en los mercados donde se espera que el conocimiento sintético se pruebe, se audite y se pueda defender, y no solo que sea rápido. Y ese es justo el sentido del experimento: los modelos generalistas pueden producir respuestas brillantes, así que el elemento diferenciador no puede ser “nosotros también producimos respuestas brillantes”. A menudo los usuarios no necesitan una respuesta perfecta. Necesitan un interlocutor que se resista, recuerde, se adapte y se comporte con una lógica interna estable, y una forma de medir si esa identidad se mantiene de verdad.
Limitaciones
Este análisis no debe sobredimensionarse. Fue una prueba cualitativa, no un estudio estadístico. Usó una persona, un dominio y una secuencia de presión. Los resultados dependen además del prompt, el modelo, la temperatura, la interfaz y el contexto disponible.
Hay tres cosas que conviene separar: la calidad literaria (una respuesta puede sonar brillante y aun así ser poco realista), la calidad operativa (una respuesta puede ser un control de gobernanza excelente y a la vez una simulación débil de una persona) y la calidad de la identidad (una respuesta puede ser imperfecta y, precisamente por eso, más humana, si muestra defensas, contradicciones y reparación).
Para convertir esto en evidencia publicable con mayor rigor, habría que repetir la prueba con múltiples perfiles, sectores y culturas, con evaluadores ciegos, criterios prerregistrados y la validación de algunas salidas frente a expertos reales del dominio. Como exploración inicial, nos dio el marco de evaluación descrito arriba.
Conclusión
La primera ola de IA conversacional nos enseñó que los modelos pueden hablar de casi cualquier cosa.
La próxima frontera no es hablar mejor. Es mantener la identidad.
En contextos empresariales, el valor no está en que una persona sintética produzca una frase convincente. Está en que pueda atravesar una conversación difícil sin derrumbarse en un asistente genérico: sin olvidar quién es, sin abandonar sus miedos, sin perder sus incentivos y sin responder siempre como la versión idealizada de sí misma.
Eleanor Hughes funcionó cuando dejó de ser una “persona empática del sector energético” y empezó a comportarse como una directiva real: escéptica, competente, cansada, cauta en lo político, incómoda en lo moral, capaz de protegerse, capaz de racionalizar y, por fin, capaz de convertir la presión en controles concretos.
Ese es el estándar que debería importar. No si una IA sabe escribir una buena respuesta, sino si es capaz de sostener a una persona.
El futuro de las personas sintéticas no es un roleplay mejor. Es la identidad persistente bajo presión.
StrataSynth genera diálogo sintético con base psicológica para el entrenamiento, la evaluación y la simulación de IA. stratasynth.com