Datasets de personas sintéticas comparados: ¿cuál encaja en tu proyecto?

PersonaHub, FinePersonas, Nemotron-Personas, PERSONA, Synthetic-Persona-Chat, Twin-2K-500 y StrataSynth Personas resuelven cada uno un problema distinto. Qué ofrece cada uno, cuándo elegirlo y qué hacer cuando necesitas personas y no descripciones.

personas-sinteticasdatasetscomparativasimulacion-de-usuariosmultilingue

Las personas sintéticas se han convertido en un ingrediente habitual para construir y probar IA: generar semillas para datos de entrenamiento, simular usuarios, revisar si un asistente tiene sesgos antes de que se encuentre con clientes reales. Ya hay varios datasets abiertos excelentes, y no son intercambiables. Cada uno se construyó para un trabajo distinto.

Esta es una guía práctica de los principales, incluido el nuestro, para que elijas la herramienta adecuada para el tuyo.

De un vistazo

TamañoAnclado a una población realIdiomas / paísesQué contiene cada personaPersonalidad en númerosLicencia
PersonaHubmuy grandeno, construido para la diversidadinglésuna frase o un párrafo descriptivonoCC BY-NC-SA 4.0 (no comercial)
FinePersonas42 millonesno, construido para la diversidadinglésun párrafo, con etiquetas de tema y embeddingsnolicencia de Llama 3
Nemotron-Personas1 millón por paíssíEE. UU., Francia, Brasil, Japón, India, Singapur, Coreadatos demográficos, ubicación, varias biografías temáticas, habilidades, aficiones, metas profesionalesno en la versión abiertaCC BY 4.0
PERSONA1.586sí, EE. UU.inglés, EE. UU.atributos demográficos e idiosincrásicos, con valoraciones de preferencias-CC BY-NC-SA 4.0 (no comercial)
Synthetic-Persona-Chatunos 11.000noinglésunas pocas frases de persona y una conversación entre dos personasnoCC BY 4.0
Twin-2K-5002.058personas realesinglés, EE. UU.unas 500 respuestas de encuesta de participantes realesrespuestas reales medidasCC BY 4.0
StrataSynth Personas10.000síEspaña, México, EE. UU., Reino Unido, Alemania, Francia, Italia, Brasil, cada uno en su idiomadatos demográficos, ocupación, ingresos, hogar, rutina diaria, forma de hablar, aficiones, habilidades, metasBig Five y apego adulto, de 0 a 1CC BY 4.0

Dónde brilla cada uno

PersonaHub y FinePersonas: amplitud. Cuando necesitas millones de puntos de vista distintos para diversificar instrucciones sintéticas, problemas de matemáticas o texto de un dominio, nada supera su escala. Una persona es una descripción breve, que es justo lo que quieres cuando sirve de semilla para un prompt.

Nemotron-Personas: escala con datos demográficos reales. Un millón de personas por país, ancladas a estadísticas oficiales, con biografías temáticas ricas. Si tus usuarios están en Estados Unidos, Japón o India, es un punto de partida magnífico.

PERSONA: alineamiento pluralista. Construido para comprobar si un modelo puede servir a personas con valores y preferencias distintos, con cientos de miles de juicios de preferencia. Ante todo, un banco de pruebas para investigación.

Synthetic-Persona-Chat: diálogo anclado en una persona. Hechos breves de la persona más la conversación que producen. Ideal para entrenar a un modelo a mantenerse coherente con una persona en un chat.

Twin-2K-500: la referencia. Personas reales respondiendo a cientos de preguntas. No es sintético, y ese es su valor: es aquello con lo que comparas una simulación.

Dónde encaja StrataSynth

Primero, cómo se hace el nuestro. Cada persona de StrataSynth la genera nuestro propio motor, el StrataSynth Humans Engine. No usamos ninguno de los datasets anteriores para construir el nuestro: ni registros, ni texto, ni semillas. Solo los leímos para compararlos, que es lo que es este artículo.

StrataSynth Personas es la capa de datos abiertos de un sistema más grande. El mismo motor está debajo de nuestros productos y de las personas que generamos:

  • StrataSynth Personas: un dataset abierto de personas sintéticas ancladas a población real, listo para entrenar, evaluar y simular usuarios de IA.
  • StrataSynth Humans Engine: el motor que genera esas personas y las mantiene coherentes entre conversaciones y escenarios.
  • QualiSynth: investigación cualitativa construida sobre el motor, donde se puede entrevistar y comparar a consumidores sintéticos antes del trabajo de campo real.
  • ArenaSynth: práctica para las conversaciones que importan, donde los profesionales ensayan negociaciones, objeciones y decisiones difíciles frente a contrapartes sintéticas.

El dataset en sí se construyó para un trabajo concreto: probar y entrenar agentes que van a hablar con clientes reales en Europa y América, en su propio idioma.

  • Ocho países, cada uno en su idioma. Español para España y México, alemán, francés, italiano, portugués para Brasil e inglés para EE. UU. y Reino Unido, sin traducir del inglés. España, México, Reino Unido, Alemania e Italia no están cubiertos por los otros datasets anclados a población de la lista.
  • Poblaciones reales, hasta el nivel del hogar. La edad, la región, los estudios, los ingresos del hogar, el empleo, la forma de convivencia y la estructura familiar siguen la población adulta real de cada país, y en España, Francia, EE. UU., México y Brasil también las ocupaciones, con el nombre que se usa allí. Los nombres siguen frecuencias reales por generación, y las personas de España, México y Brasil llevan dos apellidos.
  • Personalidad en números, y visible en el texto. Cada persona tiene puntuaciones de Big Five y de apego adulto, y la biografía, la rutina y las aficiones están escritas a partir de ellas. Puedes filtrar por personalidad y obtener personas que se leen de forma distinta.
  • Listo para simular un usuario. Cada persona viene con una forma de hablar: tono, extensión, vocabulario, las expresiones a las que recurre. Pon una biografía y una forma de hablar en un prompt y tendrás un cliente que habla como una persona concreta de un lugar concreto.
  • Libre para uso comercial bajo CC BY 4.0.

De los datos de personas a personas con las que hablar

Una persona estática ya es útil por sí sola. Muchos proyectos necesitan algo más: una persona que responda a una situación, mantenga una postura, recuerde quién es de una conversación a la siguiente y cuyos motivos se puedan examinar.

Eso es lo que hace el Humans Engine. Modela a la persona que hay debajo de las palabras: la identidad, la personalidad, las creencias, los objetivos y el estado de la relación se mantienen de forma explícita, fuera del texto, y el motor fija qué pretende y qué quiere la persona antes de generar ningún lenguaje. La misma persona se puede reutilizar en distintas interacciones en lugar de reinventarse con cada prompt.

En la práctica, eso abre varios usos:

  • Investigación. Entrevistar a consumidores sintéticos antes de comprometerse con el trabajo de campo.
  • Pruebas de agentes. Poner un sistema conversacional frente a usuarios que discrepan, escalan o cambian de opinión.
  • Formación. Ensayar negociaciones, objeciones y conversaciones difíciles frente a una contraparte coherente.
  • Datos sintéticos. Generar conversaciones con la intención, el objetivo y el estado de creencias registrados junto al texto.

Cómo elegir la capa adecuada

No hay un único dataset de personas sintéticas mejor que los demás. La elección depende de lo que necesites hacer.

  • ¿Millones de descripciones breves de personas? PersonaHub o FinePersonas.
  • ¿Personas ancladas a población real a muy gran escala? Nemotron-Personas está diseñado para eso.
  • ¿Datos de entrenamiento conversacional anclados en una persona? Synthetic-Persona-Chat encaja de forma natural.
  • ¿Respuestas humanas reales con las que comparar? Twin-2K-500 te da algo que ningún dataset sintético puede darte: respuestas de participantes reales.
  • ¿Personas ancladas a población real en mercados de Europa y América, en su idioma y con personalidad explícita? StrataSynth Personas está diseñado para eso.
  • ¿Personas a las que entrevistar, poner a prueba o simular una y otra vez? Ahí entra el StrataSynth Humans Engine.

Estos datasets también funcionan bien juntos. Usa uno amplio para diversificar prompts, uno anclado a población para que tus usuarios de prueba se parezcan a tu mercado, datos humanos reales para comprobar que la simulación se sostiene, y un motor interactivo cuando necesites comportamiento y no descripciones.

Ir más allá del dataset

¿Quieres ver cómo se comportan estas personas, y no solo leer sobre ellas? Describe a quién quieres entender. Conócelo. Ponlo a prueba.

El dataset abierto: StrataSynth/stratasynth-personas-8-countries.

Los datasets de esta comparativa

Datos tal como aparecen en la página de cada dataset en septiembre de 2026.