En los últimos años, el debate sobre los synthetic data, las synthetic personas y los digital twins ha asumido un papel central en el mundo de la investigación de mercados.
Investigadores, institutos y clientes se encuentran hoy ante una encrucijada similar a la vivida con la llegada de las primeras encuestas online: por un lado entusiasmo y altas expectativas, y por otro dudas, desconfianza e interrogantes sobre la calidad de los resultados generados artificialmente.
En su reciente seminario web de ESOMAR, Ray Poynter —junto con las contribuciones de Jon Puleston y Rupert van Hullen en el Global Research Software 2025— trazó un panorama claro y pragmático sobre las oportunidades, los límites y los riesgos de las nuevas tecnologías de generación de datos basadas en IA.

 

Qué son los Synthetic Data según ESOMAR

En junio de 2025, el ICC/ESOMAR Code introdujo una definición oficial de synthetic data: datos generados artificialmente para sustituir aquello que normalmente se recogería directamente de las personas. Se trata de conjuntos de datos que replican distribuciones, patrones y relaciones típicas de los datos reales, no simples simulaciones aleatorias. Según ESOMAR, hoy existen dos enfoques principales:

  1. Model-based tabular synthesis
    Basada en algoritmos estadísticos, machine learning, GANs, modelos bayesianos o técnicas de difusión: crea registros sintéticos que preservan la estructura del conjunto de datos real.
  2. LLM-generated data
    Incluye:
    synthetic personas, agentes conversacionales que responden como seres humanos; digital twins, versiones digitales dinámicas del comportamiento de individuos reales.

 
Estos últimos, aunque muy discutidos, aún se encuentran en una fase inicial y requieren criterios de evaluación más sólidos.
 

¿Por qué hoy se habla tanto de datos sintéticos?

La oferta está creciendo rápidamente: además de actores históricos como Ipsos, Kantar y Toluna, están surgiendo proveedores especializados como Fairgen o LivePanel, que proponen soluciones basadas en IA generativa y modelización avanzada.
La actitud de las empresas hacia los datos sintéticos hoy se resume en tres categorías:

  • quienes ya utilizan los synthetic data de forma activa;
  • quienes los rechazan por principio, temiendo pérdida de calidad;
  • quienes esperan pruebas más sólidas antes de adoptarlos.

 

Como recuerdan Poynter y Puleston, esta fase se asemeja al “wild west” de las nuevas tecnologías: grandes oportunidades, pero también riesgo de hype, resultados no siempre reproducibles y promesas exageradas.
 

Principales tipologías de Synthetic Data

En el contexto de la investigación de mercados podemos distinguir cuatro categorías de datos sintéticos:

  1. Boosting / Augmenting / Imputation
    Aumento artificial de partes de la muestra para equilibrar cuotas infrarrepresentadas o compensar carencias.
  2. Datos completamente sintéticos
    Conjuntos de datos construidos desde cero basándose en modelos que imitan a la población real.
  3. Datos sintéticos anonimizados
    Datos reales transformados para proteger la privacidad manteniendo propiedades estadísticas válidas.
  4. Datos sintéticos aleatorizados
    Datos generados con lógicas controladas, útiles para pruebas técnicas y validaciones.

 
Hoy, el área más madura es el boosting, gracias a su aplicación concreta en la gestión de muestras difíciles.
 

El caso más común: el boosting de la muestra

Veamos un ejemplo típico de boosting: un estudio requiere 500 entrevistas para cada uno de los segmentos: hombres jóvenes, mujeres jóvenes, hombres adultos y mujeres adultas. Si solo se recogen 350 hombres jóvenes, ¿cómo proceder?

Las opciones son conocidas: aceptar la infrarrepresentación, ponderar los datos o generar datos sintéticos con técnicas estadísticas o de IA.

Métodos estadísticos tradicionales

Antes de la IA generativa, ya se utilizaban enfoques como:

  • random sampling
  • nearest neighbours
  • SMOTE (Synthetic Minority Oversampling Technique)

 
Estos métodos crean nuevos casos “híbridos” basados en los sujetos más similares y siguen funcionando muy bien para conjuntos de datos numéricos y estructurados.

Boosting con IA avanzada

Hoy, la integración de machine learning y grandes paneles históricos permite soluciones mucho más sofisticadas. Algunos casos de estudio presentados en ESOMAR LATAM muestran cómo estos boosting han obtenido errores medios entre el 1% y el 3%.
 

Cómo evaluar la calidad de los datos sintéticos

Cuando evaluamos el uso de datos sintéticos, debemos plantearnos dos preguntas fundamentales:

¿Funciona en general con tu tipo de datos?
Para responder, se pueden utilizar estudios anteriores: se elimina una parte de las entrevistas recogidas, se genera el boost y se compara el nuevo resultado con los datos reales previamente recogidos.

¿Funciona para este proyecto específico?
Se puede utilizar un holdout sample: un subgrupo real que no se utiliza en el modelo, útil para comparar la calidad del boosting con datos sintéticos. Estas técnicas son aplicables al boosting, pero se vuelven más complejas cuando se trata de datos completamente sintéticos, ya que falta una referencia directa a una población real.
 

Límites y precauciones en el uso de synthetic data

A pesar de las aplicaciones prometedoras, Poynter invita a la prudencia.

  1. Efectos temporales
    Los modelos dependen de los datos de entrada. Si los datos están desactualizados, los resultados estarán sesgados.
    Riesgos principales: estacionalidad, tendencias a largo plazo, eventos disruptivos (p. ej., pandemia, lanzamiento de un nuevo dispositivo, IA).
  2. Imposibilidad de estimar el margen de error
    Con datos completamente sintéticos no se puede hablar de error de muestreo. El bootstrapping mide solo la estabilidad del modelo, no su precisión respecto a la población real.
  3. Promesas exageradas
    Los proveedores que hablan de “precisión triple” deben considerarse con cautela. La historia reciente demuestra que incluso modelos aparentemente sólidos pueden contener sesgos (como ocurrió en modelos de reconstrucción facial distorsionados).
  4. Cannibalización de datos
    Utilizar conjuntos sintéticos como base para generar más conjuntos sintéticos provoca model drift, model collapse y pérdida de realismo.

 

El mundo de las Synthetic Personas

Si los synthetic data representan la parte cuantitativa, las synthetic personas son el componente cualitativo de la revolución.
Son agentes inteligentes que responden cuestionarios, participan en discusiones cualitativas, generan insights y permiten probar mensajes y creatividad.
Cada vez más suelen diseñarse como digital twins, es decir, gemelos digitales dinámicos de consumidores reales.
Los digital twins no se limitan a representar un target: replican procesos de decisión, preferencias y actitudes, permitiendo simulaciones predictivas mucho más sofisticadas.
 

Caso Ipsos en Japón: qué pueden (y qué no pueden) hacer los digital twins

Un estudio de Ipsos sobre 150 mujeres japonesas permitió construir digital twins individuales y comparar sus respuestas con las reales en un estudio de seguimiento sobre temas relacionados con el ciclo menstrual.
Resultados clave:

  1. Los temas principales coincidían entre reales y twins.
  2. La profundidad emocional era inferior en los twins.
  3. En la fase creativa, los twins generaban muchas ideas, pero no siempre relevantes.
  4. En las evaluaciones finales, los twins privilegiaban beneficios racionales, mientras que las personas reales suelen decidir en función de la emoción.

 
Conclusión:
Los twins replican bien la estructura y la dirección, pero no la sensibilidad humana.
 

Riesgos y criticidades de los digital twins (según van Hullen)

El poder de los digital twins conlleva una serie de riesgos que no deben subestimarse, como subraya Rupert van Hullen en el ESOMAR Global Research Software 2025.
La necesidad de gestionar grandes cantidades de información personal aumenta, por ejemplo, el peligro de data leakage, es decir, la posibilidad de que datos sensibles se expongan involuntariamente debido a vulnerabilidades en los sistemas o errores en la gestión de datos. A esto se suma el riesgo de ataques adversariales: modelos e infraestructuras pueden ser objetivo de actores malintencionados que intentan extraer información confidencial o manipular los modelos.

Otra criticidad se refiere a la presencia de special categories data, como opiniones políticas, creencias religiosas o información sobre la salud. Se trata de datos particularmente delicados, que requieren un nivel de protección superior y procedimientos estrictos de tratamiento.
Las respuestas abiertas también pueden representar un punto débil: a menudo contienen más información personal de lo esperado, dando lugar a formas de divulgación no intencionada difíciles de controlar por completo.

Por último, la propia complejidad de las pipelines necesarias para construir digital twins multiplica los puntos potenciales de vulnerabilidad: cada nuevo paso de procesamiento o almacenamiento amplía la superficie de riesgo.

Para hacer frente a estos desafíos, ESOMAR destaca la importancia de un enfoque estructurado de mitigación.
Técnicas avanzadas de anonimización, como la adversarial anonymisation, permiten reducir drásticamente la trazabilidad. La adopción de arquitecturas que prevén un control riguroso de los accesos y la segregación de datos contribuye a limitar la exposición de información sensible.
Todo ello debe ir acompañado de un enfoque de privacy by design y una revisión ética continua, indispensables para monitorizar la evolución de los riesgos y garantizar un uso responsable de los digital twins.
 

Las oportunidades de los synthetic data en la investigación de mercados

Existen varios ámbitos en los que los synthetic data y las personas ya están demostrando su utilidad, tales como:

  • tests rápidos de conceptos, mensajes y creatividad,
  • optimización de cuestionarios antes del trabajo de campo,
  • integración de muestras difíciles o costosas,
  • simulaciones predictivas y análisis what-if,
  • pre-screening cualitativo mediante personas o digital twins.

 
Los synthetic data no sustituyen toda la cadena de investigación: son herramientas complementarias que aceleran el trabajo y reducen costes en las primeras fases de los proyectos.
 

Una revolución ya en marcha

El mensaje central es claro: los synthetic data ya están aquí, funcionan y crecerán rápidamente.

El boosting y la tabular synthesis son hoy las áreas más sólidas.
Las synthetic personas y los digital twins representan la frontera más innovadora —rica en oportunidades pero también en límites, especialmente en el plano emocional y de sensibilidad humana.

El enfoque adecuado es experimentar, probar, validar, evitar promesas de realismo absoluto y no sustituir por completo los datos reales.

Tal como ocurrió con las encuestas online hace veinte años, la adopción de los synthetic data requerirá tiempo, estándares y mayor familiaridad.
Pero la dirección ya está trazada: no un sustituto, sino una nueva herramienta capaz de ampliar las posibilidades de la investigación de mercados.

Lee también IA y investigación de mercado: la calidad sigue siendo humana.