Entrenar un modelo de IA para reconocer transacciones fraudulentas exige muchísimos ejemplos de fraude real, pero ese tipo de datos suele ser escaso, sensible y difícil de compartir por motivos de privacidad. Los datos sintéticos resuelven parte de este problema: información generada artificialmente, normalmente por otro sistema de IA, que imita las características estadísticas de datos reales sin contener ninguna información real ni identificable de personas concretas.
Por qué no es simplemente «información inventada al azar»
Un buen conjunto de datos sintéticos no se genera de forma arbitraria: se diseña específicamente para conservar los patrones estadísticos y las relaciones relevantes de los datos reales originales (por ejemplo, qué combinaciones de variables suelen aparecer juntas en un caso de fraude), sin incluir ningún dato real e identificable de una persona concreta que pudiera comprometer su privacidad.
Casos de uso habituales
- Entrenar modelos de detección de fraude, generando ejemplos sintéticos de patrones fraudulentos sin exponer transacciones reales de clientes concretos.
- Completar conjuntos de datos escasos en categorías poco representadas, generando ejemplos adicionales sintéticos que equilibren mejor el entrenamiento del modelo.
- Probar sistemas de software con datos realistas sin usar información real de clientes en entornos de desarrollo o pruebas.
- Compartir conjuntos de datos con terceros (investigadores, socios) sin comprometer la privacidad de las personas reales detrás de los datos originales.
Por qué ha ganado relevancia con las normativas de privacidad actuales
Normativas como el RGPD europeo limitan considerablemente qué datos personales reales pueden usarse y compartirse, incluso con fines de investigación o desarrollo tecnológico. Los datos sintéticos, al no contener información real identificable, ofrecen una vía para seguir entrenando y mejorando modelos de IA sin incurrir en los mismos riesgos legales y éticos asociados al uso directo de datos personales reales.
Una limitación que conviene tener presente
Los datos sintéticos son tan buenos como el proceso que los genera: si ese proceso no captura bien todos los matices y casos límite de los datos reales originales, el modelo entrenado con datos sintéticos puede fallar precisamente en esos casos límite no bien representados, algo que conviene validar comparando el rendimiento del modelo con datos reales siempre que sea posible hacerlo de forma segura.