Introducción
Esta sección describe cómo usar NUCLEUS a través de la plataforma web. Se centra en lo que haces, paso a paso. Las ideas subyacentes se explican en la sección Conceptos.
Activos
Los activos son el punto de partida de todo lo que hagas. Antes de anonimizar o generar datos, añades el conjunto de datos con el que quieres trabajar.
- Añadir datos. Sube un archivo o conecta una fuente de datos (consulta la documentación de AXON). AXON lo registra como un activo y guarda su descripción, incluido el país del que procede (que se usa para que los valores generados, como nombres y direcciones, sean realistas para ese país).

- Análisis. El activo se analiza automáticamente para detectar los elementos sensibles y sus tipos. Esto es lo que determina los métodos por defecto que se sugieren más adelante.

- Trazabilidad. Cada paso del proceso queda registrado en los logs —la validación, la anonimización y el entrenamiento y la generación del sintetizador— y puedes consultarlos en cualquier momento desde la pestaña Observabilidad, junto con el estado y el resultado de cada ejecución. Esto te ofrece una pista de auditoría completa de qué se hizo con tus datos, cuándo y con qué configuración.

Anonimización
La anonimización protege los elementos sensibles de un activo y guarda el resultado como un nuevo activo anonimizado. El original nunca se modifica.
Configuración automática
Solo se transforman los elementos que dejes seleccionados. Todo lo demás —los elementos que hayas deseleccionado y todos los datos no sensibles— se conserva sin cambios, que es lo que hace que el activo anonimizado mantenga una estructura idéntica a la del original.
Para cada elemento sensible detectado, NUCLEUS preselecciona el método por defecto correspondiente a su tipo (consulta Métodos de anonimización). La configuración automática te permite anonimizar un activo en un solo paso usando estos valores por defecto: la forma más rápida de obtener un conjunto de datos protegido.
Configuración avanzada
La configuración avanzada te da control elemento a elemento. Para cada elemento o columna sensible puedes:
-
Decidir si protegerlo o no. Todos los elementos sensibles encontrados durante el análisis quedan seleccionados por defecto. Si deseleccionas un elemento, queda excluido de la anonimización: no se le aplica ningún método y sus valores se trasladan al activo anonimizado exactamente como aparecen en el original. Esto resulta útil cuando un elemento detectado no es realmente sensible en tu contexto, o cuando un proceso posterior necesita ese valor intacto.
-
Elegir cualquier método admitido para ese tipo de elemento.
-
Ajustar la configuración del método (por ejemplo, el tipo sensible para Simulación, o la cantidad de ruido para Perturbación).
-
Combinar métodos dentro de un mismo activo para equilibrar privacidad y utilidad: métodos más estrictos e irreversibles para las columnas más sensibles, y métodos reversibles allí donde puedas necesitar recuperar el valor original.

Métodos
Consulta Métodos de anonimización para ver la lista completa de métodos, el valor por defecto para cada tipo de dato, qué hace cada método y cuáles pueden revertirse. En la aplicación web, el selector de método de cada elemento muestra exactamente estas opciones, filtradas según el tipo del elemento.
Desanonimización (reversión selectiva)
Para los métodos que conservan un mapeo, la plataforma puede revertir de forma selectiva la anonimización. Eliges qué columnas restaurar y NUCLEUS devuelve esas columnas a sus valores originales. La reversión requiere los permisos adecuados, ya que se controla de forma independiente de los propios datos.

Datos sintéticos
Trabajar con datos sintéticos consta de dos pasos: primero entrenas un sintetizador y después generas datos a partir de él.
Entrenamiento
Selecciona un activo y define las opciones de entrenamiento: tipos de columna, configuración de privacidad, elección de algoritmo (Generic, Transactional, Time Series o Relational) y cualquier opción específica del algoritmo. NUCLEUS entrena entonces el sintetizador, lo evalúa automáticamente y lo guarda. Puedes seguir el progreso desde la plataforma.

Entre las opciones habituales están el número de pasadas de entrenamiento, el modo calidad frente a privacidad, los tipos de columna, cómo se generan los identificadores, los formatos de fecha, las columnas sensibles y las reglas que siempre deben cumplirse en los datos (por ejemplo, "la edad debe ser 18 o más"). Consulta el Manual de referencia para ver la lista completa.
Gestión de sintetizadores
Todos los sintetizadores entrenados se almacenan en el espacio de trabajo Synthesizers de NUCLEUS, que actúa como repositorio centralizado para gestionar los modelos de generación de datos sintéticos.

Para cada sintetizador, los usuarios pueden:
-
Consultar los metadatos del sintetizador, incluidos su nombre, descripción, fecha de creación, algoritmo y estado de entrenamiento.
-
Revisar el historial completo de entrenamiento y los logs de ejecución para hacer seguimiento del progreso y del resultado de cada proceso de entrenamiento.
-
Reentrenar un sintetizador existente con datos de origen actualizados o con una configuración de entrenamiento distinta.
-
Renombrar o actualizar la descripción del sintetizador para mejorar su organización y documentación.
-
Eliminar los sintetizadores que ya no sean necesarios.
-
Importar sintetizadores entrenados en un entorno on-premise. Solo se importa el modelo entrenado; los datos de entrenamiento originales nunca salen de la infraestructura del cliente.
-
Reutilizar el mismo sintetizador para generar múltiples conjuntos de datos sintéticos en distintos proyectos y casos de uso.
La configuración de entrenamiento, los resultados de la evaluación, los metadatos y la información de ciclo de vida permanecen asociados a cada sintetizador, lo que proporciona trazabilidad completa desde el entrenamiento del modelo hasta la generación de datos sintéticos.
Generación de conjuntos de datos sintéticos
Una vez entrenado un sintetizador, se puede reutilizar para generar múltiples conjuntos de datos sintéticos sin necesidad de reentrenarlo.
Para generar un conjunto de datos sintético, los usuarios solo tienen que seleccionar:
-
El sintetizador que se va a utilizar.
-
El número de registros sintéticos que se van a generar.
-
Parámetros de generación opcionales.
-
Reglas opcionales de generación condicional.
Los conjuntos de datos sintéticos resultantes se almacenan automáticamente en el espacio de trabajo de Dedomena.AI del usuario. Desde ahí se pueden:
-
Descargar.
-
Enriquecer mediante NEURONS.
-
Publicar a través de CORTEX.
-
Reutilizar en flujos de trabajo posteriores de IA, analítica, testing, simulación e intercambio seguro de datos.
Dado que el sintetizador ya contiene la representación estadística aprendida del conjunto de datos original, durante la generación deja de ser necesario acceder a los datos de origen.
Generación condicional
Puedes dar forma a la salida en lugar de generar una copia sin más. Estableciendo proporciones objetivo por categoría, puedes reequilibrar o filtrar el conjunto de datos sintético. Las proporciones se aplican conjuntamente entre columnas; por ejemplo, pedir género = Mujer junto con fraude = sí produce únicamente filas que sean de mujeres y fraudulentas. Esto resulta práctico para reforzar grupos poco frecuentes o construir conjuntos de entrenamiento equilibrados.

Informes de evaluación
Todos los sintetizadores entrenados incluyen el informe de calidad automático descrito en Evaluación de datos sintéticos. Revísalo antes de generar y compartir datos. Para un conjunto de tablas relacionadas, obtienes un informe combinado que las cubre todas.
