Introducción
Visión general
NUCLEUS es la solución de privacidad de Dedomena.AI. Te permite seguir trabajando con tus datos —para analítica, desarrollo, testing o intercambio— sin exponer la información personal y sensible que contienen. NUCLEUS produce conjuntos de datos que conservan el valor de los originales al mismo tiempo que anonimizan cualquier información de identificación personal (PII), patrones y comportamientos, lo que te ayuda a cumplir con normativas como el GDPR, la LOPD, y CCPA.
NUCLEUS ofrece dos capacidades complementarias:
| Capacidad | Qué hace | Cuándo usarla |
|---|---|---|
| Anonimización | Protege los elementos sensibles de un conjunto de datos o archivo existente —columnas de una tabla, o regiones de una imagen, un documento o un archivo de audio— manteniendo todo lo demás exactamente como estaba. | Cuando necesitas conservar la estructura exacta de los datos originales pero proteger elementos sensibles concretos; por ejemplo, para compartir datos internamente entre equipos. |
| Datos sintéticos | Crea un conjunto de datos totalmente nuevo que se parece y se comporta como el original, pero que no contiene ningún registro real. | Cuando quieres ampliar un conjunto de datos, disponer de datos realistas para desarrollo y testing, o compartir datos externamente sin vínculo alguno con los registros originales. |
Ambas capacidades trabajan sobre los mismos activos (tus conjuntos de datos y archivos) y están disponibles tanto si usas la plataforma en la nube, a través de la API o en tu propia infraestructura.
Cómo funciona NUCLEUS
Usar NUCLEUS siempre sigue los mismos tres sencillos pasos:
-
Añadir y analizar. Subes un archivo o conectas una fuente de datos mediante AXON (Cloud, API o Edge). NUCLEUS lo analiza y detecta automáticamente los elementos sensibles que contiene y de qué tipo son (un nombre, un identificador, una cara en una foto, un número de teléfono dicho en voz alta, etc.).
-
Proteger. Eliges cómo proteger los datos: anonimizando los elementos sensibles detectados o generando una versión sintética del conjunto de datos. Se proponen valores por defecto razonables de forma automática, y puedes ajustarlos.
-
Usar. El resultado protegido se guarda como un nuevo activo que puedes descargar, exportar, compartir o utilizar en cualquier proceso posterior.

En el caso de la anonimización, como los elementos sensibles se identifican durante el paso de análisis, la protección se aplica exactamente a lo que se detectó: no se pasa por alto nada sensible ni se altera nada innecesariamente. Los algoritmos de datos sintéticos son más complejos y dan lugar a la generación de datos nuevos, con funcionalidades adicionales como privacidad diferencial, módulo de privacidad de valores atípicos, módulo de protección de PII, clasificación del tipo de columna sensible, etc.
Formas de usar NUCLEUS
Puedes usar NUCLEUS de tres maneras, según tus necesidades de gobierno del dato:
-
NUCLEUS Cloud: la plataforma SaaS gestionada. Trabajas desde la interfaz de la aplicación web; todo ocurre online sin que tengas que ocuparte de nada. Es la opción más sencilla y no requiere ninguna instalación.
-
NUCLEUS Edge: un componente on-premise que se ejecuta en tus propias máquinas, junto a tus datos. Tus datos originales nunca salen de tu entorno; solo se envía de vuelta a la plataforma el resultado final (un sintetizador —modelo matemático cifrado— cuando se crean datos sintéticos) para usarlo más adelante. Elige Edge cuando tus políticas exijan que los datos permanezcan dentro de tu perímetro.
-
API REST de DEDOMENA.AI: expone las mismas capacidades que la aplicación web para que puedas automatizarlas desde tus propias aplicaciones y pipelines. Puedes anonimizar cualquier activo registrado en la plataforma —tablas, documentos, imágenes y audio— enviando una configuración que asigne a cada elemento sensible el método de anonimización que quieras, y también puedes entrenar sintetizadores y generar conjuntos de datos sintéticos de forma programática. Elige la API cuando la privacidad tenga que ejecutarse de forma desatendida dentro de un flujo de trabajo existente (procesos ETL, pipelines de CI/CD, servicios de aprovisionamiento de datos).
Todas las opciones ofrecen las mismas capacidades, métodos y evaluación de calidad. Esta guía cubre la plataforma web en la sección Cloud, la API REST en la sección API, y el componente on-premise en la sección Nucleus Edge.
Conceptos
Esta sección explica las ideas y conceptos con los que te encontrarás al usar NUCLEUS. No necesitas formación técnica para seguirla.
Selección de datos
Todo en Dedomena.AI empieza con un activo. Un activo es simplemente un conjunto de datos que has registrado en la plataforma, junto con su descripción (metadatos). Un activo puede ser:
-
Una tabla estructurada: filas y columnas, como una hoja de cálculo o una tabla de base de datos.
-
Un archivo no estructurado: una imagen, un documento o un archivo de audio.
-
Una colección de activos relacionados: varios activos vinculados entre sí y tratados como una unidad. Una colección puede combinar datos estructurados y no estructurados: dos tablas relacionadas (por ejemplo, clientes y sus pedidos), o una tabla junto con los archivos a los que hace referencia (por ejemplo, un CSV de candidatos y los archivos PDF de sus CV). NUCLEUS mantiene coherentes los vínculos entre los activos de una colección cuando los protege (consulta Anonimización consistente entre activos relacionados).
Activos originales, anonimizados y sintéticos. Cuando proteges un activo, NUCLEUS crea un activo nuevo con el resultado y mantiene el original intacto. Cada activo se etiqueta por tipo —original, anonimizado o sintético— para que siempre sepas qué estás mirando.
Análisis. Antes de proteger nada, AXON analiza el activo y detecta sus elementos sensibles y sus tipos. En el caso de las tablas, esto significa entender cada columna (¿es un nombre, un importe, una fecha, una categoría?); en el de los archivos, localizar las regiones sensibles (una cara, una firma, una línea de texto, un fragmento hablado). Este análisis es lo que alimenta las sugerencias automáticas que verás después.
Tipos de columna (para tablas). En las tablas, el tipo asignado a cada columna es importante, porque determina qué métodos de protección están disponibles y cómo se trata la columna. Los tipos habituales son texto, número, categoría, verdadero/falso, fecha, identificador y coordenadas.
Transformación con preservación de la privacidad
NUCLEUS protege los datos de dos maneras distintas. Son complementarias, y cuál elijas dependerá de lo que necesites.
La anonimización modifica las partes sensibles de tus datos reales y deja todo lo demás exactamente como estaba. Se conservan la estructura y los valores no sensibles, de modo que el resultado es tu conjunto de datos real con los elementos sensibles ocultos o sustituidos. Algunos métodos puede revertirlos un administrador autorizado; otros no.
Los datos sintéticos no modifican en absoluto tus datos reales. En su lugar, NUCLEUS aprende los patrones de tu conjunto de datos y crea un conjunto de datos completamente nuevo desde cero. Ninguno de los registros generados reproduce un registro real de tus datos de origen —por lo que nada puede rastrearse hasta una persona o entidad real—, y aun así el nuevo conjunto de datos mantiene el mismo comportamiento estadístico (distribuciones, relaciones y patrones) que el original. Además, tú decides cuántos datos generar: el conjunto de datos sintético puede tener el mismo número de registros que el original, o tantos (o tan pocos) como necesites.
| Anonimización | Datos sintéticos | |
|---|---|---|
| Resultado | Tus datos reales con los elementos sensibles protegidos | Un conjunto de datos totalmente nuevo, estadísticamente similar al original |
| Estructura | Idéntica a la del original | Comportamiento similar, no una copia fila a fila |
| Vínculo con los registros originales | Reducido, según el método | Ninguno |
| Se puede revertir | En algunos métodos, bajo supervisión | No aplicable |
| Ideal para | Conservar la estructura exacta; compartir internamente | Ampliar datos; desarrollo y testing; compartir externamente |
Métodos de anonimización
Los métodos de anonimización se aplican a los elementos sensibles detectados durante el proceso de análisis. Los métodos disponibles para un elemento dado dependen del tipo de elemento sensible detectado (para archivos: texto, imagen o audio) o, en el caso de las tablas, del tipo de dato de la columna sensible (string, numérico, categórico, booleano o datetime).
NUCLEUS selecciona automáticamente un método por defecto para cada elemento sensible, pero puedes elegir cualquier otro método admitido al configurar la anonimización.
Métodos disponibles por elemento / tipo de dato
| Elemento sensible / Tipo de columna | Métodos disponibles (el de por defecto en negrita) |
|---|---|
| Imágenes (visual) | Desenfocar, Pixelar, Tachar |
| Audio | Pitido, Silencio, Omisión |
| Numérico | Perturbar, k-anonimización, Mezclar, Enmascarar, Hash, Eliminar |
| Fecha | Desplazar, k-anonimización, Perturbar, Mezclar, Enmascarar, Eliminar |
| Texto (string) | Enmascarar, Simulación, Pseudónimo, Codificar, Regeneración, Hash, Mezclar, k-anonimización, Eliminar |
| Categórico | Enmascarar, Simulación, Pseudónimo, Mezclar, Hash, k-anonimización, Eliminar |
| Booleano | Mezclar, Enmascarar, Eliminar |
Descripción de los métodos
| Nombre | Descripción |
|---|---|
| Enmascarar (mask) | Sustituye el valor por otro de la misma longitud que no revela nada. Con asterisks deja visibles el primer y el último carácter y rellena el resto con asteriscos: 12345678Z pasa a 1*******Z. Con opaque sustituye cada carácter por otro de su misma clase —dígito por dígito, letra por letra—, no conserva ninguno del original y mantiene los separadores, así que la forma sobrevive: trc_8f31c0a9 pasa a algo como kqz_4b07f2e1. Los valores iguales reciben siempre la misma cadena, que se sortea y se guarda en la tabla de equivalencias: nunca se deriva del valor real. |
| Hash (SHA-256) | Transforma el dato en una cadena única e irreversible, una huella digital del valor. Es ideal para nombres, empresas o números de tarjeta cuando hace falta comparar valores sin ver el texto original. |
| Pseudónimo (pseudonym) | Sustituye cada valor distinto por un identificador nuevo, de forma que un registro se puede seguir entre conjuntos de datos sin identificar a nadie. Se le puede dar la forma que deben tener los identificadores —por ejemplo EMP-\d\{6\}, que produce EMP-481902— y garantiza que dos registros nunca reciben el mismo. Sin forma, los identificadores se generan libremente. |
| Codificar (coding) | Para texto libre: encuentra los datos personales dentro de la frase y los sustituye, manteniendo el texto legible. Funciona en tres modos. Tokens marca cada hallazgo — COMPRA EN DEDOMENA.AI, MADRID → COMPRA EN \{Company_1\}, \{City_1\}. Surrogates escribe en su lugar un valor verosímil, y reutiliza el que esa misma persona o empresa ya recibió en su propia columna, de modo que el texto sigue concordando con el resto de la tabla. Invented escribe un valor verosímil nuevo sin vincularlo a nada. |
| Simulación (simulate) | Genera un valor ficticio verosímil en lugar de ruido, así que la columna sigue pareciendo lo que es. Se elige qué clase de valor generar (nombre, apellidos, dirección, correo, teléfono, dirección IP, etcétera). Los correos, los teléfonos y las URL se construyen a partir de rangos reservados, lo que significa que un valor generado nunca puede resultar ser el de una persona real. |
| Mezclar (shuffle) | Reordena al azar los valores dentro de una misma columna. Rompe el vínculo entre una persona y su dato concreto conservando la suma, la media y la distribución estadística de la columna. |
| k-anonimización (k-anonymization) | Sube la granularidad del valor para que ninguno señale a un grupo demasiado pequeño. El número significa algo distinto según la columna. En las numéricas es el ancho del tramo y admite decimales: 10 convierte 34 en 30-40, y 0.05 convierte una puntuación de 0,7314 en 0.70-0.75. En las de texto o de códigos —ciudad, código postal, idioma— es el mínimo de apariciones que necesita un valor para conservarse, se lee como entero, y los que no llegan se agrupan bajo la etiqueta Others. |
| Perturbar (perturb) | Añade ruido estadístico a los valores numéricos, el suficiente para impedir la reidentificación conservando la distribución y las medias de la columna. Se elige cuánto, de 0 a 1 — 0.05, una desviación del 5 %, es el valor por defecto. |
| Desplazar (shift) | Mueve la fecha en lugar de ocultarla, así que la columna sigue sirviendo como fecha. Todas las filas de una misma entidad se mueven el mismo intervalo, lo que mantiene coherentes las edades, la antigüedad y el orden de los acontecimientos. Se elige qué columna identifica a la entidad. |
| Regeneración (Regeneration) | Descarta el texto original y redacta uno nuevo a partir de los valores que ya se le han dado al registro, manteniendo el idioma, el registro y una longitud parecida. Es para los campos tan densos en datos personales que buscar qué tapar no resulta bastante seguro: en vez de ocultar partes, no se entrega nada del original. |
| Eliminar (drop) | Elimina la columna de la entrega. Para los campos que no aportan nada —una fotografía de perfil, una nota interna— donde lo más seguro es no entregarlos en absoluto. |
| Desenfocar (blur) | Aplica un desenfoque sobre un área visual sensible, reduciendo su nitidez sin eliminarla del todo. |
| Pixelar (pixelate) | Aplica un efecto de mosaico sobre un área visual sensible para ocultar los detalles manteniendo el área a la vista. |
| Tachar (redact) | Cubre por completo un área visual sensible. |
| Pitido (beep) | Sustituye el fragmento de audio por un pitido. |
| Silencio (silence) | Silencia el fragmento de audio. |
| Omisión (remove) | Recorta el fragmento del audio. |
Ajustar un método
Más allá de elegir el método, cuatro opciones cambian cómo se comporta en una columna concreta. Todas son opcionales.
| Opción | Qué hace |
|---|---|
| Referencia | Apunta una columna a las sustituciones de otra, de forma que una clave ajena recibe exactamente lo que recibió la entidad en su propia tabla y los datos siguen cruzándose. Se escribe como tabla.columna. |
| Derivar de | Construye el valor a partir de los valores ya sustituidos de otras columnas de la misma fila. Lo habitual es el correo desde el nombre nuevo, para que los dos concuerden en vez de describir a dos personas distintas. Dos registros que fueran a coincidir reciben un sufijo que los distingue, así que un valor derivado nunca se comparte. |
| Agrupar variantes | Activo por defecto. Las variantes de un mismo valor dentro de una columna reciben la misma sustitución —Dedomena y Dedomena.AI pasan a ser la misma empresa ficticia— sin depender de la detección. La comparación es por palabras completas, así que Ana no se confunde con Anabel. Se desactiva donde valores casi idénticos son de verdad entidades distintas. |
| Tipo | Declara el tipo de la columna en lugar de dejar que se infiera. Importa cuando la inferencia se equivocaría: un código postal como 08001 leído como número pasa a ser 8001, y ningún paso posterior puede devolverle el cero. |
Reversibilidad
Algunos métodos conservan un mapeo privado entre el valor original y el protegido, de modo que un administrador autorizado pueda recuperar el original más adelante. Otros son de un solo sentido y no se pueden revertir.
| Reversibles (basados en mapeo) | Irreversibles |
|---|---|
| Pseudonym, Simulation, Mask, k-anonimización | Hash (SHA-256), Shuffle, Perturb, Coding, Blur, Pixelate, Redact, Beep, Silence, Remove |
> Consejo. Usa métodos irreversibles para tus elementos más sensibles y reserva los métodos reversibles (en particular Pseudonym) para los casos en los que puedas necesitar la recuperación autorizada del valor original.
Anonimización consistente entre assets relacionados
Al anonimizar activos relacionados, la plataforma conserva las relaciones entre ellos aplicando sustituciones coherentes en todos los archivos vinculados.
Por ejemplo, imagina una colección que contiene:
-
Un archivo CSV con información de candidatos (como nombres y datos de contacto).
-
Un conjunto de archivos PDF con los CV de esos mismos candidatos.
Si se usa el método Simulation para sustituir los nombres de los candidatos en el CSV, los mismos nombres generados se aplican automáticamente a los nombres correspondientes que aparecen en el CV de cada candidato. Así se garantiza que la colección anonimizada siga siendo internamente coherente, preservando los vínculos entre datos estructurados y no estructurados y evitando al mismo tiempo la divulgación de las identidades originales.
La misma coherencia se mantiene para cualquier método de anonimización admitido que genere sustituciones deterministas, lo que permite que la información relacionada siga correctamente vinculada entre conjuntos de datos, documentos, imágenes, audio y otros activos de la misma colección.
Datos sintéticos
Los datos sintéticos son datos creados por NUCLEUS, en lugar de extraídos de tus registros reales. Un buen conjunto de datos sintético se comporta como el original —las mismas distribuciones, las mismas relaciones entre columnas, los mismos patrones globales—, de modo que tus análisis y modelos funcionan igual que sobre datos reales. Pero, como ningún registro sintético reproduce uno real, no hay nada que pueda rastrearse hasta una persona o entidad real.
Los datos sintéticos son especialmente útiles cuando quieres:
-
Ampliar un conjunto de datos: generar más filas de las que contiene el original.
-
Proporcionar datos realistas para desarrollo, testing y demos sin exponer datos de producción.
-
Compartir datos con socios, proveedores o el público general. Los datos sintéticos generados correctamente no suelen considerarse datos personales según las directrices de los reguladores europeos.
-
Reequilibrar un conjunto de datos: aumentar o reducir la presencia de grupos concretos (consulta Generación condicional).
Sintetizadores
Un sintetizador es el modelo que NUCLEUS entrena con tus datos para poder crear versiones sintéticas de ellos. Piensa en él como una receta reutilizable: lo entrenas una vez y, a partir de entonces, puedes generar todos los datos sintéticos que necesites, cuando los necesites, sin volver a entrenar.
-
Reutilizable. Tras el entrenamiento, genera cualquier número de filas bajo demanda.
-
Seguro. Los sintetizadores se almacenan de forma cifrada y protegida. Cuando usas Nucleus Edge, solo se envía de vuelta a la plataforma este sintetizador protegido; tus datos originales se quedan contigo.
-
Actualizable. Puedes reentrenar un sintetizador con datos nuevos a medida que evolucionan tus datos de origen, de modo que se mantenga actualizado con el tiempo.
Mientras se crea un sintetizador, su estado pasa por unas pocas fases sencillas: en curso y después listo (éxito) o fallido. En ocasiones, un sintetizador se crea correctamente pero no se ha podido generar su informe de calidad; en ese caso, el sintetizador sigue siendo plenamente utilizable.
Configuración de entrenamiento
Cada sintetizador puede configurarse antes del entrenamiento para optimizar el equilibrio entre privacidad, calidad y rendimiento de generación.
Entre las opciones de configuración disponibles se incluyen:
| Parámetro | Descripción |
|---|---|
| Batch size | Tamaño de cada lote de entrenamiento. Se recomiendan potencias de dos (128, 256, 512, etc.) según el tamaño del conjunto de datos. |
| Epochs | Número de iteraciones completas de entrenamiento. Normalmente se recomiendan valores entre 100 y 300 para los sintetizadores Generic y Transactional. |
| Amplify | Controla el objetivo de optimización. La configuración por defecto maximiza la privacidad. La opción de calidad mejora ligeramente la fidelidad de los datos sintéticos a costa de reducir las garantías de privacidad. |
| Imputar valores ausentes | Cuando está activado, los valores ausentes se completan antes del entrenamiento. En caso contrario, el sintetizador aprende la distribución original de valores ausentes y la reproduce durante la generación. |
Hay parámetros adicionales específicos de cada algoritmo, disponibles según el sintetizador seleccionado.
Durante el entrenamiento, los usuarios también pueden definir restricciones de datos que los datos sintéticos generados deben respetar siempre.

Algunos ejemplos:
-
Madrid → el país debe ser siempre España.
-
La fecha de inicio debe ser siempre anterior a la fecha de fin.
-
La edad debe ser siempre mayor de 18.
-
El precio del producto no puede ser negativo.
Estas restricciones garantizan que los registros generados sigan siendo lógicamente válidos, conservando al mismo tiempo las características estadísticas del conjunto de datos original.
NUCLEUS también ofrece estrategias de generación especializadas para distintos tipos de variable, lo que permite sintetizar cada tipo de dato según sus propias características:
-
Campos de texto libre, conservando la estructura semántica del texto original. Los usuarios pueden proporcionar opcionalmente instrucciones de generación personalizadas para controlar cómo se produce el texto sintético: su estilo, tono, formato, idioma o contenido específico del dominio. Cuando no se proporciona ninguna instrucción, NUCLEUS genera automáticamente texto sintético anonimizando el contenido original y conservando su significado semántico y su estructura lingüística.
-
Coordenadas geográficas, generando ubicaciones sintéticas realistas y conservando las características y distribuciones espaciales de los datos originales. Las coordenadas generadas siguen teniendo sentido geográfico y pueden restringirse a regiones o países concretos cuando sea necesario.

-
Identificadores, generando identificadores sintéticos conforme a formatos o expresiones regulares definidos por el usuario. Esto permite obtener valores realistas como IDs de cliente, números de póliza, códigos de empleado u otros identificadores propios del negocio, garantizando su unicidad y coherencia.
-
Fechas y marcas de tiempo, conservando características temporales como la cronología, los intervalos, la estacionalidad y la duración de los eventos —según el algoritmo de generación seleccionado— y evitando al mismo tiempo la divulgación de los valores originales.

- Variables numéricas, conservando propiedades estadísticas como distribuciones, rangos, correlaciones y métricas agregadas, y generando a la vez valores completamente nuevos que no se corresponden con observaciones reales.

-
Variables categóricas y booleanas, manteniendo las frecuencias de categoría, las dependencias y las relaciones con otras variables para producir conjuntos de datos sintéticos estadísticamente coherentes.
-
Variables específicas de dominio, mediante estrategias de generación especializadas para tipos de datos de negocio complejos, como transacciones bancarias, información financiera, historiales médicos u otros atributos propios de cada sector, según el sintetizador seleccionado.
Esta combinación de parámetros de entrenamiento configurables, restricciones de negocio y generadores de variables especializados permite a NUCLEUS producir conjuntos de datos sintéticos que son a la vez estadísticamente precisos y adecuados para una amplia variedad de casos de uso posteriores de analítica, IA, testing e intercambio de datos.
Algoritmos
NUCLEUS ofrece varios algoritmos de generación especializados y optimizados para diferentes estructuras de datos y escenarios de negocio.
Generic
El sintetizador Generic está diseñado para conjuntos de datos tabulares estructurados en los que el comportamiento secuencial o temporal no es la característica principal.
Aprende distribuciones estadísticas, correlaciones entre variables y reglas de negocio a partir de conjuntos de datos de prácticamente cualquier sector.
El algoritmo Generic también admite el ajuste fino (fine-tuning) de sintetizadores entrenados previamente, lo que permite mejorar los modelos de forma incremental con datos adicionales.
Casos de uso recomendados:
-
Bases de datos de clientes
-
Historiales médicos
-
Conjuntos de datos de RR. HH.
-
Sistemas CRM
-
Catálogos de productos
-
Datos de encuestas
Transactional
El sintetizador Transactional está diseñado para conjuntos de datos basados en eventos y transacciones, en los que los eventos se producen a intervalos de tiempo irregulares.
Aprende patrones de comportamiento como hábitos de gasto, frecuencias de transacción, relaciones con comercios, actividad de los clientes y dependencias temporales.
Para los datos bancarios, el algoritmo incluye capacidades específicas para sintetizar las descripciones de las transacciones conservando un comportamiento financiero realista.
Hay tres niveles de privacidad configurables:
| Nivel | Descripción |
|---|---|
| Nivel 1 | Sintetiza las fechas, importes, números de tarjeta y números de cuenta (IBAN) que aparecen dentro de las descripciones de las transacciones. |
| Nivel 2 | Incluye todo lo del Nivel 1 y, además, sintetiza los nombres, direcciones y ciudades contenidos en las descripciones de las transacciones. |
| Nivel 3 | Incluye todo lo del Nivel 2 y sintetiza también los nombres de comercios, sustituyéndolos por comercios realistas de sectores similares (por ejemplo, McDonald's → Burger King, Iberia → Ryanair). |
Este algoritmo resulta especialmente adecuado para:
-
Transacciones bancarias
-
Sistemas de pago
-
Historiales de compra
-
Análisis del comportamiento del cliente
-
Conjuntos de datos de detección de fraude
Time Series
El sintetizador Time Series está pensado para datos temporales muestreados con regularidad, en los que las observaciones se producen a intervalos de tiempo constantes.
Admite series temporales horarias, diarias, semanales, mensuales y cualesquiera otras equiespaciadas.
Las variables obligatorias suelen incluir:
-
Identificador de entidad (usuario, producto, sensor, etc.)
-
Marca de tiempo
Las variables adicionales asociadas a cada observación se aprenden junto con la evolución temporal de la serie.
Casos de uso habituales:
-
Datos de sensores IoT
-
Consumo energético
-
Previsión de ventas
-
Indicadores financieros
-
Monitorización industrial
Relational
El sintetizador Relational genera conjuntos de datos sintéticos compuestos por múltiples tablas relacionadas, preservando la integridad referencial.
Los conjuntos de datos relacionales admitidos deben cumplir las siguientes condiciones:
-
Todas las tablas deben pertenecer al mismo grafo relacional.
-
No puede haber registros huérfanos.
-
No se admiten las referencias cíclicas.
-
Toda clave ajena debe referenciar una clave primaria.
El algoritmo aprende tanto las distribuciones estadísticas dentro de cada tabla como las relaciones entre tablas, produciendo bases de datos sintéticas totalmente coherentes.
Aplicaciones habituales:
-
Sistemas ERP
-
Bases de datos CRM
-
Sistemas de información sanitaria
-
Registros de la Administración pública
-
Bases de datos operativas corporativas
Ajuste entre calidad y privacidad. Para los algoritmos Generic y Transactional puedes elegir entre dos modos:
-
Default: prioriza la máxima privacidad.
-
Quality: mejora el grado en que los datos sintéticos reproducen el detalle estadístico del original, a cambio de una leve contrapartida en privacidad.
Eliges el modo que mejor encaje con tu caso de uso; NUCLEUS lo aplica automáticamente durante el entrenamiento.
Evaluación de datos sintéticos
Cada vez que se entrena un sintetizador, NUCLEUS evalúa automáticamente los datos sintéticos que produce y genera un informe: no necesitas configurar nada. El objetivo del informe es que puedas confirmar, antes de usar los datos, que cumplen tus estándares.
Unos buenos datos sintéticos deben equilibrar tres objetivos a la vez: ser útiles, fieles al original y privados. NUCLEUS mide los tres y asigna a cada uno una puntuación de 0 a 100:
| Puntuación | Qué te indica |
|---|---|
| Privacidad | Hasta qué punto los datos sintéticos protegen a los sujetos que hay detrás de tus datos originales; por ejemplo, que los registros sintéticos no sean casi copias de los reales y que no haya coincidencias exactas accidentales. Cuanto más alta, más seguro. |
| Calidad | Con qué fidelidad reproducen los datos sintéticos la estadística del original: la distribución de cada columna y las relaciones entre columnas. Cuanto más alta, más realista. |
| Utilidad | Lo útiles que resultan los datos sintéticos en la práctica: si los análisis y los modelos de machine learning entrenados con ellos rinden tan bien como con los datos reales. Cuanto más alta, más útil. |
El informe de evaluación
Las tres puntuaciones, junto con los detalles de apoyo y los gráficos comparativos (real frente a sintético), se recopilan en un informe que se guarda junto al sintetizador y está disponible desde la plataforma. Para un conjunto de tablas relacionadas, el informe cubre cada tabla y ofrece un resultado global (consulta Evaluación de datos sintéticos)
Usa este informe para comprobar que un sintetizador cumple tus estándares de utilidad, calidad y privacidad antes de generar y distribuir datos con él. La evaluación se realiza automáticamente al final del entrenamiento; si por algún motivo no se puede producir el informe, el sintetizador se guarda igualmente y sigue siendo plenamente utilizable.
Nucleus Edge
Nucleus Edge es la versión on-premise de NUCLEUS. Es un pequeño componente que instalas en tu propio entorno, junto a tus datos. Lo ejecutas ahí para anonimizar datos o entrenar un sintetizador en local, y solo el sintetizador ya terminado se envía de vuelta a la plataforma: tus datos originales nunca salen de tu perímetro.
Edge es la opción adecuada cuando las normas de gobierno del dato exigen que los datos permanezcan dentro de tu infraestructura. Ofrece los mismos algoritmos, métodos y evaluación de calidad que Cloud. Consulta la guía de Nucleus Edge para saber cómo instalarlo y usarlo.