Tarjeta de Modelos de IA (Models Card)
Esta tarjeta abarca los tres paquetes de Dedomena.AI EDGE Engine que distribuyen modelos de IA preentrenados: dedomena-edge-text, dedomena-edge-vision y dedomena-edge-audio. Describe el funcionamiento de estos modelos, sus limitaciones en producción y sus posibles fallos.
1. Alcance
Dedomena.AI EDGE incluye dos tipos de IA muy diferentes, y solo uno de ellos es un modelo distribuido.
| Componente | Estado de esta tarjeta |
|---|---|
| dedomena-edge (paquete principal): algoritmos y métodos propietarios de datos sintéticos y anonimización, junto con submódulos de datos y privacidad para diferentes tareas. | FUERA DE ALCANCE. El paquete principal distribuye algoritmos y código, no pesos de modelos. No se incluye nada preentrenado ni se distribuye en estado entrenado: un modelo solo existe después de que el cliente lo entrene con sus propios datos, dentro de su propio proyecto. Por lo tanto, no hay un modelo distribuido que caracterizar. La sección 9 cubre los sintetizadores entrenados por el cliente para mayor exhaustividad, ya que los clientes lo solicitan. |
| dedomena-edge-text, dedomena-edge-vision, dedomena-edge-audio (paquetes del motor) | DENTRO DE ALCANCE. Estos distribuyen modelos preentrenados con pesos fijos que realizan inferencias de forma inmediata, sin necesidad de entrenamiento por parte del cliente. Son el tema de esta tarjeta.
2. Detalles del modelo
| Campo | Valor |
|---|---|
| Proveedor | Dedomena.AI |
| Producto | Dedomena.AI EDGE — Paquetes del motor |
| Finalidad | Detección y eliminación/sustitución con datos sintéticos de datos personales y sensibles en contenido no estructurado: documentos y texto libre, imágenes y vídeo, voz y audio |
| Origen del modelo | Modelos base de código abierto de terceros, obtenidos de sus editores y ajustados mediante el código, los umbrales y la lógica de verificación de la canalización de Dedomena.AI. No se utilizaron datos de clientes para su entrenamiento. |
| Licencia | Los modelos incorporados se distribuyen bajo licencias de código abierto permisivas (Apache 2.0 y términos de clase MIT). Los textos completos de la licencia, los avisos de derechos de autor y las atribuciones originales se reproducen en el archivo THIRD-PARTY-NOTICES incluido en cada paquete del motor. |
| Distribución | Paquetes Python firmados, instalados por el cliente en su propio proyecto de Google Cloud. Dedomena.AI no ofrece ningún punto final de inferencia alojado. |
| Servicios de IA de terceros | Ninguno. No se envía contenido a ninguna API de modelo externa o alojada en ningún momento. |
| Versión | Ver Sección 15 |
| Contacto | support@dedomena.ai (soporte técnico) · security@dedomena.ai (seguridad y privacidad) |
3. Perfil de ejecución
Todos los modelos se ejecutan dentro del proyecto de Google Cloud del cliente, en su servidor GPU. El contenido analizado nunca sale de dicho proyecto.
La inferencia es determinista por configuración: la temperatura de muestreo se establece en cero para todos los pasos de detección y verificación, por lo que la misma entrada produce los mismos resultados.
Los pesos del modelo se entregan con el paquete Engine. No se descargan pesos de terceros en tiempo de ejecución ni se utiliza la API del modelo.
La tarea de reconocimiento de voz se ejecuta cuantificada en la CPU; las etapas de visión y lenguaje requieren la GPU.
No se abre ningún acceso público al proyecto del cliente. El único tráfico saliente es la validación de licencias y los contadores de uso.
4. dedomena-edge-text
4.1 Qué hace
Localiza datos personales y entidades nombradas en documentos y texto libre para que puedan ser censurados, enmascarados o sustituidos por datos sintéticos. Es una herramienta de detección y reescritura, no un asistente de propósito general. Permite generar información en lenguaje natural.
4.2 Modelos utilizados
| Componente | Descripción |
|---|---|
| Modelo de lenguaje | Un modelo de lenguaje multilingüe de peso abierto y ajustado con precisión, perteneciente a la clase de parámetros pequeños (de miles de millones de un solo dígito), con una ventana de contexto amplia y soporte nativo para salida estructurada de estilo funcional. Preentrenado por su editor con datos web multilingües a gran escala, de texto, código y multimodales, con un límite de conocimiento de 2025, que abarca muchos idiomas, con filtrado CSAM y de datos sensibles aplicado al corpus de preentrenamiento por el editor. |
| Capa Dedomena.AI | Ajuste fino, indicaciones, taxonomía de entidades, conciliación de intervalos, umbrales de confianza y lógica de sustitución. |
4.3 Limitaciones
-
La detección es probabilística. Pueden producirse falsos negativos (datos personales no incluidos) y falsos positivos (sobreedición); siempre se recomienda la revisión humana del análisis de riesgos.
-
El rendimiento varía según el idioma, el dominio y el formato del documento. Los documentos escaneados, manuscritos o mal estructurados son considerablemente más difíciles de procesar que el texto digital limpio.
-
Los matices sutiles, el sarcasmo y el lenguaje figurado se interpretan de forma poco fiable, lo cual es importante cuando la información de identificación se infiere en lugar de declararse explícitamente.
-
Los sesgos y las lagunas en los datos de entrenamiento subyacentes se propagan a la cobertura de detección: los tipos de entidades y las formas de nombres que están subrepresentados en el proceso se detectan con menor fiabilidad.
-
El modelo subyacente puede generar texto incorrecto. Los valores sustituidos son plausibles, pero no verificados; nunca deben interpretarse como hechos.