Política de datos para IA¶
Versión: 1.0 Fecha de aprobación: [FECHA] Propietario: Comité de IA Próxima revisión: [FECHA + 12 meses]
1. Objeto y alcance¶
Esta política establece las normas de clasificación, uso, protección y retención de los datos que se introducen en herramientas y sistemas de IA. Complementa la política general de protección de datos de la organización con los requisitos específicos que introduce el uso de IA: saber qué información se ha utilizado, proteger los datos personales y decidir dónde puede procesarse cada tipo de información.
La política aplica a cualquier dato que una persona o un sistema de la organización introduzca en una herramienta de IA, ya sea para obtener una respuesta puntual, para automatizar una tarea o para que la herramienta tome o apoye una decisión.
2. Clasificación de datos en el contexto de IA¶
Toda la información que se vaya a usar con herramientas de IA debe situarse en una de estas categorías antes de su uso. La categoría determina dónde puede procesarse, con qué herramientas y con qué controles.
| Nivel | Tipo de dato | Ejemplos | Dónde puede procesarse |
|---|---|---|---|
| Nivel 1 — Público | Datos sin restricciones, accesibles a cualquier persona | Datos públicos de la web, documentos públicos, datos abiertos de administraciones | Cualquier herramienta, incluidos servicios externos en la nube |
| Nivel 2 — Interno | Datos de uso interno de la organización, sin datos personales | Documentación interna, procesos, datos agregados no personales | Herramientas corporativas y servicios en la nube con contrato de tratamiento de datos (DPA) |
| Nivel 3 — Confidencial | Datos con restricciones de acceso, incluyendo secretos comerciales o información estratégica | Datos financieros detallados, contratos con clientes, código propietario, estrategia comercial | Solo herramientas internas o proveedores con acuerdo de confidencialidad (NDA) y contrato de tratamiento de datos (DPA) |
| Nivel 4 — Regulado | Datos personales (RGPD), datos sensibles (Art. 9 RGPD), datos de salud, datos biométricos | Nombres, DNI, correo, teléfono, datos de salud, origen racial, creencias religiosas | Solo herramientas internas o proveedores con DPA específico; evaluación DPIA obligatoria |
Ante cualquier duda sobre en qué nivel se sitúa un dato concreto, se aplica el nivel más restrictivo hasta confirmar lo contrario. Esta tabla es la misma referencia que se utiliza en Privacidad y seguridad básica.
3. Saber qué información se ha utilizado¶
Cuando una herramienta de IA genera un resultado, responde a una pregunta o apoya una decisión, la organización debe poder explicar, si se le pregunta, qué información se utilizó para llegar a ese resultado. Esto es especialmente importante cuando:
- El resultado afecta a una decisión sobre una persona (un cliente, un candidato, un empleado).
- El sistema está clasificado como de alto riesgo según el Reglamento de IA de la UE, que exige poder documentar esta información (Art. 11).
- Se detecta un error o un resultado incorrecto y hay que averiguar de dónde viene el problema.
Qué se debe registrar, como mínimo, para sistemas que procesan datos de Nivel 3 o 4, o que estén clasificados como de alto riesgo:
- Qué información se ha introducido en la herramienta y de qué sistema o fuente procede.
- Quién es el responsable de que esa información sea correcta y esté actualizada.
- Si la información se ha modificado o filtrado antes de introducirla (por ejemplo, eliminando datos personales).
No se trata de un registro técnico complejo: en la mayoría de los casos basta con una breve documentación por proceso, mantenida por el responsable del área, que explique de dónde vienen los datos que alimentan ese proceso y quién responde por ellos.
4. Proteger los datos personales¶
Cuando un proceso requiere usar información que identifica a personas (clientes, empleados, candidatos), existen dos formas de reducir el riesgo antes de introducir esa información en una herramienta de IA:
Sustituir los datos identificativos por un código. Por ejemplo, sustituir el nombre de un cliente por un número de referencia. Esta técnica se llama "pseudonimización". Sigue siendo un dato personal a efectos del RGPD, porque alguien con acceso a la tabla de correspondencia podría volver a identificar a la persona, pero reduce el riesgo si la información sale de los sistemas de la organización.
Eliminar por completo la posibilidad de identificar a la persona. Esto se llama "anonimización". Si se hace correctamente y de forma irreversible, el dato deja de considerarse un dato personal.
| Técnica | En qué consiste | Cuándo usarla |
|---|---|---|
| Eliminar campos identificativos | Quitar nombre, DNI, correo, teléfono u otros identificadores directos antes de usar la información | Cuando esos campos no son necesarios para la tarea |
| Sustituir por rangos | Sustituir un valor exacto por un rango (por ejemplo, edad exacta por "30-40 años") | Cuando se necesita una visión general pero no el dato exacto |
| Sustituir por un código (pseudonimización) | Reemplazar el identificador por una referencia interna | Cuando se necesita poder relacionar registros de una misma persona sin exponer su identidad |
Regla práctica: si una tarea se puede hacer sin incluir nombres, correos o identificadores personales, se hace sin ellos. Solo se incluyen datos personales cuando son imprescindibles para el resultado, y en ese caso se usa una herramienta aprobada para tratar Nivel 4 (ver tabla de clasificación).
5. Dónde puede procesarse cada tipo de dato¶
La tabla de clasificación de la sección 2 indica qué tipo de herramienta puede usarse según el nivel del dato. Para datos de Nivel 3 (Confidencial) y Nivel 4 (Regulado), puede no ser suficiente con contratar la versión "empresarial" de un servicio en la nube: en algunos casos puede ser necesario procesar la información en sistemas propios de la organización, sin que salga hacia un proveedor externo.
Esta decisión —si es necesario o no procesar ciertos datos en sistemas propios— no es algo que deba resolver cada persona o equipo por su cuenta. Es una decisión técnica que debe tomar el equipo de IT o el Partner de Integración, evaluando caso por caso según:
- El nivel de clasificación del dato.
- Las garantías contractuales que ofrezca el proveedor (ver Selección de proveedores).
- El volumen y la frecuencia de uso.
Lo que cada equipo debe hacer es identificar correctamente el nivel de los datos que maneja (sección 2) y trasladar esa información al evaluar una nueva herramienta, para que quien tome la decisión técnica disponga de los datos necesarios.
6. Retención y eliminación de datos¶
La información usada con herramientas de IA está sujeta a los mismos plazos de retención que el resto de información de la organización, según su naturaleza. Además:
- Información personal usada para personalizar una herramienta o un proceso: debe eliminarse cuando deje de existir un motivo legítimo para conservarla (por ejemplo, si la persona deja de ser cliente o empleado, o si retira su consentimiento).
- Configuraciones o asistentes "entrenados" con información de la organización: si se dejan de usar, se eliminan del inventario de herramientas activas y se revoca el acceso a la información que tenían asociada.
- Historiales de conversaciones o registros de uso: se conservan según los plazos que establezca el Reglamento de IA de la UE para sistemas de alto riesgo y el RGPD según la base legal del tratamiento.
7. Calidad del dato¶
La calidad de la información que se introduce en una herramienta de IA determina la calidad de los resultados. Una herramienta que recibe información incompleta, incorrecta o desactualizada producirá resultados poco fiables, por buena que sea la herramienta.
Antes de usar un conjunto de datos de forma habitual con una herramienta de IA, conviene revisar:
| Aspecto | Qué significa | Cómo revisarlo |
|---|---|---|
| Completitud | Que no falten datos importantes | Comprobar cuántos campos relevantes están vacíos |
| Exactitud | Que los datos reflejen la realidad | Comparar una muestra con la fuente original |
| Consistencia | Que el mismo dato se represente igual en todos los sistemas | Comparar cómo aparece el mismo dato en distintos sistemas |
| Actualidad | Que los datos estén suficientemente actualizados | Comprobar la fecha de la última actualización |
| Unicidad | Que no haya registros duplicados | Revisar si existen registros repetidos o muy similares |
El responsable del proceso es quien debe asegurarse de que esta revisión se hace antes de poner en marcha un piloto que dependa de esos datos.