Lo que pide un auditor, o el motor de evidencias de Sekit.
Registro de datos de IA: procedencia, uso permitido y calidad
Para cada conjunto de datos que usa un sistema de IA, el registro de dónde vino, qué autoriza la empresa a hacer con él (licencia, consentimiento, restricciones), si contiene datos personales, y las comprobaciones de calidad y preparación hechas antes de usarlo (limpieza, etiquetado, división de datos).
Del catálogo de evidencias de Sekit
En la práctica
La procedencia significa rastrear los datos por cada mano que los toca, no solo dónde comenzó un conjunto de entrenamiento: qué archivos empresariales llegaron a qué herramienta de proveedor, cuándo, por quién, y si ese uso sigue coincidiendo con el consentimiento original o el contrato del cliente. Una empresa que compra una lista de clientes, la combina con soporte y alimenta un modelo acumula traspasos que rastrear. Un auditor sigue un conjunto de datos de origen a destino, un modelo entrenado o una herramienta de proveedor, verificando que el registro de conjuntos de datos de IA muestre la cadena, no solo el estado final. La brecha típica: datos copiados, combinados o subidos, con el registro cubriendo solo la fuente original.
Brechas habituales
Los archivos de la empresa se suben a la base de conocimiento de una herramienta de proveedor, pero nadie registra cuándo, por quién, ni si eso sigue coincidiendo con el consentimiento original del cliente.
Si entrenas tu propio modelo, nadie rastrea qué versión de conjunto de datos entrenó qué versión de modelo, por lo que un problema de calidad no se puede rastrear hasta su origen.
La procedencia de los datos se detiene en cuanto un conjunto se exporta de su sistema de origen, perdiendo el rastro por cualquier limpieza o transformación posterior.
Preguntas que hará tu auditor
¿Puedes rastrear este conjunto de datos hasta su fuente original?
El registro de conjuntos de datos de IA documenta la procedencia de cada conjunto, incluida la fuente, las transformaciones y dónde terminó, sea tu propio modelo o la base de conocimiento de un proveedor.
¿Qué pasa con el registro cuando un conjunto de datos se transforma o combina?
Cada transformación queda registrada en el registro del conjunto de datos, de modo que la cadena desde el origen hasta donde terminó, la base de conocimiento de un proveedor o tu propio modelo entrenado, se mantiene intacta, no solo el punto de partida.
¿El uso actual de estos datos sigue dentro de su autorización original?
El rastreo de procedencia vincula el uso de los datos con lo permitido originalmente, marcando cualquier uso que se haya alejado de la licencia original o de la base de consentimiento.
¿Qué tan actualizado está tu inventario de datos que alimentan sistemas de IA?
El inventario de datos se actualiza cada vez que cambian los flujos, extendido aquí para cubrir versiones de conjuntos de datos y transformaciones usadas específicamente para IA.
Dónde lo exige la regulación
NIS2 art. 12.4 (Inventario de activos) debe rastrear los activos tal como existen hoy, de manera que un conjunto de datos combinado o transformado sigue necesitando seguimiento, no solo su fuente original.
Controles relacionados
Vía el tema compartido del Sekit CSF, no el índice del propio marco.