SekitCrosswalk
ISO/IEC 42001:2023 — Annex A · destino de mapeo derivado

A.7.6Data preparation

Control cleaning, labeling, transformation, augmentation and splitting so data preparation is reproducible and reviewed.

El mapeo de un vistazo
A.7.6Data preparationISO/IEC 42001:2023 — Annex A

A.7.6 queda cubierto por 1 control del Sekit CSF. Abrir en el grafo completo

Mapeado desde el Sekit CSF

Los controles de Sekit que cubren este requisito, lente a lente.

Correspondencias en ISO/IEC 27001:2022

Alcanzadas a través de los controles del Sekit CSF que ambos mapean: un mapeo, no una equivalencia formal.

Correspondencias en NIST CSF 2.0

Evidencia que demuestra este control

Lo que pide un auditor, o el motor de evidencias de Sekit.

Registro de datos de IA: procedencia, uso permitido y calidad
Para cada conjunto de datos que usa un sistema de IA, el registro de dónde vino, qué autoriza la empresa a hacer con él (licencia, consentimiento, restricciones), si contiene datos personales, y las comprobaciones de calidad y preparación hechas antes de usarlo (limpieza, etiquetado, división de datos).
Del catálogo de evidencias de Sekit

En la práctica

Este control aplica solo si tu empresa entrena o ajusta su propio modelo, no si usas una herramienta de IA de proveedor tal cual. La preparación cubre todo lo hecho a los datos crudos antes de entrenar o ajustar un modelo: limpieza, etiquetado, aumento, división en conjuntos de entrenamiento y prueba. Cada paso debería ser reproducible y revisado, no un script ejecutado una vez y borrado. Un auditor pregunta cómo se limpió y etiquetó un conjunto de datos, y si la división quedó documentada. El registro de conjuntos de datos de IA debería mostrar estos pasos por conjunto. Una brecha común es un etiquetado de contratista sin registro de instrucciones, sin forma de verificar sesgos.

Brechas habituales

Para una empresa que entrena su propio modelo, los scripts de limpieza y etiquetado se ejecutan una vez durante el proyecto y nunca se guardan, así que la preparación no se puede reproducir después.
En un proyecto de ajuste fino, un contratista etiqueta los datos de entrenamiento sin instrucciones documentadas, sin forma de verificar el sesgo introducido en ese paso.
Cuando una empresa entrena su propio modelo, la división entre entrenamiento y prueba nunca queda registrada, así que los resultados no se pueden reproducir ni son confiables después.

Preguntas que hará tu auditor

Si entrenas o ajustas un modelo internamente, ¿cómo se limpiaron y etiquetaron esos datos?
El registro del conjunto de datos documenta los pasos de preparación por conjunto, limpieza, etiquetado y la división entre entrenamiento y prueba, para cualquiera que construya o ajuste su propio modelo.
Si un contratista etiqueta datos para tu modelo, ¿sus instrucciones quedaron documentadas?
Las instrucciones de etiquetado se registran junto al conjunto de datos para cualquier construcción interna, hecha por personal o contratista, para poder verificar sesgo o error en ese paso.
¿Tu inventario de datos se revisa con una periodicidad definida, o solo cuando alguien se acuerda?
El ciclo de revisión del inventario de datos sigue un calendario fijo, marcando conjuntos de datos sin propósito, incluidos los conjuntos de entrenamiento de IA ya preparados.
Si entrenas tu propio modelo, ¿puedes reproducir la división de entrenamiento y prueba usada?
La división queda documentada por conjunto de datos para cualquier construcción interna, así que los resultados de validación se pueden verificar contra la misma división en vez de una nueva al azar.

Dónde lo exige la regulación

Los registros de tratamiento del RGPD (30.1) se extienden a los datos preparados, no solo a los crudos: limpiar y etiquetar datos personales sigue siendo tratamiento que hay que registrar.

Controles relacionados

Vía el tema compartido del Sekit CSF, no el índice del propio marco.

Pregúntale a Sekura: «¿Qué evidencia demuestra A.7.6?»
También vía MCP, gratis con cuenta