← Biblioteca · Foundations
Cadena de suministro de datos para IA
Los datos para IA no son un montón de archivos, sino una cadena de suministro: desde las fuentes y los derechos hasta la limpieza, la procedencia y la auditoría continua. La web abierta sigue siendo importante, pero los datos de calidad y utilizables son cada vez más limitados, disputados y costosos de gobernar.
Regla de oro: Un conjunto de datos no es un activo si el equipo no puede explicar de dónde procede, para qué puede usarlo, cómo cambió y qué modelos lo consumieron.
Qué es la cadena de suministro de datos para IA
Es todo el recorrido desde la adquisición hasta el entrenamiento, la evaluación, la conservación y el borrado. Incluye fuentes, contratos y consentimientos, ingesta, anotación, filtros, deduplicación, versiones, controles de acceso y el registro de qué modelo utilizó cada versión.
Esto importa más que el lema «más datos». Dos conjuntos de un terabyte pueden tener valores opuestos. Uno posee un origen trazable, una cobertura útil y derechos claros. El otro mezcla copias, información personal y contenido con condiciones dudosas. El modelo no resolverá esa diferencia por la organización.
La web abierta no está sencillamente «agotada». Sigue creciendo y proyectos como Common Crawl continúan creando grandes instantáneas. Lo difícil es conseguir material nuevo, diverso, de calidad y jurídicamente utilizable sin duplicados. Parte está tras cuentas o muros de pago, algunos operadores restringen el acceso automatizado y una proporción creciente puede haber sido generada por modelos.
Adquisición y procedencia
Cada fuente necesita una ficha: propietario o custodio, URL o sistema de origen, fecha y método de adquisición, términos contractuales, fines permitidos, restricciones posteriores, retención y responsable. Adjunta el contrato de un archivo comprado. Para la web, conserva la fecha de captura y los términos vigentes. Para datos internos, registra el sistema y proceso que los produjo.
La procedencia no es un solo enlace, sino una cadena de transformaciones. Un documento puede pasar por OCR, traducción, anonimización, clasificación de calidad y corrección humana. Cada paso puede cambiar su significado y situación jurídica. Datasheets for Datasets propone documentar motivación, composición, recogida, preprocesamiento, distribución, mantenimiento y limitaciones.
Licencia, consentimiento y base jurídica son cosas distintas
- Una licencia expresa lo que permite el titular de derechos. Creative Commons distingue condiciones como atribución, uso no comercial o compartir igual.
- El consentimiento es el permiso de una persona para un uso específico de sus datos. Cuando sustenta el tratamiento, debe cumplir los requisitos aplicables y puede retirarse.
- La base jurídica justifica el tratamiento de datos personales. El consentimiento es solo una opción; que algo sea público no concede permiso universal.
- Los términos de la plataforma regulan la relación con el servicio y pueden limitar el acceso automatizado a contenido visible.
- La aceptabilidad ética es otra prueba. Una recogida jurídicamente defendible puede vulnerar expectativas razonables o perjudicar a una comunidad vulnerable.
Evalúa los derechos según finalidad y jurisdicción, no con una casilla universal de «legal». Las disputas de editores y creadores sobre copyright demuestran que los datos forman parte del modelo de negocio. Los modelos abiertos necesitan transparencia, aunque las licencias pueden limitar la redistribución. Los sistemas cerrados no eliminan el problema; dificultan la auditoría independiente.
Limpieza, deduplicación y calidad
Limpiar no es cosmética. Un proceso de limpieza suele retirar codificaciones rotas, plantillas, spam, malware, secretos, datos personales, fragmentos mínimos y contenido ajeno al dominio. También puede borrar silenciosamente idiomas minoritarios, dialectos y casos difíciles. Mide lo aceptado y rechazado por idioma, fuente y grupo relevante.
Deduplica contenido idéntico y casi idéntico entre entrenamiento, validación y prueba. De lo contrario, el modelo memoriza repeticiones y el benchmark mide filtración, no generalización. Deduplicating Training Data Makes Language Models Better relaciona los duplicados con memorización y evaluación distorsionada. Conserva hashes, reglas de similitud, umbrales, mapa de eliminaciones y versión del filtro.
Los datos sintéticos son una herramienta, no una máquina perpetua
Ayudan con casos raros, variaciones controladas, simulación, self-play y evaluaciones de seguridad. Pueden reducir el manejo de registros reales sensibles. Pero no son automáticamente anónimos ni correctos. Un generador puede reproducir datos personales, errores, estereotipos y artefactos de su entrenamiento.
«Model collapse» no significa que todo ejemplo sintético perjudique. El estudio AI models collapse when trained on recursively generated data muestra el riesgo cuando las salidas generadas sustituyen repetidamente la distribución original. Conviene conservar datos reales de calidad, registrar generador y prompt, revisar de forma independiente, filtrar, etiquetar el origen sintético y evaluar sobre datos humanos no vistos por el generador.
Datos multimodales y mundo físico
El texto es solo una rama. Imagen, voz, vídeo, robótica y sistemas autónomos requieren cámaras, micrófonos, sensores, telemetría, mapas, escenas 3D y trazas de acciones. Se añaden calibración, sincronización temporal, anotación espacial y seguridad física.
Un vídeo de fábrica puede contener a la vez rostros, secretos comerciales y un incidente peligroso. Una demostración robótica está ligada a una máquina y entorno concretos. Registra dispositivo, lugar, hora, calibración, anotador, permisos, condiciones y puntos ciegos. C2PA ofrece un modelo útil de procedencia técnica de medios, pero no prueba la veracidad ni concede derechos de entrenamiento.
Privacidad, seguridad, lineage y auditoría
Minimiza antes de almacenar, no solo antes de publicar el modelo. Separa identificadores, cifra tránsito y reposo, usa acceso por roles y temporal, registra exportaciones y aplica el borrado. Los principios del RGPD incluyen limitación de finalidad, minimización, exactitud, retención, integridad y responsabilidad.
Un dataset también es superficie de ataque. Alguien puede introducir poisoning, prompt injection dentro de documentos, archivos maliciosos o secretos destinados a una extracción posterior. Mantén los datos raw inmutables y aislados, ejecuta transformaciones en sandbox, escanea archivos, aprueba fuentes y vigila cambios anómalos en la distribución.
El lineage debe conectar fuente → versión raw → transformación → release del dataset → entrenamiento → modelo. Cada nodo necesita ID estable, fecha, propietario, hash, configuración y versiones de entrada. Si alguien retira el consentimiento o un proveedor comunica un error, el equipo puede localizar modelos afectados y decidir sobre reentrenamiento, unlearning o retirada.
Dependencia de proveedores e infraestructura full-stack
Un proveedor vende más que archivos: acceso continuo, anotadores, taxonomía, QA y a veces evaluaciones. Hay lock-in cuando no puedes inspeccionar fuentes, exportar etiquetas, poseer el esquema o reproducir filtros. El contrato debe cubrir auditoría, subcontratistas, borrado, incidentes, cambios de licencia, exportación, salida y responsabilidad por etiquetas defectuosas.
Esto conecta los datos con la infraestructura completa de IA. Modelo, cómputo, almacenamiento, catálogo, anotación, evaluaciones y gobernanza no son compras independientes. Un modelo open-weight sin datos auditables no es un sistema totalmente abierto. Una API cerrada con buenos controles contractuales puede ser más segura en operación, pero concentra la confianza en el proveedor. Evalúa open frente a closed capa por capa.
Plan práctico
- Define finalidad y usos prohibidos. ¿Qué debe hacer el modelo y qué no debe inferir?
- Crea un registro de fuentes. Propietario, origen, licencia, base jurídica, consentimiento, jurisdicción, retención y contacto.
- Separa raw, curated y release. Raw permanece inmutable; cada transformación se versiona.
- Añade una puerta de entrada. Malware, secretos, PII, formato, calidad, idioma, antigüedad y uso permitido.
- Deduplica entre splits. Comprueba contaminación de benchmarks y conserva el mapa de coincidencias.
- Mide representación. Idiomas, modalidades, fuentes, periodos y grupos expuestos al riesgo.
- Etiqueta lo sintético. Generador, versión, prompt, seed, filtros, revisión y proporción.
- Exige datasheet y lineage. Sin documentación no hay acceso al entrenamiento.
- Restringe el acceso y ensaya incidentes. ¿Puedes exportar, borrar y rastrear un dataset?
- Evalúa antes de cada release. Calidad, sesgo, fuga de privacidad, seguridad y cambios de licencia.
Fallos comunes
- «Público significa libre»: visibilidad no equivale a licencia, consentimiento ni base jurídica.
- Un lago enorme sin lineage: tras un problema nadie identifica los modelos afectados.
- Deduplificar dentro de un archivo: sobreviven copias entre fuentes y benchmarks.
- Datos sintéticos sin etiqueta: luego no se puede medir ni retirar un generador defectuoso.
- Filtros de calidad solo para inglés: otros idiomas desaparecen en silencio.
- Proveedor como caja negra: entrada barata, auditoría cara y salida dolorosa.
- Revisión de privacidad tras entrenar: los datos ya están en checkpoints y copias.
- Documentación sin enforcement: existe el datasheet, pero un job acepta cualquier ruta.
Fuentes y lecturas
- Datasheets for Datasets - propuesta base para documentar motivación, composición, recogida, preprocesamiento, distribución y mantenimiento.
- Data Provenance Initiative - proyecto de investigación sobre procedencia, licencias y atribución de datasets de IA muy usados.
- Deduplicating Training Data Makes Language Models Better - investigación sobre deduplicación, memorización y evaluación más fiable.
- AI models collapse when trained on recursively generated data - evidencia sobre el riesgo de desplazar la distribución original con generaciones de datos de modelo.
- Licencias Creative Commons - guía primaria de condiciones CC; corrige la idea de que CC significa «sin límites».
- Principios de protección de datos del RGPD - resumen primario europeo de minimización, finalidad, retención y responsabilidad.
- NIST AI Risk Management Framework - marco para mapear, medir y gestionar riesgos de IA, incluidos los relacionados con datos.
- Especificación C2PA - estándar técnico de procedencia de medios, útil pero más estrecho que el lineage de datasets.
Qué recordar
La ventaja no reside en la mayor montaña de datos. Consiste en poder construir y defender una mezcla, reproducir sus transformaciones, retirar una fuente problemática y medir el impacto. Una buena cadena une derechos, calidad, seguridad y evaluaciones en un flujo auditable. Si a «¿de dónde sabe esto el modelo?» el equipo solo responde «de nuestro dataset», no tiene una cadena de suministro. Tiene una caja.