2026-09-17 · ← Noticias
La purga de internet se pospone. Los abogados de Microsoft y OpenAI admiten que el entrenamiento sin contenido extranjero es una ficción económica
Los gigantes tecnológicos han dejado de pretender que podrían entrenar IA de última generación basándose únicamente en datos de dominio público y archivos comprados. Los documentos presentados por OpenAI y Microsoft a la Cámara de los Lores del Reino Unido revelan una defensa pragmática de su enfoque actual respecto a los datos. Reconocen que extraer datos de toda la web es controvertido, pero insisten en que, sin ello, no es técnica ni económicamente viable.
Los representantes de 404 Media critican duramente esta postura calificándola de robo. Desde una perspectiva empresarial, sin embargo, supone un claro establecimiento de límites. OpenAI afirma sin rodeos que la ley de derechos de autor, tal como está redactada hoy, prohibiría esencialmente la existencia de modelos fundacionales si se aplicara estrictamente en internet. La doctrina legal del uso justo es, por lo tanto, una necesidad existencial para ellos, no solo una escapatoria conveniente.
El fin del mito de los datos limpios
Para los clientes corporativos y los inversores, esta declaración es una señal importante. Significa el fin definitivo del mito de que alguien construirá pronto un modelo igualmente capaz basado exclusivamente en datos 'limpios' y con licencia. Los acuerdos comerciales con editores (como los que tiene OpenAI con Axel Springer o AP) son solo una gota en el océano del volumen de entrenamiento requerido.
La admisión abierta de la dependencia del web scraping muestra que el riesgo de demandas por derechos de autor está incorporado de forma permanente en el modelo de negocio. Las empresas de IA apuestan a que la presión tecnológica y geopolítica obligará a los tribunales y reguladores a flexibilizar las normas a favor del desarrollo, en lugar de arriesgarse a frenar la innovación en un país determinado.
Quién pagará por la infraestructura web
El verdadero problema no es el entrenamiento en sí, sino el impacto en el ecosistema que produce los datos. Los creadores de contenido y los sitios web más pequeños están perdiendo tráfico porque los LLM responden directamente en el chat. Si el modelo económico de los creadores colapsa, los modelos perderán una fuente de nuevos datos para entrenar a futuras generaciones (lo que se conoce como colapso del modelo).
Mientras los grandes editores negociarán licencias individuales, la larga cola de internet permanece sin compensación. La situación actual es insostenible: las empresas de IA están extrayendo valor de la web pública como una infraestructura gratuita, pero al mismo tiempo están socavando activamente esta infraestructura con sus productos.
Una nueva definición de los derechos de autor
Este conflicto se encamina hacia una inevitable reescritura de las reglas. Ya sea mediante nueva legislación o decisiones judiciales que sienten precedente, la definición de los derechos de autor tendrá que adaptarse al hecho de que la lectura de un texto por parte de una máquina para comprender patrones ya no puede castigarse de la misma manera que la copia pirata.
Mecanismos para optar por no participar en la formación
Lo que decidirá esto es cómo aborden los reguladores los mecanismos de exclusión (opt-out). La prueba de un cambio no será otra demanda de escritores, sino el despliegue generalizado de tecnologías que permitan a los propietarios de sitios web negociar eficazmente un precio por incluir sus datos en el corpus de entrenamiento.
El veredicto de Lilith
Se acabaron los cuentos de hadas sobre alimentar a los modelos solo con contenido comprado y de comercio justo. OpenAI acaba de decir en voz alta en los tribunales lo que todos saben: nuestro negocio solo funciona porque tomamos todo Internet gratis, y si nos prohíben hacerlo, estamos acabados.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗