Entrenar una IA con obras protegidas: el nuevo problema jurídico de la transparencia
Entrenar una IA con obras protegidas: el nuevo problema jurídico de la transparencia
Santiago Carretero Sánchez, Profesor Titular de Filosofía del Derecho, Universidad Rey Juan Carlos, Abogado del Ilustre Colegio de Abogados de Madrid
La discusión sobre inteligencia artificial y propiedad intelectual ha entrado en una fase distinta. Durante los últimos años hemos formulado la pregunta fundamental en términos relativamente sencillos: ¿puede una empresa utilizar obras protegidas por derechos de autor para entrenar un modelo de inteligencia artificial? La cuestión sigue abierta en numerosos ordenamientos y está dando lugar a litigios de enorme relevancia, pero en Europa comienza a adquirir una dimensión más concreta. El problema jurídico ya no consiste únicamente en determinar si el entrenamiento de un modelo puede quedar amparado por una excepción legal o por determinadas reglas de minería de textos y datos. Empieza a ser igualmente importante saber qué materiales se han utilizado, de dónde proceden, qué derechos se han respetado y qué información debe facilitar el proveedor del modelo para que los titulares puedan comprobarlo. El Derecho está pasando, por tanto, de discutir solamente la licitud abstracta del entrenamiento a exigir condiciones de transparencia y trazabilidad sobre aquello que alimenta a la inteligencia artificial. Lamentamos volver a un tema de forma recurrente, pero la encrucijada para todas las ciencias y no solo las jurídicas es tremenda.
Esta evolución tiene una importancia especial en el Derecho de la Unión Europea. El Reglamento de Inteligencia Artificial establece para los proveedores de modelos de IA de propósito general dos obligaciones directamente relacionadas con los derechos de autor: disponer de una política destinada a cumplir el Derecho de la Unión en materia de copyright y derechos afines, incluyendo el respeto de las reservas de derechos formuladas conforme a la Directiva sobre derechos de autor en el mercado único digital, y publicar un resumen suficientemente detallado del contenido utilizado para entrenar el modelo. No se trata de una exigencia puramente documental. La transparencia sobre los datos de entrenamiento permite que los titulares de derechos puedan conocer, al menos en un nivel suficiente, qué clases de contenidos han sido utilizados y puedan ejercer los derechos que les reconoce el ordenamiento. La Comisión Europea ha desarrollado incluso un modelo específico para estos resúmenes, precisamente con la finalidad de establecer una base común de información.
Aquí aparece una cuestión jurídica que considero especialmente interesante: la transparencia deja de ser un elemento externo al derecho de autor y comienza a convertirse en una condición práctica para hacerlo efectivo frente a sistemas de inteligencia artificial. Un autor difícilmente puede oponerse al uso de su obra si desconoce que ha sido utilizada; tampoco puede valorar adecuadamente si se ha respetado una reserva de derechos cuando no existe información suficiente sobre el funcionamiento jurídico del entrenamiento. Por eso, el debate sobre copyright e IA no puede quedar reducido a una oposición entre innovación tecnológica y protección de los creadores. Hay una cuestión previa de estructura jurídica: si el titular carece de información sobre el uso de su obra, sus derechos pueden existir formalmente y, sin embargo, resultar extraordinariamente difíciles de ejercer en la práctica. La transparencia cumple entonces una función instrumental: hace posible que el derecho pueda ser conocido, comprobado y eventualmente reclamado.
La actualidad de esta cuestión se aprecia también fuera del ámbito estrictamente legislativo. Hoy, 25 de septiembre, LIBER dedica una sesión específica a los problemas de copyright que afectan a las bibliotecas de investigación cuando incorporan herramientas de IA y negocian con proveedores de plataformas académicas. El interés de esta iniciativa está precisamente en que desplaza el debate desde la teoría hacia los contratos, las licencias y las condiciones reales de utilización de contenidos protegidos. En otras palabras, el problema comienza a llegar al lugar donde habitualmente se concreta el Derecho: los contratos que autorizan usos, las cláusulas que los delimitan y la información que las instituciones necesitan antes de aceptar determinadas condiciones.
Esto permite entender mejor hacia dónde parece dirigirse el modelo europeo. No basta con afirmar que una determinada tecnología necesita grandes cantidades de datos para funcionar. Desde la perspectiva jurídica, la dimensión del entrenamiento no elimina los derechos preexistentes sobre los contenidos utilizados. Tampoco parece suficiente trasladar toda la discusión al momento posterior, cuando el modelo ya está construido y produce un resultado que eventualmente reproduce una obra, un fragmento o determinados elementos protegidos. Existe un momento jurídico anterior que es decisivo: la incorporación de contenidos al proceso de entrenamiento. La procedencia de esos contenidos, las condiciones de acceso, las reservas de derechos, las licencias existentes y la documentación del proceso adquieren así una importancia que hasta ahora no siempre había ocupado el centro del análisis.
La jurisprudencia y los litigios internacionales muestran, además, que estamos ante una cuestión todavía en construcción. En Alemania, el litigio entre GEMA y Suno AI ha situado ante los tribunales la utilización de obras musicales para el entrenamiento de sistemas generativos, mientras que en Estados Unidos el litigio entre The New York Times y OpenAI continúa planteando cuestiones fundamentales sobre la utilización de contenidos protegidos y la defensa basada en el denominado fair use. Son ordenamientos distintos y no cabe trasladar automáticamente sus soluciones al Derecho europeo, pero los conflictos permiten observar algo que jurídicamente resulta más importante que sus posiciones procesales concretas: el entrenamiento de modelos generativos está obligando a precisar conceptos tradicionales del derecho de autor que fueron diseñados para una economía de explotación de obras muy diferente.
La cuestión de fondo, por tanto, no debería formularse solamente como una elección entre permitir o prohibir el entrenamiento de inteligencia artificial con contenidos protegidos. La pregunta jurídicamente más fértil es otra: ¿qué condiciones debe cumplir ese entrenamiento para que pueda desarrollarse respetando los derechos de los autores y demás titulares? La respuesta europea empieza a construirse alrededor de varias ideas conectadas: cumplimiento del Derecho de autor, respeto de las reservas de derechos, transparencia sobre los contenidos utilizados y mecanismos que permitan a los titulares ejercer efectivamente sus derechos. Esto tiene consecuencias muy concretas para los proveedores de IA, pero también para universidades, bibliotecas, empresas y profesionales que contratan o integran sistemas de inteligencia artificial.
Estamos, en definitiva, ante una transformación silenciosa del problema. La primera etapa del debate preguntaba quién es el autor de aquello que produce una IA. La segunda comenzó a preguntarse si las obras humanas podían utilizarse para entrenarla. La cuestión que ahora adquiere mayor importancia es cómo demostrar que ese proceso ha respetado el ordenamiento jurídico. Y aquí aparece una idea que puede resultar decisiva para el futuro del Derecho de autor: en la inteligencia artificial, la trazabilidad del dato puede terminar siendo tan importante como la titularidad de la obra. No porque la tecnología haya modificado el concepto jurídico de propiedad intelectual, sino porque ha modificado radicalmente la escala, la opacidad y la complejidad de los usos que pueden hacerse de una obra. El reto del jurista será conseguir que esa complejidad tecnológica no termine convirtiéndose en una dificultad para el ejercicio efectivo de los derechos.
Notas
Unión Europea. (2024). Reglamento (UE) 2024/1689 del Parlamento Europeo y del Consejo, de 13 de junio de 2024, por el que se establecen normas armonizadas en materia de inteligencia artificial. EUR-Lex.
Comisión Europea. (2026). Stakeholder consultation on AI and copyright compliance. Shaping Europe’s digital future.
Parlamento Europeo. (2026). Resolución sobre inteligencia artificial generativa y derechos de autor: formación, creación y regulación (A10-0019/2026). EUR-Lex.

Comentarios
Publicar un comentario