IA generativa y datos personales: el nuevo conflicto europeo entre entrenamiento algorítmico, interés legítimo y anonimización
Santiago Carretero Sánchez, Profesor Titular de Filosofía del Derecho, Universidad Rey Juan Carlos
La inteligencia artificial generativa ha situado al Derecho de protección de datos ante una cuestión que hasta hace pocos años parecía esencialmente técnica: ¿hasta dónde puede utilizarse la información personal de los ciudadanos para entrenar y hacer funcionar modelos de inteligencia artificial? La cuestión adquiere especial relevancia en Europa en septiembre de 2026 porque la negociación del denominado Digital Omnibus vuelve a colocar en el centro del debate la relación entre el Reglamento General de Protección de Datos (RGPD) y el desarrollo de sistemas y modelos de IA. La propuesta europea pretende simplificar determinadas reglas digitales y proporcionar mayor seguridad jurídica a las organizaciones, pero algunas de sus modificaciones afectan directamente a la forma en que debe entenderse el tratamiento de datos personales en el contexto de la inteligencia artificial. No estamos todavía ante una nueva regla definitivamente aprobada: se trata de una propuesta sometida al proceso legislativo europeo y objeto de negociación. Precisamente por ello, el interés jurídico de la cuestión reside tanto en el contenido de las modificaciones planteadas como en el modelo de protección de derechos que finalmente resulte de la negociación.
El punto de partida debe encontrarse en el RGPD vigente. El artículo 4.1 define los datos personales de una manera extraordinariamente amplia, incluyendo cualquier información sobre una persona física identificada o identificable, mientras que el artículo 4.2 considera tratamiento prácticamente cualquier operación realizada sobre esos datos, incluida su recogida, consulta, utilización, extracción, interconexión o conservación. Esto significa que el entrenamiento de un modelo de IA no puede analizarse jurídicamente como una operación puramente tecnológica: cuando los conjuntos de datos utilizados contienen información relativa a personas identificadas o identificables, estamos ante operaciones sometidas al RGPD. A ello se añade el artículo 5, que establece principios esenciales como la licitud, lealtad y transparencia, la limitación de la finalidad, la minimización de datos, la exactitud y la responsabilidad proactiva. La inteligencia artificial no constituye, por sí misma, una excepción general a estos principios.
Aquí aparece uno de los conceptos que más importancia tendrá para los juristas digitales: el interés legítimo. El artículo 6.1.f del RGPD permite el tratamiento cuando sea necesario para satisfacer intereses legítimos perseguidos por el responsable o por un tercero, siempre que no prevalezcan los intereses o los derechos y libertades fundamentales del interesado que requieran protección de datos personales. Por tanto, interés legítimo no significa autorización automática. Existe una estructura jurídica de tres elementos: debe existir un interés legítimo real y jurídicamente admisible; el tratamiento debe ser necesario para alcanzarlo; y finalmente debe realizarse una ponderación entre ese interés y los derechos e intereses de la persona afectada. El Comité Europeo de Protección de Datos ha insistido precisamente en esta metodología. En sus Directrices 1/2024, el CEPD recuerda que las tres condiciones son acumulativas y que el responsable debe demostrar que el tratamiento supera el correspondiente ejercicio de ponderación.
La cuestión se vuelve especialmente interesante cuando trasladamos ese razonamiento al entrenamiento de modelos de IA. El CEPD, en su Dictamen 28/2024, ya reconoció que el interés legítimo puede constituir, en determinadas circunstancias, una base jurídica para el desarrollo y despliegue de modelos de inteligencia artificial. Pero el propio Dictamen rechaza cualquier interpretación automática: la licitud debe analizarse caso por caso y atendiendo, entre otros elementos, a la naturaleza de los datos, el contexto en que fueron obtenidos, la relación entre el responsable y la persona afectada, la fuente de los datos, la finalidad posterior del modelo y las expectativas razonables de los interesados. El dato de que una información se encuentre públicamente disponible tampoco significa, por sí solo, que pueda utilizarse sin límites para entrenar un sistema de IA. La accesibilidad de un dato y su libre reutilización jurídica son cuestiones diferentes.
Esta distinción es esencial para comprender el verdadero alcance del debate actual. Una fotografía publicada en Internet, una sentencia accesible públicamente, un comentario realizado en una red social o una información profesional disponible en una página web pueden ser técnicamente accesibles, pero su posterior utilización para entrenar un modelo puede constituir un tratamiento diferente que debe encontrar su propia justificación jurídica. El principio de limitación de la finalidad del artículo 5.1.b del RGPD obliga precisamente a preguntarse si los datos fueron recogidos para unos fines determinados, explícitos y legítimos y si el tratamiento posterior resulta compatible con ellos. En consecuencia, la cuestión jurídica no consiste simplemente en preguntar si los datos están en Internet, sino en determinar qué tratamiento se realiza, para qué finalidad, con qué base jurídica, mediante qué garantías y con qué posibilidades reales de ejercicio de los derechos por parte del interesado.
El segundo gran problema es la anonimización. La inteligencia artificial obliga a revisar una distinción clásica entre dato personal y dato verdaderamente anónimo. Si la información ya no permite identificar a una persona, directamente o indirectamente, el régimen del RGPD deja de resultar aplicable a esa información anónima. Pero el problema aparece cuando hablamos de grandes modelos capaces de establecer relaciones, inferir características o recuperar determinados contenidos a partir de las consultas realizadas. El CEPD ha señalado expresamente que la anonimidad de un modelo de IA debe valorarse caso por caso y que debe ser muy poco probable tanto identificar directa o indirectamente a las personas cuyos datos se utilizaron para crear el modelo como extraer datos personales mediante consultas al modelo. Esta consideración resulta especialmente relevante porque demuestra que la anonimización no puede reducirse a una operación informática realizada una sola vez: en determinados contextos, debe valorarse teniendo en cuenta las capacidades técnicas y los medios razonablemente utilizables para identificar o recuperar información.
Precisamente en este punto se encuentra una de las cuestiones más delicadas de la propuesta del Digital Omnibus. La reforma europea pretende introducir modificaciones que afectan al concepto de datos personales y a la utilización de datos en el desarrollo y funcionamiento de sistemas y modelos de IA. La documentación parlamentaria europea explica que la propuesta pretende, entre otras cuestiones, clarificar el tratamiento de datos personales para entrenamiento y funcionamiento de IA y modificar determinados aspectos relativos a la consideración de datos seudonimizados. Sin embargo, el alcance definitivo de estas modificaciones continúa sujeto al procedimiento legislativo y a la negociación entre las instituciones europeas. El propio CEPD y el Supervisor Europeo de Protección de Datos han examinado críticamente algunas de estas propuestas y han señalado que el RGPD vigente ya permite, en determinadas circunstancias, recurrir al interés legítimo para el desarrollo y despliegue de modelos de IA, por lo que no consideran imprescindible introducir una nueva disposición específica para reconocer esa posibilidad.
La posición del CEPD y del EDPS resulta particularmente significativa desde una perspectiva jurídica porque introduce una idea que debería ocupar un lugar central en la enseñanza del Derecho de la IA: el problema no se resuelve creando una excepción tecnológica, sino aplicando correctamente las categorías jurídicas existentes. El Dictamen conjunto 2/2026 sostiene que el interés legítimo puede operar en determinadas circunstancias dentro del marco actual del artículo 6.1.f del RGPD. Por ello, la cuestión fundamental no es decidir entre innovación y protección de datos como si fueran necesariamente intereses incompatibles, sino determinar cuáles son las condiciones jurídicas que permiten hacer compatibles ambos objetivos. La necesidad del tratamiento, la ponderación de intereses, las expectativas razonables de los afectados, la transparencia, la minimización y las medidas técnicas y organizativas adquieren así una función mucho más importante que la mera existencia formal de una base jurídica.
También resulta necesario relacionar esta cuestión con el Reglamento de Inteligencia Artificial de la Unión Europea. La regulación europea de la IA no sustituye al RGPD. Son instrumentos diferentes que se proyectan sobre ámbitos parcialmente coincidentes y que deben interpretarse de manera coordinada. El AI Act establece un marco basado en el riesgo para los sistemas de inteligencia artificial y, tras las modificaciones introducidas por el paquete europeo de simplificación, mantiene obligaciones y salvaguardias relacionadas con los derechos fundamentales. La Comisión Europea ha señalado, además, que determinadas reglas del AI Act comenzaron a aplicarse en 2026, mientras que otras obligaciones para determinados sistemas de alto riesgo tienen calendarios posteriores. Esto confirma que el Derecho europeo de la IA no está construyendo una única norma aislada, sino un auténtico ecosistema regulatorio compuesto por el AI Act, el RGPD y las restantes normas digitales europeas.
Para los juristas, quizá la consecuencia más importante sea metodológica. Ante cualquier sistema de IA que utilice información personal, ya sea para entrenar un modelo, ajustarlo, evaluar su funcionamiento o desplegarlo, no debería comenzarse preguntando simplemente si «la IA puede utilizar esos datos». La pregunta jurídicamente correcta debe ser mucho más precisa: ¿qué datos se tratan?, ¿quién los trata?, ¿con qué finalidad?, ¿cuál es la base jurídica?, ¿es el tratamiento necesario?, ¿qué expectativas podía tener razonablemente el interesado?, ¿qué riesgos genera?, ¿qué medidas de minimización y seguridad se han adoptado?, ¿cómo puede ejercerse el derecho de oposición?, ¿existe información suficiente sobre el tratamiento?, ¿los datos pueden considerarse realmente anónimos y qué medios existen para intentar identificar a las personas? Esta metodología transforma la IA de un problema tecnológico en un verdadero problema de calificación jurídica.
La actualidad europea del 21 de septiembre de 2026 demuestra, en definitiva, que estamos entrando en una nueva fase del Derecho de la inteligencia artificial. El debate ya no se centra exclusivamente en prohibir determinados usos o clasificar sistemas según su nivel de riesgo. Ahora adquiere una importancia decisiva la regulación de la materia prima de la inteligencia artificial: los datos. La cuestión sobre quién puede utilizarlos, para qué finalidad, bajo qué fundamento jurídico y con qué garantías puede condicionar buena parte del futuro de la IA europea. La posible modificación del RGPD mediante el Digital Omnibus convierte así el entrenamiento de modelos de IA en uno de los escenarios donde se decidirá el equilibrio entre innovación tecnológica, competitividad económica y protección efectiva de los derechos fundamentales. Y precisamente por encontrarnos todavía ante una negociación legislativa, el momento resulta especialmente apropiado para que el jurista no se limite a conocer la futura norma, sino que comprenda los principios jurídicos que están detrás de ella.
Referencias
European Commission. (2025, 19 de noviembre). Digital Omnibus Regulation Proposal. European Commission.
European Data Protection Board. (2024, 18 de diciembre). Opinion 28/2024 on certain data protection aspects related to the processing of personal data in the context of AI models. EDPB.
European Data Protection Board. (2024, 8 de octubre). Guidelines 1/2024 on processing of personal data based on Article 6(1)(f) GDPR. EDPB.
European Data Protection Board & European Data Protection Supervisor. (2026, 10 de febrero). EDPB-EDPS Joint Opinion 2/2026 on the Proposal for a Regulation as regards the simplification of the digital legislative framework (Digital Omnibus). EDPB.
Parlamento Europeo. (2026). A Digital Omnibus: Identifying Interlinks and Possible Overlaps Between Different Legal Acts in the Field of Digital Legislation to Streamline Tech Rules. European Parliament.
Reglamento (UE) 2016/679 del Parlamento Europeo y del Consejo, de 27 de abril de 2016, relativo a la protección de las personas físicas en lo que respecta al tratamiento de datos personales y a la libre circulación de estos datos (RGPD), arts. 4, 5 y 6. Diario Oficial de la Unión Europea, L 119, 4.5.2016.

Comentarios
Publicar un comentario