Regulación · · 10 min de lectura
El 'caso Ross' cierra la puerta al fair use en entrenamiento de IA: lo que significa para tu agente IA
Un tribunal de apelaciones de EE. UU. ratifica que entrenar IA con contenido ajeno sin licencia no es uso legítimo. El fallo Ross Intelligence obliga a repensar el sourcing de datos de cualquier agente IA en producción.
El Segundo Circuito de apelaciones de Estados Unidos ha ratificado el fallo que condena a Ross Intelligence por infracción de derechos de autor contra Thomson Reuters, rechazando de plano su defensa de uso legítimo (fair use) para entrenar modelos de IA con la base de datos Westlaw. La decisión, publicada este 29 de septiembre, no es una nota al margen: reescribe el suelo legal sobre el que se construyen los agentes IA empresariales.
TL;DR: El Segundo Circuito rechaza que entrenar IA con contenido propietario sea fair use. Ross Intelligence pierde contra Thomson Reuters y sienta un precedente directo para todo modelo entrenado con datos ajenos. Para CTOs y product leads: audita ya tu data pipeline, porque la defensa legal 'entrenamos con lo público y ya veremos' acaba de quedar tocada.
Lo que realmente se decidió en el caso Ross vs. Thomson Reuters
El tribunal no ha dicho que toda IA sea ilegal. Ha dicho algo más quirúrgico y más peligroso para quien no lee la letra pequeña: que Ross Intelligence no tenía derecho a reproducir y utilizar el contenido de Westlaw para construir su motor jurídico. La defensa de uso legítimo, ese paraguas que muchas startups de IA esgrimen bajo el argumento de que 'el modelo transforma la obra', ha sido desestimada por un tribunal de apelaciones federal.
Esto no es una sentencia de primera instancia que cualquier abogado pueda anestesiar con un recurso. Es una ratificación en apelación, lo que la convierte en jurisprudencia con fuerza persuasiva para los tribunales inferiores de todo el circuito. Y, dado el peso del Segundo Circuito (Nueva York, Delaware, la jurisdicción donde viven y litigan la mayoría de empresas tecnológicas con negocio en EE. UU.), su influencia se extiende mucho más allá de una sola base de datos jurídica.
El mensaje operativo: el argumento de 'entreno con lo que hay en internet y no pasa nada' tiene una vida útil corta. Y para las empresas que están desplegando agentes IA que consultan conocimiento externo, la factura legal potencial no está en el preprint: está en el discovery.
El impacto directo sobre tu pipeline de datos y tus agentes IA
Cuando hablamos de agentes IA y agentes AI en producción, el entrenamiento y el retrieval son dos procesos distintos con implicaciones legales distintas:
- Entrenamiento (fine-tuning): el modelo absorbe datos y los integra en pesos. Es el terreno donde Ross cayó.
- Retrieval externo (RAG): el agente consulta una fuente externa en tiempo de ejecución. Aquí el riesgo legal recae sobre la licencia de la fuente, no sobre el modelo.
- Destilación o síntesis: generas datos sintéticos a partir de una fuente propietaria. Es la zona gris que los despachos llevan meses señalando y que este fallo estrecha.
La consecuencia práctica para un CTO es que necesita un inventario de procedencia de datos al mismo nivel que ya tiene un inventario de dependencias de software. No basta con saber qué fuentes alimentan tu agente; hay que saber bajo qué licencia, con qué cláusula de uso y con qué trazabilidad.
A diferencia de lo que dice el marketing de las plataformas foundation model, no existe un botón de 'entrenamiento limpio'. Cada vertical tiene su propia maraña de derechos: jurídico, sanitario, financiero, medios. En España, la consultoría IA que ayuda a implantar agentes lleva meses pidiendo a sus clientes esta auditoría. Este fallo convierte esa recomendación en urgencia.
Qué dice el escenario europeo (y por qué no puedes ignorarlo)
Aquí llega el matiz que muchos análisis estadounidenses olvidan: en la UE el marco no es el fair use de EE. UU., sino la directiva DSM (2019/790) y su régimen de text and data mining (TDM). Esa directiva permite el TDM con fines de investigación, pero reserva a los titulares la posibilidad de opt-out explícito para usos comerciales. Y el borrador de directrices de la Comisión sobre IA generativa va en la línea de exigir transparencia en las fuentes.
Traducido: una empresa española que entrena un modelo con contenido editorial o bases de datos sin licencia puede estar igualmente expuesta, aunque el marco sea distinto. La sentencia Ross no se aplica en España, pero el criterio económico (¿el uso sustituye al mercado original?) sí lo utilizan los tribunales europeos como referencia comparada.
El ecosistema de agencias IA en Barcelona y agencias IA en Madrid está desplegando agentes para banca, seguros y legal tech. Estos tres verticales son los más expuestos: alta densidad de datos propietarios, licencias caras y titulares con capacidad legal sólida para demandar.
Comparativa: dónde está el riesgo legal por tipo de dato
| Tipo de fuente | Riesgo entrenamiento | Riesgo RAG | Coste mitigación |
|---|---|---|---|
| Datos públicos abiertos (Wikipedia, Gutenberg) | Bajo | Bajo | Bajo |
| Bases de datos propietarias (Westlaw, Bloomberg) | Alto (caso Ross) | Medio | Licencia comercial, 5-7 cifras anuales |
| Contenido de medios (editoriales, agencias) | Medio-alto | Alto | Acuerdos bilaterales o crawling con opt-out respetado |
| Datos de clientes (CRM, tickets) | Bajo si hay consentimiento | Bajo | DPA + base legal RGPD |
| Datos sintéticos generados por otro modelo | Medio (¿licencia del origen?) | Bajo | Trazabilidad de la cadena de generación |
La conclusión de esta tabla es incómoda para la mayoría de roadmaps: las bases de datos propietarias son el activo más valioso y el más tóxico legalmente. Si tu agente jurídico o financiero se apoya en una de ellas sin licencia, no estás haciendo IA: estás prestando un servicio con material ajeno.
Las tres decisiones que un CTO debe tomar esta semana
Primero, mapear la procedencia. Antes de escalar cualquier agente IA, exige a tu equipo un documento con cada fuente, su licencia y su método de ingestión. Si no existe, ese es el proyecto.
Segundo, decidir el modelo de acceso. Para contenido propietario hay tres vías reales: licencia directa (cara, lenta, negociable), API con términos claros (la ruta que los titulares prefieren) o abandono de la fuente. No hay cuarta vía mágica. El scraping silencioso es una bomba de relojería contable, no una estrategia.
Tercero, blindar contratos con proveedores. Cuando contratas a una agencia de automatización con IA o a un proveedor de agentes, necesitas una cláusula de indemnización específica por infracción de derechos de autor en el data pipeline. Los proveedores serios ya la ofrecen; los que no, te están trasladando el riesgo.
El coste real de no hacer nada
Hablemos de números. Una demanda por infracción de derechos de autor en EE. UU. puede generar daños estatutarios de hasta 150.000 dólares por obra infringida. Si tu base de datos tiene 10.000 documentos y has entrenado sin licencia, la aritmética deja de ser teórica. A eso se suma el coste de discovery (frecuentemente 1-3 millones de dólares solo en revisión documental) y el daño reputacional en un mercado donde las agencias IA compiten por credibilidad técnica.
El fallo Ross también tiene una lectura positiva para quien juega limpio: sube el listón de entrada. Las agencias que ya operan con datos licenciados o generados internamente tienen ahora una ventaja competitiva defendible frente a competidores que construyeron su producto sobre scraping opaco. Es el mismo patrón que se vivió con el RGPD: los que invirtieron en compliance antes de que fuera obligatorio se comieron el mercado de los que no.
Qué vigilar en los próximos 12 meses
Hay tres frentes que van a moverse rápido:
- Cloudflare y el pay-per-crawl. El modelo de negocio de monetizar el acceso de bots va camino de convertirse en estándar. Si tu pipeline depende de crawling, prepárate para pagar peaje.
- Licencias colectivas. Los titulares de contenido están montando vehículos de licencia agregada (a imagen de las entidades de gestión musical). Va a nacer una industria de intermediación de datos de entrenamiento con precios por token o por documento.
- Certificaciones de origen de datos. Igual que hoy exigimos ISO 27001, en dos años veremos sellos de procedencia de datos de entrenamiento. Los departamentos de compras de banca y seguros los van a incorporar a sus pliegos.
El caso Ross no cierra el debate jurídico, lo acelera. Y para las empresas que están desplegando agentes IA en producción, el mensaje es brutalmente simple: si tu ventaja competitiva se apoya en datos que no son tuyos y que nunca licenciaste, tu moat no es tecnológico, es legalmente frágil.
La predicción: en los próximos 18 meses, el mercado de agencias IA españolas verá una consolidación silenciosa. Las que hoy ofrecen 'entrenamos tu modelo con todo lo que haga falta' perderán clientes enterprise, porque los comités de riesgo de los grandes clientes ya están aplicando criterios post-Ross. Las que lleguen con trazabilidad, licencias y contratos blindados capturarán ese hueco. La pregunta no es si tu agente IA es potente, sino si puedes demostrar de dónde viene cada dato que lo hace potente.
Preguntas frecuentes sobre el fallo Ross y el entrenamiento de IA
¿Qué ha decidido exactamente el tribunal en el caso Thomson Reuters vs. Ross Intelligence?
El Segundo Circuito de apelaciones ha ratificado el fallo de primera instancia que condena a Ross Intelligence por infracción de derechos de autor contra Thomson Reuters y rechaza su defensa de uso legítimo (fair use). El tribunal considera que el uso de la base de datos Westlaw para entrenar su motor jurídico no cumple los criterios de transformación y afecta al mercado del titular. La ratificación en apelación eleva el peso jurisprudencial de la decisión.
¿Puede afectar este fallo a mi empresa si entrena IA en España?
Directamente no, porque la jurisprudencia estadounidense no se aplica en tribunales españoles. Pero sí indirectamente: los criterios económicos del fallo (sustitución de mercado) se usan como referencia en litigios europeos, y la directiva DSM europea ya obliga a respetar el opt-out de los titulares para usos comerciales. Si entrenas con contenido propietario sin licencia, estás expuesto bajo derecho español igualmente.
¿Cuánto cuesta licenciar datos propietarios para entrenar agentes IA en producción?
Los acuerdos con bases de datos jurídicas o financieras rara vez bajan de cinco cifras anuales y suelen escalar a seis o siete cifras según volumen y uso. La alternativa más económica es el retrieval mediante API con términos de uso comerciales, que suele facturarse por consulta o por suscripción. La opción más cara es el litigio: daños estatutarios de hasta 150.000 dólares por obra en EE. UU. más costes de discovery.
¿RAG está exento del problema legal que afecta al entrenamiento?
No está exento, pero el riesgo es estructuralmente distinto. En RAG no integras el contenido en los pesos del modelo: lo consultas en tiempo de ejecución. El riesgo se traslada a la licencia de la fuente consultada y a si el agente reproduce fragmentos que sustituyan al original. Para fuentes propietarias, la práctica segura es firmar un acuerdo de acceso programático con el titular, no hacer scraping silencioso.
¿Qué deben exigir las empresas a sus agencias IA en los contratos?
Tres cosas concretas: un inventario documentado de procedencia de datos con licencias, una cláusula de indemnización específica por infracción de derechos de autor en el data pipeline, y un protocolo de opt-out para fuentes que lo soliciten. Sin los tres, el cliente está asumiendo un riesgo legal que el proveedor debería cubrir. Las agencias serias ya lo ofrecen por defecto; las que esquivan el tema están trasladándote su exposición.
Temas relacionados en agentes.ai
Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai:
- Directorio de agencias de automatización con ia
- Agencias de IA en Valencia y en Málaga
- Explora el directorio completo de agencias de IA
- Sigue las últimas noticias de IA en tiempo real