Un juez acaba de ponerle precio de mercado a los libros pirateados que entrenaron a Claude: 3.000 dólares por obra, 1.500 millones en total. Si entrenas modelos y nunca auditaste de dónde salieron tus datos, ese número ya es tu problema también.
El acuerdo Bartz v. Anthropic dejó de ser una discusión académica sobre fair use y se convirtió en una factura. La jueza Araceli Martínez-Olguín aprobó el 20 de julio de 2026 el mayor pago por copyright de la historia de EE.UU., y con eso el sector perdió la última excusa: la procedencia de los datos de entrenamiento ya no es un tema de compliance abstracto, es un pasivo cuantificable que puedes meter en un Excel.
Mi postura, sin vueltas: el fair use te cubre el uso, no la cadena de suministro. Y si tu cadena de suministro pasa por LibGen, ya sabes cuánto te va a costar.
Qué pasó
Anthropic descargó y almacenó millones de libros pirateados de las bibliotecas sombra LibGen y PiLiMi para entrenar a Claude. En 2024, autores como Andrea Bartz, Charles Graeber y Kirk Wallace Johnson demandaron. En junio de 2025, el juez William Alsup dictaminó algo clave: entrenar con libros obtenidos legalmente podía ser fair use, pero adquirir y almacenar copias pirateadas era un problema de copyright separado.
Ese fallo partió el caso en dos y condenó la mitad que nadie quería mirar. El acuerdo final cubre entre 482.000 y 500.000 obras elegibles, con un reparto inicial estimado de 2.203,56 dólares por obra sobre un fondo de unos 1.083 millones con intereses. Un pago posterior de 450 millones vence en septiembre de 2027 y empuja el total por encima de los 3.000 dólares por libro.
El reparto por defecto es 50/50 entre autor y editorial para libros con derechos vigentes; los autoeditados o con derechos revertidos antes del 10 de agosto de 2022 pueden reclamar el 100%. Anthropic dice que más del 91% de los cubiertos ya reclamaron su parte. Y para dimensionar: 1.500 millones equivalen a unos ocho días de ingresos de una empresa cuyo run-rate anualizado superó los 65.000 millones a finales de julio de 2026.
Qué significa
Significa que el riesgo legal de los datos de entrenamiento dejó de ser difuso y pasó a tener tarifa. Antes podías decir «ya veremos». Ahora puedes multiplicar: número de obras no licenciadas en tu corpus por 3.000 dólares. Eso es tu exposición estimada. Presupuestable. Comparable. Y si tu startup no aguanta ese número, tienes un problema de modelo de negocio, no de abogados.
El detalle que casi nadie subraya: el fallo de Alsup protegió el uso y castigó la adquisición. Todo el mundo leyó «fair use gana». Nadie leyó «tu pipeline de scraping es tu talón de Aquiles». Si compraste datasets a un tercero sin garantías de licencia, heredaste su riesgo sin heredar su descuento.
Tampoco te confundas con la escala de Anthropic. Ocho días de ingresos para ellos es el fin del mundo para ti. La referencia de 3.000 dólares por obra no escala hacia abajo: escala hacia arriba cuando sumas daños estatutarios, demandas de titulares de música como Sony Music Publishing y Warner Chappell —que en agosto de 2026 demandaron a Anthropic, Dario Amodei y Benjamin Mann— y el hecho de que este acuerdo no compra inmunidad sobre los outputs del modelo.
Y ojo con la visión contraria, que existe y es seria: el fair use sigue vivo, OpenAI lo defiende en su propio caso contra la Authors Guild, y Garry Tan argumenta que perseguir la destilación es absurdo cuando los modelos frontera se entrenaron con datos posiblemente cubiertos. Todo cierto. Pero ninguna de esas defensas te salva de haber pirateado la fuente. La discusión sobre el uso sigue abierta; la de la adquisición ya tiene sentencia y precio.
Qué hacer al respecto
Cinco movimientos, en este orden:
- Audita dataset por dataset. Separa lo obtenido con licencia, compra o dominio público de lo que vino de bibliotecas sombra o scrapes sin licencia. El riesgo se concentra en la adquisición, no en el entrenamiento.
- Ponle precio a tu exposición. Multiplica tus obras no licenciadas por 3.000 dólares. Ese número va en tu presupuesto de riesgo, no en un párrafo de tu deck.
- Documenta la cadena de custodia hoy. Fecha de descarga, fuente, licencia, hash del archivo. En Bartz, la fecha del 10 de agosto de 2022 fue determinante para asignar derechos. No esperes al litigio para reconstruir tu historial.
- Reescribe tus contratos con proveedores de datos. Exige garantías de licencia e indemnización por reclamaciones de copyright. Si el proveedor no firma, ese dataset es un pasivo disfrazado de activo.
- Mete un fallback y limpia el corpus. Reemplaza fuentes sucias por datasets licenciados o sintéticos donde puedas, y deja registro de qué versión del modelo usó qué corpus.
El que no haga esto en los próximos seis meses va a estar reconstruyendo su cadena de datos con abogados facturando por hora. Tú decides si lo haces con un spreadsheet o con una demanda.
¿Tu empresa sabe exactamente de dónde salió cada dataset que entrenó? Cuéntame en los comentarios si tienes la respuesta o si estás improvisando. Y si ya auditiste, comparte qué encontraste: la mitad de este sector está volando a ciegas.
Preguntas frecuentes
¿Cuánto pagó Anthropic por el caso de copyright? Más de 1.500 millones de dólares, el mayor acuerdo por copyright de la historia de EE.UU., con una referencia de unos 3.000 dólares por obra sobre 482.000-500.000 libros elegibles.
¿Entrenar con libros pirateados es ilegal? No es el entrenamiento lo que generó responsabilidad, sino la adquisición y almacenamiento de copias pirateadas. El juez Alsup consideró fair use el entrenamiento con material obtenido legalmente.
¿Este acuerdo me protege si uso datasets comprados a terceros? No. El acuerdo no compra inmunidad y no cubre reclamaciones sobre los outputs del modelo. Si tu proveedor no garantiza licencia, el riesgo es tuyo.
¿Cómo estimo mi exposición legal por datos de entrenamiento? Cuenta las obras no licenciadas en tu corpus y multiplícalas por 3.000 dólares como referencia de mercado. Es una cifra presupuestable, no un riesgo difuso.
Fuentes
- Authors Wrangle With Publishers Over $1.5 Billion Anthropic A.I. Settlement — The New York Times
- Authors are Now Fighting Publishers and Agents Over Anthropic’s $1.5 Billion AI Settlement — Times Now
- Authors Fight Publishers And Agents Over Anthropic’s $1.5 Billion Settlement — Startup Fortune
- Authors push back as publishers and agents make claims on Anthropic settlement — TechCrunch
- Court Grants Final Approval of $1.5 Billion Anthropic Copyright Settlement — The Authors Guild