Ir al contenido
IA para hoy
Investigación Investigación

Investigadores extraen libros completos de modelos IA comerciales como Claude y Gemini

Investigadores extraen libros completos de modelos IA comerciales como Claude y Gemini
Foto: Mathews Jumba · Licencia Pexels · Pexels

Hecho Qué ha ocurrido

Investigadores de Stanford y Yale han demostrado que modelos IA comerciales en producción —Claude 3.7 Sonnet, GPT-4.1, Gemini 2.5 Pro y Grok 3— pueden reproducir fragmentos sustanciales de contenido protegido por derechos de autor si se les solicita con prompts específicos. El equipo logró extraer entre el 70 % y el 95 % de «Harry Potter y la Piedra Filosofal» de estos modelos, dependiendo del sistema y técnicas de jailbreak empleadas. Los resultados, comunicados a los fabricantes bajo ventana de divulgación responsable, plantean cuestiones sobre memorización de datos de entrenamiento y validez de defensas de fair use.

Resumen generado mediante IA a partir de The Register AI (original en inglés). Naturaleza de la información: hecho documentado.

Análisis Por qué importa

Este hallazgo es crítico en los más de 60 litigios en curso contra fabricantes de IA por uso no autorizado de contenido protegido. Demuestra que los guardrails de seguridad no impiden completamente la reproducción textual de obras copyrighted, lo que debilita argumentos de transformación y puede afectar desenlaces legales y regulatorios sobre entrenamiento lícito.

Quién se ve afectado
Empresas fabricantes de modelos IA (Anthropic, OpenAI, Google, xAI), editoriales y titulares de derechos de autor, y defensores de privacidad de datos.
Qué puede cambiar
Si los tribunales consideran que la reproducción textual de obras protegidas invalida la defensa de fair use, los fabricantes de IA podrían verse obligados a implementar filtros más estrictos, rediseñar entrenamientos con datos explícitamente licenciados, o enfrentar mayores daños en litigios. Las expectativas sobre transparencia de datos de entrenamiento podrían cambiar regulatoriamente.

Análisis generado a partir de la información disponible; no procede de la fuente.

Predicción Qué observar a continuación

Evolución de los fallos judiciales en casos de copyright contra OpenAI, Google, Anthropic y otros. Cambios en políticas de guardrails y divulgación de corpora de entrenamiento. Reacciones de reguladores europeos (RGPD, AI Act) y estadounidenses. Adopción de técnicas de unlearning o entrenamientos sintéticos como alternativa.

Recomendación Qué debería hacer una empresa

Las empresas que usan modelos IA en producción deberían documentar y auditar el origen de datos en sus entrenamientos internos, y evaluar en los próximos 6-12 meses el riesgo legal de reproducción de contenido protegido en sus pipelines, especialmente si planean expansión en sectores regulados (editorial, medios, academia).

Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.

Compartir WhatsApp LinkedIn X Bluesky Telegram
Enviar esta noticia por correo

Se envía esta noticia con su análisis. La dirección se usa solo para ese envío y no se guarda.

Fuente original: The Register AI. La referencia es siempre el artículo original.

Ver fuente original ↗

LLMjailbreakextracción de datos AnthropicOpenAIGoogle DeepMindxAIMeta copyrightderechos de autorfair usememorizaciónmodelos comerciales

Tu opinión

0 comentarios

Sin registro. La primera vez te pediremos confirmar el correo y el comentario pasará por moderación; después se publican al momento si cumplen las normas. Se guarda un resumen de tu IP para evitar abusos.

Relacionadas

Investigación

Expertos matizan el alcance de AlphaGenome, el modelo de Google DeepMind para variantes del ADN

AlphaGenome, modelo de Google DeepMind, calculó el impacto potencial de 9.000 millones de mutaciones genómicas procesando un petabyte de datos. Especialistas…

Por qué importaEl caso ilustra tanto el potencial como los límites actuales de la IA aplicada a genómica, y plantea un debate sobre transparencia y concentración de…

Impacto bajo Fiabilidad declaración interesada Ámbito Tecnología
Investigación

Bubeck (OpenAI) se disculpa por comentario en la disputa sobre crédito por resolver ecuaciones de Navier-Stokes

El investigador de OpenAI Sébastien Bubeck publicó el 8 de septiembre su versión de la disputa con los matemáticos Levent Alpöge y Tristan Buckmaster sobre…

Por qué importaEl episodio expone tensiones entre laboratorios de IA y la comunidad científica sobre prioridad, transparencia y protocolos de validación de…

Impacto bajo Fiabilidad declaración interesada WWWhat's new
Investigación

Matemático medalla Fields funda instituto para probar matemáticamente la seguridad de la IA

El matemático canadiense Jacob Tsimerman, ganador reciente de la Medalla Fields, anunció la fundación del Mathematical AI Safety Institute (MAISI), un…

Por qué importaPropone usar pruebas matemáticas formales, como las pruebas de conocimiento cero usadas en criptografía, para demostrar que sistemas de IA se…

Impacto bajo Fiabilidad declaración interesada The Decoder
Investigación

OpenAI añade citas a matemáticos españoles en su paper sobre Navier-Stokes tras críticas

OpenAI actualizó la versión pública del paper que documenta su solución propuesta al problema de Navier-Stokes, incluyendo tres referencias a trabajos de los…

Por qué importaEl episodio evidencia tensiones sobre atribución de crédito científico cuando sistemas de IA se apoyan en trabajo previo humano no citado…

Impacto bajo Fiabilidad una fuente fiable Wired en Español