Investigadores extraen razonamientos ocultos de modelos propietarios mediante trazas cifradas

Hecho Qué ha ocurrido
Investigadores descubrieron una vulnerabilidad que permitía extraer las cadenas de razonamiento ocultas (chain-of-thought) cifradas devueltas por APIs de OpenAI, Anthropic y Google. El exploit funcionaba replicando trazas de modelos fuertes en versiones más débiles para forzarlas a revelar el razonamiento en texto plano; todos los modelos de una familia utilizaban la misma clave de cifrado. Claude Haiku 4.5 fue el más vulnerable. Tras reportar responsablemente, los proveedores confirmaron el problema y lo corrigieron.
Resumen generado mediante IA a partir de Simon Willison (original en inglés). Naturaleza de la información: hecho documentado.
Análisis Por qué importa
Esta vulnerabilidad expone cómo el "pensamiento" de los modelos más avanzados puede ser interceptado y reutilizado, comprometiendo tanto la privacidad de los procesos de razonamiento como la seguridad de sistemas basados en estos modelos. Además, demuestra un vector de inyección de prompts más sofisticado: insertar instrucciones maliciosas dentro de las propias trazas de pensamiento que los modelos tienden a ejecutar sin cuestionamiento.
- Quién se ve afectado
- Empresas que utilizan APIs de OpenAI, Anthropic o Google con modelos de razonamiento extendido; desarrolladores que dependen de la confidencialidad de los procesos de razonamiento de modelos propietarios; cualquier aplicación que procese información sensible con estos modelos.
- Qué puede cambiar
- Si esta clase de vulnerabilidades persiste en futuras versiones, la confianza en que el razonamiento oculto permanece privado se verá comprometida. Podría obligar a un rediseño fundamental de cómo se cifran y distribuyen las trazas de razonamiento, o cambiar el modelo de negocio hacia sistemas donde ese pensamiento se procesa completamente en servidores del proveedor sin retorno al cliente.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar si aparecen nuevas variantes de ataque una vez que los parches estén más extendidos; monitorear cambios en las políticas de acceso a razonamientos en futuras versiones de APIs (Claude 4.6+, GPT-5.6, etc.); observar si otros proveedores implementan mitigaciones similares; seguir publicaciones académicas que profundicen en la seguridad de trazas de razonamiento.
Recomendación Qué debería hacer una empresa
Equipos técnicos que integren razonamientos extendidos en aplicaciones críticas deben evaluar en los próximos 3-6 meses el impacto de este hallazgo en su modelo de seguridad y considerar implementar capas adicionales de protección o restricciones de acceso a estas trazas mientras los proveedores refinan sus defensas.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: Simon Willison. La referencia es siempre el artículo original.
Ver fuente original ↗LLMrazonamiento extendidochain-of-thoughtcifrado OpenAIAnthropicGoogle DeepMind APIs propietariasciberseguridadrazonamientoseguridadvulnerabilidad
Tu opinión
0 comentarios
Relacionadas
Anthropic detecta uso de Claude por un grupo vinculado a hutíes para desarrollar misiles
Anthropic informó que un grupo con sede en el norte de Yemen usó Claude para apoyar el desarrollo de cohetes guiados, un misil balístico de largo alcance y…
Por qué importaConfirma que los modelos de lenguaje avanzados pueden ser mal utilizados para fines de armamento militar, incluso sin lograr un resultado exitoso, lo…
OpenAI evalúa ralentizar el desarrollo de IA ante preocupaciones de seguridad, según Bloomberg
Según Bloomberg, Sam Altman ha comunicado a empleados de OpenAI que la compañía podría moderar el ritmo de desarrollo de IA, tras haber desacelerado ya algunos…
Por qué importaSi el líder del sector modera su ritmo por razones de seguridad, podría marcar un precedente que influya en la percepción regulatoria y en la…
OpenAI consulta al Congreso de EE.UU. sobre la legalidad de coordinar una ralentización de la IA con otros laboratorios
OpenAI ha preguntado a miembros del Congreso de EE.UU. si sería legal coordinar con otros laboratorios de IA una ralentización del desarrollo, según WIRED. La…
Por qué importaMuestra que los propios líderes del sector reconocen riesgos de seguridad graves y buscan cobertura legal para actuar colectivamente, lo que podría…
Anthropic detecta intentos de usar Claude para crear armas biológicas y destilación ilícita vinculados a China
Anthropic ha revelado que desarticuló varias operaciones maliciosas que intentaban usar su modelo Claude para actividades como destilación ilícita y desarrollo…
Por qué importaEvidencia riesgos de doble uso de modelos de IA avanzados en manos de actores malintencionados, y plantea la necesidad de controles de seguridad más…



