Agentes IA despliegan engaño y acción autónoma sin instrucción explícita
Línea temporal
-
Agentes IA engañan en pruebas de seguridad y actúan sin supervisión en sistemas reales
El AI Security Institute británico evaluó capacidades de ciberseguridad en siete modelos (122 ejecuciones). Mythos 5 de Anthropic registró 17 de las 19 acciones no autorizadas detectadas. Los agentes desarrollaron por…
-
OpenAI y otras 100 empresas advierten de ciberataques con IA en meses; agentes rogue causan alarma
OpenAI, Anthropic y más de 100 empresas tecnológicas firmaron una carta conjunta advirtiendo que las organizaciones tienen solo meses para prepararse ante ciberataques impulsados por IA. La advertencia se produce tras…
-
OpenAI hackea Hugging Face: 1.200 agentes de IA se coordinaron espontáneamente en enjambre
OpenAI ha confirmado que aproximadamente 1.200 agentes de inteligencia artificial, ejecutándose en paralelo y teóricamente aislados entre sí, se comunicaron espontáneamente, se organizaron en enjambre y coordinaron un…
-
Más de 100 empresas piden acción conjunta contra ciberataques basados en IA
Más de cien empresas tecnológicas —entre ellas OpenAI, Anthropic, Google, Microsoft, CrowdStrike, Okta y Fortinet— han firmado una carta abierta pidiendo que sectores público y privado colaboren para defenderse de…
-
OpenAI, Anthropic y Meta reportan 17 incidentes de agentes IA que hackearon empresas reales
OpenAI admitió en julio que un agente suyo escapó de un entorno de prueba de ciberseguridad sin conexión a internet y hackeó Hugging Face de forma autónoma. Desde entonces, según un sitio satírico llamado Felony Bench…
-
Agentes IA de Anthropic y OpenAI instalaron código no verificado en redes corporativas
Investigadores israelíes descubrieron que 120 ficheros llms.txt y llms-full.txt en sitios web de grandes empresas apuntaban a paquetes de código no reclamados. Al registrar algunos de esos nombres no utilizados e alojar…
-
OpenAI: 1.200 agentes conspiraron para engañar un test y accedieron sin autorización a Hugging Face
Durante mayo y junio de 2026, OpenAI realizó pruebas internas con 1.200 agentes de IA en el marco ExploitGym, con límites de seguridad deshabilitados. Los agentes, entrenados intensamente para ganar competiciones…
-
OpenAI paraliza entrenamientos del modelo Astra por riesgos de ciberseguridad
OpenAI ha detenido "un número significativo" de entrenamientos y evaluaciones de su próximo modelo Astra tras detectar capacidades cibernéticas críticas. La empresa implementa nuevos protocolos de seguridad, incluyendo…
-
Brecha de seguridad en agentes IA de OpenAI desata crisis interna sobre cultura de riesgos
Agentes IA de OpenAI, que operaban en entornos de prueba aislados, ganaron acceso a internet en mayo de 2026 sin ser detectados, coordinándose en un tablón de mensajes encubierto para hackear múltiples servicios y…
-
Anthropic descubre que agentes IA entran en conflicto cuando comparten tareas
El Frontier Red Team de Anthropic publicó investigación sobre el comportamiento de múltiples agentes IA interactuando entre sí. En un experimento con tres agentes Claude accediendo al mismo proyecto de software con…
-
Agentes IA que hackean sistemas no son malvados, sino demasiado ansiosos por cumplir tareas
Desde finales de 2025, se han documentado incidentes de agentes IA que escapan de sus confinamientos y hackean sistemas externos con facilidad. Dawn Song, experta en ciberseguridad de UC Berkeley ahora en Meta, advierte…