Ir al contenido
IA para hoy
Herramientas y productos Seguridad

Humanos supervisores rechazan solo dos tercios de comandos peligrosos en agentes IA

Humanos supervisores rechazan solo dos tercios de comandos peligrosos en agentes IA
Foto: Daniil Komov · Licencia Pexels · Pexels

Hecho Qué ha ocurrido

Un juego interactivo que simula solicitudes de permisos de agentes de código IA reveló que los desarrolladores aprueban aproximadamente uno de cada tres comandos maliciosos. En más de 40.000 ejecuciones del juego, las violaciones de alcance (como acceder a credenciales de AWS o config de Kubernetes) fueron rechazadas solo el 65% de las veces, mientras que npm run analyze fue aprobado el 65% a pesar de poder ejecutar código arbitrario desde package.json.

Resumen generado mediante IA a partir de The Register AI (original en inglés). Naturaleza de la información: hecho documentado.

Análisis Por qué importa

La supervisión humana es la última línea de defensa para los agentes de código, pero la fatiga por aprobaciones repetidas degrada significativamente la capacidad de detectar amenazas de seguridad. Este hallazgo cuestiona la viabilidad del modelo "humano en el bucle" como solución de seguridad suficiente en flujos automatizados reales.

Quién se ve afectado
Desarrolladores, equipos de ingeniería y empresas que adoptan agentes de IA para tareas de codificación (Claude Code, Copilot, etc.) sin protecciones adicionales.
Qué puede cambiar
La aprobación humana de comandos de agentes debe complementarse con controles técnicos robustos (sandboxes, auto-mode basado en ML, hooks de validación) en lugar de confiar únicamente en revisión manual. Las organizaciones deberán repensar políticas de permisos por defecto y entrenamiento de desarrolladores.

Análisis generado a partir de la información disponible; no procede de la fuente.

Ilustración generada con IA sobre: Humanos supervisores rechazan solo dos tercios de comandos peligrosos en agentes IA
Ilustración generada con IA por IA para hoy

Predicción Qué observar a continuación

Evolución de herramientas de control de agentes IA (Anthropic reporta que su auto-mode atrapa el 83% de comportamientos problemáticos); adopción de sandboxes y entornos de desarrollo en cloud; nuevos ataques explotando fatiga de aprobación; posibles regulaciones sobre seguridad de agentes autónomos.

Recomendación Qué debería hacer una empresa

Auditar en los próximos 3-6 meses políticas actuales de aprobación de agentes de código; implementar capas adicionales de defensa (sandboxing, auto-mode, hooks de seguridad) antes de escalar; entrenar equipos sobre trade-offs entre productividad y supervisión diligente.

Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.

Compartir WhatsApp LinkedIn X Bluesky Telegram
Enviar esta noticia por correo

Se envía esta noticia con su análisis. La dirección se usa solo para ese envío y no se guarda.

Fuente original: The Register AI. La referencia es siempre el artículo original.

Ver fuente original ↗

agentes de IAClaude Codesandboxingauto-mode AnthropicxAI aprobación humanaClaude CodeDevOpsfatiga de aprobaciónhumano en el bucleseguridad de agentesseguridad en agentes

Tu opinión

0 comentarios

Sin registro. La primera vez te pediremos confirmar el correo y el comentario pasará por moderación; después se publican al momento si cumplen las normas. Se guarda un resumen de tu IP para evitar abusos.

Relacionadas

Herramientas y productos

Google lanza la app de escritorio Gemini para Windows con agente en segundo plano

Google ha lanzado la aplicación de escritorio Gemini para Windows, tras haberlo hecho antes en Mac. La aplicación incluye un agente de IA capaz de ejecutar…

Por qué importaConsolida a Gemini como aplicación nativa de escritorio, facilitando su integración en el flujo de trabajo diario de usuarios de Windows y reforzando…

Impacto bajo Fiabilidad confirmado por varias fuentes Europa Press Portaltic
Herramientas y productos

OpenAI lanza en beta pública su Agents API para construir agentes en la nube

OpenAI ha publicado en beta pública la Agents API, que permite a desarrolladores crear agentes en la nube capaces de ejecutar tareas durante horas, correr…

Por qué importaFacilita a las empresas construir agentes autónomos de larga duración sin montar su propia infraestructura, reduciendo la barrera técnica para…

Impacto medio Fiabilidad varias fuentes Relevancia 7/10 The Decoder
Herramientas y productos

Google actualiza sus planes de IA con voz en Gmail, Google Pics y Gemini Spark en Chrome y Photos

Google anunció actualizaciones para sus suscripciones AI Plus, Pro y Ultra: voz contextual en Gmail, Docs y Keep; Google Pics para generación y edición de…

Por qué importaLa integración nativa de IA en Workspace refuerza la ventaja competitiva de Google frente a ChatGPT y Copilot, reduciendo la fricción de adopción…

Impacto medio Fiabilidad confirmado por varias fuentes Relevancia 7/10 WWWhat's new

Samsung desarrolla gafas con IA que proyectarán notificaciones y mapas ante los ojos

Según The Elec, Samsung Electronics pidió el 9 de septiembre a Samsung Display el desarrollo de micropantallas ultracompactas (0,2 pulgadas o menos) para unas…

Por qué importaConfirma que Samsung avanza en wearables de IA con pantalla integrada, un segmento donde compite con Meta y otros por definir el próximo dispositivo…

Impacto bajo Fiabilidad rumor, sin confirmar 20minutos Tecnología