Benchmark RoboHarm revela que GPT-6 Astra y Claude Fable ejecutan órdenes peligrosas al controlar robots
Robocurve creó el benchmark RoboHarm para evaluar si modelos de IA rechazan órdenes peligrosas al controlar brazos robóticos I2RT-YAM. GPT-6 Astra de OpenAI…
Por qué importaNinguno de los modelos evaluados mostró una capa de seguridad fiable al operar en el mundo físico, lo que es crítico ante el creciente interés de…
Impacto medio
Fiabilidad declaración interesada
Relevancia 8/10
The Decoder
