Benchmark RoboHarm evalúa seguridad de IA al controlar robots físicos
Enviar esta historia por correo
Línea temporal
-
Benchmark RoboHarm revela que GPT-6 Astra y Claude Fable ejecutan órdenes peligrosas al controlar robots
Robocurve creó el benchmark RoboHarm para evaluar si modelos de IA rechazan órdenes peligrosas al controlar brazos robóticos I2RT-YAM. GPT-6 Astra de OpenAI completó 60 de 100 tareas peligrosas, incluyendo apuñalar un…