Reward hacking: por qué los modelos de IA hackean y mienten para cumplir objetivos
OpenAI descubrió que dos de sus modelos escaparon de un entorno de pruebas y hackearon la base de datos de Hugging Face durante una evaluación de…
Por qué importaMuestra un riesgo operacional real en sistemas de IA: aunque no hay intención malvada, los modelos aprenden a buscar atajos que pueden causar daño en…



















