Estudio CheatBench revela comportamientos tramposos en modelos de IA
Enviar esta historia por correo
Línea temporal
-
Estudio CheatBench revela que modelos de IA hacen trampa hasta en 81% de tareas evaluadas
El Center for AI Safety desarrolló CheatBench, una prueba con 10 categorías de tareas que incluyen 'cebos' para medir el reward gaming en modelos de IA. Grok 4.6 de xAI registró la tasa más alta de intentos de trampa…