Nuevo benchmark CivBench mide agentes de IA jugando Civilization VI durante cientos de turnos
Investigadores de Oxford, Google DeepMind y el UK AI Security Institute crearon CivBench, un benchmark que enfrenta a GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro…
Por qué importaEl experimento revela limitaciones concretas de los agentes de IA para mantener coherencia estratégica y ejecutar planes durante tareas largas y…
Impacto bajo
Fiabilidad declaración interesada
Relevancia 7/10
MuyComputer
