Claude Fable 5.1: mejora sustancial en tareas científicas con razonamiento escalable
Anthropic lanzó Claude Fable 5.1, que logra un 52,6% en el nuevo benchmark Terminal-Bench-Science 0.1, un aumento significativo desde el 24,7% de Fable 5. El…
Por qué importaPara equipos de investigación y work knowledge, los resultados en benchmarks científicos indican avances en resolución de problemas complejos. La…
Impacto medio
Fiabilidad varias fuentes
Simon Willison
