9 de septiembre de 2026 · Anthropic / DataCamp
Fable 5.1 de Anthropic alcanza 52.6% en Terminal-Bench-Science, más del doble que el 22.4% de GPT-5.6 Sol
Mi opinión: Los números que publicó Anthropic para Fable 5.1 en Terminal-Bench-Science son llamativos: 52.6% contra el 22.4% de GPT-5.6 Sol y el 29% de Opus 5, en una prueba que mide si un modelo puede planear y ejecutar una investigación científica completa dentro de una terminal. Eso no es un margen marginal.
Lo que hay que tener presente es el contexto: esta evaluación la corrió Anthropic usando sus propias herramientas de prueba, sobre su propio modelo. Cuando la misma empresa que fabrica el producto también diseña y corre el benchmark, no es posible saber con certeza si la metodología favorece alguna característica particular de ese modelo. Los números convienen leerlos con criterio propio y esperar validaciones de laboratorios independientes antes de tratarlos como definitivos.
Lo que sí es claro es la dirección: la IA está mejorando en tareas de razonamiento técnico y ejecución autónoma en entornos reales, no solo en conversación. Para quienes usan modelos de IA en análisis, investigación o automatización de flujos de trabajo, la pregunta práctica es la misma de siempre: ¿cuánto estás probando los modelos en tu caso de uso real, versus cuánto peso le das a los benchmarks del fabricante?
¿Quieres usar estas herramientas? Mira las reseñas sin filtro o vuelve a las noticias.