Lo último en IA, cada díaNoticias IA
← Noticias IA

9 de septiembre de 2026 · Anthropic / DataCamp

Fable 5.1 de Anthropic alcanza 52.6% en Terminal-Bench-Science, más del doble que el 22.4% de GPT-5.6 Sol

Mi opinión: Los números que publicó Anthropic para Fable 5.1 en Terminal-Bench-Science son llamativos: 52.6% contra el 22.4% de GPT-5.6 Sol y el 29% de Opus 5, en una prueba que mide si un modelo puede planear y ejecutar una investigación científica completa dentro de una terminal. Eso no es un margen marginal.

Lo que hay que tener presente es el contexto: esta evaluación la corrió Anthropic usando sus propias herramientas de prueba, sobre su propio modelo. Cuando la misma empresa que fabrica el producto también diseña y corre el benchmark, no es posible saber con certeza si la metodología favorece alguna característica particular de ese modelo. Los números convienen leerlos con criterio propio y esperar validaciones de laboratorios independientes antes de tratarlos como definitivos.

Lo que sí es claro es la dirección: la IA está mejorando en tareas de razonamiento técnico y ejecución autónoma en entornos reales, no solo en conversación. Para quienes usan modelos de IA en análisis, investigación o automatización de flujos de trabajo, la pregunta práctica es la misma de siempre: ¿cuánto estás probando los modelos en tu caso de uso real, versus cuánto peso le das a los benchmarks del fabricante?

Leer en la fuente: Anthropic / DataCamp ↗

¿Quieres usar estas herramientas? Mira las reseñas sin filtro o vuelve a las noticias.