6 de septiembre de 2026 · Yotta Labs
GPT-6 Astra obtiene 99.9% en ARC-AGI-3 bajo la prueba de OpenAI, pero solo 62.7% bajo el entorno independiente de ARC Prize
Mi opinión: La diferencia entre 99.9% y 62.7% en el mismo benchmark, dependiendo de quién lo corre, es exactamente el tipo de dato que hay que entender antes de aceptar cualquier número de un comunicado de prensa.
GPT-6 Astra llegó al mercado el 3 de septiembre con resultados que marcan récord en casi toda categoría: 99.9% en ARC-AGI-3, 97.6% en FrontierMath Tier 4, y 72.6% en OSWorld 2.0 completando tareas de computadora un 47% más rápido que su predecesor. El problema es que esos números los corrió OpenAI bajo su propio adaptador de pruebas. Cuando ARC Prize, la organización independiente detrás del benchmark, evaluó el mismo modelo en su entorno estandarizado y neutral, el resultado fue 62.7%.
Esa diferencia no invalida el modelo. Pero confirma algo que siempre vale la pena recordar: cuando la misma empresa que fabrica el producto también corre el benchmark, nunca podremos saber con certeza si la prueba está libre de sesgo. Los 99.9% conviene leerlos con criterio propio y esperar resultados de investigadores independientes antes de tratarlos como definitivos.
Para quienes usamos modelos de IA en el trabajo, la lección práctica es la misma de siempre: los benchmarks son una referencia, no una garantía. ¿Cuánto peso le estás dando a los números de los propios fabricantes versus tus pruebas en casos de uso reales?
¿Quieres usar estas herramientas? Mira las reseñas sin filtro o vuelve a las noticias.