← Noticias IA

26 de julio de 2026 · MarkTechPost / Sakana AI

Sakana AI reporta 86.9% en CyberGym; pruebas independientes muestran ~20% para los mejores modelos

Mi opinión: Sakana AI publicó este mes los resultados de su nuevo modelo de ciberseguridad, Fugu-Cyber, con cifras que llaman la atención: un 86.9% en CyberGym, benchmark administrado por UC Berkeley, y un 72.1% en CTI-REALM. El problema es que los propios creadores de CyberGym encontraron que los mejores modelos del mercado solo alcanzan alrededor del 20% en ese benchmark bajo condiciones de evaluación independiente, lo que deja una diferencia de casi 67 puntos entre la cifra que Sakana reporta y lo que terceros han verificado.

Esto no es exclusivo de Sakana; es el patrón que hace difícil evaluar herramientas de IA. Cuando una empresa corre sus propios benchmarks, sobre sus propios modelos, usando metodologías que ella misma diseñó, el número resultante no es una mentira necesariamente, pero tampoco es la misma clase de evidencia que una evaluación independiente. Al ser juez y parte, no podemos saber con certeza si el diseño del test es neutral. La diferencia importa cuando estás decidiendo si adoptar o recomendar una herramienta de IA para trabajo crítico.

Antes de confiar en cualquier benchmark que una empresa publique sobre sí misma, vale la pena preguntarse: ¿hay una evaluación de un tercero independiente que confirme esos números?

Leer en la fuente: MarkTechPost / Sakana AI ↗

¿Quieres usar estas herramientas? Mira las reseñas sin filtro o vuelve a las noticias.