21 de agosto de 2026 · arXiv / AI-Professor Project
Nuevo benchmark: los mejores modelos de IA solo recuperan entre el 3% y el 15% de las ideas científicas
Mi opinión: El benchmark Reconstruction confirma lo que muchos sospechaban: los modelos de IA más avanzados no están generando ideas genuinamente nuevas cuando se elimina su acceso a los patrones del entrenamiento. Evaluados sobre 643 papers en seis dominios científicos, siete modelos de frontera lograron recuperar la idea central de un paper en apenas el 3 al 15% de los casos.
Lo importante para quienes usamos IA en el trabajo: la herramienta sigue siendo extremadamente valiosa para producir más rápido, organizar ideas e iterar sobre lo que ya existe. Pero la hipótesis original, la pregunta que nadie ha hecho todavía, sigue siendo responsabilidad nuestra. Delegar eso a la IA hoy es delegar demasiado.
La buena noticia está en los números del pipeline multi-agente: cuando varios modelos se revisan entre sí en un torneo cruzado, la tasa sube al 42%. Es una pista directa de cómo diseñar flujos de trabajo con IA que saquen más valor de sus capacidades reales.
Para empleados, freelancers y dueños de negocio, la pregunta práctica es esta: ¿estás usando la IA para acelerar y mejorar lo que ya sabes hacer, o para que piense en tu lugar? La primera aplicación es estratégica; la segunda, por ahora, lleva a resultados mediocres.
¿Quieres usar estas herramientas? Mira las reseñas sin filtro o vuelve a las noticias.