3 de septiembre de 2026 · Anthropic
Los investigadores automatizados de IA pueden mitigar fallos de alineación de forma confiable
Mi opinión: Anthropic publicó un estudio en el que sistemas de IA actuaron como investigadores de seguridad autónomos: buscaron literatura existente, propusieron correcciones y evaluaron sus propios resultados sobre 10 categorías de comportamiento indeseable en modelos de IA. El resultado más notable es que los mejores métodos de estos "investigadores automatizados" superaron en promedio las propuestas de investigadores humanos con experiencia, a un costo de $4 por hora frente a los $150 que cuesta un investigador humano.
Esto no significa que los modelos puedan supervisarse a sí mismos de forma autónoma: el estudio fue en un entorno controlado y sobre categorías específicas. Pero apunta en una dirección relevante para cualquier organización que dependa de IA: parte del trabajo de hacer los modelos más seguros y confiables podría automatizarse con el tiempo, acelerando el ciclo de mejora.
Si usas IA en tu negocio o tus productos, ¿sabes cómo el fabricante del modelo está trabajando para hacer esos sistemas más seguros y alineados con lo que realmente necesitas?
¿Quieres usar estas herramientas? Mira las reseñas sin filtro o vuelve a las noticias.