Lo último en IA, cada díaNoticias IA
Andrew Barto

Leyenda de la IA · Investigador · Universidad de Massachusetts Amherst

Andrew Barto

El arquitecto del aprendizaje por refuerzo

8 de agosto de 2026

Cuando Andrew Barto llegó a la Universidad de Massachusetts Amherst en 1977, la inteligencia artificial estaba obsesionada con las reglas: si pasa A, haz B. El enfoque dominante era escribir, a mano, todo el conocimiento que una maquina necesitaba. Barto tenia otra idea, más humilde y más profunda a la vez: ¿y si le enseñabamos a la maquina a aprender por si sola, igual que lo hacen los animales, con premios y castigos? La mayoría de sus colegas no estaban convencidos. Él siguió de todas formas.

A lo largo de los años 80, junto a su entonces estudiante Richard Sutton, Barto sentó las bases matemáticas del aprendizaje por refuerzo (RL, por sus siglas en inglés). Su contribución más influyente fue el aprendizaje de diferencias temporales (temporal difference learning, TD), publicado en 1988: un algoritmo que permite a un agente actualizar sus predicciones sobre el futuro a medida que va acumulando experiencia, sin esperar al resultado final. En 1981 ya habian demostrado que este mecanismo podía explicar comportamientos de aprendizaje que los modelos existentes no podian; en 1995, un estudio neurocientifico confirmó que las neuronas de dopamina del cerebro humano funcionan exactamente con esa lógica. Lo que Barto formuló en ecuaciones, la naturaleza ya lo habia inventado millones de años antes.

Con Sutton escribió en 1998 el libro de referencia del campo: "Reinforcement Learning: An Introduction" (MIT Press), citado más de 75,000 veces y todavia el texto estándar en universidades de todo el mundo. Ese trabajo, junto con los métodos de gradiente de política (policy gradient) que también ayudó a desarrollar, es la columna vertebral de sistemas como AlphaGo (DeepMind, 2016), que venció al campeón mundial de Go, y de los algoritmos de alineamiento con feedback humano que hacen posible modelos como ChatGPT o Claude. En marzo de 2025, la ACM le otorgó el Premio Turing 2024, el "Nobel de la computación", compartido con Sutton, reconociendo que sus ideas de hace cuatro décadas son el motor oculto de la IA de hoy.

Lo que más me gusta de la historia de Barto no es el Premio Turing (aunque bien merecido). Es que pasó décadas haciendo una investigación básica, sin garantías de aplicación, convencido de que entender cómo aprenden los seres vivos era la clave para construir maquinas más inteligentes. Tenía razón. Cada vez que usas una IA que mejora con el uso, que ajusta sus respuestas según tu feedback, que aprende de sus propios errores, hay un eco de su trabajo ahí dentro. Y si te quedas con algo de esta leyenda, que sea esto: las ideas más poderosas suelen parecer demasiado simples al principio.


Más figuras que moldearon la IA en Leyendas de la IA, o vuelve a las noticias.