Hay personas que cambian la historia de un campo desde adentro, trabajando con disciplina en una idea que el resto del mundo todavía no ve. Richard S. Sutton es una de ellas. Investigador canadiense de ciencias de la computación, pasó gran parte de su carrera construyendo los cimientos de lo que hoy llamamos aprendizaje por refuerzo: la rama de la IA que le enseña a una máquina a aprender por prueba y error, tal como aprende un humano cuando juega, conduce o negocia. En los años 80 y 90, ese enfoque no era el favorito del campo. La corriente dominante apostaba por sistemas basados en lógica y reglas escritas por expertos. Sutton apostó por otro camino: dejar que la máquina aprendiera de su propia experiencia, recompensando lo que funciona y corrigiendo lo que no.
En 1988 publicó el paper "Learning to Predict by the Methods of Temporal Differences", donde formalizó el TD-learning (aprendizaje por diferencias temporales): un mecanismo que permite a un sistema ajustar sus predicciones poco a poco, evaluando cada decisión con el beneficio de lo que sucedió después. Junto a su colega Andrew Barto, construyó el libro de texto fundacional del campo: "Reinforcement Learning: An Introduction" (primera edición, 1998), que hoy usan investigadores y equipos de IA en todo el mundo. Y en 2019 publicó "The Bitter Lesson" ("La lección amarga"), un breve ensayo que sacudió a la comunidad: en él argumenta que 70 años de investigación en IA demuestran que los métodos generales que aprovechan el poder de la computación siempre superan, a largo plazo, a los que tratan de codificar el conocimiento humano. Fue incómodo de leer. También fue correcto.
Sutton hizo su doctorado en la Universidad de Massachusetts Amherst (1984) y, tras años en laboratorios de investigación privados, se convirtió en profesor en la Universidad de Alberta, donde fundó el laboratorio RLAI (Reinforcement Learning and Artificial Intelligence). Los reconocimientos acumulados hablan solos: Fellow de la AAAI desde 2001, Fellow de la Royal Society of Canada en 2016, Fellow de la Royal Society de Londres en 2021. Y en 2024, la ACM le otorgó el A.M. Turing Award, el mayor premio en ciencias de la computación, junto a Andrew Barto, por "desarrollar los fundamentos conceptuales y algorítmicos del aprendizaje por refuerzo". El Turing viene con un millón de dólares y, en este caso, con décadas de razón.
La lección de Sutton no es solo técnica: es una invitación a la humildad intelectual. Su "Bitter Lesson" dice, en el fondo, que nuestras intuiciones sobre cómo funciona la inteligencia pueden ser más un obstáculo que una guía. Dejar que los datos, la experiencia y el cómputo hablen, en lugar de imponer lo que creemos saber, es exactamente la disposición que necesitamos para usar bien las herramientas de IA que tenemos hoy. Cada vez que un sistema aprende de sus propios errores, ya sea un robot, un jugador de ajedrez o un modelo de lenguaje que mejora con retroalimentación, hay un hilo invisible que lleva hasta ese investigador canadiense que eligió confiar en la experiencia cuando casi nadie lo hacía.
Enlaces oficiales de Richard S. Sutton, El padre del aprendizaje por refuerzo
Más figuras que moldearon la IA en Leyendas de la IA, o vuelve a las noticias.