Hay personas que cambian la IA desde los titulares, y hay personas que la cambian desde las matemáticas. John Schulman pertenece al segundo grupo. Físico de formación (Caltech, 2010) y doctor en ingeniería computacional por Berkeley (2016), pasó sus primeros años de investigador obsesionado con una pregunta que parecía casi filosófica: cómo hacer que un sistema de IA aprenda de la retroalimentación humana de forma estable y eficiente, sin que las actualizaciones lo desestabilicen.
En 2015, siendo uno de los seis cofundadores originales de OpenAI, publicó TRPO (Trust Region Policy Optimization), un algoritmo que por primera vez garantizaba que cada actualización de una red neuronal de refuerzo no "rompa" lo que ya había aprendido. Dos años después, en 2017, llegó PPO (Proximal Policy Optimization): más simple, más robusto, igual de poderoso. PPO se convirtió rápidamente en el método por defecto de todo el campo y, más importante, fue el motor detrás del RLHF (aprendizaje por refuerzo con retroalimentación humana) que le da a ChatGPT, a Claude y a prácticamente todos los asistentes de IA modernos su capacidad de seguir instrucciones, ser útiles y no descontrolarse. Cuando le escribes a una IA y te responde de forma coherente y alineada con lo que pediste, hay un pedacito de PPO trabajando debajo de la pantalla.
En OpenAI durante casi nueve años lideró el equipo de post-entrenamiento de los modelos más importantes: GPT-4, GPT-4o y ChatGPT. En agosto de 2024, dejó la empresa que cofundó para unirse a Anthropic con el objetivo de enfocarse más de cerca en el problema de la alineación de IA, ese desafío central de hacer que los sistemas de IA sean seguros y genuinamente beneficiosos. La estadía fue breve: en febrero de 2025 se sumó a Thinking Machines Lab, la nueva empresa de Mira Murati, como Chief Scientist.
La lección que me deja John Schulman es sutil pero poderosa: a veces la contribución más transformadora no es la que aparece en la portada de una revista, sino la que resuelve un problema técnico concreto que habilita todo lo demás. PPO no es famoso fuera del campo, pero sin él el camino hacia la IA conversacional que usamos hoy sería mucho más accidentado. Cada vez que Claude te da una respuesta que parece entender exactamente lo que necesitabas, está usando, en algún nivel, el trabajo paciente de este físico convertido en pionero del aprendizaje por refuerzo.
Enlaces oficiales de John Schulman, El arquitecto del aprendizaje por refuerzo humano
Más figuras que moldearon la IA en Leyendas de la IA, o vuelve a las noticias.