En 2014, un investigador coreano de 28 años que trabajaba como posdoctoral en Montreal publicó dos papers que nadie esperaba, y que cambiaron todo. Kyunghyun Cho no era un nombre conocido entonces, pero los modelos que creó ese año viven dentro de cada aplicación de inteligencia artificial que usas hoy: los traductores automáticos, los asistentes de texto, los modelos de lenguaje. Todo parte, en algún lugar, de lo que él hizo ese año junto a sus colaboradores en el laboratorio de Yoshua Bengio.
El primer paper, presentado en EMNLP 2014, introdujo el modelo RNN encoder-decoder y creó las Gated Recurrent Units (GRUs), una arquitectura que permitía que una red neuronal procesara secuencias de texto de longitud variable, comprimiéndolas en un vector y reconstruyéndolas en otro idioma. Era la base de la traducción automática neuronal. Pero el segundo paper fue el que encendió la mecha: "Neural Machine Translation by Jointly Learning to Align and Translate", escrito junto a Dzmitry Bahdanau y Yoshua Bengio, introdujo el mecanismo de atención. En lugar de obligar a la red a comprimir toda una oración en un solo vector, le permitió mirar hacia atrás, buscar qué parte de la frase original era relevante para cada palabra que generaba. Era una idea que parecía obvia en retrospectiva, y que nadie había formalizado así antes.
Cho es hoy Glen de Vries Professor of Health Statistics en el Courant Institute de NYU, donde también es profesor de Computer Science and Data Science. Su carrera pasó por Aalto University en Finlandia (donde obtuvo su doctorado en 2014), por el laboratorio de Bengio en Montreal, y por Facebook AI Research, donde fue Research Scientist entre 2017 y 2020. Ha recibido el Premio Ho-Am de Ingeniería (2021, uno de los más importantes de Corea), el CIFAR Azrieli Global Scholar Award (2017), y un ICML Best Paper Award (2019). En 2024 recibió el Outstanding Paper Award de ICLR por trabajo en descubrimiento de proteínas con ML.
Lo que me parece fascinante de Cho es que su contribución más grande fue conceptual: no fue el primero en hacer redes neuronales más grandes, fue el que hizo que las redes miraran mejor. La atención que él formalizó en 2014 es el corazón del mecanismo que Vaswani y otros convertirían en el Transformer en 2017, el mismo que da vida a GPT, Claude, Gemini y todo lo que vino después. Cada vez que un modelo de lenguaje entiende el contexto de una frase larga, hay algo de esa idea de Cho funcionando debajo. Eso es lo que hace a un investigador una leyenda: no siempre es el más famoso, sino el que abre la puerta que todos los demás necesitaban cruzar.
Enlaces oficiales de Kyunghyun Cho, El hombre que le enseñó a la IA a prestar atención
Más figuras que moldearon la IA en Leyendas de la IA, o vuelve a las noticias.