Cuando los grandes laboratorios de IA competían por ver quién hacía el modelo más impresionante, Percy Liang se hizo una pregunta distinta: ¿cómo sabemos si realmente funciona? Investigador chino-americano, profesor en Stanford y director del Center for Research on Foundation Models (CRFM), Liang lleva más de una década mirando la inteligencia artificial desde el ángulo que menos glamour tiene y más falta hace: el de la evaluación honesta y rigurosa.
En 2022 presentó HELM (Holistic Evaluation of Language Models), el primer marco sistemático para medir los modelos de lenguaje de forma integral. Antes de HELM, los laboratorios elegían los benchmarks donde sus modelos se veían mejor y el resto del mundo tenía que creerles. HELM cambió las reglas: definió 42 escenarios de aplicación real, siete tipos de métricas (precisión, calibración, robustez, equidad, toxicidad, sesgo y eficiencia) y evaluó más de 30 modelos de diez organizaciones al mismo tiempo. Era transparencia forzada, en un campo que no siempre quiere ser transparente. Antes de eso, en 2016, su equipo creó SQuAD (Stanford Question Answering Dataset), el conjunto de datos que se convirtió en el estándar para medir si un modelo puede leer un texto y responder preguntas sobre él, y que impulsó años de avances en comprensión del lenguaje.
El campo lo ha reconocido en múltiples formas: recibió el IJCAI Computers and Thought Award en 2016, una Sloan Research Fellowship en 2015, una Microsoft Research Faculty Fellowship en 2014, un NSF CAREER Award y el Presidential Early Career Award for Scientists and Engineers (PECASE) en 2019. También cofundó Together AI, la plataforma que lleva los mejores modelos de código abierto a la práctica para que cualquier empresa pueda usarlos. Liang hizo su B.S. y M.Eng. en el MIT (2004-2005) y su doctorado en UC Berkeley (2011), bajo la dirección de Michael Jordan y Dan Klein.
Para mí, la lección de Percy Liang es sobre integridad intelectual. En una industria donde todos quieren construir el próximo ChatGPT, él prefiere hacer las preguntas incómodas: ¿funciona de verdad? ¿para quién? ¿con qué sesgos? No hay IA responsable sin alguien dispuesto a medir con honestidad. Cada vez que usas un modelo de lenguaje, parte de lo que lo hace confiable es el tipo de trabajo que Liang ha empujado durante años, callado y constante, desde Stanford.
Enlaces oficiales de Percy Liang, El hombre que le puso un espejo a la IA
Más figuras que moldearon la IA en Leyendas de la IA, o vuelve a las noticias.