works
Rational Animations Manipulación de especificaciones: cómo la IA puede volver tus deseos en tu contra online Una continuación de «La complejidad oculta de los deseos» que analiza la manipulación de especificaciones en el aprendizaje automático —situaciones en las que un sistema cumple con la especificación literal de un objetivo sin producir el resultado deseado—. El vídeo repasa ejemplos reales y los conceptos relacionados, como la especificación errónea de la recompensa, la manipulación de la recompensa, la desalineación externa y la ley de Goodhart, y muestra por qué definir correctamente lo que esperamos de los sistemas de IA es un problema fundamental para la seguridad de la IA.

Abstract

Una continuación de «La complejidad oculta de los deseos» que analiza la manipulación de especificaciones en el aprendizaje automático —situaciones en las que un sistema cumple con la especificación literal de un objetivo sin producir el resultado deseado—. El vídeo repasa ejemplos reales y los conceptos relacionados, como la especificación errónea de la recompensa, la manipulación de la recompensa, la desalineación externa y la ley de Goodhart, y muestra por qué definir correctamente lo que esperamos de los sistemas de IA es un problema fundamental para la seguridad de la IA.