Возможно ли согласование ИИ?
Reducing Suffering
Abstract
Проблема согласования ИИ, которую часто определяют как задачу приведения развитого ИИ в соответствие с человеческими желаниями, сталкивается с двумя ключевыми трудностями. Во-первых, человеческие ценности не являются монолитными; по фундаментальным этическим вопросам существуют существенные, зачастую непримиримые разногласия, что исключает возможность создания единой функции ценности ИИ, которая бы соответствовала всем человеческим предпочтениям. Во-вторых, даже если сосредоточиться на предпочтениях одного конкретного человека, точно предсказать его желаемые действия в будущих, потенциально новых сценариях крайне проблематично. Системы человеческих ценностей, являющиеся неизбежно упрощенными представлениями сложного мира, не обладают достаточной информацией, чтобы предложить окончательные решения для всех будущих моральных дилемм. Эти ограничения становятся более заметными при экстраполяции ценностей на незнакомые будущие контексты. Поэтому при согласовании ИИ, вместо стремления к идеальному воспроизведению ценностей, следует сосредоточиться на внедрении широко приемлемых мер безопасности и механизмов, отражающих компромисс между разнообразными человеческими ценностями, с учетом неотъемлемой неточности в долгосрочной экстраполяции ценностей. – Аннотация, сгенерированная ИИ.