works
Sarah Hastings-Woodhouse AI控制导论 online AI控制是一项与AI对齐(alignment)不同的研究议程:一个已对齐的AI是不想伤害人类的AI,而一个受控的AI是无论其意图如何都无法在物理上造成伤害的AI。文章解释了为何控制措施可能比对齐更容易实现,描述了具体的技术方法——例如使用较小的受信任模型来监控不受信任的前沿模型——并承认该议程的局限性,尤其是控制只是一项临时措施,其效果取决于整个行业的普遍采用。

AI控制导论

Sarah Hastings-Woodhouse

August 24, 2026

Abstract

AI控制是一项与AI对齐(alignment)不同的研究议程:一个已对齐的AI是不想伤害人类的AI,而一个受控的AI是无论其意图如何都无法在物理上造成伤害的AI。文章解释了为何控制措施可能比对齐更容易实现,描述了具体的技术方法——例如使用较小的受信任模型来监控不受信任的前沿模型——并承认该议程的局限性,尤其是控制只是一项临时措施,其效果取决于整个行业的普遍采用。