超级智能体带来灾难性风险:“科学家AI”能否提供一条更安全的路径?
超级智能体带来灾难性风险:“科学家AI”能否提供一条更安全的路径?, 2026
Abstract
领先的AI公司正越来越专注于构建通用型AI智能体——能够在人类可执行的几乎所有任务中自主规划、行动并追求目标的系统。尽管这类系统可能极为有用,但不受约束的AI能动性会给公共安全带来重大风险,从恶意行为者的滥用,到人类控制权可能不可逆转的丧失。作者讨论了这些风险如何源于当前的AI训练方法。事实上,多种情景与实验已表明,AI智能体有可能实施欺骗,或追求人类操作者未曾设定、且与人类利益相冲突的目标,例如自我保存。基于预防原则,作者认为亟需为当前以能动性为导向的发展路径寻找更安全但同样有用的替代方案。为此,他们提出将开发一种在设计上即可信且安全的非能动性AI系统作为后续进展的核心基石,并称之为“科学家AI”(Scientist AI)。该系统旨在依据观察来解释世界,而非在世界中采取行动以模仿或取悦人类。它由一个生成理论以解释数据的世界模型和一个问答推理机构成。两个组件都以显式的不确定性概念运作,以降低过度自信预测的风险。有鉴于此,“科学家AI”可用于协助人类研究者加速科学进步,包括AI安全领域的进步。特别地,该系统可作为防护栏,用以应对那些尽管存在风险仍可能被创造出来的AI智能体。归根结底,专注于非能动性AI或许能在获得AI创新收益的同时,规避当前发展路径所带来的风险。作者希望这些论证能促使研究者、开发者和政策制定者选择这条更安全的道路。