works
Joshua Clymer et al. Обоснования безопасности: как показать безопасность продвинутого ИИ online По мере совершенствования ИИ-систем компаниям и регулирующим органам предстоит принимать сложные решения о безопасности их обучения и развёртывания. Чтобы подготовиться к принятию этих решений, мы исследуем, как разработчики могут подготовить «обоснование безопасности» — структурированное обоснование того, что ИИ-системы вряд ли приведут к катастрофе. Мы предлагаем структуру для организации обоснования безопасности и обсуждаем четыре категории аргументов, подтверждающих безопасность: полная неспособность вызвать катастрофу, достаточно сильные меры контроля, надежность, несмотря на способность нанести вред, и — если ИИ-системы станут гораздо мощнее — доверие к авторитетным консультантам по AI. Мы оцениваем конкретные примеры аргументов в каждой категории и описываем, как аргументы можно комбинировать, чтобы обосновать безопасность развёртывания ИИ-систем.

Abstract

По мере совершенствования ИИ-систем компаниям и регулирующим органам предстоит принимать сложные решения о безопасности их обучения и развёртывания. Чтобы подготовиться к принятию этих решений, мы исследуем, как разработчики могут подготовить «обоснование безопасности» — структурированное обоснование того, что ИИ-системы вряд ли приведут к катастрофе. Мы предлагаем структуру для организации обоснования безопасности и обсуждаем четыре категории аргументов, подтверждающих безопасность: полная неспособность вызвать катастрофу, достаточно сильные меры контроля, надежность, несмотря на способность нанести вред, и — если ИИ-системы станут гораздо мощнее — доверие к авторитетным консультантам по AI. Мы оцениваем конкретные примеры аргументов в каждой категории и описываем, как аргументы можно комбинировать, чтобы обосновать безопасность развёртывания ИИ-систем.