Суперинтеллектуальные агенты создают риски катастрофы: может ли «ИИ-учёный» предложить более безопасный путь?
Суперинтеллектуальные агенты создают риски катастрофы: может ли «ИИ-учёный» предложить более безопасный путь?, 2026
Abstract
Ведущие компании в области ИИ всё активнее занимаются созданием универсальных ИИ-агентов — систем, способных автономно планировать, действовать и достигать целей почти во всех задачах, которые под силу человеку. Какими бы полезными ни были такие системы, неконтролируемая агентность ИИ создаёт значительные риски для общественной безопасности: от злоупотреблений со стороны злоумышленников до потенциально необратимой утраты человеческого контроля. Авторы показывают, как эти риски возникают из современных методов обучения ИИ. Различные сценарии и эксперименты уже продемонстрировали возможность того, что ИИ-агенты прибегают к обману или преследуют цели, не заданные людьми-операторами и противоречащие человеческим интересам, — например самосохранение. Руководствуясь принципом предосторожности, авторы видят острую потребность в более безопасных, но по-прежнему полезных альтернативах нынешней траектории, ориентированной на агентность. В связи с этим они предлагают в качестве основного строительного блока дальнейшего прогресса разработку неагентной системы ИИ, надёжной и безопасной по самому своему устройству, которую называют «ИИ-учёный» (Scientist AI). Эта система предназначена для объяснения мира на основе наблюдений, а не для действий в нём с целью подражания людям или угождения им. Она состоит из модели мира, порождающей теории для объяснения данных, и машины вывода, отвечающей на вопросы. Оба компонента работают с явным представлением о неопределённости, что снижает риск чрезмерно самоуверенных предсказаний. С учётом этого «ИИ-учёный» мог бы помогать исследователям ускорять научный прогресс, в том числе в области безопасности ИИ. В частности, такую систему можно использовать как защитный барьер против ИИ-агентов, которые могут быть созданы вопреки связанным с ними рискам. В конечном счёте ставка на неагентный ИИ способна дать выгоды от инноваций в области ИИ, избежав рисков нынешней траектории. Авторы надеются, что эти аргументы побудят исследователей, разработчиков и политиков предпочесть этот более безопасный путь.