works
Rational Animations Как согласовать ИИ: положите его в сэндвич online Введение в проблему масштабируемого надзора: как согласовывать системы ИИ, чьи выходные данные слишком сложно оценивать людям напрямую — либо потому, что оценка слишком трудозатратна, либо потому, что ИИ качественно умнее нас. В видео представлено предложение «сэндвича» Аджеи Котры — попросить неспециалистов согласовать модель, которая умнее их, но менее умна, чем группа экспертов, — и описан базовый экспериментальный тест этой идеи в статье Сэма Боумена и др. «Measuring Progress on Scalable Oversight for Large Language Models».

Как согласовать ИИ: положите его в сэндвич

Rational Animations

August 3, 2026

Abstract

Введение в проблему масштабируемого надзора: как согласовывать системы ИИ, чьи выходные данные слишком сложно оценивать людям напрямую — либо потому, что оценка слишком трудозатратна, либо потому, что ИИ качественно умнее нас. В видео представлено предложение «сэндвича» Аджеи Котры — попросить неспециалистов согласовать модель, которая умнее их, но менее умна, чем группа экспертов, — и описан базовый экспериментальный тест этой идеи в статье Сэма Боумена и др. «Measuring Progress on Scalable Oversight for Large Language Models».