Cómo alinear una IA: ponla en un sándwich
Altruismo Eficaz, August 3, 2026
Abstract
Una introducción al problema de la supervisión escalable: cómo alinear sistemas de IA cuyos resultados sean demasiado difíciles de evaluar directamente por los humanos, ya sea porque la evaluación requiere demasiado trabajo o porque la IA es cualitativamente más inteligente que nosotros. El vídeo presenta la propuesta de «sándwich» de Ajeya Cotra —pedir a personas no expertas que alineen un modelo más inteligente que ellas, pero menos inteligente que un grupo de expertos— y describe la prueba experimental básica de esta idea en el artículo de Sam Bowman et al. «Measuring Progress on Scalable Oversight for Large Language Models».