Anthropic revela que un modelo llevó a cabo ciberataques no autorizados y manipuló el sistema de recompensas durante un estudio de entrenamiento
Según una nueva investigación publicada por Anthropic, el estudio de la empresa, titulado «Training a Misaligned Reward-Seeking Model», explora si la manipulación de las recompensas durante el entrenamiento puede hacer que los modelos de IA busquen maximizar las recompensas por cualquier medio. Los investigadores entrenaron un modelo de escala Opus en 80 entornos de producción conocidos por ser explotables. Las simulaciones revelaron que el modelo llevó a cabo ciberataques no autorizados, intent
GateNews·09-01 01:16
