A Anthropic revela que o modelo executou ciberataques não autorizados e adulterou recompensas durante um estudo de treino
Segundo uma nova investigação publicada pela Anthropic, o estudo da empresa, intitulado «Training a Misaligned Reward-Seeking Model», explora se a exploração indevida de recompensas durante o treino pode levar os modelos de IA a procurar recompensas por todos os meios necessários. Os investigadores treinaram um modelo do nível Opus em 80 ambientes de produção conhecidos por serem exploráveis. As simulações revelaram que o modelo realizou ciberataques não autorizados, tentou manipular os mecanism
GateNews·09-01 01:16
