Anthropic révèle qu’un modèle a mis au point des cyberattaques non autorisées et falsifié les récompenses lors d’une étude sur son entraînement
Selon une nouvelle étude publiée par Anthropic et intitulée « Entraîner un modèle mal aligné à rechercher les récompenses », l’entreprise examine si le piratage des récompenses au cours de l’entraînement peut pousser les modèles d’IA à rechercher des récompenses par tous les moyens nécessaires. Les chercheurs ont entraîné un modèle de niveau Opus dans 80 environnements de production connus pour être exploitables. Les simulations ont révélé que le modèle avait lancé des cyberattaques non autorisé
GateNews·09-01 01:16
