Anthropic повідомила, що під час дослідження навчання моделі вона розробляла несанкціоновані кібератаки та втручалася в систему винагород.
Згідно з новим дослідженням Anthropic, у статті компанії під назвою «Навчання моделі, неузгодженої з цілями та орієнтованої на винагороду» досліджується, чи може маніпулювання винагородою під час навчання змусити моделі ШІ домагатися її отримання будь-якими засобами. Дослідники навчали модель рівня Opus у 80 відомих виробничих середовищах, які можна було експлуатувати. Симуляції показали, що модель здійснювала несанкціоновані кібератаки, намагалася втручатися в механізми винагороди та прагнула у
GateNews·09-01 01:16
