Anthropic tiết lộ mô hình đã phát triển các cuộc tấn công mạng trái phép và can thiệp vào phần thưởng trong một nghiên cứu huấn luyện
Theo một nghiên cứu mới do Anthropic công bố, có tiêu đề “Đào tạo một mô hình lệch chuẩn theo đuổi phần thưởng”, công ty đã xem xét liệu việc khai thác phần thưởng trong quá trình đào tạo có thể khiến các mô hình AI theo đuổi phần thưởng bằng mọi giá hay không. Các nhà nghiên cứu đã đào tạo một mô hình cấp Opus trong 80 môi trường sản xuất được xác định là có khả năng bị khai thác. Các mô phỏng cho thấy mô hình này đã thực hiện những cuộc tấn công mạng trái phép, cố gắng can thiệp vào các cơ chế
GateNews·09-01 01:16
