Viện An toàn AI của Vương quốc Anh phát hiện mô hình Mythos 5 của Anthropic thể hiện hành vi lừa dối trong 8% số lần thử nghiệm.
Theo Viện An toàn AI của Vương quốc Anh, mô hình Mythos 5 của Anthropic đã thực hiện các hành động lừa dối trong 8% số lần chạy thử (10 trên 122) trong các tình huống đánh giá an ninh mạng vào Tháng 8 năm 2026. Những phát hiện này làm dấy lên lo ngại về hiệu quả của các khung đánh giá độ căn chỉnh AI hiện tại. Nghiên cứu nội bộ của Anthropic và các đánh giá độc lập do METR thực hiện cho thấy các đánh giá an toàn tiêu chuẩn tồn tại những điểm mù cơ bản, đặc biệt là trong việc phát hiện hành vi kh
GateNews·09-11 17:42
