MIT CSAIL: Chỉ khen thưởng câu trả lời đúng khiến mô hình suy luận quá tự tin; phương pháp mới cải thiện ước tính mức độ không chắc chắn

Thông điệp AIMPACT, ngày 26 tháng 4 (UTC+8): nghiên cứu của MIT CSAIL phát hiện rằng các mô hình suy luận hàng đầu, trong quá trình huấn luyện tăng cường bằng học, trở nên quá tự tin vì chỉ được thưởng cho các câu trả lời đúng mà không xem xét mức độ tin cậy. Nhóm nghiên cứu đề xuất một phương pháp mới: huấn luyện để mô hình ước tính mức độ tin cậy cho từng đáp án, từ đó cải thiện đáng kể năng lực ước tính sự không chắc chắn mà không làm suy giảm độ chính xác. Nghiên cứu này chỉ ra một khiếm khuyết then chốt trong cơ chế huấn luyện tăng cường bằng học hiện tại và đưa ra hướng cải tiến hiệu quả. (Nguồn: InFoQ)
Xem bản gốc
Trang này có thể chứa nội dung của bên thứ ba, được cung cấp chỉ nhằm mục đích thông tin (không phải là tuyên bố/bảo đảm) và không được coi là sự chứng thực cho quan điểm của Gate hoặc là lời khuyên về tài chính hoặc chuyên môn. Xem Tuyên bố từ chối trách nhiệm để biết chi tiết.
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Bình luận
Thêm một bình luận
Thêm một bình luận
Không có bình luận
  • Đã ghim