MIT CSAIL: Hanya memberi hadiah untuk jawaban yang benar membuat model penalaran terlalu percaya diri, metode baru meningkatkan estimasi ketidakpastian

AIMPACT, 26 April (UTC+8): Penelitian dari MIT CSAIL menemukan bahwa model inferensi tingkat teratas menjadi terlalu percaya diri saat pelatihan penguatan (reinforcement learning) hanya memberi imbalan pada jawaban yang benar tanpa mempertimbangkan tingkat kepercayaan. Tim peneliti mengajukan metode baru untuk melatih model memperkirakan tingkat kepercayaan untuk setiap jawaban, sehingga secara signifikan meningkatkan kemampuan estimasi ketidakpastian tanpa mengorbankan akurasi. Studi ini mengungkap kelemahan penting pada mekanisme pelatihan reinforcement learning saat ini serta menawarkan arah perbaikan yang efektif. (Sumber: InFoQ)
Lihat Asli
Halaman ini mungkin berisi konten pihak ketiga, yang disediakan untuk tujuan informasi saja (bukan pernyataan/jaminan) dan tidak boleh dianggap sebagai dukungan terhadap pandangannya oleh Gate, atau sebagai nasihat keuangan atau profesional. Lihat Penafian untuk detailnya.
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
Komentar
Tambahkan komentar
Tambahkan komentar
Tidak ada komentar
  • Disematkan