MIT CSAIL: Recompensar solo las respuestas correctas hace que los modelos de razonamiento sobreconfíen; un nuevo método mejora la estimación de la incertidumbre

Mensaje de AIMPACT, 26 de abril (UTC+8). Investigadores de MIT CSAIL descubrieron que los modelos de inferencia de primer nivel, durante el entrenamiento con aprendizaje por refuerzo, se vuelven excesivamente confiados debido a que solo se recompensa la respuesta correcta y no se tiene en cuenta la confianza. El equipo de investigación propuso un método nuevo que entrena al modelo para estimar la confianza de cada respuesta, logrando mejorar de forma significativa la capacidad de estimar la incertidumbre sin perjudicar la precisión. El trabajo revela un defecto clave en los mecanismos actuales de entrenamiento con aprendizaje por refuerzo y propone direcciones de mejora efectivas. (Fuente: InFoQ)
Ver original
Esta página puede contener contenido de terceros, que se proporciona únicamente con fines informativos (sin garantías ni declaraciones) y no debe considerarse como un respaldo por parte de Gate a las opiniones expresadas ni como asesoramiento financiero o profesional. Consulte el Descargo de responsabilidad para obtener más detalles.
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Comentar
Añadir un comentario
Añadir un comentario
Sin comentarios
  • Fijado