MIT CSAIL: Solo premiar las respuestas correctas hace que los modelos de razonamiento sean excesivamente confiados; un nuevo método mejora la estimación de la incertidumbre

Mensaje de AIMPACT, 26 de abril (UTC+8). Investigadores del MIT CSAIL descubrieron que los modelos de inferencia líderes se vuelven excesivamente confiados durante el entrenamiento por refuerzo debido a que solo se recompensa la respuesta correcta y no se tiene en cuenta la confianza. El equipo de investigación propuso un nuevo método para entrenar al modelo a estimar la confianza de cada respuesta, mejorando de forma significativa la capacidad de estimar la incertidumbre sin afectar la precisión. El trabajo revela una falla clave en los mecanismos actuales del entrenamiento por refuerzo y propone direcciones de mejora efectivas. (Fuente: InFoQ)
Ver original
Esta página puede contener contenido de terceros, que se proporciona únicamente con fines informativos (sin garantías ni declaraciones) y no debe considerarse como un respaldo por parte de Gate a las opiniones expresadas ni como asesoramiento financiero o profesional. Consulte el Descargo de responsabilidad para obtener más detalles.
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Comentar
Añadir un comentario
Añadir un comentario
Sin comentarios
  • Fijado