MIT CSAIL : récompenser uniquement les réponses correctes pousse le modèle de raisonnement à être trop sûr de lui ; une nouvelle méthode améliore l’estimation de l’incertitude

Message AIMPACT, le 26 avril (UTC+8) : des chercheurs du MIT CSAIL ont constaté que, lors de l’entraînement par renforcement, les modèles d’inférence de pointe deviennent trop confiants car ils ne sont récompensés que pour les réponses correctes, sans prendre en compte la confiance. L’équipe de recherche propose une nouvelle méthode : entraîner le modèle à estimer la confiance pour chaque réponse, tout en améliorant de manière significative la capacité d’estimation de l’incertitude, sans dégrader la précision. Cette étude met en évidence un défaut majeur des mécanismes actuels d’entraînement par renforcement et propose des pistes d’amélioration efficaces. (Source : InFoQ)
Voir l'original
Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.
  • Récompense
  • Commentaire
  • Reposter
  • Partager
Commentaire
Ajouter un commentaire
Ajouter un commentaire
Aucun commentaire
  • Épinglé