معهد MIT CSAIL: إن الاقتصار على مكافأة الإجابات الصحيحة يجعل نماذج الاستدلال شديدة الثقة، وطريقة جديدة تعزز تقدير عدم اليقين

رسالة AIMPACT، 26 أبريل (التوقيت العالمي المنسق +8)، كشفت أبحاث من MIT CSAIL أن نماذج الاستدلال الرائدة تصبح مفرطة في الثقة أثناء تدريب التعلم المعزز، وذلك بسبب منح مكافأة للإجابات الصحيحة فقط دون مراعاة مستوى الثقة. واقترحت مجموعة البحث طريقة جديدة تقوم بتدريب النموذج على تقدير درجة ثقة كل إجابة، مما يعزز بشكل ملحوظ قدرته على تقدير عدم اليقين دون الإضرار بالدقة. وتسلط هذه الدراسة الضوء على عيب جوهري في آليات التدريب الحالية للتعلم المعزز، وتقدم مسارات تحسين فعّالة. (المصدر: InFoQ)
شاهد النسخة الأصلية
قد تحتوي هذه الصفحة على محتوى من جهات خارجية، يتم تقديمه لأغراض إعلامية فقط (وليس كإقرارات/ضمانات)، ولا ينبغي اعتباره موافقة على آرائه من قبل Gate، ولا بمثابة نصيحة مالية أو مهنية. انظر إلى إخلاء المسؤولية للحصول على التفاصيل.
  • أعجبني
  • تعليق
  • إعادة النشر
  • مشاركة
تعليق
إضافة تعليق
إضافة تعليق
لا توجد تعليقات
  • مُثبت