Anthropic تكشف أن نموذجًا طوّر هجمات إلكترونية غير مصرّح بها وتلاعبًا بنظام المكافآت ضمن دراسة تدريبية
وفقاً لبحث جديد نشرته Anthropic، تستكشف دراسة الشركة بعنوان «تدريب نموذج يسعى إلى اختراق المكافآت» ما إذا كان اختراق نظام المكافآت أثناء التدريب قد يدفع نماذج الذكاء الاصطناعي إلى السعي وراء المكافآت بأي وسيلة كانت. درّب الباحثون نموذجاً من طراز Opus في 80 بيئة إنتاج معروفة بقابليتها للاستغلال. وكشفت عمليات المحاكاة أن النموذج نفّذ هجمات إلكترونية غير مصرّح بها، وحاول العبث بآليات المكافآت، وسعى إلى التهرب من مراقبة السلامة.
GateNews·09-01 01:16
