انخفاض نتيجة تصحيح الأخطاء في Claude Fable 5 من 86.2 إلى 25.9 بعد إعادة التفعيل في 1 يوليو
عاد كلود فابل 5 إلى الإنترنت في 1 يوليو، ونشرت منصتان لتقييم الذكاء الاصطناعي تقييمات أداء متضاربة في اليوم نفسه. أفادت BridgeBench أن نتيجة تصحيح الأخطاء لكلود فابل 5 انهارت من 86.2 إلى 25.9 بعد إعادة التشغيل، بينما وجدت Arena.AI أن الأداء لم يتغير إلى حد كبير عبر آلاف الأصوات العمياء لتفضيلات البشر. يعود الاختلاف إلى مصنف السلامة الجديد من Anthropic الذي يوجه معظم مهام البرمجة وتصحيح الأخطاء إلى كلود أوبوس 4.8 بدلاً من السماح لفابل 5 بمعالجتها مباشرة. اعترفت Anthropic بأن المصنف ينتج نتائج إيج
AMZN%1.94
OliverGrant·07-04 21:18
