Claude Fable 5 Menunjukkan Hasil Benchmark yang Bertentangan Setelah Pemulihan pada 1 Juli
Claude Fable 5 kembali beroperasi pada 1 Juli, memicu penilaian kinerja yang bertentangan dari dua platform benchmarking AI. BridgeBench melaporkan penurunan skor debugging dari 86,2 menjadi 25,9, sementara Arena.AI menemukan kinerja sebagian besar tidak berubah melalui ribuan suara preferensi manusia buta. Perbedaan ini berasal dari pengklasifikasi keamanan baru Anthropic yang mengarahkan sebagian besar tugas pengkodean ke Claude Opus 4.8, bukan penurunan kemampuan model yang sebenarnya, menuru
AMZN-0,63%
OliverGrant·07-03 21:13
