GPT-5.6 Sol Mengungguli Tolok Ukur Kode React dengan 43,1%, Namun Kesenjangan Kinerja Dibanding Kompetitor Minimal
Menurut Beating, Million merilis ReactBench v1, sebuah benchmark untuk menguji AI coding agents pada 51 tugas pengembangan React dunia nyata. GPT-5.6 Sol memperoleh skor 43,1%, memimpin para kompetitor; Fable 5 menyusul dengan 41,2%. Million mencatat bahwa kesenjangannya tipis, tidak cukup untuk mengonfirmasi keunggulan Sol yang jelas. Meski unggul dalam skor, bahkan model dengan performa terbaik hanya menyelesaikan kurang dari setengah tugas. Dalam 4.455 pengujian, semua model menghadirkan 1.19
GateNews·07-16 11:45
