Perplexity Meluncurkan Benchmark WANDR dengan 500 Tugas Penelitian untuk Mengukur Kemampuan Agen AI
Perplexity AI meluncurkan WANDR (Wide ANd Deep Research), sebuah benchmark open-source pada 15 Juli untuk mengukur seberapa efektif sistem AI menjalankan tugas penelitian skala besar yang memerlukan penemuan informasi secara luas serta verifikasi bukti secara mendetail. Benchmark ini berisi 500 tugas pengumpulan data yang realistis, dimodelkan seperti pekerjaan pengetahuan profesional, termasuk analisis pasar, due diligence, tinjauan literatur, dan intelijen kompetitif, yang didukung oleh lebih
GateNews·07-15 11:02
