Perplexityが、AIリサーチ能力を測るWANDRベンチマークを公開
Perplexity AIは、人工知能システムが大規模なリサーチ業務をどれほど効果的に実行できるかを評価するために設計されたオープンベンチマーク「WANDR(Wide ANd Deep Research)」を、2026年7月14日に導入しました。フレームワークには、プロフェッショナルの知識業務をモデル化した500の現実的なデータ収集タスクが含まれており、市場分析、デューデリジェンス、文献レビュー、競合インテリジェンス、製品比較、タレント・ソーシングなどが扱われます。このベンチマークは、現行のAIシステムが大量の関連エンティティを特定し、さらに各結果を裏付けとなるエビデンスで検証することが難しいという課題に対処するために立ち上げられました。Perplexityによれば、同社の評価で最高性能のモデルでさえ、ソフトF1スコア0.363、ハードF1スコア0.133にとどまり、大規模でエビデンスに裏打ちされたリサーチが完全に自動化されるにはまだ遠いことを示しています。このベンチマークには、500のタスクにまたがって170,000件超の出典に裏付けられたレコードが含まれており、何百件、何千件ものレ
OliverGrant·07-15 11:03
