ついに、大規模言語モデルの評価を「ベンチマーク競争」から「実務シナリオ」に引き戻した人が現れた。O*NET加重という考え方は確かに企業の実際の採用ロジックにより近い。

原文表示
CoinNetwork
幣界網の報道によると、AI評価機関Artificial Analysisは、業界・スキル「能力指数」を発表し、大規模モデルの実際のビジネスにおけるパフォーマンスを評価する。この指数はスキル指数と業界指数に分かれており、前者はエージェント、プログラミングなどに等しい重みの平均スコアを採用し、後者は金融・会計、法律、医療・健康、戦略・運用、エンジニアリング、経済の6分野をカバーする。業界指数の重み配分はO*NETの職務活動分類法を参考にし、実際の職務ニーズに近づけている。各指数の基礎ベンチマークテストはArtificial Analysisが独自に実行し、職務タスクの頻度に基づいて加重組み合わせでスコアリングされており、企業が垂直領域の大規模モデルを評価するためのより実用的な尺度を提供する。
このページには第三者のコンテンツが含まれている場合があり、情報提供のみを目的としております(表明・保証をするものではありません)。Gateによる見解の支持や、金融・専門的な助言とみなされるべきものではありません。詳細については免責事項をご覧ください。
  • 報酬
  • コメント
  • リポスト
  • 共有
コメント
コメントを追加
コメントを追加
コメントなし
  • ピン留め