终于有人把大模型评估从「跑分竞赛」拉回「干活场景」了,O*NET加权这个思路确实更贴近企业真实用人逻辑

币 界 网
币界网消息,AI评测机构Artificial Analysis推出了行业与技能「能力指数」,用于评估大模型在实际业务中的表现。该指数分为技能指数和行业指数,前者如智能体、编程等采用等权重平均算分,后者涵盖金融与会计、法律、医疗健康、战略与运营、工程、经济六大领域。行业指数的权重分配借鉴了O\*NET工作活动分类法,以贴近真实岗位需求。每个指数的底层基准测试均由Artificial Analysis独立运行,并根据岗位任务频次进行加权组合算分,为企业评估垂直领域大模型提供了更实用的标尺。
此页面可能包含第三方内容,仅供参考(非陈述/保证),不应被视为 Gate 认可其观点表述,也不得被视为财务或专业建议。详见声明
  • 赞赏
  • 评论
  • 转发
  • 分享
评论
请输入评论内容
请输入评论内容
暂无评论
  • 置顶