PANews 7月29日消息,Kimi 宣布開源多模態大模型視覺感知評測基準 PerceptionBench,旨在將視覺感知能力拆解為 10 項原子級能力進行獨立評估,涵蓋視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、OCR 及幻覺識別等面向。該基準基於 42 個既有評測集中的模型失敗案例構建,共包含 3000 道經人工驗證的問題,每題僅考察單一視覺能力,無需推理或外部知識。
評測結果顯示,在 16 款前沿多模態大模型中,沒有任何模型整體準確率超過 60%。GPT-5.6-Sol 以 59.7% 的準確率排名第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和 GPT-5.5(55.8%)位列前五。報告指出,視覺幻覺(Hallucination)仍是各模型表現最弱的能力,整體感知能力仍存在顯著提升空間。
67.65萬 熱度
1.37萬 熱度
15.63萬 熱度
230.73萬 熱度
127.6萬 熱度
Kimi 開源 PerceptionBench 視覺感知基準,GPT-5.6-Sol 準確率居首但未有模型突破 60%
PANews 7月29日消息,Kimi 宣布開源多模態大模型視覺感知評測基準 PerceptionBench,旨在將視覺感知能力拆解為 10 項原子級能力進行獨立評估,涵蓋視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、OCR 及幻覺識別等面向。該基準基於 42 個既有評測集中的模型失敗案例構建,共包含 3000 道經人工驗證的問題,每題僅考察單一視覺能力,無需推理或外部知識。
評測結果顯示,在 16 款前沿多模態大模型中,沒有任何模型整體準確率超過 60%。GPT-5.6-Sol 以 59.7% 的準確率排名第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和 GPT-5.5(55.8%)位列前五。報告指出,視覺幻覺(Hallucination)仍是各模型表現最弱的能力,整體感知能力仍存在顯著提升空間。