Kimi lança PerceptionBench de código aberto, um benchmark de percepção visual; GPT-5.6-Sol lidera em acurácia, mas nenhum modelo ultrapassa 60%

robot
Geração do resumo em andamento

PANews, 29 de julho, anunciou que a Kimi disponibilizou como código aberto um modelo de linguagem multimodal de avaliação de percepção visual, o PerceptionBench. O objetivo é decompor as capacidades de percepção visual em 10 habilidades atômicas para avaliação independente, cobrindo dimensões como relações visuais, contagem, atributos, profundidade e 3D, localização, comparação, identificação de granularidade fina, integração de contexto, OCR e detecção de alucinações. O benchmark foi construído com base em casos de falha de modelos a partir de 42 conjuntos de avaliação existentes, e inclui 3.000 questões verificadas manualmente; para cada questão, é avaliada apenas uma capacidade visual, sem necessidade de raciocínio ou conhecimento externo.

Os resultados da avaliação mostram que, entre 16 modelos multimodais de ponta, nenhum modelo alcançou acurácia geral acima de 60%. GPT-5.6-Sol ficou em primeiro lugar com 59,7% de acurácia, seguido por Kimi K3 (58,5%), Claude-Fable-5 (57,2%), Gemini-3.1-Pro (56,2%) e GPT-5.5 (55,8%) nos cinco primeiros lugares. O relatório aponta que a alucinação visual (Hallucination) ainda é a capacidade em que todos os modelos apresentam o pior desempenho, e que ainda há um espaço significativo para melhorias na capacidade global de percepção.

Ver original
Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.
  • Recompensa
  • Comentário
  • Repostar
  • Compartilhar
Comentário
Adicionar um comentário
Adicionar um comentário
Sem comentários
  • Fixado