DeepSeek grande atualização finalmente "abriu os olhos"

Achava que essa louca atualização de IA já tinha chegado ao fim, mas na semana passada acabou de lançar o DeepSeek V4, e de repente veio uma surpresa ainda maior.

Justamente agora, o DeepSeek lançou o modo de reconhecimento de imagens, mostrando que está em fase de testes internos. Isso significa que a capacidade multimodal do DeepSeek, discutida por um ano inteiro, finalmente chegou!

Atualmente, tanto a versão web quanto o aplicativo do DeepSeek podem ser testados em fase de testes internos para o modo de reconhecimento de imagens, e a equipe do APPSO realizou testes imediatos.

O pesquisador responsável pela pesquisa multimodal do DeepSeek, Chen Xiaokang, postou no X: Agora, nós te vemos, acompanhado de uma imagem, e vamos deixar o DeepSeek interpretar o que essa imagem significa.

O resultado mostrou que ele consegue reconhecer as metáforas por trás da imagem, mesmo sem nenhuma palavra relacionada ao DeepSeek na imagem, mas combinando o reconhecimento da identidade do autor e da imagem, inferiu que se trata de uma atualização na capacidade multimodal do DeepSeek.

Por fim, uma conclusão bastante precisa: aquele peixe que não consegue ver o mundo agora finalmente abriu os olhos.

Em comparação com a resposta, o processo de pensamento do DeepSeek ao reconhecer imagens é ainda mais interessante.

No passado, ao ver uma captura de tela do Twitter, a maioria das pessoas provavelmente descreveria honestamente: "Duas baleias azuis, uma com máscara de dormir à esquerda, a outra sem."

Mas o DeepSeek começa a fazer perguntas: Quem é essa pessoa? Por que ela postou isso? O que o logotipo da baleia representa? O que os "XX" na máscara de dormir estão insinuando?

Isso é o que realmente acontece na nossa cabeça quando vemos uma imagem meme. Ninguém começa contando quantas baleias há, o que nos interessa é quem está falando com quem, qual é a mensagem subentendida.

E ele ainda faz auto-correções de forma contínua.

Por exemplo, ele até uma vez associou a máscara de dormir na imagem ao óculos do Kamina em "Tengen Toppa Gurren Lagann", e se corrigiu: "Não, isso é muito nerd.""Espera, olhe com atenção..." "Vamos mudar o ângulo...".

Essas inferências, associações e auto-correções são bem interessantes. Mas a parte mais contra a lógica de todo esse processo de pensamento é que, quase no final, ele de repente faz uma pausa, como se estivesse defendendo uma tese.

Ele lista três perguntas, responde a si mesmo, primeiro confirmando fatos objetivos, depois inferindo a natureza do evento, e só então faz a interpretação. O DeepSeek transformou esse hábito de pensamento que nem percebemos em uma lógica de raciocínio para reconhecimento de imagens.

É como quando estamos chegando a uma conclusão: "Espera, esse pressuposto está correto? Essa hipótese é válida? E se eu estiver interpretando errado?"

Também lançamos para o DeepSeek um teste clássico de IA — contar dedos.

Ele pensou um pouco, respondeu errado, e ainda reclamou: "Realmente fiquei tonto de contar."

Mas se eu der uma orientação, ele consegue responder corretamente.

Em outro teste de contar dedos, após a primeira resposta errada, não dei a resposta, apenas pedi para ele pensar mais um pouco, e ele conseguiu dar a resposta certa.

Também testamos um clássico teste de "coração", e essa imagem anteriormente tinha derrubado todas as IA, mas o DeepSeek também não conseguiu reconhecer.

Deixando de lado esses testes de alta dificuldade, na avaliação preliminar do APPSO, a precisão do reconhecimento de imagens do DeepSeek ainda é relativamente alta, e sem ativar o modo de raciocínio, ele consegue responder em meio segundo.

Por exemplo, o reconhecimento de uma cena de filme já deve estar no banco de dados.

A compreensão de imagens abstratas também é bastante precisa.

A compreensão da imagem do produto da Uniqlo também não apresentou problemas.

No entanto, esse processo de reconhecimento de imagens provavelmente não envolve busca na internet, apenas responde com base na base de conhecimento, então coisas mais novas, como o novo mascote da Apple, o Finder-chan, não podem ser reconhecidas.

Além disso, há limitações no formato de arquivo suportado para upload no modo de reconhecimento de imagens, como a não compatibilidade com o formato HEIF.

O lançamento do modo de reconhecimento de imagens do DeepSeek significa que essa baleia finalmente abriu os olhos, mas talvez seja apenas o começo.

As capacidades multimodais do DeepSeek podem ser atualizadas em breve, e ao preencher essa lacuna, o cenário dos modelos domésticos pode passar por mudanças sutis novamente.

O APPSO continuará compartilhando suas experiências com o modo de reconhecimento de imagens do DeepSeek, e também convida todos a testarem e compartilharem dicas e detalhes interessantes após a experiência.

Ver original
Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.
  • Recompensa
  • Comentário
  • Repostar
  • Compartilhar
Comentário
Adicionar um comentário
Adicionar um comentário
Sem comentários
  • Fixado