DeepSeek grande atualização finalmente "abriu os olhos"

Pensava que esta louca atualização da IA já tinha chegado ao fim, mas não, na semana passada acabámos de lançar o DeepSeek V4, e de repente surge uma surpresa ainda maior.

Justamente agora, o DeepSeek lançou o modo de reconhecimento de imagens, que está a ser testado em fase de pré-lançamento. Isto significa que a capacidade multimodal do DeepSeek, discutida durante um ano inteiro, finalmente chegou!

Atualmente, tanto a versão web quanto a aplicação do DeepSeek podem ser testadas em fase de pré-lançamento para o modo de reconhecimento de imagens, e a APPSO realizou testes práticos imediatamente.

O investigador responsável pela pesquisa multimodal do DeepSeek, Chen Xiaokang, publicou no X: Agora, vemos-te, acompanhado de uma imagem, e vamos deixar o DeepSeek interpretar o significado dessa imagem.

O resultado mostra que ele consegue reconhecer as metáforas por trás da imagem, mesmo sem qualquer menção ao DeepSeek na imagem, mas combinando o reconhecimento da identidade do autor e da imagem, inferiu que se trata de uma atualização das capacidades multimodais do DeepSeek.

Por fim, uma conclusão bastante adequada: aquele peixe que não consegue ver o mundo agora finalmente abriu os olhos.

Em vez de focar na resposta, a APPSO achou mais interessante o processo de raciocínio do modo de reconhecimento de imagens do DeepSeek.

No passado, ao ver uma captura de ecrã do Twitter, a maior parte das vezes a descrição honesta era: "Duas baleias azuis, à esquerda com máscara, à direita sem máscara."

Mas o DeepSeek começa logo a questionar: Quem é essa pessoa? Por que ela enviou isto? O que representa o logotipo da baleia? O que os XX na máscara estão a insinuar?

Isto é realmente o que acontece na nossa cabeça quando encontramos um meme. Ninguém começa a contar quantas baleias há, o que nos interessa é quem está a falar com quem, qual é a mensagem subentendida.

E ele ainda se corrige a si próprio várias vezes.

Por exemplo, chegou a relacionar a máscara na imagem com os óculos do Kamina em "Tengen Toppa Gurren Lagann", e depois se contradisse: "Não, isso é demasiado otaku." "Espera, olha com atenção..." "Vamos tentar de outro ângulo..."

Essas inferências, associações e auto-correções são bastante interessantes. Mas a parte mais contra a lógica no seu raciocínio é quando, quase no final, ele de repente faz uma pausa e realiza uma pequena defesa de argumentos.

Ele faz três perguntas e responde a si próprio, primeiro confirmando os factos objetivos, depois especulando sobre a natureza do evento, e só então faz a interpretação. O DeepSeek transformou esse hábito de pensamento, que nem sempre percebemos, na lógica de raciocínio do reconhecimento de imagens.

É como quando, antes de chegar a uma conclusão, também pensamos: "Espera, este pressuposto está correcto? Essa hipótese é válida? E se eu estiver a interpretar mal a direção?"

Também colocámos uma questão clássica de teste de IA — contar dedos — ao DeepSeek.

Ele pensou um pouco, respondeu errado, e até comentou: "Estou mesmo confuso a contar." Mas, se o orientarmos um pouco mais, ele consegue responder corretamente.

Numa outra tentativa de contar dedos, após a primeira resposta errada, não lhe demos a resposta, apenas pedimos que pensasse mais um pouco, e ele conseguiu dar a resposta certa.

Também testámos um clássico teste de "coração", que anteriormente tinha confundido todas as IA, e o DeepSeek também não conseguiu reconhecer.

Deixando de lado esses testes de alta dificuldade, a primeira avaliação da APPSO indica que a precisão do reconhecimento de imagens do DeepSeek é relativamente alta, e sem ativar o modo de raciocínio, consegue responder em meia segundo.

Por exemplo, a identificação de uma cena de filme já deve estar na base de dados.

A compreensão de imagens abstratas também é bastante precisa.

A compreensão da imagem de produto da Uniqlo também não apresentou problemas.

No entanto, o processo de reconhecimento de imagens provavelmente não envolve pesquisa online, baseando-se apenas na base de conhecimentos, por isso algumas coisas mais recentes, como o novo mascote da Apple, o Finder-chan, podem não ser reconhecidas.

Além disso, o formato de arquivo suportado pelo modo de reconhecimento de imagens também é limitado, por exemplo, não suporta o formato HEIF.

O lançamento do modo de reconhecimento de imagens do DeepSeek significa que essa baleia finalmente abriu os olhos, mas talvez seja apenas o começo.

As capacidades multimodais do DeepSeek podem ser atualizadas em breve, e ao preencher essa lacuna, o panorama dos modelos nacionais pode sofrer uma mudança sutil.

A APPSO continuará a compartilhar experiências com o modo de reconhecimento de imagens do DeepSeek, e também convida todos a experimentarem e compartilharem dicas e detalhes interessantes conosco.

Ver original
Esta página pode conter conteúdos de terceiros, que são fornecidos apenas para fins informativos (sem representações/garantias) e não devem ser considerados como uma aprovação dos seus pontos de vista pela Gate, nem como aconselhamento financeiro ou profissional. Consulte a Declaração de exoneração de responsabilidade para obter mais informações.
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Comentar
Adicionar um comentário
Adicionar um comentário
Nenhum comentário
  • Fixado