DeepSeek grosse mise à jour, enfin « ouvrir les yeux »

Je pensais que cette mise à jour folle de l'IA était déjà terminée, mais surprise, la semaine dernière, après avoir lancé la DeepSeek V4, voilà qu’un nouveau grand coup arrive soudainement.

Juste à l’instant, DeepSeek a lancé un mode de reconnaissance d’image, en phase de test bêta. Cela signifie que la capacité multimodale de DeepSeek, discutée toute l’année, est enfin là !

Actuellement, la version web et l’application de DeepSeek peuvent tous deux être en phase de test bêta pour le mode de reconnaissance d’image, et APPSO a immédiatement effectué un test pratique.

Le chercheur responsable de la multimodalité chez DeepSeek, Chen Xiaokang, a publié sur X : Now, we see you, accompagné d’une image, et nous laissons DeepSeek interpréter ce que cette image signifie.

Le résultat montre qu’il peut reconnaître la métaphore derrière cette image, même si aucun mot lié à DeepSeek n’apparaît dans l’image, mais en combinant la reconnaissance de l’identité de l’émetteur et de l’image, il en déduit qu’il s’agit d’une mise à jour des capacités multimodales de DeepSeek.

Pour finir, une conclusion très pertinente : la baleine qui ne voit pas le monde, ouvre enfin les yeux.

Comparé au résultat de la réponse, APPSO trouve que le processus de réflexion de DeepSeek en mode reconnaissance d’image est encore plus intéressant.

Autrefois, pour cette capture Twitter, l’IA aurait probablement simplement décrit honnêtement : « Deux baleines bleues, une porte un cache-œil à gauche, l’autre ne porte rien. »

Mais DeepSeek commence directement à poser des questions : Qui est cette personne ? Pourquoi a-t-elle publié cela ? Que représente le logo de la baleine ? Que suggère le XX sur le cache-œil ?

C’est ce qui se passe vraiment dans notre tête quand on tombe sur une image drôle. Personne ne compte d’abord combien de baleines il y a, ce qui nous intéresse, c’est qui parle à qui, et quels sont les sous-entendus.

Et il se corrige aussi en boucle.

Par exemple, il a même une fois associé le cache-œil de l’image à celui de Kamina dans « Tengen Toppa Gurren Lagann », puis s’est repris : « Non, ça, c’est trop otaku. » « Attendez, regardons de plus près… » « Changeons d’angle… »

Ces raisonnements, associations, auto-corrections sont très impressionnants. Mais la partie la plus contre-intuitive de tout ce processus, c’est quand il arrive à la fin de sa réflexion, et soudain il s’arrête, se met en pause, et organise une petite séance de défense de ses idées.

Il pose trois questions auxquelles il répond lui-même, d’abord pour confirmer les faits objectifs, puis pour inférer la nature de l’événement, avant de faire une interprétation. DeepSeek a transformé cette habitude de pensée, que même nous ne réalisons pas, en une logique de réflexion pour la reconnaissance d’image.

C’est comme quand on tire une conclusion : notre cerveau repasse aussi en revue : « Attendez, cette prémisse est-elle correcte ? Cette hypothèse tient-elle la route ? Et si je me suis trompé dans la direction ? »

Nous avons aussi lancé à DeepSeek un classique test de reconnaissance : compter les doigts.

Il a réfléchi un moment, puis a répondu faux, en se plaignant : « Je suis vraiment confus avec le comptage. »

Mais si je le guide un peu, il peut encore répondre correctement.

Dans un autre test de comptage de doigts, après une première erreur, je ne lui donne pas la réponse, je lui demande simplement de réfléchir à nouveau, et il peut donner la bonne réponse.

Nous avons aussi essayé un classique test du « cœur » : cette image avait déjà mis en difficulté tous les IA auparavant, mais DeepSeek n’a pas réussi à la reconnaître non plus.

En laissant de côté ces tests très difficiles, nos premiers essais montrent que la précision de DeepSeek en reconnaissance d’image reste assez élevée, et sans mode de réflexion, il peut même répondre en moins d’une seconde.

Par exemple, la reconnaissance de cette scène de film est probablement déjà dans la base de données.

La compréhension des images abstraites est également très précise.

La compréhension de cette image de produit Uniqlo ne pose pas de problème.

Mais ce processus de reconnaissance ne semble pas faire de recherche en ligne, il se base uniquement sur la base de connaissances, donc certains éléments récents, comme le nouveau mascotte d’Apple, Finder-chan, ne peuvent pas être reconnus.

De plus, le format de fichier supporté pour le mode reconnaissance d’image est limité, par exemple, le format HEIF n’est pas supporté.

Le lancement du mode reconnaissance d’image de DeepSeek signifie que cette baleine a enfin ouvert les yeux, mais ce n’est peut-être que le début.

Les capacités multimodales de DeepSeek pourraient rapidement être enrichies, et après avoir comblé cette lacune, le paysage des modèles nationaux pourrait à nouveau connaître un changement subtil.

APPSO continuera à partager avec vous ses expériences du mode reconnaissance d’image de DeepSeek, et nous vous invitons à tester et à partager avec nous vos astuces et détails intéressants.

Voir l'original
Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.
  • Récompense
  • Commentaire
  • Reposter
  • Partager
Commentaire
Ajouter un commentaire
Ajouter un commentaire
Aucun commentaire
  • Épinglé