DeepSeek gran actualización finalmente "abrió los ojos"

Pensé que esta loca actualización de la IA ya había llegado a su fin, pero no, la semana pasada se lanzó la DeepSeek V4, y de repente apareció una sorpresa aún mayor.

Justo ahora, DeepSeek lanzó el modo de reconocimiento de imágenes, que está en prueba preliminar. Esto significa que la capacidad multimodal de DeepSeek, de la que se ha hablado durante un año entero, ¡finalmente está aquí!

Actualmente, tanto la versión web como la app de DeepSeek pueden ser probadas en modo de reconocimiento de imágenes en fase de prueba, y APPSO realizó una prueba rápida para todos.

El investigador responsable de multimodalidad en DeepSeek, Chen Xiaokang, publicó en X: Ahora, te vemos, y acompañó la publicación con una imagen, dejando que DeepSeek interprete qué significa esa imagen.

El resultado mostró que puede reconocer las metáforas detrás de esa imagen, aunque no hay ninguna referencia a DeepSeek en ella, pero combinando el reconocimiento de la identidad del publicador y la imagen, dedujo que se trata de una actualización de las capacidades multimodales de DeepSeek.

Finalmente, se dio un resumen muy acertado: esa ballena que no puede ver el mundo, ¡finalmente ha abierto los ojos!

En lugar del resultado, lo que APPSO encontró más interesante fue el proceso de pensamiento de DeepSeek en modo de reconocimiento de imágenes.

En el pasado, cuando la IA veía esa captura de Twitter, probablemente describiría honestamente: "Dos ballenas azules, la de la izquierda lleva antifaz, la de la derecha no lleva."

Pero DeepSeek empezó a preguntar: ¿quién es esta persona? ¿Por qué publicó esto? ¿Qué representa el logo de la ballena? ¿Qué insinúa la X en el antifaz?

Eso es lo que realmente pasa en nuestra cabeza cuando vemos un meme. Nadie cuenta cuántas ballenas hay, lo que nos importa es quién le está hablando a quién, qué subtexto hay en lo que dicen.

Y además, se corrige a sí mismo una y otra vez.

Por ejemplo, en un momento, relacionó el antifaz en la imagen con las gafas de Kamina en "Tengen Toppa Gurren Lagann", y se contradijo: "No, esto es demasiado otaku." "Espera, mira con atención..." "Cambiemos el ángulo..."

Esas inferencias, asociaciones y autocorrecciones son bastante interesantes. Pero lo más sorprendente en todo ese proceso de pensamiento es que, cuando casi termina, de repente se detiene y hace una pequeña defensa de sus conclusiones.

Se planteó tres preguntas y se respondió a sí mismo, primero confirmando hechos objetivos, luego especulando sobre la naturaleza del evento, y finalmente haciendo interpretaciones. DeepSeek convirtió ese hábito de pensamiento que ni siquiera nosotros notamos en una lógica para el reconocimiento de imágenes.

Es como cuando antes de llegar a una conclusión, nuestro cerebro repasa: "Espera, ¿es correcto este supuesto? ¿Este hipótesis aguanta? ¿Y si entendí mal la dirección?"

También le lanzamos un clásico test de IA: contar dedos.

Pensó un rato y respondió mal, incluso soltó: "Realmente me mareé contando."

Pero si le doy una pista, aún puede responder correctamente.

En otra prueba de contar dedos, después de responder mal la primera vez, no le di la respuesta, solo le pedí que pensara un poco más, y también pudo dar la respuesta correcta.

También probamos un clásico test de "corazón", que anteriormente había confundido a todas las IA, y DeepSeek tampoco pudo reconocerlo.

Dejando de lado estas pruebas de máxima dificultad, en las pruebas preliminares, la precisión de reconocimiento de DeepSeek sigue siendo bastante alta. Sin modo de pensamiento activado, incluso puede responder en medio segundo.

Por ejemplo, el reconocimiento de una escena de película ya debería estar en su base de datos.

Su comprensión de imágenes abstractas también es muy buena.

La interpretación de la imagen del producto de Uniqlo no tuvo problema.

Pero este proceso de reconocimiento probablemente no involucra búsqueda en línea, solo responde basado en su base de conocimientos, por lo que algunos elementos más recientes, como el nuevo ícono de Apple, Finder, no pueden ser reconocidos.

Además, el formato de archivo para subir en modo de reconocimiento de imágenes también tiene limitaciones, como no soportar el formato HEIF.

El lanzamiento del modo de reconocimiento de imágenes de DeepSeek significa que esa ballena finalmente ha abierto los ojos, pero quizás esto sea solo el comienzo.

Es probable que en breve se actualicen más capacidades multimodales de DeepSeek, y al cubrir esa brecha, el panorama de los modelos nacionales podría experimentar cambios sutiles.

APPSO continuará compartiendo más experiencias con el modo de reconocimiento de imágenes de DeepSeek, y también invita a todos a probarlo y compartir trucos y detalles interesantes con nosotros.

Ver original
Esta página puede contener contenido de terceros, que se proporciona únicamente con fines informativos (sin garantías ni declaraciones) y no debe considerarse como un respaldo por parte de Gate a las opiniones expresadas ni como asesoramiento financiero o profesional. Consulte el Descargo de responsabilidad para obtener más detalles.
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Comentar
Añadir un comentario
Añadir un comentario
Sin comentarios
  • Fijado