DeepSeek大更新 終於「開眼」了

原以為這個瘋狂的 AI 瘋狂更新應該已經告一段落了,沒想到上週才發完 V4 的 DeepSeek ,突然端出一個更大的驚喜。

就在剛剛, DeepSeek 上線了識圖模式,顯示正在灰測中。這意味著討論了一整年的 DeepSeek 多模態能力,終於來了!

目前 DeepSeek 網頁版和 App 更新後都有可能被灰測到識圖模式,APPSO 第一時間給大家進行了實測。

DeepSeek 負責多模態的研究員陳小康在 X 上發文: Now, we see you,並配上一張圖,我們就讓 DeepSeek 來解讀一下這張圖何意味。

結果顯示,它能識別出這張圖背後的隱喻,雖然圖中沒有任何關於DeepSeek 的字眼,但它結合對發布者身份和圖像的識別,推斷出這是關於 DeepSeek 多模態能力的更新。

最後給出一句十分到位的總結:那個看不見世界的鯨魚,現在終於睜開眼了。

比起回答結果,APPSO 發現 DeepSeek 識圖模式的思考過程更有意思。

過去 AI 來看那張推特截圖,大概率是老老實實描述:「兩隻藍色鯨魚,左邊戴眼罩,右邊沒戴。」

但 DeepSeek 它上來就開始追問:這人是誰?他為什麼發這個?鯨魚 logo 代表什麼?眼罩上的 XX 又在暗示什麼?

這才是我們刷到一張梗圖時腦子裡真正發生的事。沒人會先數鯨魚有幾隻,我們關心的是誰在對誰說話,說的是什么潛台詞。

而且它還會來來回回的自我糾正。

比如它甚至一度把圖中的眼罩聯想到《天元突破》裡卡米那的眼鏡,然後自己打臉:「不,這太宅男向了。」「等等,仔細看……」「再換個角度……」。

前面那些推理、聯想、自我糾正,都挺精彩。但整段思考過程裡最反常識的部分,其實是它推理到快收尾時,突然自己喊了個暫停,給自己開了一場小型答辯會。

它列出三個問題自問自答,先確認客觀事實,再推測事件性質,最後才做解讀。 DeepSeek 把這個我們自己都沒意識到的思維習慣,做成了識圖的思考邏輯。

就像我們平時給結論之前,腦子裡也會過一遍:「等等,這個前提對嗎?那個假設站得住嗎?萬一我理解錯了方向呢?」

我們還把經典的 AI 測試題——數手指,拋給了 DeepSeek。

它思考了一通,還是回答錯了,中間還吐槽了一句:「我真的是數暈了。」

不過如果我再引導一下,它還是可以回答正確。

另外一個數手指的測試中,第一次回答錯誤之後,我沒給答案,只是讓它再想想,也能給出正確的回答。

我們還試了試一個經典的「愛心」測試,這個圖之前難倒了所有 AI , DeepSeek 同樣沒有能識別出來。

抛開這些難度較高的極限測試,APPSO 初步測試下來,DeepSeek 識圖的準確率其實還是比較高,不開思考模式的話甚至半秒就能給出回答。

比如這個電影劇照的識別,應該是已經在資料庫內了。

對於抽象圖片的理解也十分到位。

優衣庫這個商品圖的理解也沒有問題。

不過這個識圖的過程應該是沒有聯網搜索,只能基於知識庫回答,所以一些比較新的東西,就無法識別,比如蘋果這個新的吉祥物 Finder 酱。

而且識圖模式上傳的檔案格式也有限制,比如不支持 HEIF 格式

DeepSeek 識圖模式上線,意味著這隻鯨魚終於開眼了,但也許只是剛剛開始。

DeepSeek 多模態更多的能力可能很快也會陸續更新,補上這塊短板後,整個國產模型的格局可能也會再次迎來微妙的變化。

APPSO 將持續跟大家分享 DeepSeek 識圖模式更多的體驗,也歡迎大家體驗後與我們分享有趣的小技巧和細節。

查看原文
此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見聲明
  • 打賞
  • 回覆
  • 轉發
  • 分享
回覆
請輸入回覆內容
請輸入回覆內容
暫無回覆
  • 已置頂