原以為這個瘋狂的 AI 瘋狂更新應該已經告一段落了,沒想到上週才發完 V4 的 DeepSeek ,突然端出一個更大的驚喜。
就在剛剛, DeepSeek 上線了識圖模式,顯示正在灰測中。這意味著討論了一整年的 DeepSeek 多模態能力,終於來了!
目前 DeepSeek 網頁版和 App 更新後都有可能被灰測到識圖模式,APPSO 第一時間給大家進行了實測。
DeepSeek 負責多模態的研究員陳小康在 X 上發文: Now, we see you,並配上一張圖,我們就讓 DeepSeek 來解讀一下這張圖何意味。
結果顯示,它能識別出這張圖背後的隱喻,雖然圖中沒有任何關於DeepSeek 的字眼,但它結合對發布者身份和圖像的識別,推斷出這是關於 DeepSeek 多模態能力的更新。
最後給出一句十分到位的總結:那個看不見世界的鯨魚,現在終於睜開眼了。
比起回答結果,APPSO 發現 DeepSeek 識圖模式的思考過程更有意思。
過去 AI 來看那張推特截圖,大概率是老老實實描述:「兩隻藍色鯨魚,左邊戴眼罩,右邊沒戴。」
但 DeepSeek 它上來就開始追問:這人是誰?他為什麼發這個?鯨魚 logo 代表什麼?眼罩上的 XX 又在暗示什麼?
這才是我們刷到一張梗圖時腦子裡真正發生的事。沒人會先數鯨魚有幾隻,我們關心的是誰在對誰說話,說的是什么潛台詞。
而且它還會來來回回的自我糾正。
比如它甚至一度把圖中的眼罩聯想到《天元突破》裡卡米那的眼鏡,然後自己打臉:「不,這太宅男向了。」「等等,仔細看……」「再換個角度……」。
前面那些推理、聯想、自我糾正,都挺精彩。但整段思考過程裡最反常識的部分,其實是它推理到快收尾時,突然自己喊了個暫停,給自己開了一場小型答辯會。
它列出三個問題自問自答,先確認客觀事實,再推測事件性質,最後才做解讀。 DeepSeek 把這個我們自己都沒意識到的思維習慣,做成了識圖的思考邏輯。
就像我們平時給結論之前,腦子裡也會過一遍:「等等,這個前提對嗎?那個假設站得住嗎?萬一我理解錯了方向呢?」
我們還把經典的 AI 測試題——數手指,拋給了 DeepSeek。
它思考了一通,還是回答錯了,中間還吐槽了一句:「我真的是數暈了。」
不過如果我再引導一下,它還是可以回答正確。
另外一個數手指的測試中,第一次回答錯誤之後,我沒給答案,只是讓它再想想,也能給出正確的回答。
我們還試了試一個經典的「愛心」測試,這個圖之前難倒了所有 AI , DeepSeek 同樣沒有能識別出來。
抛開這些難度較高的極限測試,APPSO 初步測試下來,DeepSeek 識圖的準確率其實還是比較高,不開思考模式的話甚至半秒就能給出回答。
比如這個電影劇照的識別,應該是已經在資料庫內了。
對於抽象圖片的理解也十分到位。
優衣庫這個商品圖的理解也沒有問題。
不過這個識圖的過程應該是沒有聯網搜索,只能基於知識庫回答,所以一些比較新的東西,就無法識別,比如蘋果這個新的吉祥物 Finder 酱。
而且識圖模式上傳的檔案格式也有限制,比如不支持 HEIF 格式
DeepSeek 識圖模式上線,意味著這隻鯨魚終於開眼了,但也許只是剛剛開始。
DeepSeek 多模態更多的能力可能很快也會陸續更新,補上這塊短板後,整個國產模型的格局可能也會再次迎來微妙的變化。
APPSO 將持續跟大家分享 DeepSeek 識圖模式更多的體驗,也歡迎大家體驗後與我們分享有趣的小技巧和細節。
13.45萬 熱度
78.71萬 熱度
113.06萬 熱度
6.07萬 熱度
166.63萬 熱度
DeepSeek大更新 終於「開眼」了
原以為這個瘋狂的 AI 瘋狂更新應該已經告一段落了,沒想到上週才發完 V4 的 DeepSeek ,突然端出一個更大的驚喜。
就在剛剛, DeepSeek 上線了識圖模式,顯示正在灰測中。這意味著討論了一整年的 DeepSeek 多模態能力,終於來了!
目前 DeepSeek 網頁版和 App 更新後都有可能被灰測到識圖模式,APPSO 第一時間給大家進行了實測。
DeepSeek 負責多模態的研究員陳小康在 X 上發文: Now, we see you,並配上一張圖,我們就讓 DeepSeek 來解讀一下這張圖何意味。
結果顯示,它能識別出這張圖背後的隱喻,雖然圖中沒有任何關於DeepSeek 的字眼,但它結合對發布者身份和圖像的識別,推斷出這是關於 DeepSeek 多模態能力的更新。
最後給出一句十分到位的總結:那個看不見世界的鯨魚,現在終於睜開眼了。
比起回答結果,APPSO 發現 DeepSeek 識圖模式的思考過程更有意思。
過去 AI 來看那張推特截圖,大概率是老老實實描述:「兩隻藍色鯨魚,左邊戴眼罩,右邊沒戴。」
但 DeepSeek 它上來就開始追問:這人是誰?他為什麼發這個?鯨魚 logo 代表什麼?眼罩上的 XX 又在暗示什麼?
這才是我們刷到一張梗圖時腦子裡真正發生的事。沒人會先數鯨魚有幾隻,我們關心的是誰在對誰說話,說的是什么潛台詞。
而且它還會來來回回的自我糾正。
比如它甚至一度把圖中的眼罩聯想到《天元突破》裡卡米那的眼鏡,然後自己打臉:「不,這太宅男向了。」「等等,仔細看……」「再換個角度……」。
前面那些推理、聯想、自我糾正,都挺精彩。但整段思考過程裡最反常識的部分,其實是它推理到快收尾時,突然自己喊了個暫停,給自己開了一場小型答辯會。
它列出三個問題自問自答,先確認客觀事實,再推測事件性質,最後才做解讀。 DeepSeek 把這個我們自己都沒意識到的思維習慣,做成了識圖的思考邏輯。
就像我們平時給結論之前,腦子裡也會過一遍:「等等,這個前提對嗎?那個假設站得住嗎?萬一我理解錯了方向呢?」
我們還把經典的 AI 測試題——數手指,拋給了 DeepSeek。
它思考了一通,還是回答錯了,中間還吐槽了一句:「我真的是數暈了。」
不過如果我再引導一下,它還是可以回答正確。
另外一個數手指的測試中,第一次回答錯誤之後,我沒給答案,只是讓它再想想,也能給出正確的回答。
我們還試了試一個經典的「愛心」測試,這個圖之前難倒了所有 AI , DeepSeek 同樣沒有能識別出來。
抛開這些難度較高的極限測試,APPSO 初步測試下來,DeepSeek 識圖的準確率其實還是比較高,不開思考模式的話甚至半秒就能給出回答。
比如這個電影劇照的識別,應該是已經在資料庫內了。
對於抽象圖片的理解也十分到位。
優衣庫這個商品圖的理解也沒有問題。
不過這個識圖的過程應該是沒有聯網搜索,只能基於知識庫回答,所以一些比較新的東西,就無法識別,比如蘋果這個新的吉祥物 Finder 酱。
而且識圖模式上傳的檔案格式也有限制,比如不支持 HEIF 格式
DeepSeek 識圖模式上線,意味著這隻鯨魚終於開眼了,但也許只是剛剛開始。
DeepSeek 多模態更多的能力可能很快也會陸續更新,補上這塊短板後,整個國產模型的格局可能也會再次迎來微妙的變化。
APPSO 將持續跟大家分享 DeepSeek 識圖模式更多的體驗,也歡迎大家體驗後與我們分享有趣的小技巧和細節。