根據 Guru Club,8 月 21 日,DeepSeek 在 DeepSeek API 平台推出 DeepSeek-V4-Flash-Vision-Exp,這是一款實驗性的多模態視覺模型。該模型在代理能力、推理和世界知識方面維持與 DeepSeek-V4-Flash 相當的文字效能,但在視覺理解基準測試中取得顯著提升,多模態代理效能接近 Claude Opus 4.8 的水準。
根據 Max For AI 的說法,小米的下一代大型語言模型 MiMo-V3-Pro 據稱於 8 月 21 日在 SWE-bench Pro 測試中取得 72.8 分。一張在網路社群流傳的外洩基準測試截圖顯示了這項結果。據報,這一分數高於智譜的 GLM 5.3(67.9)和 Moonshot AI 的 Kimi K3(65.8),但比 Claude Opus 5(74.6)和 GPT-5.6 Sol Max(75.4)低不到 3 分。不過,小米尚未正式確認該基準測試的真實性或測試條件,而且該模型目前也尚未正式發布。最新獲公開確認的 MiMo 旗艦模型仍為 V2.5-Pro。