台灣深思科技(DeepSeek)今日推出其最新大型語言模型 DeepSeek V4 的兩個預覽版本,這項更新備受期待,為去年 V3.2 模型以及隨之推出的 R1 推理模型帶來重大進展。公司表示,DeepSeek V4 Flash 與 V4 Pro 都是混合專家(mixture-of-experts)模型,每個模型的上下文長度均為 100 萬 tokens,足夠在提示中使用大型程式碼庫或文件。混合專家方法透過每個任務只啟動部分參數,來降低推理成本。V4 Pro 總共擁有 1.6 萬億參數(490 億活躍參數),使其成為目前最大的開放權重模型,超越 Moonshot AI 的 Kimi K 2.6(1.1 萬億)、MiniMax 的 M1(456 億)以及 DeepSeek V3.2(671 億)的兩倍以上。較小的 V4 Flash 則擁有 284 億參數(130 億活躍參數)。深思科技表示,這兩個模型因架構改進而比 V3.2 更加高效且表現更佳,且在推理測試中幾乎「縮小了與現有領先模型的差距」,包括開放與閉源模型。公司聲稱其新的 V4-Pro-Max 模型在推理測試中表現優於開放源碼對手,且在某些任務上超越 OpenAI 的 GPT-5.2 與 Gemini 3.0 Pro。在程式設計競賽測試中,深思科技表示 V4 模型的表現「與 GPT-5.4 相當」。圖片來源:DeepSeek 然而,這些模型在知識測試中似乎稍遜於前沿模型,特別是 OpenAI 的 GPT-5.4 與 Google 最新的 Gemini 3.1 Pro。這種落後顯示出「發展軌跡比最先進模型落後約 3 到 6 個月」,該實驗室指出。V4 Flash 與 V4 Pro 都僅支援文字,不像許多閉源對手提供的音訊、視訊與圖像理解與生成功能。值得注意的是,DeepSeek V4 的價格遠低於目前任何前沿模型。較小的 V4 Flash 模型每一百萬輸入 tokens 價格為 0.14 美元,每一百萬輸出 tokens 價格為 0.28 美元,低於 GPT-5.4 Nano、Gemini 3.1 Flash、GPT-5.4 Mini 與 Claude Haiku 4.5。較大的 V4 Pro 模型則每一百萬輸入 tokens 價格為 0.145 美元,每一百萬輸出 tokens 價格為 3.48 美元,同樣低於 Gemini 3.1 Pro、GPT-5.5、Claude Opus 4.7 與 GPT-5.4。此番發佈恰逢美國指控中國透過數千個代理帳號大規模盜取美國 AI 實驗室的智慧財產。DeepSeek 自己也被 Anthropic 與 OpenAI 指控「蒸餾」,也就是實際上複製他們的 AI 模型。
DeepSeek預覽新AI模型,縮小與頂尖模型的差距
分享這篇文章: