中國人工智能公司DeepSeek於週三低調推出其旗艦模型DeepSeek-V4-Pro的正式版本(版本號0813),未發布任何公告或網誌文章。該模型自4月起以預覽版形式運行,如今正式向用戶開放。DeepSeek公布的內部基準測試顯示,其效能與Anthropic的Claude Fable 5極為接近,但價格僅為後者的2%。這亦延續了DeepSeek此前推出Janus Pro開源模型的路線(詳見:DeepSeek再下一城推Janus Pro 其全新開源AI模型能否超越OpenAI?),繼續以低成本策略挑戰美國前沿模型。
即加入CFTime TG 討論區!想掌握最新加密市場動態與 AI 新聞與資訊,更能隨時獲得免費 web 3入場券!
效能對比:平均差距僅5.3%
根據DeepSeek發布的比較表格,在九個同時有兩款模型評分的代理基準測試中,Claude Fable 5的平均領先幅度僅5.3%。在兩個基準上,DeepSeek甚至取得領先。若排除Humanity’s Last Exam(無工具版本)——其中DeepSeek得分42.7,Claude Fable 5得分53.3,差距達10.6%——其餘基準的平均差距僅為2.8%。
價格對比:約46倍差距
定價方面的對比則更為懸殊:Claude Fable 5輸入每百萬Tokens 10美元,輸出每百萬Tokens 50美元;DeepSeek V4 Pro輸入每百萬Tokens僅0.435美元,輸出每百萬Tokens 0.87美元。以混合費率計算,Claude Fable 5約30美元,DeepSeek約0.65美元,相差約46倍。Hugging Face行政總裁Clément Delangue估計,每項基準任務的成本差距超過31美元對比約0.04美元。
其他競爭對手的價格壓力
Anthropic自身的產品線使溢價問題更加複雜。Claude Opus 5在大多數基準上的得分高於Fable 5,但價格僅為其一半。與此同時,Kimi K3在推出時即擊敗了Fable 5及GPT-5.6 Sol,而DeepSeek與小米已將前沿模型成本削減99%,美國實驗室則朝相反方向發展。
注意事項:獨立驗證尚未完成
DeepSeek的數據為公司自行測試,基礎設施尚未公開。兩個基準(DSBench-FullStack及DSBench-Hard)為內部測試集,無公開排行榜可供對照。由於DeepSeek的權重採用MIT許可證並已上傳至Hugging Face,獨立驗證僅需下載即可完成。
中國開源模型正以前所未有的成本優勢挑戰美國前沿
DeepSeek V4 Pro的正式發布延續了中國開源權重實驗室的一貫模式:以美國前沿模型的一小部分成本,達到僅差數個百分點的效能水平。對於大規模使用AI工具的企業而言,這種成本差距——約46倍——具有實質性的商業意義。
