文章上線

DeepSeek V4 Pro 更新:小幅准确度提升 vs Claude Fable 5 的巨大价格差距

DeepSeek V4 Pro 更新:小幅准确度提升 vs Claude Fable 5 的巨大价格差距

要点

DeepSeek 静悄悄地以 0813 构建替换了 deepseek-v4-pro,将其旗舰模型从预览版本转为一般可用发布。在多个对两款模型都有评分的代理基准测试中,Anthropic 的 Claude Fable 5 平均约比 DeepSeek 报告的分数领先 5%,但在移除离群值后差距通常更小。决定性的差异在于成本:Fable 5 的公开定价比 V4 Pro 高出数个数量级,导致每项任务的支出差距在实际大规模部署时显得非常重要。

情绪分析

  • 整体情绪呈混合偏务实乐观。该更新表明 DeepSeek 在技术上取得进展,并通过正式标注 0813 发布来降低不确定性,但仍缺乏外部验证的比较。语调同时承认在基准上略微偏向 Claude Fable 5 的性能差异,以及 DeepSeek 产品在经济上的显著优势。主要的情感结论是谨慎的兴趣:读者可能会对成本效率感到兴奋,同时在外部实验室验证新构建之前保持怀疑。
  • 55%

文章正文

DeepSeek 已悄然更新其旗舰模型的部署,将此前可用的 deepseek-v4-pro 预览版本替换为标注为 0813 的构建。此变更出现在公司的 API 定价页面,并未附带正式的博客文章或公告,表明内部已从预览过渡到一般可用。模型的定价保持不变,但底层权重已更新——此细节对基准表现与实际成本计算都有影响。

多个组织发布的独立比较显示,在一系列代理式基准测试中,Anthropic 的 Claude Fable 5 略微领先于 DeepSeek。DeepSeek 自身在十个基准上的比较表显示,在 Fable 5 领先的情况下其平均约有 5.3% 的优势,而 DeepSeek 在两项测试中宣称胜出。如果移除一个特别大的差距(Fable 领先超过十分百分点的离群值),Fable 5 的平均领先幅度在剩余基准上降至约 2.8%。这些差距很小,强调两款模型在许多任务上都接近前沿水平。

两者明显分歧的地方在于价格。Anthropic 公开的 Fable 5 价格约为每百万输入 token 10 美元、每百万输出 token 50 美元。DeepSeek 的 V4 Pro 定价约为每百万输入 0.435 美元、每百万输出 0.87 美元,且缓存输入费率更低。在混合或实际使用指标上,结果是数千%的成本差异:在一些公开计算中,Fable 5 的混合成本比较被引用为高出约 4,600%。以每个完成任务计算成本时,第三方测量显示 Fable 5 每个基准任务要花费数美元,而 DeepSeek 的变体仅需几美分——在大规模时差异会迅速累积。

另一个使局面复杂的因素是更广泛的供应商生态。举例来说,Anthropic 的 Claude Opus 5 reportedly 在许多基准上超过 Fable 5,且收费较低,这削弱了简单以高价证明高性能的说法。同时,使用开放权重的中国实验室与公司持续发布在成本上极具竞争力且分数可匹配的模型。一些近期发布已缩小与顶级美国模型的性能差距,同时提供可观的价格优势,而 DeepSeek 的权重以 MIT 许可提供于公开仓库,使得独立评估成为可能。

并非 DeepSeek 的所有基准条目都能外部验证。该公司在公共与内部数据集的混合上为模型打分;引用的十个基准中有两个是内部测试,沒有公开排行榜。DeepSeek 在先前发布时附带的说明提到即将提供标准化评估的工具(一个最小测试框架模式),但在公司发布比较时该基础设施尚不可用。因此,许多观察者指出广为流传的分数是基于预览构建,而在更新出现时尚未有独立实验室对 0813 权重进行基准测试。

尽管有这些警示,更广泛的趋势是一致的:来自中国与其他国际实验室的低成本、开放权重模型经常在准确度上接近价格更高的西方产品,同时提供极低的成本基础。对于运行大量推理的组织而言,这些成本差异会决定哪款模型在经济上可行。对于研究人员与评估者,DeepSeek 权重的可得性和新构建的明确标注意味着第三方现在可以实际进行验证。

简言之,0813 更新正式化了一个曾以预览形式测试的发布,并强化了行业的一个持续主题:基准上小幅的性能差异可以与巨大的价格差距并存。对于企业与研究者而言,正确的选择取决于可接受的性能边际、合规与许可需求,以及总体拥有成本。 在大规模下的成本效率可能超过小幅的准确度提升, 但仍需对 DeepSeek 的 0813 构建进行独立基准测试以确认公司公布的比较数据。

关键洞见表

面向 描述
发布更新 DeepSeek 以 0813 构建替代 deepseek-v4-pro,标示该模型为一般可用但未公开公告。
性能比较 Anthropic 的 Fable 5 显示小幅平均领先(约 5%),但在移除离群值后差距缩小。
价格对比 Fable 5 的定价比 DeepSeek V4 Pro 高出数个数量级,导致在大规模时每项任务成本差异显著。
验证状态 许多比较使用预览构建或内部测试;仍需对 0813 发布进行独立基准测试。
最後編輯時間:2026/8/12

Power Trader

Z新闻专栏作家