最近 Deepseek 悄悄更了个小版本,结果直接把 AI 圈的水搅浑了。一个本来主打轻量应用的 Flash 版,不仅性能不输旗舰级模型,价格还便宜到让人不敢信。
性能没它好的贵不少,比它强的贵到离谱
先看网友做的对比图表:每个点代表一个大模型,位置越靠上性能越好,越靠右价格越贵。Deepseek V4 Flash 的性能比不上 Claude 5、GPT 5.6So、Kimi K3 这些顶级模型,但价格几乎吊打所有同行。
要是换成线性坐标轴,差距会更明显:比 V4 Flash 强一点的模型,性能只高两成,但价格却贵了一两个零。难怪有网友说,Deepseek 重新定义了 AI 模型的性价比。
实测了一下,用了 1 亿 + token 才花了 5 块钱,这种性能和价格的不对等,实在让人惊讶。

很多人好奇,Deepseek 为啥能做到又强又便宜?咱们翻了他们的论文和公开资料,找到了两个核心方向。
先说说后训练。大模型训练通常分两个阶段:第一阶段是预训练,往模型里塞海量文本、代码等数据,让它掌握基础能力,就像培养高中生,各科知识都要喂。第二阶段是后训练,相当于让模型刷题练应试能力,通过监督微调、强化学习,让它学会理解指令、拆解问题、按人类偏好输出答案。
同样的预训练模型,不同的后训练方式,表现会天差地别。Deepseek 之前的 V3 版本,经过 GRPU 强化学习后,数学能力直接暴涨,在 AIME2024 测试集上的正确率从 15.6% 飙升到 71%。OpenAI 的 instruct GPT 也是靠这套逻辑,13 亿参数的模型,在真人盲评里打赢了参数量大 100 多倍的 GPT3。

仔细看 Deepseek 的发布说明,这次公开的跑分并不是裸跑的成绩,而是用上了未发布的 Deepseek Harness 工具。这其实就是现在很火的 Agent 工具,相当于给模型安上了搜索引擎、代码运行环境,还能帮它管理上下文、检查运行结果,给模型加了不少 buff。
今年年初多伦多大学的研究显示,同一个大模型放到不同的 Agent 工具里,完成任务的概率最高能差好几倍。在 Agent 成为 AI 发展核心阶梯的当下,模型的实际能力不仅取决于本身,还要看配套的工具。

这次 Deepseek 用高质量的后训练加上自研的 Agent 工具,把原本主打轻量应用的 Flash 版拉到了全球旗舰模型的身后。本来以为这只是个下沉市场的小弟,结果居然能和一众老牌旗舰掰手腕,要是后续 V4 Pro 也用上这套组合拳,效果只会更惊艳。
最后说句实在的,Deepseek 这次的操作,算是给整个 AI 行业提了个醒:性价比和性能,从来不是二选一的难题。
更新时间:2026-08-11
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号