今天凌晨零时起,DeepSeek正式执行全新的API调价方案。DeepSeek-V4-Flash和DeepSeek-V4-Pro实行峰谷定价——高峰时段(北京时间9时至12时、14时至18时)价格翻倍。其中,DeepSeek-V4-Pro高峰时段百万Tokens输出价格最高达到27元,较此前的6元上涨约350%;缓存命中输入价格更是从0.025元直接拉到了0.3元,涨幅高达1100%。即便是轻量级模型V4-Flash,高峰时段输出价格也从2元涨至9元。
这标志着国产大模型行业正式告别“赔本赚吆喝”的粗放阶段,进入了一个全新的竞争周期。
但涨价只是这场变局的冰山一角。过去一周,中国大模型行业密集变阵,几乎每一天都有重磅消息。

8月13日,DeepSeek确认V4-Flash和V4-Pro将上调价格、实行峰谷计价,同时发布Harness(智能体运行框架)开发者预览版,并以MIT协议公开源代码。一天后,智谱发布GLM-5.3,该版本与GLM-5.2采用相同基座模型,仅靠后训练便将编程能力提升50%。同一天,阿里巴巴千问正式开源Qwen3.8系列模型,其中全新开源的270亿参数模型Qwen3.8-27B,“家用显卡也能跑”。
从“谁更便宜”到“谁更不可替代”——竞争的底层逻辑正在被重写。
“价格屠夫”为何举起涨价大旗
要理解这次涨价的分量,得先回顾DeepSeek是怎么一步步成为“价格屠夫”的。2024年底,DeepSeek-V3发布,训练成本仅约557万美元,同期海外同级别模型训练成本动辄数亿美元。2025年初,R1系列推出,推理成本被压到行业平均的十分之一以下。彼时整个行业的反应就两个字:离谱。
但DeepSeek的低价不是靠烧钱补贴——底牌是技术:自研的DeepSeekMoE混合专家架构、原创的MLA多头潜在注意力机制,再叠上GRPO强化学习和多token预测。这套组合拳把训练和推理成本摁到了地板上。
然而,低价策略换来了规模,也换来了代价。官方数据显示,DeepSeek的日活用户与API调用量持续攀升,V4-Flash在全球聚合平台OpenRouter的周榜上以7.22万亿Token的调用量登顶全球第一。但每一个Token背后都是真金白银的算力成本,调用量越大,亏损窟窿越大。正如荣耀高管那句曾刷屏的评论——“法拉利的性能,电动小摩托的价格”——听起来很美,却难以为继。于是从8月4日V4-Flash封神,到8月6日DeepSeek预告涨价,再到8月13日公告落地,只隔了九天。涨价不是拍脑袋,而是需求与供给双重挤压下的必然选择。
值得玩味的是,即便涨价之后,DeepSeek的价格依然远低于海外同行——V4-Pro高峰时段输出价格仅为Claude旗舰模型的约十三分之一,闲时更是只有约二十五分之一。也就是说,这次“涨价”更多是国产大模型从“极端低价”回归“合理低价”,而非真正变贵。真正被这条公告戳到的,是那些已经习惯了“白菜价”的开发者。
Harness:DeepSeek的“生态棋”
如果说涨价是DeepSeek的“防守”,那Harness就是它的“进攻”。
Harness是什么?简单来说,它是一套智能体运行框架。过去人类和AI的交互是线性的:你提问,它回答。现在进入了Agent时代——Agent要能自主拆解任务、调用工具,甚至自我修正。在这个过程中,模型本身的“智商”固然重要,但运行的“环境和约束”决定了它是否可靠。
DeepSeek Harness的设计思路是“一切皆插件”——模型、工具、技能、会话、沙箱、存储、循环、调度、UI等所有Agent能力均由插件组合而成,可自由替换、灵活重组。更有意思的是,DeepSeek的模型本身只是Harness的插件之一——开发者不仅可以接入DeepSeek的模型,理论上也可以对接市面上其他主流大模型。这一布局的深意在于:DeepSeek不想只做模型的供应商,它想做的是Agent时代的操作系统。谁掌握了Agent运行的底层框架,谁就掌握了下一代AI应用生态的入口。
左手涨价回血,右手开源生态——DeepSeek正在下一盘大棋。

三条路线,同一个方向
另一边,阿里云继续走开源路线。Qwen3.8-27B是一款原生多模态稠密模型,原生支持262K Tokens上下文长度,通过YaRN技术可外推至1M Tokens。在Agentic terminal coding测试中得分73.0,在SWE-bench Pro测试中得分61.7,在专业工作任务测试JobBench中得分33.4。更关键的是,量化后的模型可在消费级显卡上流畅运行——这意味着中小开发者和科研机构可以用更低的硬件门槛使用顶级模型。截至目前,千问已累计开源460余个模型,全球下载总量超30亿次,衍生模型数超30万个。
而智谱则押注后训练。GLM-5.3在不改变基座模型的情况下,通过后训练Scaling实现了能力跃升。在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,得分从4.6提升至28.3;在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上,得分从46.2提升至66.9。在智谱自研的Z.ai Code Bench中,GLM-5.3在High档位下达到31.4%的准确率,超过Claude Opus 4.8最高档位的29.5%,且每项任务平均输出约5万Tokens,而Opus 4.8需要约12万Tokens——用更少的算力撬动更大的性能提升。
三条不同的技术路线,指向同一个方向:大模型行业正在从“卷参数规模”转向“卷工程落地”。
全球格局正在被改写
AI模型聚合平台OpenRouter的最新数据印证了一个重要趋势:8月3日至9日当周,全球AI大模型总调用量达69万亿Token,国产AI大模型周调用量高达34.25万亿Token。中国模型在OpenRouter平台的月度Token份额已由2025年1月的6.0%飙升至2026年7月的61.5%,占比提升超十倍。最新前十大模型中,7个来自中国厂商。

更值得关注的是需求结构的变化——Agent与Coding类应用仅占应用数量的19%,却贡献了81.2%的Token用量。这意味着推理需求正从简单聊天向复杂工作流升级,智能体化任务正在成为驱动推理需求高速扩张的新引擎。
与此同时,全球开源AI格局也在经历大洗牌。Hugging Face最新报告显示,2026年以来,中国AI企业发布的最大开源模型在参数规模上显著超越美国同行——中国模型的月度参数上限在7540亿至2.78万亿之间,而美国模型在同期多数月份则低于1300亿。
DeepSeek这次涨价,表面上是价格调整,实质上是整个行业从“圈地”走向“变现”的信号弹。算力供不应求的市场格局已经形成,“夺回定价权”正在成为国产大模型行业的关键词。摩根士丹利指出,中国大模型市场的竞争重点正在从“价格战”转向“智力战”。
对于开发者来说,这意味着“免费午餐”正在减少,但同时也意味着更稳定、更可持续的服务质量。对于行业来说,这是一次从野蛮生长到精耕细作的必然转型。
而对于我们这些内容创作者来说,这是一个值得持续追踪的叙事——国产大模型正在从“追赶者”变成“定义者”,而这个过程才刚刚开始。
更新时间:2026-08-18
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号