一场围绕“蒸馏”的暗战,正在全球AI行业掀起惊涛骇浪。
2026年春天,OpenAI、Anthropic与谷歌三家硅谷巨头罕见联手,通过“前沿模型论坛”共享信息,联手打击所谓的“对抗性蒸馏”行为。Anthropic发布报告称,有迹象表明部分流量来自与深度求索、稀宇科技和月之暗面相关的账户,并指控其进行了总计超1600万次的对抗性交互。到了6月,指控升级——Anthropic称阿里巴巴通过约2.5万个虚假账号,在4月22日至6月5日期间与Claude进行了2880万次对话互动。
账号被封、API被限、政策打压接踵而至。然而,当整个行业都在靠“白嫖”海外巨头输出数据快速冲榜时,有一家公司偏偏掀翻了牌桌——字节跳动创始人张一鸣在Seed全员会上明确表态:不做模型蒸馏。哪怕团队经历了三次痛苦的路线争论,哪怕眼睁睁看着竞品靠捷径杀入全球第一梯队,字节还是扭头去啃一块超过5万亿参数的硬骨头。

放着唾手可得的答案不抄,偏要押注高不确定性的底层自研——这背后到底藏着怎样的算计?
要看清这场风暴,得先搞明白“蒸馏”到底是怎么回事。
2015年,“深度学习之父”杰弗里·辛顿等人明确提出这一概念时,它是个相当优雅的技术手段。大模型做“师傅”,小模型当“徒弟”,徒弟通过观察师傅的输入输出,学习其解决问题的思路和方法,最终实现能力复刻。目的很简单:把臃肿的大模型压缩成能在手机上流畅运行的小体积,牺牲一点点精度换效率。
但到了2026年,事情彻底变味了。
过去你得拿到对方模型权重才能干活,现在只要一根网线,通过API接口向海外最强闭源模型疯狂发问,把吐出来的高质量数据收集起来,就能训练自己的模型。更狠的是,o1这类具备长思维链的模型和智能体浪潮兴起后,AI不仅给答案,还把一步步解题的完整思考轨迹全盘托出。以前只能偷看学霸的期末成绩单,现在直接把人家三年的草稿本和错题集全复印了。
不过,这早就不是写几行Python脚本就能搞定的草台班子游戏了。海外巨头布下了天罗地网——异常流量识别、账号风控、隐形水印、指纹触发器,手段层出不穷。大规模黑盒蒸馏已经变成一场工业级的攻防暗战:得养着庞大的真实账号矩阵,模拟自然的人类提问分布,拿到数据后还要清洗、去重、格式对齐,甚至动用改写、回译等手段洗掉预埋的印记。

Anthropic、OpenAI公开发表技术博客,点名指责中国AI实验室进行“蒸馏攻击”、窃取知识产权。美国高级官员更是公开表示要对此展开调查,甚至以“窃取美国知识产权”为由制裁中国企业。
但这里面有个极其滑稽的双标。
如果你翻过大模型的发展史就会知道,OpenAI们在训练自家基座模型时,不也是毫不客气地把全人类在互联网上留下的新闻、网页、书籍乃至版权画作抓取一空吗?凭什么你抓取人类的智慧结晶叫“技术颠覆”,我花钱调用你的API获取生成数据就成了“无耻偷窃”?
商务部的回应一针见血:美方罔顾中国企业AI模型与美国前沿模型发布时间非常接近、中国部分模型能力已处于领先地位等事实,给中国企业扣上所谓依靠“蒸馏”“窃取美国知识产权”的帽子。这些做法缺乏事实依据,没有法理支撑,在实践上搞双重标准,属于典型的人工智能霸权主义行径。据了解,很多美国人工智能企业在研发和训练中蒸馏了中国的模型。
抛开道德与法律的口水战,蒸馏真正的致命问题在于天花板。
如果一个模型的数据营养全部仰赖另一个更强的模型,它的能力上限就被锁死了。学生最多只能无限逼近老师,很难真正超越。你复刻了别人的认知模式,就丧失了长出全新能力边界的机会——在商业上永远是跟跑者,主导权永远攥在别人手里。
更可怕的代价在组织内部。这就像给运动员喂兴奋剂——一旦团队发现靠白嫖数据几个月就能把榜单刷到全球前三,谁还愿意去干那种周期长达数年、充满失败风险的原生预训练?劣币驱逐良币,组织的底层研发韧性会在短期快感中被彻底腐蚀。

正是在这种背景下,字节跳动内部那场路线之争才格外惊心动魄。
据媒体报道,从2025年开始,Seed内部至少发生过三次关于“蒸馏”的重要路线争论。第一次是2025年1月,DeepSeek-R1发布后以有限的训练成本展现出强大推理能力,给国内头部实验室带来巨大压力。Seed内部的研究员很焦虑——人才密度、算力投入都不弱,但模型表现却没达到R1的水平。有人建议引入美国头部闭源模型的生成结果来补短板。
第二次是英伟达Blackwell系列GPU大规模在美国部署商用后。由于高端GPU对华出口管制,中国实验室拿不到性能最先进的芯片。算力差距赤裸裸地摆在面前,有人提出至少把蒸馏作为过渡性保命手段。
第三次是Kimi K3发布,被多项第三方评测认为已接近海外闭源旗舰。一个小团队竟然杀入全球第一梯队,大厂的焦虑几乎到达顶点。
三次试探,三次被否决。
张一鸣在Seed全员会上明确表示:训练大模型本就困难,团队可以接受一段时间的落后。他反对蒸馏,认为这能在短期内改善模型表现,但本质上还是在复制Claude已有的能力——沿着这条路走,最多只能不断逼近,很难真正实现超越。字节跳动“应该愿意为长期目标牺牲一部分短期收益”。
字节内部不仅限制美国前沿模型的蒸馏,对开源模型同样严禁,甚至通过API检测等手段加强内部管控。早在2023年4月,字节就明确要求不得将GPT生成的数据加入训练数据集。红线画得清清楚楚。

放弃短期红利的同时,字节把筹码推向了另一张更疯狂的牌桌。
据《晚点LatePost》报道,字节跳动正在讨论训练一个参数规模超过5万亿的模型。这超过了阿里的Qwen 3.8-Max(2.4万亿参数)和月之暗面的K3(2.8万亿参数),是目前国内已知参数规模最大的模型。该计划仍处于早期阶段,模型最终不一定会发布。新模型将由Seed Foundation负责人项亮主导,与大语言模型预训练数据负责人沈科合作。
这是一条成本更高、结果也更难预测的路线。5万亿参数可以扩大模型容量,却不能自动解决数据质量、训练稳定性和能力涌现的问题。参数规模如果不能与架构、数据和训练方法同时升级,最后可能只得到一个更昂贵的模型。
8月6日,字节跳动CEO梁汝波在全员会上承认,公司大语言模型与海外领先模型的差距正在扩大。他要求团队接受一段时间的落后,坚持自研和长期优化。
宁可慢也要把根基扎透——这种定力在极度浮躁的AI圈显得异类。

当下的局面很微妙。依靠蒸馏起家的中等规模团队,能用极低的成本线直接“斩杀”那些投入巨大但能力尚未拉开代差的原生模型。
但蒸馏改变不了游戏规则。
人民日报评论指出,中国大模型的进步源于实打实的自主创新,绝非“蒸馏”式模仿——“蒸馏”只是机械“刷题”的肌肉记忆,而中国模型能实现“举一反三”的突破。DeepSeek公司2025年9月登上《自然》杂志封面的研究论文证明,其R1推理模型的训练数据全部来自互联网,与竞争对手输出数据无关。
大模型进化的终极法则尚未可知。如果智能水平提升真的是无尽的,算力可以支撑递归自我改进一路狂奔,那么手握最强教师模型的巨头会把差距越拉越大,今天的蒸馏跟风者不过是在捡芝麻。但如果AI的能力天花板很快逼近,智能涌现的速度开始放缓,蒸馏就会成为最恐怖的平权机器。
但无论剧本怎么写,有一点是确定的:靠投机取巧拼凑出来的流水线,成不了护城河。你能搭出风控绕过的脚本,别人也能;你能清洗出对齐的格式,别人更便宜。真正能在这个修罗场里活到大结局的,绝不是把别人草稿纸抄得最快的人,而是那些咬着牙、忍着痛,一行行夯实自家底层算力基础设施和原生数据飞轮的少数派。
5万亿参数的赌局才刚刚开局。谁在裸泳,底牌揭晓那天自会见分晓。
更新时间:2026-08-18
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号