
7月17日凌晨,月之暗面上线了Kimi K3。
它的发布文,开头引了苏轼的一句话:犯其至难而图其至远者,发之以勇,守之以专,达之以强。
挑最难的事做,向最远的目标去。

这家公司的名字本就取自月亮的背面,开篇又抬手指了指最远处,那股要上天的劲儿,呼之欲出。
但真正让我停下来反复读的,不是这些,是它正文里的另一句话。
01
承认不足?
月之暗面在发布文里写:虽然Kimi K3的整体表现仍落后于最强的闭源模型Claude Fable 5和GPT-5.6 Sol,但它在我们的整套评测中展现出前沿水平的能力,并稳定超过了其他所有模型。
这句话我看了两遍。
一家公司发布自己“迄今能力最强的模型”,在通篇最显眼的位置,主动告诉全世界,我不如那两个对手。
而且它不止说了一遍。在文章最后的“局限性”里,它又写了一次:尽管Kimi K3总体上是一个非常有竞争力的模型,但与Claude Fable 5和GPT-5.6 Sol相比,在用户体验上仍有一定差距。

这不太合常理。发布会这个场合,历来是各家把自己的优势掰开揉碎讲给你听的地方,榜单可以挑着放,对手可以选着比,实在不行还能造一个只有自己第一的新指标。主动认输,等于把最好的宣传位,让给了对手的名字。
所以真正的问题不是它谦虚,是它凭什么敢这么写?
02
言外之意
答案就在它自己公布的那几张成绩单里,不过得对照着看。
先看那个最像“总分”的榜单。GDPval-AA v2考的是模型在44个职业、9个行业里的真实任务表现,K3拿了1687分,排在Claude Fable 5 Max和GPT-5.6 Sol Max之后,位列第三,但超过了Claude Opus 4.8 Max的1600分。这跟它自己承认的一致,综合第三。
但再看另一张。AA-Briefcase是Artificial Analysis专门用来测长周期智能体知识工作的榜单,K3在这里拿了1527分,位列所有模型第二,只输给Fable 5 Max,而超过了GPT-5.6 Sol Max的1495分。

你注意到那个反差了吗?
综合上,它刚刚承认自己落后于GPT-5.6 Sol。可到了“长周期的智能体活儿”这个具体的项目上,它反过来赢了对方。
还有更极端的一处。在BrowseComp这个考长周期、高难度信息搜索的测试上,K3拿到91.2分,是SOTA,也就是当前最好成绩。而且按它的说法,这是单个智能体跑出来的,没有用上下文压缩,也没有额外的上下文管理技术,靠的是那个100万token的上下文窗口硬扛下来的。
这三张单子摆在一起,意思就很清楚了。总分第三,但在“长活儿”这条线上,它是第二,甚至第一。
03
强调什么?
再往下读那份发布文,你会发现它花掉最多笔墨的地方,全是这类又具体又极难的东西。
月之暗面搭了一个内核优化的竞技场,让各家模型在自己的GPU沙箱里,用完全一样的任务和测试框架,去优化GPU内核,最多可以跑24小时。结果是:在最大思考强度下,Kimi K3的表现接近Fable 5(含回退机制),并明显领先Opus 4.8、GPT-5.6 Sol和GPT-5.5。
又一次,在这种硬活儿上,它把综合排名高于自己的对手甩在了身后。
月之暗面还从零写了一个类似Triton的GPU编译器,叫MiniTriton,在它支持的基准测试上,性能达到或超越Triton和torch.compile,部分负载上还更快。

它用连续48小时的自主运行,基于开源EDA工具和45纳米工艺库,独立完成了一颗芯片的构建、优化和验证,面积4平方毫米,集成146万个标准单元,专门用来跑一个基于它自己架构的小模型。
它还花了大约两小时,复现一项通常需要资深研究员做一到两周的天体物理计算,读了20多篇论文,评估了300多种状态方程,写出3000多行Python代码,还发现了已发表公式里的不一致。
一边是最醒目地承认自己综合不如人,一边是拿这些极难的活儿一个接一个地砸。这两件事放在一起,它想说的其实很清楚了:别拿总分衡量我,看我在这几件事上能干到什么程度。
04
王冠变了
这就要说到一件这两年正在变化的事。
“综合最强”这个头衔,在过去是极值钱的。它是王冠,戴上了就能理直气壮地比别人贵。可这一年多下来,各家模型在真实使用里的差距,正被飞快地磨平。当第二名、第三名、乃至免费开源的模型都追到了“够用”,用户就很难再为那一点点综合领先,多付好几倍的钱。
王冠还是那顶王冠,只是它能兑换的溢价,越来越薄了。
而月之暗面这次的开放方式和定价,等于把这件事挑明了。
K3是2.8万亿参数,是全球首个开源的3万亿级别模型,完整的模型权重会在7月27日前放出来,任何人都能拿去用。而它的API定价,按人民币算,每百万token输入命中缓存2元、未命中20元,输出100元。
它还专门提到,靠着Mooncake的分离式推理架构,官方API在编程场景的缓存命中率超过90%,实际的输入价格只有标准价的四分之一。

这是一门什么生意,一目了然。模型的权重是白送的,调用是按量收的,而且收得很便宜。
一个白送权重、低价卖调用的模型,本来就不靠“我最强”这三个字收钱。既然不靠它收钱,那承认自己综合不如最强,就没有任何损失。它损失不了溢价,因为它本来就没打算收那份溢价。
它要的是另一样东西:在开发者天天干活的那个具体场景里,成为最趁手的那一个。
05
至难和至远
再回头看苏轼那句“犯其至难而图其至远”,其实就是月之暗面这次发布的路线图。
至难,是它挑的那些活儿:优化内核、写编译器、设计芯片、复现论文等,这些全都不是普通用户会碰的东西,甚至不是大多数程序员每天会碰的东西。它挑的是这一行里最硬的骨头。
至远,是这些活儿的共同类型,没有一个是“回答一个问题”,全都是“独立干完一件很长的活”。例如优化内核,它跑了24小时。设计芯片,它跑了48小时。做一份行业研究,它经过120多轮递归自我改进,中间自己搜了2800多次网页,翻了87份季报、99份PDF,合计一万一千多页资料……
月之暗面在文里管这个叫“长程编程和智能体知识工作”。翻译成大白话就是,把一件需要好几天、成百上千个步骤的活儿,交给它,它自己一步步做完。
所以这次发布真正的选择是:放弃在综合分上跟人纠缠,把全部力气压在“能不能独立干完一件长活”这一条线上。挑最难的场景,做最长的任务,然后把它开源、卖得便宜。
至于综合分数排第几,用户体验差多少,它自己都替你说了,不如那两家。
06
找到属于自己的天
不过这份发布文里,最耐人寻味的一句,被放在了最不起眼的角落。
在“局限性”那一节,月之暗面列了K3的第二个毛病,标题叫“过于主动”。原文是这么写的:K3的训练重点优化了长程、高难任务,因此在任务执行过程中遇到小问题或用户意图模糊时,它可能会替用户做出非预期的决定。
它还建议,如果你的应用希望它更有边界感、别太自由发挥,最好在指令里给它加上明确的约束。

我第一次读到这儿,觉得这不像一个缺陷,倒像一个必然的代价。
你想让一个模型自己跑完48小时,独立设计出一颗芯片,中间不可能事事都停下来回头问你。它必须敢在岔路口自己拿主意,敢在信息不全的时候先往前走一步。那个让它能干完长活的东西,和那个让它自作主张的东西,本来就是同一样东西。你按“独立干完长活”去优化一个模型,就等于在训练它别那么听话。
于是一个新的取舍,第一次这么清楚地摆到了台面上:你到底想要一个特别听话、但需要你在旁边一步步指挥的助手?还是一个偶尔会自作主张、但能把活儿真正干完的员工?
这两者不太可能兼得。越是奔着“独立干完”去,就越要让渡一部分掌控感;越是要求它步步请示,它就越干不完那些长活。而每一家模型公司,在决定要不要押注长程任务的那一刻,其实都在替用户做这个选择。
月之暗面这次的答案,从它把“过于主动”写进局限性、又建议你自己加约束这个动作里,已经看得很清楚了。它选了后者,并且把管住它的绳子,递到了你手上。
所以我才说“7月17号这一天,月之暗面要换天”,这并不是说月之暗面一定要争个天下第一,而是它开始意识到,属于自己的那片天,未必在别家的头顶。
更新时间:2026-07-20
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号