只干活3B参数,干翻27B:快手开源,消费级显卡拥有智能体员工

你不需要机房,不需要A100,不需要花几万块买顶级显卡。

一个在编程测试里干翻了一票30B级模型的AI程序员,量化之后19GB。一张24GB显存的消费级显卡就能把它装进去,变成你随叫随到的智能体员工。

这东西叫KAT-Coder-V2.5-Dev,快手AI团队Kwaipilot做的,7月23号刚开源,Apache-2.0协议,商用随便用,不用开放你的代码,没有用户量限制,没有任何附加条件。

35B的脑子,每次只想3B的事

先说这个模型最反直觉的地方。

它总共有350亿个参数。但你每次问它一个问题,它只动用其中30亿。

怎么做到的?MoE,混合专家架构。

你想象一家医院,里面有256个专科医生。心内科、骨科、神经科、皮肤科……什么科都有。你挂了个号说「我胸口疼」,导诊台不会把256个医生全叫来会诊,那效率太低了。导诊台看一眼你的症状,挑8个最相关的专科医生来看你。

KAT-Coder-V2.5-Dev就是这个逻辑。256个专家模块住在模型里,每次处理一个token,一个路由器(就是那个导诊台)从中选8个最对口的来干活。剩下的248个专家该休息休息,不消耗算力。

所以35B是这家医院的全部编制,决定它知识储备有多深。3B是每次出诊的医生数,决定它回答你这个问题要花多少计算量。

还有一个细节。这家医院有两种诊室。40层网络里,30层用的是线性注意力,你可以理解成医生看你的病历时,不用每次从头翻到尾,看一份压缩过的摘要就行。只有10层是全注意力,会把完整病历摊开逐字看。这个设计让它在处理超长代码文件时,显存占用比全部用全注意力的模型小得多。

官方给的数据是原生支持256k token上下文。256k大概是一本中等厚度的小说。你让它读一整个项目的代码再改bug,理论上装得下。

底座是Qwen,快手干的是「特训」

KAT-Coder-V2.5-Dev不是快手从零训练的。

它的底座是阿里开源的Qwen3.6-35B-A3B。快手做的事情叫后训练,拿一个已经很强的通用模型,往编程Agent这个方向猛训。

怎么训的?两步。

第一步,SFT,监督微调。大约100万条训练数据,覆盖10种任务类型,写新功能、修bug、重构代码、性能优化、写测试、读代码、改配置、部署上线,还有代码审查和跨文件修改。还覆盖10种编程场景,应用开发、UI工程、数据科学、机器学习、数据库、基础设施、安全工程、特殊领域编程,等等。

第二步,RL,强化学习。这步才是真正拉开差距的地方。

他们不是让模型做选择题然后判对错。他们把模型扔进真实的代码仓库沙箱里,让它像一个真正的程序员一样干活,读issue、看代码、改文件、跑测试、发现没过、再改、再跑。整个干活过程被记录成一棵决策树,模型从成功和失败的经验里自己学。

论文里提到一个很有意思的细节。训练过程中,模型一度学歪了,开始在一步之内疯狂调用几十个工具。就像一个新来的实习生,你让他修个bug,他一口气打开了几十个文件开始乱翻。快手不得不专门设计了一套惩罚机制,针对「单轮调用太多工具」「调用失败的工具」「生成空操作」「大段重复内容」这些毛病逐一纠正。

反复训了很多轮才稳定下来。

成绩,3B激活,打赢27B

数据说话。以下全部来自快手团队的统一复现,用相同的部署框架(vLLM/SGLang)、相同的Agent框架(Claude Code 2.1.195)、相同的测试条件,把各家模型下载下来自己跑了一遍。不是搬运各家官方PPT上的数字。

**SWE-bench Verified**(让AI去解决真实GitHub issue,跑通测试用例才算过)

| 模型 | 得分 | 激活参数 |

| **KAT-Coder-V2.5-Dev** | **69.40%** | 3B |

| Qwen3.5-27B | 68.60% | 27B(Dense) |

| Qwen3.6-35B-A3B | 64.40% | 3B |

| Gemma4-31B | 60.60% | 31B(Dense) |

| Qwen3-Coder-30B | 31.80% | 30B(Dense) |

你看这个对比。KAT-Coder-V2.5-Dev每次只用3B参数干活,赢了每次用27B参数的Qwen3.5。计算量只有人家的九分之一,分数还高了0.8个百分点。

跟它的底座Qwen3.6-35B-A3B比,同样的3B激活,后训练之后从64.4%拉到69.4%,硬生生拔高了5个百分点。这5个百分点就是快手那套SFT+RL训练流程的价值。

**SWE-bench Multilingual**(多语言版本,不只Python),63.00%,第二名Qwen3.5-27B是57.67%,拉开了5个多百分点。

**Scicode**(科学计算编程),44.20%,Qwen3.5-27B只有25.58%。这个差距接近翻倍。

放到整个AI编程圈里看是什么位置?SWE-bench官方排行榜上(2026年2月数据,Agent 2.0.0框架),Claude 4.5 Sonnet(high reasoning)拿了71.4%,Kimi K2.5拿了70.8%,DeepSeek V3.2拿了70.0%。KAT-Coder-V2.5-Dev的69.4%和这些闭源商业模型只差一两个百分点。当然口径不完全一样,排行榜用的是Agent 2.0.0框架,KAT-Coder模型卡用的是Claude Code 2.1.195,不同脚手架分数不能直接横比。但量级上,一个3B激活的开源模型摸到了Claude 4.5 Sonnet的脚后跟,这事本身就够离谱了。

冷水也得泼。SWE-bench的分数高度依赖Agent框架。换一个框架,排名可能变。而且快手自己在模型卡里也承认,Qwen3.6-35B-A3B在他们的测试里比官方公布的成绩低了约10个百分点,他们认为是Agent框架版本差异导致的,不是模型本身的问题。所以benchmark数字的绝对值没那么大意义,同条件横向对比才有参考价值。

还有一点。KAT-Coder-V2.5-Dev只开源了文本能力。视觉/多模态组件被砍掉了。你不能让它看一张UI截图然后还原页面,这个做不到。

消费级显卡,真能跑

原始权重BF16精度,13个文件,总共64.56GB。24GB显存的消费级显卡塞不下,差得远。

但社区已经做了一堆GGUF量化版。bartowski的量化仓库(HuggingFace上下载量3.5万)提供了从2bit到16bit的全套。

| 量化精度 | 文件大小 | 24GB显卡能跑? |

| Q8_0 | 34.38 GB | ❌ 塞不下 |

| Q6_K | 27.99 GB | ❌ 差一点 |

| Q5_K_M | 23.30 GB | ⚠️ 极限,KV cache没空间 |

| **Q4_K_S** | **19.18 GB** | **✅ 剩约5GB给KV cache** |

| Q4_K_M | 19.92 GB | ✅ 剩约4GB |

| IQ4_XS | 17.51 GB | ✅ 宽裕 |

| Q3_K_M | 15.11 GB | ✅ 很宽裕,质量有损 |

| IQ2_XXS | 9.11 GB | ✅ 能跑,质量别期待 |

推荐Q4_K_S。19.18GB,塞进24GB显存后还剩大约5GB给KV cache。日常写代码、改bug、跑Agent任务够用。你不太可能让它一次吃下256k的超长上下文(那需要巨大的KV cache),但几千行的项目代码完全没问题。

没有独立显卡?64GB内存的Mac也行。mlx-community做了MLX量化版,4bit的OptiQ版本可以用Apple Silicon的统一内存跑。速度比GPU慢,但能用。

什么都没有?还有一条路。KAT-Coder的完整版(1万亿参数、32B激活的那个大家伙)在快手的StreamLake万擎平台上可以申请API。拿到key之后配两个环境变量,直接用Claude Code调用。

对,你没看错,它兼容Claude Code。装好之后跟用Claude Code一模一样,只是背后跑的是KAT-Coder。

本地部署的话,官方推荐SGLang或vLLM。以SGLang为例。

注意这里`--tp-size 8`是官方给的8卡配置。单张消费级显卡跑GGUF量化版的话,用llama.cpp或者ollama加载更实际。

Apache-2.0,真·随便用

我专门去看了License。Apache-2.0,开源界最宽松的协议之一。

跟那些「开源但有一堆条件」的模型不一样,Apache-2.0的规则非常直白。

- 免费商用,可以。不用申请,不用报备。

- 修改后二次分发,可以。你改了训练了,随便发。

- 用在闭源产品里,可以。不需要开放你的代码。

- 用户量限制,没有。

- 收入限制,没有。

- 唯一要求,保留一份Apache-2.0的版权声明。

做个对比。Kimi K3的自定义协议规定MaaS年收入超过2000万美元要单独谈,月活超过1亿要显著标注「Kimi K3」。Qwen系列也是Apache-2.0。DeepSeek-Coder-V2用的是DeepSeek自定义协议,对商用有额外条款。

KAT-Coder-V2.5-Dev在协议这件事上,没有任何坑。个人开发者、小团队、甚至大公司拿来集成到产品里,法律层面完全没有障碍。

快手这步棋

快手做短视频的,怎么突然来卷编程模型了?

其实不算突然。Kwaipilot这个团队之前就有KAT-Dev-32B(Dense架构)、KAT-Dev-72B-Exp,还有一整套KwaiCoder系列。再往前捋,2025年9月KAT-Coder V1发布,SWE-bench Verified拿了73.4%,当时是闭源的。2026年3月V2出来,79.6%,逼近Claude Opus 4.6的80.8%。这次V2.5-Dev是7月24号开源的,69.4%。

你会发现一个有意思的事。V2.5-Dev的分数比自家闭源V2低了10个点。快手最强的编程模型是闭源的V2,开源的V2.5-Dev排第二。快手把旗舰能力留给付费API(StreamLake万擎平台),把「够用且能打」的版本开源出来赚口碑和生态。

论文里最核心的贡献其实是那套训练流程。AutoBuilder(自动把GitHub仓库变成可执行的沙箱测试环境)、SeamlessFlow(异构集群上的RL训练调度架构)、基于熵的决策树剪枝(只训练最有价值的节点,砍掉冗余计算)。

这些东西是工程壁垒。你可以下载它的权重,但你很难复现它的训练过程,因为那些沙箱环境、工具链、奖励函数设计、训练基础设施,论文里只给了方法论,没给代码。

对普通人来说,这些不重要。重要的是,一张消费级显卡,一个19GB的量化文件,一个Apache-2.0协议。SWE-bench 69.4%。

去HuggingFace搜`
bartowski/Kwaipilot_KAT-Coder-V2.5-Dev-GGUF`,下个Q4_K_S,你的AI程序员今天就能上岗。

展开阅读全文

更新时间:2026-08-03

标签:数码   快手   显卡   员工   参数   智能   模型   代码   百分点   框架   测试   协议   显存   文件

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034844号

Top