
小蚂蚁学AI · 不整虚的,只讲你能用上的
你有没有过这种时刻——正让 AI 帮你改一段代码,它改到一半,你余额提示"额度不足"?或者正总结一份 200 页的 PDF,它总结到 80 页,断了。
我有。而且越来越频繁。
不是项目变多了,是token 真的越来越不够用。各大厂商给的套餐看着多,实际用起来跟漏了的水桶似的。钱没少花,焦虑反而越来越大。
直到前几天,阿里千问团队扔出一枚炸弹——Qwen3.8-27B,开源、免费、能塞进你自己的电脑。
发布 48 小时冲上 Hugging Face 趋势榜第一,当天 Hacker News 登顶,Ollama 上线 38 分钟下载破万。社区直接给它封了个外号:"本地 Opus 4.6"。
我第一反应:又来?
第二反应:等等,27B 能干过 Opus 4.6?这俩差了一个数量级啊。
第三反应:算了,先装再说。
装完跑了一周,我回来告诉你:这模型确实有点东西,但没网上吹的那么神。
Qwen3.8-27B,270 亿参数,稠密模型。
"稠密"啥意思?就是每生成一个字,270 亿参数全员上岗,不像 MoE 模型只派一小队人。
这有啥好处?稳定、可预测、部署简单。没有 MoE 那种"门控路由"的复杂度,Ollama、llama.cpp、vLLM 原生支持,不用折腾专家加载策略。
代价是:它比同尺寸的 MoE 模型吃更多显存。但阿里用了一个巧妙的办法解决了(后面第 4 节讲)。
几个关键数字: - 262K 原生上下文,用 YaRN 技术能扩展到 1M - 原生多模态,能看懂图片和视频(注意:是看懂,不是生成) - Apache 2.0 协议,随便下载、随便商用、不要钱 - 还有个大哥 Qwen3.8-2.4T-A95B(Max 级别),也开放了权重,但那个体量普通人根本跑不动
小蚂蚁划重点:如果你平时用 AI 是"帮我写脚本""帮我读长文档""帮我看看这张截图",这模型对味。想让它画图?出门左转找 Flux。
这是最容易被忽悠的地方。
官方模型卡上的跑分确实吓人:
测试项目 | Qwen3.8-27B | Claude Opus 4.6 Max |
SWE-bench Pro | 61.7 | 53.4 |
LiveCodeBench v6 | 90.3 | 88.8 |
Terminal Bench 2.1 | 73.0 | 78.2 |
GPQA Diamond | 89.2 | 91.3 |
4 个测试里 2 个超过 Opus 4.6 Max,看着很猛。
但先打对折听。
这些全是官方自己跑的分,不是第三方独立验证。而且官方跑分几乎全是在 Claude Code 这个编码 Agent 框架上跑出来的——也就是说,这模型跟 Claude Code 配合最好,换个体感可能不一样。
第三方榜单也出来了: - Artificial Analysis Agentic Index:51 分,排第 7 - Agents' Last Exam:42.9%,保住自家旗舰 Qwen3.8-Max 八成以上水平
51 分什么概念?比前代 Qwen3.6-27B 的 28 分高出一大截,也压过了 DeepSeek V4 Pro 和 GPT-5.6 Luna。但前面还站着 Claude Opus 5、GLM-5.3、Grok 4.6 三个 59 分的。
准确说法:本地模型第一次挤进了第一梯队,但离"干翻所有闭源旗舰"还差得远。

我自己实测下来:日常编程和 Agent 任务,它跟云端旗舰的差距已经小到要刻意分辨才感觉得出来;真正复杂的长推理任务,云端还是更稳。
这是我觉得最值得讲的部分。
传统稠密模型有个致命问题:KV cache 爆炸。
你可以把 KV cache 理解成模型的"工作记忆"——每读一个 token,它都要记一笔账,上下文越长,账本越厚。很多模型长上下文跑不动,不是模型本身装不下,是账本先爆了。
Qwen3.8-27B 玩了招狠的:64 层里只有 16 层用全注意力,剩下 48 层换成 Gated DeltaNet 线性注意力。
啥意思?别人每笔流水都留着,它只记余额。
效果是:KV cache 大约只有同尺寸传统模型的四分之一。27B 的身板扛 262K 上下文,靠的就是这个。
另外它内置了 MTP(多 token 预测),一次预测多个 token,相当于自带一个草稿手,先打草稿再确认,速度白捡一截。

小蚂蚁划重点:这就是为什么 27B 能跑在消费级显卡上——不是阿里有魔法,是架构创新。Gated DeltaNet + MTP,一个省显存,一个加速。
直接给结论:
配置 | 能跑吗 | 体验 |
24GB 显卡 / 24GB 内存 Mac | ✅ 底线入场券 | 跑 4bit 量化版,约 17GB,聊天够用 |
32GB Mac | ✅ 舒服档 | 上下文能开得长一些 |
48GB 以上 | ✅ 推荐 | 可以上 8bit,质量接近无损 |
16GB 及以下 Mac | ❌ 别折腾了 | 装不下 |
速度上要有心理预期: - M4 Max 跑 MLX 4bit:约 23 tok/s - M5 Max 跑优化 4bit + MTP:50-60 tok/s - RTX 5090 开 MTP:90-120 tok/s
我自己是 M5 Max 128G,用 Ollama 跑 4bit 版,实测大概 25 tok/s 左右。聊天和一般任务够用,跑长任务得有耐心。
4bit 和 8bit 怎么选? 一句话:内存够就 8bit,嫌慢就 4bit。4bit 快接近一倍,质量损失日常聊天感知不强,但长推理任务会偶尔露怯。


# 1. 安装 Ollama(如果还没装) # macOS/Linux: curl -fsSL https://ollama.com/install.sh | sh # Windows: 去 https://ollama.com/download 下载安装包 # 2. 拉取模型(默认 INT4 量化版,约 17GB) ollama pull qwen3.8:27b # 3. 运行对话 ollama run qwen3.8:27b # 4. 开启 OpenAI 兼容 API(默认端口 11434) ollama serve 装完就能用,支持 OpenAI API 格式,任何兼容 OpenAI 的工具都能直接接。
# 1. 下载量化模型权重(Q4_K_M 约 17GB) # Hugging Face: https://huggingface.co/Qwen/Qwen3.8-27B-GGUF # 魔搭社区(国内更快): https://modelscope.cn/models/Qwen/Qwen3.8-27B-GGUF # 2. 编译 llama.cpp git clone https://github.com/ggerganov/llama.cpp cd llama.cpp && make -j$(nproc) # 3. 启动推理服务 ./llama-server \ -m qwen3.8-27b-q4_k_m.gguf \ -c 32768 \ -ngl 999 \ --host 0.0.0.0 \ --port 8080 # 4. 测试 API curl http://localhost:8080/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"qwen3.8-27b","messages":[{"role":"user","content":"用Python写个快速排序"}]}' pip install vllm python -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen3.8-27B \ --quantization awq \ --tensor-parallel-size 1 \ --max-model-len 65536 vLLM 优势:连续批处理、PagedAttention,吞吐量比 llama.cpp 高 3-5 倍。
开头说了,官方跑分几乎全是拿 Claude Code 跑出来的。这模型目前搭配上 Claude Code 效果最好。
接入也简单,Ollama 原生支持:
ollama pull qwen3.8:27b ollama launch claude --model qwen3.8:27b 两条命令,Claude Code 的后端就换成本地模型了。
现在 Claude Code 接本地模型,完全不用担心封号的问题,没有 API 费用,没有额度焦虑,Agent 随便跑,token 随便烧,代码不出你自己家门。
这就是我说的 token 自由。
对代码不能出内网的公司来说,这基本是目前最值得评估的方案。
⚠️ 体感上的关键点:拿它接 Claude Code 这种 Agent,决定流畅度的其实不是生成速度,是"读档"速度。Agent 每干一轮活,都得把前面的聊天记录、工具结果、代码片段从头到尾重新通读一遍才能开工。轮数越多,要重读的东西越厚。短任务聊着很顺,上下文堆到几万字之后,每一轮开工前的等待会明显变长。所以拿来当 CC 后端,内存带宽比 tok/s 数字更值钱。
光说没用,上场景。
需求: 我有一份客户修图需求的 Excel 表,里面有 200 多条记录,每条包含客户名、修图类型、原片路径、交付状态。我想让 AI 帮我按"修图类型"分类统计,并生成一份 Markdown 报告。
我把 Excel 转成 CSV,连同需求一起丢给本地 Qwen3.8-27B(通过 Ollama API):
import requests, json, csv from collections import Counter # 读取 CSV with open("修图需求.csv", "r", encoding="utf-8") as f: reader = csv.DictReader(f) rows = list(reader) # 统计 types = Counter(r["修图类型"] for r in rows) pending = [r for r in rows if r["交付状态"] == "待处理"] # 构造 prompt prompt = f"""以下是修图需求统计数据: - 总计 {len(rows)} 条记录 - 各类型分布:{dict(types)} - 待处理 {len(pending)} 条 请生成一份 Markdown 报告,包含: 1. 总览表格 2. 各类型占比(用文字描述,不要画图) 3. 待处理清单(按客户名排序) 4. 简短建议""" # 调用本地 Qwen3.8-27B resp = requests.post( "http://localhost:11434/v1/chat/completions", json={ "model": "qwen3.8:27b", "messages": [{"role": "user", "content": prompt}], "max_tokens": 2000 } ) print(resp.json()["choices"][0]["message"]["content"]) 它吐出来的报告结构清晰,数据准确,还主动提醒我"古风调色类占比最高(32%),建议优先安排人手"。
全程没花一分钱 API 费用,数据没出我电脑。
新模型发布第一周,吹捧的声音都打对折听。这模型用下来,社区也发现了一些尚待打磨的细节。
1. 默认推理档位太疯
默认的 xhigh 推理档位会疯狂过度思考。国外开发者 Simon Willison 实测,让它画个 SVG 圆圈,它能就"要不要加同心辅助圆"这种问题琢磨半天。一张骑自行车的鹈鹕 SVG,整整想了 21 分钟,烧掉两万多个推理 token。
他文章的标题直接就是:"很优秀,但默认疯狂过度思考"。
建议:日常使用,把 reasoning_effort 调到 medium 或者 low。
2. Token 消耗是上一代的 3 倍
有人把 3.8 和上一代 3.6 并排实测,答案质量 3.8 确实赢(10 个任务赢 9 个),但代价是平均 token 消耗几乎是 3.6 的三倍。
这个缺点放在本地跑倒没那么致命,反正烧的是自己家的电。但如果你打算调 API 按量计费,这个账得算清楚。
3. 知识截止有点迷
有人问它训练数据到什么时候,它自己答 2026 年,一追问 2024 年之后的具体事就露馅。不知道自己不知道,用的时候留个心眼。
4. 1M 上下文目前还是 PPT 数字
官方说用 YaRN 能扩展到 1M,但实测大家跑到的都是 262K。1M 是给尺子末尾硬接了一段估算刻度,量是能量,精度没经过校准。
5. Agent 跑长任务记得把输出长度配额开大
官方专门提醒了这点,默认的 max_tokens 可能不够用。
直接给结论:
说实话,Qwen3.8-27B 现在还替代不了我的生产主力,真正做项目,我还是会打开云端。
但它的意义不在今天。
在 token 越来越不够用的时代,本地模型第一次摸到了"能用"的门槛。
按这个速度走下去,完全够格的生产级本地模型,早晚会出现。到那时候,智能不用按月订阅,就住在你自己的电脑里。
这一定是未来发展的方向。未来我们的每个电脑、每部手机都该本地常驻一个 AI 大模型。
它不需要你打开网页,不需要你登录账号,也不需要每个月付几十、几百块钱的订阅费。
这件事情真正重要的地方,其实不是"免费"。
而是控制权开始回到你手里。
过去我们使用 AI,本质上是在租用别人的智能。模型跑在别人的服务器上,算力掌握在别人手里,数据经过别人的 API,能力有多少、限制是什么,也由别人决定。
而本地 AI 模型的终局,可能是:智能像电一样,插上电就有。
Qwen3.8-27B 这次发布,最值得关注的,不是它能不能干掉 Opus 4.6。
它让我们每个普通人明白:AI 大模型可以住进自己的电脑和手机。
这可能比"又出了一个更加强的模型",更加重要。
本文实测信息截至 2026 年 8 月,模型能力/跑分/部署方式以阿里千问官网和 Hugging Face 当前页面为准。写稿时参考:阿里千问官方开源公告、Hugging Face 模型卡
更新时间:2026-08-24
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034844号