大涨1300亿!阿里Qwen3.8-Max重磅登场,无人值守连续编程16天

8月3日,阿里巴巴正式发布旗舰大模型Qwen3.8-Max,迅速搅动整个AI行业。消息一出,阿里巴巴港股盘中大涨7.26%,市值站上2.41万亿港元。这款模型拥有2.4万亿总参数,推理激活参数950亿,不仅是千问系列迄今为止规模最大的模型,更创下一个关键突破:千问首次计划开放Max旗舰级模型权重。

过去各大厂商比拼大模型,热衷于比拼单次对话得分、答题速度。而Qwen3.8-Max把赛道换了方向:不再只追求一次性输出答案,重点打磨长周期自主任务。连续十几天独立维护项目、自主复现科研论文、调度数百个子智能体完成量化回测、自主优化芯片设计,这些真实场景测试,展现出国产大模型向“自主智能体”迈进的清晰信号。下周权重开放之后,全球开发者也将亲自检验这款旗舰模型的真实水平。

一、榜单成绩单亮眼,强弱差距依然客观

正式发布当天,Qwen3.8-Max亮相国际权威Arena榜单,多个赛道跻身全球前列。文本任务榜单位列实验室榜第二;视觉赛道拿到第二名,仅落后ClaudeFable5;前端编程榜单位列全球第四。

在多项专业基准测试中,它不断刷新国产模型上限。论文复现评测PaperBench拿到93.0分,超越GPT-5.6Sol、ClaudeFable5;模拟电脑操作的OSWorld-Verified榜单上,86.1分拿下第一;参数化CAD测试成绩同样超越海外主流旗舰。

当然,没有任何一款模型能够实现全赛道通吃。短板同样清晰可见:终端命令测试、软件工程基准SWE-benchPro、长视频理解任务中,它距离海外顶尖闭源模型仍存在差距。千问团队此前预览版阶段也曾坦诚评价,这款模型有望成为除Fable5之外实力顶尖的模型,清醒的定位,也避开了单纯跑分竞赛的浮躁。

商用定价同样具备竞争力。国内接口输入每百万Tokens12元,输出36元;海外输入2美元、输出6美元,缓存命中价格大幅降低。对比海外同类旗舰,更低的调用成本,能够降低企业、开发者落地复杂智能体应用的门槛。

二、最大看点:不用人盯,连续十几天自主完成项目

如果只看参数和跑分,Qwen3.8-Max只是又一款旗舰大模型。真正拉开差距的,是长程自主执行能力。

千问团队做了一组极具冲击力的长期实验:指令模型从零搭建命令行工具项目,构建一套可以自我迭代的开发系统。整个流程无需人员持续值守,模型自主接收需求、编写代码、运行测试、提交迭代。无人干预的16天内,完成265次代码提交、上百次功能迭代。和常规AI一次性生成代码不同,这项测试考验模型持续保存项目状态、处理报错、吸收新需求,长期维护工程的能力。

科研场景同样表现突出。拿到一篇论文题目后,模型连续工作125小时,手写七千多行代码,完成数十轮GPU训练,成功复现论文结论。不止简单复刻,它还自主提出十多种优化方案,最终找到了效果更好的数据选择策略。在天池真实算法竞赛中,它独立搭建多模态识别系统,经过45轮迭代调整,击败超过八成人类参赛队伍。

智东西还开展了一项趣味实测,让模型把《奥德赛》文本转化为可交互Three.js古希腊3D场景。初代版本就能搭建海岛、神殿和基础镜头,但画面细节简陋;持续反馈优化后,场景丰富度明显提升。客观来看,对比海外顶尖模型产出的3D虚拟世界,在场景细节、沉浸感上依旧存在差距,但证明国产模型已经打通“文字生成代码、根据视觉反馈持续修改”的混合智能体链路。

三、横跨多行业:从量化交易到芯片设计全能落地

此次升级重点覆盖编程、科研、办公、多模态、长程智能体五大方向,大量测试瞄准真实行业工作场景。

在量化研究案例中,模型仅依靠六条因子描述,自动拆分数百个研究方向,调度330个子Agent,完成6000次策略回测,自主筛选有效交易因子。面对企业合规文件,一小时标注上千条关键条款;从零设计数字银行交互原型;结合食材资料搭建完整餐饮菜单,精准控制成本;依据图纸搭建30层写字楼抗震结构模型。

最让人意外的是芯片设计测试。任务要求打造一款RSA硬件加速器,初始版本逻辑门数量高达8298个。经过500轮持续迭代优化,模型自主重构算法、精简电路架构,最终门数压缩至678个,芯片面积缩减81%,顺利实现稳定时序运行。整个过程从算法设计、代码编写、仿真测试到布局布线,全程自主完成。

电商模拟测试更贴近商业场景。模型手握10万元启动资金,在包含数千种商品、数百家供应商的虚拟市场经营一整年,还要应对供应商欺诈、突发供应链中断、大促冲击等随机事件。经过2000轮交互运营,最终资金翻至初始4.16倍,相比上一代模型能力提升一倍以上。

四、多模态能力升级,看懂长视频,学会“观察屏幕干活”

多模态是旗舰模型的标配,Qwen3.8-Max进一步补齐视觉、长视频短板。它能够一次性解析上百页财报、复杂PDF文档,自动提取图表、文字信息,输出结构化报告;支持处理最长100小时连续视频素材,梳理人物关系、时间线与事件脉络。

一个极具前景的能力是视觉驱动智能体。模型能够观察软件界面、网页画面,仅凭屏幕画面复刻各类操作系统App,不需要访问源代码。在内部复刻应用基准测试中,成绩介于GPT-5.6Sol与ClaudeFable5之间;移动端设备操作测试同样取得不错成绩。

为方便开发者搭建应用,千问同步推出扩展工具库,给各类智能体框架补充图像、视频、3D建模、CAD专业工具支持,降低多模态智能体的开发门槛。

五、开源战略加码,国产大模型进入全新竞争阶段

行业里长期存在一条潜规则:头部厂商往往只开放中小体量模型权重,最强的Max旗舰版本只提供云端API,牢牢掌握核心能力。而阿里宣布下周在HuggingFace、ModelScope开放Qwen3.8-Max完整权重,打破了这一惯例。

开源带来的改变显而易见。中小企业、科研团队不再只能依靠云端调用接口,可以本地私有化部署、自主微调,打造行业专属模型。与此同时,全球开发者会开展大规模实测,验证官方公布的各项长周期任务案例能否在外部环境稳定复现,2.4万亿参数稀疏模型真实部署成本、长时间运行稳定性,都会迎来公开检验。

放眼全球赛道,海外闭源模型依靠先发优势持续迭代;国内Kimi、DeepSeek、千问等选手不断缩小差距。竞争重心已经悄然转变:单纯比拼单次问答分数的时代慢慢过去,能不能持续稳定完成跨天数复杂工程任务、能不能适配各行各业落地需求,成为新一轮比拼核心。

Qwen3.8-Max的登场,不只是一次参数规模升级,更是国产大模型发展路线的一次清晰转向。从问答助手,向能够长期自主工作的数字劳动者进化。

客观来说,这款模型尚未实现全方位超越海外顶尖产品,部分复杂长视频、软件工程任务仍存在追赶空间。但连续自主编程、芯片设计、电商经营等实测案例证明,国产大模型已经具备承接完整工程链路的潜力。

等到下周权重正式开源,整个开发者社区将迎来一场大规模实测。后续,千问能否依靠长程智能体优势,在企业服务、云端AI生态持续兑现价值,也将持续影响国内AI产业格局。

展开阅读全文

更新时间:2026-08-05

标签:科技   阿里   重磅   模型   自主   测试   长程   智能   旗舰   赛道   权重   场景   海外

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034844号

Top