【8月21日多榜速递】国产稳占四席,DeepSeek 通吃三榜

朋友们好,今天ai模型全球榜单内容更新,去掉之前繁杂的模型版本,按照公司进行排名,每个公司只选最强的模型重组榜单,希望能给朋友们更直观的对比结果。


首先快速过一下权威三榜内容


公司深度分析(按上榜表现排序)

【Anthropic】 LMArena 公司榜第 1(Claude Fable 5,1507),OpenCompass 第 3(Claude Opus 4.7,64.0)。8 月主旋律是安全与召回——Fable 5 / Mythos 5 因网络空间能力被美国商务部出口管制指令召回(据 AI Tools Review 8 月报道),RSP v3.0 安全框架升级,ASL-4 门槛下下一代 Mythos 级模型已命名但按兵不动。企业侧,Claude 3.1 Guardian 在金融合规监控落地(与 MiFID II 框架对齐),多云战略新增 Oracle OCI。8 月 10 日起为 Claude 输出加不可见文本水印 + C2PA 文件签名,应对欧盟 AI Act 第 50 条(来源:AI/TLDR Daily Digest 8 月 11 日)。

【OpenAI】 LMArena 公司榜第 7(GPT-5.6 Sol xHigh,1482),OpenCompass 第 1(GPT-5.4,67.3)。这是按公司去重后 OpenAI 首次回到前 10(原始榜第 18 名)。GPT-5.5(代号"Spud")4 月发布,GPT-5.6 系列(Sol/Terra/Luna)7 月 9 日上线,8 月 1 日命名下一代模型 Astra,8 月 7 日声明初步评估可能触及"Critical"网络安全能力阈值(OpenAI 把对应的 GPT-5.6-Cyber 锁在 Daybreak Red 验证渠道)。侧重点:实时多模态(GPT-5.5 Omni 视频+音频流)、Agent Swarms(法律/财务/招聘 85% 流程已自动化)、与微软合建北欧超算训练下一代。价格端被 DeepSeek 倒逼,GPT-5.6 Luna 8 月降价 80%

【Moonshot 月之暗面】 LMArena 公司榜第 4(Kimi K3 Max,1490),SuperCLUE 第 2(70.68),OpenCompass 第 5(Kimi K2.6,63.4)。Kimi K3 7 月 17 日发布,2.8 万亿参数,KDA 混合线性注意力,原生搭载视觉理解、百万词元上下文,拿下 Frontend Code Arena 编程榜首——开源模型首次超越头部闭源登顶。WebDev 子榜冲至第 2,国产首次进前 3。侧重点:Agent(Swarm 智能体集群、Goal 目标驱动模式)、Agentic Coding、3D 游戏生成、咨询级 PPT。

【Alibaba 阿里】 LMArena 公司榜第 6(Qwen3.8-Max,1482),SuperCLUE 第 1(71.48),OpenCompass 第 7(Qwen3.6-Max-Preview,60.8)。Qwen3.8-Max 8 月 3 日发布,总参数 2.4 万亿,激活 95B,100 万 Token 上下文,编程+专业办公能力大幅提升。8 月 13 日开放 Qwen3.8-2.4T-A95B 权重——阿里首次将 Max 级旗舰对外开放权重。CodeArena 全球第 4,可自主编程 16 天复现论文、2000 轮交互经营虚拟电商企业(千问团队实测)。同步推出企业级 Agent 产品"千问办公"。港股当日涨超 6%。

【DeepSeek】 LMArena 公司榜第 9(V4-Pro High,1462),SuperCLUE 第 3(V4-Pro max,70.10,今日官方版新上榜),OpenCompass 第 2(V4-Pro,65.1)——三榜通吃。V4-Flash 7 月 31 日正式版 API,V4-Pro 8 月 13 日正式版。据 SemiAnalysis 8 月 13 日评估,V4-Pro 和 V4-Flash 在 Agent 相关测试中甩开参数更大的英伟达 Nemotron 3 Ultra。V4-Pro 训练成本仅 560 万美元,对比 GPT-4 的 1 亿+ 美元,差 20 倍;推理成本 0.14 美元/百万 Token。融资 500 亿元进行中,投前估值超 5000 亿元。

【Zhipu 智谱】 LMArena 公司榜第 5(GLM-5.3 Max,1484),SuperCLUE 第 5(GLM-5.2 max,63.27),OpenCompass 第 8(GLM-5.1,59.0)。GLM-5.3 8 月 14 日正式发布,通过后训练提高智能上限,在 Terminal Bench 3.0、Agents' Last Exam(CLI)等公开基准测试中取得开源第一。智谱港股盘中一度涨超 9%。侧重点:推理增强、Agentic Coding、国产芯片适配(寒武纪 FP8+Int4 混合量化)。

【ByteDance 字节】 SuperCLUE 第 4(Doubao-Seed-2.1-pro,65.94),OpenCompass 第 4(Doubao-Seed-2-0-Pro,63.5),LMArena 未进公司榜前 10。侧重点:多模态推理(Doubao-Seed 全家桶)、TikTok 内容生态、视频生成(Seedance 2.0/2.5 已全面接入豆包)、To B 业务(豆包 + 火山引擎组合重排 To B)。

权威观点援引

国产 vs 海外 格局

公司榜前 10 里,海外三榜分别 5/0/3 席,国产 5/10/7 席——SuperCLUE 完全国产化(它本身只评国产),LMArena 海外略多(Anthropic 文本榜近乎垄断),OpenCompass 国产 7 席压倒性。

开闭源博弈上,三榜都给出强信号:DeepSeek 开源压制 OpenAI 闭源(OpenCompass 仅差 2.2 分),阿里 Qwen3.8 开放 Max 级旗舰权重,Meta 预告开源 Muse Spark 1.2,Anthropic 走"可信优先 + 召回"路线——开源阵营在 2026 年 8 月已实质接管中下游,把"训练成本 = 护城河"的老叙事直接打碎。

跨榜单交叉观察

DeepSeek 是三榜通吃的"全能选手"(LMArena 9、SuperCLUE 3、OpenCompass 2);Anthropic 在 LMArena 文本榜近乎垄断但 OpenCompass 仅第 3、中文榜缺席——典型"国际霸主+中文短板";Kimi K3 在 LMArena / SuperCLUE / OpenCompass / WebDev 四条线都在前 10,是国产少有的全能型。Alibaba 三榜都有姓名但位次分化(SuperCLUE 1、LMArena 6、OpenCompass 7),国际化 + 中文主场双线作战。

展开阅读全文

更新时间:2026-08-22

标签:科技   通吃   速递   公司   模型   侧重点   阿里   权重   成本   英伟   参数   中文   豆包

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top