大家好,欢迎来到「AI全球模型排行」每日播报。
今天是 2026年8月11日,我们照例为你带来三大权威榜单的最新动态。今天最大的看点在 LMArena:Meta 于 8月6日新发布的 Muse Spark 1.2 强势进入前四,而阿里 Qwen3.8-Max 则意外跌出 Top 5,竞技场格局出现微妙洗牌。
️ LMArena 竞技场

较昨日变化:Fable 微降 3 分但仍稳居榜首;Muse Spark 1.2 以 1499 分跃升至第 4,直接跳过 1.1 版本和原版,像是开了倍速快进。Qwen3.8-Max 则有些失意,从昨日第 5 名(1496)滑落至第 9(1491),一口气掉了 4 位、5 分,成为今日头部模型中跌幅最大的一位。
简评:Anthropic 依然是 LMArena 的定海神针,前三把交椅稳如泰山。Meta 的新架构 Muse Spark 1.2 发布仅五天就冲进前四,说明用户对"更聪明的 Muse"买账程度远超预期。相比之下,Qwen3.8-Max 在中文评测中威风八面,但在国际用户的盲测偏好中似乎还没找到最佳打开方式——这或许说明模型能力本身和"人类觉得好不好用"之间,还隔着一层微妙的体验鸿沟。

与昨日完全一致。Qwen3.8-Max 以 71.5 分继续领跑,和 Kimi-K3(70.7)的差距仍维持在 0.8 分,像是两位高手在紫禁之巅对峙,谁也不愿先退一步。DeepSeek 两个版本(Flash 和 Pro)继续包揽第 4、5 名,一个主打速度、一个主打精度,"左右互搏"玩得明明白白。
简评:SuperCLUE 榜单今天安静得像一潭死水——但这潭死水下暗流涌动。Qwen 和 Kimi 的冠军之争只差 0.8 分,按照这种胶着状态,任何一方的微小更新都可能打破平衡。
OpenCompass 综合评测

同样与昨日无变化。Gemini-3-Pro 以近 3 分的优势领跑,Claude-4.5-Opus 稳居第二,Qwen3-Max 以 45.3 分守住了第三的位置。
跨榜单交叉观察
今天最值得玩味的是 Qwen3.8-Max 的"偏科"表现:SuperCLUE 称霸(71.5 分)、OpenCompass 前三(45.3 分),但 LMArena 跌到了第 9。这种"中文顶尖 + 国际中上 + 竞技场遇冷"的三重画像,揭示了一个有趣的现实:模型能力、评测分数和用户主观偏好,是三件不同的事。
行业趋势方面,Anthropic 在 LMArena 依然拥有恐怖的统治力——前八名中占了六席。国产模型则继续呈现"中文强、国际待突破"的格局。
以上就是今天的榜单速报。
模型江湖,瞬息万变。明天同一时间,我们继续为你追踪 AI 最强战力。
关注「AI全球模型排行」,每天获取最新榜单动态。
更新时间:2026-08-14
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号