AI模型榜单日报 | 202611 Muse Spark 1.2 杀入 LMArena 前四

大家好,欢迎来到「AI全球模型排行」每日播报。

今天是 2026年8月11日,我们照例为你带来三大权威榜单的最新动态。今天最大的看点在 LMArena:Meta 于 8月6日新发布的 Muse Spark 1.2 强势进入前四,而阿里 Qwen3.8-Max 则意外跌出 Top 5,竞技场格局出现微妙洗牌。

LMArena 竞技场

较昨日变化:Fable 微降 3 分但仍稳居榜首;Muse Spark 1.2 以 1499 分跃升至第 4,直接跳过 1.1 版本和原版,像是开了倍速快进。Qwen3.8-Max 则有些失意,从昨日第 5 名(1496)滑落至第 9(1491),一口气掉了 4 位、5 分,成为今日头部模型中跌幅最大的一位。

简评:Anthropic 依然是 LMArena 的定海神针,前三把交椅稳如泰山。Meta 的新架构 Muse Spark 1.2 发布仅五天就冲进前四,说明用户对"更聪明的 Muse"买账程度远超预期。相比之下,Qwen3.8-Max 在中文评测中威风八面,但在国际用户的盲测偏好中似乎还没找到最佳打开方式——这或许说明模型能力本身和"人类觉得好不好用"之间,还隔着一层微妙的体验鸿沟。

与昨日完全一致。Qwen3.8-Max 以 71.5 分继续领跑,和 Kimi-K3(70.7)的差距仍维持在 0.8 分,像是两位高手在紫禁之巅对峙,谁也不愿先退一步。DeepSeek 两个版本(Flash 和 Pro)继续包揽第 4、5 名,一个主打速度、一个主打精度,"左右互搏"玩得明明白白。

简评:SuperCLUE 榜单今天安静得像一潭死水——但这潭死水下暗流涌动。Qwen 和 Kimi 的冠军之争只差 0.8 分,按照这种胶着状态,任何一方的微小更新都可能打破平衡。

OpenCompass 综合评测

同样与昨日无变化。Gemini-3-Pro 以近 3 分的优势领跑,Claude-4.5-Opus 稳居第二,Qwen3-Max 以 45.3 分守住了第三的位置。

跨榜单交叉观察

今天最值得玩味的是 Qwen3.8-Max 的"偏科"表现:SuperCLUE 称霸(71.5 分)、OpenCompass 前三(45.3 分),但 LMArena 跌到了第 9。这种"中文顶尖 + 国际中上 + 竞技场遇冷"的三重画像,揭示了一个有趣的现实:模型能力、评测分数和用户主观偏好,是三件不同的事。

行业趋势方面,Anthropic 在 LMArena 依然拥有恐怖的统治力——前八名中占了六席。国产模型则继续呈现"中文强、国际待突破"的格局。

以上就是今天的榜单速报。

模型江湖,瞬息万变。明天同一时间,我们继续为你追踪 AI 最强战力。

关注「AI全球模型排行」,每天获取最新榜单动态。

展开阅读全文

更新时间:2026-08-14

标签:科技   模型   日报   竞技场   昨日   简评   用户   战力   中文   国际   微妙   格局

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top