
一份第三方测评榜单上,那条"同等能力里最便宜"的线,这几天被重新描了一遍。四款新模型接连挤上这条线,最便宜的一档,跑完全套测评的单次成本压到 0.068 美元。这回挪动的地方与其说是名次,不如说是"花多少钱能办多少事"的整套坐标。
发布消息的是 Artificial Analysis,一家专门给大模型做独立测评的机构。它常年盯着两个数:横轴是"每任务成本",指跑完它家一整套题平均要花多少钱;纵轴是"智能指数",由十项评测加权算出,涵盖写代码、查资料、做表格、数学推理这些硬活。
把几百个模型按这两个数画成散点,再连出前沿线。凡是落在线上的点,它的左下方都找不到别的模型。通俗说,这个价位上已经没有明显更强的对手了。前沿线往外挪一格,就意味着同样的钱能买到更多能力,或者同样的能力能少花钱。

Artificial Analysis 的"智能指数 vs 每任务成本"图
推文给出的四个点,按价格从低到高排开:
四款模型一共贡献了十一个前沿点:GPT-6 Luna 占五个,Claude Opus 5.5 占四个,MiMo-V2.6-Pro 和 GPT-6 Sol 各占一个。同一款模型为什么能占好几个点?因为推理强度可以调,用力小一点就更便宜、得分低一点,自己就撑出一小段前沿。
最左边那两个点值得多看一眼。GPT-6 Luna 用不到 7 美分的单次成本换来 37 分;小米的 MiMo-V2.6-Pro 花 0.13 美元拿到 46 分,只比 48 分的 GPT-6 Sol 少两分,价钱却只有它的八分之一。
多家评测都提到,这批便宜模型比上一代价格近乎砍半,能力大体持平,个别项还略有退步。换句话说,这一轮推着前沿线左移的主要是降价。对天天要跑大量任务的团队来说,"能力不变、账单腰斩"的更新,比多挣两分实在得多。明察秋毫地拆开成本结构还能看到:这些模型的单次 token 消耗其实涨了,全靠单价下调撑着。
最右上的 Claude Opus 5.5 是当前最高分,58 分,单次成本 5.98 美元,是 GPT-6 Luna 的八十多倍。这不代表贵就不值,最难的智能体和知识工作还得靠它顶上。但对大多数日常活计,多花出去的钱大概率换不回对等的产出。
选型因此更像量体裁衣:分类、抽取这类批量活,交给单价低的模型就够用;只有最难的少数任务,才值得请出最贵的那一档。
独立测评机构给的结论很直接:新模型基本把各自的价位段填满了,同一个价位上很难再找到更强的对手。
媒体的复盘更细。有分析指出,GPT-6 这两款和上一代相比,价格减半而智能提升有限,编程能力一进一退:Sol 略涨,Luna 反而退了两分;不过幻觉率降幅明显,其中一款从九成多降到了六成。
国产这边,小米官方和北京日报都强调 MiMo-V2.6-Pro 拿下开源第一、国产第一,价格只有海外模型的二十分之一到六十分之一,在国内头部模型里也占价格优势,并称它在"智能与价格"图上做到了帕累托最优,也就是同价位里最强、同能力下最便宜。
也有批评的声音。有分析发现,Anthropic 自己发布的前沿图里,只画了对手的旗舰款,把同一天发布的便宜款晾在一边。挑图选对手这件事本身就是个提醒:别只信一家的自证材料,兼听则明,偏信则暗,几家独立榜单交叉着看才稳妥。
前沿线往哪挪,说到底是在给"够用"重新定价。前两年要花大价钱才买得到的智能水平,如今正一档一档落到更便宜的价位上。真正值得更新的,或许不只是手里的模型,还有选型的习惯:先问这笔活值多少钱,再决定请哪一档出场。
原文链接:
https://x.com/ArtificialAnlys/status/2102833926788288704
更新时间:2026-10-04
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号