跑一次最低不到7美分,四款新模型重排AI性价比

一份第三方测评榜单上,那条"同等能力里最便宜"的线,这几天被重新描了一遍。四款新模型接连挤上这条线,最便宜的一档,跑完全套测评的单次成本压到 0.068 美元。这回挪动的地方与其说是名次,不如说是"花多少钱能办多少事"的整套坐标。

那条线是怎么画出来的

发布消息的是 Artificial Analysis,一家专门给大模型做独立测评的机构。它常年盯着两个数:横轴是"每任务成本",指跑完它家一整套题平均要花多少钱;纵轴是"智能指数",由十项评测加权算出,涵盖写代码、查资料、做表格、数学推理这些硬活。

把几百个模型按这两个数画成散点,再连出前沿线。凡是落在线上的点,它的左下方都找不到别的模型。通俗说,这个价位上已经没有明显更强的对手了。前沿线往外挪一格,就意味着同样的钱能买到更多能力,或者同样的能力能少花钱。

Artificial Analysis 的"智能指数 vs 每任务成本"图

四个新面孔,四张价签

推文给出的四个点,按价格从低到高排开:

四款模型一共贡献了十一个前沿点:GPT-6 Luna 占五个,Claude Opus 5.5 占四个,MiMo-V2.6-Pro 和 GPT-6 Sol 各占一个。同一款模型为什么能占好几个点?因为推理强度可以调,用力小一点就更便宜、得分低一点,自己就撑出一小段前沿。

便宜的这一端,早不是凑合

最左边那两个点值得多看一眼。GPT-6 Luna 用不到 7 美分的单次成本换来 37 分;小米的 MiMo-V2.6-Pro 花 0.13 美元拿到 46 分,只比 48 分的 GPT-6 Sol 少两分,价钱却只有它的八分之一。

多家评测都提到,这批便宜模型比上一代价格近乎砍半,能力大体持平,个别项还略有退步。换句话说,这一轮推着前沿线左移的主要是降价。对天天要跑大量任务的团队来说,"能力不变、账单腰斩"的更新,比多挣两分实在得多。明察秋毫地拆开成本结构还能看到:这些模型的单次 token 消耗其实涨了,全靠单价下调撑着。

贵的那一端,值不值要算

最右上的 Claude Opus 5.5 是当前最高分,58 分,单次成本 5.98 美元,是 GPT-6 Luna 的八十多倍。这不代表贵就不值,最难的智能体和知识工作还得靠它顶上。但对大多数日常活计,多花出去的钱大概率换不回对等的产出。

选型因此更像量体裁衣:分类、抽取这类批量活,交给单价低的模型就够用;只有最难的少数任务,才值得请出最贵的那一档。

各方怎么看

独立测评机构给的结论很直接:新模型基本把各自的价位段填满了,同一个价位上很难再找到更强的对手。

媒体的复盘更细。有分析指出,GPT-6 这两款和上一代相比,价格减半而智能提升有限,编程能力一进一退:Sol 略涨,Luna 反而退了两分;不过幻觉率降幅明显,其中一款从九成多降到了六成。

国产这边,小米官方和北京日报都强调 MiMo-V2.6-Pro 拿下开源第一、国产第一,价格只有海外模型的二十分之一到六十分之一,在国内头部模型里也占价格优势,并称它在"智能与价格"图上做到了帕累托最优,也就是同价位里最强、同能力下最便宜。

也有批评的声音。有分析发现,Anthropic 自己发布的前沿图里,只画了对手的旗舰款,把同一天发布的便宜款晾在一边。挑图选对手这件事本身就是个提醒:别只信一家的自证材料,兼听则明,偏信则暗,几家独立榜单交叉着看才稳妥。

话说回来

前沿线往哪挪,说到底是在给"够用"重新定价。前两年要花大价钱才买得到的智能水平,如今正一档一档落到更便宜的价位上。真正值得更新的,或许不只是手里的模型,还有选型的习惯:先问这笔活值多少钱,再决定请哪一档出场。

原文链接:
https://x.com/ArtificialAnlys/status/2102833926788288704

展开阅读全文

更新时间:2026-10-04

标签:科技   美分   性价比   模型   最低   能力   美元   成本   智能   沿线   高档   价格   对手   便宜

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top