AI 改题改到 0 分?从 50% 到 58%,新算法解决啥?

上学时你有没有过这种经历?一道简单题填好答案,检查时突然觉得不对,改来改去交卷,结果最初的答案才是对的。现在的 AI,居然把人类这个 “坏毛病” 学了去。

前不久给 AI 喂了一道条件不完整的数学题,它明明无数次接近正确答案,却在快要给出结果时突然怀疑自己,绕了 8 分钟的漫长思考后,不仅得出错误答案,还强行给出了 “有理有据” 的解释,最后得了 0 分。难道AI 推理越充分反而越笨?

训练规则藏着推理瓶颈

这不是 AI 太笨,而是训练规则出了问题。通义实验室公开的一篇论文,给这个现象提供了有说服力的解释。

如今多数推理模型在预训练后,会经过一轮后训练,强化学习是关键方法之一。系统会按可验证的结果给奖励:答对给奖,答错无奖励,模型会往获得更多奖励的方向进化。但通义实验室的工程师发现,强化学习前后,模型多数步骤变化不大,真正拉开差距的只有少数关键转折点。

可以把 AI 做题比作开车:一条路再长,真正决定走对路的,只是某一个瞬间左转还是右转。AI 推理也是一样,不是每一步都错,而是少数关键步骤出了问题。

但知道岔路口影响推理还不够,关键是要让 AI 知道哪个方向才对。这就引出了新的问题:既然关键只有少数几步,怎么让 AI 分清哪些步骤有用,哪些是添乱的多余步骤?

多数现有的强化学习训练方法,就像只看结果的小学老师:答案对了就给分,错了就全扣分,根本没有 “过程分”。这导致 AI 在推理过程中,会混杂关键步骤和看似认真却带偏方向的多余步骤,两种步骤拿到的反馈差不多,AI 自然会糊涂,最终陷入推理瓶颈。

FIPO 算法破解推理难题

通义实验室在论文中提出了新的强化学习训练方法 FIPO。FIPO 算法重新分配训练权重,没有给每一步单独判分,而是看每一步会把后续推理轨迹引导到正确还是错误方向,再按影响大小调整训练的优先级。

这相当于给 AI 加了 “复盘推演” 能力:每迈出一步,都会在心里预判,这一步是让思路更清晰,还是把未来的自己带进沟里。经过这样的训练,AI 的推理过程会更完善,答案正确率也会提升。

论文数据显示,采用 FIPO 算法的模型,准确率从 50% 提升到峰值 58%,在同等参数和纯强化学习的设定下,成绩反超了 OpenAI 的 O one mini,也胜过了 Deepseek R E 0。

通义实验室的研究,不仅给出了针对性的解决办法,更拆解了很多人见过却没真正解释清楚的现象。AI 的每一次进步,本质上都是工程师们从海量现象中提炼问题,追踪蛛丝马迹,在修正中逼近最优解。

如今 AI 模型几乎以星期为单位迭代,肉眼可见变得更强更聪明,背后都是无数工程师把看不见的问题掰开揉碎,一步步往前推进。向每一位研究人员致敬。

展开阅读全文

更新时间:2026-08-15

标签:科技   算法   步骤   关键   模型   答案   实验室   现象   方向   工程师   方法

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top