横跨经济学、工程学和管理学的 Harness

文 | 王丰辉(资深金融研究者)

有一个词,四十五年里先后进入三个学科的专业语汇,最近又回到了出发点。这个词是 harness,本义是马具:一匹役马有的是力气,缺的是方向,把蛮力变成有用功的,是套在它身上的那副装置。

1979 年,工程学。Glenford Myers 在《软件测试的艺术》里把测试脚手架正式命名为 test harness——套在一段代码外面的那副装置,让它能被反复地、自动地验证。实践更早,NASA 阿波罗的飞行软件,1960 年代就在用这么一套东西。

1990 年,管理学。哈默在《哈佛商业评论》上喊出"别自动化,要推倒重来":别用计算机固化旧流程,要围绕计算机重新设计流程。他没有用 harness 这个词,但主张是同一个结构:新引擎进来了,别拿它去服务旧结构。

2017 年,经济学。Brynjolfsson 三个人在生产率 J 曲线的论文里提出的核心判断,用一句英文说就是:harnessing the full benefits of a new GPT requires a large amount of investments in complementary capital——要兑现一项通用目的技术的全部收益,需要大量互补性投资。harnessing,驾驭,在这里是个动词。

2024 年,这个词回到了工程学:agent harness,套在模型外面、让模型能够执行任务的那套装置。到 2026 年,harness engineering 也成了词,还是热词。

三个学科,各自独立选中同一个词,前后四十五年。管理学的收编和经济学的收编之间,找不到互相引用的痕迹,这是历史的偶然;选中的理由却是同一个结构:都有一股现成的强大动力引擎,都缺一副让它可用、可控、可验证的装置。这个同构是我自己归纳的,未必准确,下面整篇文章就算是在验证这个归纳。

模型外面是什么

说回通用智能体。

大模型本身是什么?一个无状态的 text→text 函数:读入一段文字,输出一段文字,然后什么都忘了。它不记得上一轮说过什么,不能自己执行动作,出错也不会自己重试。跟它聊天,觉得它无所不知;让它自己干完一件长程多步骤的事,它寸步难行(可查询图灵完备的概念)。

让它变成智能体的,是套在它外面的那套装置。Anthropic 在自家 Claude Code 的文档里下过一句定义,我认为是所有定义里最干净的一句:Claude Code is the harness, and Claude is the model inside it——Claude Code 是那套 harness,Claude 是装在里面的模型。

这套装置的运转是一个循环:每一轮,harness 先做上下文组装,将系统指令、对话历史、记忆文件、检索到的资料整合成完整上下文送入模型;模型读完发起工具调用;调用先过权限门禁,高危动作暂停并提交人工审批;放行的进入沙箱执行,在隔离环境里访问文件系统、执行代码;结果经验证回路检查,未通过则退回重来,通过的写回上下文,进入下一轮。循环往复直到任务完成,这个名字叫 agent loop。任务过大时,循环里还可以再开子代理——各自携带一套独立上下文的小循环,完成后将浓缩结果交回主循环。

有几个部件值得单独说。验证回路,建议升成一级组件的:任务标记"完成"之前,先跑一遍测试、规则检查,或者让另一个模型评审,做编码智能体的人给过数字——让模型自查,质量提升两到三倍。代码引擎是另一个。它在结构图上不占一个框:论接口,它是工具层里一件名叫"执行代码"的工具;论运行,它就是沙箱的发动机。但它的角色是元工具——固定工具集是一张封闭清单,预置什么就只有什么;代码是图灵完备的,没预置的能力,模型可以现场写一段程序来赋能。凡是算术、日期这类对错有唯一答案的环节,也都交给它,那是整个 harness 里唯一不依赖概率的部件。

这套装置有多重要?LangChain 做过一个实验:同一个模型,权重一个字节不动,只换一套更好的 harness,终端操作基准的通过率从 52.8% 涨到 66.5%。龙虾或者智能体现在层出不穷,有乱花渐欲迷人眼的感觉,但它最终解决的并不是模型本身的问题,还是围绕解决 harness 的调优问题。

词没变,变的是受控者

工程视角看,这个装置不是新东西。test harness 之后,机器学习时代评测基准的执行脚手架接着叫 harness,然后才是 agent harness。概念还先于词:2024 年底 Anthropic 的《Building Effective Agents》把这套循环已经讲得很透,通篇没用 harness 这个词,当时业界叫它 scaffolding,脚手架。2025 年,agent harness 成了主流叫法。

词没变,变的是受控者。test harness 面对确定性代码:输入定了,输出就定了。agent harness 面对随机性模型:同一份输入,不保证同一个输出。把一个随机系统纳入有纪律的受控环境——这项工程实践四十年前就有,只是今天第一次应用于一个会自主推理的对象。

汽车与流水线

"围绕新引擎重新设计结构",工程史上最直观的标本是汽车。油车的平台围绕发动机设计:发动机舱、变速箱、传动轴、排气,整车布局以动力总成为核心展开。电车的原生平台是滑板底盘:电池平铺在底板上,电机贴着车轮,电池包本身就是结构件。这不是把油箱换成电池,是整辆车的骨架围绕新的动力源重新设计了一遍。

反例也有现成的:油改电。在油车架构中植入电池,电池占据原油箱的位置,后排地板抬高,乘坐空间被明显压缩。引擎换了,架构没有围绕它重新设计,代价直接体现在整车参数上。

再往前,还有一个例子。流水线技术好像什么都没有改变,但是又改变了一切。流水线本身是什么?一条传送带。零件还是那些零件,工人还是那些工人,说它什么都没改变,不算过分。但福特 1913 年装配线投产之后,工厂的布局围绕它重新设计:工序被拆散,再按节拍重新编排,工人的动作被重新定义,原料的送达按分钟计算。整个工厂围绕这个引擎重新设计了自己。泰勒的《科学管理原理》比装配线早两年,把工序拆解成科学的那套方法,为流水线的工序分解提供了现成的方法论。

GPT 与互补性投资

这里需要先澄清 GPT 这个缩写的歧义。一提 GPT,想到的是 ChatGPT(Generative Pre-trained Transformer);经济学里它另有所指:General Purpose Technology,通用目的技术。判据三条:渗透几乎所有行业;本身不提供完整解决方案,只开启可能性;要兑现这些可能性,需要大量互补投入。蒸汽机、电力、内燃机、计算机都走过这条路。大模型是最新一个。

互补性投资是什么?落到企业,是一串很具体的动作:重写软件、重训员工、再造流程、重组组织、积累管理经验。这些动作有一个共同的会计特征:大部分是无形资产,在公司账上记作费用,不记作投资。钱花了,报表上只见成本上升,产出无从体现。

Brynjolfsson 和 Hitt 早在 1996 年研究几百家大企业的 IT 支出时就发现了:IT 投资本身有高回报,但只在同时重组流程、投资员工培训的企业里才能兑现,并且具有互补性。

有个微观例子。一家公司想变成数据驱动的:改人员构成,开发线上系统,教客户用数字界面。这些资源本来可以直接生产商品,现在都投进了组织知识、招聘实践、组织建设这些资产负债表上不存在的资产。

新的引擎并不是装上就会产生最大的生产效率,而是需要你整个链条跟它一起运转起来。

J 曲线

为什么叫 J 曲线?因为按这个机制,生产率的测量值先往下走、再往上走,轨迹是个 J。

前期,钱花出去了,可测的投入增加;产出端流程还在重写、员工还在培训,可测的产出没有同步增长,生产率被低估,董事会看到的是“投了这么多,怎么没效果”。后期,无形资本开始产生效益,产出显现,投入端因为漏记,统计出的生产率又转向被高估。Brynjolfsson的论文模拟出一条完整的曲线:第五到第八年坠到最低,负 1.6 个百分点,第十三四年才穿回零线。Brynjolfsson 自己的判断:AI 多半还在 J 的前半段。

这个形状不是第一次见。Paul David 1990 年研究电气化:美国第一座中心电站 1882 年投运,工厂的传动系统花了几十年才有一半改用电力。不是机器在等电,是厂房在等重新设计——蒸汽时代的每台机器都是围绕蒸汽轴的位置布置的,改电力意味着整个厂房布局推倒重来。

这儿还是要说明,J 曲线是一个假说,不是定论。

管理学为什么也能讲这个词

我自己总结,一句话,经济学算的是账,管理学算的是管理和组织这些东西。

经济学的账,是生产率统计里那笔记不进去的无形投资;管理学的动作——再造流程、培训员工、重组组织——就是那批账记不进去的无形资产本身。哈默 1990 年那一声“别自动化,要推倒重来”,给的就是具体施工方法:流程再造(business process reengineering)。文中最著名的案例是福特的应付账款部门:500 个人靠人工核对采购单、收货单、发票三套单据付款,原计划用 IT 把部门精简到 400 人,后来发现马自达做同样的事只用 5 个人。福特没有继续优化核对环节,而是围绕共享数据库重新设计流程——发票这个环节被整个取消,部门从 500 人减到 125 人。同一个数据库,用来加速旧流程省 20%,用来重新设计流程省 75%。而且这不是管理学第一次做这件事:1911 年泰勒围绕机械动力重新设计工人的动作,1990 年哈默围绕计算机网络重新设计流程,今天轮到围绕大模型重新设计组织的分工与决策权——每来一次动力革命,管理学就围绕新的动力源重新设计一次组织。

阿姆达尔定律

还有一个类似的约束,来自计算机工程的阿姆达尔定律。

Gene Amdahl 1967 年提出:无论增加多少个处理器,加速比的上限由串行部分决定。一段计算里如果有两成必须串行,剩下八成并行得再快,整体提速的天花板就是五倍。

AI 越快,串行环节越决定组织的上限,不能被 AI 优化的部分才决定整体效率。放到银行里,审批决策、风险合规,就是那些串行环节。营销文案、材料起草、报表初筛,这些环节 AI 优化得再快,整体效率的天花板还是卡在串行那一段。

这条定律和 J 曲线值得并排审视。J 曲线讲时间:收益没到账,源于统计漏记与互补性投资的滞后,时间上可以等待。阿姆达尔讲结构:就算账全部记对了,串行环节照样限定了整体提速的上限,结构上无法绕开。一个约束时间维度,一个约束结构维度。

结构问题正在发生吗?有两条证据。NBER 的工作论文调查了近六千名美国高管:69% 的公司在用 AI,其中89% 报告过去三年生产率没有变化。MIT NANDA 项目 2025 年 7 月发布的《The GenAI Divide: State of AI in Business 2025》报告给出的口径:约 95% 的企业生成式 AI 试点没有可测量的回报——这份报告的方法论正被学界批评,我把它当旁证,不当铁证。个体侧倒是有一批扎实的实验:Brynjolfsson 的客服实验里,AI 助手把新手的生产率提升了 34%。提升发生在个体,没有发生在组织——这正是引擎装上了、链条没跟着转的当代版本。

回到银行

回到银行,回到任何企业。这两年的观察:大行坐拥万卡仍称算力不足,小银行连千卡集群都难以具备。引擎的差距是明账,谁都看得见;harness 的差距是暗账——流程重写了没有,员工重训了没有,审批这条串行链重新设计过没有,报表上找不到这一栏。暗账不补,明账白花。

所以审视这一轮 AI 转型,问题不在“上没上大模型、买了多少卡”,在那句四十五年前就有人说过的话:有没有围绕这个引擎,重新设计自己。这套工程实践,当年的对象是一段代码,今天的对象是一家企业。(本文为作者观点,不代表本头条号立场)

末了,再回顾这句英文:

harnessing the full benefits of a new GPT requires a large amount of investments in complementary capital

谢谢

展开阅读全文

更新时间:2026-10-07

标签:科技   工程学   管理学   经济学   模型   生产率   流程   引擎   互补性   结构   装置   曲线   组织

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top