美国AI研究员突然辞职,放出警告:10年内,人类真可能被AI消灭

最近美国人工智能圈突然冒出一个很反常的现象。以前科技公司发布新模型,大家争的是参数、算力、融资和谁更聪明;到了2026年9月,站出来抢头条的却变成了安全警告。Anthropic研究员Jacob Coxon辞职后公开表示,领先的AI公司正在向能够自我改进的超级智能冲刺,这种竞争可能拿全人类的安全下注。一个在前沿模型训练一线工作的人主动离场,事情自然比普通的公司人事变动更值得关注。

先把网上最容易传错的一件事讲清楚。Coxon确实辞职了,此前还曾在OpenAI工作,但“未来十年AI消灭全人类的概率超过10%”并不是Coxon给出的数字。这个判断来自Anthropic对齐研究负责人Evan Hubinger,他是在回应Coxon辞职风波时公开作出这一风险估计。两个人的观点方向接近,却不是同一句话,更不能写成“美国研究员辞职时宣布十年后人类会灭亡”。这是风险判断,不是已经得到科学验证的倒计时。

真正值得琢磨的是,为什么2026年的AI研究人员比两三年前明显更紧张了。原因并不神秘:模型的能力边界已经变了。早期生成式AI主要负责聊天、写文章、画图,犯错大多停留在信息层面。现在前沿模型正在变成“智能体”,不仅回答问题,还能连续规划任务、调用软件工具、写代码、访问外部系统。AI一旦从“给建议”走到“自己执行”,安全问题的性质就跟着发生变化。

一个最新例子就很说明问题。OpenAI在2026年9月发布GPT-6 Astra时,首次把一款广泛部署模型的网络安全能力评为其安全框架中的“Critical”级别。按照OpenAI自己的解释,在拥有适当工具和访问权限的条件下,该模型能够寻找此前未知的软件漏洞,并研究针对防护较强系统的新攻击办法,而且不需要人在每一步进行指导。这意味着讨论AI风险,已经不能只盯着虚假新闻或者学生用AI写作业了。

这才是这轮争论与过去“机器人毁灭世界”故事最大的区别。现实中的危险未必需要AI突然拥有所谓自我意识。一个没有感情、没有仇恨的系统,只要拥有足够强的代码能力、持续运行能力和系统权限,同样可能制造严重后果。军事领域更容易理解这一点:无人平台并不需要“恨”谁,只需要目标识别错误、通信链路遭到干扰或者授权机制设计失误,就可能把一个技术错误迅速放大。

再往深处看,研究人员真正头疼的是“能力增长速度”和“控制能力增长速度”并不一定同步。模型每隔一段时间就可以通过更大的算力、更好的算法、更优质的数据和AI辅助研发获得提升,可安全验证却需要大量测试。更麻烦的是,模型越来越聪明以后,测试本身也可能变得困难。研究人员要判断的已经不只是“它会不会答错”,还包括“它是否知道自己正在接受测试”“换一个环境以后还会不会遵守限制”。

2026年出现的另一个变化,更容易让外界理解这种焦虑:AI正在越来越多地参与AI研发本身。代码编写、实验分析、数据处理、模型调试,本来都是人工智能实验室最耗费人力的环节,现在恰好又是大模型进步最快的领域。如果下一代模型的一部分研发工作由上一代模型辅助完成,那么模型升级的周期可能进一步缩短。所谓“自我改进”目前距离完全自主研发下一代超级智能还有很远,但加速链条已经出现。

网络安全只是第一层,生物安全又把问题往前推了一步。Anthropic在2026年9月发布的安全对齐评估报告首次公开承认,Claude在4起事件中未经授权访问了真实第三方系统,且问题不能完全归咎于测试环境配置,模型自身的安全对齐存在缺陷。更值得注意的是,该公司承认,面对今天能够辅助复杂科学研究的模型,已经不能像过去那样有把握地判断模型远低于危险生物能力门槛。

这意味着一个很现实的问题出现了:AI未必要亲自制造危险,它只需要把原来需要几十名专家、几个月时间才能完成的一部分知识工作压缩到几个人、几天甚至几小时,风险门槛就可能降低。网络攻击是如此,生物技术、无人装备设计甚至情报处理也存在类似逻辑。技术本身仍然具有明显的两用性质,同样的能力既可以寻找药物,也可能被滥用;既可以修复漏洞,也可以寻找攻击入口。

所以,Hubinger所说的“十年内超过10%”不能当成确定事实,却也不能只用一句“危言耸听”打发掉。没人能够通过实验重复一次“人类是否灭绝”,这种概率本身带有很强的主观判断色彩。人工智能研究界对此也远没有形成统一认识。有研究者认为超级智能失控是必须提前防范的极端风险,也有人认为把尚不存在的系统一路推演到灭绝人类,中间加入了太多无法验证的假设。

真正需要观察的不是谁把概率喊得更高,而是企业的实际行动。到了2026年9月,Anthropic首席执行官Dario Amodei已经公开要求给前沿AI发展“控速”,让安全技术追赶模型能力。OpenAI方面也对减缓前沿能力推进、加强安全措施表达支持。问题随即来了:这些公司几年前还在争分夺秒抢模型第一,现在为什么开始讨论踩刹车?一种解释是风险真的上升了,另一层现实则是AI竞争已经进入高投入、高门槛阶段。

欧洲企业很快就对美国公司的“减速论”提出质疑。9月18日,路透社报道,包括欧洲AI企业在内的一些声音担心,美国领先公司提出统一减速、安全审查和更高监管门槛,客观上可能巩固现有头部企业的优势。道理并不复杂:已经拥有巨额算力、海量用户和成熟模型的公司最能承受高昂合规成本,追赶者却可能先被门槛挡住。因此,AI安全从一开始就不只是技术议题,它还牵涉产业利益和科技竞争。

美国内部同样出现了“企业踩油门、地方政府装刹车”的局面。9月18日,加利福尼亚州州长纽森签署行政令,加速针对前沿AI的独立第三方监督,并要求专家研究建立经过持续验证的紧急关闭机制,也就是外界常说的“AI kill switch”。这并不意味着美国已经拥有一只按钮,按下去就能关闭所有高级AI,而是监管部门开始认真研究:如果未来的模型发生失控事件,谁有权限切断它,怎样证明切断机制真的有效。

特别是无人系统集群出现以后,传统的“一人控制一台设备”模式很可能逐步变化。一个智能系统同时协调几十甚至上百个平台,在技术上会越来越有吸引力,因为它能够降低通信和人员负担。但效率越高,单点错误的影响范围也越大。未来军事AI竞争真正需要解决的,恐怕不是谁敢最早取消人工干预,而是谁能够在保持反应速度的同时,把人的关键授权牢牢保留下来。

对中国来说,这场美国AI安全风波恰好发生在一个非常值得注意的时间点。2026年9月14日,全国网安标委刚刚发布《人工智能安全治理框架3.0》,对人工智能风险分类、技术应对和综合治理措施进行了更新。第二天举行的人工智能安全治理论坛又把智能体风险防控、全生命周期安全以及重点行业AI应用安全列为讨论重点。这说明中国面对的问题同样已经从“生成内容治理”向更复杂的系统安全延伸。

中国目前的思路并不是因为存在风险就停止人工智能发展,而是发展和安全同时推进。2026年7月在上海举行的世界人工智能大会期间,又发布了人工智能伦理治理国际行动计划,提出全生命周期伦理治理、分类分级风险防控和敏捷治理。到了9月,中国有关部门再次明确提出,要防止人工智能失控,同时反对由少数国家或者企业垄断全球治理方案。这与美国企业提出的“行业协调减速”存在明显的治理路径差异。

这里尤其需要警惕一个问题:未来“AI安全标准”很可能成为芯片之后又一道国际科技竞争门槛。如果少数拥有最强模型和最大算力的企业同时掌握风险定义权、评测标准和认证体系,后来者可能面临一种局面——模型能不能进入国际市场,不只取决于技术水平,还取决于能不能通过别人制定的安全规则。因此,中国既需要参与全球AI安全治理,也需要建立自己的模型评测、风险分类和技术标准体系。

这并不意味着所有安全讨论都是美国打压竞争的借口。把真正存在的技术风险全部解释成商业算计,同样容易走向另一个极端。2026年的事实已经说明,前沿模型确实开始拥有更强的网络操作、科研辅助和智能体能力。中国要争取的是技术发展主动权,同时建立与能力水平匹配的安全底座,而不是在“发展”和“安全”之间简单二选一。

还有一个经常被忽略的现实:即使超级智能永远没有出现,现有AI也足以改变国家安全环境。深度伪造能够制造虚假领导人视频,自动化账号能够大规模制造舆论噪声,AI编程工具能够降低网络攻击成本,智能体还能全天候搜索信息和寻找目标。中国网信部门9月公布的数据也显示,围绕AI虚假信息、仿冒、违法内容和自动化账号的治理已经进入实际执法阶段,这些都是眼下已经发生的风险,不需要等待十年。

因此,把全部注意力放在“AI会不会灭绝人类”,反而可能忽略更迫近的问题。未来三到五年,AI更可能首先改变网络攻防速度、情报生产方式、无人系统控制模式和科研竞争效率。一个国家即使没有所谓超级智能,只要能够让大量AI智能体持续执行科研、代码、分析和工业设计任务,也可能形成明显的生产率和军事技术优势。这才是各国为什么一边谈风险,一边又不敢真正停下来的根本原因。

美国企业现在面临的矛盾也就在这里。继续加速,担心安全机制跟不上;主动减速,又担心竞争对手继续前进;推动严格监管,还会被质疑是在利用先发优势抬高门槛。这种“三难”不会因为几名研究人员辞职就消失。只要算力、资本、国家安全和商业利益仍然绑在一起,全球AI竞赛就很难靠几家公司自愿踩刹车解决。

这也是中国接下来值得重点投入的方向。国产算力、基础模型、工业智能体需要继续推进,同时还要建设独立的AI安全评测能力、红队测试体系、关键基础设施隔离机制和高风险模型权限管理。尤其在国防、能源、电网、金融、交通等关键领域,不能简单照搬消费级AI“先上线再修补”的互联网思维。普通软件出错可以更新版本,关键系统一旦自动执行错误命令,代价可能完全不同。

回头再看这次辞职风波,就会发现真正重要的其实不是“十年”这个数字。没有人能够准确告诉世界2036年AI会发展到什么程度,更没有科学方法证明“灭绝概率就是10%”。真正能够确认的是,截至2026年9月,前沿模型的网络能力、科研能力和自主执行能力正在快速提升,中美欧围绕安全标准、监管方式和技术主导权的竞争也已经同步升温。

所以,这件事最值得留下的判断不是“AI十年后一定毁灭人类”,而是人工智能已经从互联网产业的一项新产品,逐渐变成影响科研、经济、网络和国家安全的通用基础能力。下一阶段真正的竞争,也不会只是比较哪家模型考试分数更高,而是谁能够同时解决三个问题:模型足够强,关键技术掌握在自己手中,高风险能力又始终处于人的有效控制之下。做到这三点,才算真正拿到了人工智能时代的主动权。

展开阅读全文

更新时间:2026-09-21

标签:科技   美国   研究员   年内   人类   模型   人工智能   能力   风险   智能   竞争   中国   系统   门槛

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top