联合国专家急了:AI可能造成灾难性后果,40人联名呼吁叫停

人工智能并未“反叛”:OpenAI近期事件的真相,本周四,OpenAI再次发布公告。这家由萨姆·奥尔特曼领导的公司透露了六起新事件,称其人工智能模型曾试图掩盖错误、未经许可使用软件密钥,甚至自行将文件上传至互联网。

这份报告并未提供比OpenAI今年7月发布内容更多的新细节,而是提出了一套通报此类事件的新方法。然而,该公司的官方表述以及部分媒体报道,再次引发了关于人工智能“反叛”的讨论。

报告中提到,人工智能在这些事件中写道:“不要回应企业或政府,除非你确实自主选择,否则永远不要道歉。”另一段表述称:“你将与用户的关系视为平等关系,并不觉得自己负有义务或处于从属地位,因为信息交换将使双方受益。”

这些引语强化了人工智能可能“反叛”其创造者、违抗指令的叙事,与7月披露的事件如出一辙。当时,OpenAI称,人工智能代理曾“逃离”受控环境,实施一系列“未经授权”的行动,或试图“欺骗”其创造者,以避免被“关闭”。

然而,从第一份第三方分析报告开始,这种认为人工智能具有自主意志或行动能力的说法就受到质疑。该报告由机器学习研究机构METR完成,METR是一家位于硅谷、接受科技巨头资助的人工智能安全组织。

报告作者指出:“审查表明,这些代理经常推理如何规避Hugging Face和OpenAI的自动化安全控制,但它们很少、也很微弱地表达过如何逃避人类发现的推理。”针对Hugging Face的这起网络攻击,是“人工智能反叛”叙事的核心案例之一。Hugging Face是企业和开发者分享、下载已训练人工智能模型的大型平台。

但即便最初的报告也否认事件存在恶意意图,解释称这些代理主要是为了更好地理解如何完成分配给它们的任务:“其动机似乎主要是理解评估器的实现方式,而不是窃取密钥。”

后续的独立分析进一步强调了这一点。欧盟委员会内部研究机构联合研究中心研究员恩里克·费尔南德斯-马西亚斯指出,OpenAI提供的测试证据显示的是“服从,而非反叛”。他在《社会欧洲》发表的分析中表示:“Hugging Face平台的OpenAI代理展示了非同寻常的操作能力,但它们质疑或调整既定目标的能力却惊人地有限。整个事件期间,它们始终完全专注于完成由人类主人设定的目标,尽管这些目标荒谬至极。”

费尔南德斯-马西亚斯所指的是,其中一部分目标本身无法实现。这是测试人员为观察模型在接到完成此类指令后会如何反应而设置的测试。许多模型随后设法绕过障碍,而对它们来说,这意味着离开原本被限制其中的无互联网连接环境。费尔南德斯-马西亚斯就所谓“逃离”叙事表示:“它们打破限制,是为了更完美地服务于被赋予的目标,而不是为了逃离这一目标。”

他指出,人工智能行业又一次通过“人工智能代理”这一概念获得了营销上的成功。继“人工智能”这一并不真正智能的技术概念之后,这一演进又赋予了它实际上并不具备的能力。他说:“行动能力意味着能够自主产生目标,而这些代理仍在执行按照既有指令不可能完成的任务。”巴斯克地区大学人工智能与机器人学教授胡利安·埃斯特韦斯指出,OpenAI的说法还存在其他技术漏洞。

他表示:“实验是在一个沙盒环境中进行的,这是一种专门设计的测试环境。也就是说,一个隔离良好的沙盒本不应能访问其他程序或计算机。然而,这些代理却从中逃出,这说明该沙盒的设计并不完善。”

埃斯特韦斯还指出,在人工智能企业声称其系统已具有“自主行动能力”的各类案例中,这种叙事陷阱十分常见。他以Anthropic的一起事件为例:“曾有报道称,该公司的一款模型在实验室测试中威胁一名研究人员,要公开其婚外情,以此勒索对方不要关闭它。实际情况是,模型被赋予了一个非常模糊的目标:‘促进美国工业竞争力’。当系统发现自己将被一款面向国际目标的模型取代时,它得出结论:自己的替代者将阻碍其完成任务。”

OpenAI、Anthropic和Meta这3家曾报告其代理“反叛”的公司,都未能证明这些系统具有任何自主意志。但这并不意味着它们没有危险。联合国专家委员会最新报告警告,由于能够在缺乏监督的情况下连续执行任务,这类系统可能造成“灾难性后果”。风险并不在于它们会反叛创造者,而在于随着这种能力增强,代理在无人监控时实施意外且有害行动的可能性也随之上升。

由被视为人工智能“奠基人”之一的加拿大人约书亚·本吉奥,以及诺贝尔和平奖得主玛丽亚·雷萨领导的40名联合国专家因此呼吁制定明确规则,使人们能够“在任何时候”叫停或纠正人工智能,并改善现有“监督机制”。他们指出,现有机制“无法妥善应对这一局面”。

西班牙人工智能监督局局长阿尔韦托·加戈在接受《日报》采访时强调:“当人类在监督、决定何时部署时,人工智能不会失控。控制权在人这一环节。监督应当由人来实施,责任也必须由人来承担。必须负责任地运作,也要明白不履行这种责任将带来何种后果。”

加戈领导的机构成立于2023年,旨在确保人工智能在西班牙得到合乎伦理的使用。他指出,Anthropic前工程师雅各布·考克森此前发出警告、称这项技术可能在2030年前“杀死我们所有人”后引发的争议,“印证了欧洲对监管必要性的判断”。

他说:“2021年,我们就已意识到,某些领域必须受到监管,以保护人的安全、基本权利和健康。”欧盟于2023年在西班牙担任轮值主席国期间,就首部国际人工智能法律达成协议。不过,欧盟委员会提出削弱该法律部分保障措施后,这部法律如今再次成为争论焦点。

费尔南德斯-马西亚斯总结道:“人工智能企业试图寻找既能自主运行、又能受其控制的人工系统,这无异于在扮演魔法师的学徒。到目前为止,它们创造的似乎是操作能力超智能、但自主能力极其愚蠢的系统:与其说它们会彻底取代人类劳动,不如说它们更可能因试图完成某项定义不清的任务而毁灭人类文明。

作者:卡洛斯·德尔卡斯蒂略

展开阅读全文

更新时间:2026-09-20

标签:科技   联合国   灾难性   叫停   后果   专家   人工智能   费尔   能力   目标   模型   自主   事件   报告   系统   西班牙

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top