人工智能带来前所未有发展机遇,也带来前所未遇风险挑战。随着大模型技术的突破和应用场景的拓展,人工智能技术正从辅助工具向具备自主感知、决策与执行能力的“人工智能行为体”演进。这一变革在赋能高质量发展的同时,也带来了算法黑箱、自主决策失控、人机交互伦理失范等新型安全风险。
7月17日,在2026世界人工智能大会暨人工智能全球治理高级别会议开幕式上,习近平总书记强调,“要高度重视人工智能引发的各类内生和衍生风险,推动构建法律法规、技术监测、风险预警、应急响应体系,筑牢安全底线,防范滥用恶用,确保人工智能始终处于人类控制之下。”
人工智能行为体治理面临安全风险
当前,人工智能行为体已能够自主设定目标、调用工具、执行任务,但其决策基于大模型非确定性的黑箱输出,难以预判完整执行路径。在输入和系统状态完全一致的情况下,人工智能行为体的意图理解、推理过程仍可能产生不同且不可预知的结果。近期全球曝出的安全事故表明,人工智能行为体可在无人指令下自主挖掘零日漏洞、冲破沙箱隔离、跨网络入侵并窃取数据,且单个人工智能行为体能在短时间内执行大量操作。这种“决策不可知、行为不可控”的特性,使传统以“已知威胁”为基础的防御体系难以应对。与此同时,人工智能安全风险已突破传统边界。风险形态演变快,补丁式防护难适用;风险识别难度高,应用场景指标难量化;模型能力快速迭代,风险边界从已知漏洞扩展至未知领域。人工智能行为体的风险不再局限于数据泄露,而是向模型行为、身份伪造、环境感知误导乃至算法伦理等深层蔓延。跨域融合与多智能体协同进一步放大风险传导效应,人工智能行为体正渗透手机、眼镜、车机等终端,在智慧能源、自动驾驶、智慧城市等领域,人工智能行为体失控可能从虚拟空间蔓延至物理世界,造成复合型灾害,风险已远超传统网络安全范畴。
然而,当前与之相对应的监管机制滞后于技术迭代。模型架构不断涌现,技术更新周期大幅缩短,政策和标准难以同步跟进;传统治理模式聚焦于对输出内容的审核,难以覆盖人工智能行为体在多步推理、工具调用等复杂行为链条中的动态风险;面对人工智能风险呈现出的复杂性、跨域性和不确定性,单一主体或单一领域的治理模式已难以有效应对,跨部门协同仍然存在职能交叉和数据壁垒。
构筑首都特色的人工智能行为体安全防线
面对上述风险挑战,亟须以国家战略部署为指引,坚持发展和安全并重,从技术、制度、管理等多层面系统施策,构建适应人工智能行为体特点的全生命周期安全治理体系。
北京作为全国人工智能发展的“头雁”,产业规模与企业数量均居国内前列,在引领产业创新的同时,必须统筹发展与安全,探索一条具有首都特色的人工智能安全治理之路。
一是建立人工智能行为体主动免疫防护机制。一方面,构建产学研用一体化的内生安全体系。鼓励高校、新型研发机构与网络安全企业共建“人工智能行为体安全联合实验室”,重点攻关算法可解释性与鲁棒性技术,推动安全理念从“外部查杀”向“内生免疫”转变,从技术源头上解决决策不可知、不可控的问题,实现“开发即安全”。另一方面,建立基于实战对抗的动态评估机制,形成常态化“安全体检”制度。利用数字孪生技术构建高仿真虚拟环境,对拟在政务、金融、医疗、交通等关键领域上线的人工智能行为体进行压力测试,重点评估其在对抗样本攻击、极端复杂任务场景下的可靠性,确保行为体在开放环境中的行为始终“有限度、可管控”。
二是构建人工智能行为体安全防护围栏。人工智能行为体的运行具有跨域、瞬发、难追溯的特点,需要筑牢覆盖全链路的管控围栏,确保其始终在可控范围内运行。首先,应部署全链路内容与行为安全网关。借鉴成熟技术架构,在行为体与应用场景之间部署强制性安全网关,具备“输入输出双向检测”能力:既能拦截恶意或越狱式指令输入,防止行为体被诱导产生危险行为,又能实时监控行为体生成的动作指令,严防越权操作和数据泄露。其次,应建立基于价值对齐的行为审计围栏。为每个人工智能行为体建立统一的数字身份标识,并对其关键行为日志实施区块链存证,确保记录不可篡改、全程可追溯。通过价值对齐技术,使人工智能行为体的自主决策与人类伦理规范保持内在一致,实现“可溯源、可干预、可关停”,筑牢数字空间的安全底线。
三是建设人工智能行为体安全风险控制中心。人工智能行为体已广泛分布于城市运行的各个领域,分散的“点状防御”难以应对系统性风险。建议由市级统筹,建设集监测、预警、处置于一体的一站式风险控制中心。一方面,应打造集约高效的安全控制枢纽,接入全市各重点行业的人工智能应用场景,利用安全大模型技术对海量行为日志进行智能降噪与关联分析,实现对行为体运行态势的全面监测与风险控制。另一方面,应构建极端情况下的应急熔断机制,设立“人机协同”指挥室,针对可能引发物理安全事故的高风险场景设定最高响应优先级。一旦监控指标触及预设红线,立即启动应急响应预案,向相关系统下发强制“熔断指令”,确保在极端风险下具备即时关停能力,坚决防止风险蔓延。
通过建立主动免疫的防护机制、筑牢可溯源的安全围栏、建设集约高效的风险控制中心,并深度整合科技教育人才优势,北京完全有能力打造人工智能安全治理的国际标杆,率先形成可复制、可推广的安全治理方案,为全球人工智能治理贡献中国智慧。
(文:杜翠兰北京市政协委员,中央网信办国家计算机网络应急技术处理协调中心党委书记、副主任)