2026年5月1日,由澳大利亚网络安全中心(ACSC)牵头,联合美国 CISA、美国 NSA、美国 FBI、英国 NCSC、加拿大 Cyber Centre 以及新西兰 NCSC 等机构,正式发布了联合网络安全指南**《审慎部署智能体AI服务》(Careful adoption of agentic AI services)。 这份指南不仅是针对生成式 AI 的延续,更是专门针对具有自主性(Autonomy)**、**工具调用(Tool Use)和长期记忆(Memory)**特征的"AI 智能体(Agentic AI)"提出的首个全球性防御架构参考。
一、 核心定义:从"对话框"到"自主实体"
指南首先明确了智能体 AI(Agentic AI)与传统大语言模型(LLM)在安全威胁模型上的本质区别。
- •自主性(Autonomy):智能体可以根据高阶目标(Goal)自行拆解步骤,而无需人类干预每一步。
- •工具与环境交互(Tool Use):智能体通过 API、Web 插件、甚至物理接口(如工业控制系统)直接操作外部环境。
- •持久性与记忆(Persistence & Memory):智能体能跨会话保留状态,这意味着恶意指令(如间接提示词注入)可能产生"毒素累积"效应。
二、 风险矩阵:四大关键威胁维度
该最佳实践识别出智能体 AI 引入的特有攻击向量,并从架构师角度进行了分类:
- 1.间接提示词注入(Indirect Prompt Injection): 智能体在自主检索网页或读取邮件时,可能由于解析到隐藏在外部文档中的恶意指令,导致其执行未经授权的操作(如:将用户私密文档发送至攻击者服务器)。
- 2.权限蔓延与提权(Privilege Escalation): 如果给智能体分配的 API Key 权限过高,一旦智能体逻辑被误导,可能导致核心数据库、云基础设施被非法操作。
- 3.记忆中毒(Memory Poisoning): 攻击者通过在多次交互中植入错误信息或恶意逻辑,逐渐污染智能体的长期记忆,使其在未来的任务中持续表现出偏差或后门行为。
- 4.级联失效(Cascading Failures): 在多智能体协作(Multi-agent systems)中,一个智能体的错误输出可能触发整个自动化流水线的连锁反应,导致不可逆的业务损失。
三、 最佳实践:防御性架构建议
指南为开发者和企业 IT 管理者提出了以下核心防御策略:
1. 严格的"人在回路"(Human-in-the-Loop, HITL)
针对具有敏感权限(如转账、删除生产环境资源、发送外部邮件)的智能体,必须设置手动确认关卡。不建议将具备写权限的 API 完全交由 AI 自主决定。
2. 最小特权原则(Principle of Least Privilege)
- •沙箱化执行:智能体执行代码或工具调用的环境应为隔离的容器(如 Docker),严禁直接访问宿主机文件系统。
- •细粒度权限管控:仅授予智能体完成任务所需的最低级别 API 权限,并对每个 API 调用进行速率限制和审计监控。
3. 输入输出的动态审查
- •输入端:对智能体检索到的外部数据进行预扫描,识别潜在的注入攻击。
- •输出端:在将 AI 生成的指令发送给执行器(Executor)之前,利用传统的规则引擎(Rule-based system)或辅助审计模型进行安全性校验。
4. 可解释性与全量审计
所有智能体的思考链(Chain-of-Thought)、工具调用记录、以及记忆状态的变更,都必须进行持久化记录。这不仅是为了事后追溯,更是为了实时异常检测。
四、 专家解读:IT 咨询顾问的视角
作为架构师,我们必须认识到:智能体 AI 的安全不再仅仅是"算法对齐"问题,而是回归到了经典的"系统安全"范畴。
- •从"输入防御"转向"行为监控":提示词注入难以通过单纯的字符串过滤完全消除,重点应放在限制智能体能产生的"外部副作用(Side Effects)"上。
- •零信任架构在智能体中的应用:应将每一个 AI 智能体视为一个"不可信的用户实体",通过 API 网关实施持续验证。
参考文献
- 1.Australian Signals Directorate (ASD).(2026, May 1).Careful adoption of agentic AI services: Joint Cybersecurity Advisory.ACSC.
- 2.U.S. Cybersecurity and Infrastructure Security Agency (CISA).(2026).Security Guidelines for Autonomous AI Agents in Critical Infrastructure.
- 3.Chhabra, A., et al.(2026).Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges.IEEE Xplore.
- 4.Bengio, Y., et al.(2026, February).International AI Safety Report 2026.arXiv:2602.21012.
- 5.National Cyber Security Centre (NCSC-UK).(2026).Principles for the design and implementation of agentic AI systems.
LeisureLinux 独家:金融政企行业智能体(OpenClaw)办公解决方案
2026 架构师必读:如何在工程化落地中约束 OpenClaw 式的"暴力"智能体?
智能体 Agent 架构的"寒冬"还是"转正"?——从 Linux 哲学看 Agentic AI 的范式转移