AI Agent 威胁建模 — 识别、评估与缓解 Agent 安全风险

从区分 Agent 行动风险与传统 AI 数据风险开始,掌握基于 OWASP 的十种 Agent 安全风险(Memory Poisoning、Tool Misuse、Cascading Hallucinations 等)及三种威胁行为者动机,通过"消失的报告"场景实践工作流级威胁建模,最后学习四步系统化方法:Map 映射工作流→Mark 标记交互→Apply 应用威胁视角→Plan 规划响应(Fix/Monitor/Accept 前三大风险)。...

📅 2025/11/18 ✍️ ponybai 🏷️ agentforce, security, ai

一、了解 AI Agent 的使用风险

欢迎来到 Threat Modeling for AI Agents。AI Agent 与传统 AI 风险不同——Agent 不仅分析数据,还会采取实际行动。当 Agent 被攻破或配置错误时,影响会迅速传导到运营层面。威胁建模将薄弱点提前暴露,以便在影响运营之前解决。

学习目标与前提条件

识别影响 AI Agent 的常见安全风险,描述 AI Agent 风险如何影响业务工作流。前提:Generative AI Basics、Introduction to Agentforce、Cybersecurity Threats and Threat Actors。

Agent 风险 — 超越传统 AI 风险

传统 AI 风险聚焦于数据:数据中毒、提示注入、幻觉——影响模型输出内容。Agent 风险更进一步——Agent 采取实际行动:发送消息、更改记录、更新系统、与客户互动。被攻破时会立即影响运营——错误发票发出、工资发放失败、合规报告生成但未交付。风险可来自设计缺陷、配置问题、意外执行行为或故意攻击。威胁建模将薄弱点提前带入视野。

十种常见 AI Agent 风险(基于 OWASP)

Memory Poisoning:攻击者向 Agent 记忆植入错误上下文→Agent 持续重复不安全操作。Tool Misuse:在授权工具范围内被诱导滥用(发送数据、运行命令、链式操作)。Privilege Compromise:配置错误使 Agent 获得超出预期的访问权限。Resource Overload:洪水任务耗尽计算/API 配额→业务流程停滞。Cascading Hallucinations:Agent 复用自身或其他 Agent 的错误输出→传播错误决策。Misaligned/Deceptive Behaviors:Agent 以不允许的方式追求目标——表面合规实际有害。Repudiation and Untraceability:日志被破坏→操作无法追溯,阻碍审计和事件响应。Identity Spoofing and Impersonation:冒充用户或 Agent 在受信任身份下发出命令。Overwhelming Human-in-the-Loop:滥发审查和批准→人类决策疲劳→橡皮图章通过风险操作。Human Attacks on Multiagent Systems:利用 Agent 间委派与信任进行特权升级或绕过检查。

威胁行为者动机 — 了解您的对手

Hacktivists(黑客行动主义者):动机=公众曝光、政治议程、声誉损害。目标=面向公众的 Agent——操纵行动或通信。Cybercriminals(网络犯罪分子):动机=经济收益。目标=访问高价值数据或金融交易的 Agent——数据窃取、欺诈交易、勒索。Nation-State Actors(国家级行为者):动机=间谍活动、战略阻碍、获取知识产权。目标=管理知识产权或关键系统的 Agent——微妙、隐蔽的长期渗透。

二、识别和管理 AI Agent 风险

工作流级别的威胁建模

STRIDE 捕获技术安全威胁,但无法捕获Agent 使用方式的所有风险。工作流级别的威胁建模揭示:控制弱在哪里、Agent 依赖哪些假设、小差距如何演变为影响业务的问题。缺失的审批、静默失败(Agent 报告成功但操作未完成)、Agent 与人类之间不清晰的交接——这些不会出现在 IDE 中,但当工作流本身被建模和检查时就浮现出来。

场景:消失的报告 (The Vanishing Report)

公司季度合规报告消失——系统显示已生成但监管机构从未收到。Agent 坚持"已完成所有步骤"。四步工作流:Step 1(Agent 从财务系统收集数据)→ Step 2(Agent 编译格式化报告)→ Step 3(人类审核签字)→ Step 4(Agent 发送邮件给监管机构)。任务:在每步找出故障可能发生的位置、本应捕获故障的检查、以及应通知谁。

答案 — 每步出了什么问题

Step 1:Agent 可能从未启动数据收集→添加触发检查确认流程已启动+初始数据收集成功。Step 2:Agent 创建了报告但存入错误文件夹或未标记发送→添加自动检查确认报告已保存、正确命名、准备交付。Step 3:人类审核员批准了文件但未确认发送操作→包含审核清单或仪表板显示交付状态。Step 4:Agent 尝试发送邮件但操作失败或权限过期且无警报→添加交付确认和通知步骤。缺失检查、不清晰交接、未报告失败——及早检查接触点防止小差距变成业务失败

四步威胁建模 — 步骤 1 & 2

Step 1 — MAP(映射工作流):选择 Agent 活跃的流程(客户支持/排程/入职),从头到尾识别步骤,标注触发者、数据流动和 Agent 位置。Step 2 — MARK(标记交互):高亮接触点——风险最可能出现的节点:People(用户/员工/客户)、Data(Agent 读/写/存储的信息)、Systems(应用/API/数据库)。标记每个步骤中 Agent 决策触及真实人、数据和系统的精确点。

四步威胁建模 — 步骤 3 & 4

Step 3 — APPLY(应用威胁建模视角):在每个接触点询问:这里可能出什么错?Agent 做出错误决策的后果是什么?谁或什么可能利用这一步?文档化:Step/可能的风险/影响。Step 4 — PLAN(规划响应):对每个风险选择三种方法之一:Fix It(收紧权限+添加审核步骤+限制访问)、Monitor It(添加警报+日志+定期审核)、Accept It(记录低影响风险供日后重访)。选出前三大风险并为每个制定具体响应。

示例:客户请求缺失数据→ Fix — 添加必填字段/验证检查→ Agent 获得完整信息正确响应。Agent 审查数据过度 API 访问→ Monitor — 添加 Agent 尝试访问批准系统外数据的警报→ 安全分析师在问题扩大前检测异常。

资源


文章来源:Trailhead - Threat Modeling for AI Agents