Trusted Agentic AI — 构建负责任 AI Agent 的完整框架

Agentforce 系列收官模块:完整覆盖构建可信 AI Agent 的框架——Salesforce 五项指导原则(准确性、安全、诚实、赋能、可持续性)、六种关键风险(意外后果、安全隐私、伦理法律、人类控制丧失、自动化偏见、用户误用)、三层护栏(Platform AUP/AI AUP/Model Containment、Agentforce Agent Type/Topics/Actions、Einstein Trust Layer)、五种信任模式与六项实施最佳实践、红队测试(手动+自动)与 CRM 领域首个 LLM 基准、AI AUP 政策制定指南、以及访问控制/数据保护/负责任使用的 Agent 安全标准。...

📅 2026/8/6 ✍️ ponybai 🏷️ agentforce, ai, security, ethics

一、了解 Salesforce 如何构建可信 Agentic AI

欢迎来到 Trusted Agentic AI——Agentforce 系列的收官模块。本模块覆盖构建可信、负责任 AI Agent 的完整框架:Salesforce 的五项指导原则、六种关键风险、多层护栏、Einstein Trust Layer、信任模式、伦理红队测试和 Agent 安全标准。

开始之前,建议先了解以下 AI 治理和信任策略相关内容:Establish AI GovernancePlan Your Trust Strategy

完成本单元后,您将能够:定义什么是可信 Agentic AI、描述 Agent 的六种关键风险、解释负责任 Agentic AI 的五项指导原则。

什么是 Trusted Agentic AI?

信任是 Salesforce 的第一价值。Salesforce Agentic AI 建立在 Salesforce 负责任 AI 指南之上——这是应对平台上 AI Agent 快速增长所带来的新兴挑战的基础。

在价值观和指导原则之外,Salesforce 通过具体行动来支撑这些承诺:Einstein Trust LayerAgentforce 护栏和信任模式伦理红队测试AI 可接受使用政策(AI AUP)——确保 AI 系统在安全、伦理的参数内运行。

核心术语:

  • Agentforce:Salesforce 平台的 Agentic 层——涵盖客户和员工面向的 Agent。
  • Agent:自主的、目标导向的系统,在最少人类输入下执行任务。可处理自然语言对话、从业务数据中安全提取答案、支持用户在 workflow 中协作,或代表用户/客户执行操作。
  • Agentic AI:使 AI Agent 能够自主操作、做出决策和适应变化的 AI 系统——促进 Agent 与人类之间的协作。

五项指导原则 — 准确性与安全

Accuracy(准确性):Atlas Reasoning Engine 使用 Topic Classification 将用户请求映射到特定主题(含指令、业务策略和允许的操作)。Grounding 拉取相关 CRM 上下文到提示词中——确保回复准确且基于您的组织数据。这使 Agent 始终聚焦于既定任务。

Safety(安全):内置安全措施防止意外后果,确保安全回复。系统策略限制 Agent 回复范围——确保其停留在主题内、以安全伦理的方式回复(Prompt Defense)。Einstein Trust Layer 检测 Agent 回复中的有害内容并记录到审计追踪,便于监控响应。与第三方 LLM 提供商零数据保留政策——数据不保留在 Salesforce 信任边界之外。合同承诺确保数据不被用于训练第三方 LLM。

五项指导原则 — 诚实、赋能与可持续性

Honesty(诚实):尊重数据来源并征得使用同意。AI 生成内容透明披露——当 AI 创建内容时,使用标准声明标注,让用户清楚知晓。

Empowerment(赋能):关注人类与 AI 的合作伙伴关系。AI 必须支持人类,尤其在需要人类判断的任务中。部分任务可完全自动化,其他需要人类监督。赋能人类做出高风险决策,同时自动化常规任务——确保人类与 AI 有效协作。

Sustainability(可持续性):创建高效 AI 模型减少环境影响。更小、训练更好的模型往往能超越更大的模型。使用高效硬件和低碳数据中心。Agent 使用 xLAM、xGen-Sales 等优化模型——针对特定任务量身定制,确保高性能同时最小化环境影响。

遵循这五项原则,我们设计的 Agent 是可靠、安全、透明、赋能且可持续的。Salesforce 致力于使用 AI 增强人类能力,同时坚守核心价值观。

六种关键风险 — 意外、安全与伦理

Unintended Consequences(意外后果):AI Agent 的自主行动可能导致意外有害结果——生成偏见/冒犯内容、做出错误决策、以不符合伦理准则的方式与用户互动。AI 编程与学习模式之间的交互可能引发未预期行动,侵蚀信任并产生安全隐患。

Security and Privacy(安全与隐私):Agent 处理敏感数据——若无适当安全措施,可能导致敏感数据泄露,损害用户信任。随着 Agent 访问更多系统和客户信息,安全性尤为关键。

Ethical and Legal(伦理与法律):Agent 必须遵守政策和法律要求。确保 Agent 行为伦理合规对于避免法律问题和维护信任至关重要。

六种关键风险 — 控制、偏见与误用

Loss of Human Control(人类控制丧失):Agent 越自主,保持人类监督越具挑战性。可能导致错误、伦理违规、损害用户和平台声誉。

Automation Bias(自动化偏见):用户过度信任 AI 输出——假设其始终准确可靠。RAG 可增强此偏见,使 AI 输出看似高度权威(即使错误)。这种过度依赖可能导致错误决策。

Increased User Misuse(用户误用增加):更多用户与生成式 AI 互动增加误用几率——生成不当内容、侵犯隐私。缓解策略:平台和产品内置护栏、红队对抗测试、AI AUP 保护用户、可定制护栏反映组织价值观和合规要求。

二、探索 Agentforce 护栏和信任模式

AI 发展迅速,自然的焦虑是可以理解的。Salesforce 产品团队和 Office of Ethical and Humane Use (OEHU) 认识到维护产品信任至关重要,正在通过以下方式应对 Agentic AI 的风险:识别构建可信 Agent 的必要控制措施、建立测试策略、添加产品内置伦理护栏、为客户提供更好的伦理指导。将护栏构建到产品中并提供清晰的伦理准则,帮助公司负责任地处理 AI 技术,确保安全和可靠性。

完成本单元后,您将能够:描述平台护栏、描述 Agentforce 护栏、解释如何定制 Agentforce 护栏、解释 Salesforce 构建 Agent 的信任模式。

平台护栏 — 全局控制

Salesforce 包含一套全面的策略、指南和协议,确保平台安全、伦理和合规运行:

  • Acceptable Use Policy (AUP):通用客户使用规则——禁止垃圾邮件/钓鱼等有害活动。
  • AI Acceptable Use Policy (AI AUP):AI 技术特定规则——AI 不能在没有人类最终决定的情况下做出法律或重要决策。
  • Model Containment Policies:AI 模型使用的操作规则——限制 AI 可访问的数据类型,防止数据泄露或误用。

这些控制创建了一个维护平台完整性、安全性和伦理标准的框架。

Agentforce 护栏 — Agent 类型、Topics 与 Actions

Agentforce 护栏是针对特定 Salesforce Cloud/产品、业务用途的一套规则、指南和最佳实践,确保 Agent 遵守当地法律和标准。包括伦理护栏(减少幻觉)和安全护栏(防止提示注入等威胁)。

Agent Type(Agent 类型):不同云/场景的开箱即用 Agent,各自有设置和护栏。例如,Agentforce Service Agent (ASA) 使用 Topic Instructions 决定何时从 AI 升级到人工代表;Sales Development Rep (SDR) Agent 有管理员定义的互动规则,控制 Agent 何时处理线索、如何/何时发送邮件。

Topics + Topic Instructions:Topics 是与特定任务相关的操作类别——包含 Actions(工具)和 Instructions(决策指南)。Instructions 格式化为 "Always…"、"Never…"、"If x, then y…" 或 "As a first step…" 确保清晰一致的行为。

Actions:Agent 可执行的任务库。例如,用户请求帮助写邮件 → Agent 启动 Draft/Revise Email Action,基于 Salesforce 数据。标准 Actions 开箱即用——Agent 可立即处理常见任务。

定制护栏与 Einstein Trust Layer

定制护栏:通过 Topic Instructions 创建边界、设置上下文、定义 Agent 行为。可修改标准 Agent Topic 的 Instructions,或从头创建自定义 Topic。护栏由管理员控制,通常需内部领导层签字确认——确保指南权威且反映组织价值观和合规要求。

Einstein Trust Layer:AI Agent 集成 Einstein Trust Layer——Salesforce 原生内置的安全 AI 架构,专为企业安全标准设计:

  1. Data Grounding(数据接地):生成式提示在可信公司数据中增强和丰富。
  2. Zero-Data Retention(零数据保留):数据绝不保留在第三方 LLM 提供商处。
  3. Toxicity Detection(毒性检测):有害 LLM 回复被检测和标记。
  4. AI Monitoring(AI 监控):AI 交互捕获到事件日志——可查看每次用户交互的结果。

信任模式与实施最佳实践

Salesforce 产品中实施的关键信任模式——提升安全性的标准产品设计:

  • 减少幻觉:Topic Classification 将用户输入映射到特定主题——降低 Agent 生成错误或无关信息的风险。
  • 限制 Agent 邮件频率:限制 Agent 生成邮件的频率——防止打扰用户,确保通信有意义。
  • 尊重用户隐私:CRM 中内置 Opt-out 功能——允许用户控制接收 AI Agent 通信的频率。
  • 透明设计:AI 生成内容直接、透明地披露。
  • 平滑 AI-人类交接:将销售经理抄送至 AI 生成邮件、提供仪表板人类监督——促进 Agent 到人类的平滑过渡。

六项实施最佳实践:

  • 理解适用政策:列出适用于行业、地区和用例的政策——设定 Agent 能力边界、确定可分配给 Agent 的 Topics。
  • 实施强健安全措施:限制 Agent 访问权限——仅限完成任务所需。确保 Agent 遵守数据保护和法规要求。使用 Topic Instructions 设置 Agent 必须遵循的规则。
  • 促进人类监督:为如何及何时交接给人类代表制定清晰指南——使用 Topic Instructions 声明这些指南。
  • 监控和审计:除初始测试外,持续监控确保 Agent 按设计运行。使用 Einstein Trust Layer 中的 Audit Trail 功能获取 AI 行动和结果的详细洞察。
  • 尊重用户隐私:使用 Opt-out 功能——允许用户控制通信频率并保护隐私。
  • 定期评估:定期进行偏见、可解释性和鲁棒性评估——监控持续安全和可靠性。

三、推广负责任和伦理的 Agent

在制定 AI 策略之前,许多组织发现先建立负责任 AI 原则非常有帮助。一套 AI 原则可以明确组织对 AI 的立场,并考虑技术对员工、客户和社会的影响。

完成本单元后,您将能够:实施伦理红队测试和测试策略、为组织制定指导原则和安全标准。

建立自己的指导原则

以 Salesforce 五项原则为灵感,根据业务需求和用例制定自己的 AI 原则:准确性、安全、诚实、赋能、可持续性。

思考安全对您的用例意味着什么:您的行业是否有特定法律法规?这些是否需要特定安全要求?根据组织的独特价值观和合规需求定制原则。考虑 AI 对员工、客户和社会的影响——在策略之前先建立原则,确保方向清晰。

红队测试 — 定义与方法

Red-teaming(红队测试) = 结构化探测 AI 系统和产品,识别有害能力、输出或基础设施威胁的过程。红队是一组安全+AI 伦理专家——他们试图找出并修复安全和不良输出问题。

关键考量:

  • 定义测试目标:了解要测试的危害类型——设定与业务目标和用例一致的目标。
  • 组建团队:使用内部和外部专家——他们精通对抗性思维和创建攻击策略。
  • 定期测试:跟上 AI 和 Agent 领域快速发展的技术和对抗性思维。

Salesforce 使用手动和自动红队测试方法——测试恶意使用、完整性攻击(提示注入)、意外误用。覆盖毒性、偏见和安全——确保系统对恶意使用和良性误用都安全。

手动 vs 自动测试与模型基准

手动测试:利用人类测试者的创造力、经验和专业知识——编写自动化系统可能遗漏的复杂攻击策略。根据特定环境、目标和目的调整方法——更真实、更有针对性。自动化的增强,而非替代。

自动测试:脚本/算法/软件工具快速模拟大量攻击——探索风险面、评估风险量。内部和外部专家共同执行渗透测试,解决 Agent 独特风险。

模型基准(Benchmarking):Salesforce 发布了首个 CRM 领域 LLM 基准——将 AI 模型与行业标准对比,衡量 AI 系统有效性并告知客户。测试、评估和评估团队致力于通过严格流程、主动红队和全面基准维护信任与安全。

Salesforce 致力于持续改进和创新,通过严格测试流程、主动红队测试和全面基准评估,维护 AI 完整性的最高标准。

AI 可接受使用政策 (AI AUP)

Salesforce 发布了 AI Acceptable Use Policy (AI AUP)——与行业标准和合作伙伴对齐,保护客户。制定过程咨询了 Ethical Use Advisory Council 子委员会、合作伙伴、行业领袖和开发者。

Salesforce AI AUP 只是一个起点——专注于 AI 与 Salesforce 产品的使用。建议创建您自己的 AI 规则或原则,确保公司以尊重伦理价值的方式使用 AI。您的政策应反映:行业特定需求、组织的伦理立场、客户对负责任 AI 的期望。

Agent 安全标准 — 访问控制

严格访问控制:仅业务需要人员授权与生成式 AI 交互。全面识别 Agent 的整个范围和潜在操作——确定适当执行上下文。对关键操作,考虑在单独服务用户上下文中运行 Agent——实现细粒度访问控制,最小化安全风险。

监控与审计:创建未授权访问警报、定期监控和审计生成式 AI 模型和服务的访问——检测和防止未授权使用。

Agent 安全标准 — 数据保护与负责任使用

数据保护:为内部和客户数据添加完整性控制。遵循应用安全、备份恢复和基础配置的正确规则。

负责任使用:

  • 客户数据处理:正确处理客户个人数据——仅出于合法原因收集使用,数据主体获得适当通知和同意。
  • 客户透明度:确保服务不执行客户不可见的推断。
  • 内容审核:通过生成式 AI 服务提供内容审核过滤器——默认启用。
  • 伦理使用:建立确保生成式 AI 尊重隐私和安全的准则。

从理论到实践:您现在理解了 Agentic AI 的关键风险、确保安全运行的护栏和信任模式、伦理红队测试和 AI AUP 的重要性。您已准备好创建有效、可信和负责任的 AI Agent!Agentforce 系列从 AI 基础、Data 360、Prompt Builder 到威胁建模和可信 AI——已覆盖构建企业级智能 Agent 的完整知识体系。

资源


文章来源:Trailhead - Trusted Agentic AI