Agent Analytics and Monitoring — Agentforce 代理分析与监控

本文全面介绍 Agentforce 的代理分析与监控功能。从代理开发生命周期(ADLC)的监控阶段开始,深入 Agent Analytics 仪表板的各项指标(有效性、使用量、质量、健康度、信任度),到 Sessions & Intents 页面如何逐步调试个别代理对话。通过 Coral Cloud Resorts 的真实案例,跟随 Alex Wu 调查 VPN 中断和取消政策问题,学习如何从数据分析到知识库修复,实现代理的持续改进。...

📅 2026/7/29 ✍️ ponybai 🏷️ agentforce, analytics, monitoring, salesforce

开始使用 Agent 监控

欢迎来到 Agent 监控的第一单元。在本单元中,我们将了解代理活动观测和测量如何改善代理结果,描述用于量化代理活动的代理指标范围,介绍代理开发生命周期框架,并学习 Coral Cloud Resorts 的场景设置。

学习目标

完成本单元后,您将能够:

  • 解释如何使用代理活动观测和测量来改善代理结果
  • 描述用于量化代理活动的各类代理指标

开始之前

在开始本模块之前,建议先学习以下预备内容:

  • Agentforce Builder 入门 — 了解代理的构建方式
  • Agentforce 测试工具与策略 — 测试与监控是代理可观测性的两大关键阶段

使用 Agent 监控衡量和改进结果

Agentforce 监控(Agentforce Monitoring) 是一套工具,可让您深入了解 AI 代理的交互。它包含两个核心工具:

  • Agent Analytics(代理分析):提供代理会话的广泛视图,深入了解生产环境中的行为。通过交互延迟、使用模式、质量评分和成功率来揭示性能。重点回答两个问题:「我的代理是否按预期工作?」以及「在哪里以及如何改进它?」
  • Sessions & Intents(会话与意图):提供意图级别的详细信息,便于更深入的检查。LLM 将跨会话的相似用户目标分组为意图,让您超越整个会话摘要,找到代理不准确、误导或离题的具体案例。

Agent 监控可以做什么

当您的代理处于活跃状态时,系统会收集关于它们在做什么以及做得如何的全面信息。您可以使用这些工具:

  • 发现代理趋势和模式
  • 筛选并深入研究会话,包括导致不佳结果的会话
  • 审计和调试代理行为
  • 发现并分类表现不佳的原因
  • 确定行动项目以解决根本原因

这形成了一个持续改进循环:实施改进 → 测试 → 部署 → 监控 → 一个结果更好、用户满意度更高的改进代理。

代理开发生命周期 (ADLC) 中的监控

代理开发生命周期(Agent Development Lifecycle, ADLC) 通过五个阶段进行迭代,实现代理的持续改进:

构思(Ideate)→ 构建(Build)→ 测试(Test)→ 部署(Deploy)→ 监控(Monitor)→ 回到构思

成功的 AI 解决方案从构思阶段建立可衡量的、基于结果的目标(即 KPI)开始。例如,对于服务代理,您的业务目标可以是:

  • 最大化案例偏转率(超过 80%)
  • 最小化人工升级率(低于 25%)
  • 最小化放弃率(低于 5%)

代理可观测性驱动持续改进

可观测性(Observability) 是衡量和理解代理行为在操作中的实践。它在 ADLC 的测试和监控阶段尤为适用。在这两个阶段中,您需要:

  • 观察代理在行动中的表现
  • 根据目标衡量结果
  • 将结果与目标进行比较
  • 根据需要采取行动改进代理

测试帮助您在实验室环境中观察代理(使用精心设计的测试用例);监控则将代理暴露于真实世界条件下(多样且意外的输入)。从监控中获得的洞察展示了在哪里让代理更具弹性、可靠性和有效性。

监控阶段的测量类别

在监控阶段,代理活动在多个维度上进行观察、测量和计算:

  • 有效性(Effectiveness):案例偏转率(%)— 代理解决用户需求的效果如何?
  • 使用量(Usage):唯一会话数 — 代理被使用了多少?
  • 质量(Quality):知识检索评分 — 代理的响应有多相关和准确?
  • 健康度(Health):错误率 — 代理是否在没有技术问题的情况下运行?
  • 信任度(Trust):指令遵循率 — 代理是否遵循其配置的指令?
  • 用户满意度(User Satisfaction):点赞/踩(仅限 Employee Agent)
  • 语音(Voice):打断率 — 对于语音代理,对话有多流畅?

代理数据如何收集和存储

数据收集从启用 Agentforce 会话追踪(Session Tracing)审计与反馈(Audit and Feedback) 以及 知识/RAG 质量数据与指标 开始。所有代理会话的每一次对话轮次和事件都会被捕获。分析数据从多个来源流入统一的 Data 360 数据模型:

  • 会话追踪:逐步展示对话中发生的情况 — 输入、决策、采取的行动和输出 — 向您展示代理为什么以某种方式行为
  • 审计与反馈数据:知识检索评分和评估指标
  • 信任层评分:毒性评分和指令遵循评估

改善 Coral Cloud Resorts 的客户服务

让我们认识一下 Alex Wu — Coral Cloud Resorts 的商业智能总监。Coral Cloud Resorts 提供热门探险活动:浮潜和水肺潜水(最受欢迎和利润最高)以及陆地冒险活动(骑行和文化之旅)。

问题在于:探险员工应接不暇,无法满足需求。Alex 的解决方案是使用 ADLC 框架规划、设计、构建、测试和部署一个新的 Excursion Booking Agent(探险预订代理),处理信息请求和管理预订。

Alex 评估代理的首要目标是:

  • 将信息查询和预订请求偏转 50%
  • 将升级率从 100%(没有代理)降低到 50%

现在代理已投入生产,Alex 迫不及待地想监控其性能。我们将在整个模块中跟随他的旅程。

监控代理指标和评分

欢迎来到第二单元。在本单元中,我们将导航 Agentforce Studio 中的 Agent Analytics 仪表板,探索 Overview(概览)和 Performance Insights(性能洞察)选项卡,解读有效性指标、质量评分和健康度指标,并跟随 Alex Wu 调查他的 Excursion Booking Agent 在真实世界中的性能。

Agent Analytics 是什么?

Agent Analytics 提供可视化和深入分析工具,帮助您识别和调查所有代理会话中的有意义趋势和模式。您可以探索不同级别的细节:

  • 高度细粒度数据:个别会话详情
  • 聚合洞察:KPI 和摘要指标
  • 趋势分析:代理性能随时间的变化

在 Agentforce Studio 中启动 Agent Analytics

从 App Launcher 搜索并选择 Agentforce Studio → 选择 Agents → 在 Explorer 的 Observe & Optimize 下选择 Analytics。Observe & Optimize 区域还包括 Sessions & Intents(位于 Optimization 下),用于审计会话记录、比较意图和标记。

导航 Agent Analytics 仪表板

选择代理类型后,仪表板会显示该类型代理的指标。仪表板由 Tableau Next 驱动。关键组件包括:

  • 过滤器栏:按代理、时间、渠道、模态范围筛选数据
  • 概览标签:头条 KPI 和趋势图
  • 维度标签:有效性、使用量、质量评分、健康度、信任度、语音、用户满意度
  • 性能洞察标签:按子代理、意图或操作的细分

筛选仪表板数据

过滤器栏限定仪表板上显示的数据范围。过滤选项包括:代理(全部或特定代理)、时间窗口、渠道以及模态(文本、语音或两者)。灵活的过滤让您精准聚焦于需要分析的数据。

探索代理性能 — 概览标签

概览标签展示头条 KPI、环比趋势卡和结果图表。从这里开始,您可以快速获得代理性能的高层视图。维度标签将分析数据按维度分类 — 选择某个维度标签(如质量或健康度)即可查看其特定的 KPI 集合和图表。

探索有效性指标

选择有效性标签查看带有环比变化指标的 KPI 卡片:

  • 偏转率(Deflection Rate):未升级即结束的会话比例
  • 升级率(Escalation Rate):升级到人工代表的会话比例
  • 放弃率(Abandonment Rate):超时或未互动即结束的会话比例(默认超时2小时)
  • 互动率(Engagement Rate):用户收到与代理触发的操作相关的回复的会话比例
  • 成功率(Success Rate):已完成且无错误的交互操作步骤比例
  • 任务解决率(Task Resolution Rate):Trust Layer 任务解决检测器评估为完全解决的会话比例

会话结果 — 堆叠柱状图

进一步向下滚动,聚合的会话结果数据以堆叠柱状图呈现。结果分为四类:Deflected(偏转 — 用户满意解决)、Escalated(升级 — 转给人工)、Abandoned(放弃 — 超时)和 Ambiguous(模糊 — 无法明确分类)。此图表帮助您发现代理有效性的趋势变化。

指标卡片视图 vs. 表格视图

您可以在两种视图之间切换:指标卡片视图(大卡片磁贴布局,适合单个指标的专注分析)和表格视图(紧凑表格,适合多指标并排比较)。日期筛选器可更改图表的颗粒度:按天、按周或按月。

探索使用量指标

选择使用量标签查看:

  • 唯一会话数:指定时间段内的独立会话数
  • 唯一交互数:独立的用户和代理交互数(一次交互 = 用户请求 + 代理响应)
  • 唯一用户数:与代理交互的独立用户数
  • 每次会话平均交互数:每个会话的平均交互次数

探索质量评分

质量评分是由外部 LLM 评估器生成的维度评分:

  • 质量评分(Quality Score, 1–5):代理响应对用户请求的整体相关性
  • 答案忠实度(Answer Faithfulness, 0–1):响应与知识库源数据的贴合程度
  • 答案相关性(Answer Relevance, 0–1):响应对用户问题的相关程度
  • 上下文相关性(Context Relevance, 0–1):代理是否正确检索到了回答问题的数据源

注意:这些评分需要启用 Audit and Feedback 和 Knowledge/RAG Quality Data and Metrics。

探索健康度指标

选择健康度标签查看:错误率(交互中遇到错误的百分比)、会话时长(秒)以及 代理交互延迟(秒 — 代理响应用户请求所需的时间)。低延迟和低错误率表明代理健康、响应迅速,用户会信任并持续使用。

探索信任度与语音指标

信任度标签展示 Einstein Trust Layer 的评估:指令遵循响应率(高遵循度阈值的响应百分比)和平均代理毒性评分(0–1,越低越好)。语音标签展示打断率 — 包含打断的交互百分比。

探索性能洞察(细分分析)

性能洞察标签比较跨细分领域的性能 — 哪些子代理、意图或操作带来了好或坏的结果。选择一个细分类型(子代理、意图或操作),过滤到特定细分领域,选择要比较的指标,查看水平柱状图。每个柱条代表一个细分领域,颜色编码表示性能水平 — 绿色代表良好,橙色或红色代表需要关注。

Employee Agent Dashboard 中的用户情绪

在 Employee Agent 仪表板中,选择用户满意度可查看正面反馈(点赞)和负面反馈(踩)的计数,以及跨多个代理的随时间变化的趋势线。用户满意度是衡量代理是否满足真实用户需求的直接指标。

Alex 调查代理性能

部署 Excursion Booking Agent 两周后,Alex 打开 Agent Analytics 检查进展。他在有效性标签上看到了混合的结果:偏转率 38%(低于 50% 目标)、升级率 42%(接近目标但需改进)、放弃率 27%(令人担忧 — 超过四分之一的用户放弃)、互动率 58%、成功率 71%。

Alex 分析趋势

Alex 研究了 30 天期间的聚合有效性指标趋势图。放弃率(橙色线)在过去两周稳步攀升,而偏转率(蓝色线)已经趋于平稳。会话结果堆叠柱状图显示,被放弃的会话(红色段)在周末显著增加,3月15–16日和3月22–23日尤为突出。周末模式表明周末用户的某些特征导致他们更频繁地放弃。

深入性能洞察

Alex 切换到性能洞察标签来识别哪些部分导致了放弃。按子代理细分偏转率:General FAQ 绿色(~65%)、Water Activities Booking 橙色(~32%)、Land Tours Booking 绿色(~58%)、Pricing Information 黄色(~45%)。切换到放弃率:Water Activities Booking 红色(~38%),而 General FAQ 仅 8%。问题被锁定:水活动预订子代理严重表现不佳。

Alex 学到了什么?

Water Activities Booking 子代理的偏转率最低、放弃率最高(38% vs. 平均 27%)。这个子代理处理浮潜和水肺潜水预订 — 度假村最受欢迎和利润最高的活动。高放弃率意味着潜在收入正在流失。Alex 制定了行动计划:调查子代理指令以改进、查看质量评分、检查健康度指标(延迟),并与探险台经理会面讨论客人可能未被回答的常见问题。

Alex 的持续改进循环

Alex 发现并修复了 Water Activities Booking 子代理中的一个模糊指令。他的改进循环:诊断 → 修复 → 测试 → 部署 → 监控。结果是更高的偏转率和更低的放弃率,符合业务目标。这就是 ADLC 的实际运作 — 监控反馈到构思,驱动构建、测试、部署和再监控的持续循环。

调查代理会话和意图

欢迎来到第三单元。在本单元中,我们将学习如何导航 Sessions & Intents 页面,理解已处理和未处理会话的区别,探索会话表格,深入研究使用聊天会话日志和 Trace 标签的个别对话,并跟随 Alex 使用这些强大的调试工具调查 Cancellation and Rescheduling 子代理。

学习目标 — 第三单元

完成本单元后,您将能够:

  • 导航 Sessions & Intents 页面
  • 区分已处理和未处理的会话
  • 解释意图管道流程
  • 使用会话元数据筛选和分析个别代理-用户对话
  • 解读会话详情
  • 使用 Session Page Trace 逐步调试代理行为

启动 Sessions & Intents

从 App Launcher 找到并选择 Agentforce Studio → 选择 Agents → 在 Explorer 的 Observe & Optimize 下选择 Sessions & Intents。这将打开显示已处理和未处理会话的页面,准备进行详细分析。

筛选 Sessions & Intents 页面

使用过滤器栏限定数据范围,就像在 Agent Analytics 中一样。过滤器让您缩小到特定代理或子代理、时间段、会话结果(偏转、升级、放弃)以及质量评分范围。正确的筛选器能将成千上万的会话转化为一组有针对性、可管理的集合用于调查。

导航已处理和未处理会话

Sessions & Intents 页面有两个标签:

  • 已处理会话(Processed Sessions):系统已使用两个顺序管道完成处理的会话。Intent Pipeline 分析已关闭会话并提取意图(用户在对话中试图完成什么),通常需要 4-5 小时。Clustering Pipeline 将跨会话的相似意图分组并分配集群标签,每周运行。
  • 未处理会话(Unprocessed Sessions):仍在活跃、最近关闭或尚未完全处理的会话。蓝色横幅表示处理正在进行中。使用 Trace 标签立即调查会话,无需等待处理。

注意:某些意图不会被标记,因为 Clustering Pipeline 需要至少 10 个语义相似的意图才能创建集群标签。

探索会话表格

每行代表一个单独会话,包含关键列:会话 ID / 时间戳、会话时长、会话结果、意图摘要(LLM 生成的用户意图摘要)、响应摘要、使用的子代理、执行的操作、意图标签(如 Cancellation Request)以及质量评分(带颜色编码徽章 — 高/中/低,附数值)。

时长指标(仅限聊天)

对于聊天会话,日志显示详细的时长指标:总会话时长(在记录顶部)、每个代理回复的响应时长以及处理时间明细(推理时间 vs. 执行操作时间)。这种明细帮助您了解慢速响应是由于推理复杂性还是操作执行的延迟。

探索个别对话

点击任何对话的会话 ID 进行调查。会话详情页面有两个面板:

  • 左侧面板 — 聊天会话日志:用户和代理之间的完整对话记录,带有时间戳、颜色编码气泡(用户右侧,代理左侧)、质量徽章(处理完成后)、每个响应的代理完成时间。对于语音会话,集成音频播放器带有播放控件。
  • 右侧面板 — 两个标签:交互摘要(Interaction Summary)提供选定意图的结构化分解,包含指标和推理;Trace 标签显示代理采取的每个处理步骤的按时顺序记录。

交互摘要与 Trace 标签

交互摘要 提供选定意图或时刻的结构化分解。关键字段包括:代理名称、平均代理延迟(毫秒)、每次意图总交互数(轮次数)、意图时长、触发的主题(调用的子代理,带颜色编码图标)、触发的操作(如 Retrieve Knowledge)、意图标签(如 Cancellation Request)、质量评分(带颜色编码徽章)以及最重要的 质量评分推理 — LLM 对评分原因的解释,这是知道具体修复内容的最可操作字段。

Trace 标签 显示代理采取的每个处理步骤的按时顺序记录。您可以跟随从用户输入到最终响应的确切序列,查看时间花费在哪里(意图识别、路由、检索、操作执行),识别行为在何处偏离配置,并可展开嵌套步骤深入研究子代理委托。

Alex 深入调查 — 取消预订问题

Coral Cloud Resorts 的客户服务部门报告称,访客对代理的取消政策回答感到困惑。Agent Analytics 揭示了惊人数字:Cancellation & Rescheduling 子代理的质量评分仅为 2.8/5,升级率为 67%(在 423 个会话中),是所有子代理中最高的。质量子评分显示答案忠实度仅为 0.54 — 这表明代理提供的信息与知识库内容不一致。

深入分析 — 会话 #1(质量评分 2.2)

Alex 筛选 Sessions & Intents:子代理 Cancellation & Rescheduling、结果 Escalated、质量评分 Low(1.0–3.0)。他打开会话 #1:

用户问「如果有飓风警告,我可以取消我的探险吗?」代理反复提供通用政策信息(48 小时窗口和改签费)。用户明确表示代理没有回答问题,代理最终升级。交互摘要显示答案忠实度仅为 0.42,质量评分推理明确指出「代理提供的通用政策信息没有解决天气紧急情况例外的问题」。

深入分析 — 会话 #2 和 #3

会话 #2(质量评分 1.9):用户询问因病取消,代理提供标准 48 小时政策,用户明确询问医疗例外,代理重复相同政策。Trace 揭示了根本原因 — 代理只检索了基本的 Excursion Cancellation Policy 文章,从未搜索医疗例外信息。

会话 #3(质量评分 2.5):用户购买了旅行保险,想知道如何影响取消,但代理再次只提供标准费用而不考虑保险。模式是明确的:代理使用的是不完整的知识库文章。

调查知识库

Alex 深入查看了 Trace 中引用的实际知识文章。他发现了根本原因:知识库信息碎片化且不完整。多个重叠的文章造成混乱(取消与改签政策分布在不同的文章中),关键例外场景缺失(客人疾病、家庭紧急情况、旅行保险对取消的影响),天气政策含糊不清(仅涵盖度假村发起的取消,不涵盖客人因天气担忧发起的取消)。

代理的答案忠实度低(0.54)是因为它从多个不完整的文章中综合响应,产生了不一致和冲突的答案。问题不在代理 — 而在知识库。

实施修复

Alex 与法律和客户服务团队合作,修复根本原因 — 知识库本身:

  1. 创建一篇单一、全面的文章「Complete Excursion Cancellation & Rescheduling Policy」,涵盖天气紧急情况、医疗例外、旅行保险场景
  2. 归档旧有的碎片化文章以防止冲突
  3. 更新子代理指令:询问用户关于旅行保险、询问取消原因、将答案扎根于完整的政策文档
  4. 在 Agentforce Testing Center 中测试新版本
  5. 部署到生产环境并监控三周

三周后的结果

三周后,结果令人瞩目:

  • 质量评分:4.3/5 ↑(原为 2.8)— 整体质量大幅提升
  • 答案忠实度:0.91 ↑(原为 0.54)— 代理现在提供准确、有来源的信息
  • 升级率:28% ↓(原为 67%)— 大幅降低,用户得到了答案
  • 会话量:423 → 447 — 随着用户更信任代理,使用量反而增加了

在 Sessions & Intents 验证中,Alex 抽查了 15 个最近的取消会话,Trace 标签一致显示检索到单一综合文章。天气、医疗和保险问题全部被正确处理,带有具体的政策细节。质量评分推理现在写着:「代理提供了准确、完整的信息,直接解决了用户的具体取消场景。」

总结

您学习了如何使用 Agentforce 监控工具来观察、衡量和理解代理在真实世界中的性能:

  • Agent Analytics 仪表板:高层 KPI、趋势图表和维度标签
  • 性能洞察:按子代理、意图或操作细分以识别表现不佳的领域
  • Sessions & Intents:深入研究个别对话,包括聊天记录、交互摘要和逐步 Trace
  • ADLC 循环:监控 → 构思 → 构建 → 测试 → 部署 → 监控,驱动持续改进
  • 知识库质量直接影响代理的质量评分 — 修复根本原因,而不仅仅是症状

文章来源:Trailhead — Agent Analytics and Monitoring