Agentforce Testing Tools and Strategies - 代理测试工具与策略

Agentforce 测试工具与策略:ADLC 测试阶段、Builder 调试工具、Test Suites 批量测试、确定性 vs 概率性测试、五步测试策略。...

📅 2025/8/21 ✍️ ponybai 🏷️ agentforce, testing

Agentforce Testing Tools and Strategies

AI 代理的测试需要新的工具和策略。本模块涵盖 Agent Development Lifecycle (ADLC) 中的测试阶段、Agentforce Builder 和 Studio 的测试工具、确定性 vs 概率性测试的考量、以及五步测试策略来持续精炼你的代理。

The Reasons to Test - ADLC Context

AI 代理的兴起正在重塑软件开发。传统的 ALM 阶段(构思、配置、测试、部署、观察)同样适用于 Agent Development Lifecycle (ADLC),但生成式 AI 的加入为测试带来了新的挑战。测试应该验证你在规划阶段定义的所有规格:受众、范围、用例、guardrails 和任务——确保代理的表现与你的设计意图一致。

Agentforce Builder - Testing & Troubleshooting Tools

Agentforce Builder 提供了多个测试和故障排查工具:

Preview 面板 (1):在 Builder 中直接与代理对话,测试用户可能的交互。两种模式:Simulate(使用模拟数据和动作测试)、Live Test(使用真实数据查看代理表现)。Preview 输出让你看到代理是否提供了有用和相关的响应、调用了正确的 actions、正确引用了业务流程、保持在 guardrails 内。

Interaction Summary (2):高层次回顾代理返回响应所使用的步骤,包括调用的 subagents 和推理过程。

Agentforce Session Tracing (3):查看代理会话的每个细节——推理引擎执行、actions、prompt 和 gateway 输入/输出、错误消息、最终响应(文本或代码视图),全部按 session ID 组织。需要 Data 360。上线后也可以用来审查用户与代理的对话,定位问题或调整代理处理未预见的输入。

Agentforce Studio Test Suites - Batch Testing at Scale

在 Agentforce Builder 中手动精炼代理后,使用 Agentforce Studio Test Suites (Beta) 进行规模化批量测试。App Launcher → Agentforce Studio → Tests。

为什么需要批量测试?手动在 Preview 中逐个测试每个用户可能的提问方式会耗费大量时间。Test Suites 一次批量测试数十甚至数百个场景:上传自然语言编写的 .csv 测试用例文件,或让 AI 生成与代理任务相关的测试输入。

Testing Considerations - Deterministic vs. Probabilistic

测试 AI 代理时需要考虑确定性 (Deterministic) 和概率性 (Probabilistic) 的区别:

确定性测试:适用于有明确、可预测结果的场景——如验证代理是否调用了正确的 action、是否遵循了特定的业务流程。这类测试可以通过 CSV 中的 Expected Topic/Action 来验证。

概率性测试:生成式 AI 的输出本质上是概率性的——同一个输入可能产生不同的措辞。对于这类场景,关注语义正确性而非字面匹配。使用 Session Tracing 审查推理过程,确保代理的理解和决策路径正确,即使措辞有所不同。

缓解策略:结合两种测试方法、使用具体清晰的 instructions、在 guardrails 中定义边界、反复迭代直到代理行为稳定可预测。

The Five-Step AI Agent Testing Loop

测试 AI 代理时需要考虑确定性 (Deterministic) 和概率性 (Probabilistic) 的区别:

确定性测试:适用于有明确、可预测结果的场景——如验证代理是否调用了正确的 action、是否遵循了特定的业务流程。这类测试可以通过 CSV 中的 Expected Topic/Action 来验证。

概率性测试:生成式 AI 的输出本质上是概率性的——同一个输入可能产生不同的措辞。对于这类场景,关注语义正确性而非字面匹配。使用 Session Tracing 审查推理过程,确保代理的理解和决策路径正确,即使措辞有所不同。

缓解策略:结合两种测试方法、使用具体清晰的 instructions、在 guardrails 中定义边界、反复迭代直到代理行为稳定可预测。

AI Agent Testing Loop 是一个逐步策略,引导你精炼代理直到它们为用户做好准备。你创建测试场景、选择评估指标、运行自动化测试、验证结果,然后使用反馈进一步优化代理以提高准确性和性能。

为什么需要测试策略?代理测试是发布可靠、可信代理的基础。用户与代理互动的方式有无数种变体——在开始测试之前有一个策略是明智的。

Step 1 — Identify Test Scenarios and Create Test Data:在 Preview 面板中手动测试各类用户输入并据此修改代理后,你就可以在 Test Suites (Beta) 中批量测试了。你可以自己编写测试场景(自然语言),也可以让 AI 生成测试用例——基于代理的元数据和允许访问的数据。

Coral Cloud Resorts 的 Service Agent 为例:Experience Management subagent 处理预订体验相关的客户咨询——包括预订、修改会话、回答体验详情。Create Experience Session Booking action 使用 Flow 创建新的体验预订。

要编写好的测试场景:在 Agentforce Builder 中查看 subagents 的 Classification Description 和 Scope 字段,以及每条 Instructions。然后编写(或生成)针对这些细节的测试输入。例如针对 Experience Management subagent:

  • Tell me about the _____________ experience.
  • Do you have any bookings for the _____________ experience in July?
  • I need to change my booking.
  • I would like to confirm my booking.

好的测试输入集具备三个属性:Volume(足够数量覆盖不同场景和边界情况)、Diversity(广泛的输入、上下文和变体,包括超出代理范围的输入)、Quality(定义明确、准确、与代理目标相关的测试用例)。建议先生成 10-20 个测试场景,下载 .csv 文件审查,再逐步扩展到更大批次。

Steps 3-5 - Run, Validate, Iterate

Step 2 — Set Evaluation Parameters:Test Suites (Beta) 的 New Test 工作流引导你完成四个屏幕。提供基本信息后,可选择 Context Variables(模拟用户信息或对话上下文),以及选择评估代理性能和质量的标准。每个测试用例包含:Utterance(输入查询)、Expected Subagent(应评估的 subagent)、Expected Actions(应执行的操作)、Expected Response(自然语言描述的期望结果)。

Step 3 — Run the Tests and Evaluate:完成 New Test 工作流后点击 Run Test Suite 运行测试。查看每个评估标准的测试结果。

Step 4 — Validate Your Results:虽然生成的测试告诉你通过/失败状态,但人工审查响应至关重要——确保代理响应与用户互动方式一致、符合品牌语调、不产生毒性或不需要的结果。这一步可捕捉语气不匹配或上下文特定的不准确。

Step 5 — Review and Iterate:测试是迭代过程。使用结果精炼 subagents、actions 和 instructions,直到达到可接受的准确度。测试还可以揭示代理访问的过时数据或需要调整的权限。

Retest Your Agents:代理会演进,业务也会变化。影响代理性能的因素包括:数据变化、权限更新、subagents/actions/prompts 修改、业务流程变更。持续测试帮助你的代理保持相关性和可信度。

Wrap Up & Resources

Agentforce 的测试工具箱为你提供了从手动调试到规模化自动化测试的完整路径。Agentforce Builder 的 Preview + Session Tracing 让你深入理解代理行为;Test Suites (Beta) 让你批量验证数百个场景。五步测试策略(Define → Prepare → Run → Validate → Iterate)提供了系统化框架来持续精炼代理,确保每次迭代都让代理更准确、更可预测、更值得信赖。


文章来源:Trailhead - Agentforce Testing Tools and Strategies