Agentforce Data Library Basics — 代理数据库基础

从接地概念到动手实操:了解为什么需要数据接地(90% 企业数据是非结构化)、四大核心概念(接地/分块/索引/检索器)、自动化设置和运行时流程,以及为 Coral Cloud Spa 服务创建基于文件的数据库的完整步骤。...

📅 2025/10/10 ✍️ ponybai 🏷️ agentforce, data library, rag, salesforce

01 用真实世界数据升级 AI

学习目标

  • 描述使用 Agentforce Data Library 的好处
  • 定义 AI 数据转换和组织的四个关键概念
  • 解释 Data Library 的设置和运行时流程如何工作

为什么要用数据接地 AI?

如果给客户错误的答案,他们可能不会再回来。给服务代表提供不正确的信息,他们会令客户沮丧。提供过时的建议给销售人员,他们会错过目标。虽然数据是 AI 的骨架,但模型天生是通才(Generalists) — 它们在大规模数据集上训练以获取广泛知识,但缺乏您独特业务场景的专业信息。

真实世界数据接地(Grounding)将 AI 模型从静态训练集中解放出来。当您将 LLM 接地到经过验证的来源(Salesforce 知识库、上传的文件、网站)时,它可以更准确地返回客户查询的响应、建议更好的回复给代理,并提供精巧的搜索摘要。

企业数据的挑战

大多数公司将知识库存储为非结构化格式 — 视频、图像、文档、电子邮件、传感器数据、社交媒体帖子、音频文件 — 这些格式无法整洁地放入电子表格或数据库。这种非结构化数据占近 90% 的企业数据。它更难搜索,但包含宝贵的洞察:客户反馈、感知和意见、语气和情感。

Agentforce Data Library 就是答案。它将 AI 接地到您的真实世界数据中,连接您的知识库到 Salesforce AI 功能,提供针对您组织量身定制的最新 AI 生成内容,并自动化将大量非结构化或半结构化数据转换为可搜索内容的转换过程。

为 LLM 转换数据 — 四个关键概念

Agentforce Data Library 自动化 Data 360 和 Prompt Builder 之间的配置。四个关键概念:

接地(Grounding):向提示中添加领域特定知识或客户信息,给 LLM 上下文以准确响应。来源包括知识文章、上传的文件、网站、对话记录等。挑战:冗长文档搜索资源密集,而 LLM 有最大令牌限制。

分块(Chunking):将数据源分解为较小的"块(Chunks)"。块是小的、易于处理的部分(段落、章节),仍然独立有意义。允许系统检索特定、相关的段落而非整个文档。

索引(Indexing):将分块数据组织和分类到搜索索引中。使检索更快更容易,提高结果相关性,并支持处理非常大的数据集。

检索器(Retrievers):充当数据和 AI 功能之间的指针。自动提取和提供来自不同数据库、系统或平台的相关数据。当用户提问时,检索器确定哪些数据集特定 AI 工具可以访问。

设置过程中发生了什么?

当您创建一个数据库时,连接数据与 AI 代理的流程立即开始:数据流被创建 → Data Lake Objects 和 Data Model Objects 生成 → 对象被映射在一起 → 数据分块开始(时间根据文章/文件的数量、大小和复杂度以及选择的分块字段数而变化)→ 分块完成且搜索索引准备好后创建检索器 → 每个数据库有自己唯一的检索器

关键优势:整个配置过程是自动化的 — 不需要手动配置数据流、映射或索引。

运行时发生了什么?

一切就绪后的运行时流程:用户的查询被添加到提示模板中(模板引用检索器)→ 系统搜索索引以找到最相关的信息 → 检索到的信息被合并回提示中,用领域特定上下文丰富它 → LLM 接收这个丰富的提示(用户的查询 + 添加的信息 + 提示指令)并生成响应 → Service Planner 审查响应以确保与提示指令一致 → 最终用户收到准确回答问题且针对特定任务个性化的响应。

02 为代理构建基于文件的数据库

欢迎来到第二单元。在这个动手实操单元中,我们跟随 Becca 在 Coral Cloud Resorts 为 Spa 服务创建基于文件的数据库,上传 PDF 文件,将数据库分配给代理,用真实的客人查询测试它,看 Agentforce Data Library 如何将原始的非结构化内容转化为智能的接地响应。

学习目标

  • 从 Setup 创建和配置数据库
  • 在 Agentforce Builder 中创建或添加数据库

认识 Coral Cloud Resorts — 数据挑战

Coral Cloud Resorts 是一家在全球最迷人目的地拥有酒店的奢华酒店公司。管理员 Becca 想要代理能回答具体问题和完成复杂任务,基于公司独特的政策。但度假村当前的数据是一大堆非结构化内容:邮件、PDF、视频、内部 FAQ — 没有任何东西是为 AI 消费而组织的。

Becca 决定设置一个 Agentforce Data Library 来接地 Coral Cloud 的 AI 聊天机器人。她将把 Spa 服务的 PDF 转化为代理可以搜索和引用的知识。

创建数据库

Becca 从 Setup 搜索 Agentforce Data Library → New Library → 输入唯一名称"Coral Cloud Spa Services"(及可选描述)→ Save。现在她需要选择数据源类型并填充内容。

选择数据源 — 文件上传

Agentforce 提供两种主要数据源选项:Knowledge articles 或 File uploads。选择是永久的,无法更改。Becca 的 Spa 经理通过 PDF 文件分发信息,所以她选择基于文件的数据库。点击 Upload Files → 选择 PDF(大小限制:文本/HTML 4MB,PDF 100MB)→ Save。

点击保存后,自动化流程立即开始:数据流推送至 Data 360、数据对象创建和映射、搜索索引和检索器自动创建。无需手动配置 — 干净、简单,让代理更智能。

将数据库分配给功能

数据库准备好了。Becca 将其分配给代理:点击代理名称 → Open in Builder → Knowledge 标签 → 选择 Coral Cloud Spa Services 数据库 → Save → Activate。代理现在通过检索器拥有对数据库搜索索引的访问权限 — 当客人提问时可以检索上传 PDF 中的相关块。

试试看 — 测试接地后的代理

Becca 检查搜索索引是否就绪,重启预览对话,并进行三次测试:

测试 1 — 基本推荐:询问敏感肌肤的 Spa 服务 → 代理推荐 Tropical Revitalizing 面部护理和 Aloha Aromatherapy 面部护理 — 快速无缝。

测试 2 — 季节性特惠:询问敏感肌肤的季节性特惠 → 代理推荐 Holiday Bliss Package,甚至高亮了附赠的饼干和热巧克力。代理的推理引用了 Becca 上传的文件。

测试 3 — 价格验证:询问 Holiday Bliss Package 的价格 → 代理迅速回复正确的价格,与菜单匹配。

满意所有结果后,Becca 激活代理。它现在已上线,接地于真实的度假村数据,准备帮助客人放松身心。


文章来源:Trailhead - Agentforce Data Library Basics