学习目标
完成本模块后,你将能够:
- 定义数据画像,并解释它与其他分析技术的区别。
- 识别数据画像提供的关键洞察及其好处。
- 解释为什么数据画像应是任何数据质量计划的第一步。
如果你学过 Data Management Fundamentals,就会知道数据质量管理是一个多步骤流程。在 Salesforce 数据质量管理框架里,数据画像(Data Profiling)是第一步。
什么是数据画像?
数据画像(Data Profiling)是分析数据的结构、内容和质量,以发现有意义模式、异常和指标的过程。它帮助你:
- 理解数据实际如何存储和使用。
- 揭示数据质量问题,如不完整或不一致的值。
- 建立完整性、一致性、正确性的基线。
- 为数据补救和 AI 就绪度的优先级提供依据。
把数据画像想象成数据的「健康体检」——在开始治疗(如数据清洗、丰富、创建重复管理的匹配规则)之前,先检查字段如何填充、数据里存在什么模式。不理解数据,就不知道该清理什么、丰富什么,或者数据是否适合业务用途。
画像与报表/查询的区别 (1)
数据画像 ≠ 报表(Reporting):
- 报表回答业务问题:「上季度卖了多少?」——业务指标、运营度量。
- 画像回答数据质量问题:「多少比例的记录缺少电话号码?」——结构分析。
报表 = 业务表现,画像 = 数据健康。报表告诉你收入,画像告诉你 23% 的收入数据可能因为缺字段而不可靠。不同的问题、不同的工具、不同的目的。
画像与报表/查询的区别 (2)
数据画像 ≠ 查询(Queries):SOQL/SQL 查询返回特定记录(战术性的「显示加州的账户」),而画像分析整个数据集(战略性的「所有对象里 15% 的 State 字段不一致」)。
数据画像 ≠ 仪表盘(Dashboards):仪表盘随时间可视化已知 KPI(监控),画像发现未知问题(发现你原本不知道存在的问题)。
发现先于度量——先画像,再报表、查询、仪表盘。这种「发现优先」的方法正是画像成为任何数据质量计划第一步的原因。
用数据画像诊断数据质量
数据画像从五个质量维度揭示数据的健康状况:
- 完整性(Completeness)——多少比例的字段已填充?
- 唯一性(Uniqueness)——有多少重复记录?
- 一致性(Consistency)——值是否符合预期格式?
- 准确性(Accuracy)——值是否与现实相符?
- 有效性(Validity)——值是否符合预期模式?
画像让数据质量可度量。与其说「我们的数据很糟」,不如说「40% 的 Phone 字段为空、12% 的 Contact 可能是重复、State 有 15 种格式变体」。每个维度都量化了一个具体、可行动的问题。
指导数据质量管理决策 (1)
画像结果告诉你该把精力投在哪里:
- 高影响字段存在大量不一致 → 优先清洗。
- 接近字段限额的对象 → 清理未使用字段释放容量。
- 重复率高的表 → 启动去重项目。
- 从不被访问的数据 → 归档候选(降低存储成本)。
- 填充率低的字段 → 调查原因:集成坏了?用户培训缺口?
画像把数据质量从模糊的担忧变成可优先排序的行动计划——资源投向画像显示能产生最大影响的地方。
指导数据质量管理决策 (2)
继续:
- 验证规则缺口 → 在画像显示格式不一致的地方补规则。
- 集成错误 → 画像揭示模式(来自系统 X 的所有记录都缺字段 Y)。
- 培训需求 → 某些团队持续录入错误数据。
画像不仅发现问题,还揭示根本原因:每条缺字段 Y 的记录都来自系统 X,那是集成修复而非数据录入问题;每个 Industry 值错误的记录都来自销售团队,那是培训需求而非验证规则。坏数据 → 画像 → 找根因 → 系统性修复。数据质量管理由画像驱动。
监控确保数据保持可靠
数据质量会随时间退化,持续画像 = 持续质量保障。监控策略:
- 项目前画像——建立基线。
- 项目后画像——验证改进。
- 定期画像——持续监控(活跃 org 每月、稳定 org 每季度)。
- 设置质量阈值——指标跌破可接受水平时告警。
- 跟踪趋势——数据质量在改善还是退化?
画像不是一次性的——数据会衰减,画像捕捉衰减。数据画像工具会随时间存储结果,能检测数据模式的变化并在异常活动时触发告警。持续画像 = 持续信心。
知道何时该做数据画像
本单元探索数据画像的六大关键用例,以及何时画像能产生最大影响。
在正确的时机运行数据画像
数据画像在两类战略场景下最有帮助:
- 项目规划与执行——在设计迁移、集成或 AI 计划前理解当前数据状态。
- 持续数据治理与监管——随时间监控数据质量,及早发现采用或配置问题。
下面探索数据画像最有价值的六个关键用例。
评估数据与数据模型的当前状态
用例 1:在做出变更前评估。无论是新接手 org 的管理员,还是准备服务新客户的顾问,评估数据状态能让你快速上手。画像帮你理解:
- 哪些对象记录最多?哪些字段填充最多/最少?
- 重复集中在哪里?数据值有什么模式?关系是否完整(没有孤儿记录)?
Luna 评估 Service Cloud 的基础对象 Contact、Case 以及 NTO org 里最大的 10 个对象,发现 Case 对象接近字段限额,于是联系管理员启动字段清理项目。这个基线为后续每个决策提供依据——你无法改进没度量的东西。
清理并优化未使用的字段元数据
用例 2:发现并移除未使用的字段。画像能识别:
- 所有记录中 0% 填充的字段。
- 不在任何页面布局、不被 Apex/Flow/报表引用的字段。
- 来自已停用集成的字段。
Luna 发现 Case 对象有 84 个从未使用的空字段,另有 25 个字段自 2024 年 1 月 1 日起两年多未使用。她识别出可快速安全退役的字段:不属于托管包、创建超过 3 个月、按元数据依赖排序(无依赖的最先处理)。基于证据的弃用——画像证明字段未被使用,然后放心删除。
评估归档节省潜力
用例 3:量化存储缩减。画像识别超过 N 年的记录、Closed/Inactive 状态的记录、X 个月未访问的记录,以及归档候选占用的总存储。
计算:保留的存储成本 ÷ 归档成本 = 归档项目的 ROI。用数据支撑商业论证:「归档 3 年以上的 Case 将减少 40% 存储,每年节省 X 美元」。
Luna 发现 200 万条 Case 记录里只有 20 万条有运营意义(按最近创建时间分析),识别出归档 90% 记录的机会。数字能说服干系人——画像提供数字。
聚焦数据迁移与集成项目
用例 4:迁移前画像源数据。预迁移画像能识别:不满足目标验证规则的数据、源里缺失的必填字段、格式不一致、导入时会翻倍的重复记录、孤儿记录(子无父)。
在迁移前修复问题,而不是之后。预迁移 1 小时画像,节省迁移后 10 小时清理。
NTO 刚收购了另一家公司,计划把客户和 Case 记录迁移到主 Service Cloud org。Luna 用画像识别最近使用的字段、建议归档不再需要的旧记录,让迁移聚焦在高价值字段的小集合上。
评估 AI 与 Agentforce 就绪度
用例 5:评估 AI 的数据质量。AI 模型需要:完整的数据(训练无缺口)、一致的数据(跨记录同义)、准确的数据(正确的标签和值)、无偏的数据(代表所有情况)。
画像揭示:缺失关键字段的记录比例(AI 无法从缺失数据学习)、不一致的分类值(AI 学到错误模式)、代表性不足的细分(AI 偏向多数情况)。
训练前画像——垃圾数据 = 垃圾 AI。在 AI 开发投入前量化这些风险,修复数据质量的成本远低于部署后再修。
监控跨流程阶段的用户采用
用例 6:衡量用户如何与数据交互。画像揭示:各团队/部门的记录创建率、字段填充率(用户是否填全必填信息)、流程阶段推进(记录是否在管道中流动)、被遗弃的记录(创建后从未更新)。
采用洞察:创建记录少的团队 → 培训需求;持续为空的字段 → UX 问题;卡在某阶段的记录 → 流程瓶颈。
Luna 为服务团队新引入的 5 个 Case 字段设置了 4 周自动每日画像,发现 4 个字段持续填充、1 个一直为空,于是跟进业务干系人确认是否需要培训或流程澄清。数据讲述采用的故事——画像让你听到它。
何时做数据画像
战略性安排画像时机:
- 项目前——迁移、集成、AI 实施,建立基线、识别风险。
- 重大变更后——部署、数据加载、org 合并,验证质量未退化。
- 持续(定期)——活跃 org 每月、稳定 org 每季度,在用户报告前发现问题。
- 触发式——大量数据导入后、用户报告数据问题时、合规审计前。
定时画像 = 质量预警系统;触发式画像 = 应急响应。两者结合,全面覆盖。
比较数据画像架构
最后一个单元比较数据画像的部署架构,并学习 NTO 如何选择合适工具。
解决方案架构很重要
画像在哪里、如何运行,会影响结果的性能、安全性和完整性。架构决策决定了:能否画像全部数据还是只部分?敏感数据是否离开 Salesforce?画像作业跑多快?能否结合 Salesforce 和外部数据?
一次性的电子表格分析能回答今天的问题,但无法:迁移后重新评估、对比清理前后的数据、检测数据随时间的变化、跨团队提供一致证据。选择合适的部署架构,才能在速度、治理、可重复性和风险之间取得平衡。
理解画像部署架构 (1)
原生(Native,仅 Salesforce):
- 画像完全在 Salesforce 内运行,数据不离开平台——最大安全性。
- 限于 Salesforce 数据。
- 最适合:受监管行业、PII 敏感数据、只用 Salesforce 的 org。
混合(Hybrid,Salesforce + 外部):
- 画像引擎在外部运行,数据提取、画像、返回结果。
- 可结合 Salesforce 与非 Salesforce 数据,分析更强,但数据离开平台。
- 最适合:需要跨系统画像的多平台环境。
原生把一切留在 Salesforce(安全但限于 Salesforce 数据);混合提取到外部引擎(更强分析但数据离开平台,需安全审查)。权衡是安全 vs 能力。
理解画像部署架构 (2)
外部(External,第三方平台):
- 完整数据提取到外部工具,最大分析能力和灵活性,可结合任何数据源。
- 数据离开 Salesforce——最高安全考量。
- 最适合:数据源多样、安全控制成熟的复杂环境。
关键选择标准:数据量(工具能否处理你的规模)、性能(速度和 org 影响)、安全(数据是否离开 Salesforce)、定制(能否定义自定义规则)、集成(是否适配你的数据栈)、成本(按记录/订阅/一次性)。
没有完美的架构——只有适合你特定需求的权衡。
NTO 的数据画像工具选择
Data 360 是 NTO 数据 + AI 解决方案架构的核心。Luna 评估画像选项后,选择了原生数据画像解决方案(支持 CRM 和 Data 360 数据源,洞察留在 Salesforce 内)。原生画像带来的好处:
- 数据管家可以直接在 Salesforce 里审查和纠正问题。
- Data 360 转换可以自动把有问题的值排除在匹配和统一之外。
- 自动画像可定时运行,把结果喂给监控框架,检测新的异常、不一致或漂移。
正确的架构 = 满足你安全、性能和数据需求的那个。这些决策共同让 NTO 的数据基础保持准确可信。





















