一、连接与转换数据
学习目标
完成本单元后,你将能够:
- 解释如何连接各种数据源到 Data 360,包括摄取数据和访问零拷贝数据
- 描述数据转换的方式及何时使用每种方式,包括批量和流式数据转换及公式字段
连接数据——两种方式
连接数据是释放数据价值的第一步。数据可以有多种形式、来自不同位置,Data 360 提供集中统一、分析和处理的地方。你有两种选择:
摄取数据(Ingest Data):如果数据存在于 Sales、Service、Industries、B2C Commerce 或 Marketing Cloud Engagement 等 CRM 源中,Data 360 提供灵活的零成本连接器。手动创建数据流来摄取数据,数据保留原始结构和类型并存储在数据湖对象(DLO)中。使用入门数据包(Starter Data Bundles)可节省时间——预配置的数据流自动将 DLO 映射到关联的数据模型对象(DMO)。也可摄取非结构化数据(音频、知识文章)和结构化数据(CSV 文件)。
零拷贝访问外部数据(Zero Copy):双向连接 Data 360 到外部系统(Google BigQuery、Snowflake、Redshift、Databricks),无需复制即可在 Data 360 中自由使用数据。提供完全数据流动性(覆盖现有架构的虚拟操作层)、实时数据访问(无需等待同步)、简化集成(消除复杂数据管道)、增强治理(副本更少、风险更低)。两种连接器:查询联邦(实时数据查询)和文件联邦(大规模数据集分析,成本更低)。
转换和清洗数据
数据连接后,可进行清洗、丰富和操作以满足需求。三种转换方式:
批量数据转换(Batch Data Transforms):用于复杂转换或需要按计划更新的场景。可在特定间隔运行,从多个 DLO 合并数据,使用各种函数创建计算字段,输出到多个 DLO。支持连接、聚合、追加、过滤和使用公式等操作——如使用 Average/Count/Sum 聚合数据、追加多数据集行、过滤不需要的行、连接两个输入节点、计算值、修改字符串、格式化日期、删除列。
流式数据转换(Streaming Data Transforms):适用于数据进入系统时近实时清洗和丰富——如信用卡欺诈检测,立即聚合和规范化传入数据以发现异常。新记录在摄取时即被转换并追加到输出对象。从源 DLO 读取,运行 SQL 查询修改数据,然后映射目标 DLO 到 DMO。
数据流中的公式字段(Formula Fields):在数据流中创建计算字段来清洗和调整原始数据。标准化格式、添加连接键、为满足特定条件的数据添加标记。支持文本操作、类型转换、日期计算和逻辑表达式。例如,将订单确认码与产品 ID 拼接创建唯一标识符。
二、映射与统一数据
学习目标
完成本单元后,你将能够:
- 解释 Data 360 中数据建模和映射的重要性
- 描述完全限定键(FQK)如何防止数据冲突
- 解释统一画像的概念及其重要性
- 解释身份解析如何工作,包括匹配和协调规则
数据建模基础——Customer 360 数据模型
数据连接和转换完成后,下一步是通过映射到标准化结构——数据模型来理解所有数据。Customer 360 数据模型是使数据互操作的标准化数据模型,组织不同类型数据并定义其关系,就像地图图例一样——每个人都理解数据代表什么以及如何关联。提供标准对象供映射多样化数据源,描述可以存在的数据类型及其属性,协调不同数据源以进行洞察、统一、细分和激活。
数据模型对象(DMO):描述事物或操作实例的数据分组,可以是标准或自定义的——存储潜在客户、产品信息或客户详情等信息。属性(Attribute)是关于 DMO 的标准化信息,通常包含在字段中。DMO 是数据模型的构建块。
映射数据到数据模型

当数据进入 Data 360 时,存储在原始数据湖对象(DLO)中。数据映射是将 DLO 中的字段连接到 Customer 360 数据模型中标准化 DMO 字段的过程——这对于下游的细分、洞察和激活至关重要。
入门数据包可能带有预映射字段,但自定义字段或未映射的标准字段需要手动映射。特别关注姓名、ID、邮箱和电话等关键属性——这些是链接个人数据和构建统一画像的关键。
完全限定键(Fully Qualified Keys, FQK):当多个数据流协调到一个 DMO 时,不同记录可能具有相同键值导致冲突。FQK 由源键(Source Key,如 Contact ID)和键限定符(Key Qualifier,如 Marketing Cloud)组成。通过为所有包含键值的 DLO 字段配置键限定符,Data 360 可以准确解读不同来源的数据,确保每条记录具有唯一标识符,防止在查询、细分或计算洞察时出现误读。
通过身份解析创建统一画像
数据映射完成后,运行身份解析规则集(Identity Resolution Rulesets)来创建统一画像。
统一画像(Unified Profiles):通过链接多个数据源创建的单一全面客户视图,基于配置的身份解析规则。将 Data 360 了解的有关客户或账户的所有信息整合到一个画像中。这些画像是可变的——随源数据变化、新数据源处理或规则调整而更新和提升准确性。
理解统一画像——钥匙环的比喻

把统一画像想象成一个钥匙环。钥匙环上有很多不同的钥匙(房门钥匙、车钥匙、U盘),但它不把它们变成一把钥匙,也不宣称某一把是"最好的"——它把它们组织成一个易于访问的单一对象。
统一画像就像连接所有客户 ID 的钥匙环——来自 Salesforce 和外部系统的订阅者 ID、联系人 ID、设备 ID、支付 ID等。每个链接的 ID 保持唯一,但统一画像让你能够访问每个 ID 关联的上下文数据,提供完整的客户全貌。你可以看到机会、避免重复工作。
身份解析规则详解
身份解析通过规则集(Ruleset)构建统一画像,包含针对特定对象(如"个人")的匹配规则和协调规则:
匹配规则类型:
- 精确匹配(Exact):数据必须精确匹配,不允许拼写错误或替代格式
- 模糊匹配(Fuzzy):允许相似匹配,容纳拼写错误或略不同拼写(如"Robert"和"Bob")
- 规范化匹配(Normalized):基于完全相同的信息进行匹配,无论格式如何(适用于邮箱、电话、地址)
协调规则类型:
- 最近更新(Last Updated):选择最近更新的值
- 最高频次(Most Frequent):选择在链接记录中出现最多的值
- 来源优先级(Source Sequence):从可信来源(如 CRM Contact 记录)优先于验证较弱的来源(如 S3 文件上传)
规则可在对象和字段两个级别应用。即使某值未被选入统一画像,所有唯一数据仍被存储。
接下来继续学习:Customer 360 Data Model for Data 360。