一、了解数据与 AI(Learn About Data and AI)
学完本单元,你将能够:理解数据的概念及其在现代世界中的重要性;解释数据驱动决策在现代组织中的角色及其与传统决策的区别;定义 AI 并说明其在当今世界的意义。
数据的重要性(The Importance of Data)
数据(data)是事实、数字、统计、文档、图片、视频以及其他任何能提供对世界各个方面洞察的信息的集合。今天,数据已成为现代生活和经济的重要组成部分。随着技术的发展,企业能够收集、存储和分析海量数据,以洞察其运营和客户。数据可以说是现代世界中最有价值的资产,并以多种形式被收集。
数据提供了有价值的洞察和信息,帮助个人和组织做出更好的决策。如今数据以前所未有的速度生成,企业和政府都在用数据洞察消费者行为、市场趋势等重要因素。以下是数据影响世界的行业实例:
- 商业与金融:通过分析数据,企业能发现新机遇,开发满足客户需求的新产品和新服务。
- 医疗与医药:通过分析数据,研究人员能识别出带来突破性发现的模式和相关性,数据在开发新疗法和治愈疾病中扮演关键角色。
- 其他行业:数据几乎可用于任何行业,以改进运营、推动业务成功。
数据驱动决策(Data-Driven Decision-Making)
数据驱动决策是基于数据分析而非直觉或个人经验做决策的过程。在现代组织中,由于可用的数据量巨大,数据驱动决策日益重要。它能提供对业务运营、客户行为和市场趋势更准确、更可靠的洞察。
相比之下,传统决策依赖直觉、个人经验和其他主观因素。虽然传统决策在某些情况下有效,但可能导致有偏见的决策和错失机会。要实施数据驱动决策,组织必须有效地收集、存储和分析数据,这需要数据可视化、统计分析和机器学习(ML)等工具和技术。
数据驱动决策在现代组织中的关键益处与成果:
- 提供洞察:通过分析数据,组织能识别出通过其他方式可能不明显显现的模式和相关性,从而做出更明智的决策。
- 改善绩效:数据驱动决策通过识别可降低成本、提高效率和优化运营的领域来改善绩效。
- 提升竞争力:通过用数据洞察客户行为和市场趋势,组织能开发出更好满足客户需求的产品和服务。
AI 的重要性(The Significance of AI)
人工智能(AI)是计算机科学的一个分支,计算机系统在其中使用数据来推理、执行任务,并以类人的推理方式解决问题。AI 之所以在当今世界重要,是因为它能自动化各种任务、提高效率、降低成本。AI 被用于医疗、金融、交通和制造等各行各业,以改进运营、为客户提供更好的服务。
数据对于让 AI 学习和执行通常需要人类智能的工作至关重要。在医疗领域,AI 需要海量的医学影像和患者数据来分析并识别健康风险;在金融领域,AI 分析大量金融数据来做出投资决策和检测欺诈活动;在制造业,AI 用传感器和生产数据来监控设备性能、识别维护问题并优化生产流程。
AI 在各行业的关键应用:
- 医疗:用于医学影像、药物发现和患者监控。AI 驱动的医学影像可帮助医生更准确地检测疾病和损伤,AI 驱动的药物发现可帮助研究人员更快地开发新药,AI 还可实时监控患者状况。
- 金融:用于欺诈检测、信用评分和投资管理。AI 驱动的欺诈检测可帮助银行等金融机构更快、更准确地识别欺诈交易,AI 驱动的信用评分可提供更准确的信用评估。
- 制造:用于质量控制、预测性维护和供应链优化。AI 驱动的质量控制可帮助制造商识别缺陷、提高产品质量,AI 驱动的预测性维护可减少停机、提高效率。
由于 AI 能自动化任务、提高效率、降低成本,它已成为各行各业必不可少的技术。通过使用 AI,企业能改进运营、为客户提供更好的服务,最终提升竞争力、实现更好的成果。
二、理解数据及其意义(Understand Data and Its Significance)
学完本单元,你将能够:解释数据的类型与格式(如表格、文本、图像、音频、视频);使用技术识别数据来源和收集方法;理解糟糕数据对决策的影响。
数据分类与类型(Data Classification and Types)
数据可以按分类划分为三大类:
- 结构化数据(structured data):以特定方式组织和格式化,格式定义明确、易于搜索和分析,例如电子表格和数据库。
- 非结构化数据(unstructured data):不以特定方式格式化,可包括文本、文档、图像、音频录音和视频,例如社交媒体帖子、客户评论,以及电子邮件或 Slack 帖子等对话数据。它更难分析,但能提供关于客户行为和市场趋势的宝贵洞察。
- 半结构化数据(semi-structured data):结构化与非结构化数据的结合,例如 XML 或 JSON 文件。
数据也可以按格式分类:表格数据(tabular)(按行列组织的结构化数据)、文本数据(text)(电子邮件、报告等文本)、图像数据(image)(品牌 Logo、图表、信息图等视觉信息)、地理空间数据(geospatial)(地理坐标与国家地图形状)、时间序列数据(time-series)(一段时间内的信息,如过去一年的每日股价)。
数据还可以按类型分为定量(quantitative)与定性(qualitative):定量数据是数值型、可测量和统计分析的(如销售额、按地理位置统计的客户数、网站流量);定性数据是非数值型,包括文本、图像和视频(如客户评论、社交媒体帖子、调查回复)。理解不同数据类型与分类,有助于组织选择正确的分析方法来获取洞察。
数据收集方法(Data Collection Methods)
识别数据来源是数据分析的重要步骤。数据可从内部(组织内生成的销售数据、客户数据)、外部(组织外获取的市场研究、社交媒体数据)和公开数据集(可免费用于分析和研究的数据库)获得。
数据收集、标注和清理是数据分析的重要步骤:数据收集(data collection)是从各种来源收集数据的过程;数据标注(data labeling)是给数据打标签以便于搜索和分析(如按年龄组或产品类别分类);数据清理(data cleaning)是删除或纠正数据中的错误和不一致(如删除重复数据、纠正拼写错误、填补缺失数据)。
收集数据可用多种技术:调查(surveys)用一组问题从人群中收集数据;访谈(interviews)通过一对一对话收集更详细的数据(但耗时);观察(observation)通过观察和倾听人或事件来收集客户行为数据;网页抓取(web scraping)用软件工具从网站收集竞争对手、市场趋势和客户评论数据。
探索性数据分析(EDA)通常是任何数据项目的第一步,其目标是了解数据中的一般模式,理解其中的洞察和关键特征。
数据在 AI 中的重要性(The Importance of Data in AI)
数据是 AI 的重要组成部分,数据的质量和有效性对 AI 应用的成功至关重要。数据质量与有效性的考量包括确保数据最新、准确、完整、且能代表所研究的人群。不完整、过时或包含错误的数据会对决策和 AI 产生重大影响,导致不准确或有偏见的结果。
数据质量在 AI 项目一开始就很重要,以下几个考虑方面凸显了数据质量的重要性:
- 训练与性能:用于训练 AI 模型的数据质量直接影响其性能,高质量数据确保模型学到准确、有代表性的模式,带来更可靠的预测和更好的决策。
- 准确性与偏见:数据质量对减轻 AI 系统中的偏见至关重要,有偏见或不准确的数据会导致有偏见的结果,强化既有不平等或延续不公平做法。
- 泛化与鲁棒性:AI 模型应能有效处理新的陌生数据,高质量数据确保模型学到相关且多样化的模式。
- 信任与透明度:数据质量与 AI 系统的可信度和透明度密切相关,透明的数据实践有助于建立信任和问责。
- 数据治理与合规:适当的数据质量措施对维护数据治理和遵守监管要求至关重要,组织必须确保 AI 系统中使用的数据符合隐私、安全和法律标准。
要在 AI 中实现高数据质量,需要一个稳健的数据生命周期,聚焦数据多样性、代表性并处理潜在偏见。数据生命周期包括收集、存储、处理、分析、共享、保留和处置等阶段,数据质量在所有这些阶段都很重要。
三、探索 AI 技术与应用(Discover AI Techniques and Applications)
学完本单元,你将能够:识别 AI 的实用用例;识别 AI 模型和 ChatGPT 的局限;理解 AI 的数据生命周期以及数据隐私和安全在 AI 应用中的重要性。
人工智能技术(Artificial Intelligence Technologies)
人工智能是让机器像人类一样学习和思考的广阔领域,涵盖许多技术:
- 机器学习(machine learning):用各种数学算法从数据中获取洞察并做出预测。
- 深度学习(deep learning):用称为神经网络的特定算法找出输入与输出之间的关联,数据量越大越有效。
- 自然语言处理(natural language processing):让机器把人类语言作为输入并据此执行操作的技术。
- 大语言模型(large language models):理解和生成类人文本的高级计算机模型。
- 计算机视觉(computer vision):让机器解读视觉信息的技术。
- 机器人技术(robotics):让机器执行物理任务的技术。
机器学习(ML)可根据学习方法和所解决问题的性质分为几种类型:监督学习(supervised learning)从标注数据中学习并基于发现的模式做预测;无监督学习(unsupervised learning)从无标注数据中学习、在没有预定义输出的情况下发现模式和关系;强化学习(reinforcement learning)让智能体通过试错学习、采取行动以最大化从环境中获得的奖励(常用于机器人、游戏和自主系统)。AutoML 和 OneNine AI、Salesforce AI 等无代码 AI 工具近年已被引入,以最小的人工干预自动构建完整的机器学习管道。
机器学习的角色(The Role of Machine Learning)
机器学习是人工智能的一个子集,用统计算法让计算机从数据中学习,而无需显式编程。它用算法构建能基于输入做预测或决策的模型。
机器学习 vs 传统编程:在传统编程中,程序员必须清楚理解问题以及要实现的目标;而在机器学习中,算法从数据中学习,并生成自己的规则或模型来解决问题。
数据在机器学习中的重要性:数据是驱动机器学习的燃料。用于训练机器学习模型的数据的质量和数量会显著影响其准确性和有效性,必须确保所用数据相关、准确、完整且无偏见。
数据质量与机器学习的局限:为确保数据质量,需要清理和预处理数据,移除噪声(无用或无意义的信息)、缺失值和异常值。机器学习虽然是解决各种问题的强大工具,但也有局限,包括:
- 过拟合(overfitting):模型过于复杂、过度贴合训练数据,导致泛化能力差。
- 欠拟合(underfitting):模型过于简单、未能捕捉数据中的潜在模式。
- 偏见(bias):模型在不能代表真实世界人群的数据上训练。
机器学习还受限于所用数据的质量和数量、复杂模型缺乏透明度、难以泛化到新情况、处理缺失数据的挑战,以及产生有偏见预测的可能。
预测式 AI 与生成式 AI(Predictive vs Generative AI)
预测式 AI(Predictive AI)用机器学习算法基于数据输入做预测或决策,广泛用于欺诈检测、医学诊断和客户流失预测等场景——它训练模型识别数据中的模式,从而对新输入做出准确预测。
生成式 AI(Generative AI)则基于给定输入创建新内容(如图像、视频或文本),而非基于现有数据做预测。它可用于艺术、音乐和创意写作等广泛的应用。
预测式与生成式 AI 并不互斥——许多 AI 应用同时使用两种技术。例如,聊天机器人可能用预测式 AI 理解用户输入,再用生成式 AI 生成类似人类语言的回复。两者对比如下:
- 预测式 AI:能基于标注数据做准确预测;可解决欺诈检测、医学诊断、客户流失预测等广泛问题;受限于可用标注数据的质量和数量;可能在训练标注数据之外难以预测;训练和部署可能需要大量计算资源。
- 生成式 AI:能生成新颖有创意的内容;可用于艺术、音乐、写作等创意应用;可能基于输入数据生成有偏见或不适当的内容;可能难以理解上下文或生成连贯内容;可能不适合需要准确性和精确性的应用。
生成式 AI(ChatGPT)的局限(Limitations of Generative AI)
ChatGPT是一种生成式 AI 工具,用大语言模型对文本输入生成类人回复。它通过在大量文本数据上训练、学习基于前面的词预测序列中的下一个词来工作。
虽然 ChatGPT 能生成类人回复,但也有局限——它可能基于训练数据生成有偏见或不适当的回复,这是机器学习模型的常见问题(它们会反映训练数据的偏见和局限)。例如,如果训练数据包含大量负面或攻击性语言,ChatGPT 可能生成类似的负面或攻击性回复。
ChatGPT 还可能难以理解用户输入的上下文或生成连贯的回复。ChatGPT 只有在其训练数据同样好时才足够好——如果训练数据不完整、有偏见或有其他缺陷,模型可能无法生成准确或有用的回复。与其他机器学习模型一样,数据扮演关键角色:如果训练数据糟糕,ChatGPT 就不会太有用。ChatGPT 的例子证明了数据在有效使用 AI 中的关键作用。
AI 的数据生命周期(Data Lifecycle for AI)
数据生命周期指数据从最初收集到最终删除所经历的各个阶段。AI 的数据生命周期包括数据收集、预处理、训练、评估和部署等一系列步骤,确保所用数据相关、准确、完整且无偏见,所生成的模型有效且合乎伦理。
AI 的数据生命周期是一个持续的过程——模型需要基于新数据和反馈不断更新和细化。这些是数据生命周期的阶段:
- 数据收集(data collection):从传感器、调查和在线来源等各种来源收集数据。
- 数据存储(data storage):数据收集后必须安全存储。
- 数据处理(data processing):处理数据以提取洞察和模式(可能使用机器学习算法)。
- 数据使用(data use):处理后的数据用于其预期目的(如做决策或指导政策)。
- 数据共享(data sharing):有时需要与其他组织或个人共享数据。
- 数据保留(data retention):指数据保留的时间长度。
- 数据处置(data disposal):数据不再需要时安全删除(安全删除数字数据或销毁物理介质)。
虽然 AI 和 ML 有潜力彻底改变许多行业并解决复杂问题,但重要的是意识到它们的局限和伦理考量。
四、了解数据伦理、隐私与实践(Know Data Ethics, Privacy, and Practical Implementation)
学完本单元,你将能够:定义并解释与数据收集和分析相关的伦理考量的重要性;理解确保数据隐私、同意和保密性的伦理问题;理解保护数据的不同方式以及数据保护的法律法规框架,包括 GDPR、CCPA 等相关法律。
数据伦理与 AI(Ethics, Data, and AI)
数据收集和分析是 AI 和机器学习的关键组成部分,但也可能引发伦理担忧。随着数据日益宝贵和可访问,考虑其如何被收集、分析和使用的伦理影响非常重要。数据收集和分析中的伦理问题示例包括:
- 隐私侵犯(privacy violations):未经同意收集和分析个人信息,或将个人信息用于收集目的之外的其他用途。
- 数据泄露(data breaches):未经授权访问或泄露敏感数据,可能对个人或组织造成财务或声誉损害。
- 偏见(bias):数据、算法或决策过程中存在系统性错误或不准确,可能导致不公平或歧视性结果。
为解决这些伦理问题,需确保数据以负责任和合乎伦理的方式被收集、分析和使用。促进数据隐私和保密性的策略包括:加密(encryption)(加密敏感数据,仅授权用户可访问)、匿名化(anonymization)(移除个人身份信息,使其无法追溯到特定个人)、访问控制(access controls)(限制敏感数据仅授权用户访问,确保数据仅用于预期目的)。
应对偏见与公平性(Addressing Bias and Fairness)
数据驱动决策的一个关键挑战是偏见的存在,它可能导致不公平或歧视性的结果。偏见可能在数据生命周期的任何阶段被引入,从数据收集到算法决策。应对偏见、促进公平需要一系列策略:
- 多样化数据来源:确保从多样化来源收集数据,使数据能代表目标人群,用其他来源平衡单一来源中可能存在的偏见。
- 改进数据质量:确保数据准确、完整、能代表目标人群,识别并纠正数据中可能存在的错误或偏见。
- 开展偏见审计:定期审查数据和算法以识别和应对偏见,分析数据以发现可能表明偏见的模式或趋势并采取纠正措施。
- 纳入公平性指标:把公平性指标纳入算法和决策过程的设计,衡量某些决策对不同人群的影响,确保决策公平无偏见。
- 促进透明度:公开数据和算法、解释决策是如何做出的,征求利益相关者的反馈并纳入决策过程。
采用这些策略有助于组织确保其数据驱动决策过程公平无偏见。为确保 AI 和机器学习以负责任、合乎伦理的方式开发和部署,需要建立伦理框架和指南。
数据与 AI 的法律法规框架(Legal and Regulatory Frameworks)
数据保护法律和法规是确保数据被负责任、合乎伦理地收集、分析和使用的重要组成部分。四项重要的数据保护法律和法规:
- 《加州消费者隐私法案》(CCPA):适用于在加州开展业务并收集加州居民个人数据的公司。
- 《健康保险流通与责任法案》(HIPAA):适用于医疗组织,规范美国受保护健康信息的使用和披露。
- 《通用数据保护条例》(GDPR):适用于处理欧盟居民个人数据的所有组织。
- 《欧盟人工智能法案》(EU AI Act):全面的 AI 法规,禁止不可接受风险的系统,并对高风险应用提出具体的法律要求。
政府机构负责执行这些法律法规,调查投诉和数据泄露、开展审计和检查、对违规行为处以罚款和处罚,并为组织提供保护数据和遵守数据保护法的指导。有效的数据生命周期管理需要一系列最佳实践:实施数据治理政策和程序、定期开展审计和评估、确保数据准确完整且能代表目标人群、安全存储数据且仅授权用户可访问、确保数据仅用于预期目的并负责任地共享、设置适当的保护措施、制定数据保留政策并在不再需要时安全删除数据。
Einstein Trust Layer
虽然 AI 及其伦理影响可能很复杂,但它的力量不必以牺牲安心为代价。当你使用 Salesforce 的 AI 解决方案时,你刚学到的所有原则都通过 Einstein Trust Layer 得以实践。
Einstein Trust Layer 是构建在 Salesforce 平台中的安全 AI 架构,是一套协议、安全技术以及数据和隐私控制,用于在你探索生成式 AI 解决方案时保护你的公司安全。它提供了多项功能,让你对自己的安全和品牌感到放心。有了一个致力于赢得你信任的平台,你可以使用代理和生成式功能等最新创新,而无需拿自己的声誉冒险。从屏蔽敏感数据到把相关记录数据与你的提示词合并以获得更准确的结果,Einstein Trust Layer 把安全工程化到 Salesforce 产品中,让你在技术前沿也能自信从容。


















