联合学习
什么是联合学习?

联合学习是一种机器学习方法,即在分布式数据源中训练 AI 模型,而无需将所有原始数据移动到一个中心位置。每个参与的设备、服务器、组织或位置都不会在单个系统中收集敏感数据,而是在本地训练模型并共享模型更新,这些更新可以整合成更强大的共享模型。

阅读时长:12 分钟 30 秒 | 发布日期:2026 年 7 月 31 日

目录

    联合学习要点

    • 联合学习可帮助组织跨分布式数据源训练 AI 模型,而无需集中原始数据。
    • 联合学习位于 AI、数据隐私和分布式计算的交汇点,因为模型训练发生在不同的系统、站点、设备或组织之间。
    • 常见用例包括医疗保健研究、金融服务、欺诈检测、移动应用、边缘 AI 和跨组织协作。
    • 联合学习可以改善隐私和数据访问,但仍然需要强大的安全性、治理、监控和基础设施规划。

    联合学习的作用是什么?

    简而言之,联合学习使 AI 模型能够从许多位置的数据中学习,而无需将所有数据复制到一个位置。数据留在更接近创建位置的地方,而模型则从多个位置的模式中学习。

    例如,多家医院可能希望使用医疗数据训练 AI 模型,但他们可能无法彼此共享患者记录。利用联合学习,每家医院都可以根据自己的数据在本地训练模型。然后可以组合这些模型更新,帮助改进共享模型,而无需直接移动原始患者数据。

    联合学习为何如此重要?

    联合学习至关重要,因为组织通常需要更多数据来改进 AI 模型,但由于隐私、安全性、合规性、数据主权或运维等方面的限制,他们无法始终集中这些数据。

    这对于医疗保健、金融服务、电信、政府、制造业和研究等行业尤为重要。这些组织可能拥有分布在各个地点、业务部门、设备、合作伙伴或地区的宝贵数据。联合学习可以帮助他们基于 AI 进行协作,同时更好地控制数据保留位置。

    联合学习还可以支持边缘 AI。当设备、传感器、机器或移动应用创建数据时,本地训练可以减少将大量原始数据发送回中央系统的需求。

    联合学习的工作原理是什么?

    联合学习的工作原理是将模型发送到多个参与系统,在本地训练该模型,然后将模型更新整合到改进的共享模型中。

    典型的联合学习流程包括:

    • 使用中央系统或协调层来创建初始模型。
    • 参与计划的客户端、设备、服务器或组织基于本地数据训练模型。
    • 每个参与方都会发送回模型更新(而非完整的原始数据集)进行聚合。
    • 这些更新将整合到新的全局或共享模型中。
    • 然后重新分发改进后的模型,并重复此过程,直至模型达到所需的性能。

    在某些联合学习方法中,会使用中央服务器来协调聚合。而在更分散的方法中,参与方可在不依赖单个中央聚合器的情况下交换模型更新。

    联合学习与传统机器学习对比

    联合学习和传统机器学习都利用数据训练模型,但它们以不同的方式处理数据。

    领域

    传统机器学习

    联合学习

    数据位置

    通常在训练前将数据集中起来。

    数据分布在设备、位置或组织之间。

    训练流程

    在中央环境中基于数据训练模型。

    跨多个环境在本地训练模型。

    数据迁移

    原始数据通常移动到共享数据湖、仓库或训练系统。

    模型更新会迁移,而原始数据则保留在更接近其来源的地方。

    隐私保护方法

    隐私措施取决于集中数据的保护方式。

    通过减少对原始数据集中化的需求来改善隐私保护。

    常见用例

    一般 AI 训练、分析、集中式数据科学、模型开发。

    医疗保健、金融、边缘 AI、移动应用、受监管数据、跨组织 AI。

    主要挑战

    收集、存储、保护和管理大型集中数据集。

    协调分布式训练、安全性、模型质量和治理。

    联合学习什么情况下最有用?

    联合学习并不总是优于传统机器学习。在无法轻松移动或共享数据,但组织仍希望跨分布式数据源训练模型时,它最有用。

    联合学习与分布式学习对比

    联合学习是一种分布式机器学习,但这两个概念并不相同。

    领域

    分布式学习

    联合学习

    主要目标

    跨多个系统加快或扩展模型训练。

    跨分布式数据源训练模型,同时将原始数据保留在本地。

    数据环境

    可以跨多个计算节点集中管理和拆分数据。

    数据通常保留在独立的客户端、站点、设备或组织中。

    关注隐私

    并非总是主要目标。

    隐私和数据位置是核心目标。

    通用设置

    数据中心、云群集、HPC 环境、AI 训练平台。

    医院、银行、移动设备、边缘站点、研究网络、合作伙伴生态系统。

    协调

    通常由中央训练基础设施管理。

    可以使用中央聚合器或分散式协调模型。

    为什么联合学习与分布式学习不同?

    分布式学习通常涉及扩展计算。联合学习通常指在不集中数据的情况下从分布式数据中学习。

    为什么联合学习对隐私很重要?

    联合学习对于隐私至关重要,因为它减少了将原始数据移动到单个集中位置的需求。这可以帮助组织训练 AI 模型,同时使敏感数据更靠近源。

    这并不意味着联合学习自动具有隐私性或安全性。如果模型更新未得到妥善保护,仍可能泄露信息。组织可能需要采用加密、安全聚合、差异性隐私保护、访问控制、审计日志记录和治理策略等技术来降低风险。

    联合学习最好理解为一种可以保护隐私的 AI 训练方法,而非完整的隐私解决方案。

    联合学习的示例有哪些?

    只要组织需要从分布式或敏感数据中学习,联合学习就非常有用。

    用例

    联合学习如何提供帮助

    医疗卫生研究

    医院可以基于 AI 模型进行协作,而无需直接共享患者记录。

    医学成像

    模型可以从多个临床点的成像数据中学习,而数据则保留在本地。

    金融服务

    银行可以改进欺诈检测模型,同时保护敏感的客户数据。

    移动应用

    可以跨多个设备通过用户行为改进模型,而无需集中所有原始用户数据。

    工业边缘 AI

    制造站点可以利用本地设备数据训练模型,而无需迁移所有运营数据。

    零售和客户体验

    分布式商店或区域可以改进模型,同时将客户数据保留在更靠近源系统的地方。

    公共部门和研究机构

    代理或研究机构可以基于 AI 协作,同时保持数据控制和策略边界。

    为什么联合学习示例通常都是隐私敏感型的?

    这些示例说明了联合学习为何对隐私敏感型和分布式环境特别重要。

    联合学习如何支持边缘 AI?

    联合学习支持边缘 AI,允许模型从在边缘或附近创建的数据中学习。组织可以在本地训练模型并共享模型更新,而不是将每一传感器读取数据、图像、日志或设备交互数据移动到中央系统。

    这对于制造工厂、医疗设备、零售点、电信网络、移动应用和联网车辆非常有用。这些环境中的数据可能是敏感的、大型的、低延迟的或者迁移成本昂贵。

    联合学习可以帮助边缘 AI 系统随着时间的推移进行改进,同时减少数据传输需求,并使更多数据保留在靠近创建位置的地方。

    组织如何选择联合学习解决方案?

    组织应根据数据敏感度、用例复杂性、安全要求、基础设施环境和运营成熟度选择联合学习解决方案。

    重要因素包括:

    • 支持跨站点、设备、云或边缘环境的分布式培训。
    • 隐私和安全功能,如加密、安全聚合、访问控制和审计日志记录。
    • 与现有 AI、数据、云、安全和基础设施平台集成。
    • 支持治理、监控、模型验证和合规性报告。
    • 能够跨参与方进行扩展,同时保持性能和可靠性。

    正确的解决方案应有助于团队协调分布式 AI 训练,而不会产生不必要的风险、运营复杂性或数据迁移。

    联合学习有哪些优势?

    联合学习可以帮助组织改进 AI 模型,同时减少将敏感或监管数据集中起来的需求。

    常见优势包括:

    • 提高数据隐私性,因为原始数据可以保留在更靠近其来源的地方。
    • 改善对跨团队、站点、设备或组织的分布式数据的访问。
    • 支持跨多个受监管或隐私敏感型环境间的协作。
    • 减少数据迁移,从而减少带宽、延迟和数据传输问题。
    • 更适合边缘 AI、移动 AI、医疗保健、金融服务和主权数据用例。

    最大的好处是,联合学习可以在直接数据共享困难、受限或存在风险时实现 AI 协作。

    联合学习面临哪些挑战?

    联合学习可能很复杂,因为需要跨分布式系统、数据源和多个参与方训练 AI。

    常见的挑战包括:

    • 跨多个设备、站点或组织协调模型训练。
    • 管理参与方之间的数据质量差异。
    • 保护模型更新免受安全、隐私或中毒风险的影响。
    • 处理不可靠的网络、有限的带宽或不一致的计算资源。
    • 跨分布式环境监控模型性能、偏差、漂移和治理。

    联合学习还需要有明确的策略来管理参与、数据使用、模型所有权、安全性、合规性和责任制事宜。

    HPE 如何支持联合学习

    HP 利用安全的 AI 基础设施、私有云功能、边缘到云平台和服务来支持联合学习,帮助组织构建和运营分布式 AI 环境。

    HPE Private Cloud AI 可以帮助组织在私有云环境中运行企业 AI 工作负载,同时加强对数据、访问、基础设施和运营的控制。这可以为需要隐私保护、治理和安全 AI 部署的组织提供支持,同时将敏感数据置于更强大的控制之下。

    HPE ProLiant Compute 可以为跨数据中心、私有云环境和边缘位置的 AI 和分布式计算工作负载提供服务器基础。NVIDIA AI Computing by HPE 可帮助组织部署可扩展的 AI 基础设施,用于训练、调优和推理。GreenLake 可以支持混合云运维,并支持跨分布式环境的灵活消费模式。

    对于有数据主权、监管或区域性控制要求的组织,HPE AI Factory for Sovereign AI 可以支持围绕数据控制、合规性和安全运维设计的 AI 环境。

    借助 HPE,组织可以构建支持分布式数据、隐私敏感型 AI、边缘 AI、受监管 AI 运维和可扩展计算基础设施的 AI 环境。

    联合学习常见问题

    要评估的最佳联合学习框架是什么?

    常见的联合学习框架有 TensorFlow Federated、Flower、FedML、OpenFL、PySyft 和 FATE。正确框架的选择取决于用例、编程环境、隐私要求、部署模式、可扩展性需求以及与现有 AI 和数据工作流程的集成。

    企业应购买联合学习平台还是自行构建?

    需要支持、治理、安全、监控、集成和更快部署的企业应考虑购买联合学习平台。对于专业研究或高度定制化的需求来说,由内部进行构建可能是合理的,但这需要更多的工程、安全、运维和维护资源。

    金融服务组织应在联合学习平台中寻求什么?

    对于金融服务组织而言,应寻求支持安全协作、数据隐私、可审计性、访问控制、模型监控、欺诈检测用例和监管报告的联合学习平台。它应帮助团队改进模型,同时不会暴露敏感的客户或交易数据。

    医疗保健组织在利用医疗数据进行联合学习时应考虑哪些因素?

    医疗机构应考虑隐私保护、患者知情同意、临床安全性、《HIPAA 法案》或地区合规性要求、数据质量、模型验证、偏差监控及可审计性。联合学习解决方案应帮助多个站点基于 AI 模型进行协作,同时使受保护的健康数据始终处于本地控制之下。