美光科技术语表

联邦学习

明亮而模糊的辐射状灯光

深度学习和人工智能 (AI) 正逐渐融入人们的日常生活,各组织正在利用这些技术来优化、加速并提升业务流程。然而,对于许多类似于医疗保健和金融这样的行业而言,获取 AI 训练数据可能颇具挑战性。

如今,数据隐私已成为大众关注的焦点,各组织可能难以获取足够且合适的数据来充分训练其 AI 模型。联邦学习是上述问题的一种解决方案,它提供了一个中央平台,可在不共享数据的情况下对多台设备上的模型进行训练。

什么是联邦学习?

联邦学习的定义:联邦学习是机器学习的一个子集,它允许模型使用来自多台设备的数据集进行训练,同时无需共享原始数据。这种方法不仅能保护数据隐私,还能增强数据安全性,并符合相关法规要求。此外,联邦学习利用多样化的数据源,在保障数据安全的同时,能够训练出更准确、更可靠的模型。

除了数据隐私和安全之外,联邦学习所使用的多个数据来源还可以促进数据多样性。由于在整体学习、模型构建及最终输出时会用到多个数据集,联邦学习可确保模型能够基于更广泛的数据和数据类型进行训练,从而提高模型的准确性和适应性。

联邦学习可以采用协作训练技术。通过允许多个参与机构利用各自的多样化数据训练同一个模型,且无需共享原始数据,大型组织能从这种协作式训练中获益。

联邦学习的工作原理是什么?

联邦学习的原理是在数据源头对数据进行处理,从而确保敏感信息始终保存在本地设备上。参与学习的各方不会共享原始数据,而是会下载一个共享的基础模型,利用各自的私有数据对其进行训练,然后对更新后的模型进行加密并共享,以此实现协作。

模型在某个私有数据集上训练完成后,即可被下载并由下一个参与方进行训练。在所有参与方完成模型的训练和加密后,该模型即可开始分析来自各种来源的新数据集。

目前存在多种联邦学习方法,它们在使用的数据类型方面各有不同。例如,有些模型基于来自不同来源的大量相似数据类型进行训练,另一些模型则基于多样化的数据类型进行训练。

联邦学习的发展历程是怎样的?

联邦学习是近年来兴起的一种机器学习分支,其发展得益于人工智能系统的演进和快速普及。

“联邦学习”这一术语最早于 2016 年由 Google 在一篇论文中提出,该论文探讨了机器学习模型的去中心化训练概念。为应对日益严重的隐私泄露问题,Google 开发了新的技术,可在无需共享原始数据的情况下实现安全的数据训练。

联邦学习有哪些主要类型?

联邦学习目前有几种类型,它们的主要区别在于模型使用数据进行训练的方式,以及用于训练模型的数据类型:

  • 横向联邦学习:在包含相似类型数据的多个数据集上训练模型。这些数据集可以轻松地统一处理。
  • 纵向联邦学习:在多个互不相同但互补的数据集上训练模型,使模型能够生成统一的输出结果。
  • 联邦迁移学习:在预训练好的基础模型上引入新数据集,使原始模型能够迁移其能力,以执行新功能。
  • 集中式联邦学习:在单台服务器上收集并聚合所有客户端的模型更新,以此协调训练过程。该服务器是模型聚合与分发的中心节点。
  • 去中心化联邦学习:没有中央服务器。客户之间会以点对点的方式直接共享模型更新。由于不存在单点故障或控制点,这种方法可以增强安全性和隐私保护。
  • 异构联邦学习:可处理类型不同且格式不兼容的数据,然后以一致的方式训练模型。在完成模型训练之前,需要进行一个自适应步骤,参与训练的客户端会调整其数据和学习率,以实现训练过程的一致性。

联邦学习是如何应用的?

联邦学习是一种可应用于多种机器学习场景的技术和方法。它提供了一种实用的方法,可以在不合并源数据的情况下收集数据集。

与其他类型的机器学习相比,联邦学习的主要优势在于其安全性和数据隐私保护。因此,在 AI 领域,联邦学习的主要用例是那些数据具有内在私密性和安全要求的行业,例如医疗保健行业。

医疗保健行业的企业利用联邦学习技术,在不损害患者隐私的前提下,收集分散的患者数据集。例如,一家健康保险公司可以从客户的个人病历中汇编数据,从而使医院和诊所能够安全地共享私人数据。

同样,金融行业的企业也可以利用联邦学习,通过协作来利用更多数据,从而加强欺诈防范并保障金融安全。这是一个有关如何在保障行业安全的前提下实现机构间数据共享的例子。

联邦学习在开发新技术方面也有用武之地。利用联邦学习,研究人员可以安全地共享数据并从彼此的数据中获益,从而促进创新。这方面的一个例子是自动驾驶汽车的研发。自动驾驶汽车及其他自动驾驶车辆依赖于机器学习技术、模型和算法的实时协同工作,在开发过程中涉及多种需要考虑的模型。为了开发自动驾驶汽车及其支撑技术,负责该技术不同环节的组织可以通过联邦学习开展合作,从而使自动驾驶汽车能够更有效地响应实时事件。

相关技术正在不断创新,目标是开发出更易于使用的版本;各大汽车厂商都在开展这一领域的工作,并拥有不同的测试数据。通过联邦学习来共享这些数据后,人工智能模型便能够提供更好的洞察、预测和分析,从而进一步推动自动驾驶汽车的发展。

常见问答

联邦学习常见问答

联邦学习与机器学习并非互相独立的关系,联邦学习是一种特殊类型的机器学习。联邦学习基于传统的机器学习原理,但引入了一种去中心化的、安全的数据处理方法,使多个参与方能在不损害数据主权的前提下贡献数据。

联邦学习在数据主权方面优势明显,而其缺点是什么? 要建立一个所有参与方都能达成共识的联邦学习平台,可能颇具挑战性。一个可用的平台必须在适当程度上为所有参与方保障数据安全、隐私和合规。
 

如果模型的复杂程度较高,该平台也可能面临隐私方面的挑战。对于需要处理敏感数据的行业,联邦学习是一种解决隐私问题的方案,但数据所有者需要得到充分的保证,以确信他们的隐私确实会得到保护。

联邦学习可应用于深度学习模型,利用来自多个数据源的信息对深度神经网络进行训练。