跳到正文
原文
Google DeepMind·· 2026-04-22精选AI 评分71

Google DeepMind 发布 Decoupled DiLoCo 架构,实现低带宽抗故障的跨数据中心训练

Decoupled DiLoCo: A new frontier for resilient, distributed AI training

AI 导读

Google DeepMind 发布新的分布式训练架构 Decoupled DiLoCo,通过解耦计算岛实现跨数据中心低带宽训练,并在硬件故障时隔离影响继续训练。该架构在 120 亿参数模型上跨美国四个区域以 2-5 Gbps 网络训练成功,速度比传统同步方法快 20 倍以上,并支持混合不同代际硬件(如 TPU v6e 和 v5p)。

推荐理由

该架构以解耦计算岛实现低带宽跨数据中心训练,抗硬件故障并支持混合硬件代际,可帮助理解分布式训练的前沿方向。

正文 · AI 翻译

2026年4月23日 研究

Arthur Douillard 和 DiLoCo 团队

我们的新分布式架构帮助在远程数据中心之间训练大型语言模型——带宽需求更低,硬件弹性更强。

训练前沿AI模型传统上依赖于一个大型、紧密耦合的系统,其中相同的芯片必须保持近乎完美的同步。这种方法对当今最先进的模型非常有效,但当我们展望未来更大规模的代际时,在数千个芯片上维持这种同步水平将成为一个重大的后勤挑战。

今天,在一篇新论文中,我们很高兴分享一种解决这个问题的新方法,称为 Decoupled DiLoCo(分布式低通信)。通过将大规模训练任务分割到解耦的“计算岛”上,并在它们之间异步流动数据,这种架构隔离了局部故障,使系统的其他部分可以继续高效学习。

其结果是,一种在分布式数据中心之间训练高级模型的更具弹性和灵活性的方式。关键是,Decoupled DiLoCo 不会遭受以往分布式方法(如数据并行)在全球规模下因通信延迟而不可行的困扰。

随着前沿模型在规模和复杂性上持续增长,我们正在探索多种方法,以便在更多计算资源、更多地理位置和多样化硬件上训练模型。

图1:将训练任务解耦为独立的“计算岛”(学习单元),可以在相同硬件故障水平下实现几乎不间断的训练,因为这些故障的影响被隔离了。

开发更大规模、更容错的异步训练

Decoupled DiLoCo 建立在两项早期进展之上:Pathways 引入了基于异步数据流的分布式AI系统,以及 DiLoCo 大幅降低了分布式数据中心之间所需的带宽,使得在远程位置训练大型语言模型变得可行。

Decoupled DiLoCo 将这些想法结合起来,以更灵活的方式在规模上训练AI模型。它构建在 Pathways 之上,支持在独立的计算岛(称为学习单元)之间进行异步训练,使得一个区域的芯片故障不会中断其他区域的进展。

这种基础设施还具有自愈能力。在测试中,我们使用了一种称为“混沌工程”的方法,在训练过程中人为引入硬件故障。Decoupled DiLoCo 在丢失整个学习单元后继续训练过程,并在它们恢复在线时无缝地重新集成它们。

使用 Gemma 4 模型测试 Decoupled DiLoCo 表明,当硬件故障时,该系统比传统训练方法能保持更高的学习集群可用性——同时最终提供相同基准水平的机器学习(ML)性能。

图2:左:解耦DiLoCo方法所需的带宽比传统训练方法少几个数量级,因此非常高效。中:随着硬件故障水平的增加,解耦DiLoCo仍然能提供高水平的“有效吞吐量”或有用的训练,而其他方法的有效吞吐量则急剧下降。(前两张图基于模拟训练运行)。右:在实际实验中,使用解耦DiLoCo训练的Gemma 4模型的基准机器学习性能与传统训练方法达到的性能相当。

解耦DiLoCo不仅对故障更具弹性,而且对于执行生产级、完全分布式预训练也很实用。我们成功地在四个不同的美国地区使用2-5 Gbps的广域网(相对于数据中心设施之间现有的互联网连接,这是一个相对可实现的水平,不需要在设施之间新建自定义网络基础设施)训练了一个120亿参数的模型。值得注意的是,该系统实现这一训练结果的速度比传统同步方法快20倍以上。这是因为我们的系统将所需的通信整合到更长的计算周期中,避免了系统中一个部分必须等待另一个部分的“阻塞”瓶颈。

推动AI训练基础设施的发展

在Google,我们采用全栈式AI训练方法,涵盖硬件、软件基础设施和研究。越来越多的收益来自于重新思考这些层如何协同工作。

解耦DiLoCo就是一个例子。通过实现互联网级带宽的训练任务,它可以利用任何位置闲置的计算资源,将闲置资源转化为有用容量。

除了效率和弹性之外,这种训练范式还解锁了在同一训练运行中混合不同代际硬件的能力,例如TPU v6e和TPU v5p。这种方法不仅延长了现有硬件的使用寿命,还增加了可用于模型训练的总计算量。在我们的实验中,来自不同代际、以不同速度运行的芯片仍然与单芯片类型训练运行的机器学习性能相匹配,确保了即使是较旧的硬件也能有效加速AI训练。

此外,由于新一代硬件并非同时在所有地方出现,跨代训练可以缓解反复出现的物流和容量瓶颈。

随着我们今天推动AI基础设施的边界,我们继续探索实现下一代AI所需的弹性系统方法。

致谢

这项工作由Google DeepMind和Google Research的跨团队成员完成。

解耦DiLoCo的主要贡献者和核心贡献者是Arthur Douillard、Keith Rush、Yani Donchev、Zachary Charles、Ayush Dubey、Blake Woodworth、Ionel Gog、Josef Dean、Nova Fallen、Zachary Garrett。运营支持由Nate Keating和Jenny Bishop提供。

我们还感谢Jeff Dean、Marc’Aurelio Ranzato、Raia Hadsell、Arthur Szlam、Edouard Yvinec、Henry Prior、Paul Barham、Michael Isard、Daniel Ramage、Brendan McMahan、Chase Hensel和Zoltan Egyed的额外支持和建议。

来源:Google DeepMind · deepmind.google