计算机科学与探索

北大核心,INSPEC,JST,CSCD,WJCI

国内刊号:11-5602/TP

国际刊号:1673-9418

计算机科学与探索杂志2025年第7期:面向大规模DNN训练场景的容错技术综述

发布日期:

作者:许光远, 张亚强, 史宏志

单位:山东海量信息技术研究院,济南 250101

关键词:容错,深度学习,模型训练,ChatGPT

基金:山东省自然科学基金青年基金(ZR2021QF104)。

由大量异构资源构建的大规模算力集群是训练ChatGPT、Sora等大型深度神经网络(DNN)的必需品,然而训练过程中的故障率往往与训练规模正相关,集群中任一部件故障可能会导致训练任务中断,因此在大规模深度神经网络训练中实现高效容错能力变得尤为重要。对近年大规模神经网络训练的容错技术进行了深入探讨,重点讨论了不同层面上如何有效应对训练过程中出现的故障及相关技术可能存在的优劣势。说明了容错技术在大规模深度神经网络训练中所起的关键作用,阐述了近年来有关大规模深度神经网络训练的容错技术,根据作用主体从训练过程,以及训练体系架构和模块两个层面展开论述。训练过程中的容错设计主要包括检查点和非检查点容错技术。检查点容错技术旨在优化检查点的存储和传输,以减少故障发生时的数据丢失和训练恢复时间。非检查点技术则依赖于弹性训练、冗余计算及参数更新策略,提供更加灵活的故障恢复机制。在训练体系架构和模块的容错设计中,探讨了近年确保大规模集群稳定性的故障检测和管理等容错技术。讨论了容器、数据预处理和矩阵乘法等模块的容错措施,以提升训练任务的效率与容错能力。通过归纳和分析近年提出的容错技术,总结了面向大规模深度学习训练场景的现有挑战,并展望了未来的发展方向,提出了相关优化方向,以适应更大规模深度学习训练场景的容错需求。

来源:2025年第7期

《计算机科学与探索》期刊编辑部

查看计算机科学与探索杂志2025年第7期

联系我们

  • 地址:北京市海淀区北四环中路211号
  • 电话:(010)89056056
  • E-mail:fcst@vip.163.com

咨询工作人员