跳转到内容

训练系统与实验管理

大规模训练基础设施、分布式训练与实验追踪。

类型 Topics · 更新 2026-07-20

本Topic聚焦大规模机器学习与具身/自动驾驶模型的训练系统与实验管理问题:如何在GPU集群上高效组织数据并行、流水线并行与异构并行,支撑超大规模语言模型、多模态与端到端驾驶策略的稳定可复现训练;如何管理从数据加载、检查点、混合精度到闭环强化学习仿真的全流程实验;如何降低通信开销、内存瓶颈与训练-部署差距,使实验室规模方法可扩展到工业级集群与数字孪生环境,同时保证实验可追溯与资源利用率。

  • 模型架构本身的设计细节与新算子发明
  • 推理服务部署与在线serving优化
  • 数据标注流水线或原始数据采集硬件
  • 特定基准数据集的收集与标注协议
  • foundations — 需掌握分布式系统基础、并行计算概念与深度学习训练循环,才能理解数据/模型/流水线并行的通信与同步机制
  • data-engineering — 训练系统依赖高效数据加载与预处理流水线,相邻主题提供数据规模与格式相关前置
术语 含义 常见混淆
数据并行 (Data Parallel) 将同一模型复制到多设备,每个设备处理不同数据分片,梯度聚合更新共享参数 易与模型并行混淆;数据并行主要解决batch规模而非单模型内存墙
流水线并行 (Pipeline Parallel) 将模型层切分到不同设备形成流水线,微批次在阶段间流动以隐藏通信 气泡(bubble)空闲与流水线深度/微批次数权衡常被忽略
张量/模型并行 将单层或算子内的计算与参数切分到多设备,共同完成前向/反向 与流水线并行组合时通信模式更复杂,易误判为纯数据并行
异构并行映射 针对MoE等稀疏结构,动态或静态地将专家与通信路径映射到异构设备拓扑 与均匀数据并行不同,需处理负载不均与专家路由
本地分片异构数据并行 (LSHDP类) 在数据并行框架下进一步本地分片处理异构数据分布,减少全局同步开销 与标准AllReduce数据并行差异在于分片策略与异构性处理
检查点与实验管理 训练过程中模型/优化器状态保存、恢复、版本与超参追踪机制 常被简化为简单save/load,忽略大规模下异步一致性与存储成本
闭环强化学习训练流水线 在数字孪生或仿真环境中持续交互收集轨迹并更新策略的系统级循环 与开环模仿学习不同,强调环境交互、稳定性与sim-to-real差距管理

早期训练以单机或简单数据并行为主,通信与内存限制模型规模。随后引入模型并行与流水线并行(如Megatron-LM体系)实现千亿级语言模型在GPU集群上的高效训练。近期进一步针对MoE稀疏结构发展异构并行折叠与本地分片策略,并在具身/驾驶领域将大规模3DGS数字孪生与RL闭环流水线结合,从纯监督学习转向可扩展的交互式训练系统,强调通信中心设计、实验可复现与资源异构适配。

  1. Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM(精读)— 奠基性阐述GPU集群上大规模语言模型的数据/张量/流水线并行组合与实现,是理解现代分布式训练系统的核心入口
  2. A Survey of End-to-End Driving: Architectures and Training Methods(精读)— 系统梳理端到端驾驶的架构与训练方法谱系,为具身/自动驾驶训练系统设计提供方法论对照
  3. RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS and Reinforcement Learning(中文笔记)— 展示大规模3DGS数字孪生环境下闭环RL训练端到端策略的系统流水线,连接训练系统与具身应用
  1. 先读Megatron-LM论文掌握数据/张量/流水线并行基础与GPU集群实现要点
  2. 对照LSHDP与MoE Parallel Folding理解异构与稀疏模型下的并行映射扩展
  3. 阅读端到端驾驶训练方法综述,建立自动驾驶训练范式全景
  4. 精读RAD笔记与论文,理解大规模仿真闭环RL训练系统的工程组织
  5. 回顾关键词与相邻主题,梳理实验管理、检查点与资源调度共通问题
Paper 输入 输出 表示 训练目标
Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM 大规模语言模型与GPU集群拓扑 高效可扩展的分布式训练系统与并行策略 模型切分+数据并行+流水线微批次 最大化吞吐与模型规模同时控制通信与内存
MoE Parallel Folding: Heterogeneous Parallelism Mappings for Efficient Large-Scale MoE Model Training with Megatron Core 大规模MoE模型与异构设备 异构并行映射与折叠策略 专家路由感知的并行布局 提升MoE训练效率与负载均衡
LSHDP: Locally sharded heterogeneous data parallel for distributed deep learning 异构数据分布下的分布式训练任务 本地分片异构数据并行方法 本地分片+异构感知聚合 降低同步开销并适配数据异构性
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS and Reinforcement Learning 大规模3DGS数字孪生环境与驾驶策略 闭环RL训练的端到端驾驶策略 3DGS仿真+IL正则化RL流水线 缩小开环-闭环差距并降低碰撞率(待核验具体数值)
A Survey of End-to-End Driving: Architectures and Training Methods 端到端驾驶文献与方法 架构与训练方法分类综述 梳理训练范式与系统设计要点
  • 并行策略组合不当导致通信瓶颈或流水线气泡过高,吞吐骤降
  • 检查点与恢复在超大规模下一致性与存储开销失控
  • 异构设备或MoE路由负载不均引发训练不稳定
  • 闭环仿真与真实传感器差距导致sim-to-real失效
  • 实验配置与随机种子管理缺失造成不可复现结果
  • 数据加载与训练计算不平衡形成I/O瓶颈
  • 如何在更大规模MoE与多模态模型上自动搜索最优异构并行映射
  • 闭环RL训练系统如何与真实世界数据高效混合并保证安全
  • 训练系统层面对通信中心架构(如6G相关)的适配边界在哪里
  • 实验管理工具如何与数字孪生及具身数据流无缝集成
  • 本地分片与传统AllReduce在极端异构数据下的理论与实测边界(待核验)
  1. 数据并行、张量并行与流水线并行各自主要解决什么瓶颈?组合使用时需注意哪些通信与气泡问题?
  2. Megatron-LM体系如何通过并行策略扩展语言模型训练规模?其核心工程权衡是什么?
  3. 针对MoE模型,异构并行折叠与标准数据并行相比有何额外挑战?
  4. RAD如何利用大规模3DGS构建闭环训练环境?它试图解决端到端驾驶训练中的哪些经典问题?
  5. 在分布式训练实验管理中,检查点设计与可复现性保障有哪些常见工程风险?

本 Topic registry 入选 13 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
foundational Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM 2021 auto refresh 2026-07-19 sources=arxiv,crossref
watch City-Scale Multi-Camera Vehicle Tracking Guided by Crossroad Zones 2021 cross-topic assign from registry title match=1 keywords; 202
watch MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making 2024 cross-topic assign from registry title match=1 keywords; 202
foundational The Multimodal Universe: Enabling Large-Scale Machine Learning with 100TB of Astronomical Scientific Data 2024 auto refresh 2026-07-19 sources=arxiv
recent MoE Parallel Folding: Heterogeneous Parallelism Mappings for Efficient Large-Scale MoE Model Training with Megatron Core 2025 auto refresh 2026-07-19 sources=arxiv
recent Efficient Multimodal Streaming Recommendation via Expandable Side Mixture-of-Experts 2025 auto refresh 2026-07-19 sources=arxiv
watch DrivIng: A Large-Scale Multimodal Driving Dataset with Full Digital Twin Integration 2026 cross-topic assign from registry title match=1 keywords; 202
watch Meta-ROS: A Next-Generation Middleware Architecture for Adaptive and Scalable Robotic Systems 2026 cross-topic assign from registry title match=1 keywords; 202
watch A Communication-Centric 6G-LLM Architecture for Scalable Tactical Autonomous Defense Vehicle Networks 2026 cross-topic assign from registry title match=1 keywords; 202
recent HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining 2026 cross-topic assign from registry title match=2 keywords; 202
recent LSHDP: Locally sharded heterogeneous data parallel for distributed deep learning 2025 auto refresh 2026-07-19 sources=crossref
foundational A Survey of End-to-End Driving: Architectures and Training Methods 2020 Covers training methods for end-to-end driving systems
recent RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS and Reinforcement Learning 2025 RAD large-scale RL training with 3DGS — systems-scale traini

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)

Section titled “基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)”

近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)

Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”

观察清单(选题 5 · 可学习 5 · 待获取 PDF 0)

Section titled “观察清单(选题 5 · 可学习 5 · 待获取 PDF 0)”

成熟度 seed · 内容数 13 · 论文池 13