首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
拆解MindSpeed LLM:4层架构与核心模块,看懂昇腾大模型训练框架的设计
📅 2026/9/25 8:29:05
✍️ 爱科研究院
👁 阅读 3,247
拆解MindSpeed LLM4层架构与核心模块看懂昇腾大模型训练框架的设计【免费下载链接】MindSpeed-LLM昇腾LLM分布式训练框架项目地址: https://gitcode.com/Ascend/MindSpeed-LLMMindSpeed LLM 是面向昇腾生态的LLM 分布式训练框架为昇腾硬件上的大语言模型训练提供端到端方案涵盖分布式预训练、指令微调以及权重转换、推理、评估等完整工具链。这篇文章将带你逐层拆解它的4 层架构与核心代码模块帮助新手快速看懂这个昇腾大模型训练框架的设计思路。如上图所示整个框架自上而下分为LLM 大模型层 → 训练算法层 → 训练后端层 → 功能模块层四个层次底部再叠加 PyTorch、CANN 与昇腾系列硬件的基础底座。官方对架构的详细描述可参考 docs/zh/introduction.md。第1层模型层内置 100 主流开源大模型最上层是框架支持的LLM 大模型按架构类型分为两大族Transformer 族包含 Dense 模型Qwen3 系列等与 MoE 模型DeepSeek、Qwen3、GLM 系列等Transformer-Next 族包含 SSM 模型Mamba2 等与 Linear 模型Qwen3-Next、Bailing 系列等框架预置了100 余个主流开源模型的高性能训练脚本开箱即用。支持的完整模型清单见 docs/zh/pytorch/models/supported_models.md各模型的训练脚本则集中在 examples/ 目录中按mcore/Megatron 后端与fsdp2/FSDP2 后端分类组织。第2层训练算法层预训练与指令微调双通路这一层定义了框架支持的两大训练场景场景覆盖能力分布式预训练数据处理、From Scratch 从头训练、断点继续训练分布式指令微调微调数据处理、全参微调 SFT、低参微调 LoRA、量化微调 QLoRA微调链路遵循业界主流流程——数据格式化、模板套入、训练循环整体流程如下图所示在并行策略上框架提供 TP张量并行、PP流水线并行、DP数据并行、CP上下文并行、EP专家并行等多维并行组合并创新支持逐层分离训练LDT等昇腾大模型训练优化方案对应入口脚本包括 pretrain_gpt.py预训练、posttrain_gpt.py后训练/微调与 rlhf_gpt.pyRLHF 训练。第3层训练后端层Megatron 与 FSDP 双引擎这是框架设计中最关键的一层——双训练后端让不同开发习惯的团队都能以最低成本接入新模型Megatron 训练后端开启 MindSpeed Core 加速以 Megatron-LM 为基座基于 ModelSpec 模板做模型增量开发支持 TP/PP/VP/EP/CP/DP 全并行策略适合追求极致性能的大规模预训练FSDP 训练后端开启 FSDP Turbo 加速以 MindSpeed-FSDP 为基座直接接入 HuggingFace Transformers 模型定义支持 FSDPEP / FSDPCP 组合新模型以天为单位即可适配适合快速实验与中小规模训练。FSDP2 后端的训练入口为 train_fsdp2.py两套后端的使用差异与选型建议可在 项目导读 的模型运行样例中找到。第4层功能模块层覆盖训练全流程的工具链最底层的功能模块分为两类把训练之外的脏活累活全部封装好训练开发模块权重转换Megatron ↔ HuggingFace、在线推理、在线评估易用性模块训练 Profiling 性能分析、确定性计算、断点续训、最终权重保存以 Profiling 为例框架可直接采集昇腾硬件上的时间线、显存与算子级别数据用于定位训练性能瓶颈对应根目录工具脚本convert_ckpt.py权重转换、inference.py模型推理、evaluation.py模型评估、preprocess_data.py数据预处理。核心代码模块mindspeed_llm 的 5 大子模块看懂宏观架构后再看代码。核心代码全部位于 mindspeed_llm/ 目录由 5 个子模块协同工作协作关系为core/→features_manager/→training/→tasks/fsdp2/作为独立后端平行存在子模块职责代表内容core/底层核心能力张量/流水线/上下文并行、Transformer 与 MoE 实现、优化器、高可用断点续训features_manager/特性注册与管理通过补丁机制按需注入 Flash Attention、LoRA、MoE 路由、量化感知训练等特性training/训练生命周期管理参数解析、分布式初始化、检查点管理与训练主循环tasks/业务执行层评估、推理、微调、权重转换等具体任务实现fsdp2/FSDP2 独立后端完整的模型定义、数据管道、分布式策略与推理引擎其中features_manager/的特性补丁机制值得特别一提各项训练特性如 moe_router.py、lora.py以插件形式注入训练流程可自由组合开关这正是框架能同时支撑上百个模型的工程基础。更细粒度的说明见 项目导读。总结如何快速上手昇腾大模型训练框架回顾 MindSpeed LLM 的设计脉络模型层解决支持哪些模型——100 开源 LLM 开箱即用训练算法层解决怎么训——预训练 指令微调多维并行策略加持训练后端层解决用什么训——Megatron 高性能后端 FSDP 快适配后端双引擎功能模块层解决配套工具——权重转换、推理、评估、Profiling 一应俱全对新手而言建议的上手路径是先读 项目导读 建立全局认知再选择 examples/ 中一个与自身模型相近的示例脚本如 pretrain_qwen3_8b_4k_fsdp2_A3.sh配合 docs/zh/pytorch/training/ 下的快速入门文档跑通第一个训练任务即可完整体验这套昇腾 LLM 分布式训练框架的能力。【免费下载链接】MindSpeed-LLM昇腾LLM分布式训练框架项目地址: https://gitcode.com/Ascend/MindSpeed-LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/25 8:29:05
JavaScript 闭包完全解读:以《You Don‘t Know JS: 作用域与闭包》(you-dont-know-js-ru)第 5 章为例
2026/9/25 8:29:05
从treg说起:OpenRouter+MCP+CLI+Agent工具链组装实战
2026/9/25 8:29:05
PaddleSeg 中的 ANN 非局部语义分割模型:架构原理、配置解析与 Cityscapes/Pascal VOC 实战
2026/9/25 8:59:07
Windows 11 下 IE 兼容方案全解析:IE 模式、ActiveX 与 VBScript 迁移指南
2026/9/25 8:59:07
【LLM】Langchain框架开发应用总结
2026/9/25 8:59:07
Hypothesis API 风格指南:为属性测试库设计一致、易用的策略 API
2026/9/25 8:59:07
Atlas 300V Pro 24G推理加速卡实战:YOLO模型部署全流程解析
2026/9/25 8:59:07
昇腾Atlas 300V实战:YOLO模型部署与推理全流程解析
2026/9/25 8:54:06
业务开发视角的可观测体系建设:从日志、链路到告警的实战指南
2026/9/25 0:03:37
AI元人文:从工具使用到思维重构的深度探索
2026/9/25 0:03:37
Python+CNN车牌识别实战:从数据预处理到模型训练与部署
2026/9/25 0:03:37
Vim基础操作全攻略:保存退出、模式切换与高频命令实战
2026/9/25 5:41:44
深入解析Transformer多头注意力机制与工程优化
2026/9/25 5:41:44
OpenClaw 的 Skills 跑学习任务,模型通道改到 TaoToken 通道行不行?
2026/9/25 5:41:44
ChatGPT报错Oops, an error occurred! 全链路排查指南