Huawei AI Learning
查看原始笔记 · 仓库最近更新:2026-10-03。具体核验日期以正文为准。
面向 AI 初学者的华为 AI / 昇腾学习笔记。目标不是堆术语,而是逐层搞清楚:硬件是什么、软件栈怎么配合、大模型如何跑起来、最后怎样扩展到 AI 集群。
最后更新:2026-10-03
先看懂全景图
Section titled “先看懂全景图”AI 应用 / Agent / RAG ↓大模型(盘古、DeepSeek、Qwen 等) ↓PyTorch / MindSpore ↓CANN(昇腾 AI 软件栈) ↓Ascend NPU / Atlas ↓超节点 SuperPoD / AI 集群 ↓RoCE / IB / 存储 / 服务器 / 液冷 / 数据中心一句话理解:
- Ascend / 昇腾:华为 AI 计算平台的核心。
- NPU:执行 AI 计算的处理器。
- Atlas:基于昇腾的 AI 计算产品/服务器/集群体系。
- CANN:连接 AI 框架与昇腾硬件的软件栈,可类比理解为昇腾生态中非常关键的“CUDA 层”角色,但二者架构和接口并不等同。
- MindSpore:华为主导的 AI 框架。
- PyTorch on Ascend:让大量 PyTorch 工作负载迁移到昇腾的重要路线。
- ModelArts:华为云上的 AI 开发与训练平台。
- SuperPoD / 超节点:把大量 AI 加速卡通过高速互联组织成更大的计算系统。
2026 年值得重点关注
Section titled “2026 年值得重点关注”1. 从单卡转向超节点和大规模集群
Section titled “1. 从单卡转向超节点和大规模集群”华为 AI 基础设施的重点已经不只是“某一张昇腾卡有多快”,而是计算、互联、网络、存储和系统软件共同组成的大规模 AI 系统。
学习时因此不要只研究 NPU 参数,还需要逐步理解:
- 单 NPU
- 单服务器多 NPU
- 多服务器训练
- SuperPoD 超节点
- 大规模 AI Cluster
2. CANN 是必须掌握的核心
Section titled “2. CANN 是必须掌握的核心”以后看到昇腾相关报错时,经常会碰到:
- Driver
- Firmware
- CANN Toolkit
- AscendCL
- HCCL
- torch_npu
- 算子兼容
- 版本匹配
所以学习昇腾时,CANN 应当排在很前面,而不是最后再学。
3. PyTorch + Ascend 很重要
Section titled “3. PyTorch + Ascend 很重要”对于已经熟悉 CUDA / PyTorch 的开发者,PyTorch 迁移到昇腾是非常现实的路线。
初学者暂时记住:
普通 PyTorch ↓torch_npu ↓CANN ↓Ascend NPU后续会单独建立 PyTorch → Ascend 迁移实验。
Level 0:AI 基础
Section titled “Level 0:AI 基础”先理解:
- CPU / GPU / NPU
- Tensor
- FP32 / FP16 / BF16 / INT8 / INT4
- Training 与 Inference
- Transformer
- Token
- 参数量
- 显存/HBM
- FLOPS
- 带宽
- AllReduce
目标:以后看到“70B、BF16、8 卡训练、HCCL”时知道它们分别在说什么。
Level 1:认识华为 AI 产品
Section titled “Level 1:认识华为 AI 产品”学习:
- Ascend
- Atlas
- 昇腾服务器
- AI 加速卡
- SuperPoD
- 华为云 ModelArts
Level 2:CANN
Section titled “Level 2:CANN”重点:
- CANN 架构
- Driver / Firmware / Toolkit
- AscendCL
- HCCL
- 算子
- profiling
- 环境变量
- 版本兼容矩阵
Level 3:AI 框架
Section titled “Level 3:AI 框架”两条路线:
路线 A:PyTorch + torch_npu
适合已有 PyTorch 生态和模型迁移。
路线 B:MindSpore
用于理解华为原生 AI 软件生态。
Level 4:跑第一个大模型
Section titled “Level 4:跑第一个大模型”目标:
Linux ↓Ascend Driver ↓CANN ↓PyTorch + torch_npu ↓模型 ↓推理服务 ↓OpenAI-compatible API建议从小模型开始,而不是直接挑战 70B。
Level 5:大模型推理
Section titled “Level 5:大模型推理”继续学习:
- vLLM / 昇腾适配生态
- KV Cache
- Continuous Batching
- Prefill / Decode
- TTFT
- TPS
- 并发
- 量化
Level 6:分布式训练
Section titled “Level 6:分布式训练”重点理解:
- Data Parallel
- Tensor Parallel
- Pipeline Parallel
- Expert Parallel
- MoE
- HCCL
- AllReduce
- Scale-up
- Scale-out
Level 7:AI 集群与数据中心
Section titled “Level 7:AI 集群与数据中心”这部分对网络/系统集成人员尤其重要:
- SuperPoD
- Spine-Leaf
- RoCE
- RDMA
- ECN / PFC
- AI Fabric
- 管理网络
- 存储网络
- 带外管理
- NVMe / 分布式存储
- 液冷
- 供电
- 机柜功率
- 集群监控
- 故障域
huawei-ai-learning/├── README.md├── 01-ai-basics/├── 02-ascend-hardware/├── 03-cann/├── 04-pytorch-on-ascend/├── 05-mindspore/├── 06-llm-inference/├── 07-distributed-training/├── 08-superpod-network/├── 09-modelarts/├── 10-labs/└── updates/第一个阶段的学习目标
Section titled “第一个阶段的学习目标”暂时不要追求“会部署千卡集群”。
第一阶段只解决五个问题:
- 昇腾是什么?
- Atlas、Ascend、NPU 三者是什么关系?
- CANN 为什么必须安装?
- PyTorch 模型怎样跑到 Ascend 上?
- 一台昇腾服务器怎样运行一个大模型?
搞懂这五个问题,再进入 SuperPoD 和大规模网络,会容易很多。
本仓库将持续补充:
- 华为 AI 新产品与新版本
- Ascend / Atlas 硬件
- CANN 安装与排障
- PyTorch 模型迁移
- MindSpore
- 大模型推理
- DeepSeek / Qwen 等模型在昇腾上的实践
- SuperPoD 架构
- AI 集群网络
- 存储与液冷
- ModelArts
- 实验步骤与故障案例
官方资料入口
Section titled “官方资料入口”学习时优先使用华为官方资料:
- Huawei Ascend / 昇腾社区
- CANN Documentation
- MindSpore Documentation
- Huawei Cloud ModelArts Documentation
- Huawei 官方技术与产品发布资料
后续章节会为具体知识点附上对应官方来源和版本日期,避免把旧版本教程与当前版本混用。