AI 基础设施学习笔记
从一块 GPU / NPU 开始,理解一台服务器,再走向完整的 AI 集群。
两条学习路线
Section titled “两条学习路线”| 专题 | 学习重点 | 从这里开始 |
|---|---|---|
| NVIDIA B300 | 千卡集群架构、网络、存储、供电与制冷、部署验收 | 进入 B300 手册 |
| 华为 AI · 昇腾 | Ascend、CANN、PyTorch、MindSpore、大模型推理 | 进入华为 AI 笔记 |
NVIDIA B300:从整体架构到工程落地
Section titled “NVIDIA B300:从整体架构到工程落地”以 128 台 8-GPU 节点,共 1,024 GPU 为当前学习设计基线。依次理解计算节点、集群网络、存储和数据中心的约束,再进入部署和验收。
华为 AI:先跑通单机,再理解集群
Section titled “华为 AI:先跑通单机,再理解集群”先认识硬件和软件栈的分工,再理解版本配套与模型运行方式。
查看最近更新。具体参数和操作步骤请结合文章中的适用版本、核验日期及官方来源阅读。