跳转到内容

AI 基础设施学习笔记

从一块 GPU / NPU 开始,理解一台服务器,再走向完整的 AI 集群。

专题 学习重点 从这里开始
NVIDIA B300 千卡集群架构、网络、存储、供电与制冷、部署验收 进入 B300 手册
华为 AI · 昇腾 Ascend、CANN、PyTorch、MindSpore、大模型推理 进入华为 AI 笔记

NVIDIA B300:从整体架构到工程落地

Section titled “NVIDIA B300:从整体架构到工程落地”

以 128 台 8-GPU 节点,共 1,024 GPU 为当前学习设计基线。依次理解计算节点、集群网络、存储和数据中心的约束,再进入部署和验收。

华为 AI:先跑通单机,再理解集群

Section titled “华为 AI:先跑通单机,再理解集群”

先认识硬件和软件栈的分工,再理解版本配套与模型运行方式。

查看最近更新。具体参数和操作步骤请结合文章中的适用版本、核验日期及官方来源阅读。

原始笔记:B300 AI Factory Handbook · Huawei AI Learning。