B300 AI Factory Handbook
查看原始笔记 · 仓库最近更新:2026-10-03。具体核验日期以正文为准。
面向从零学习、设计、建设和运维 NVIDIA B300 大规模 GPU 集群的中文知识库。
当前设计基线:128 台 8-GPU B300 节点 = 1,024 GPU,并预留继续横向扩展能力。
“128 台 B300”与“128 张 B300 GPU”完全不同。本项目默认前者;实际采购口径变化时必须重新计算网络、供电、制冷、机柜和存储规模。
- 小白入门:00-beginner/
- 128 节点总体架构:
01-architecture/ - 网络架构:
02-network/ - 存储架构:
03-storage/ - 机房设计:
04-datacenter/ - 软件平台:
05-software/ - 运维体系:
06-operations/ - 部署与验收:
07-deployment/ - 128 节点实例:
08-design-example/ - 官方资料与变更记录:sources/
- 128 节点如何分组、形成故障域和扩容单元?
- Scale-up(节点内 NVLink/NVSwitch)与 Scale-out(节点间 RDMA)分别解决什么?
- InfiniBand XDR 与 Spectrum-X Ethernet 怎么选?
- 1,024 GPU 需要多少 800G 端口、交换机和光连接?
- Storage / Compute / In-band / OOB 网络为什么分开?
- 机房需要多少 MW、每柜多少 kW、怎样供电和冷却?
- Slurm、Kubernetes、BCM/Mission Control、DCGM、UFM 各负责什么?
- 怎样做 burn-in、NCCL、RDMA、存储和故障切换验收?
- 从 128 扩到 256/512 节点时,哪些基础设施第一天就必须预留?
先做架构和容量模型,再选机房。 AI Factory 的限制往往不是 U 位,而是单柜功率、冷却能力、供电路径、承重、800G 布线距离和网络扩展边界。
本仓库持续更新。采购和施工前,参数必须以当时 NVIDIA、服务器 OEM、网络、存储和机房厂商正式设计文件为准。