跳转到内容

00|小白入门

查看原始笔记 · 仓库最近更新:2026-10-03。具体核验日期以正文为准。

先建立五层模型:GPU → 单机 Scale-Up → 集群 Scale-Out → 高性能存储 → AI Factory 基础设施。

  • HGX:GPU 平台,由 OEM 集成为服务器。
  • DGX:NVIDIA 整机系统。
  • NVLink/NVSwitch:节点内 GPU 高速互联。
  • NCCL:多 GPU collective communication library。
  • RDMA:高性能远程内存访问。
  • InfiniBand:HPC/AI 高性能网络。
  • RoCE:Ethernet 上的 RDMA。
  • Spectrum-X:NVIDIA AI Ethernet 平台。
  • DCGM:GPU telemetry/diagnostics/health。
  • UFM:InfiniBand fabric 管理。
  • Slurm:HPC/AI 作业调度。

推荐顺序:8-GPU 单机 → NVLink/NVSwitch → NCCL → RDMA → 32 节点 SU → 128 节点 fabric → 存储 → 电力/冷却 → 调度/监控 → 验收。