持续更新

NVIDIA NCA-AIIO 认证备考

AI 基础设施与运维

7 篇文章约 2 小时阅读
  1. 01
    AI 为什么需要 GPU
    AI、机器学习、深度学习的关系,AI 这几年为什么突然加速,训练和推理对硬件的要求有什么不同,以及 GPU 和 CPU 在架构上差在哪。
    2026-09-27 · 16 分钟
  2. 02
    NVIDIA 软件栈与 AI 生命周期
    从驱动、CUDA、加速库到 NGC、NIM、AI Enterprise,NVIDIA 的软件一层层各管什么;一个模型从数据准备到上线监控,每个阶段用到哪些工具;以及 NVIDIA 的行业方案各对应什么领域。
    2026-09-27 · 15 分钟
  3. 03
    GPU 服务器与互连
    NVIDIA 数据中心 GPU 的代际演进,GPU 之间靠 PCIe、NVLink、NVSwitch 怎么连,一台 DGX H100 里装了什么,按用途怎么选硬件,以及从一张卡扩展到 SuperPOD 的路径。
    2026-09-27 · 15 分钟
  4. 04
    AI 网络、存储与 DPU
    AI 集群的流量为什么和普通数据中心不一样,一个集群里的四张网各管什么,RDMA 和 GPUDirect 怎么绕过 CPU,InfiniBand 和以太网怎么选,存储怎么分层,以及 DPU 把哪些活从 CPU 上拿走了。
    2026-09-27 · 19 分钟
  5. 05
    电力散热与上云选择
    AI 机柜的功率密度为什么让传统机房吃不消,供电冗余和 PUE 是什么,散热从风冷走到液冷的原因,建 AI 机房还要考虑哪些设施条件,以及本地部署、上云和混合各适合什么情况。
    2026-09-27 · 11 分钟
  6. 06
    集群编排与作业调度
    GPU 集群为什么需要调度系统,Slurm 和 Kubernetes 各自怎么管 GPU,GPU Operator 装了哪些东西,两者怎么选,以及 BCM、Mission Control 这类集群管理软件管的是哪一层。
    2026-09-27 · 13 分钟
  7. 07
    GPU 监控与虚拟化
    BMC 和带外管理网络怎么在系统死机时救机器,GPU 监控该看哪些指标、GPU-Util 为什么会骗人,nvidia-smi 和 DCGM 各管什么,直通、vGPU、MIG、时间片、MPS 这几种 GPU 共享方式怎么选,最后把各层的安全隔离串起来。
    2026-09-27 · 21 分钟