持续更新
NVIDIA NCA-AIIO 认证备考
AI 基础设施与运维
7 篇文章约 2 小时阅读
- 01AI 为什么需要 GPUAI、机器学习、深度学习的关系,AI 这几年为什么突然加速,训练和推理对硬件的要求有什么不同,以及 GPU 和 CPU 在架构上差在哪。2026-09-27 · 16 分钟
- 02NVIDIA 软件栈与 AI 生命周期从驱动、CUDA、加速库到 NGC、NIM、AI Enterprise,NVIDIA 的软件一层层各管什么;一个模型从数据准备到上线监控,每个阶段用到哪些工具;以及 NVIDIA 的行业方案各对应什么领域。2026-09-27 · 15 分钟
- 03GPU 服务器与互连NVIDIA 数据中心 GPU 的代际演进,GPU 之间靠 PCIe、NVLink、NVSwitch 怎么连,一台 DGX H100 里装了什么,按用途怎么选硬件,以及从一张卡扩展到 SuperPOD 的路径。2026-09-27 · 15 分钟
- 04AI 网络、存储与 DPUAI 集群的流量为什么和普通数据中心不一样,一个集群里的四张网各管什么,RDMA 和 GPUDirect 怎么绕过 CPU,InfiniBand 和以太网怎么选,存储怎么分层,以及 DPU 把哪些活从 CPU 上拿走了。2026-09-27 · 19 分钟
- 05电力散热与上云选择AI 机柜的功率密度为什么让传统机房吃不消,供电冗余和 PUE 是什么,散热从风冷走到液冷的原因,建 AI 机房还要考虑哪些设施条件,以及本地部署、上云和混合各适合什么情况。2026-09-27 · 11 分钟
- 06集群编排与作业调度GPU 集群为什么需要调度系统,Slurm 和 Kubernetes 各自怎么管 GPU,GPU Operator 装了哪些东西,两者怎么选,以及 BCM、Mission Control 这类集群管理软件管的是哪一层。2026-09-27 · 13 分钟
- 07GPU 监控与虚拟化BMC 和带外管理网络怎么在系统死机时救机器,GPU 监控该看哪些指标、GPU-Util 为什么会骗人,nvidia-smi 和 DCGM 各管什么,直通、vGPU、MIG、时间片、MPS 这几种 GPU 共享方式怎么选,最后把各层的安全隔离串起来。2026-09-27 · 21 分钟