GPU 服务器选型为什么不能只看显存

显存决定“能否装下”一部分工作负载,整机架构才决定它能否稳定、持续、高效地跑起来。

客户说“我要多大显存”时,我会先确认模型、精度、上下文、批量、并发和训练还是推理。显存很重要,但只看显存,最容易买到一台参数好看、业务表现不稳定的服务器。

第一层是 GPU 本身:型号、数量、显存容量、精度支持和软件生态必须与框架、驱动及目标模型匹配。第二层是数据通路:多 GPU 工作负载会受 PCIe、NVLink 或 NVSwitch 拓扑影响;GPU 分布在不同 CPU 根端口上,通信路径和 NUMA 关系会改变效率。NVIDIA 配置指南要求关注 PCIe 代际、通道宽度和 GPU 在 CPU 插槽与根端口间的均衡,而不是只列 GPU 数量。

第三层是整机平衡。CPU 负责数据准备和调度,系统内存承接模型加载与缓存,NVMe 和外部存储决定数据供给,网卡决定多节点与存储访问,电源和散热决定持续负载下能否维持性能。NVIDIA 参考配置中,推理和训练系统的内存建议至少达到总 GPU 显存的 2 倍;这是参考起点,不是所有项目的固定答案,但足以说明“显存之外还有一整套比例关系”。

我会把选型拆成四步:用真实任务测单卡基线;确认多卡是否需要高速互联;核对 CPU、内存、存储和网络是否会形成瓶颈;最后验证机房供电、散热、驱动、框架与运维能力。只有这四步闭环,GPU 显存才会转化成可用算力,而不是闲置资产。

我的建议显存回答“能不能放进去”,拓扑和整机平衡回答“能不能高效跑”,软件与运维回答“能不能长期交付”。