跳到主要内容
注册无需实名认证
安云主机 AnYun VPS

术语表 · GPU 与算力

NVLink

NVLink Interconnect

又写作

卡间互联NV 桥NVSwitch显卡互联

要点

什么是NVLink?

NVLink 是 NVIDIA 的显卡间高速互联通道,带宽显著高于 PCIe,作用是让多张卡在切分同一个模型时快速交换中间结果;消费级的 RTX 4090 与 5090 不提供 NVLink,专业卡与数据中心卡才有。

它只在一种场景下真正决定成败:张量并行,也就是同一层的权重被切到多张卡上,每一步都要跨卡通信。此时 PCIe 的带宽会成为瓶颈,卡再多也换不来吞吐。

反过来,数据并行(每张卡各持一份完整模型、各跑各的批次)与「一张卡一个推理服务」这两种用法,通信量很小,走 PCIe 完全够用。多卡不等于必须 NVLink——先确认你的并行方式。

常见误解

产品页写「双卡」「四卡」并不说明卡之间怎么连。看到多卡配置要追问互联方式:PCIe 还是 NVLink,这决定了它适合并行训练还是只适合并行跑多个独立任务。

相关术语

和「NVLink」一起看 4 条

张量并行 Tensor Parallelism

张量并行是把同一层的权重矩阵切分到多张 GPU 上同时计算的并行方式,用来运行单卡显存放不下的模型;由于每一层都要跨卡交换中间结果,卡间互联的带宽直接决定它的效率。

显存 VRAM (Video Memory)

显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。

算力 Compute Power (FLOPS)

算力指 GPU 每秒能完成的浮点运算次数,通常以 TFLOPS 标注,它决定模型跑得多快;算力与显存是两个互不替代的维度——显存决定能不能跑,算力决定跑得快不快。

大模型 Large Language Model (LLM)

大模型是参数量在十亿级以上的深度学习模型的统称,中文语境下通常特指大语言模型(LLM);模型名字里的 7B、13B、70B 指的就是参数量,它直接决定了运行所需的显存。

联系 工单
扫码
手机访问

扫码在手机上打开