张量并行 Tensor Parallelism
张量并行是把同一层的权重矩阵切分到多张 GPU 上同时计算的并行方式,用来运行单卡显存放不下的模型;由于每一层都要跨卡交换中间结果,卡间互联的带宽直接决定它的效率。
术语表 · GPU 与算力
NVLink Interconnect
又写作
要点
什么是NVLink?
NVLink 是 NVIDIA 的显卡间高速互联通道,带宽显著高于 PCIe,作用是让多张卡在切分同一个模型时快速交换中间结果;消费级的 RTX 4090 与 5090 不提供 NVLink,专业卡与数据中心卡才有。
它只在一种场景下真正决定成败:张量并行,也就是同一层的权重被切到多张卡上,每一步都要跨卡通信。此时 PCIe 的带宽会成为瓶颈,卡再多也换不来吞吐。
反过来,数据并行(每张卡各持一份完整模型、各跑各的批次)与「一张卡一个推理服务」这两种用法,通信量很小,走 PCIe 完全够用。多卡不等于必须 NVLink——先确认你的并行方式。
本站相关页面
相关术语
张量并行是把同一层的权重矩阵切分到多张 GPU 上同时计算的并行方式,用来运行单卡显存放不下的模型;由于每一层都要跨卡交换中间结果,卡间互联的带宽直接决定它的效率。
显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。
算力指 GPU 每秒能完成的浮点运算次数,通常以 TFLOPS 标注,它决定模型跑得多快;算力与显存是两个互不替代的维度——显存决定能不能跑,算力决定跑得快不快。
大模型是参数量在十亿级以上的深度学习模型的统称,中文语境下通常特指大语言模型(LLM);模型名字里的 7B、13B、70B 指的就是参数量,它直接决定了运行所需的显存。