跳到主要内容
注册无需实名认证
安云主机 AnYun VPS

术语表 · GPU 与算力

张量并行

Tensor Parallelism

又写作

TPtensor parallel模型并行多卡切分

要点

什么是张量并行?

张量并行是把同一层的权重矩阵切分到多张 GPU 上同时计算的并行方式,用来运行单卡显存放不下的模型;由于每一层都要跨卡交换中间结果,卡间互联的带宽直接决定它的效率。

要与数据并行分清楚:数据并行是每张卡各放一份完整模型、各跑不同批次的数据,通信量小、扩展容易,但要求单卡放得下整个模型;张量并行正好相反,是为「放不下」而生的。

实践上的取舍很朴素:同机多卡且有 NVLink 时,张量并行才顺手;只有 PCIe 时通信开销明显,把两张小卡拼起来往往不如直接换一张大显存的卡省心。

常见误解

张量并行不是把两张 24 GB 的卡变成一张 48 GB 的卡:切分本身有显存冗余与通信开销,还要框架支持你的模型结构。能用单卡解决就用单卡,这是这个领域少有的、几乎没有例外的经验。

本站相关页面

多卡与互联方式

相关术语

和「张量并行」一起看 4 条

NVLink NVLink Interconnect

NVLink 是 NVIDIA 的显卡间高速互联通道,带宽显著高于 PCIe,作用是让多张卡在切分同一个模型时快速交换中间结果;消费级的 RTX 4090 与 5090 不提供 NVLink,专业卡与数据中心卡才有。

显存 VRAM (Video Memory)

显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。

大模型 Large Language Model (LLM)

大模型是参数量在十亿级以上的深度学习模型的统称,中文语境下通常特指大语言模型(LLM);模型名字里的 7B、13B、70B 指的就是参数量,它直接决定了运行所需的显存。

算力 Compute Power (FLOPS)

算力指 GPU 每秒能完成的浮点运算次数,通常以 TFLOPS 标注,它决定模型跑得多快;算力与显存是两个互不替代的维度——显存决定能不能跑,算力决定跑得快不快。

联系 工单
扫码
手机访问

扫码在手机上打开