显存 VRAM (Video Memory)
显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。
术语表 · GPU 与算力
Compute Power (FLOPS)
又写作
要点
什么是算力?
算力指 GPU 每秒能完成的浮点运算次数,通常以 TFLOPS 标注,它决定模型跑得多快;算力与显存是两个互不替代的维度——显存决定能不能跑,算力决定跑得快不快。
在中文语境里,「算力」也被用作整台机器计算资源的统称,「算力租赁」就是按小时租用 GPU 服务器这门生意的通称。两种用法都常见,看上下文区分即可。
比较标称算力时有一个前提经常被忽略:数字只在同一精度下可比。同一张卡的 FP32、FP16/BF16、FP8、INT8 算力可以相差数倍,带稀疏加速的标称值又比稠密值高一档。把不同精度的数字并排比较,得出的结论没有意义。
还有一个实践上的反直觉之处:大模型推理很多时候受限于显存带宽而不是算力,也就是所谓 memory-bound。这解释了为什么换一张算力高得多的卡,推理速度却没有按比例提升。
本站相关页面
相关术语
显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。
推理指用已经训练好的模型产生结果的过程——生成文本、出图、语音转写、目标检测都属于推理,它是 GPU 租用中最常见的用途,显存要求由模型大小决定,速度要求由并发量决定。
NVLink 是 NVIDIA 的显卡间高速互联通道,带宽显著高于 PCIe,作用是让多张卡在切分同一个模型时快速交换中间结果;消费级的 RTX 4090 与 5090 不提供 NVLink,专业卡与数据中心卡才有。
大模型是参数量在十亿级以上的深度学习模型的统称,中文语境下通常特指大语言模型(LLM);模型名字里的 7B、13B、70B 指的就是参数量,它直接决定了运行所需的显存。