跳到主要内容
注册无需实名认证
安云主机 AnYun VPS

术语表 · GPU 与算力

显存

VRAM (Video Memory)

又写作

VRAM显卡内存视频内存xiancunGPU 内存

要点

什么是显存?

显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。

这是选卡时第一个要算清楚的数字,顺序不能颠倒:先确认模型放得下,再比较速度。粗略的估算方法是按精度折算权重大小——FP16 每个参数占两个字节,所以 70 亿参数(7B)的模型权重约 14 GB;4-bit 量化后大致降到四分之一上下。这只是权重,实际还要给上下文缓存留出余量。

第二个常被算漏的部分是 KV 缓存:推理时每一个并发请求、每一段上下文都要占显存,且随上下文长度线性增长。「权重刚好塞进去」的配置,往往在并发上来之后 OOM。留 20% 以上的余量是常见做法。

本站的 GPU 机型按显存分档而不是按卡的型号分档,就是这个原因:24 GB、32 GB、48 GB、80 GB 是四个不同的能力边界,型号只是实现方式。

常见误解

多卡的显存不能简单相加。两张 24 GB 的卡不等于一张 48 GB 的卡:单个模型仍受限于单卡容量,除非做张量并行或模型切分,而那要求框架支持并且卡间通信不成为瓶颈。

先看显存,再谈别的

# 机器上每张卡的显存与当前占用
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv

# 粗略估算(只算权重,不含上下文缓存)
#   FP16   :参数量(B) × 2   ≈ 显存 GB   →  7B ≈ 14 GB
#   4-bit  :参数量(B) × 0.6 ≈ 显存 GB   →  70B ≈ 42 GB
# 实际部署再按经验留出 20% 以上余量给 KV 缓存

相关术语

和「显存」一起看 5 条

量化 Quantization

量化指把模型权重从 16 位浮点降到 8 位或 4 位整数存储,用可接受的精度损失换取显存占用的成倍下降,是让大模型挤进单张消费级显卡的标准手段。

大模型 Large Language Model (LLM)

大模型是参数量在十亿级以上的深度学习模型的统称,中文语境下通常特指大语言模型(LLM);模型名字里的 7B、13B、70B 指的就是参数量,它直接决定了运行所需的显存。

ECC 显存 ECC Video Memory

ECC 显存是带纠错校验的显存,能自动纠正单比特翻转错误,专业卡与数据中心卡配备,消费级的 RTX 4090、5090 没有——这是长时间训练任务倾向于选专业卡的主要理由之一。

张量并行 Tensor Parallelism

张量并行是把同一层的权重矩阵切分到多张 GPU 上同时计算的并行方式,用来运行单卡显存放不下的模型;由于每一层都要跨卡交换中间结果,卡间互联的带宽直接决定它的效率。

推理 Inference

推理指用已经训练好的模型产生结果的过程——生成文本、出图、语音转写、目标检测都属于推理,它是 GPU 租用中最常见的用途,显存要求由模型大小决定,速度要求由并发量决定。

联系 工单
扫码
手机访问

扫码在手机上打开