量化 Quantization
量化指把模型权重从 16 位浮点降到 8 位或 4 位整数存储,用可接受的精度损失换取显存占用的成倍下降,是让大模型挤进单张消费级显卡的标准手段。
术语表 · GPU 与算力
VRAM (Video Memory)
又写作
要点
什么是显存?
显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。
这是选卡时第一个要算清楚的数字,顺序不能颠倒:先确认模型放得下,再比较速度。粗略的估算方法是按精度折算权重大小——FP16 每个参数占两个字节,所以 70 亿参数(7B)的模型权重约 14 GB;4-bit 量化后大致降到四分之一上下。这只是权重,实际还要给上下文缓存留出余量。
第二个常被算漏的部分是 KV 缓存:推理时每一个并发请求、每一段上下文都要占显存,且随上下文长度线性增长。「权重刚好塞进去」的配置,往往在并发上来之后 OOM。留 20% 以上的余量是常见做法。
本站的 GPU 机型按显存分档而不是按卡的型号分档,就是这个原因:24 GB、32 GB、48 GB、80 GB 是四个不同的能力边界,型号只是实现方式。
先看显存,再谈别的
# 机器上每张卡的显存与当前占用
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv
# 粗略估算(只算权重,不含上下文缓存)
# FP16 :参数量(B) × 2 ≈ 显存 GB → 7B ≈ 14 GB
# 4-bit :参数量(B) × 0.6 ≈ 显存 GB → 70B ≈ 42 GB
# 实际部署再按经验留出 20% 以上余量给 KV 缓存 本站相关页面
相关术语
量化指把模型权重从 16 位浮点降到 8 位或 4 位整数存储,用可接受的精度损失换取显存占用的成倍下降,是让大模型挤进单张消费级显卡的标准手段。
大模型是参数量在十亿级以上的深度学习模型的统称,中文语境下通常特指大语言模型(LLM);模型名字里的 7B、13B、70B 指的就是参数量,它直接决定了运行所需的显存。
ECC 显存是带纠错校验的显存,能自动纠正单比特翻转错误,专业卡与数据中心卡配备,消费级的 RTX 4090、5090 没有——这是长时间训练任务倾向于选专业卡的主要理由之一。
张量并行是把同一层的权重矩阵切分到多张 GPU 上同时计算的并行方式,用来运行单卡显存放不下的模型;由于每一层都要跨卡交换中间结果,卡间互联的带宽直接决定它的效率。
推理指用已经训练好的模型产生结果的过程——生成文本、出图、语音转写、目标检测都属于推理,它是 GPU 租用中最常见的用途,显存要求由模型大小决定,速度要求由并发量决定。