显存 VRAM (Video Memory)
显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。
术语表 · GPU 与算力
Inference
又写作
要点
什么是推理?
推理指用已经训练好的模型产生结果的过程——生成文本、出图、语音转写、目标检测都属于推理,它是 GPU 租用中最常见的用途,显存要求由模型大小决定,速度要求由并发量决定。
推理与训练的差别体现在显存上:推理只需要放下权重与上下文缓存,不需要保存梯度和优化器状态,因此同一个模型做推理所需的显存远低于做全参数微调。
常见的部署方式是用 vLLM、TGI 这类推理框架把模型包成一个 HTTP 服务,或者用 ComfyUI、Stable Diffusion WebUI 做图像生成。前者关心吞吐与并发,后者关心单张图的时间。
计费方式与用途要对上:间歇性的批量任务按小时租最划算,用完关机即停止计算算力费用;常驻对外的推理服务则应该考虑月租,因为它本来就要一直开着。
本站相关页面
相关术语
显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。
量化指把模型权重从 16 位浮点降到 8 位或 4 位整数存储,用可接受的精度损失换取显存占用的成倍下降,是让大模型挤进单张消费级显卡的标准手段。
大模型是参数量在十亿级以上的深度学习模型的统称,中文语境下通常特指大语言模型(LLM);模型名字里的 7B、13B、70B 指的就是参数量,它直接决定了运行所需的显存。
CUDA 是 NVIDIA 的并行计算平台与编程接口,PyTorch、TensorFlow 等框架的 GPU 加速全部经由它实现,因此实践中「这台机器能不能跑我的代码」等于「驱动、CUDA 版本与框架编译版本是否对得上」。
按小时计费是 GPU 算力租用的通行方式:从预付余额中按实例运行的小时数扣费,关机即停止计算算力费用,与 VPS 的月付按整月结算完全不是一回事。