显存 VRAM (Video Memory)
显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。
术语表 · GPU 与算力
CUDA (Compute Unified Device Architecture)
又写作
要点
什么是CUDA?
CUDA 是 NVIDIA 的并行计算平台与编程接口,PyTorch、TensorFlow 等框架的 GPU 加速全部经由它实现,因此实践中「这台机器能不能跑我的代码」等于「驱动、CUDA 版本与框架编译版本是否对得上」。
版本关系是三层的:显卡驱动决定最高能支持的 CUDA 版本,CUDA Runtime 是实际安装的那一套,框架(PyTorch 等)在编译时又绑定了某个 CUDA 版本。三者错配的典型症状是 torch.cuda.is_available() 返回 False,或者程序启动时报缺少某个 so 库。
这也是「预装镜像」在这个市场是真实卖点的原因:没人愿意把第一个计费小时花在装驱动上。本站的镜像按框架与 CUDA 版本成对固定,不提供会随时间漂移的「最新版」——那种镜像会在某天早上悄悄改掉你的运行环境。
新架构的卡(如 RTX 5090)需要更新的 CUDA 与框架版本才能正常工作,旧版本可能根本认不出这张卡。上机前先确认你的代码栈支持,比开机后再排查省钱。
三层版本,三条命令
nvidia-smi | head -3 # 驱动版本 + 它支持的最高 CUDA 版本
nvcc -V # 实际安装的 CUDA Runtime 版本
python -c "import torch; print(torch.__version__, torch.version.cuda, torch.cuda.is_available())" 本站相关页面
相关术语
显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。
推理指用已经训练好的模型产生结果的过程——生成文本、出图、语音转写、目标检测都属于推理,它是 GPU 租用中最常见的用途,显存要求由模型大小决定,速度要求由并发量决定。
炼丹是中文机器学习圈对训练模型的戏称,取自结果难以预测、只能反复调参试出来的过程;「炼丹炉」指用来训练的机器,「丹」指训练出来的模型权重。
算力指 GPU 每秒能完成的浮点运算次数,通常以 TFLOPS 标注,它决定模型跑得多快;算力与显存是两个互不替代的维度——显存决定能不能跑,算力决定跑得快不快。