跳到主要内容
注册无需实名认证
安云主机 AnYun VPS

术语表 · GPU 与算力

推理

Inference

又写作

inferencetuili跑模型出图

要点

什么是推理?

推理指用已经训练好的模型产生结果的过程——生成文本、出图、语音转写、目标检测都属于推理,它是 GPU 租用中最常见的用途,显存要求由模型大小决定,速度要求由并发量决定。

推理与训练的差别体现在显存上:推理只需要放下权重与上下文缓存,不需要保存梯度和优化器状态,因此同一个模型做推理所需的显存远低于做全参数微调。

常见的部署方式是用 vLLM、TGI 这类推理框架把模型包成一个 HTTP 服务,或者用 ComfyUI、Stable Diffusion WebUI 做图像生成。前者关心吞吐与并发,后者关心单张图的时间。

计费方式与用途要对上:间歇性的批量任务按小时租最划算,用完关机即停止计算算力费用;常驻对外的推理服务则应该考虑月租,因为它本来就要一直开着。

常见误解

显存刚好放下权重,不代表能服务多个并发请求。KV 缓存随并发数与上下文长度增长,容量算漏这一块的服务通常在上线后的第一个高峰崩掉,而不是在测试时。

本站相关页面

推理与出图机型

相关术语

和「推理」一起看 5 条

显存 VRAM (Video Memory)

显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。

量化 Quantization

量化指把模型权重从 16 位浮点降到 8 位或 4 位整数存储,用可接受的精度损失换取显存占用的成倍下降,是让大模型挤进单张消费级显卡的标准手段。

大模型 Large Language Model (LLM)

大模型是参数量在十亿级以上的深度学习模型的统称,中文语境下通常特指大语言模型(LLM);模型名字里的 7B、13B、70B 指的就是参数量,它直接决定了运行所需的显存。

CUDA CUDA (Compute Unified Device Architecture)

CUDA 是 NVIDIA 的并行计算平台与编程接口,PyTorch、TensorFlow 等框架的 GPU 加速全部经由它实现,因此实践中「这台机器能不能跑我的代码」等于「驱动、CUDA 版本与框架编译版本是否对得上」。

按小时计费 Hourly Billing

按小时计费是 GPU 算力租用的通行方式:从预付余额中按实例运行的小时数扣费,关机即停止计算算力费用,与 VPS 的月付按整月结算完全不是一回事。

联系 工单
扫码
手机访问

扫码在手机上打开