跳到主要内容
注册无需实名认证
安云主机 AnYun VPS

术语表 · GPU 与算力

量化

Quantization

又写作

quantizationlianghua4-bitGGUFGPTQAWQ

要点

什么是量化?

量化指把模型权重从 16 位浮点降到 8 位或 4 位整数存储,用可接受的精度损失换取显存占用的成倍下降,是让大模型挤进单张消费级显卡的标准手段。

常见的格式有 GGUF、GPTQ、AWQ 以及框架内置的 bitsandbytes 方案,选哪个主要取决于你用的推理框架支持哪个,而不是哪个「更先进」。

收益很直接:4-bit 量化后,原本需要 80 GB 显存的模型可能落到 40 GB 出头,于是一张 48 GB 的卡就够了,成本差出一大截。这就是为什么这个市场上「70B 单卡推理」几乎总是指量化之后。

常见误解

量化的质量损失在短问答里几乎看不出来,在长上下文、代码生成与数学推理上会集中暴露。上线前请用你自己的真实问题集横向对比一次量化前后的输出,不要只看公开跑分——跑分测不出你的场景。

本站相关页面

按显存选机型

相关术语

和「量化」一起看 4 条

显存 VRAM (Video Memory)

显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。

LoRA LoRA (Low-Rank Adaptation)

LoRA(低秩适配)是一种参数高效微调方法:冻结原模型权重,只训练一组新增的低秩矩阵,显存占用与产出文件都远小于全参数微调,是消费级显卡上最常用的微调方式。

推理 Inference

推理指用已经训练好的模型产生结果的过程——生成文本、出图、语音转写、目标检测都属于推理,它是 GPU 租用中最常见的用途,显存要求由模型大小决定,速度要求由并发量决定。

大模型 Large Language Model (LLM)

大模型是参数量在十亿级以上的深度学习模型的统称,中文语境下通常特指大语言模型(LLM);模型名字里的 7B、13B、70B 指的就是参数量,它直接决定了运行所需的显存。

联系 工单
扫码
手机访问

扫码在手机上打开