本地模型工具

LLM VRAM Calculator

根据参数量和每参数 bit 数,估算模型权重的理论占用。这是一把粗略的尺,不是显卡兼容性保证。

模型参数

7B 模型输入 7;70B 模型输入 70
常用参数量

理论权重占用

模型权重约等待计算
十进制容量等待计算
每参数等待计算
权重 +20% 参考等待计算
权重 +50% 参考等待计算

公式:参数量 × bit ÷ 8查看计算方法

这只是权重

KV Cache、Activations、Framework overhead、CUDA overhead 和 Runtime buffers 不在理论值中。

量化还有元数据

INT4 不是永远恰好 0.5 byte/parameter;分组、scale、zero point 与格式都会占空间。

上下文影响很大

Context 越长、Batch 越大,KV Cache 通常越高。经验余量不能替代真实运行测试。

本地还是云端,不只看显存。

把硬件、电费、隐私、维护和调用频率一起比较。

阅读本地与 API 对比