这只是权重
KV Cache、Activations、Framework overhead、CUDA overhead 和 Runtime buffers 不在理论值中。
根据参数量和每参数 bit 数,估算模型权重的理论占用。这是一把粗略的尺,不是显卡兼容性保证。
KV Cache、Activations、Framework overhead、CUDA overhead 和 Runtime buffers 不在理论值中。
INT4 不是永远恰好 0.5 byte/parameter;分组、scale、zero point 与格式都会占空间。
Context 越长、Batch 越大,KV Cache 通常越高。经验余量不能替代真实运行测试。
把硬件、电费、隐私、维护和调用频率一起比较。