GGUF 体积估算

下载或部署 Ollama / llama.cpp 模型前,粗算磁盘与显存需求。

阅读完整指南: Ollama Modelfile 编写与本地 LLM 实践指南 →

隐私提示:本地解析,不上传服务器。

↓ 在下方输入区粘贴内容,结果会立即显示

按参数量(十亿)与量化格式粗算 GGUF 权重文件体积,便于选型本地部署硬件。

预估体积

3.59 GB

注释说明

估算说明

基于常见每参数字节数近似值。实际 GGUF 还含 tokenizer 与对齐填充,请以下载文件为准。

下载或部署 Ollama / llama.cpp 模型前,粗算磁盘与显存需求。

快速开始

  1. 输入参数量

    如 7B、8B、70B,单位十亿参数。

  2. 选择量化

    q4_k_m 等为常见本地推理格式。

量化取舍

位数越低体积越小,但可能影响复杂推理质量; 请结合任务实测。

功能与使用场景

根据参数量、量化位数(Q4/Q8 等)与上下文长度估算 GGUF 模型磁盘占用,帮助部署前规划存储与内存。

本地 Ollama/LM Studio 选型、笔记本硬盘空间评估、边缘设备能否装得下某模型等决策参考。

典型工作流

当你准备下载或部署一个 GGUF 格式的模型时,首先确定模型的参数量。常见的 7B、13B 等数字代表 70亿、130亿参数。输入参数量后选择量化等级(如 Q4_K_M),工具会立即显示预估的磁盘占用和加载后的显存需求。

估算结果可帮助你选择适合设备的模型。例如,4GB 显存的笔记本适合 Q4 量化的 7B 模型,而 24GB 显存的工作站可运行 Q5 量化的 70B 模型。显存不足时,工具会提示你考虑更高量化等级或更小模型。

示例

示例

Input

7B params, q4_k_m

Output

~3.85 GB

FAQ

与运行显存一致吗?

文件体积接近权重占用; 推理还需 KV cache 等额外显存。

为什么实际显存占用比估算值高?

估算值仅包含模型权重。实际运行时,框架需要额外显存存储中间计算结果、键值缓存(对话上下文)和系统开销。例如 7B 模型 Q4 估算 3.8GB,但加载后可能占用 5GB。长文本生成时显存需求会进一步增加。