快速开始
-
输入参数量
如 7B、8B、70B,单位十亿参数。
-
选择量化
q4_k_m 等为常见本地推理格式。
下载或部署 Ollama / llama.cpp 模型前,粗算磁盘与显存需求。
阅读完整指南: Ollama Modelfile 编写与本地 LLM 实践指南 →
隐私提示:本地解析,不上传服务器。
↓ 在下方输入区粘贴内容,结果会立即显示
按参数量(十亿)与量化格式粗算 GGUF 权重文件体积,便于选型本地部署硬件。
预估体积
3.59 GB
基于常见每参数字节数近似值。实际 GGUF 还含 tokenizer 与对齐填充,请以下载文件为准。
下载或部署 Ollama / llama.cpp 模型前,粗算磁盘与显存需求。
输入参数量
如 7B、8B、70B,单位十亿参数。
选择量化
q4_k_m 等为常见本地推理格式。
位数越低体积越小,但可能影响复杂推理质量; 请结合任务实测。
根据参数量、量化位数(Q4/Q8 等)与上下文长度估算 GGUF 模型磁盘占用,帮助部署前规划存储与内存。
本地 Ollama/LM Studio 选型、笔记本硬盘空间评估、边缘设备能否装得下某模型等决策参考。
当你准备下载或部署一个 GGUF 格式的模型时,首先确定模型的参数量。常见的 7B、13B 等数字代表 70亿、130亿参数。输入参数量后选择量化等级(如 Q4_K_M),工具会立即显示预估的磁盘占用和加载后的显存需求。
估算结果可帮助你选择适合设备的模型。例如,4GB 显存的笔记本适合 Q4 量化的 7B 模型,而 24GB 显存的工作站可运行 Q5 量化的 70B 模型。显存不足时,工具会提示你考虑更高量化等级或更小模型。
Input
7B params, q4_k_m
Output
~3.85 GB
文件体积接近权重占用; 推理还需 KV cache 等额外显存。
估算值仅包含模型权重。实际运行时,框架需要额外显存存储中间计算结果、键值缓存(对话上下文)和系统开销。例如 7B 模型 Q4 估算 3.8GB,但加载后可能占用 5GB。长文本生成时显存需求会进一步增加。