模型层 · 本地部署
Models 图谱量化版对比
你决定用哪个模型之后,真正要面对的问题是:同一模型有几十个量化版,我该下哪一个?
本站只回答这一个问题——不评模型强弱,只帮你选对量化版。
先说清楚:这个站的数据怎么来的
直接从 Hugging Face 公开 API 读取的客观数据:文件体积(字节)、上下文长度、架构、许可、下载量、更新时间。
由实测字段按公开规则算出:每权重比特数(依 llama.cpp 命名标准)、档位归属、显存需求区间。推导规则在 METHODOLOGY.md 完整公开,任何人可复算。
哪个量化质量更高、哪个更快、哪个模型更强——这些需要实测,本站不跑 benchmark,所以不装作知道。凡我们给出的主观判断,一律显式标注「我们的口径」。
本站不下载、不托管任何模型权重文件。所有数字都来自公开元数据,点击即可回到发布页核对。
采集时间:2026-09-30(数据快照,非实时)
怎么用这个站
- 先看你有多少显存。这是唯一的硬约束,8GB 和 24GB 能跑的档位完全不同。
- 在 B 区块查速查表。直接给出「这个显存档位该用哪个量化档」,体积是实测值。
- 在 C 区块横向对比量化者。看谁档位全、谁带 imatrix、谁在跟进更新。
- 在 D 区块看单档详解。七个字段说清每个变体是什么、差在哪、什么时候该选它。
- 下载前先读许可。非宽松许可的,页面会标出来,原文链接就在旁边。
已收录系列 按 GGUF 量化实际下载量排序
DeepSeek V4
DeepSeekMIT 许可,量化生态活跃,antirez(llama.cpp 作者)亲自维护量化版。
- 通用对话
- MIT 许可
- 推理
看该选哪一档 →
Gemma 4
GoogleGoogle 开放权重最新一代,三种规格各自都有量化覆盖。
- 通用对话
- MoE 稀疏
- 小尺寸可跑
看该选哪一档 →
GLM 5
智谱 AI智谱当前最新一代,MIT 许可的 Flash 版对本地部署最友好。
- 通用对话
- 工具调用
- MIT 许可
看该选哪一档 →
gpt-oss
OpenAIOpenAI 唯一开放权重系列,20B 版是单卡本地部署的甜点。
- 推理
- MoE 稀疏
- apache-2.0
看该选哪一档 →
Kimi K3
月之暗面月之暗面当前最新一代,41 家量化仓但整体热度中等。
- 通用对话
- 长上下文
看该选哪一档 →
MiniCPM 5
面壁智能 · OpenBMB国产小尺寸代表,2B 规模适合低显存与端侧。
- 端侧
- 小尺寸
- 中文强项
看该选哪一档 →
千问 3.8
阿里 · 通义千问阿里当前最新一代,27B 密集模型是本地部署圈热度最高的一个。
- 通用对话
- 工具调用
- 长上下文
- 中文强项
看该选哪一档 →
收录的量化者 41 位
0ppxnhximxr
6block
Abiray
AesSedai
Amynnnn
AtomicChat
Coder40-95
GrEarl
Kuberwastaken
L-Alchemyst
Mungert
NANI-Nithin
Preyazz
abenzerps
aj9o9
apetersson
aria220
backpack-run
bartowski老牌量化者,档位命名规范、说明文档最完整
batiai
bullerwins
byteshape
ddh0
ggml-orgllama.cpp 所属组织的官方量化发布
giladgd
gooseyai
indiansatoshi
lausannequants
lmstudio-communityLM Studio 官方社区组织,为其 GUI 客户端供包
mradermacherMirostat 作者,长期做低比特实验性量化
muzzy
ngquocvinh
openbmb模型方自己出的 GGUF(最可信的一档)
prithivMLmods
qtum
sokann
tarruda
teamblobfish
unsloth量化覆盖面最广、下载量最高的第三方量化者
vcruz305
zurichquants
数据来源与法律立场
数据来自 Hugging Face 公开 API(模型元数据 + 文件体积),采集时间 2026-09-30,为快照数据而非实时。
本站不跑 benchmark,不给质量与速度结论。凡涉及主观判断处均标注「我们的口径」。
不下载、不托管任何权重文件;许可原样引自发布页,本站不解读许可、不构成法律意见,一切以发布页原文为准。
系列选择依据四维打分(量化热度 40 / 量化广度 25 / 规模可及性 20 / 新鲜度 15),方法与落选名单见 数据仓 METHODOLOGY.md ↗。