跳到主要内容

智谱 AIZhipu AI · 发布于 2026-08-25

GLM 5GLM 5

智谱当前最新一代,MIT 许可的 Flash 版对本地部署最友好。

  • 通用对话
  • 工具调用
  • MIT 许可

先说清楚:这个站的数据怎么来的

✅ 实测字段

直接从 Hugging Face 公开 API 读取的客观数据:文件体积(字节)、上下文长度、架构、许可、下载量、更新时间。

✅ 推导

由实测字段按公开规则算出:每权重比特数(依 llama.cpp 命名标准)、档位归属、显存需求区间。推导规则在 METHODOLOGY.md 完整公开,任何人可复算。

❌ 我们不说的

哪个量化质量更高、哪个更快、哪个模型更强——这些需要实测,本站不跑 benchmark,所以不装作知道。凡我们给出的主观判断,一律显式标注「我们的口径」。

本站不下载、不托管任何模型权重文件。所有数字都来自公开元数据,点击即可回到发布页核对。 采集时间:2026-09-30(数据快照,非实时)

成员 1GLM 5.3(完整版)

754B 总参(MoE,激活数未公开) · 旗舰 · 7 个量化来源

A基础模型卡 这一档位是什么

官方发布页zai-org/GLM-5.3 ↗
许可other

⚠ 非宽松许可,以发布页原文为准。本站不解读许可条款,也不给法律意见。

规模754B 总参(MoE,激活数未公开)
架构glm-dsa
上下文长度1,048,576 tokens
定位旗舰
官方下载量1.4M 点赞 2k
最近更新2026-09-04

许可为 other,须读发布页原文。

B该选哪个 按你的显存倒推

按「你实际有多少显存能装」选档位,而不是按参数猜。下面每档的体积都是实测值(来自发布页文件列表),加权 15% 余量给运行时与 KV cache。

显存 → 档位速查(体积最小的可行档,质量最高的那一档)
8 GB 显存这一档没有能装下的版本(最小是 216.6 GB)
消费级入门卡、共享显卡
12 GB 显存这一档没有能装下的版本(最小是 216.6 GB)
RTX 3060 12G / 4060Ti 16G 降配使用
16 GB 显存这一档没有能装下的版本(最小是 216.6 GB)
RTX 4060Ti 16G / 4070S 超配
24 GB 显存这一档没有能装下的版本(最小是 216.6 GB)
RTX 3090 / 4090
48 GB+ 显存这一档没有能装下的版本(最小是 216.6 GB)
A6000 / L40S / Mac 统一内存
展开:本系列所有档位的实测体积(1 档)
量化档体积每权重比特档位最小体积来源
Q2_K 217 GB 2.80 bpw 极限压缩 sokann

「每权重比特」是按 llama.cpp 公开命名标准从文件名推导的,同一档位在不同模型上的真实值会略有差异。这是 B 级推导,不是实测值。

C量化版本总表 横向对比

量化者许可档数总体积 上下文建议档下载量更新
unsloth
glm-dsa
other
须读原文
12 5542 GB 1,048,576 UD-IQ4_XS
365 GB
629k 2026-08-29
L-Alchemyst imatrix
glm-dsa
other
须读原文
3 960 GB 1,048,576 Q4_K
431 GB
22k 2026-09-07
AesSedai imatrix
glm-dsa
许可缺失 5 1809 GB 1,048,576 Q4_K
469 GB
1k 2026-09-03
Coder40-95
glm-dsa
other
须读原文
12 5542 GB 1,048,576 UD-IQ4_XS
365 GB
1k 2026-09-08
sokann imatrix
glm-dsa
other
须读原文
2 1605 GB 1,048,576 BF16
1507 GB
923 2026-09-21
muzzy mit 4 1361 GB — Q4_K
435 GB
448 2026-09-29
0ppxnhximxr imatrix
glm-dsa
other
须读原文
3 912 GB 1,048,576 Q4_K
455 GB
183 2026-08-29

「建议档」是本站按体积最小且落在平衡档的规则自动选出的,不是质量排名。官方量化排在最前;带 imatrix 标记的仓库带重要性矩阵数据。

D每个变体详解 七字段

每个变体按七个字段展开:它是什么 → 量化者做了什么 → 与同系列其他变体的区别 → 存在的意义 → 优势 → 为什么选它 → 已知取舍。最后一项是本站唯一会写主观判断的地方,且都标注了「我们的口径」。

unsloth

other 12 档 · 5542 GB · 629k 下载
它是什么unsloth/GLM-5.3-GGUF ↗,提供 12 个 GGUF 量化档,合计 5542 GB。由 unsloth 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 glm-dsa 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3;权重总字节 5951.1 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(L-Alchemyst 3 档、AesSedai 5 档、Coder40-95 12 档、sokann 2 档 等)。 本仓 12 档,覆盖最全。
存在的意义补上官方没覆盖的档位(UD-IQ4_XS 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 UD-IQ4_XS(365 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 UD-IQ4_XS(365 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 5542 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

L-Alchemyst

other 3 档 · 960 GB · 22k 下载
它是什么L-Alchemyst/GLM-5.3-GGUF ↗,提供 3 个 GGUF 量化档,合计 960 GB。由 L-Alchemyst 发布。
量化者做了什么带重要性矩阵(imatrix:/home/polaris/Projects/Workspace/glm/imatrix-glm53-fixed.dat),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 glm-dsa 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-BF16;权重总字节 1030.8 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(unsloth 12 档、AesSedai 5 档、Coder40-95 12 档、sokann 2 档 等)。 本仓 3 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 Q4_K(431 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(431 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 全仓 960 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

AesSedai

许可缺失 5 档 · 1809 GB · 1k 下载
它是什么AesSedai/GLM-5.3-GGUF ↗,提供 5 个 GGUF 量化档,合计 1809 GB。由 AesSedai 发布。
量化者做了什么带重要性矩阵(imatrix:/mnt/srv/snowdrift/fp16/GLM-5.3/imatrix.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 glm-dsa 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-BF16;权重总字节 1942.7 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(unsloth 12 档、L-Alchemyst 3 档、Coder40-95 12 档、sokann 2 档 等)。 本仓 5 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 Q4_K(469 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(469 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 全仓 1809 GB,硬盘紧张的话建议只下需要的 1~2 个档位

Coder40-95

other 12 档 · 5542 GB · 1k 下载
它是什么Coder40-95/GLM-5.3-GGUF ↗,提供 12 个 GGUF 量化档,合计 5542 GB。由 Coder40-95 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 glm-dsa 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3;权重总字节 5951.1 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(unsloth 12 档、L-Alchemyst 3 档、AesSedai 5 档、sokann 2 档 等)。 本仓 12 档,覆盖最全。
存在的意义补上官方没覆盖的档位(UD-IQ4_XS 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 UD-IQ4_XS(365 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 UD-IQ4_XS(365 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 5542 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

sokann

other 2 档 · 1605 GB · 923 下载
它是什么sokann/GLM-5.3-GGUF ↗,提供 2 个 GGUF 量化档,合计 1605 GB。由 sokann 发布。
量化者做了什么带重要性矩阵(imatrix:/tank/models/zai-org/GLM-5.3/imatrix.dat),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 glm-dsa 架构优化;声明上下文 1,048,576 tokens;权重总字节 1723.5 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(unsloth 12 档、L-Alchemyst 3 档、AesSedai 5 档、Coder40-95 12 档 等)。 本仓 2 档,覆盖最少。
存在的意义补上官方没覆盖的档位(BF16 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 BF16(1507 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 BF16(1507 GB,近似无损)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 全仓 1605 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

muzzy

mit 4 档 · 1361 GB · 448 下载
它是什么muzzy/GLM-5.3-GGUF ↗,提供 4 个 GGUF 量化档,合计 1361 GB。由 muzzy 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;发布页声明溯源到 zai-org/GLM-5.3;权重总字节 1460.8 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(unsloth 12 档、L-Alchemyst 3 档、AesSedai 5 档、Coder40-95 12 档 等)。 本仓 4 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q4_K(435 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(435 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 1361 GB,硬盘紧张的话建议只下需要的 1~2 个档位

0ppxnhximxr

other 3 档 · 912 GB · 183 下载
它是什么0ppxnhximxr/GLM-5.3-GGUF ↗,提供 3 个 GGUF 量化档,合计 912 GB。由 0ppxnhximxr 发布。
量化者做了什么带重要性矩阵(imatrix:/home/ubuntu/models/GLM-5.3-GGUF-source/imatrix_unsloth.gguf_file),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 glm-dsa 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-BF16;权重总字节 979.6 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(unsloth 12 档、L-Alchemyst 3 档、AesSedai 5 档、Coder40-95 12 档 等)。 本仓 3 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 Q4_K(455 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(455 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 全仓 912 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

E量化者档案 选量化者意味着什么

量化者决定了这个包的档位覆盖、命名规范、是否带 imatrix、什么时候跟进新模型。这一区块说明「选这个量化者的量化意味着什么」。

unsloth 量化覆盖面最广、下载量最高的第三方量化者

在本系列:1 个仓 · 629k 下载

定位:量化覆盖面最广、下载量最高的第三方量化者。

擅长什么:几乎每个主流基础模型都第一时间跟 GGUF,且档位最全——从极限压缩到近似无损一应俱全。提供静态(static)与动态(dynamic,用 UD- 前缀)两套量化。

  • 为什么要认 unsloth 版:
  • 覆盖率高 → 你想要的档位通常都有
  • 命名规范 → Q4_K_M 就是 Q4_K_M,不会同档不同名
  • 带 importance matrix(imatrix)→ 量化质量比纯 RTN 更稳
  • 官方教程与 LM Studio / llama.cpp 集成路径最顺

注意:unsloth 的动态量化(UD-Q4_K_XL 等)在同档位下体积略大、速度略慢,换来的是质量通常更好。是否值得取决于你的瓶颈是显存还是速度——这是我们的口径,不是实测结论。

官方发布页:https://huggingface.co/unsloth

发布页 ↗

L-Alchemyst

在本系列:1 个仓 · 22k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

AesSedai

在本系列:1 个仓 · 1k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

Coder40-95

在本系列:1 个仓 · 1k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

sokann

在本系列:1 个仓 · 923 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

muzzy

在本系列:1 个仓 · 448 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

0ppxnhximxr

在本系列:1 个仓 · 183 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

F更新记录 谁在跟进

按更新时间倒序。更新频繁说明该量化者在跟进新版本;长期不更新则基础模型升版后可能不同步。

  • 2026-09-29 muzzy 更新了 4 个档位
  • 2026-09-21 sokann 更新了 2 个档位 · 含 imatrix
  • 2026-09-08 Coder40-95 更新了 12 个档位
  • 2026-09-07 L-Alchemyst 更新了 3 个档位 · 含 imatrix
  • 2026-09-03 AesSedai 更新了 5 个档位 · 含 imatrix
  • 2026-08-29 0ppxnhximxr 更新了 3 个档位 · 含 imatrix
  • 2026-08-29 unsloth 更新了 12 个档位

基础模型 zai-org/GLM-5.3 最近更新:2026-09-04 · 本站采集时间:2026-09-30

成员 2GLM 5.3 Flash

321B 总参(MoE,激活数未公开) · 轻量主力 · 10 个量化来源

A基础模型卡 这一档位是什么

官方发布页zai-org/GLM-5.3-Flash ↗
许可mit
规模321B 总参(MoE,激活数未公开)
架构glm5next / glm5-next (各量化仓申报不一)
上下文长度1,048,576 tokens
定位轻量主力
官方下载量4.7M 点赞 3k
最近更新2026-09-07

MIT 许可,本地部署法律上最干净的 GLM 选项。

B该选哪个 按你的显存倒推

按「你实际有多少显存能装」选档位,而不是按参数猜。下面每档的体积都是实测值(来自发布页文件列表),加权 15% 余量给运行时与 KV cache。

显存 → 档位速查(体积最小的可行档,质量最高的那一档)
8 GB 显存这一档没有能装下的版本(最小是 116.7 GB)
消费级入门卡、共享显卡
12 GB 显存这一档没有能装下的版本(最小是 116.7 GB)
RTX 3060 12G / 4060Ti 16G 降配使用
16 GB 显存这一档没有能装下的版本(最小是 116.7 GB)
RTX 4060Ti 16G / 4070S 超配
24 GB 显存这一档没有能装下的版本(最小是 116.7 GB)
RTX 3090 / 4090
48 GB+ 显存这一档没有能装下的版本(最小是 116.7 GB)
A6000 / L40S / Mac 统一内存
展开:本系列所有档位的实测体积(3 档)
量化档体积每权重比特档位最小体积来源
Q2_K 117 GB 2.80 bpw 极限压缩 vcruz305
作者标注 3.49bpw 140 GB 3.49 bpw 长上下文优先 ddh0
Q4_K 193 GB 4.85 bpw 平衡档 vcruz305

「每权重比特」是按 llama.cpp 公开命名标准从文件名推导的,同一档位在不同模型上的真实值会略有差异。这是 B 级推导,不是实测值。

C量化版本总表 横向对比

量化者许可档数总体积 上下文建议档下载量更新
unsloth
glm5next
mit 12 2366 GB 1,048,576 UD-IQ4_XS
157 GB
953k 2026-09-06
aj9o9 imatrix
glm5next
mit 2 186 GB 1,048,576 IQ3_XXS
112 GB
20k 2026-09-01
vcruz305
glm5next
mit 2 288 GB 1,048,576 Q4_K
193 GB
6k 2026-08-27
batiai imatrix
glm5next
mit 5 610 GB 1,048,576 Q4_K
189 GB
2k 2026-09-04
AesSedai imatrix
glm5-next
许可缺失 5 783 GB 1,048,576 Q4_K
202 GB
2k 2026-08-30
qtum imatrix
glm5next
mit 4 420 GB 1,048,576 IQ4_XS
167 GB
1k 2026-08-31
zurichquants
glm5next
mit 12 2366 GB 1,048,576 UD-IQ4_XS
157 GB
1k 2026-09-01
lausannequants
glm5next
mit 12 2366 GB 1,048,576 UD-IQ4_XS
157 GB
1k 2026-09-02
ddh0 imatrix
glm5-next
许可缺失 1 130 GB 1,048,576 作者标注 3.49bpw
140 GB
862 2026-09-12
backpack-run
glm5-next
mit 1 181 GB 1,048,576 Q4_K
194 GB
760 2026-09-06

「建议档」是本站按体积最小且落在平衡档的规则自动选出的,不是质量排名。官方量化排在最前;带 imatrix 标记的仓库带重要性矩阵数据。

D每个变体详解 七字段

每个变体按七个字段展开:它是什么 → 量化者做了什么 → 与同系列其他变体的区别 → 存在的意义 → 优势 → 为什么选它 → 已知取舍。最后一项是本站唯一会写主观判断的地方,且都标注了「我们的口径」。

unsloth

mit 12 档 · 2366 GB · 953k 下载
它是什么unsloth/GLM-5.3-Flash-GGUF ↗,提供 12 个 GGUF 量化档,合计 2366 GB。由 unsloth 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 glm5next 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-Flash;权重总字节 2540.4 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(aj9o9 2 档、vcruz305 2 档、batiai 5 档、AesSedai 5 档 等)。 本仓 12 档,覆盖最全。
存在的意义补上官方没覆盖的档位(UD-IQ4_XS 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 UD-IQ4_XS(157 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 UD-IQ4_XS(157 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 2366 GB,硬盘紧张的话建议只下需要的 1~2 个档位

aj9o9

mit 2 档 · 186 GB · 20k 下载
它是什么aj9o9/GLM-5.3-Flash-GGUF ↗,提供 2 个 GGUF 量化档,合计 186 GB。由 aj9o9 发布。
量化者做了什么带重要性矩阵(imatrix:imatrix_unsloth.gguf_file),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 glm5next 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-Flash;权重总字节 199.8 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 12 档、vcruz305 2 档、batiai 5 档、AesSedai 5 档 等)。 本仓 2 档,覆盖中等。
存在的意义补上官方没覆盖的档位(IQ3_XXS 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 IQ3_XXS(112 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 IQ3_XXS(112 GB,长上下文优先)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退

vcruz305

mit 2 档 · 288 GB · 6k 下载
它是什么vcruz305/GLM-5.3-Flash-GGUF ↗,提供 2 个 GGUF 量化档,合计 288 GB。由 vcruz305 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 glm5next 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-Flash-BF16;权重总字节 309.6 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 12 档、aj9o9 2 档、batiai 5 档、AesSedai 5 档 等)。 本仓 2 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q4_K(193 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(193 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 288 GB,硬盘紧张的话建议只下需要的 1~2 个档位

batiai

mit 5 档 · 610 GB · 2k 下载
它是什么batiai/GLM-5.3-Flash-GGUF ↗,提供 5 个 GGUF 量化档,合计 610 GB。由 batiai 发布。
量化者做了什么带重要性矩阵(imatrix:/mnt/nas/batiai-models/GLM-5.3-Flash-workspace/imatrix.dat),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 glm5next 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-Flash;权重总字节 654.8 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 12 档、aj9o9 2 档、vcruz305 2 档、AesSedai 5 档 等)。 本仓 5 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 Q4_K(189 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(189 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 全仓 610 GB,硬盘紧张的话建议只下需要的 1~2 个档位

AesSedai

许可缺失 5 档 · 783 GB · 2k 下载
它是什么AesSedai/GLM-5.3-Flash-GGUF ↗,提供 5 个 GGUF 量化档,合计 783 GB。由 AesSedai 发布。
量化者做了什么带重要性矩阵(imatrix:/mnt/srv/snowdrift/fp16/GLM-5.3-Flash/imatrix.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 glm5-next 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-Flash-BF16;权重总字节 840.3 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 12 档、aj9o9 2 档、vcruz305 2 档、batiai 5 档 等)。 本仓 5 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 Q4_K(202 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(202 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 全仓 783 GB,硬盘紧张的话建议只下需要的 1~2 个档位

qtum

mit 4 档 · 420 GB · 1k 下载
它是什么qtum/GLM-5.3-Flash-GGUF ↗,提供 4 个 GGUF 量化档,合计 420 GB。由 qtum 发布。
量化者做了什么带重要性矩阵(imatrix:imatrix.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 glm5next 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-Flash;权重总字节 451.1 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 12 档、aj9o9 2 档、vcruz305 2 档、batiai 5 档 等)。 本仓 4 档,覆盖中等。
存在的意义补上官方没覆盖的档位(IQ4_XS 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 IQ4_XS(167 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 IQ4_XS(167 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 全仓 420 GB,硬盘紧张的话建议只下需要的 1~2 个档位

zurichquants

mit 12 档 · 2366 GB · 1k 下载
它是什么zurichquants/GLM-5.3-Flash-GGUF ↗,提供 12 个 GGUF 量化档,合计 2366 GB。由 zurichquants 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 glm5next 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-Flash;权重总字节 2540.4 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 12 档、aj9o9 2 档、vcruz305 2 档、batiai 5 档 等)。 本仓 12 档,覆盖最全。
存在的意义补上官方没覆盖的档位(UD-IQ4_XS 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 UD-IQ4_XS(157 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 UD-IQ4_XS(157 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 2366 GB,硬盘紧张的话建议只下需要的 1~2 个档位

lausannequants

mit 12 档 · 2366 GB · 1k 下载
它是什么lausannequants/GLM-5.3-Flash-GGUF ↗,提供 12 个 GGUF 量化档,合计 2366 GB。由 lausannequants 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 glm5next 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-Flash;权重总字节 2540.4 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 12 档、aj9o9 2 档、vcruz305 2 档、batiai 5 档 等)。 本仓 12 档,覆盖最全。
存在的意义补上官方没覆盖的档位(UD-IQ4_XS 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 UD-IQ4_XS(157 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 UD-IQ4_XS(157 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 2366 GB,硬盘紧张的话建议只下需要的 1~2 个档位

ddh0

许可缺失 1 档 · 130 GB · 862 下载
它是什么ddh0/GLM-5.3-Flash-GGUF ↗,提供 1 个 GGUF 量化档,合计 130 GB。由 ddh0 发布。
量化者做了什么带重要性矩阵(imatrix:./imatrices/GLM-5.3-Flash-imatrix.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 glm5-next 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-Flash;权重总字节 139.8 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 12 档、aj9o9 2 档、vcruz305 2 档、batiai 5 档 等)。 本仓 1 档,覆盖最少。
存在的意义补上官方没覆盖的档位(作者标注 3.49bpw 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 作者标注 3.49bpw(140 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 作者标注 3.49bpw(140 GB,长上下文优先)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退

backpack-run

mit 1 档 · 181 GB · 760 下载
它是什么backpack-run/GLM-5.3-Flash-GGUF ↗,提供 1 个 GGUF 量化档,合计 181 GB。由 backpack-run 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 glm5-next 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 zai-org/GLM-5.3-Flash;权重总字节 193.8 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 12 档、aj9o9 2 档、vcruz305 2 档、batiai 5 档 等)。 本仓 1 档,覆盖最少。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q4_K(194 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(194 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)

E量化者档案 选量化者意味着什么

量化者决定了这个包的档位覆盖、命名规范、是否带 imatrix、什么时候跟进新模型。这一区块说明「选这个量化者的量化意味着什么」。

unsloth 量化覆盖面最广、下载量最高的第三方量化者

在本系列:1 个仓 · 953k 下载

定位:量化覆盖面最广、下载量最高的第三方量化者。

擅长什么:几乎每个主流基础模型都第一时间跟 GGUF,且档位最全——从极限压缩到近似无损一应俱全。提供静态(static)与动态(dynamic,用 UD- 前缀)两套量化。

  • 为什么要认 unsloth 版:
  • 覆盖率高 → 你想要的档位通常都有
  • 命名规范 → Q4_K_M 就是 Q4_K_M,不会同档不同名
  • 带 importance matrix(imatrix)→ 量化质量比纯 RTN 更稳
  • 官方教程与 LM Studio / llama.cpp 集成路径最顺

注意:unsloth 的动态量化(UD-Q4_K_XL 等)在同档位下体积略大、速度略慢,换来的是质量通常更好。是否值得取决于你的瓶颈是显存还是速度——这是我们的口径,不是实测结论。

官方发布页:https://huggingface.co/unsloth

发布页 ↗

aj9o9

在本系列:1 个仓 · 20k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

vcruz305

在本系列:1 个仓 · 6k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

batiai

在本系列:1 个仓 · 2k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

AesSedai

在本系列:1 个仓 · 2k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

qtum

在本系列:1 个仓 · 1k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

zurichquants

在本系列:1 个仓 · 1k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

lausannequants

在本系列:1 个仓 · 1k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

ddh0

在本系列:1 个仓 · 862 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

backpack-run

在本系列:1 个仓 · 760 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

F更新记录 谁在跟进

按更新时间倒序。更新频繁说明该量化者在跟进新版本;长期不更新则基础模型升版后可能不同步。

  • 2026-09-12 ddh0 更新了 1 个档位 · 含 imatrix
  • 2026-09-06 backpack-run 更新了 1 个档位
  • 2026-09-06 unsloth 更新了 12 个档位
  • 2026-09-04 batiai 更新了 5 个档位 · 含 imatrix
  • 2026-09-02 lausannequants 更新了 12 个档位
  • 2026-09-01 zurichquants 更新了 12 个档位
  • 2026-09-01 aj9o9 更新了 2 个档位 · 含 imatrix
  • 2026-08-31 qtum 更新了 4 个档位 · 含 imatrix
  • 2026-08-30 AesSedai 更新了 5 个档位 · 含 imatrix
  • 2026-08-27 vcruz305 更新了 2 个档位

基础模型 zai-org/GLM-5.3-Flash 最近更新:2026-09-07 · 本站采集时间:2026-09-30