跳到主要内容

月之暗面Moonshot AI · 发布于 2026-06-13

Kimi K3Kimi K3

月之暗面当前最新一代,41 家量化仓但整体热度中等。

  • 通用对话
  • 长上下文

先说清楚:这个站的数据怎么来的

✅ 实测字段

直接从 Hugging Face 公开 API 读取的客观数据:文件体积(字节)、上下文长度、架构、许可、下载量、更新时间。

✅ 推导

由实测字段按公开规则算出:每权重比特数(依 llama.cpp 命名标准)、档位归属、显存需求区间。推导规则在 METHODOLOGY.md 完整公开,任何人可复算。

❌ 我们不说的

哪个量化质量更高、哪个更快、哪个模型更强——这些需要实测,本站不跑 benchmark,所以不装作知道。凡我们给出的主观判断,一律显式标注「我们的口径」。

本站不下载、不托管任何模型权重文件。所有数字都来自公开元数据,点击即可回到发布页核对。 采集时间:2026-09-30(数据快照,非实时)

成员 1Kimi K3

2669B 总参(MoE,激活数未公开) · 通用 · 10 个量化来源

A基础模型卡 这一档位是什么

官方发布页moonshotai/Kimi-K3 ↗
许可other

⚠ 非宽松许可,以发布页原文为准。本站不解读许可条款,也不给法律意见。

规模2669B 总参(MoE,激活数未公开)
架构kimi-k3
上下文长度1,048,576 tokens
定位通用
官方下载量1.4M 点赞 12k
最近更新2026-09-02

许可为 other,须读发布页原文。

B该选哪个 按你的显存倒推

按「你实际有多少显存能装」选档位,而不是按参数猜。下面每档的体积都是实测值(来自发布页文件列表),加权 15% 余量给运行时与 KV cache。

显存 → 档位速查(体积最小的可行档,质量最高的那一档)
8 GB 显存这一档没有能装下的版本(最小是 —)
消费级入门卡、共享显卡
12 GB 显存这一档没有能装下的版本(最小是 —)
RTX 3060 12G / 4060Ti 16G 降配使用
16 GB 显存这一档没有能装下的版本(最小是 —)
RTX 4060Ti 16G / 4070S 超配
24 GB 显存这一档没有能装下的版本(最小是 —)
RTX 3090 / 4090
48 GB+ 显存这一档没有能装下的版本(最小是 —)
A6000 / L40S / Mac 统一内存
展开:本系列所有档位的实测体积(0 档)
量化档体积每权重比特档位最小体积来源

「每权重比特」是按 llama.cpp 公开命名标准从文件名推导的,同一档位在不同模型上的真实值会略有差异。这是 B 级推导,不是实测值。

C量化版本总表 横向对比

量化者许可档数总体积 上下文建议档下载量更新
unsloth imatrix
kimi-k3
other
须读原文
9 6903 GB 1,048,576 UD-Q8_K_XL
1561 GB
409k 2026-08-07
AtomicChat imatrix
kimi-k3
other
须读原文
5 5775 GB 1,048,576 Q8_0
2955 GB
2k 2026-07-31
Kuberwastaken
kimi-k3
other
须读原文
0 0.0 GB 1,048,576 — 626 2026-07-27
vcruz305
kimi-k3
other
须读原文
1 606 GB 1,048,576 UD-IQ1_S
330 GB
547 2026-09-26
6block imatrix
kimi-k3
other
须读原文
1 1043 GB 1,048,576 IQ1_S
580 GB
213 2026-08-03
GrEarl
kimi-k3
other
须读原文
1 865 GB 1,048,576 Q2_K
929 GB
194 2026-08-02
qtum imatrix
kimi-k3
other
须读原文
1 1043 GB 1,048,576 IQ1_S
580 GB
137 2026-08-17
bullerwins
kimi-k3
许可缺失 1 1454 GB 1,048,576 MXFP4
1561 GB
115 2026-07-28
aria220 imatrix
kimi-k3
other
须读原文
6 5481 GB 1,048,576 UD-Q8_K_XL
1561 GB
97 2026-07-29
Amynnnn imatrix
kimi-k3
other
须读原文
6 5481 GB 1,048,576 UD-Q8_K_XL
1561 GB
92 2026-08-02

「建议档」是本站按体积最小且落在平衡档的规则自动选出的,不是质量排名。官方量化排在最前;带 imatrix 标记的仓库带重要性矩阵数据。

D每个变体详解 七字段

每个变体按七个字段展开:它是什么 → 量化者做了什么 → 与同系列其他变体的区别 → 存在的意义 → 优势 → 为什么选它 → 已知取舍。最后一项是本站唯一会写主观判断的地方,且都标注了「我们的口径」。

unsloth

other 9 档 · 6903 GB · 409k 下载
它是什么unsloth/Kimi-K3-GGUF ↗,提供 9 个 GGUF 量化档,合计 6903 GB。由 unsloth 发布。
量化者做了什么带重要性矩阵(imatrix:Kimi-K3-GGUF/imatrix_unsloth.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 kimi-k3 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 moonshotai/Kimi-K3;权重总字节 7411.8 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(AtomicChat 5 档、Kuberwastaken 0 档、vcruz305 1 档、6block 1 档 等)。 本仓 9 档,覆盖最全。
存在的意义补上官方没覆盖的档位(UD-Q8_K_XL 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 UD-Q8_K_XL(1561 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 UD-Q8_K_XL(1561 GB,近似无损)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 全仓 6903 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

AtomicChat

other 5 档 · 5775 GB · 2k 下载
它是什么AtomicChat/Kimi-K3-GGUF ↗,提供 5 个 GGUF 量化档,合计 5775 GB。由 AtomicChat 发布。
量化者做了什么带重要性矩阵(imatrix:/data/imatrix_v2.dat),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 kimi-k3 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 moonshotai/Kimi-K3;权重总字节 6200.5 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 9 档、Kuberwastaken 0 档、vcruz305 1 档、6block 1 档 等)。 本仓 5 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q8_0 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 Q8_0(2955 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q8_0(2955 GB,近似无损)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 全仓 5775 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

Kuberwastaken

other 0 档 · 0.0 GB · 626 下载
它是什么Kuberwastaken/Kimi-K3-GGUF ↗,提供 0 个 GGUF 量化档,合计 0.0 GB。由 Kuberwastaken 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 kimi-k3 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 moonshotai/Kimi-K3。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 9 档、AtomicChat 5 档、vcruz305 1 档、6block 1 档 等)。 本仓 0 档,覆盖最少。
存在的意义补上官方没覆盖的档位(— 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 体量较小,适合只想快速验证能不能跑的场景
为什么选它 / 目的该仓无可用档位。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 许可是 other,必须自己读发布页原文再决定能不能用

vcruz305

other 1 档 · 606 GB · 547 下载
它是什么vcruz305/Kimi-K3-GGUF ↗,提供 1 个 GGUF 量化档,合计 606 GB。由 vcruz305 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 kimi-k3 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 moonshotai/Kimi-K3;权重总字节 650.5 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 9 档、AtomicChat 5 档、Kuberwastaken 0 档、6block 1 档 等)。 本仓 1 档,覆盖中等。
存在的意义补上官方没覆盖的档位(UD-IQ1_S 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 UD-IQ1_S(330 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 UD-IQ1_S(330 GB,极限压缩)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 606 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

6block

other 1 档 · 1043 GB · 213 下载
它是什么6block/Kimi-K3-GGUF ↗,提供 1 个 GGUF 量化档,合计 1043 GB。由 6block 发布。
量化者做了什么带重要性矩阵(imatrix:imatrix_k3.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 kimi-k3 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 moonshotai/Kimi-K3;权重总字节 1119.9 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 9 档、AtomicChat 5 档、Kuberwastaken 0 档、vcruz305 1 档 等)。 本仓 1 档,覆盖中等。
存在的意义补上官方没覆盖的档位(IQ1_S 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 IQ1_S(580 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 IQ1_S(580 GB,极限压缩)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 全仓 1043 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

GrEarl

other 1 档 · 865 GB · 194 下载
它是什么GrEarl/Kimi-K3-GGUF ↗,提供 1 个 GGUF 量化档,合计 865 GB。由 GrEarl 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 kimi-k3 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 moonshotai/Kimi-K3;权重总字节 928.6 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 9 档、AtomicChat 5 档、Kuberwastaken 0 档、vcruz305 1 档 等)。 本仓 1 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q2_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q2_K(929 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q2_K(929 GB,极限压缩)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 865 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

qtum

other 1 档 · 1043 GB · 137 下载
它是什么qtum/Kimi-K3-GGUF ↗,提供 1 个 GGUF 量化档,合计 1043 GB。由 qtum 发布。
量化者做了什么带重要性矩阵(imatrix:imatrix_k3.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 kimi-k3 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 moonshotai/Kimi-K3;权重总字节 1119.9 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 9 档、AtomicChat 5 档、Kuberwastaken 0 档、vcruz305 1 档 等)。 本仓 1 档,覆盖中等。
存在的意义补上官方没覆盖的档位(IQ1_S 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 IQ1_S(580 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 IQ1_S(580 GB,极限压缩)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 全仓 1043 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

bullerwins

许可缺失 1 档 · 1454 GB · 115 下载
它是什么bullerwins/Kimi-K3-GGUF ↗,提供 1 个 GGUF 量化档,合计 1454 GB。由 bullerwins 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 kimi-k3 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 moonshotai/Kimi-K3;权重总字节 1561.2 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 9 档、AtomicChat 5 档、Kuberwastaken 0 档、vcruz305 1 档 等)。 本仓 1 档,覆盖中等。
存在的意义补上官方没覆盖的档位(MXFP4 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 MXFP4(1561 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 MXFP4(1561 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 1454 GB,硬盘紧张的话建议只下需要的 1~2 个档位

aria220

other 6 档 · 5481 GB · 97 下载
它是什么aria220/Kimi-K3-GGUF ↗,提供 6 个 GGUF 量化档,合计 5481 GB。由 aria220 发布。
量化者做了什么带重要性矩阵(imatrix:Kimi-K3-GGUF/imatrix_unsloth.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 kimi-k3 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 moonshotai/Kimi-K3;权重总字节 5885.0 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 9 档、AtomicChat 5 档、Kuberwastaken 0 档、vcruz305 1 档 等)。 本仓 6 档,覆盖中等。
存在的意义补上官方没覆盖的档位(UD-Q8_K_XL 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 UD-Q8_K_XL(1561 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 UD-Q8_K_XL(1561 GB,近似无损)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 全仓 5481 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

Amynnnn

other 6 档 · 5481 GB · 92 下载
它是什么Amynnnn/Kimi-K3-GGUF ↗,提供 6 个 GGUF 量化档,合计 5481 GB。由 Amynnnn 发布。
量化者做了什么带重要性矩阵(imatrix:Kimi-K3-GGUF/imatrix_unsloth.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 kimi-k3 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 moonshotai/Kimi-K3;权重总字节 5885.0 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(unsloth 9 档、AtomicChat 5 档、Kuberwastaken 0 档、vcruz305 1 档 等)。 本仓 6 档,覆盖中等。
存在的意义补上官方没覆盖的档位(UD-Q8_K_XL 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 UD-Q8_K_XL(1561 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 UD-Q8_K_XL(1561 GB,近似无损)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 全仓 5481 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 许可是 other,必须自己读发布页原文再决定能不能用

E量化者档案 选量化者意味着什么

量化者决定了这个包的档位覆盖、命名规范、是否带 imatrix、什么时候跟进新模型。这一区块说明「选这个量化者的量化意味着什么」。

unsloth 量化覆盖面最广、下载量最高的第三方量化者

在本系列:1 个仓 · 409k 下载

定位:量化覆盖面最广、下载量最高的第三方量化者。

擅长什么:几乎每个主流基础模型都第一时间跟 GGUF,且档位最全——从极限压缩到近似无损一应俱全。提供静态(static)与动态(dynamic,用 UD- 前缀)两套量化。

  • 为什么要认 unsloth 版:
  • 覆盖率高 → 你想要的档位通常都有
  • 命名规范 → Q4_K_M 就是 Q4_K_M,不会同档不同名
  • 带 importance matrix(imatrix)→ 量化质量比纯 RTN 更稳
  • 官方教程与 LM Studio / llama.cpp 集成路径最顺

注意:unsloth 的动态量化(UD-Q4_K_XL 等)在同档位下体积略大、速度略慢,换来的是质量通常更好。是否值得取决于你的瓶颈是显存还是速度——这是我们的口径,不是实测结论。

官方发布页:https://huggingface.co/unsloth

发布页 ↗

AtomicChat

在本系列:1 个仓 · 2k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

Kuberwastaken

在本系列:1 个仓 · 626 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

vcruz305

在本系列:1 个仓 · 547 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

6block

在本系列:1 个仓 · 213 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

GrEarl

在本系列:1 个仓 · 194 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

qtum

在本系列:1 个仓 · 137 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

bullerwins

在本系列:1 个仓 · 115 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

aria220

在本系列:1 个仓 · 97 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

Amynnnn

在本系列:1 个仓 · 92 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

F更新记录 谁在跟进

按更新时间倒序。更新频繁说明该量化者在跟进新版本;长期不更新则基础模型升版后可能不同步。

  • 2026-09-26 vcruz305 更新了 1 个档位
  • 2026-08-17 qtum 更新了 1 个档位 · 含 imatrix
  • 2026-08-07 unsloth 更新了 9 个档位 · 含 imatrix
  • 2026-08-03 6block 更新了 1 个档位 · 含 imatrix
  • 2026-08-02 GrEarl 更新了 1 个档位
  • 2026-08-02 Amynnnn 更新了 6 个档位 · 含 imatrix
  • 2026-07-31 AtomicChat 更新了 5 个档位 · 含 imatrix
  • 2026-07-29 aria220 更新了 6 个档位 · 含 imatrix
  • 2026-07-28 bullerwins 更新了 1 个档位
  • 2026-07-27 Kuberwastaken 更新了 0 个档位

基础模型 moonshotai/Kimi-K3 最近更新:2026-09-02 · 本站采集时间:2026-09-30