跳到主要内容

DeepSeekDeepSeek · 发布于 2026-07-31

DeepSeek V4DeepSeek V4

MIT 许可,量化生态活跃,antirez(llama.cpp 作者)亲自维护量化版。

  • 通用对话
  • MIT 许可
  • 推理

先说清楚:这个站的数据怎么来的

✅ 实测字段

直接从 Hugging Face 公开 API 读取的客观数据:文件体积(字节)、上下文长度、架构、许可、下载量、更新时间。

✅ 推导

由实测字段按公开规则算出:每权重比特数(依 llama.cpp 命名标准)、档位归属、显存需求区间。推导规则在 METHODOLOGY.md 完整公开,任何人可复算。

❌ 我们不说的

哪个量化质量更高、哪个更快、哪个模型更强——这些需要实测,本站不跑 benchmark,所以不装作知道。凡我们给出的主观判断,一律显式标注「我们的口径」。

本站不下载、不托管任何模型权重文件。所有数字都来自公开元数据,点击即可回到发布页核对。 采集时间:2026-09-30(数据快照,非实时)

成员 1DeepSeek V4 Flash

292B 总参(MoE,激活数未公开) · 通用主力 · 7 个量化来源

A基础模型卡 这一档位是什么

官方发布页deepseek-ai/DeepSeek-V4-Flash ↗
许可mit
规模292B 总参(MoE,激活数未公开)
架构deepseek4
上下文长度1,048,576 tokens
定位通用主力
官方下载量1.2M 点赞 2k
最近更新2026-06-22

MIT 许可,47 家量化仓。

B该选哪个 按你的显存倒推

按「你实际有多少显存能装」选档位,而不是按参数猜。下面每档的体积都是实测值(来自发布页文件列表),加权 15% 余量给运行时与 KV cache。

显存 → 档位速查(体积最小的可行档,质量最高的那一档)
8 GB 显存这一档没有能装下的版本(最小是 88.0 GB)
消费级入门卡、共享显卡
12 GB 显存这一档没有能装下的版本(最小是 88.0 GB)
RTX 3060 12G / 4060Ti 16G 降配使用
16 GB 显存这一档没有能装下的版本(最小是 88.0 GB)
RTX 4060Ti 16G / 4070S 超配
24 GB 显存这一档没有能装下的版本(最小是 88.0 GB)
RTX 3090 / 4090
48 GB+ 显存这一档没有能装下的版本(最小是 88.0 GB)
A6000 / L40S / Mac 统一内存
展开:本系列所有档位的实测体积(9 档)
量化档体积每权重比特档位最小体积来源
IQ2_S 88 GB 2.46 bpw 极限压缩 bullerwins
Q2_K 103 GB 2.80 bpw 极限压缩 Preyazz
IQ3_XXS 102 GB 3.06 bpw 长上下文优先 bullerwins
IQ3_S 137 GB 3.35 bpw 长上下文优先 ddh0
Q3_K 136 GB 3.55 bpw 长上下文优先 Preyazz
IQ4_XS 155 GB 4.25 bpw 平衡档 bullerwins
MXFP4 156 GB 4.25 bpw 平衡档 ddh0
Q4_K 172 GB 4.85 bpw 平衡档 Preyazz
Q8_0 156 GB 8.50 bpw 近似无损 bullerwins

「每权重比特」是按 llama.cpp 公开命名标准从文件名推导的,同一档位在不同模型上的真实值会略有差异。这是 B 级推导,不是实测值。

C量化版本总表 横向对比

量化者许可档数总体积 上下文建议档下载量更新
unsloth imatrix
deepseek4
mit 13 1416 GB 1,048,576 UD-IQ4_NL
138 GB
23k 2026-07-09
Preyazz
deepseek4
mit 3 383 GB 1,048,576 Q4_K
172 GB
2k 2026-04-28
ggml-org
deepseek4
mit 2 346 GB 1,048,576 MXFP4
155 GB
1k 2026-08-06
teamblobfish imatrix
deepseek4
mit 7 879 GB 1,048,576 Q4_K
175 GB
1k 2026-05-19
tarruda imatrix
deepseek4
mit 4 457 GB 1,048,576 MXFP4
156 GB
864 2026-07-02
bullerwins imatrix
deepseek4
许可缺失 4 839 GB 1,048,576 IQ4_XS
155 GB
752 2026-07-02
ddh0 imatrix
deepseek4
许可缺失 3 401 GB 1,048,576 MXFP4
156 GB
464 2026-08-07

「建议档」是本站按体积最小且落在平衡档的规则自动选出的,不是质量排名。官方量化排在最前;带 imatrix 标记的仓库带重要性矩阵数据。

D每个变体详解 七字段

每个变体按七个字段展开:它是什么 → 量化者做了什么 → 与同系列其他变体的区别 → 存在的意义 → 优势 → 为什么选它 → 已知取舍。最后一项是本站唯一会写主观判断的地方,且都标注了「我们的口径」。

unsloth

mit 13 档 · 1416 GB · 23k 下载
它是什么unsloth/DeepSeek-V4-Flash-GGUF ↗,提供 13 个 GGUF 量化档,合计 1416 GB。由 unsloth 发布。
量化者做了什么带重要性矩阵(imatrix:DeepSeek-V4-Flash-GGUF/imatrix_unsloth.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 deepseek4 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 deepseek-ai/DeepSeek-V4-Flash;权重总字节 1519.9 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(Preyazz 3 档、ggml-org 2 档、teamblobfish 7 档、tarruda 4 档 等)。 本仓 13 档,覆盖最全。
存在的意义补上官方没覆盖的档位(UD-IQ4_NL 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 UD-IQ4_NL(138 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 UD-IQ4_NL(138 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 全仓 1416 GB,硬盘紧张的话建议只下需要的 1~2 个档位

Preyazz

mit 3 档 · 383 GB · 2k 下载
它是什么Preyazz/DeepSeek-V4-Flash-GGUF ↗,提供 3 个 GGUF 量化档,合计 383 GB。由 Preyazz 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 deepseek4 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 Preyazz/DeepSeek-V4-Flash-Q8_0-GGUF;权重总字节 410.9 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(unsloth 13 档、ggml-org 2 档、teamblobfish 7 档、tarruda 4 档 等)。 本仓 3 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q4_K(172 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(172 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 383 GB,硬盘紧张的话建议只下需要的 1~2 个档位

ggml-org

mit 2 档 · 346 GB · 1k 下载
它是什么ggml-org/DeepSeek-V4-Flash-GGUF ↗,提供 2 个 GGUF 量化档,合计 346 GB。由 ggml-org 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 deepseek4 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 deepseek-ai/DeepSeek-V4-Flash;权重总字节 370.9 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(unsloth 13 档、Preyazz 3 档、teamblobfish 7 档、tarruda 4 档 等)。 本仓 2 档,覆盖最少。
存在的意义补上官方没覆盖的档位(MXFP4 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 MXFP4(155 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 MXFP4(155 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 346 GB,硬盘紧张的话建议只下需要的 1~2 个档位

teamblobfish

mit 7 档 · 879 GB · 1k 下载
它是什么teamblobfish/DeepSeek-V4-Flash-GGUF ↗,提供 7 个 GGUF 量化档,合计 879 GB。由 teamblobfish 发布。
量化者做了什么带重要性矩阵(imatrix:tests/v4-port/calibration/imatrix-v4-flash.dat),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 deepseek4 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 deepseek-ai/DeepSeek-V4-Flash;权重总字节 943.7 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(unsloth 13 档、Preyazz 3 档、ggml-org 2 档、tarruda 4 档 等)。 本仓 7 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 Q4_K(175 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(175 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 全仓 879 GB,硬盘紧张的话建议只下需要的 1~2 个档位

tarruda

mit 4 档 · 457 GB · 864 下载
它是什么tarruda/DeepSeek-V4-Flash-GGUF ↗,提供 4 个 GGUF 量化档,合计 457 GB。由 tarruda 发布。
量化者做了什么带重要性矩阵(imatrix:/Users/thiago/ml-models/huggingface/tarruda/DeepSeek-V4-Flash-GGUF/imatrix.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 deepseek4 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 deepseek-ai/DeepSeek-V4-Flash;权重总字节 490.6 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(unsloth 13 档、Preyazz 3 档、ggml-org 2 档、teamblobfish 7 档 等)。 本仓 4 档,覆盖中等。
存在的意义补上官方没覆盖的档位(MXFP4 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 MXFP4(156 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 MXFP4(156 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 全仓 457 GB,硬盘紧张的话建议只下需要的 1~2 个档位

bullerwins

许可缺失 4 档 · 839 GB · 752 下载
它是什么bullerwins/DeepSeek-V4-Flash-GGUF ↗,提供 4 个 GGUF 量化档,合计 839 GB。由 bullerwins 发布。
量化者做了什么带重要性矩阵(imatrix:/mnt/llms/work/dsv4-flash/imatrix.dat),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 deepseek4 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 deepseek-ai/DeepSeek-V4-Flash;权重总字节 901.2 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(unsloth 13 档、Preyazz 3 档、ggml-org 2 档、teamblobfish 7 档 等)。 本仓 4 档,覆盖中等。
存在的意义补上官方没覆盖的档位(IQ4_XS 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 IQ4_XS(155 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 IQ4_XS(155 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 全仓 839 GB,硬盘紧张的话建议只下需要的 1~2 个档位

ddh0

许可缺失 3 档 · 401 GB · 464 下载
它是什么ddh0/DeepSeek-V4-Flash-GGUF ↗,提供 3 个 GGUF 量化档,合计 401 GB。由 ddh0 发布。
量化者做了什么带重要性矩阵(imatrix:/home/dylan/imatrices/deepseek-v4-flash.imat.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 deepseek4 架构优化;声明上下文 1,048,576 tokens;发布页声明溯源到 deepseek-ai/DeepSeek-V4-Flash;权重总字节 430.5 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 6 个量化来源(unsloth 13 档、Preyazz 3 档、ggml-org 2 档、teamblobfish 7 档 等)。 本仓 3 档,覆盖中等。
存在的意义补上官方没覆盖的档位(MXFP4 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 MXFP4(156 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 MXFP4(156 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 全仓 401 GB,硬盘紧张的话建议只下需要的 1~2 个档位

E量化者档案 选量化者意味着什么

量化者决定了这个包的档位覆盖、命名规范、是否带 imatrix、什么时候跟进新模型。这一区块说明「选这个量化者的量化意味着什么」。

unsloth 量化覆盖面最广、下载量最高的第三方量化者

在本系列:1 个仓 · 23k 下载

定位:量化覆盖面最广、下载量最高的第三方量化者。

擅长什么:几乎每个主流基础模型都第一时间跟 GGUF,且档位最全——从极限压缩到近似无损一应俱全。提供静态(static)与动态(dynamic,用 UD- 前缀)两套量化。

  • 为什么要认 unsloth 版:
  • 覆盖率高 → 你想要的档位通常都有
  • 命名规范 → Q4_K_M 就是 Q4_K_M,不会同档不同名
  • 带 importance matrix(imatrix)→ 量化质量比纯 RTN 更稳
  • 官方教程与 LM Studio / llama.cpp 集成路径最顺

注意:unsloth 的动态量化(UD-Q4_K_XL 等)在同档位下体积略大、速度略慢,换来的是质量通常更好。是否值得取决于你的瓶颈是显存还是速度——这是我们的口径,不是实测结论。

官方发布页:https://huggingface.co/unsloth

发布页 ↗

Preyazz

在本系列:1 个仓 · 2k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

ggml-org llama.cpp 所属组织的官方量化发布

在本系列:1 个仓 · 1k 下载

定位:llama.cpp 自己的官方量化发布渠道。

为什么重要:ggml 是 llama.cpp 的底层张量库,ggml-org 发的 GGUF 由项目核心作者把关。遇到新架构(比如新出的 MoE 稀疏模型),ggml-org 通常是第一个支持并发布可用 GGUF 的。

  • 特点:
  • 档位偏保守,优先保证能正确加载与推理不出错
  • 覆盖不一定全(作者精力有限,只跟进自己关心的模型)
  • 适合作为「该架构能不能在 llama.cpp 上跑」的权威参考

适合谁:想第一时间在新架构上尝鲜、或者需要确认某个模型是否已被 llama.cpp 支持。

发布页:https://huggingface.co/ggml-org

发布页 ↗

teamblobfish

在本系列:1 个仓 · 1k 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

tarruda

在本系列:1 个仓 · 864 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

bullerwins

在本系列:1 个仓 · 752 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

ddh0

在本系列:1 个仓 · 464 下载

代表:openbmb(面壁智能)、google、Qwen、unsloth 转发的 Qwen/Qwen3-30B-A3B-GGUF。

  • 为什么优先级最高:
  • 只有模型作者完全知道哪几层权重对质量最敏感
  • 官方量化档位数量通常很少(往往只有 Q4_K_M / Q8_0 两三档),因为官方只覆盖「安全」的选择
  • 出错时责任明确,不会因为第三方的错误 imatrix 导致质量异常

如果官方出了量化版,优先用它。 除非你需要官方没提供的极低比特档位。

  • 例外情况:
  • 官方可能只出 1~2 档,你实际需要 Q3 或 IQ4_XS 之类,还是得找第三方
  • 官方 GGUF 的更新频率依赖官方团队节奏,可能比第三方慢

核验方式:在本站系列页里,标有「官方」的条目会排在第三方之前。每条的许可都从 HF 发布页的 cardData.license 字段读取,以发布页原文为准。

发布页 ↗

F更新记录 谁在跟进

按更新时间倒序。更新频繁说明该量化者在跟进新版本;长期不更新则基础模型升版后可能不同步。

  • 2026-08-07 ddh0 更新了 3 个档位 · 含 imatrix
  • 2026-08-06 ggml-org 更新了 2 个档位
  • 2026-07-09 unsloth 更新了 13 个档位 · 含 imatrix
  • 2026-07-02 bullerwins 更新了 4 个档位 · 含 imatrix
  • 2026-07-02 tarruda 更新了 4 个档位 · 含 imatrix
  • 2026-05-19 teamblobfish 更新了 7 个档位 · 含 imatrix
  • 2026-04-28 Preyazz 更新了 3 个档位

基础模型 deepseek-ai/DeepSeek-V4-Flash 最近更新:2026-06-22 · 本站采集时间:2026-09-30