跳到主要内容

OpenAIOpenAI · 发布于 2025-08-04

gpt-ossgpt-oss

OpenAI 唯一开放权重系列,20B 版是单卡本地部署的甜点。

  • 推理
  • MoE 稀疏
  • apache-2.0

先说清楚:这个站的数据怎么来的

✅ 实测字段

直接从 Hugging Face 公开 API 读取的客观数据:文件体积(字节)、上下文长度、架构、许可、下载量、更新时间。

✅ 推导

由实测字段按公开规则算出:每权重比特数(依 llama.cpp 命名标准)、档位归属、显存需求区间。推导规则在 METHODOLOGY.md 完整公开,任何人可复算。

❌ 我们不说的

哪个量化质量更高、哪个更快、哪个模型更强——这些需要实测,本站不跑 benchmark,所以不装作知道。凡我们给出的主观判断,一律显式标注「我们的口径」。

本站不下载、不托管任何模型权重文件。所有数字都来自公开元数据,点击即可回到发布页核对。 采集时间:2026-09-30(数据快照,非实时)

成员 1gpt-oss 20B

20B(MoE,约 3.6B 激活) · 单卡甜点 · 4 个量化来源

A基础模型卡 这一档位是什么

官方发布页openai/gpt-oss-20b ↗
许可apache-2.0
规模20B(MoE,约 3.6B 激活)
架构gpt-oss
上下文长度131,072 tokens
定位单卡甜点
官方下载量6.7M 点赞 5k
最近更新2025-08-26

apache-2.0,674 万下载。虽非最新代,但量化生态成熟且许可最干净。

B该选哪个 按你的显存倒推

按「你实际有多少显存能装」选档位,而不是按参数猜。下面每档的体积都是实测值(来自发布页文件列表),加权 15% 余量给运行时与 KV cache。

显存 → 档位速查(体积最小的可行档,质量最高的那一档)
8 GB 显存 Q8_0(0.9 GB · 近似无损)
更省:BF16 1.7 GB
消费级入门卡、共享显卡
12 GB 显存 Q8_0(0.9 GB · 近似无损)
更省:BF16 1.7 GB
RTX 3060 12G / 4060Ti 16G 降配使用
16 GB 显存 Q8_0(0.9 GB · 近似无损)
更省:UD-Q8_K_XL 13 GB / BF16 1.7 GB
RTX 4060Ti 16G / 4070S 超配
24 GB 显存 Q8_0(0.9 GB · 近似无损)
更省:UD-Q8_K_XL 13 GB / BF16 1.7 GB
RTX 3090 / 4090
48 GB+ 显存 Q8_0(0.9 GB · 近似无损)
更省:UD-Q8_K_XL 13 GB / BF16 1.7 GB
A6000 / L40S / Mac 统一内存
展开:本系列所有档位的实测体积(22 档)
量化档体积每权重比特档位最小体积来源
IQ2_XXS 12 GB 2.13 bpw 极限压缩 bartowski
IQ2_XS 12 GB 2.31 bpw 极限压缩 bartowski
IQ2_M 12 GB 2.39 bpw 极限压缩 bartowski
IQ2_S 12 GB 2.46 bpw 极限压缩 bartowski
Q2_K 11 GB 2.80 bpw 极限压缩 unsloth
IQ3_XXS 12 GB 3.06 bpw 长上下文优先 bartowski
IQ3_XS 12 GB 3.36 bpw 长上下文优先 bartowski
Q3_K 11 GB 3.55 bpw 长上下文优先 unsloth
IQ3_M 12 GB 3.66 bpw 长上下文优先 bartowski
IQ4_NL 12 GB 4.05 bpw 平衡档 bartowski
MXFP4 12 GB 4.25 bpw 平衡档 ggml-org
IQ4_XS 12 GB 4.25 bpw 平衡档 bartowski
Q4_0 12 GB 4.55 bpw 平衡档 unsloth
Q4_1 12 GB 4.83 bpw 平衡档 unsloth
Q4_K 12 GB 4.85 bpw 平衡档 unsloth
UD-Q4_K_XL 12 GB 5.62 bpw 保守档 unsloth
Q5_K 12 GB 5.69 bpw 保守档 unsloth
UD-Q6_K 12 GB 6.54 bpw 保守档 unsloth
Q6_K 12 GB 6.59 bpw 保守档 unsloth
Q8_0 0.9 GB 8.50 bpw 近似无损 ggml-org
UD-Q8_K_XL 13 GB 8.72 bpw 近似无损 unsloth
BF16 1.7 GB 16.00 bpw 近似无损 ggml-org

「每权重比特」是按 llama.cpp 公开命名标准从文件名推导的,同一档位在不同模型上的真实值会略有差异。这是 B 级推导,不是实测值。

C量化版本总表 横向对比

量化者许可档数总体积 上下文建议档下载量更新
unsloth
gpt-oss
apache-2.0 12 178 GB 131,072 Q4_K
12 GB
498k 2025-12-19
ggml-org
gpt-oss
apache-2.0 3 14 GB 131,072 MXFP4
12 GB
135k 2026-07-28
lmstudio-community
gpt-oss
apache-2.0 1 11 GB 131,072 MXFP4
12 GB
106k 2025-08-05
bartowski
gpt-oss
许可缺失 19 307 GB 131,072 MXFP4
12 GB
20k 2025-08-11

「建议档」是本站按体积最小且落在平衡档的规则自动选出的,不是质量排名。官方量化排在最前;带 imatrix 标记的仓库带重要性矩阵数据。

D每个变体详解 七字段

每个变体按七个字段展开:它是什么 → 量化者做了什么 → 与同系列其他变体的区别 → 存在的意义 → 优势 → 为什么选它 → 已知取舍。最后一项是本站唯一会写主观判断的地方,且都标注了「我们的口径」。

unsloth

apache-2.0 12 档 · 178 GB · 498k 下载
它是什么unsloth/gpt-oss-20b-GGUF ↗,提供 12 个 GGUF 量化档,合计 178 GB。由 unsloth 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 gpt-oss 架构优化;声明上下文 131,072 tokens;发布页声明溯源到 openai/gpt-oss-20b;权重总字节 191.0 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 3 个量化来源(ggml-org 3 档、lmstudio-community 1 档、bartowski 19 档)。 本仓 12 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q4_K(12 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(12 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 已 285 天未更新,基础模型若有新版可能已不同步

ggml-org

apache-2.0 3 档 · 14 GB · 135k 下载
它是什么ggml-org/gpt-oss-20b-GGUF ↗,提供 3 个 GGUF 量化档,合计 14 GB。由 ggml-org 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 gpt-oss 架构优化;声明上下文 131,072 tokens;发布页声明溯源到 openai/gpt-oss-20b;权重总字节 14.8 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 3 个量化来源(unsloth 12 档、lmstudio-community 1 档、bartowski 19 档)。 本仓 3 档,覆盖中等。
存在的意义补上官方没覆盖的档位(MXFP4 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 MXFP4(12 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 MXFP4(12 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)

lmstudio-community

apache-2.0 1 档 · 11 GB · 106k 下载
它是什么lmstudio-community/gpt-oss-20b-GGUF ↗,提供 1 个 GGUF 量化档,合计 11 GB。由 lmstudio-community 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 gpt-oss 架构优化;声明上下文 131,072 tokens;发布页声明溯源到 openai/gpt-oss-20b;权重总字节 12.1 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 3 个量化来源(unsloth 12 档、ggml-org 3 档、bartowski 19 档)。 本仓 1 档,覆盖最少。
存在的意义补上官方没覆盖的档位(MXFP4 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 MXFP4(12 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 MXFP4(12 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 已 420 天未更新,基础模型若有新版可能已不同步

bartowski

许可缺失 19 档 · 307 GB · 20k 下载
它是什么bartowski/openai_gpt-oss-20b-GGUF ↗,提供 19 个 GGUF 量化档,合计 307 GB。由 bartowski 发布。
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 gpt-oss 架构优化;声明上下文 131,072 tokens;发布页声明溯源到 openai/gpt-oss-20b;权重总字节 329.5 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 3 个量化来源(unsloth 12 档、ggml-org 3 档、lmstudio-community 1 档)。 本仓 19 档,覆盖最全。
存在的意义补上官方没覆盖的档位(MXFP4 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 MXFP4(12 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 MXFP4(12 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
· 全仓 307 GB,硬盘紧张的话建议只下需要的 1~2 个档位
· 已 414 天未更新,基础模型若有新版可能已不同步

E量化者档案 选量化者意味着什么

量化者决定了这个包的档位覆盖、命名规范、是否带 imatrix、什么时候跟进新模型。这一区块说明「选这个量化者的量化意味着什么」。

unsloth 量化覆盖面最广、下载量最高的第三方量化者

在本系列:1 个仓 · 498k 下载

定位:量化覆盖面最广、下载量最高的第三方量化者。

擅长什么:几乎每个主流基础模型都第一时间跟 GGUF,且档位最全——从极限压缩到近似无损一应俱全。提供静态(static)与动态(dynamic,用 UD- 前缀)两套量化。

  • 为什么要认 unsloth 版:
  • 覆盖率高 → 你想要的档位通常都有
  • 命名规范 → Q4_K_M 就是 Q4_K_M,不会同档不同名
  • 带 importance matrix(imatrix)→ 量化质量比纯 RTN 更稳
  • 官方教程与 LM Studio / llama.cpp 集成路径最顺

注意:unsloth 的动态量化(UD-Q4_K_XL 等)在同档位下体积略大、速度略慢,换来的是质量通常更好。是否值得取决于你的瓶颈是显存还是速度——这是我们的口径,不是实测结论。

官方发布页:https://huggingface.co/unsloth

发布页 ↗

ggml-org llama.cpp 所属组织的官方量化发布

在本系列:1 个仓 · 135k 下载

定位:llama.cpp 自己的官方量化发布渠道。

为什么重要:ggml 是 llama.cpp 的底层张量库,ggml-org 发的 GGUF 由项目核心作者把关。遇到新架构(比如新出的 MoE 稀疏模型),ggml-org 通常是第一个支持并发布可用 GGUF 的。

  • 特点:
  • 档位偏保守,优先保证能正确加载与推理不出错
  • 覆盖不一定全(作者精力有限,只跟进自己关心的模型)
  • 适合作为「该架构能不能在 llama.cpp 上跑」的权威参考

适合谁:想第一时间在新架构上尝鲜、或者需要确认某个模型是否已被 llama.cpp 支持。

发布页:https://huggingface.co/ggml-org

发布页 ↗

lmstudio-community LM Studio 官方社区组织,为其 GUI 客户端供包

在本系列:1 个仓 · 106k 下载

定位:LM Studio 桌面客户端的官方社区组织,为其 GUI 供包。

  • 特点:
  • 档位偏保守务实,以「在 LM Studio 里能顺畅跑起来」为目标筛选
  • 文件命名与 LM Studio 的模型库索引对得上,下载后能被客户端直接识别
  • 也会带 MTP / 投机采样相关的特殊版本

适合谁:如果你用 LM Studio 而不是自己敲 llama-server 命令行,这个组织的包省心程度最高。

不适合谁:如果你要精细控制加载参数(tensor split、n_gpu_layers、上下文分配),社区包往往不针对你的硬件调优,仍要自己调。

发布页:https://huggingface.co/lmstudio-community

发布页 ↗

bartowski 老牌量化者,档位命名规范、说明文档最完整

在本系列:1 个仓 · 20k 下载

定位:老牌量化者,档位命名规范、说明文档最完整。

  • 特点:
  • 每档位都写清「这个档适合什么场景」,不是只丢一堆文件
  • 命名遵循 llama.cpp 约定,Q4_K_M 就是社区通义的那个 Q4_K_M
  • 同一个模型常常同时提供静态量化与 imatrix 量化两个目录

怎么选他的包:看仓库里的 README 分档说明,那是少数把「为什么这档质量损失小、那档损失大」写清楚的地方。

注意:他的仓库名常带 Qwen_ Meta-Llama_ 这类前缀(因为 HF 仓库名不允许重复,量化者要加模型组织名消歧),搜仓时别漏掉前缀。

发布页:https://huggingface.co/bartowski

发布页 ↗

F更新记录 谁在跟进

按更新时间倒序。更新频繁说明该量化者在跟进新版本;长期不更新则基础模型升版后可能不同步。

基础模型 openai/gpt-oss-20b 最近更新:2025-08-26 · 本站采集时间:2026-09-30