D每个变体详解 七字段
每个变体按七个字段展开:它是什么 → 量化者做了什么 → 与同系列其他变体的区别 → 存在的意义 → 优势 → 为什么选它 → 已知取舍。最后一项是本站唯一会写主观判断的地方,且都标注了「我们的口径」。
量化者做了什么模型作者自行量化,只有覆盖不到的档位才需要考虑第三方;未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 llama 架构优化;声明上下文 131,072 tokens;权重总字节 9.3 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(bartowski 15 档、NANI-Nithin 25 档、abenzerps 10 档、Abiray 5 档 等)。 本仓 3 档,覆盖最少。
存在的意义模型作者最清楚哪几层权重对质量敏感,官方量化通常是最保守、最不会出错的选择——官方出了就优先用它。
优势· 官方出品,出错时责任明确
· 平衡档落在 Q4_K(1.6 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(1.6 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 档位极少,没有升降空间,被显存卡住时无路可退
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 llama 架构优化;声明上下文 131,072 tokens;发布页声明溯源到 openbmb/MiniCPM5-2B;权重总字节 36.3 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(openbmb 3 档、NANI-Nithin 25 档、abenzerps 10 档、Abiray 5 档 等)。 本仓 15 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q4_K(1.7 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(1.7 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 llama 架构优化;声明上下文 131,072 tokens;发布页声明溯源到 openbmb/MiniCPM5-2B;权重总字节 43.1 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(openbmb 3 档、bartowski 15 档、abenzerps 10 档、Abiray 5 档 等)。 本仓 25 档,覆盖最全。
存在的意义补上官方没覆盖的档位(Q4_1 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 档位覆盖最广的一档(25 档),从极限压缩到近似无损都能选
· 平衡档落在 Q4_1(1.6 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_1(1.6 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;发布页声明溯源到 openbmb/MiniCPM5-2B;权重总字节 17.1 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(openbmb 3 档、bartowski 15 档、NANI-Nithin 25 档、Abiray 5 档 等)。 本仓 10 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q4_K(1.6 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(1.6 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 llama 架构优化;声明上下文 131,072 tokens;发布页声明溯源到 openbmb/MiniCPM5-2B;权重总字节 10.9 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(openbmb 3 档、bartowski 15 档、NANI-Nithin 25 档、abenzerps 10 档 等)。 本仓 5 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q4_K(1.6 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(1.6 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
量化者做了什么带重要性矩阵(imatrix:/root/workspace/HF/calibration/minicpm5-2b/minicpm5_2b_combined_gpu0.imatrix.gguf),用激活数据统计各层重要性后再量化,通常比纯 RTN 稳;针对 llama 架构优化;声明上下文 131,072 tokens;发布页声明溯源到 openbmb/MiniCPM5-2B;权重总字节 23.2 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(openbmb 3 档、bartowski 15 档、NANI-Nithin 25 档、abenzerps 10 档 等)。 本仓 13 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 带 imatrix,同档位下质量通常更稳
· 平衡档落在 Q4_K(1.6 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(1.6 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 暂未发现明显取舍(不代表没有,建议先下一档实测)
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 llama 架构优化;声明上下文 131,072 tokens;发布页声明溯源到 openbmb/MiniCPM5-2B;权重总字节 20.6 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(openbmb 3 档、bartowski 15 档、NANI-Nithin 25 档、abenzerps 10 档 等)。 本仓 7 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q4_K(1.8 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(1.8 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 llama 架构优化;声明上下文 131,072 tokens;发布页声明溯源到 openbmb/MiniCPM5-2B;权重总字节 38.7 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(openbmb 3 档、bartowski 15 档、NANI-Nithin 25 档、abenzerps 10 档 等)。 本仓 9 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q4_K(1.6 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(1.6 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 llama 架构优化;声明上下文 131,072 tokens;权重总字节 61.8 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(openbmb 3 档、bartowski 15 档、NANI-Nithin 25 档、abenzerps 10 档 等)。 本仓 19 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_1_L 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q4_1_L(1.8 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_1_L(1.8 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)
量化者做了什么未提供重要性矩阵(imatrix),走的是纯权重量化路线;针对 llama 架构优化;声明上下文 131,072 tokens;发布页声明溯源到 openbmb/MiniCPM5-2B;权重总字节 22.8 GB(发布页 gguf.total 字段)。
与同系列其他变体的区别同系列另有 9 个量化来源(openbmb 3 档、bartowski 15 档、NANI-Nithin 25 档、abenzerps 10 档 等)。 本仓 8 档,覆盖中等。
存在的意义补上官方没覆盖的档位(Q4_K 这类),让你能在有限显存里凑合跑起来,或者反过来用更高精度换质量。
优势· 平衡档落在 Q4_K(1.6 GB),是大多数人的起点
为什么选它 / 目的如果你的瓶颈是显存:直接下 Q4_K(1.6 GB,平衡档)。
如果你的瓶颈是速度:这个仓里没有更快的档位(GGUF 的速度主要由架构与后端决定,不由量化档决定),换量化者意义不大。
如果你的瓶颈是质量:往上走一档到保守档(Q5_K_M / Q6_K)。
已知取舍· 无 imatrix,同档位下质量损失可能比带 imatrix 的版本更明显(我们的口径,需实测验证)