Did Codex Reset
GitHub

QQ·微信群

腾讯混元强调 Hy4 preview 压缩至 214 GiB

Tencent Hy

腾讯混元(@TencentHunyuan)引用了 Zhihu Frontier,并评论“更小体积,同样智能”,指向一篇关于压缩 Hy4 preview 的解读。

在被引用的帖子中,Zhihu Frontier(@ZhihuFrontier)表示,腾讯混元量化团队贡献者 yghstill 描述了通过将权重从约 1.5TB 至 214 GiB 缩小来打包该 770B 参数模型。参数量仍为 770B;压缩改变的是这些权重的表示方式。该解读提到了 Sherry 量化算法、STQ1_0 存储格式和 MIX-STQ1_0 混合精度分配,并称完整混合精度模型平均约为 每权重 2.38 bit,激进压缩集中在专家权重上。

被引用账号称,该团队在打过补丁的 llama.cpp 构建中实现了 STQ1_0 CUDA 内核,并报告 MRCR 检索性能几乎不变,数学能力略有下降。在相近 bit 预算下对比 UD-IQ1_M,该混合精度模型在所报告的评测中领先,包括 MRCR 提升超过五分。腾讯混元自己的帖子并未提供这些测量数据。