Did Codex Reset
GitHub

QQ·微信群

騰訊混元強調 Hy4 preview 壓縮至 214 GiB

Tencent Hy

騰訊混元(@TencentHunyuan)引用 Zhihu Frontier,並附上評語「體積更小,智能不變」,指向一篇關於壓縮 Hy4 preview 的解說。

在被引用的帖文中,Zhihu Frontier(@ZhihuFrontier)表示,騰訊混元量化團隊的貢獻者 yghstill 描述如何封裝這款 770B 參數模型,將權重由約 1.5TB 至 214 GiB 縮減。參數數量仍為 770B;壓縮改變的是這些權重的表示方式。該解說列明 Sherry 量化演算法、STQ1_0 儲存格式,以及 MIX-STQ1_0 混合精度分配,並稱完整的混合精度模型平均約為 每權重 2.38 bits,激進壓縮主要集中於專家權重。

被引用的帳號稱,該團隊在經修補的 llama.cpp 組建中實現了 STQ1_0 CUDA kernels,並指 MRCR 檢索表現幾乎不變,數學則略有下降。在相近 bit 預算下對比 UD-IQ1_M,該帳號稱混合精度模型在所報告的評測中領先,包括 MRCR 提升超過五分。騰訊混元自身的帖文並未提供這些測量數據。