Tencent Hunyuan、Hy4 previewの214 GiBへの圧縮を強調
Tencent Hunyuan(@TencentHunyuan)は「サイズは小さく、知能は同じ」というコメントとともにZhihu Frontierを引用し、Hy4 previewの圧縮に関する解説を指摘した。
引用された投稿で、Zhihu Frontier(@ZhihuFrontier)は、Tencent Hunyuanの量子化チームの貢献者yghstillが、770Bパラメータモデルの重みを約1.5TBから214 GiBに縮小してパッキングしたと説明したと述べた。パラメータ数は770Bのままであり、圧縮はそれらの重みの表現方法を変更する。解説ではSherry量子化アルゴリズム、STQ1_0ストレージ形式、MIX-STQ1_0混合精度割り当てを挙げ、完全な混合精度モデルは重みあたり平均約2.38ビットであり、積極的な圧縮はエキスパート重みに集中していると述べている。
引用されたアカウントによると、チームはパッチを当てたllama.cppビルドにSTQ1_0 CUDAカーネルを実装し、MRCR検索性能はほぼ変わらず、数学でわずかな低下があると報告している。同様のビット予算のUD-IQ1_Mと比較して、混合精度モデルは報告された評価でリードし、MRCRで5ポイント以上の向上を含むという。Tencent Hunyuan自身の投稿ではそれらの測定値は提供されていない。