Did Codex Reset
GitHub

텐센트 Hunyuan, Hy4 preview를 214 GiB로 압축했다고 강조

Tencent Hy

텐센트 Hunyuan(@TencentHunyuan)은 "더 작은 크기, 같은 지능"이라는 코멘트와 함께 Zhihu Frontier를 인용하며 Hy4 preview 압축에 관한 해설글을 가리켰다.

인용된 게시물에서 Zhihu Frontier(@ZhihuFrontier)는 텐센트 Hunyuan 양자화 팀의 기여자 yghstill이 770B 파라미터 모델을 가중치를 대략 1.5TB에서 214 GiB로 줄여 패킹했다고 설명했다고 말했다. 파라미터 수는 770B로 유지되며, 압축은 해당 가중치가 표현되는 방식을 바꾼다. 해설글은 Sherry 양자화 알고리즘, STQ1_0 저장 형식, MIX-STQ1_0 혼합 정밀도 할당을 언급하며, 완전한 혼합 정밀도 모델이 가중치당 평균 약 2.38비트이고 공격적인 압축은 expert 가중치에 집중된다고 말한다.

인용된 계정은 팀이 패치된 llama.cpp 빌드에서 STQ1_0 CUDA 커널을 구현했으며, MRCR 검색 성능은 거의 변하지 않았고 수학에서는 소폭 하락했다고 보고한다. 비슷한 비트 예산의 UD-IQ1_M과 비교해 혼합 정밀도 모델이 보고된 평가에서 앞섰으며, MRCR에서 5점 이상 향상됐다고 말한다. 텐센트 Hunyuan의 자체 게시물은 해당 측정치를 제공하지 않는다.