该版本由腾讯混元团队面向本地部署场景推出,基于8月28日发布的Hy4 preview,其MoE架构总参数770B、激活参数49B,并支持约100万Token上下文。
9月1日,腾讯混元团队公布Hy4 preview的轻量量化版本,并将该版本开源。此版本将原BF16权重的存储占用由接近1.5TB压缩至约214GB,主要面向本地部署与异构设备联合运行场景,用于降低运行该模型所需的硬件门槛。
Hy4 preview是腾讯于8月28日发布并开源的MoE大语言模型,总参数量为770B,激活参数为49B,上下文长度为100万Token。本次轻量版使用Sherry稀疏三值量化与MIX-STQ1_0混合精度两套方法。前者将路由专家层权重按四枚一组映射到{-1、0、+1},每组包含固定零值,平均每个权重约占1.25比特;计入额外开销后实际约为1.31bpw,并在llama.cpp中实现STQ1_0推理内核,速度对标IQ1_M且高于IQ1_S。后者依据校准数据判断各层敏感度,敏感层保留IQ2_XXS(2.06比特),非敏感层采用STQ1_0(1.31比特),相对UD-IQ1_M方案可节省5GB以上存储空间。
评测结果显示,压缩后的模型在长文理解、多轮长上下文检索上与原始BF16模型差距较小,数学能力出现小幅回落。具体指标方面,MCP Atlas得分由83.7降至83.2,SWE-Bench multi由82.9降至81.3。在异构推理部分,团队与prima.cpp合作完成一项验证:一台搭载单张4090的笔记本与一台四卡A4000服务器分别位于两个局域网,合计80GB显存与64GB内存,系统通过异构调度把MoE层拆分分配到两端,使214GB模型达到1.02 token/s的推理速度,较笔记本单机offload快约6倍。