该版本包含1bit与4bit多种量化方案,将原本需多卡集群部署的旗舰模型显存占用压缩至单张96GB显卡可承载范围,同时通过GGUF格式适配llama.cpp生态。
腾讯混元团队于2026年7月14日正式推出混元Hy3模型的极致量化版本,旨在降低超大规模混合专家(MoE)架构模型在本地及中小规模服务器上的部署门槛。该旗舰模型总参数量达295B,原生激活参数为21B,支持256K超长上下文窗口,此前因BF16精度权重文件高达598GB,仅能在多卡高性能集群运行。此次更新针对开源社区与开发者需求,推出了三种不同压缩率与适用场景的量化方案,使原本需要庞大算力资源支持的模型能够在单张高端显卡甚至内存充足的本地设备上运行。
具体技术细节显示,团队完成了梯度量化压缩工作,其中极限轻量化IQ1_M版本将权重压缩至85.5GiB,压缩幅度达6.7倍,仅需单张96GB显存的推理显卡即可完整承载,适用于硬件资源受限的离线场景。中等精度的Q4_K_M版本体积为169.9GiB,需双显卡部署,其输出概率分布与Top-K选择策略在测试中表现出与原生BF16版本高度的一致性,旨在以有限成本获取接近满血版的效果。此外,针对企业级服务需求,团队发布了原生适配vLLM推理框架的GPTQ Int4版本,利用该框架高并发与低延迟特性优化API服务部署。
此次更新标志着超大规模模型在边缘侧或本地化部署上的进一步突破,解决了Hy3模型此前硬件门槛极高的痛点。通过配合GGUF格式与llama.cpp生态,开发者无需依赖多卡服务器即可体验295B参数的旗舰能力。这一举措不仅提升了模型在代码生成、智能体调度及长文档理解等任务的可及性,也反映了当前大模型领域向量化压缩与高效推理优化的发展趋势,有助于扩大高端AI模型在不同算力环境下的应用范围。