通义千问团队公开致谢Unsloth,新方案支持1-bit量化使27B参数模型仅需8GB内存即可运行,文件体积较全精度缩小89%。
通义千问官方近日对Unsloth团队推出的Qwen3.8-27B GGUF量化版本给予正式认可,双方在开源协作框架下完成了针对该模型的性能优化工作。此次更新的核心是Unsloth发布的Dynamic V3(v3.0)量化架构,旨在解决大模型本地部署中的资源瓶颈问题。官方评价指出,该版本在保持较高智能水平的同时显著降低了硬件需求,被称为“更小更聪明”的解决方案。该互动标志着开源社区与模型研发方在轻量化技术路径上的协同深化。
Dynamic V3方案采用改进的后训练量化技术,而非简单的压缩操作,重点在于保留原模型的输出质量。测试数据显示,在文件体积相同的条件下,其准确率较其他主流量化方案提升超过10%,在Div-300及KLD(KL Divergence)等基准测试中表现突出。该方案特别针对智能体编码、多轮对话及多语言任务进行了优化,使其输出效果更接近全精度模型。相关GGUF格式文件已上传至Hugging Face平台,可直接被llama.cpp、Unsloth Desktop等主流推理工具调用。
资源消耗优化是本次升级的另一关键维度。Unsloth同步推出了1-bit量化版本,该版本在保留约77%准确率的情况下,将运行内存需求降至8GB,使得270亿参数的多模态模型能在普通消费级设备或笔记本电脑上部署。部分极致压缩版本(如UD-IQ1_S)体积约为6.2GB,较全精度模型缩小约89%。相比之下,此前Qwen3.8-27B的4-bit量化通常需要16至19GB显存或内存。这一变化降低了270亿参数级模型的硬件门槛,结合其支持的262K上下文窗口(可扩展至百万Token)及Apache 2.0开源协议,使得开发者能够在本地环境完成从推理到微调的全流程操作。