该模型总参数124B但激活仅5.1B,通过架构优化实现小体量高智能,已上线OpenRouter平台并开启限时免费调用窗口。
7月24日,蚂蚁集团旗下百灵大模型团队正式推出新一代原生混合推理模型Ling-3.0-Flash。该模型采用混合线性注意力架构,总参数量设定为124B,单次计算激活参数仅为5.1B。相较于上一代旗舰型号Ring-2.6-1T,其参数规模与激活量分别缩减87.6%和91.9%,但在基础推理、指令遵循及长文本处理等核心指标上达到或超越了参数量为其2至3倍的行业领先模型水平。此次发布旨在解决大语言模型在Agent实际应用场景中计算成本高、响应慢的痛点,通过提升智效比实现落地性价比的优化。
在技术架构层面,Ling-3.0-Flash放弃了单纯堆砌参数的传统思路,从预训练阶段即采用混合注意力机制。模型以5:1的比例交替堆叠KDA线性注意力层与MLA层,其中KDA(Kimi Delta Attention)在Delta Rule状态更新中引入细粒度对角门控,显著提升了长文档与代码库处理中的关键信息记忆能力。同时,该模型进一步压缩了专家激活比例,将每个Token的专家激活比例从上一代的1/32降至1/64,实现了更高的效率杠杆。针对智能体(Agent)场景,模型扩展了超过10000个真实交互训练环境,优化了复杂任务的自我纠错与长程规划机制,在代码编写、任务拆解及多源信息调研等场景中展现出更强的自主闭环交付能力。
为配合模型运行速度需求,百灵团队配套引入了集群级分级缓存架构,具体采用SGLang HiCache与Mooncake组合方案。该系统通过物理双池设计与集群共享L3缓存,将处理长输入时的首个Token生成时间降低了60%至80%,有效避免了持续对话中的算力浪费与重复计算。当前,该模型已上线OpenRouter平台并开放API接口,自即日起至8月3日23:00(北京时间)期间提供限时免费调用服务,计划在此之后正式开源。这一举措为实时智能助手及复杂Agent应用提供了低延迟、高稳定性的基础设施支持。