该模型在5万卡国产算力集群完成全流程训练,原生支持1M上下文,预览版月调用量跻身OpenRouter全球前三。
美团于6月30日正式发布新一代大模型LongCat-2.0,并宣布对外开源核心组件。这是业界首个在五万卡国产算力集群上完成从零预训练到推理全流程的万亿参数模型。该模型总参数量达到1.6T,采用动态范围设计,平均激活参数约为48B,动态区间覆盖33B至56B,同时原生支持1M超长上下文窗口,旨在解决长文档分析与复杂代码库理解等任务中的连贯性问题。
在技术实现层面,LongCat-2.0基于超过30T tokens的预训练数据,涵盖中文、英文、多语言及代码等多种类型。为应对万卡级集群训练中的硬件故障、通信异常及显存压力,研发团队在稳定性、正确性与效率三方面进行了专项优化。通过引入HCCL异常处理机制与弹性扩缩卡技术,月均日故障率降低超过70%;利用自研确定性算子与Bitwise一致性验证保障了训练结果可靠;通过流水线调度与算子级控核,将训练MFU提升1.5倍,最终实现稳态日吞吐量超过1T tokens。推理阶段则通过模型、算子与框架的协同优化,支撑万亿参数MoE结构的高效运行。
在正式发布前,LongCat-2.0的预览版本已通过OpenRouter平台及longcat.ai面向全球开发者开放调用。数据显示,该模型在特定基准测试中的月调用量已位列全球第三,其中在Hermes评测中排名首位,在Claude Code评测中排名第二,仅次于Claude Opus 4.8。此次开源计划将包含Infra框架、推理引擎及模型参数等技术细节,以推动行业技术共享与应用落地。