Thinking Machines发布9750亿参数模型Inkling

7月16日 07:50
前OpenAI首席技术官米拉·穆拉蒂创立的实验室推出首款多模态基础模型,采用混合专家架构实现410亿活跃参数激活,通过开放权重策略支持企业级定制化微调。

美国人工智能初创公司Thinking Machines Lab于2026年7月15日正式发布其首款自主研发的基础模型Inkling。该模型由前OpenAI首席技术官米拉·穆拉蒂联合创立的团队开发,采用“开放权重”模式分发,旨在为企业提供可高度定制化的AI底座。Inkling的核心设计理念并非追求单项性能指标的极致领先,而是致力于在推理成本、运行效率与多模态能力之间寻求平衡,以解决通用闭源模型在企业私有化部署中的局限性与高昂成本问题。

在技术参数方面,Inkling采用混合专家(MoE)架构,总参数量达到9750亿,但在处理单次任务时仅激活约410亿参数。这种设计显著降低了计算资源消耗与响应延迟。模型基于45万亿个涵盖文本、图像、音频及视频的Token进行原生多模态预训练,支持64K至256K的上下文窗口,并具备最高100万Token的长文本处理能力。架构细节上,每个混合专家层包含256个路由专家与2个共享专家,单Token仅激活6个专家参与计算,同时引入滑动窗口注意力与全局注意力结合机制以优化长序列处理效率。训练过程中采用了大规模异步强化学习技术,经过超过3000万次迭代优化以提升推理表现。

商业落地策略上,Inkling不直接面向消费级聊天机器人市场,而是作为企业微调的起点模型,与其云端微调工具Tinker形成生态协同。该模型允许开发者根据具体业务场景动态调节“思考强度”,在需要高精度时增加计算投入,在追求速度或成本敏感时减少推理Token消耗。测试数据显示,在代码生成任务中达到同等性能时,其Token消耗量仅为英伟达Nemotron3 Ultra的三分之一。尽管官方承认该模型并非当前全球性能最强的AI系统,但其在Artificial Analysis评测中获得41分,超越了部分竞品。

这一发布标志着AI行业竞争重心的转移,从单纯的规模军备竞赛转向针对垂直场景的效率与成本优化。Thinking Machines Lab此前已通过Tinker平台在ToB领域积累了近一年的实践经验。Inkling的推出为那些对数据隐私敏感、需要定制化训练且关注部署成本的工业企业提供了新的技术选项,同时也为开源模型在企业级生产环境中的大规模应用开辟了新路径。