苹果与LM Studio合作展示本地化部署方案,利用Thunderbolt 5技术整合1.5TB统一内存,实现数据不出局域网的跨设备推理能力。
在WWDC 2026全球开发者大会期间,人工智能软件平台LM Studio与苹果公司联合展示了基于消费级硬件运行超大规模人工智能模型的新技术路径。该演示通过构建由四台Mac Studio组成的计算集群,成功加载并流畅运行了月之暗面公司开发的Kimi K2.6大语言模型。这一技术验证表明,无需依赖传统企业级GPU云端集群,利用特定硬件互联架构亦可承载万亿参数级别的模型推理任务。
Kimi K2.6模型采用混合专家(MoE)架构设计,总参数量达到1万亿,但在推理过程中仅激活约320亿参数。为满足模型权重加载需求,四台搭载M3 Ultra芯片的Mac Studio设备通过Thunderbolt 5接口进行互联,利用macOS系统中的RDMA-over-Thunderbolt技术实现跨设备内存共享。该架构将系统总统一内存整合至约1.5TB,形成了逻辑上的超大内存池,从而支撑模型权重的驻留与调度。在开发者测试数据中,该集群配置下的模型生成速度约为28 tokens/s,且整体功耗水平显著低于同等算力的传统GPU方案。
此次合作还同步演示了LM Studio旗下的LM Link工具功能。该组件基于Tailscale Mesh VPN架构构建,支持端到端加密连接,允许用户通过MacBook Neo笔记本或iPhone等移动设备,远程安全访问本地Mac Studio集群。在该工作流中,所有数据交互与处理过程均在本地局域网内完成,不经过任何第三方云服务器,实现了真正的私有化部署。LM Link功能已于今年6月初适配macOS及iOS平台,标志着苹果生态在构建多设备协同AI推理环境方面迈出了实质性一步,为个人开发者及小型团队提供了运行前沿大模型的可行性方案。