英伟达CUDA 13.4支持Windows on Arm64

9月10日 09:20
9月9日推出的预览版工具包让Arm64 Windows系统可直接构建GPU应用,并与联发科共同研发的RTX Spark形成配套;该芯片笔记本拟10月开售,高配约3000美元。

英伟达推出 CUDA Toolkit 13.4,主要变化是把 Windows on Arm64 纳入原生开发范围。此前 Arm 平台在 CUDA 生态里长期走 Linux 路线,此次更新让开发者可在 Arm64 Windows 主机直接产出目标程序,也能使用 x86-64 工具链做交叉编译。版本目前处于预览阶段,也为 RTX Spark 进入个人电脑市场准备底层软件。

与之关联的 RTX Spark 由英伟达和联发科合作开发,采用台积电 3nm 工艺。其内部组合包括 20 核 Grace CPU、6144 个 CUDA 核心的 Blackwell GPU,两者经 NVLink-C2C 互联,并可共享最高 128GB 统一内存。其 FP4 精度 AI 算力数值为 1 PFLOPS,可支撑 1200 亿参数大模型的本地推理,同时具备 100 万 token 上下文处理能力。首批笔记本电脑预计 10 月上市,高配机型定价约 3000 美元,另有折算约人民币 2.02 万元。

开发者一侧,新版工具包同步提供 NVIDIA Rubin 架构早期访问权限,对应计算能力 107,便于应用在正式硬件落地前完成移植和验证。Multi-Process Service V3 增加脚本化命令行界面、命名服务器实例、TOML 配置以及基于 cgroup 的 GPU 显存配额控制,提升容器化场景中的资源划分能力。CUDA Python 组件中,cuda.core 更新到 1.1.0,补充纹理与表面编程、NUMA 感知托管内存和 .pyi 类型存根;cuda.compute 1.1 则允许针对多个 GPU 架构预先编译 CCCL 算法。由于版本仍处预览期,已知反馈指出 PyTorch 构建流程可能引发不稳定或无响应,官方不建议将其用于生产部署或基准测试。该工具链调整补齐了 Windows on Arm64 的开发缺口,也为低功耗设备承载更大规模的本地模型任务提供前置条件。