9月22日,SpaceXAI将新模型接入Cursor、Grok Build与API,依靠更大基座、50万Token上下文、专业基准与2美元百万输入价,强调长时复杂任务和成本效率。
2026年9月22日,SpaceXAI推出Grok 4.7。该产品把重心放在编码与知识工作负载上,并被列为公司现有编码、知识处理线中规格最高的版本。模型现已进入Cursor、Grok Build与Grok API,还会经第三方编程工具、模型路由平台和云服务商提供。对外给出的常规计费是每百万词元输入2美元、输出6美元;另有一个高速选项,输出吞吐量增加一倍,相应售价也翻一倍。
架构侧的变化集中在长链路执行。Grok 4.7采用比Grok 4.6更大的基础模型;相关披露显示,前者约为2.1万亿参数,后者约为1.5万亿参数。训练过程延长强化学习阶段,加入更耗时的组合任务,并要求模型在完成工作后做更多自我核查。上下文窗口提升到50万Token,文本和图像都可作为输入。模型还围绕Grok Bot harness做了原生适配,可配合多智能体拆分任务、并行推进和相互检查。新的安全防护体系也被纳入,用于降低越狱诱导与异常拦截导致的输出风险。
评测数据展示了这轮升级的主要落点。CursorBench 4.0得分46.3%,较Grok 4.6的40.4%提高5.9个百分点;DeepSWE v1.1达到71.0%,上一代为65.2%;Terminal-Bench 4.0从20.3%升到38.0%;EEBench从53.0%升至64.0%。通用工作类指标也有变化,AA Briefcase v1.1得到1657分,上一代为1546分;GDPval Elo从1605升至1695。法律代理与电气工程类测试被并列展示,用于观察非编码专业能力。部分横评同时指出,Fable 5.1与GPT-6 Astra在某些榜单中得分更高。
这次更新回应的核心问题是复杂软件任务。真实工程通常包含阅读仓库、拆解需求、跨文件修改、运行测试和多轮修复,模型能否长时间维持目标并识别自身错误,难度高于单段代码生成。围绕它的公开讨论同时呈现两条线索:一条聚焦价格与吞吐的组合,另一条比较综合智能分数与前沿系统的差距。Grok 4.8也被提及已完成训练,规模约2.5万亿参数。