阶跃推出Step 5 Preview,10月15日开源

9月20日 11:19
面向AI编程、软件工程、专业知识与金融等Agentic场景,该基座使用600B稀疏MoE、仅激活27B参数,在AA智能指数得到44分,完整权重定于10月15日开放。

阶跃星辰在九月二十日发布了Step 5 Preview,将其定义为面向真实世界Agentic任务的旗舰基座模型。当前该模型已向外界全量开放服务,官方同时设定完整权重在十月十五日对外开源。这一版本的服务方向涵盖编程、软件工程、专业认知工作以及金融分析。

模型底座采用稀疏MoE设计,总参数规模为600B,激活参数为27B;上下文长度为100万Token,并可原生接受文本与视觉输入。在Artificial Analysis Intelligence Index里,该版本记录为44分,在全球开源类别中排在前三位。阶跃还给出了一项成本控制口径:同一类单任务开销只有Anthropic Claude Opus 5的八分之一。

为了验证编程执行能力,阶跃搭建了StepCodeBench,题库涉及553个独立仓库、9类任务、20个应用领域和33种编程语言,可用于观察缺陷修正、功能编写、代码重构、环境配置等情形下的成功率。公开与内部测评同时覆盖DeepSWE v1.1、ALE-CLI、FrontierFinance、DRACO等项目;在相关结果里,它在若干复杂基准中位于GPT-6 Astra或Claude Opus 5之后,并优于其他参评开源模型。GDPval-AA v2包含截至九月十九日的更新数据,DeepSWE v1.1则在SWE-agent harness下按temperature=1.0、top_p=0.95设置测试。一个示例流程展示了模型对硬件工作流的整合能力:读取ESP32资料后,借助串口、截图、摄像头画面和鼠标操作反馈,把一块ESP32-S3开发板调整为带蓝牙按键与语音输入的Vibe Coding键盘,并保持超过3小时的修改—调试循环。

这些数字构成市场比较时常用的参照,低成本、长上下文、多模态输入与较高分数被放在一起,便于企业评估其在编程代理与研究辅助中的可用性。如果十月十五日的权重发布按期完成,开发者将获得本地部署与进一步验证的机会;后续第三方依据同套任务进行的复测,将继续检验厂商口径与实际表现之间的一致程度。