阶跃星辰(StepFun)今日发布旗舰模型 Step 5 Preview,总参数 600B,激活参数 27B,原生支持 1M 上下文及文本/视觉输入。该模型在 Artificial Analysis 评测中获得 44 分,位列全球开源前三。模型将于 10 月 15 日正式开源,未来一周内已接入 AGI Bar 免费使用。

模型定位与定价
Step 5 Preview 面向软件工程、深度研究和专业工作流,重点强化长上下文、多轮工具调用和长程 Agent 执行。定价方面:输入 ¥7/百万 token,输出 ¥20/百万 token,缓存 ¥0.35/百万 token。

StepCodeBench 代码评测
阶跃构建了 StepCodeBench,覆盖 553 个独立代码仓库、9 类任务、20 个应用领域、33 种编程语言。任务包括功能修改、Bug 修复、重构、文档生成、性能调优等。Step 5 Preview 在该评测上的 avg@4 达到 49.0%,在功能修改、Bug 修复和重构任务上表现突出,低中等难度任务接近 Claude Opus 5 水平。


金融领域优化
模型在金融领域进行了专门优化,包含 LiveSearch(检索验证金融信息)、CorporateValuation(企业估值)、DeepResearch(深度研究报告)等内部评测,以及在 FrontierFinance(6 类投资场景、220 道专家问题、11,543 项评估标准)中表现优异。

官方案例展示
Step 5 Preview 可调用 Blender 创建 3D 资产并接入 Three.js 应用:
- Room Planner:从卧室照片生成可交互 3D 空间
- 3D Flappy Bird:浏览器 3D 游戏,含动态环境和实时操控
- Dream Racing:线条赛车在不断变化的场景中前进
- Toy Universe:两个 3D 世界放入同一交互空间
- 穿越时光的铁路:基于 1922 年旅行指南重建九广铁路历史图册
- 清明上河图:用 p5.js 逐笔构建并动画展开
- 动态象棋:可玩 3D 中国象棋,含立体棋盘和棋子动画
长程 Agent 任务
在未经 Pokémon 专项优化的情况下,Step 5 Preview 持续运行《Pokémon Red》,完成 3,093 回合、超 628 万 tokens,获得 3 枚道馆徽章。在另一项可编程键盘开发调试任务中,连续工作超过 3 小时。
在 MLA GPU Kernel 优化任务中,模型在 22 小时内达到前向/反向合计 508 TFLOPS,超越 Claude Opus 5(493)和 Kimi K3(307)。在 Qwen3-30B-A3B 后训练实验中,24 小时内将 AIME24 准确率从 53.3% 提升至 60%,与 Claude Opus 5 持平。


技术亮点
- Narrow but Deep 架构:采用 92 层 Transformer,为长 Prefill 提供更深信息传播路径,处理多跳推理
- Sparse GQA:引入稀疏索引选择相关历史信息,结合 Block-wise Token Merging 将 Indexer 成本降至 1/8
- 模型自进化:模型参与自身迭代,构建百万级可验证高难任务数据
- 长程 Agent 可训练性:通过确定性算子对齐,实现训练与推理的 bit-wise 对齐,logprob 偏差控制在 1e-2 以内
