市场热点名人快讯安全中心
市场热点消息

阶跃星辰开源Step Code,自测称性能追平DeepSeek Harness

阶跃星辰以MIT许可证开源AI编程工具Step Code v0.1.0;其自测称工具在两项基准中兼顾通过率和较低token消耗,但未披露底层模型。

快讯正文

阶跃星辰开源Step Code:自测追平DeepSeek Harness,token更省

动察 Beating AI 快讯,阶跃星辰开源 AI 编程工具 Step Code v0.1.0,采用 MIT 许可证。它直接跑在终端里,可以读写代码、跑测试和执行开发任务,还支持 MCP、Agent Skills 和 Claude Code 插件。内置的 StepPage 可以一条命令把本地静态网站发布到线上。

Step Code 主打少用 token。在阶跃自己的 Terminal-Bench 2.1 横评中,它完成 72/89 个任务,得分 80.9%,与图中的 DeepSeek Harness 并列最高,但 token 用量更低。阶跃自建的 Multi-Frame 长任务测试共有 150 道题,Step Code 完成 110 道,得分 73.3%,平均每题消耗 509 万 token,在对比的 6 款 harness 中同时拿到最高通过率和最低 token 用量。

不过阶跃没有公布这轮横评具体用了哪个底层模型,也没有拆解这些 token 是怎么省下来的。官方只提到 Step Code 与 Step 系列模型一起针对 token 消耗做过调优。从源码看,它在整个 harness 里都比较「抠 token」:文件读取和命令输出会主动限长,搜索尽量只返回需要的部分,长对话默认会压缩上下文,system prompt 也要求能直接调用工具就不要额外开 Agent。它甚至还有一套更激进的上下文裁剪机制,可以删掉历史工具输出、重复结果和旧的思考过程,不过这项默认关闭。

原文链接 https://m.theblockbeats.info/flash/368553

补充解读

开源发布、版本号和MIT许可证等信息表述具体,且源码机制具有一定可核查性;但性能和token效率数据来自厂商自测,底层模型、完整测试配置及节省来源未披露,横向结论需独立复现。该事件对AI编程工具生态有一定意义,但与当前重点观察资产缺少直接关联。

关注后续官方信息,不根据单一消息做决定。

阶跃星辰是否公布底层模型、完整测试配置及原始结果

第三方能否复现Terminal-Bench 2.1与Multi-Frame成绩

Step Code后续版本、开发者采用情况及安全审计结果

同事件进展

正在加载事件时间线…