阶跃星辰“第一梯队”,是“自嗨”吗?
链接复制成功
发布于:北京市
沉寂许久的阶跃星辰,正试图挤进大模型第一梯队。
9月20日,它发布Step 5 Preview,原生支持文本与视觉输入,重点面向编程、软件工程、专业知识工作和长程Agent任务。上线初期,登录并完成首次调用后可获得30天的Step Plan免费使用权。几天后,Step Plan的月度套餐一度售罄。对于一家在大模型市场存在感不算强的公司来说,这样的关注度并不常见。
紧接着,第三方平台Artificial Analysis发布最新的智能指数排名,Step 5 Preview与Kimi K3并列全球开源第二。这是阶跃星辰的开源模型第一次获得这么高的名次。
阶跃星辰成立于2023年4月,由前微软全球副总裁姜大昕创办,早期被外界列入“AI六小龙”,但从后续业务看,它不算一家典型的大模型公司。除了通用大模型,它还布局了语音、图像、智能体和手机等业务,产品线比较分散。这次Step 5 Preview的发布,一度被外界视为它杀回第一梯队的信号。
这个时间点也很微妙。据媒体报道,阶跃已于6月底向港交所秘密递交上市申请,争取年底挂牌。而模型圈的第一梯队基本已经坐稳了月之暗面、深度求索等厂商,靠这一款模型,阶跃真能挤进去吗?
01.阶跃模型上桌了?
判断阶跃星辰有没有进入大模型第一梯队,可以拆成两层:模型本身的能力,和市场上的使用规模。
模型能力,我们重点看榜单排名。
从阶跃公布的基准测试看,Step 5 Preview的优势主要集中在代码、Agent、浏览检索和长上下文任务。在GPQA Diamond、Terminal-Bench v2.1、BrowseComp和MMMU-Pro等测试中成绩靠前,说明它已经具备处理复杂专业任务的能力,但这些恰好是不容易被用户直接感受到的部分。
阶跃还自建了StepCodeBench,覆盖553个独立代码仓库、33种编程语言,考察在真实开发场景中的表现。这项测试中,Step 5 Preview排名第三,低于Claude Opus 5和GPT-6 Astra,高于Kimi K3和GLM 5.3。这说明它具备一定工程实力,不过测试的数据集和评分规则没有公开,参考价值有限。
成为付费用户可以阅读 阶跃星辰 所有资料
了解更多 →