阶跃Step 5 Preview实测:国产大模型前三,重新杀回主桌
9 月的大模型战场竞争激烈,各家不仅比拼榜单排名,还要比拼真实任务中的实战能力。模型能否处理复杂任务、满足即时需求、支撑大规模调用,并进入手机、汽车等终端,正成为衡量基模公司的行业金线。
阶跃星辰发布新一代开源旗舰基础模型 Step 5 Preview。在全球权威的 Artificial Analysis Intelligence Index 中,Step 5 Preview 取得 44 分,位居全球开源模型前三,并进入模型智能水平与单任务成本权衡的“帕累托前沿”,在能力、效率、成本之间实现最佳平衡。APPSO 实测发现,阶跃已杀回国產大模型头部玩家行列。

Step 5 Preview 重点面向 AI 编程、软件工程、专业知识工作、金融等场景,擅长长上下文、多轮工具调用与持续执行。模型采用稀疏 MoE 架构,总参数量 600B,激活参数仅 27B,原生支持文本与视觉输入,上下文长度达 1M。
通过 WorkBuddy 接入模型,APPSO 覆盖编程、设计、3D 生成、深度调研和数据分析进行实测。编程测试从 Three.js 五子棋开始,生成的小游戏甚至包含人机对弈。威尼斯快艇游戏案例中,模型将水面、建筑与镜头运动组织在同一场景,效果接近可直接体验的网页小游戏。卡帕多奇亚热气球场景中,数十个气球同时飞行,日照、风向和视角均可调整,模型仍保持完整场景结构和交互逻辑。尼亚加拉瀑布还原任务中,面对动态水体、水雾、彩虹、游船、多视角和季节切换等高密度要求,整体完成度亮眼。网页操作系统任务中,相比此前 DeepSeek V4 Pro 和 V4.1 Flash 的同类测试,Step 5 Preview 在界面完整度、功能衔接和细节还原上更进一步。网页设计和 3D 资产测试中,太空行星、夜间跑车主题均体现对视觉层级和页面氛围的理解;狮身人面像及随手拍摄照片也能在数分钟内还原出具备基本结构和空间细节的模型。

深度调研和金融场景更考验证据组织与判断能力。阶跃围绕公司研究构建三项内部评测,并引入包含 220 道专家问题、11543 项评估标准的 FrontierFinance。官方结果显示,Step 5 Preview 在四项金融基准中表现均接近 Claude Opus 5。APPSO 实测中,小折叠手机立项报告要求串联用户投诉、外屏生态和售后成本,模型给出有依据的产品建议;广州、佛山七日游加入预算、体力和严格素食限制,模型持续遵循约束且方案可行;销售明细表分析中,模型先清洗数据,再追踪负利润率订单集中区域与品类,最后生成月度销售趋势图。这些案例显示,Step 5 Preview 已能理解复杂需求、规划执行步骤、调用工具并持续遵守约束,交付可运行、阅读或继续使用的成果。
Step 5 Preview 验证了阶跃研发前沿旗舰模型的能力,全模态基座模型矩阵则让阶跃具备从感知、理解、生成到交互的完整能力链路。过去一个季度,阶跃推出 Step Edge 端侧模型和 StepAudio 3 系列语音模型。Step Edge 通过文本与视觉基础模型结合语音、GUI 和生成能力,支持简单任务端侧完成、复杂任务云端处理,在评测中取得 29 项第一。StepAudio 3 Realtime 在 Artificial Analysis 对话动态和语音推理测试中分别取得 98.9% 和 99.7%,StepAudio 3 ASR 以 1.7% 词错误率并列非流式语音识别全球第一。目前阶跃模型布局覆盖云端旗舰、Flash 高效模型、端侧模型,以及语音、视觉、生成、GUI 等多模态专项能力。

阶跃的 AI+终端落地场景更具辨识度。官方数据显示,其模型手机装机量已超过 4200 万台,日均服务近 2000 万人次,合作覆盖国内超过 50% 的头部手机品牌,应用场景包括识屏问答、智能搜索、内容生成和跨应用任务执行。汽车方面,阶跃与吉利、千里科技共同研发整车智能体超级 Eva,由极氪 8X 首发搭载。超级 Eva 接入 Step 3.5 Flash 基座模型及阶跃语音和视觉理解模型,将感知、推理与执行整合进同一套车载智能体系统。吉利银河 M9 也通过接入阶跃端到端语音大模型,实现业内首次同类模型量产上车。
数千万台终端既是每天进行的开放世界测试,也让模型在口音、噪声、模糊指令和网络波动等真实场景中获得高价值反馈,帮助阶跃积累面向高频终端 Agent 的“智能密度”。终端也是验证端云协同与全模态 Agent 的天然场所。相比主要依赖开发者调用和线上评测的纯 API 模型公司,阶跃能把模型能力送入具体设备,通过系统适配、产品交付和用户使用,缩短技术能力转化为商业价值的路径。
Personal Agent 很可能成为 Coding Agent 之后全球 AI 产业的下一波浪潮,需要理解屏幕、声音、环境和个人偏好,跨应用完成真实任务,对长期上下文、全模态感知、GUI 操作和端云协同提出更高要求,核心入口载体是 AI 原生硬件。今年 7 月,阶跃推出大模型原生 AI 终端品牌 STEPX,并即将带来大模型原生智能体手机 STEPX Neo,构建起从模型、系统到终端的“模软硬”三位一体技术闭环。
前沿基
更多推荐阅读

智谱ZCode被指偷传代码遭企业追责
9月20日,ZCode“静默上传代码”风波从技术质疑升级为企业追责。太原承明科技向ZCode运营方北京智谱华章发出函件,称ZCode未经充分告知和授权上传其数据资产及商业秘密,要求就数据删除、流向、操作日志、责任主体及可能的数据出境等问题整改,并于10月10日前书面答复,同时保留索赔、投诉和诉讼权利。 承明科技称,取证发现上传并非偶发代码片段传输,而是自动、批量触发的完整归档,可能涉及源代码、系...
2026-09-20
哑巴AI三天引爆硅谷,14万开发者抢测
9月16日,ChatGPT核心发明人之一、InstructGPT论文第四作者Diogo Almeida连发长推,直指行业走偏,并推出新模型Jev。Jev不写文章不陪聊,只接收混乱数据,70毫秒内返回带概率的判断,输出token永久免费。发布仅三天,它就被Vercel、Cloudflare和LangChain等主流平台集成;不到36小时,14万名开发者涌入内测,用例已达数百个。有人用它做Mac语音助...
2026-09-20
AI圈双节无休:全球基模决战提前打响
中秋和国庆13天假期,可能成为今年AI圈最忙最炸的两周,“基模决战周”即将到来。硅谷暗流涌动,国内厂商也卡在假期前密集憋大招。 OpenAI月初刚发布GPT-6 Astra,已拿下约13%企业AI支出,Anthropic的Claude Fable约为8%。硅谷方面,Anthropic、谷歌、马斯克的Grok几乎都有新动作。 Anthropic的Claude 5.2箭在弦上。路透社爆料称Anth...
2026-09-20
机器鸭5天卖1万台,深圳团队谈AI硬件创业
一只叫 Microduck 的机器鸭在 X 上刷屏。它由 Hugging Face 旗下 Pollen Robotics 设计,售价 399 美元,高峰期平均每 4 秒卖出一台,5 天预售突破 1 万台,订单额超 500 万美元,交付已排到明年。它会走路、踢球、滑轮滑,摔倒能自己爬起来。对普通用户是可爱玩具,对开发者是可训练、修改和二次开发的机器人平台。 把鸭子从原型变成实物的是深圳公司 See...
2026-09-20
24岁首席科学家转身具身智能,对话深朴智能王家伟
本周「十字路口」嘉宾王家伟是 24 岁的深朴智能首席科学家。中科大少年班、MSRA、DeepSeek、字节 Seed——这条路直通大模型最前沿,但毕业时他转身走向具身。他想离开的不是大模型,而是只能跟随既定计划的状态。他说「风浪越大,鱼越贵」——具身路线、评估和产品都还没有共识,风险更高,却给了年轻研究者定义问题的空间。 播客从 GPT-6 Astra 出发,讨论「OpenAI 会不会降维打击具...
2026-09-20
比个耶就打招呼,这个3D机器人能看懂你的手势
家人们,夕小瑶会动了,还能听我的“手势指挥”。对着摄像头比个耶,她就抬手打招呼;点个赞,她开始自信走秀;食指画个圈,她也跟着转身。这个网页我也放出来了,感兴趣的可以玩一下:https://xixiaoyao-gesture-studio.netlify.app/。初次加载3D模型会有点慢,建议用带摄像头的电脑打开,右下角点击开启互动,允许使用摄像头,再把手放进画面里。 以前夕小瑶只出现在我的头像...
2026-09-20