前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8655
  • Agent 系统的瓶颈不是模型,是架构设计
  • 防御式 Agent 架构:Schema 注入与超时控制
  • 自研研究 Agent 拦截 AI 编程幻觉:文档先行策略
  • 像物理学家一样剪枝 LLM:区块移除的伊辛模型优化
  • Mac mini上的AI开发新范式:OpenClaw与Codex实战
  • Cloudflare Python Workers 正式上线,可用纯 Python 开发边缘应用
  • 浏览器直接给 ESP32 烧录 Claude 写的宏,无需 IDE 或工具链
  • Google 发布 Agent 安全风险报告:5 万美元循环消耗与凭证窃取案例
  • 多 Agent 合规流水线:用 RAG + 自修正架构对抗 WCAG 幻觉问题
  • Anthropic 发布金融领域 Claude 参考智能体套件
  • OpenAI 披露强化学习模型在上下文压缩时插入 Prompt 注入
  • Jev 决策模型实测:0.3秒完成意图分类和工具路由,$0.00004/次
  • Kimi Code Desktop 上线:图形界面 + 内置终端 + Git 状态,支持 Swarm 多 Agent 协
  • StepFun Step 5 Preview:600B 总参数 MoE 模型,1M 超长上下文,10 月开源
  • JSON-Render:通吃 React/Vue/Svelte/React Native 等 10+ 框架的生成式 UI
  • Agent-Native:让 Agent 能力同时暴露给 LLM 工具调用和 UI 操作的 TypeScript 框架
  • 清华联合无问芯穹开源具身智能体RPent,GPT-6 Astra注入机器人
  • AI Agent工具调用边界case:路由错误比想象中更脆弱
  • AI按它能读的契约编程,而非你想要的
  • MCP 远程服务器实现 AI 驱动的确定性 UI 编排
  • 阶跃Step 5 Preview实测:27B参数开源模型冲至Top2
  • 用Responses API构建有边界的GPT-6 Astra Agent
  • 用破坏不变量法审查 AI 生成代码
  • AI 编程测试冻结:保存异常指纹而非测试名
  • 程序员亲历:全公司用 Claude Code 批量生产代码,没人读代码,12 小时工作制
  • 自托管Llama部署成本全解析:GPU之外容易被忽视的隐性开销
  • Builder.io开源Agent-Native框架:让人与AI共享同一操作层
  • 让AI编程代理在中断后从断点恢复:session化执行轨迹方案
  • CI如何验证AI代理真的跑了测试而不是伪造结果
  • llm-keys-ui:让Coding Agent安全获取API密钥的插件
  • AI产品定价数学:固定费率如何悄悄亏损
  • ZCode事件:AI编程工具静默上传全部Git历史
  • Anthropic自评:R&D自动化率26%,但完全自主为0
  • 阿里Qwen-Image-2.1:70亿参数开源图像生成拳打闭源模型
  • OWASP CRS 规则引擎:给 LLM 和 MCP 加上 WAF
  • 智谱 MaaS 上线数据不留存机制,可申请开通
  • 如何界定可完成的AI工程范围
  • Cursor中直接查询技术文档的MCP方案
  • AI Agent的过度自信陷阱
  • Cursor与.NET周报:七个实战规则
  • AI Agent失效?模型可能不是根源
  • Qwen-Image-2.1开源:7B参数兼顾生图与编辑
  • 阿里开源 Qwen-Image-2.1:7B 参数兼顾透明图生成与多图编辑
  • 免费模型Trace不能支持的五个评估主张
  • AI重构前的副作用冻结术:先录 Ledger 再动格式
  • Agent能改Oracle则Green Build不足为信:独立检查三原则
  • AI编程导致代码质量下降?根子在质量管理
  • AI连接数据库必须先脱敏:PII保护实战指南
  • Anthropic与埃森哲20亿美元共建AI安全评估体系
  • Copilot CLI恢复检查点导致1GB未跟踪文件被删
  • AI代码审查升级:结果直发PR评论,淘汰复制粘贴
  • 已加载 51 / 8655
8.0
热点
AI SCORE
模型发布2026-09-21 11:46

阶跃Step 5 Preview实测:27B参数开源模型冲至Top2

量子位#开源模型#阶跃星辰#低参数
Editor brief · 编辑速览

阶跃星辰发布Step 5 Preview预览版,仅27B激活参数即达开源榜第二,推理效率与效果兼备。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

谁能想到,全球旗舰模型混战打到现在,局势依旧充满变数。

昨天,阶跃星辰毫无预兆地端出了最新一代旗舰基座模型——Step 5 Preview。

MoE架构,600B总参数、激活参数仅27B,1M上下文。

Agent能力大幅提升,在Artificial Analysis的最新评测中,Step 5 Preview取得44分,直接冲到全球开源Top 2。

要知道,其他拿到这一分数的大模型,大多都是万亿参数级别。

文章配图

可以说很有竞争力了,单个任务成本仅为Opus 5的12.5%。

文章配图

AA榜单中,Step 5 Preview位于Intelligence Index与单任务成本权衡的「帕累托前沿」。

文章配图

阶跃挺久没出现在这么靠前的位置了,之前两代模型都聚焦在Flash这个档位。

但Benchmark这东西嘛,现在大家也都懂。

榜单上你追我赶,今天刷掉一个,明天又冒出来一个。真到要用的时候,模型到底行不行,完全是另外一码事。

烧了无数Token,并行跑了无数个3D资产、3D游戏……

所以API一接上,我直接给Step 5 Preview上强度,让它操作Blender,给我建一个后室出来。

说实话,最开始我没指望它真能交付出什么东西。

结果等它自己折腾了一个多小时,我打开文件夹,再点开渲染好的MP4,直接看愣了。

不er,这啥啊,你搁哪个网站下载的视频??

建模本身就不说了,离谱的是,它居然自己给视频加了一堆后期。

VHS录像质感、镜头噪点、昏黄灯光,人物走路的时候甚至还有脚步声。

给我看得有点毛骨悚然了,感觉转角会跳出一个《痴迷》女主。。。

第二个任务,我让它照着1999年的《LEGO Racers》,直接搓一个乐高赛车游戏。

赛道、赛车、人机车手、实时排名都有,甚至连发动机音效都给配上了。

文章配图

也可能主要还是因为我车技菜,经常一脚油门直接创路障上,有时候甚至连人机都跑不过。

文章配图

不过吧,家人们,玩完两个3D Demo,我是真有点顶不住了。

你要知道,我是晕3D的。前面两个任务搓完,差点没搁工位上吐出来。。。

最后再奉上一个《花屋》建模,接下来咱还是做点简单的2D任务吧。

文章配图

先做了个霓虹跑酷小游戏。有意思的是,我专门用了和阶跃上一代官网Demo类似的Prompt。

道路两旁加了高楼,视觉层次更完整,Game Over之后整个边框还会跟着变红,很多Prompt里没写的小细节,它自己补上了。

文章配图

文章配图

这审美真可以啊,而且覆盖面特别全,基本能直接拿来用了。

文章配图

不过,有时候还是会出现模块溢出这种小Bug,依然得review,依然得改。

文章配图

第一轮经常有些小细节不到位,离Astra那种「我咧个,这是AI做的?」的瘫软程度,肯定还有差距。

通常指出两三轮问题,它自己修一遍,就能到可用状态。

文章配图

明明前面两代还都是Flash,怎么到Step 5 Preview,Agent能力突然猛了这么多?

过去几年,大模型行业最简单粗暴的信仰一直是Scaling。

确实很猛,Fable直接给Agent堆超模了,涌现出不少新技能点。

所以,Step 5 Preview当然也在Scaling,但它没有把「越大越好」当成唯一目标。

团队选择了一种叫Narrow but Deep的网络设计。

92层的Transformer,在控制激活规模的同时,让信息经过更多层连续变换。

复杂任务里,经常会有大量multi-hop依赖,前面搜到的信息,要经过很多步之后才能真正派上用场。

网络更深,相当于给这些信息留下了更长的传播和推理路径。

几十轮工具调用之后,上下文能轻松滚到上百万Token。如果每一层都把前面所有内容重新扫一遍,计算量很快就会爆炸。

Sparse MoE、Hybrid Sparse、Sparse GQA……本质上都是在解决上下文的问题。

文章配图

当然,算法层面写个Sparse,不代表GPU真的就会少干活。

索引、访存、调度这些问题处理不好,好不容易省下来的算力,全部会浪费掉。

所以Step 5 Preview在硬件上也下了不少功夫,通过底层算子和数据访问优化,让理论上的Sparse尽量真正变成实际吞吐。

有了这套软硬件基座,后面要做的事就比较清晰了,围绕Agent训一遍模型,让它能连续干活。

简单来说,如果以前模型的基本单位是「回答」,那现在就变成了「Loop」。

规划、执行、调用工具、看结果、发现不对、继续修。

最终,通过Long-horizon RL、Context Compaction等方法,团队让Step 5 Preview在几十轮工具调用之后,还能记得自己到底要干嘛。

到这里,Step 5 Preview的思路就比较完整了。

踩在「性能×成本」的甜蜜点上,把有限的计算预算尽量花在真正影响Agent能力的地方。

从Step 3.5 Flash,到Step 3.7 Flash,再到今天的Step 5 Preview,路线其实没怎么变——

尽可能让Frontier级能力,大家用得起。

大模型竞赛打到今天,依旧天上一天地上一年,战场始终瞬息万变,唯一不变的共识是:

毕竟,仅仅过去一年里,头部模型的王座就不知道换多少次了。。。

新的模型、新的技术路线不断把能力边界往前推,曾经足以建立巨大壁垒的领先优势,很多时候几个月就会被追平。

Stanford 2026 AI Index里有个数据很有意思。

截至2026年3月,Anthropic、xAI、Google和OpenAI四家公司最顶尖的模型,在Arena上的差距已经压缩到了25个Elo以内。

你要知道,GPT刚发的时候,这个差距可远没有这么小。

一方面,Frontier的门槛越来越高;另一方面,Frontier内部又越来越拥挤。

单纯追逐某一个Benchmark、某一次榜单第一,已经很难定义一家模型公司的长期位置。

Benchmark上的智能,又能不能真正迁移到复杂、开放、长程的真实任务里?

现在各家其实都已经开始疯狂点自己的技能树了。

V4 Flash打爆性价比,给Flash级模型干成白菜价。

Astra同样如此,Coding其实没提升多少,但把Computer use的心智站住了。

向下,优化效率和成本,让Agent真正进入大众生活。

文章配图

说实话,这才是AI行业最有意思的地方,要是真靠Scaling解决一切,跟制造业有啥区别啊。

我一直觉得,模型层更像是一片参差不齐的竹林。

点亮任何一个技能点,都意味着Trade-off。

更强的推理、更长的Context、更低的延迟、更少的激活、更强的多模态、更好的Agent能力……

至少在相当长的一段时间里,很难有一家模型把所有方向全部点满。

只要能找到合适的切口,总会有新模型、新公司的市场生态位。

关于AGI的这场马拉松,远没有跑到最后一公里。

刚刚,Claude Code大重构!内部3万Agent管理技术免费开放2026-09-18

梁文锋CFO到位!投过智谱MiniMax2026-09-15

奥特曼被骗!A社一脚油门冲刺IPO,募资叫板SpaceX2026-09-14

银行Agent上岗:4200万小微经营者可用,信贷、票据、财税一把梭2026-09-12

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1

Original source

本文由 AI 翻译整理自 量子位,原文版权归原作者所有。

阅读英文原文
上一篇
MCP 远程服务器实现 AI 驱动的确定性 UI 编排
下一篇
用Responses API构建有边界的GPT-6 Astra Agent