系列:每日AI热点

每日AI热点 · 2026-09-16:StepAudio 3 登顶 Artificial Analysis + Step-3.7-Flash 开源就绪,SigLIP 2 成 VLA 默认视觉塔

★ 今日最值得关注

阶跃「Step 系列」本月打出最强执行组合:StepAudio 3 五款模型(09-15)登顶 Artificial Analysis——实时率 98.9%、ASR-WER 1.7% 双项全球第一;Step-3.7-Flash 开源部署路径已成熟(vLLM stepfun37 MTP / SGLang dev EAGLE,NVFP4 4 卡)。同月视觉+语音双线开源、节奏明显加快——对「阶跃星辰 Step 系列」产业链,这是一条干净的执行信号。

三层事实:

  1. StepAudio 3 登顶(09-15):五款模型包揽 Artificial Analysis 语音榜——实时率 98.9%、ASR-WER 1.7%,两项均为全球第一。不是单项领先,是整列模型同时到位。
  2. Step-3.7-Flash 部署成熟:开源权重已有明确落地路径——vLLM stepfun37(MTP)/ SGLang dev-step-3.7-flash(EAGLE 多层草稿),且 NVFP4 4 卡即可跑。意味着端侧/工作站侧可达性已打开,与之前的 Mac Studio M4Max / DGX Spark 验证一脉相承。
  3. 执行节奏加快:同月内「视觉 + 语音」双线开源,从「发布权重」到「给出可复现部署」只差一步——这是把模型变成生产力的关键跨越。

可执行结论:如果你在跟踪国产大模型 / 具身产业链,Step 这一个月的动作是最没有歧义的执行信号——双线开源 + 双引擎部署就绪,比任何「即将发布」都更实在。对本人 OpenInfer / Qwen3-4B DFlash 也有直接参照:Step-3.7-Flash 在 vLLM/SGLang 两端都有官方草稿路径,说明「并行草稿 + 国产/低卡部署」已是可复用范式。

值得单独说:上期(0915)我们讲「投机解码可审计化(双密钥水印)」;本期 Step 在 vLLM/SGLang 两端都给出成熟部署,等于把「国产 MoE 投机解码栈」从 demo 推到生产。两条线合起来看——投机解码既「敢上生产」(水印),也「能上国产卡」(Step 部署就绪)。

二、vLLM & SGLang 社区跟踪

版本状态:vLLM stable v0.29.0(09-09),下一个候选 v0.29.1rc0(09-13);SGLang v0.5.19(09-05) 仍为最新稳定,近窗无新 tag。本期增量主要来自 main 分支,无正式发版(与 0915 同节奏)。

vLLM(main · 工程成熟 + 多后端补强)

新特性 / 架构演进:

SGLang(v0.5.19 · 前缀缓存默认化 + DFlash2 草稿网升级)

新特性 / 重大适配:

生产实践:DFlash2 的「局部卷积 + 候选选择器」方向性很明确——它想直接抬高接受长度 E[L](见原理部分),而非堆宽草稿树。属 main 增量,尚未进 v0.5.19 tag。

原理:DFlash2 草稿网 + 局部卷积 + 候选选择器——把「接受长度 E[L]」往上顶

上期(0915)我们钉死一条公式:Speedup = E[L]×Ttarget / (Tdraft + Tverify),结论是「E[L] 是天花板,别盲目加宽草稿树」。本期 DFlash2 给出抬高天花板的具体做法:

Qwen3.8-27B 单 H200 并发 1 → 3.43× 就是这条路线的兑现。它和 0913 的「缓存边界 Pareto」、0915 的「E[L] 天花板」同源:都在 tradeoff 上找最优工作点,只是本期把旋钮从「选 D」拧到了「改草稿网质量」。

我的判断:DFlash2 的方向证明——投机解码的下一阶段竞争不在「并行度」,而在「草稿质量」。谁把 E[L] 顶得更高、Tverify 压得更低,谁就赢。对本人 OpenInfer/Qwen3-4B DFlash,下一步应实测「局部卷积式草稿网」能否在 Qwen3-4B 上复现 3×+。

常驻专题

PD 分离:vLLM main 走 EPD 三段分离 + 9 类 KV connector(NIXL/Mooncake/LMCache)+ llm-d(CNCF);SGLang 侧统一 Radix Tree 默认化 + DeepEP v2 多节点图捕获。横向:vLLM 偏连接器插件化,SGLang 偏路由 + 统一树缓存原生(#37506 unified-pool)。

架构演进:投机解码四路线(EAGLE-3 / MTP / DFlash / DSpark),本期 SGLang 把 DFlash 推到 DFlash2(局部卷积 + 候选选择器);稀疏注意力 HiSparse、FP8/NVFP4 量化(NVFP4 lm_head 仍坑)、多模态扩散持续推进。

PyTorch vs transformers:本周期无「脱离 transformers」新 PR。沿用立场:纯 PyTorch 自研仅在头部模型划算;Step-3.7-Flash 调试需 transformers ≥ 5.0。横向结论不变:自研推理栈适用高频/头部/极致优化,长尾借力 transformers。

Step 适配:StepAudio 3(09-15,实时率 98.9%/ASR-WER 1.7% 全球第一)+ Step-3.7-Flash 部署成熟——vLLM stepfun37(FP8/BF16 MTP k=3;NVFP4 4 卡 TP4 需 modelopt + FP8 KV cache + async-scheduling)/ SGLang dev-step-3.7-flash(EAGLE 多层草稿)。同月视觉+语音双线开源,执行节奏加快。横向:vLLM 一等公民 > SGLang dev 镜像。

三、AI 论文与产业热点

今日重点(1 句)

Google DeepMind 的 SigLIP 2 把视觉编码器从「会认物」升级成「语义 + 密集 + 多语」三合一,已成为 Qwen3-VL 等新一代 VLA 的默认视觉塔——这正是机器人「从认物到干活」的底层眼睛;而 M-RoPE(Qwen3-VL)用 3D 位置编码保住图像结构、专家卸载(Expert Offload)让 DeepSeek V4 671B 级 MoE 在有限显存跑起来,正好把今日「视觉+推理落地」主线从模型层补到部署层——产业侧宇树 IPO 受理、智元赴港、优必选订单破 14 亿、小鹏 IRON 下线、智驾双国标落地,正把具身「看懂 + 管动」逐一标价。

论文核心(SigLIP 2 · Google DeepMind,arXiv:2502.14786)

算子讲解:M-RoPE(Qwen3-VL)

性能优化:专家卸载(Expert Offload)

产业热点(具身公司 / 产业链速递 · 置顶)

⚠️ 产业动态不构成投资建议。

四、一句话结论

阶跃 Step 系列本月打出最强执行组合——StepAudio 3(实时率 98.9% / ASR-WER 1.7% 全球第一)登顶 Artificial Analysis、Step-3.7-Flash 在 vLLM/SGLang 双引擎部署就绪(NVFP4 4 卡)——对「阶跃产业链」是干净的执行信号;SGLang v0.5.19 把统一 Radix Tree 设成默认前缀缓存(须重核命中率)、DFlash2 草稿网加局部卷积+候选选择器把接受长度 E[L] 往上顶(Qwen3.8-27B 单 H200 并发 1 达 3.43×),与 0915 的「E[L] 天花板」公式同源——把旋钮从「选 D」拧到「改草稿网质量」;vLLM 主线 Rust Core 成熟 + dual-key 水印已稳。论文侧 SigLIP 2(DeepMind,arXiv:2502.14786)以四路损失把视觉塔升级为语义+密集+多语三合一、已成 Qwen3-VL 等新一代 VLA 默认眼睛,M-RoPE 用 3D 位置编码保结构、专家卸载让 DeepSeek V4 671B MoE 有限显存可跑,而宇树 IPO 受理、智元赴港、优必选订单破 14 亿、小鹏 IRON 下线、智驾双国标落地,正把具身「看懂 + 管动」逐一标价。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。