★ 今日最值得关注
阶跃「Step 系列」本月打出最强执行组合:StepAudio 3 五款模型(09-15)登顶 Artificial Analysis——实时率 98.9%、ASR-WER 1.7% 双项全球第一;Step-3.7-Flash 开源部署路径已成熟(vLLM stepfun37 MTP / SGLang dev EAGLE,NVFP4 4 卡)。同月视觉+语音双线开源、节奏明显加快——对「阶跃星辰 Step 系列」产业链,这是一条干净的执行信号。
三层事实:
- StepAudio 3 登顶(09-15):五款模型包揽 Artificial Analysis 语音榜——实时率 98.9%、ASR-WER 1.7%,两项均为全球第一。不是单项领先,是整列模型同时到位。
- Step-3.7-Flash 部署成熟:开源权重已有明确落地路径——vLLM
stepfun37(MTP)/ SGLangdev-step-3.7-flash(EAGLE 多层草稿),且 NVFP4 4 卡即可跑。意味着端侧/工作站侧可达性已打开,与之前的 Mac Studio M4Max / DGX Spark 验证一脉相承。 - 执行节奏加快:同月内「视觉 + 语音」双线开源,从「发布权重」到「给出可复现部署」只差一步——这是把模型变成生产力的关键跨越。
可执行结论:如果你在跟踪国产大模型 / 具身产业链,Step 这一个月的动作是最没有歧义的执行信号——双线开源 + 双引擎部署就绪,比任何「即将发布」都更实在。对本人 OpenInfer / Qwen3-4B DFlash 也有直接参照:Step-3.7-Flash 在 vLLM/SGLang 两端都有官方草稿路径,说明「并行草稿 + 国产/低卡部署」已是可复用范式。
值得单独说:上期(0915)我们讲「投机解码可审计化(双密钥水印)」;本期 Step 在 vLLM/SGLang 两端都给出成熟部署,等于把「国产 MoE 投机解码栈」从 demo 推到生产。两条线合起来看——投机解码既「敢上生产」(水印),也「能上国产卡」(Step 部署就绪)。
二、vLLM & SGLang 社区跟踪
版本状态:vLLM stable v0.29.0(09-09),下一个候选 v0.29.1rc0(09-13);SGLang v0.5.19(09-05) 仍为最新稳定,近窗无新 tag。本期增量主要来自 main 分支,无正式发版(与 0915 同节奏)。
vLLM(main · 工程成熟 + 多后端补强)
新特性 / 架构演进:
- Rust Core 持续成熟:新增
--hf-overrides、per-request 抢占直方图(preemption histogram)——把调度可观测性从「全局聚合」细化到「单请求」,长尾延迟定位更准。 - XPU / ROCm 后端周级补强:继续把 v0.29.1rc0 的 dual-key Gumbel-max 水印(#56122,草稿/验证双密钥采样,生产合规/防伪)往多硬件铺开。
- stable v0.29.0 已含:EPD 三段分离(Encoder–Prefill–Decode)、OffloadingConnector 修复(MTP/EAGLE 下不再零命中)等(详见 0915)。
SGLang(v0.5.19 · 前缀缓存默认化 + DFlash2 草稿网升级)
新特性 / 重大适配:
- 统一 Radix Tree 成默认前缀缓存(破坏性变更):此前需显式开启,现为默认——须重核命中率,否则旧部署的缓存收益假设会失真。
- Beam Search 请求级上线:与投机解码 / PD 分离不兼容(同请求二选一)。
- DeepEP v2 补齐多节点 MoE 图捕获 Decode:跨节点 MoE 的 decode 阶段也能进 CUDA Graph。
- DFlash2 草稿网络升级:加局部卷积 + 候选选择器,Qwen3.8-27B 单 H200 并发 1 达 3.43×;MXFP4 W4A8 MoE + KDA fused accept 进一步压验证开销。
生产实践:DFlash2 的「局部卷积 + 候选选择器」方向性很明确——它想直接抬高接受长度 E[L](见原理部分),而非堆宽草稿树。属 main 增量,尚未进 v0.5.19 tag。
原理:DFlash2 草稿网 + 局部卷积 + 候选选择器——把「接受长度 E[L]」往上顶
上期(0915)我们钉死一条公式:Speedup = E[L]×Ttarget / (Tdraft + Tverify),结论是「E[L] 是天花板,别盲目加宽草稿树」。本期 DFlash2 给出抬高天花板的具体做法:
- 局部卷积:在草稿网络上引入 n-gram / 位置局部性感知,让草稿更贴合目标模型的局部模式 → 更多草稿 token 被接受(E[L]↑)。
- 候选选择器:在并行草稿树里做「生成 + 筛选」,只把高置信候选送进验证 → 同样 Tverify 下通过率更高。
Qwen3.8-27B 单 H200 并发 1 → 3.43× 就是这条路线的兑现。它和 0913 的「缓存边界 Pareto」、0915 的「E[L] 天花板」同源:都在 tradeoff 上找最优工作点,只是本期把旋钮从「选 D」拧到了「改草稿网质量」。
我的判断:DFlash2 的方向证明——投机解码的下一阶段竞争不在「并行度」,而在「草稿质量」。谁把 E[L] 顶得更高、Tverify 压得更低,谁就赢。对本人 OpenInfer/Qwen3-4B DFlash,下一步应实测「局部卷积式草稿网」能否在 Qwen3-4B 上复现 3×+。
常驻专题
PD 分离:vLLM main 走 EPD 三段分离 + 9 类 KV connector(NIXL/Mooncake/LMCache)+ llm-d(CNCF);SGLang 侧统一 Radix Tree 默认化 + DeepEP v2 多节点图捕获。横向:vLLM 偏连接器插件化,SGLang 偏路由 + 统一树缓存原生(#37506 unified-pool)。
架构演进:投机解码四路线(EAGLE-3 / MTP / DFlash / DSpark),本期 SGLang 把 DFlash 推到 DFlash2(局部卷积 + 候选选择器);稀疏注意力 HiSparse、FP8/NVFP4 量化(NVFP4 lm_head 仍坑)、多模态扩散持续推进。
PyTorch vs transformers:本周期无「脱离 transformers」新 PR。沿用立场:纯 PyTorch 自研仅在头部模型划算;Step-3.7-Flash 调试需 transformers ≥ 5.0。横向结论不变:自研推理栈适用高频/头部/极致优化,长尾借力 transformers。
Step 适配:StepAudio 3(09-15,实时率 98.9%/ASR-WER 1.7% 全球第一)+ Step-3.7-Flash 部署成熟——vLLM stepfun37(FP8/BF16 MTP k=3;NVFP4 4 卡 TP4 需 modelopt + FP8 KV cache + async-scheduling)/ SGLang dev-step-3.7-flash(EAGLE 多层草稿)。同月视觉+语音双线开源,执行节奏加快。横向:vLLM 一等公民 > SGLang dev 镜像。
三、AI 论文与产业热点
今日重点(1 句)
Google DeepMind 的 SigLIP 2 把视觉编码器从「会认物」升级成「语义 + 密集 + 多语」三合一,已成为 Qwen3-VL 等新一代 VLA 的默认视觉塔——这正是机器人「从认物到干活」的底层眼睛;而 M-RoPE(Qwen3-VL)用 3D 位置编码保住图像结构、专家卸载(Expert Offload)让 DeepSeek V4 671B 级 MoE 在有限显存跑起来,正好把今日「视觉+推理落地」主线从模型层补到部署层——产业侧宇树 IPO 受理、智元赴港、优必选订单破 14 亿、小鹏 IRON 下线、智驾双国标落地,正把具身「看懂 + 管动」逐一标价。
论文核心(SigLIP 2 · Google DeepMind,arXiv:2502.14786)
- 一句话定位:四路损失统一配方(sigmoid 对比 + caption 解码器 + 自蒸馏/掩码预测 + 在线去偏)产出语义 / 密集 / 多语兼备的视觉-语言编码器,向后兼容 SigLIP。
- 核心思想:caption 解码器注入位置 grounding → 定位能力;自蒸馏(后 20% 训练、50% patch 掩码重建)补局部语义 / 密集;90% 英 + 10% 非英去偏 → 多语。
- 公式:
L = L_sig + λ1·L_cap + λ2·L_self;L_sig为 batch 内全配对 sigmoid 二分类。 - 影响(数字说话):RefCOCO 83.76% vs 64.05%、VOC 分割 77.1 vs 72.0、NYUv2 深度 0.493 vs 0.576;已成 2025–26 开源 VLA 默认视觉塔(Qwen3-VL 用 SigLIP2-SO-400M)。具身意义 = 抓取 / 深度更准 + 出海多语 + NaFlex 看屏幕。
算子讲解:M-RoPE(Qwen3-VL)
- 定位:把 1D RoPE 扩成 3D(T / H / W) 位置编码,图像块 / 视频帧当结构化网格处理。
- 在用:Qwen3-VL(32B / 235B-A22B)Interleaved MRoPE(
mrope_section=[24,20,20],t/h/w 交织高低频)+ DeepStack + 视频时间戳;视觉塔即 SigLIP-2。 - 关键点:零额外参数显式编码坐标(vs 1D 拉平丢结构);坑 =
mrope_section须与权重一致、Qwen2-VL/2.5-VL/3 的get_rope_index不可混用、视频 T 走时间戳 token。
性能优化:专家卸载(Expert Offload)
- 定位:MoE 冷专家卸到 CPU / NVMe,热专家常驻 GPU + 异步预取,让 DeepSeek V4 671B 级 MoE 在有限显存可跑。
- 代表工作:MoE-Infinity(ICML 2023)、DeepSpeed-MoE;与 EP 正交可叠加。
- 收益:GPU 显存从 E×size 降到 K_hot×size(省数倍),净时延靠 overlap 压近零;具身关联 = 端侧 VLA「边缘 GPU + CPU 协同」实时推理。
产业热点(具身公司 / 产业链速递 · 置顶)
- 【具身】宇树(688836·科创板 IPO 已受理 / 拟募 42 亿):8 月募 9.05 亿美元、G1 9.9 万 / B2 连续 5 年盈利,但高盛指「未准备好执行功能型任务」 → 中性偏谨慎;利好谐波 / 执行器供应链(688017 / 002050 / 601689)与机器人 ETF 562500。
- 【具身】智元机器人(赴港 IPO 目标 400–500 亿港元;控股上纬新材 688585):2025 出货 5168 台全球第一,2026 目标破 1 万台 → 利好 688585 映射。
- 【具身】优必选(09880.HK,市值约 565 亿,订单破 14 亿):Walker S2 锁定 1.12 亿美元订单,唯一上市整机。
- 【具身】小鹏(09868.HK):第二代 VLA + 9/8 首台 IRON 下产线——端侧参数扩 3.5 倍、响应提速 300%、4D 时空 + 世界模型,跨 Robotaxi / IRON → 地平线 09660.HK 受益。
- 【监管】智驾强制国标:GB44721-2026(2027-7-1 实施)+ GB47955-2026(L2 命名规范)→ 利好合规智驾供应链;2026 H1 人形融资 162 亿美元创历史新高、中国占 10 笔。
⚠️ 产业动态不构成投资建议。
四、一句话结论
阶跃 Step 系列本月打出最强执行组合——StepAudio 3(实时率 98.9% / ASR-WER 1.7% 全球第一)登顶 Artificial Analysis、Step-3.7-Flash 在 vLLM/SGLang 双引擎部署就绪(NVFP4 4 卡)——对「阶跃产业链」是干净的执行信号;SGLang v0.5.19 把统一 Radix Tree 设成默认前缀缓存(须重核命中率)、DFlash2 草稿网加局部卷积+候选选择器把接受长度 E[L] 往上顶(Qwen3.8-27B 单 H200 并发 1 达 3.43×),与 0915 的「E[L] 天花板」公式同源——把旋钮从「选 D」拧到「改草稿网质量」;vLLM 主线 Rust Core 成熟 + dual-key 水印已稳。论文侧 SigLIP 2(DeepMind,arXiv:2502.14786)以四路损失把视觉塔升级为语义+密集+多语三合一、已成 Qwen3-VL 等新一代 VLA 默认眼睛,M-RoPE 用 3D 位置编码保结构、专家卸载让 DeepSeek V4 671B MoE 有限显存可跑,而宇树 IPO 受理、智元赴港、优必选订单破 14 亿、小鹏 IRON 下线、智驾双国标落地,正把具身「看懂 + 管动」逐一标价。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。