今天有一条很少见的对称证据:同一个优化思路(MoE 共享专家融合)在 08-20 同一天,分别在 NVIDIA 侧(vLLM #53040)和 AMD 侧(SGLang #32340)拿到两位数收益。当两家厂商、两个框架、两条内核栈给出形状一致的收益曲线时,基本可以确认收益来自消除固定开销这个结构性原因,而不是某一家内核的独门魔法。第二条主线是可观测性:vLLM #48915 把逐请求投机解码接受率写进了 OpenAI 兼容响应体。
★ 今日最值得关注
共享专家融合:vLLM #53040(NVIDIA)与 SGLang #32340(AMD)同日兑现。
先看 vLLM #53040 做了什么。DeepSeek V4 类 MoE 模型每层有两路专家:routed 专家(FP4) 和 共享专家(FP8,每个 token 必过)。融合前的执行序列是四次内核 launch:
- routed FP4 MegaMoE
- shared FP8 gate/up
- shared down
- add(残差相加)
这四次 launch 之间还要多次把中间结果写回 HBM 再读出来。融合后,SM100 persistent MegaMoE 内核统一调度:shared 的 L1 段、routed 的 dispatch + MMA、shared 的 L2 段、FP32 累加,全部在一个 persistent 内核里完成,最终只写一次 BF16 输出。
实测数字(B200/GB200,DSv4,128/256 输出):
| 指标 | 融合前 | 融合后 | 变化 |
|---|---|---|---|
| BS=1 输出吞吐 | 130.02 tok/s | 149.50 tok/s | +14.98% |
| BS=1 TPOT | 7.653 ms | 6.643 ms | −13.19% |
| 并发 64 吞吐 | — | — | +9.44% |
| 128 token 短输入 TTFT | — | — | +4.93%(变差) |
怎么读这张表:decode 阶段的瓶颈是带宽与 launch 开销,不是算力。所以小 batch 收益最大——BS=1 的 TPOT 改善(−13.19%)明显大于并发 64 的吞吐改善(+9.44%),因为 batch 越大,launch 开销被摊得越薄,能省的份额自然越小。而 TTFT 反而 +4.93%,是因为极短 prefill 上 persistent 内核的启动成本摊不平——这是同一个机制的另一面,不是 bug。
AMD 侧 #32340 修的是两个 V3 时代遗留的假设(bf16 correction bias、top-6 非 2 的幂),在 MI355X / TP4 低并发上拿到输出吞吐 +8~11%,GSM8K 精度保持。收益曲线形状和 NVIDIA 侧一致。
给部署的直接影响:两条路都以 flag 提供、默认不开。
- B200/GB200 跑 DSv4:加
--moe-backend deep_gemm_mega_moe就能吃到两位数收益。- MI355X 跑 V3/V4:升级到含 #32340 的构建。 不开就白丢 10%+。 但也要注意 TTFT 回退那一条——如果你的负载是短输入、低输出、对首 token 延迟敏感,先压测再上。
一、AI 产业与论文热点
论文:ResNet(Deep Residual Learning for Image Recognition)
- 一句话定位:用跳连 + 残差学习把网络深度从 22 层推到 152+ 层,解决梯度消失与退化问题,引用量 >20 万。
- 核心思想三条:① 学残差
F(x) = H(x) − x而不是直接学H(x)——当F → 0时网络退化成恒等映射,这保证了「加深不会变差」;② 跳连不需要任何额外参数;③ Bottleneck 1×1 降维让 152 层的计算量反而比 VGG-19 更少。 - 影响:催生了 ResNeXt / SENet / EfficientNet / ConvNeXt 一整条脉络。更关键的是跳连思想跨域迁移——Transformer 的残差连接、Diffusion 的 U-Net、VLA 的视觉编码器,全都有它的影子。没有残差跳连就没有今天可训练的深度视觉-动作模型。 在一个人人谈 MoE、谈稀疏注意力的年份,回看 ResNet 的价值在于:它证明了「一个足够简单的结构性改动」比堆参数更能改变上限。
算子:DeepNorm(GLM 深层稳定训练)
- 定位:让 Transformer 能训到 1000 层,通过 α > 1 放大残差路径使深层梯度稳定。
- 关键公式:
DeepNorm(x) = LayerNorm(α·x + SubLayer(x)),其中α = (2N)^(1/4),另有β = (3M²)^(−1/4)缩放初始化。 - 在用模型:GLM-130B / GLM-4 / GLM-5(智谱,100+ 层标配);DeepSeek V4(残差放大思想相通);Qwen3(走 Pre-LN 路线,但 Warmup 策略有它的影子)。
- 三个关键点:① 零额外参数,只靠 α / β 两个缩放因子;② Pre-LN 模型不需要它——别照抄;③ β 只缩放 V/O 和 FFN 的第二层 linear,不缩 Q/K,这个细节做错会直接训崩。
性能优化:梯度检查点(Gradient Checkpointing / 激活重计算)
- 定位:训练时激活值占显存 60~80%,用「计算换显存」——前向只保存部分层的激活,反向时重算其余层。
- 机制:每隔 √N 层保存一个 checkpoint,显存从
O(N·d²)降到O(√N·d²),即 1/√N,代价是计算量 +33%。 - 代表工作:PyTorch
torch.utils.checkpoint(7B 从 8×A100 降到 4×A100);Megatron Selective Recomputation(省 70% 显存、只多 10~15% 计算,是 GPT-3 175B 的标配);DeepSeek V4(梯度检查点 + FP8 + ZeRO-3,284B 在 256×H200 上训练)。 - 对具身的意义:显存省 √N 倍直接降低了大模型训练的准入门槛,VLA 7B 微调单卡可行——这对做机器人垂域微调的小团队是决定性的。
产业速递
- 宇树科技(688836):上市 3 日,首日 +460% 收 845 元,今日报 675.89 元(−1.62%),3 日累计 +348%,主力净流入 21.95 亿全市场第一。利好供应链 688017 / 002050 / 601689。
- 优必选(09880.HK):WRC 展示全栈工业方案,宣布与西门子合建首个万台产能超级工厂 8 月投产,VLA 端侧推理 +176%。但市值约 430 亿 HKD vs 宇树 3400 亿 RMB,存在估值修复空间。
- 北京人形创新中心:WRC 发布 Pelican-Unify 大一统具身世界模型 + 天工 Omni 机器人,6 国 20+ 企业签约「开物生态」。
- GLM 5.3 发布(8/18):LMArena 得分 83,1M 上下文——这正是上文 DeepNorm 算子的直接产物。国产开源模型全球调用量 DeepSeek + Qwen > 63.5%。
- 南京大学「光语芯」:国际首创超低功耗智能视觉传感器芯片,光信号直接转 Token,不经模数转换,能效 >10× 提升。若能量产,可能颠覆端侧视觉感知链路。
- 产业整体:工信部数据,2025 年机器人产业营收破 3000 亿(5 年 CAGR +20%),2026H1 达 1655 亿(+24.5%);全球人形出货 1.91 万台,中国占 97%。
二、vLLM & SGLang 社区跟踪
近 72 小时三方均无新版本 tag(vLLM v0.27.1 / SGLang v0.5.17)。
vLLM
- #48915(新特性,重点):新增
--per-request-spec-decode-metrics summary|detailed,让响应的metrics.speculative_decoding返回逐请求的mean_acceptance_length/acceptance_histogram/draft_acceptance_rate。这条的价值被低估了。 此前投机解码一旦收益不及预期,你只能拿到一个全服务平均值,无法区分是「所有请求接受率都偏低」还是「某一类流量把平均值拉下去了」。有了逐请求直方图,就能按流量分桶定位——比如长输出的 Agent 流量和短输出的分类流量混跑时,两者的接受率可能差一倍,而过去这个事实是隐藏的。这是从「怀疑接受率下降」到「测量接受率下降」的分水岭。
- #52998(默认值变更):TP CUDA 组默认启用 FlashInfer all-reduce;
VLLM_ALLREDUCE_USE_FLASHINFER=0可退出,VLLM_BATCH_INVARIANT=1会强制排除。跟 main 的必须核对启动日志里实际选中的通信后端——默认值变更最危险的地方在于你以为没变。
- #52466:Mooncake Store 消费端新增
save_decode_cache,decode 期的 KV 也进共享 Store;#51777:nixl 升到 1.3.2;#51362:修稀疏 Mamba block table 保存。多轮 / Agent 负载跨实例续接不必重算。
SGLang
- #27770(PD 分离):SWA 混合模型 decode 侧 radix 缓存(统一 radix 树)——全注意力 KV 跨轮复用,SWA 只传新鲜窗口,减少重复的 P/D KV 传输。注意与 HiCache / Mamba / DSA 互斥。
- #33370(PD 路由,大改动):进程内 KV Indexer + Router 集成(42 文件 +6605)。链路是 worker ZMQ → bridge → gRPC → indexer →
MatchExternalKvPrefix→ sgl-router,去掉了 Redis / Dragonfly 外部依赖。设计上有个值得抄的点:indexer 故障只损失缓存亲和性,不影响可用性——降级路径是明确的,而不是整体不可用。 - #35496(投机解码):DFlash2 selector 支持量化 target lm_head(改走
quant_method.apply+ padded 尾部掩 −inf,规避 flashinfer radix top-k 的CHECK_INPUT失败与 TP>1 挂起)。影响:32GB 卡跑 Qwen3.8-27B 量化权重终于能开 DFlash2 了。但需从 main 构建,发行版里还没有。
- #32340(AMD 性能):见上文 ★。另:#29525 DeepEPv2 ElasticBuffer A2A 后端 08-19 合入后 2 小时 20 分即被 #35568 回滚——通信层改动的风险密度可见一斑。
常驻专题:Step 适配(本期首次出现实质进展)
vLLM #53174(08-20T23:13 开,仍 open) 同时修 Step-3.5 MTP 启动崩溃与 reasoning parser,这是跟踪以来 Step 方向的第一个实质动作。更重要的是它首次给出了量化证据:
只修 MTP、不修 parser 时,Step-3.5-Flash-FP8 在
tool_choice: required下 50 个请求只有 18 次(36%)返回合法 tool call,30 次是no_tool_call_empty。
这个数字说明什么:Step 模型在 vLLM 上的问题不只是「启动崩溃」这种显性问题,还有「能跑但 64% 的请求不按格式返回」这种静默功能缺失。只盯着 MTP 草稿头的人会完全漏掉这半边。
耦合代价也首次被讲清楚:Transformers v5 要求 layer_types 长度等于 num_hidden_layers,而 Step-3.5-Flash 是 48 vs 45(多出 3 个 MTP 尾层);此前 #38247 为了过校验直接裁剪,导致 MTP 层索引 layer_types[num_hidden_layers+i] 启动即 IndexError。 #53174 改为「裁剪只在 super().__init__() 校验时生效,之后恢复 45+3」。
其余 Step PR 全 open(vLLM #52115 / #49490 / #40070 / #49642,SGLang #35206 / #32325)。StepFun-ai org 仅 Step-Realtime-CLI 08-20 有推送,Step-3.7-Flash 停 06-01、Step-3.5-Flash 停 04-03、官方 vllm fork 停 05-28,本窗口无新开源模型与官方部署指南更新。
方法论收获:模型定义向 transformers 靠拢求广度、数据面向自研靠拢求确定性,这个「分层非二选一」是对的——但分层接缝处(config 校验 / 词表 padding / 层类型表)正是故障高发地。Step 的崩溃不发生在任何一层的内部,就发生在缝上。
三、一句话结论
共享专家融合在同一天被 NVIDIA 与 AMD 两侧独立验证(BS=1 吞吐 +14.98% / TPOT −13.19%,MI355X +8~11%),收益曲线形状一致说明它来自固定 launch 与 HBM 往返开销的消除,是结构性而非偶然——B200/GB200 跑 DSv4 的今天就该加 --moe-backend deep_gemm_mega_moe;而 vLLM #48915 把逐请求接受率写进响应体,意味着投机解码终于从「全服务平均值玄学」进入「按流量分桶归因」的阶段,这两件事叠加,才是本周真正可执行的收益。
信息来源:vLLM v0.27.1 Release(2026-08-11);vLLM PR #53040 / #48915 / #52998 / #52466 / #51777 / #51362 / #53174 / #38247;SGLang PR #27770 / #33370 / #35496 / #32340 / #29525 / #35568;SGLang v0.5.17 Release(2026-08-08);GitHub commits API(vllm-project/vllm、sgl-project/sglang,since 2026-08-19T01:00:00Z);StepFun-ai org 仓库推送时间核对。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。