★ 今日最值得关注
vLLM 0.28 的自适应投机 token 预算:纯调度改动,零模型成本,DSpark TTFT 改善 55–65%。
这是本期最该进你待办的一条——因为它不花一分钱模型成本,只改调度逻辑,就能把 DSpark 的 TTFT 砍掉一半以上。
三层事实:
- 机制:不再给每步投机写死一个预算,而是按需分配——简单前缀少投、难前缀多投。
- 收益:DSpark TTFT 改善 55–65%,且不引入任何额外模型权重、不增加显存。
- 对比:在 vLLM 0.28 的 EAGLE / MTP 之外,这条”自适应预算”路线是三条投机解码路线里唯一零增量成本的一条。
可执行结论:如果你已经在跑 DSpark,升级 vLLM 0.28 后把自适应预算打开,TTFT 这层几乎免费拿到 55%+ 的改善;不用动模型、不用动硬件。
值得强调:投机解码的红利正在从”文本生成”外溢到更广的自回归场景(昨天的 Step-Audio RTF 已是信号)。自适应预算把”要不要投、投多少”交给运行时自己判断,是这条路线走向产品化的关键一步——它把加速从”调参艺术”变成了”默认行为”。
二、vLLM & SGLang 社区跟踪
版本状态:vLLM v0.28.0(8/26);SGLang v0.5.18(8/22)。近 72h 无新版本,但社区对两个引擎挖出了可落地的细节。
vLLM v0.28.0
新特性:
- 稀疏注意力端到端打通(DeepSeek-V4 / Kimi-K3)——长上下文不再是拼显存的 brute force。
- 自适应投机 token 预算 → DSpark TTFT 改善 55–65%(零模型成本,见 ★)。
- Model Runner V2:E/P/D 分离 + 权重卸载,把”调度”和”计算”进一步拆开。
- 分层 KV 卸载新增磁盘 tier,长上下文 Agent 冷会话不再永久占 HBM。
max_num_batched_tokens翻倍至 16384。
破坏性变更 / 默认值变更:max_num_batched_tokens 8192 → 16384,单卡 / 小显存配置可能 OOM,升级前务必重测容量。
SGLang v0.5.18
性能:
- 冷启动权重 staging:Qwen3-32B 从 84.8s → 35.6s 拉起(提速 ~2.4×)。
- DSpark 投机:383.7 tok/s @ V4-Pro TP8。
- PD 分离生产就绪:5×TP 部署。
原理:自适应投机预算为什么”零成本”
把投机解码的预算从”定值”改成”自适应”,省掉的是每次都要为最坏情况预留的冗余。
固定预算的代价:简单前缀(“你好""请继续”)也按难前缀的预算投,白白浪费草稿算力;难前缀又可能投不够,命中率上不去。自适应预算按实际难度动态分配,等于把”投机效率”交给运行时在线优化——这也是为什么它能做到零模型成本、只靠调度改进就拿到 55–65% 的 TTFT 改善。
我的判断:这条路线对”首 token 延迟敏感、但请求难度分布很不均”的线上场景(Agent、流式补全)价值最大。它不要求你换模型、不要求你加卡,是性价比最高的那一档加速。
常驻专题
PD 分离:Dynamo 1.0 / llm-d / Mooncake / NIXL 持续演进;SGLang 侧 DCP 解码上下文并行、FlashInfer all-to-all MoE 路由、DeepSeek-V4 FlashMLA 稀疏预填充默认开。
架构演进:投机解码三路线(EAGLE / MTP / 自适应预算,vLLM 自适应预算 DSpark TTFT 改善 55–65%)、稀疏 MLA、FP8/INT4/KV 量化、多模态。
纯 PyTorch vs transformers:本周期无”脱离 transformers 自研栈”的新 PR,依赖解耦趋势延续(vLLM 把 Transformers 升 5.15.0 + bitsandbytes 外置)。
Step 适配:
- Step-3.7-Flash 开源权重 + 官方 vLLM / SGLang 镜像已放出;NVFP4 跑 4 卡;MTP / EAGLE 投机;命中价 ¥0.27/M(Flash 主战场价格锚已下来)。
- 具体部署以 StepFun 官方仓库为准。
三、AI 论文与产业热点
今日重点(1 句)
Open X-Embodiment(RT-X)用 22 种机器人、100 万+ episodes 的跨本体数据 + 本体 embedding 条件化,证明机器人也服从「数据缩放定律」——这是「具身智能引擎」投资主线的技术底座。
论文核心(Open X-Embodiment / RT-X)
- 一句话定位:首个大规模跨本体联合训练、产出可迁移「机器人基础模型」的开源工作。
- 核心思想(3 行):① 22 种机器人数据统一进 OXE 数据集;② 每条样本打本体 embedding rₑ 作条件,同一套权重跨本体共享技能;③ RT-1-X 用 FiLM 调制、RT-2-X 把 rₑ 作 token 拼进 VLA。
- 影响:数据异构性 + 条件化 = 跨本体泛化(未见任务泛化 2–3×),直接支撑整机厂与零部件价值重估。
算子讲解:专家并行 EP
- 定位:MoE 专家切到不同 GPU,token 经 all-to-all 路由,解决单卡放不下 / 算不均。
- 在用模型:DeepSeek V4(EP 跨节点 + aux-loss-free bias)、Qwen3-MoE、MiniMax。
- 关键点:相比朴素实现,显存分摊 + 并行,瓶颈转 all-to-all 带宽;坑在负载不均与通信开销。
性能优化:自适应早退 Early-exit
- 定位:简单样本中间层退出头置信度 > τ 即退出,不必跑满 L 层。
- 代表工作:FastBERT / DeeBERT / CALM;收益 1.5–3× 算力 / 时延。
- 具身关联:VLA 简单观测早退 → 机器人响应时延降低。
产业热点(具身智能公司 / 产业链速递)
- 宇树科技(688836):8/19 科创板上市,9/2 收 547(-4.21%),较高点回撤 ~50%;战略配售含 DeepSeek(锁 36 月);H1 营收 11.52 亿(+48.5%)。映射:A 股人形估值锚。
- 智元机器人(控股上纬新材 688585):冲刺港股 IPO 估值 400–500 亿 HK,H1 出货 ~8000–9000 台。映射:688585 资本化平台。
- 地平线(09660.HK):征程 6M 量产上车(20+ 车企 / 70+ 车型 / 128TOPS 城区 NOA)。映射:智驾 + 机器人双主线。
- 优必选(09880.HK):H1 营收 12.7 亿(+104.2%),全尺寸人形 5.9 亿(+1445%),U1 订单 1.33 万台。
- 一般:Flash 模型主战场(DeepSeek V4 Flash / 智谱 GLM-5.3-Flash / 阿里 Qwen3.8-Flash / 腾讯 Hy4);智驾 VLA + 世界模型(地平线 6M / Momenta R7 / WorldVLA)。
四、一句话结论
vLLM 0.28 把稀疏注意力端到端打通、并用一条纯调度的自适应投机预算把 DSpark TTFT 免费砍掉 55–65%,是本期最该落地的加速;论文侧 RT-X 用 22 种机器人坐实跨本体数据缩放定律,把「具身智能引擎」从主题叙事拉到了有技术底座的投资主线——而宇树回撤 ~50%、智元冲港股、地平线量产上车,正在把这条主线逐个标上价格。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。