★ 今日最值得关注
不是 v0.28.0 本身,而是 main 自 08-27 起改掉的三个默认值。
版本号是最容易被盯上的东西,但真正改变你线上行为的往往是默认值。这一次有三处:
| 变更 | PR | 默认行为 | 你需要担心什么 |
|---|---|---|---|
| MRv2 对所有模型默认开启 | #53183 | 全模型走 Model Runner V2 | 覆盖面从”部分模型”扩到”全部模型”,回归范围要同步扩大 |
| Blackwell CUDA graph 捕获默认 1024 | #49390 | 捕获批大小上限 1024 | 显存占用上升,小显存卡需重算容量 |
| max_num_batched_tokens 8192 → 16384 | #51726 | 单批 token 上限翻倍 | 单卡 / 小显存配置可能直接 OOM |
为什么我把默认值排在版本收益前面:性能收益你不升级就享受不到,但默认值变更你不注意就会被动承受。 第三条的 max_num_batched_tokens 翻倍尤其典型——它能在吞吐上带来好处,但代价是激活显存峰值跟着涨,而很多团队的并发配置是照着老数字调出来的。
建议动作:如果你在跟进 main 而不是稳定 tag,现在就把
max_num_batched_tokens显式写回配置。隐式默认值只在”它不变”的时候才是便利,一旦它变了,就变成一个没有 changelog 的线上变更。
一、AI 产业与论文热点
论文:Octo(RSS 2024)—— 小模型通用机器人基座
Octo: An Open-Source Generalist Robot Policy,27M / 93M 两档参数,在 800k 条 Open X-Embodiment 轨迹上预训练。
两个关键设计:
- Readout Tokens:8 个只读的可学习 token 作为上下文摘要,下游 head 只看这 8 个 token。本质是输入输出解耦——主干处理多长的观测序列都行,head 的复杂度恒定。
- Action Chunking:一次预测 T_p = 64 步,但只执行前 T_a = 16 步就重新规划(receding horizon)。预测长远、执行保守、频繁修正。
它的意义:用通用 observation 序列化,把”特定本体、特定任务”的策略,变成”5 步微调就能接一个新本体”。这是 VLA 范式的开源利器——27M 参数的规模意味着单卡就能微调,门槛和 RT-1/π0 完全不在一个量级。
算子:Flow Matching —— 扩散的简化版
连续 ODE 速度场。核心极其简洁:
$$\frac{dx}{dt} = v_\theta(x_t, t), \quad \mathcal{L} = \mathbb{E}\lVert v_\theta(x_t, t) - (x_1 - x_0) \rVert^2$$
训练目标就是让网络去回归”从噪声到数据”的那个直线方向。
相对 DDPM 的优势:4–16 步 vs 100 步,实测 27× 加速 @ 2% 质量下降。SD3 / π0 / Octo-Flow 均已验证。
为什么它值得关注:扩散模型在机器人领域的主要障碍从来不是质量,而是推理步数。动作生成必须跑在控制频率上,100 步的 DDPM 在 50Hz 控制环里根本不现实。Flow Matching 把步数压到 4–16,这是让扩散路线在具身场景变得可用的那一步。
性能优化:分布式 RL 训练 —— RLHF 工程化
技术栈:Ray + vLLM/SGLang + DeepSpeed ZeRO-3 + LoRA broadcast。
架构要点:Actor / Rollout / Critic / Reference 多角色解耦,各自独立扩缩;LoRA broadcast 做到毫秒级同步,避免每轮全量权重分发。
效果:70B 模型的 RLHF 从 7 天压到 19 小时。
几个关键细节:
- GRPO:组内归一化 advantage,去掉 Critic,省一半显存。在大模型 RL 里 Critic 往往和 Actor 一样大,砍掉它是显存层面的结构性节省。
- DeepSeek V4 的 CANN-GRPO + FP8:670B 模型 RLHF 7 天 → 19 小时(3.55×)。
投资映射(具身智能主线下)
| 标的 | 性质 | 关键动作 |
|---|---|---|
| 小鹏鹏行 | 整机 | 9 亿美元首轮融资,估值 63 亿 |
| 智元 | 整机 | H1 出货 9,700 台 / 43%,全球第一 |
| 优必选 09880.HK | 整机 | Walker S2 进入 BYD / Foxconn / Airbus |
| 宇树 688836 | 整机 | 上市回撤,但仍为 A 股第一股锚 |
| 比亚迪 002594 | 整车 + 机器人 | 长沙工厂 150 台实训 |
| 无界动力 | 灵巧手 | A 轮 7 亿 + 单笔订单 7 亿 |
| 优艾智合 | 工业移动操作 | C+ 6 亿,半导体行业占比 38% |
当前主线判断:具身智能正在进入”训练时代”——RL 训练栈(OpenRLHF / veRL / AReaL)+ VLA 微调栈(Octo / OpenVLA)+ 世界模型栈(V-JEPA 2 / Genie / Cosmos)三者合流。这三者的共同底座是同一件事:分布式训练能力。它会成为新的护城河,而不是模型结构本身。
二、vLLM & SGLang 社区跟踪
vLLM v0.28.0(08-26)
性能提升 · Kimi-K3 全栈优化:
- DCP(#50484)
- 融合 FlashKDA(#50654 / #51311 / #52458)
- 合并 all-gather,1.5~3×(#51070)
- 共享专家分片,每卡省 ~17 GiB(#50912)
跑 K3 的团队升级即受益。
新特性 · 高并发投机解码防亏:
| PR | 内容 |
|---|---|
| #51725 | 自适应 DSpark 验证预算,K3 TTFT 改善 ~60% |
| #52816 | DFlash2 局部卷积候选选择器 |
| #48341 | 异步调度自动草稿 |
默认变更(见开头 ★ 部分):#53183 MRv2 全模型默认开、#49390 Blackwell CUDA graph 捕获默认 1024、#51726 max_num_batched_tokens 8192→16384。
原理:自适应 DSpark 验证预算(#51725)
把”每步验证多少草稿 token”从固定 k 改成按实时负载 / 接受率动态分配的自适应预算。
核心事实:固定 k 在高并发 GPU 饱和之后,验证开销 > 收益(c=256 慢 33%)。自适应之后:低并发 ±3%,高并发保住收益,K3 DSpark TTFT 改善 ~60%。
落地形态:开 DSpark 之后不用再手调 k,框架按接受率自己调预算。前提是 experimental 状态,且需要 v0.28.0+。
SGLang
| PR | 内容 | 影响 |
|---|---|---|
| #36288 | Mixed Chunk Prefill Base(1/N),重构 prefill / 混合批处理基座 | 为细粒度 prefill / decode 解耦打底 |
| #35451 | 全 prefill CUDA graph 支持 PP | 长上下文 prefill 提速 |
| #36160 | 统一 PD 控制面(mori) | PD 进”弹性路由”阶段 |
| #34608 | 负载感知路由,发布每调度器负载到专用 socket | PD 进”运维可观测”阶段 |
| #36518 / #36608 | GLM-5.3-Flash 进一等调优(cookbook + AMD MI300X/325X/355X 配方) | 国产模型一等公民 |
| — | LingBot-Video / cosmos3 扩散融合 | 多模态扩散 |
| #36547 | 修 DeepSeek-V4 多流 QKV 生命周期 | 正确性 |
| #36330 | 修 AMD Qwen3.5 MTP | 正确性 |
| #35275 | 修 spec adaptive 启动崩溃 | 起服即崩类问题 |
#36288 值得多说一句。Mixed Chunk Prefill Base 标注为 1/N,说明这是一个多阶段的基座重构,今天只是第一步。它的目标是细粒度的 prefill / decode 解耦——这件事 vLLM 那边通过 MRv2 在做,SGLang 从 prefill 侧切入。两边路径不同,但指向同一个问题:prefill 和 decode 的资源特征差异太大,混在同一个调度器里必然互相拖累。
常驻专题
PD 分离:vLLM v0.28.0 的分层 KV 卸载已成熟(磁盘 #49644 + 二级层 #51007 + 部分加载 #50321 + 指标 #48798),配合 E/P/D 解耦;SGLang main 则在做统一控制面(#36160)+ 负载感知路由(#34608)。
横向看:vLLM 侧重 KV 卸载分层,SGLang 侧重请求路由更聪明。前者在解决”数据放得下吗”,后者在解决”请求该去哪”。
PyTorch vs transformers:vLLM 继续把模型迁 Transformers 后端(MLA #48250 / 硬件无关模型定义 #49458)求广度,同时把 bitsandbytes 迁 OOT(#43529)做解耦;SGLang 无脱 transformers 的激进 PR。结论不变——分层收敛,代价是 Transformers 5.15.0 破坏性升级需要排期。
Step 适配:上游 PR 全 open(vLLM #49642 / #53174、SGLang #32325 / #35206),其中 #53174 于 08-26 更新(Step-3.5 MTP + 结构化输出)。但官方 vLLM recipe 现已给出 Step-3.7-Flash MTP-3 示例(基于 stepfun37 镜像),NVFP4 4 卡可跑。上游 v0.28.0 release notes 未列 Step 模型——生产部署仍靠 StepFun 镜像 / fork。
三、一句话结论
升级 v0.28.0 的收益清单(K3 省 ~17 GiB/卡、DSpark TTFT 改善 ~60%)是明面上的,但真正会咬人的是 main 上那三个被改掉的默认值——尤其是 max_num_batched_tokens 从 8192 翻倍到 16384,它能在你没改任何配置的情况下让小显存卡 OOM;跟 main 的团队现在就把它显式写回配置。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。