★ 今日最值得关注
周日非交易日,框架侧近 24h 无新正式版本:vLLM 仍守 v0.30.0 + v0.30.1rc0,SGLang 仍守 v0.5.20,但 SGLang main 分支密集重构(恢复逻辑内核组、MemCache 统一驱逐、sgl-router 只转发 built body、HiRadixCache→Unified Radix)预示 v0.5.21 将收口「缓存 + 路由」底座;最该盯的一条 PR 是 #38891——把 kv-hints 做成请求传输层信封,让 KV 亲和路由不再依赖外部旁路信号。阶跃 Step 5 Preview 距 10-15 开源约 18 天。
这其实是同一句话的两种写法:两个引擎都在把「缓存亲和 + PD 分离 + 弹性扩缩容」收成下一阶段主轴,差异只在发布节奏与默认化程度——vLLM 已经把 CVE 修复和 AMD NVFP4 量化都进了 0.30 稳定线,SGLang 则把底座重构闷在 main,等 v0.5.21 一次性收口。
三层事实:
- 版本是什么:vLLM 稳定仍为 v0.30.0(09-22,762 commits / 315 贡献者),发布线到 v0.30.1rc0(09-23,#58281 AMD MI355 致密 NVFP4);SGLang 稳定仍为 v0.5.20(09-18,713 PRs / 237 贡献者),无 v0.5.21,main 09-26 仍密集提交(累计 18,939 commits)。
- SGLang 在闷什么:#41243 恢复逻辑内核组重构、#41276 MemCache 统一组件驱逐游标与锁收据、sgl-router 仅对 built body 预定 input_ids 转发、#40787 移除 HiRadixCache→Unified Radix、#38891 kv-hints 信封进请求传输——缓存与路由底座在收口 + 加固,预计统一进 v0.5.21。
- Step 侧进度:Step 5 Preview(09-20,600B/27B 超稀疏 MoE、100 万上下文、AA 综合前三开源、单任务成本≈Claude Opus 5 的 1/8)完整权重 10-15 开源(约 18 天);社区已现 Step-5-Preview-BF16 权重(TypeSafeAI),可用
--trust-remote-code --reasoning-parser stepfun试跑,但归属与许可未确认;IPO 仍未见港交所公开招股书,媒体口径「已进入上市审批阶段」但公司未置评——不得写「已递表」。
可执行结论:SGLang 用户别追 main、等 v0.5.21(缓存/路由底座收口后再升);生产 PD 继续锚定 vLLM v0.30.0(CVE-2026-93436 修复所在线);想试 Step 5 Preview 等官方 10-15 开源做 day-0,社区 BF16 权重先小流量验证、别把自报数字当基准。
值得强调:SGLang 把 kv-hints 塞进请求信封,和今天 #40787 的「HiRadixCache→Unified Radix」是同一收口动作的两面——前者解决「路由决策去旁路化」,后者解决「前缀缓存单一真相源」。两者并进,等于把 PD 分离下最头疼的「缓存命中率 ↔ 亲和路由」耦合,从旁路信号时代推进到请求内联时代。这对本人的 OpenInfer / Qwen3-4B DFlash 也是同一收口逻辑:把能复用的状态(KV、draft)做成可透传、可对齐的单元,而不是靠外部旁路协调。
二、vLLM & SGLang 社区跟踪
版本状态:窗口内 vLLM 仍守 v0.30.0(09-22,762 commits / 315 贡献者)+ v0.30.1rc0(09-23)双线;SGLang 无新 release,最新稳定版仍为 v0.5.20(09-18,713 PRs / 237 贡献者),main 分支 09-26 仍密集提交(累计 18,939 commits),但无 v0.5.21 tag。
vLLM(v0.30.0 + v0.30.1rc0 · 无新正式版,安全与落地特性延续)
版本 / 安全状态(无新正式版):
- 版本:稳定仍 v0.30.0(09-22,762 commits / 315 贡献者);发布线到 v0.30.1rc0(09-23,#58281 AMD MI355 致密 NVFP4)——tags 自 09-23 无新 tag,AMD 用户可试 NVFP4 但仍属 RC。
- 安全延续:CVE-2026-93436(CVSS 8.7,PD 分离下被拒请求 decode 侧 KV metadata 未释放 → 内存耗尽 DoS)修复需 ≥0.29.1(仍仅 rc0 可用),生产 PD 务必升 0.30 线。
- 可落地特性回顾:v0.30.0 的 Fast Start(H200 引擎初始化 28.9s→8.2s)、HiSparse 主机驻留 KV 溢出、双键 Gumbel-max 水印、MRV2 图捕获冻结(12s→2s) → 零改动滚动重启降本 + 稀疏 MLA decode 显存缓解,本窗口无新改动但仍是该线最该落地的原语。
SGLang(v0.5.20 · main 密集重构,v0.5.21 收口缓存/路由底座)
社区开发 / 重构(近窗新增):
- 缓存/路由底座收口:#41243 恢复逻辑内核组重构(09-26)、#41276 MemCache 统一组件驱逐游标与锁收据(09-26)、sgl-router 仅对 built body 预定 input_ids 转发(09-26)、#40787 移除 HiRadixCache→Unified Radix(09-22)。
- kv-hints 信封:#38891 把「KV 命中线索」做成请求传输层信封(09-23,详见原理部分)。
- 模型/结构化:#39026 XGrammar V4.1 DSML 参数约束(09-21)→ Agent 工具调用 / 结构化输出更稳。
原理:SGLang PR #38891(kv-hints 信封进请求传输层)
本期最值得理解的一条技术解读。
机制:PR #38891(09-23)把「KV 命中线索(kv hint)」做成请求传输层信封(envelope)——请求携带前缀缓存位置 / 命中提示,沿 transport 透传。路由决策因此不再依赖外部旁路信号,能在 PD 分离、跨节点、弹性扩缩容下稳定做亲和路由。
直接影响:
- 前缀命中率↑ → TTFT↓ + prefill 计算成本↓,对多轮 / Agent / RAG 型负载收益最大。
- 非强一致性保证:需与 radix 索引、KV 事件发布配合,预计进 v0.5.21。
我的判断:把「缓存亲和」从旁路信号改成「请求内联信封」,是 PD 分离工程化里非常关键的一步。旁路信号的问题是——它和请求的因果链是松耦合的,扩缩容一频繁就漂移;内联信封让「这个请求该去哪个 prefiller」成为请求自身携带的、可校验的字段。SGLang 把它和 #40787 的 Unified Radix 一起推进,等于把「往哪路由」和「缓存真相源」两件事在同一代里对齐了。
常驻专题
PD 分离:vLLM 0.30 落 CVE-2026-93436 修复 + HiSparse;SGLang kv-hints 信封 #38891 + sgl-router cache_aware + Dynamo KV Router(x-prefiller-host-port);llm-d 把 PD 与前缀 / 负载感知调度组合。
架构演进:vLLM Fast Start + HiSparse + 双键水印 + MRV2 图捕获冻结;SGLang Unified Radix(分支点缓存 #34565)+ sampling masks + DSpark-under-PD + HiCache 收口(#40787)。
PyTorch vs transformers:无脱离 PR,边界重新分层延续(vLLM --model-impl transformers + SGLang Transformers 后备方案);模型定义层收敛 transformers,性能层留引擎 kernel。
Step 适配:Step-3.7-Flash 双框架部署成熟(vLLM stepfun37 + MTP > SGLang dev + EAGLE,NVFP4 4 卡);Step 5 Preview 10-15 开源、社区已现 BF16 权重、官方 day-0 待 10-15。
三、AI 论文与产业热点
今日重点(1 句)
DriveVLM 补齐智驾维度闭环:VLM 慢思考做认知锚点、快规划器高频兜底的双系统范式,一年内被 Helix/GR00T/小鹏/理想集体继承;算子侧 Rectified Flow 把生成直线化到 1 步、Tensor Parallel 深挖给出车端双芯跑 VLA 的切分基线。
论文核心(DriveVLM · 清华×中科院自动化所「天工」,arXiv:2402.12289,2024-02)
- 一句话定位:首个把 VLM 慢思考装进智驾闭环、并提出 System1/System2 双系统的开山作——把「认知」和「执行」解耦成两条频率不同的系统。
- 核心思想:五段式 CoT(场景描述 → 关键目标 3D 框 → 驾驶意图 → 元动作离散字典 → 轨迹 waypoints),元动作把自由发挥收敛到有限决策类别,可解释可约束;视觉-语言对齐模块用 3D 感知特征补 VLM 空间短板。
- 影响确认:EMMA(全文本化单模型,研究上限) vs DriveVLM-Dual(CoT 锚点 + 快系统兜底,量产架构) vs Helix(潜向量,机器人整机)三范式对照;量产智驾 VLA 均为其工程化放大版——今天小鹏 / 理想的 VLA 量产架构,骨子里是这套双系统的放大。
算子讲解:Rectified Flow(整流流,Liu et al., ICLR 2023)
- 定位:直线插值 x_t=(1−t)x₀+t·x₁、速度 u=x₁−x₀、MSE 回归;reflow 迭代直线化 → 1 步生成。
- 在用模型:SD3 / FLUX(logit-normal t)作图像生成;π0 / π0.5 / GR00T N2 把动作头接在整流流上作机器人策略。
- 与 Flow Matching 的区别:Flow Matching 是「传输框架」(给任意概率路径配速度场),Rectified Flow 是「传输几何视角」(取直线路径、用 reflow 逼直)——机器人侧 10 步 → 1-2 步 = 控频 5Hz → 30Hz+,直接拉升闭环响应。
性能优化:Tensor Parallel 深挖(Megatron-LM)
- 定位:列并行零通信 + 行并行 AllReduce,f/g 共轭算子每层前向 2 次 AllReduce(≈
2(p−1)/p·b·s·h字节)。 - 约束:TP≤8 且 ≤ head 数、只放 NVLink 单机内;TP8 显存 ÷8 近线性。
- 具身关联:车端双芯 TP2 跑 VLA(小鹏双图灵 / Thor)——把「注意力并行」的切分基线直接搬进车端双 Orin/Thor 的板级互联。
产业热点(具身公司 / 产业链速递 · 置顶)
- 【具身】特斯拉 Optimus:Gen3 定型 + 长三角审厂收官(周产 500+→9 月底 1000→年底 2000-2500 台/周,2026 约 5 万台)→ 利好 拓普 601689 / 三花 002050 / 均胜 600699 / 绿的 688017 / 机器人 ETF 562500。
- 【具身】智元机器人:第 20000 台 交付长隆 + 300 台乐园常态运营;银河通用宁德时代 7×24 超 3 个月常态化作业;至简动力百台交付落地绿的谐波、东山精密产线;大摩二连升中国人形 2026 预测至 5 万台。
- 【通用】大模型价格战:V4.1 Flash / MiMo-V2.6 / Opus 5.5 / GPT-6 Luna 集体压价(智谱市值回落 3000 亿港元);小鹏二代 VLA 推送 MONA(响应 +300%、720B 蒸馏至 508TOPS);DrivingBench 实测通用大模型直开每公里近 40 元 → VLA 专用架构是正解;Waymo World Model(Genie 3)极端场景仿真。
⚠️ 产业动态不构成投资建议。
四、一句话结论
周日非交易日,框架侧近 24h 无新正式版本:vLLM 仍守 v0.30.0 + v0.30.1rc0(CVE-2026-93436 修复在 0.30 线,生产 PD 务必升),SGLang 仍守 v0.5.20 但 main 密集重构(#41243/#41276/#40787/#38891)预示 v0.5.21 收口「缓存 + 路由」底座;最该盯的 PR #38891 把 kv-hints 做成请求传输层信封,让 PD 分离下亲和路由不再依赖外部旁路信号。阶跃 Step 5 Preview 距 10-15 开源约 18 天,社区已现 BF16 权重但归属未确认。论文侧 DriveVLM 把 VLM 慢思考 + 快规划器双系统装进智驾闭环(五段式 CoT + 元动作),一年内被 Helix/GR00T/小鹏/理想集体继承;算子 Rectified Flow 直线化到 1 步、Tensor Parallel 深挖给出车端双芯跑 VLA 的切分基线;产业侧特斯拉 Optimus Gen3 定型 + 长三角审厂收官、智元第 2 万台交付长隆、大摩二连升中国人形 2026 预测至 5 万台——具身「补脑 + 落地」继续逐一标价。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。