★ 今日最值得关注
vLLM v0.28.0 正式发布(2026-08-26,584 commits / 270 贡献者)。
这是本期绝对的主线事件。它不是一个”修修补补”的版本,而是把两条最有分量的技术线一次性推到生产可用:
第一条,Kimi-K3 的系统级性能推进。 四个提交叠起来是一套组合拳:
| PR | 内容 | 效果 |
|---|---|---|
| #50484 | DCP 解码上下文并行 | 长上下文 decode 扩展 |
| #51070 | 合并 all-gather | 1.5~3× 内核加速 |
| #50912 | 共享专家分片(而非复制) | 每卡省 ~17 GiB |
| #51725 | 自适应 DSpark 预算 | K3 DSpark TTFT 改善 ~60% |
单独看每一项都只是”优化”,叠起来就是 K3 在长上下文 + 高并发下吞吐与时延的量级改善。特别是 #50912 的 ~17 GiB/卡——这直接改变了 K3 的可部署性:省下来的显存可以换成更大的并发或更长的上下文,而不是拿去复制共享专家。
第二条,DeepSeek V4 稀疏 MLA 端到端打通(#51538),覆盖 plain / MTP / DSpark 三种模式。配合 DFlash2(#52816)进稳定版,意味着 vLLM 的投机解码栈在这一版完成了收敛。
为什么说 #51725 值得单独理解:DSpark 按置信度
cumprod排序选前缀、EMA 平滑、varlen CUDA graph 验证。核心洞察是——固定 k 草稿在高并发 GPU 饱和之后,验证开销大于收益(08-13 实测 c=256 固定 7 草稿慢 33%)。#51725 把它改成逐请求自适应预算,于是 K3 的 DSpark TTFT 改善约 60%。升级 v0.28.0 即享,无需任何业务改动。
一、AI 产业与论文热点
论文:DALL·E 2(Ramesh et al., OpenAI, 2022)
层级式文本条件图像生成。它最关键的贡献是把”语义对齐”和”像素重建”拆成两步,中间用 CLIP 潜空间做桥:
- Prior:把 CLIP 文本嵌入 $z_t$ 映射到图像嵌入 $z_i$。这一步只管语义对齐。
- Decoder(GLIDE + CFG):从 $z_i$ 扩散生成图像。这一步只管像素质量。
- 上采样器扩展到 $1024^2$。
附带能力:图像变体生成,以及潜空间插值。
影响:它验证了”共享潜空间 + 条件扩散”这条路线是正确的,直接催生了 Stable Diffusion。今天回头看,两级解耦几乎是所有文生图系统的默认结构。
算子:MTP(Multi-Token Prediction,DeepSeek V3/V4)
在主干 Transformer 顶部叠加 k 个轻量预测头,同时预测未来 k 个 token,损失加权 λ = 0.3。
推理时这些头天然就是草稿模型,accept 率极高,整体降低 10–20% 时延。在用模型:DeepSeek V3 / V4、Qwen3。落到具身场景:VLA 的实时控制频率提升约 15%。
MTP 的巧妙之处在于:训练时顺手训出来的东西,推理时正好能用上。它不需要额外的草稿模型、不需要额外的对齐训练,代价只是训练期 k 个头的那点算力。这是本期最”划算”的设计。
性能优化:长上下文流式与分块策略
三件套组合拳:
- Chunked Prefill:在线 softmax 保证分块与全量 prefill 数学等价。
- Streaming KV:只保留最近窗口,丢弃中间。
- Attention Sink:固定保留最前 4 个 token。
效果:128K 上下文显存从 80GB 降到 12GB。vLLM / SGLang / DeepSeek V4 均已部署。
Attention Sink 那一条容易被忽略但很关键——大量注意力分数会汇聚到序列开头的少数 token 上,一旦把它们滑出窗口,模型行为会明显退化。固定保留前 4 个 token,成本几乎为零,收益是稳定性。
端侧 VLA 的意义:这是视频流能够实时跑起来的前提。
产业热点
- 英伟达:Q2 营收 962 亿美元,同比 +106%;Q3 指引 1080 亿美元;CFO 给出 2028 财年再增 70% 的罕见长期展望。→ 算力需求真实且仍在加速。
- 智谱 GLM-5.3-Flash 开源:首次跑在 10 万张国产芯片集群上,定价仅为 Opus 4.8 的 1/40。→ 国产算力全栈拼图加速补全。
- OpenAI 自研推理芯片 Jalapeño 亮相 Hot Chips:每瓦吞吐达英伟达 GB300 的 1.5–1.9 倍。→ 推理芯片格局走向群雄割据。
- 《道路交通安全法》修订草案首设”自动驾驶专章”:激活状态下违法由车企担责。→ L3+ 商业化的权责边界终于明确。
- 阿里 Qwen3.8-Flash 开源:125B MoE 仅激活 6B,1M 长上下文提速 8 倍+,训练成本降 90%。→ 中国 AI 从规模竞赛转向效率竞赛。
- Meta MTIA 400 生成式 AI 加速器发布:3nm 双芯粒,12 petaFLOPS。→ 自研芯片从备选项变成必选项。
具身智能速递
| 公司 | 状态 | 说明 |
|---|---|---|
| 宇树(688836) | 中性 | 上市 7 日股价从 1100 元回落至 586 元,估值修正中,全板块估值锚 |
| 智元(赴港 IPO) | 利好 | 目标估值 400–500 亿港元,2025 年全球出货第一(39%),映射 688585 |
| 小鹏鹏行 | 利好 | 超 9 亿美元首轮融资,估值 63 亿美元,腾讯 / 阿里入局,映射 09868.HK |
| 天工 Ultra | 利好 | 百米 8.64 秒破人类纪录,运动控制产业链 |
| 小米(01810.HK) | 利好 | 玄戒三芯齐发,全栈自研,端侧 AI + 智驾 + 机器人协同 |
产业侧今天最该记的是英伟达那条 2028 财年再增 70% 的展望。CFO 给出三年期的量化指引在半导体行业极其罕见——这通常意味着订单可见度已经排到了那个位置,而不是对需求的乐观猜测。
二、vLLM & SGLang 社区跟踪
vLLM v0.28.0(08-26)
版本发布:584 commits / 270 贡献者。
性能提升(Kimi-K3 系统级,详见开头表格)。
新特性:
- DeepSeek V4 稀疏 MLA 端到端(#51538):plain / MTP / DSpark 三模式。
- AMD Quark NVFP4(#47972)+ ROCm gfx11 / gfx950(#47017 / #52212)。→ DSV4 推理栈收敛,AMD 卡可用。
架构演进 / 破坏性变更(这一栏升级前必读):
- MRv2 成熟:E/P/D 分离(#38390)、权重卸载(#51413)、多层 MTP KV(#50062)。
- 分级 KV 卸载到磁盘(#49644)。
- bitsandbytes 迁出为 OOT 插件(#43529)。
- Transformers 升 5.15.0(#51668)。
⚠️ 对部署的影响:这是环境级 + 依赖级双变更。
bitsandbytes不再随核心分发,意味着量化路径要单独装;Transformers 5.15.0 是大版本跃迁,自定义模型定义大概率要改。建议按「重建镜像 → 冒烟 → 精度回归 → 灰度」排期,不要原地pip install -U vllm。
SGLang(仍 v0.5.18,08-22,710 PR)
近 72h 无新 tag,但 main 在 08-26 / 08-27 高频提交。
| PR | 内容 | 影响 |
|---|---|---|
| #33561 | 支持 Ling-3.0-flash(BailingMoeV3,百川新旗舰 MoE) | 国产 MoE 进一等支持 |
| #31626 | Beam search 支持 | 补齐非采样解码路径 |
| #36233 | CUDA 13.4 容器初探 Rubin(sm_107) | 面向下一代硬件铺垫 |
| #36397 | custom all-reduce v2 调优 | 通信内核打磨 |
| #35379 | 泛化混合 SWA MTP 草稿池路由 | 混合架构投机解码 |
| #33871 | 减少 breakable prefill CUDA graph 空闲 DP 工作 | 削减空转 |
| #35640 | 跨 DP-attn rank 协调 FullCG prefill | PD + 投机打磨 |
常驻专题:两条 PD 分离路线正在分化
| 维度 | vLLM(v0.28.0) | SGLang(main) |
|---|---|---|
| 本期动作 | E/P/D 分离、分级 KV 卸载到磁盘、CPU 规范布局 | 跨 DP-attn 协调 FullCG prefill、拆 custom all-reduce 为 push/pull planes、权重缓存 daemon 路径可配 |
| 技术取向 | 资源解耦 + 外部存储 | 协议 / 拓扑对齐 + 运维可观测 |
两家的分歧很清楚:vLLM 在问”KV 能放到多远的地方”,SGLang 在问”请求该怎么走”。前者扩展容量边界,后者提升调度智能。长期看这两条路会汇合——容量变大之后,路由决策必然要考虑数据在哪一层。
PyTorch vs transformers:vLLM v0.28.0 升 Transformers 5.15.0(双后端收敛,求 day-N 广度);SGLang 维持自研运行时(Rust server、自管 kernel 栈)。本期无”脱 transformers 自研”PR。结论不变:模型定义向 transformers 收敛求广度,数据面 / 运行时向自研收敛求确定性——分层,不是二选一。
Step 适配:连续多日无新模型(Step-3.7-Flash 06-01 / 328★、Step-3.5-Flash 04-03 / 2070★、vllm fork 05-28)。vLLM #49642 / #49490 / #52115 / #53174 与 SGLang #32325(实测仍 open,2026-07-24 起未动)/ #35206 的 Step MTP PR 全部 open;v0.28.0 与 v0.5.18 的官方 notes 均无 Step 条目。
结论:Step 仍只能靠预建镜像吃加速——vLLM 用 vllm/vllm-openai:stepfun37 + MTP config,SGLang 用 dev-step-3.7-flash + EAGLE。全量 MTP 合入主干尚未完成,上游维护投入相对滞后。
三、一句话结论
v0.28.0 是本季度最值得排期升级的一个版本——K3 全栈省下 ~17 GiB/卡、DSV4 稀疏 MLA 端到端、DFlash2 进稳定,且大部分收益(如自适应 DSpark 让 TTFT 改善 ~60%)不需要改任何业务代码;但请把它当成一次环境级变更来对待:bitsandbytes 已外置、Transformers 已升 5.15.0,原地 pip install -U 大概率会让你在半夜接到电话。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。