系列:每日AI热点

每日AI热点 · 2026-08-27:vLLM v0.28.0 发布(584 commits),K3 全栈推性能、DSV4 稀疏 MLA 端到端、DFlash2 进稳定版

★ 今日最值得关注

vLLM v0.28.0 正式发布(2026-08-26,584 commits / 270 贡献者)。

这是本期绝对的主线事件。它不是一个”修修补补”的版本,而是把两条最有分量的技术线一次性推到生产可用:

第一条,Kimi-K3 的系统级性能推进。 四个提交叠起来是一套组合拳:

PR内容效果
#50484DCP 解码上下文并行长上下文 decode 扩展
#51070合并 all-gather1.5~3× 内核加速
#50912共享专家分片(而非复制)每卡省 ~17 GiB
#51725自适应 DSpark 预算K3 DSpark TTFT 改善 ~60%

单独看每一项都只是”优化”,叠起来就是 K3 在长上下文 + 高并发下吞吐与时延的量级改善。特别是 #50912 的 ~17 GiB/卡——这直接改变了 K3 的可部署性:省下来的显存可以换成更大的并发或更长的上下文,而不是拿去复制共享专家。

第二条,DeepSeek V4 稀疏 MLA 端到端打通(#51538),覆盖 plain / MTP / DSpark 三种模式。配合 DFlash2(#52816)进稳定版,意味着 vLLM 的投机解码栈在这一版完成了收敛。

为什么说 #51725 值得单独理解:DSpark 按置信度 cumprod 排序选前缀、EMA 平滑、varlen CUDA graph 验证。核心洞察是——固定 k 草稿在高并发 GPU 饱和之后,验证开销大于收益(08-13 实测 c=256 固定 7 草稿慢 33%)。#51725 把它改成逐请求自适应预算,于是 K3 的 DSpark TTFT 改善约 60%。升级 v0.28.0 即享,无需任何业务改动。

一、AI 产业与论文热点

论文:DALL·E 2(Ramesh et al., OpenAI, 2022)

层级式文本条件图像生成。它最关键的贡献是把”语义对齐”和”像素重建”拆成两步,中间用 CLIP 潜空间做桥:

  1. Prior:把 CLIP 文本嵌入 $z_t$ 映射到图像嵌入 $z_i$。这一步只管语义对齐。
  2. Decoder(GLIDE + CFG):从 $z_i$ 扩散生成图像。这一步只管像素质量。
  3. 上采样器扩展到 $1024^2$。

附带能力:图像变体生成,以及潜空间插值。

影响:它验证了”共享潜空间 + 条件扩散”这条路线是正确的,直接催生了 Stable Diffusion。今天回头看,两级解耦几乎是所有文生图系统的默认结构。

算子:MTP(Multi-Token Prediction,DeepSeek V3/V4)

在主干 Transformer 顶部叠加 k 个轻量预测头,同时预测未来 k 个 token,损失加权 λ = 0.3。

推理时这些头天然就是草稿模型,accept 率极高,整体降低 10–20% 时延。在用模型:DeepSeek V3 / V4、Qwen3。落到具身场景:VLA 的实时控制频率提升约 15%。

MTP 的巧妙之处在于:训练时顺手训出来的东西,推理时正好能用上。它不需要额外的草稿模型、不需要额外的对齐训练,代价只是训练期 k 个头的那点算力。这是本期最”划算”的设计。

性能优化:长上下文流式与分块策略

三件套组合拳:

效果:128K 上下文显存从 80GB 降到 12GB。vLLM / SGLang / DeepSeek V4 均已部署。

Attention Sink 那一条容易被忽略但很关键——大量注意力分数会汇聚到序列开头的少数 token 上,一旦把它们滑出窗口,模型行为会明显退化。固定保留前 4 个 token,成本几乎为零,收益是稳定性。

端侧 VLA 的意义:这是视频流能够实时跑起来的前提。

产业热点

  1. 英伟达:Q2 营收 962 亿美元,同比 +106%;Q3 指引 1080 亿美元;CFO 给出 2028 财年再增 70% 的罕见长期展望。→ 算力需求真实且仍在加速。
  2. 智谱 GLM-5.3-Flash 开源:首次跑在 10 万张国产芯片集群上,定价仅为 Opus 4.8 的 1/40。→ 国产算力全栈拼图加速补全。
  3. OpenAI 自研推理芯片 Jalapeño 亮相 Hot Chips:每瓦吞吐达英伟达 GB300 的 1.5–1.9 倍。→ 推理芯片格局走向群雄割据。
  4. 《道路交通安全法》修订草案首设”自动驾驶专章”:激活状态下违法由车企担责。→ L3+ 商业化的权责边界终于明确。
  5. 阿里 Qwen3.8-Flash 开源:125B MoE 仅激活 6B,1M 长上下文提速 8 倍+,训练成本降 90%。→ 中国 AI 从规模竞赛转向效率竞赛。
  6. Meta MTIA 400 生成式 AI 加速器发布:3nm 双芯粒,12 petaFLOPS。→ 自研芯片从备选项变成必选项。

具身智能速递

公司状态说明
宇树(688836)中性上市 7 日股价从 1100 元回落至 586 元,估值修正中,全板块估值锚
智元(赴港 IPO)利好目标估值 400–500 亿港元,2025 年全球出货第一(39%),映射 688585
小鹏鹏行利好超 9 亿美元首轮融资,估值 63 亿美元,腾讯 / 阿里入局,映射 09868.HK
天工 Ultra利好百米 8.64 秒破人类纪录,运动控制产业链
小米(01810.HK)利好玄戒三芯齐发,全栈自研,端侧 AI + 智驾 + 机器人协同

产业侧今天最该记的是英伟达那条 2028 财年再增 70% 的展望。CFO 给出三年期的量化指引在半导体行业极其罕见——这通常意味着订单可见度已经排到了那个位置,而不是对需求的乐观猜测。

二、vLLM & SGLang 社区跟踪

vLLM v0.28.0(08-26)

版本发布:584 commits / 270 贡献者。

性能提升(Kimi-K3 系统级,详见开头表格)。

新特性:

架构演进 / 破坏性变更(这一栏升级前必读):

⚠️ 对部署的影响:这是环境级 + 依赖级双变更。bitsandbytes 不再随核心分发,意味着量化路径要单独装;Transformers 5.15.0 是大版本跃迁,自定义模型定义大概率要改。建议按「重建镜像 → 冒烟 → 精度回归 → 灰度」排期,不要原地 pip install -U vllm。

SGLang(仍 v0.5.18,08-22,710 PR)

近 72h 无新 tag,但 main 在 08-26 / 08-27 高频提交。

PR内容影响
#33561支持 Ling-3.0-flash(BailingMoeV3,百川新旗舰 MoE)国产 MoE 进一等支持
#31626Beam search 支持补齐非采样解码路径
#36233CUDA 13.4 容器初探 Rubin(sm_107)面向下一代硬件铺垫
#36397custom all-reduce v2 调优通信内核打磨
#35379泛化混合 SWA MTP 草稿池路由混合架构投机解码
#33871减少 breakable prefill CUDA graph 空闲 DP 工作削减空转
#35640跨 DP-attn rank 协调 FullCG prefillPD + 投机打磨

常驻专题:两条 PD 分离路线正在分化

维度vLLM(v0.28.0)SGLang(main)
本期动作E/P/D 分离、分级 KV 卸载到磁盘、CPU 规范布局跨 DP-attn 协调 FullCG prefill、拆 custom all-reduce 为 push/pull planes、权重缓存 daemon 路径可配
技术取向资源解耦 + 外部存储协议 / 拓扑对齐 + 运维可观测

两家的分歧很清楚:vLLM 在问”KV 能放到多远的地方”,SGLang 在问”请求该怎么走”。前者扩展容量边界,后者提升调度智能。长期看这两条路会汇合——容量变大之后,路由决策必然要考虑数据在哪一层。

PyTorch vs transformers:vLLM v0.28.0 升 Transformers 5.15.0(双后端收敛,求 day-N 广度);SGLang 维持自研运行时(Rust server、自管 kernel 栈)。本期无”脱 transformers 自研”PR。结论不变:模型定义向 transformers 收敛求广度,数据面 / 运行时向自研收敛求确定性——分层,不是二选一。

Step 适配:连续多日无新模型(Step-3.7-Flash 06-01 / 328★、Step-3.5-Flash 04-03 / 2070★、vllm fork 05-28)。vLLM #49642 / #49490 / #52115 / #53174 与 SGLang #32325(实测仍 open,2026-07-24 起未动)/ #35206 的 Step MTP PR 全部 open;v0.28.0 与 v0.5.18 的官方 notes 均无 Step 条目。

结论:Step 仍只能靠预建镜像吃加速——vLLM 用 vllm/vllm-openai:stepfun37 + MTP config,SGLang 用 dev-step-3.7-flash + EAGLE。全量 MTP 合入主干尚未完成,上游维护投入相对滞后。

三、一句话结论

v0.28.0 是本季度最值得排期升级的一个版本——K3 全栈省下 ~17 GiB/卡、DSV4 稀疏 MLA 端到端、DFlash2 进稳定,且大部分收益(如自适应 DSpark 让 TTFT 改善 ~60%)不需要改任何业务代码;但请把它当成一次环境级变更来对待:bitsandbytes 已外置、Transformers 已升 5.15.0,原地 pip install -U 大概率会让你在半夜接到电话。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。