每日AI热点 · 全部 27 期
系列 · 共 27 篇(持续更新),把每天 vLLM / SGLang 上游、国产模型适配、投机解码与推理优化的一线进展,做成「同一天同框 / 谁在掉队」的时效笔记,补足框架解码手记偏原理、少时效的部分,每篇附英文对照。
- 每日AI热点 · 2026-09-27:周日无新正式版本,SGLang main 收口缓存/路由底座、kv-hints 信封进传输层;DriveVLM 把 VLM 慢思考装进智驾闭环2026-09-27T00:00:00.000Z
- 每日AI热点 · 2026-09-26:vLLM 守 v0.30.0 并切 v0.30.1rc0(补 AMD MI355 NVFP4);Step-5-Preview-BF16 权重低调现 HF 成窗口最值关注国产推理进展;MAE 奠基自监督视觉前端2026-09-26T00:00:00.000Z
- 每日AI热点 · 2026-09-25:vLLM v0.30.0 年度大版本发布(762 commits、Fast Start 持久化权重缓存 + HiSparse 主机 KV 溢出,CVE-2026-93436 修复落地);DINOv3 7B 冻结视觉骨干首超弱监督 SOTA2026-09-25T00:00:00.000Z
- 每日AI热点 · 2026-09-21:阶跃 Step 5 Preview 发布(600B/27B 超稀疏 MoE、100 万上下文,10-15 开源);SGLang v0.5.20 sampling masks overlap 让 RL 重放 rollout,Qwen3-8B decode +52%2026-09-21T00:00:00.000Z
- 每日AI热点 · 2026-09-20:GR00T N2 把机器人大脑从 VLA 升级为世界动作模型(新环境成功率翻倍);SGLang v0.5.20 HRRN 调度 TTFT 降 69%、NVIDIA Dynamo KV 感知路由 TTFT −50%2026-09-20T00:00:00.000Z
- 每日AI热点 · 2026-09-19:SGLang v0.5.20 发布(713 PR / 237 人),#37709 DSpark under PD 打通草稿 KV 跨节点复用;Decision Transformer 立起 VLA「动作即 token」思想鼻祖2026-09-19T00:00:00.000Z
- 每日AI热点 · 2026-09-17:vLLM2026-09-17T00:00:00.000Z
- 每日AI热点 · 2026-09-16:StepAudio 3 登顶 Artificial Analysis + Step-3.7-Flash 开源就绪,SigLIP 2 成 VLA 默认视觉塔2026-09-16T00:00:00.000Z
- 每日AI热点 · 2026-09-15:vLLM v0.29.1rc0 落地投机解码双密钥水印 + EPD 三段分离,SGLang main 补扩散与 XPU DFlash2026-09-15T00:00:00.000Z
- 每日AI热点 · 2026-09-13:vLLM HiSparse 三连把 host 内存变成 GPU 显存延展层,SGLang graph-pool 把 CUDA Graph 显存做成可借用池2026-09-13T00:00:00.000Z
- 每日AI热点 · 2026-09-12:SGLang 抢下 DeepSeek-V4.1 Day-0(有界重算换低缓存,8×H200 prefill 1.56×、pass@1 无损),vLLM 维持 v0.29.02026-09-12T00:00:00.000Z
- 每日AI热点 · 2026-09-10:vLLM v0.29.0 终于发正式版(MRV2 全量默认 + Mamba 前缀缓存 −9~25% TTFT),SGLang 维持 v0.5.192026-09-10T00:00:00.000Z
- 每日AI热点 · 2026-09-07:SGLang v0.5.19 发版(786 PR,W4A8 MoE +12%/DeepEP v2),vLLM 卡在 0.29.0 候选期且稳定版曝两则安全公告2026-09-07T00:00:00.000Z
- 每日AI热点 · 2026-09-03:Agentic 负载成主战场,胜负手从「8k 吞吐」变成「多轮会话还能不能命中历史 KV」2026-09-03T00:00:00.000Z
- 每日AI热点 · 2026-09-02:vLLM 自适应投机预算零成本提速 55–65%;RT-X 坐实机器人数据缩放定律2026-09-02T00:00:00.000Z
- 每日AI热点 · 2026-09-01:SGLang 的 NVFP4 + FP8 lm_head 会把输出变成无限重复,且 v0.5.18 装不上修复2026-09-01T00:00:00.000Z
- 每日AI热点 · 2026-08-29:SGLang 把冷启动压到 35.6 秒(2.38×),vLLM v0.28.0 的三处破坏性变更2026-08-29T00:00:00.000Z
- 每日AI热点 · 2026-08-28:v0.28.0 之后主分支改了三个默认值,SGLang 重构 prefill 基座2026-08-28T00:00:00.000Z
- 每日AI热点 · 2026-08-27:vLLM v0.28.0 发布(584 commits),K3 全栈推性能、DSV4 稀疏 MLA 端到端、DFlash2 进稳定版2026-08-27T00:00:00.000Z
- 每日AI热点 · 2026-08-26:自适应 DSpark 让 c=256 吞吐 +33.6%,Step 的 MTP 接受率从 97% 静默崩到 4%2026-08-26T00:00:00.000Z
- 每日AI热点 · 2026-08-25:vLLM 交出 4090D/H20 约 3× 解码内核,SGLang 把 DSpark 验证铺到四种量化2026-08-25T00:00:00.000Z
- 每日AI热点 · 2026-08-24:MTP 投机解码首次跨进多模态(Nemotron VL),SGLang 静默一日2026-08-24T00:00:00.000Z
- 每日AI热点 · 2026-08-23:SGLang v0.5.18 把启动时间砍到 35.6 秒,vLLM v0.28.0 进入 RC 带上 DFlash22026-08-23T00:00:00.000Z
- 每日AI热点 · 2026-08-21:共享专家融合同日在 NVIDIA 与 AMD 两侧兑现,BS=1 吞吐 +14.98%2026-08-21T00:00:00.000Z
- 每日AI热点 · 2026-08-19:DFlash2 给草稿头装上「局部卷积 + 候选选择器」,投机解码从拼接受率转向拼草稿质量2026-08-19T00:00:00.000Z
- 每日AI热点 · 2026-08-18:TensorCast 把 KV 迁移做成共享层,多轮 Agent median TTFT 最多砍 93.2%2026-08-18T00:00:00.000Z
- 每日AI热点 · 2026-08-13:投机解码开始「算账」——高并发下固定草稿数反亏 33%2026-08-13T00:00:00.000Z