★ 今日最值得关注
同一天,两大框架双双为国产模型 Ling-3.0-flash 落地;而阶跃 Step 连续第三日零推送,并被曝内部战略线已一分为二。
- vLLM 合入 #51045:Bailing V3 MLA/KDA 混合 MoE 模型实现 + MTP 草稿 + ling3 解析器,15 文件 +2070 行。
- SGLang 合入 #33556:Ling-3.0-flash cookbook,附 GB300 实测 GSM8K 96.66% / 96.97%。
- 同日、同模型、双框架、都带投机解码——国产模型的一线适配,已经从「能不能跑」进入「怎么跑得快」的阶段。
对照面:StepFun-ai org 主力仓库推送时间仍停在 06-01 / 04-03,官方 vllm fork 停 05-28;而 08-05 有媒体报道阶跃内部已确立「大模型」与「智能体终端」两条独立战略线,海外商业化以 API(尤其语音模型)为主。
结论:Step 在开源推理生态里的适配停滞不是偶发排期问题,而与组织资源重心迁移方向一致——把 Step 列为国产推理适配的观察基准,需要下调预期权重。
一、基线速览(三方均无新 tag)
| 对象 | 最新稳定版 | 发布时间 | 本窗口动态 |
|---|---|---|---|
| vLLM | v0.26.0 | 2026-07-27 | main 分支 52 commits |
| SGLang | v0.5.16 | 2026-07-25 | main 分支 61 commits(sgl-kernel 升 0.4.6) |
| 阶跃 Step | Step-3.7-Flash / 3.5-Flash | 仓库 push 停 06-01 / 04-03 | GitHub 零进展;仅有战略层面新闻 |
注:sgl-kernel 由 #33678 提升至 0.4.6,属子包版本,SGLang 主仓 tag 未变。
二、国产模型适配的「同框」信号
Ling-3.0-flash 在同一天进入 vLLM 与 SGLang 两条主干,且都明确带投机解码(MTP 草稿 / cookbook 吞吐),说明:
- 国产新模型的「首发即双框架」已成常态,生态位从「求框架收留」变成「框架主动抢适配」。
- 投机解码(见本博客「推测解码手记」ep1–ep6)已是新模型上线的标配卖点,不是可选项。
- GB300 实测 GSM8K 96%+ 说明国产模型在推理卡上的「能跑」已被验证,竞争转向「跑得省、跑得快」。
三、阶跃 Step 的「缺席」该怎么读
连续三日零 commit + 主力仓停在数月前 + 战略线拆分的新闻,三重信号指向同一判断:
- Step 的开源推理投入阶段性让位给「大模型 vs 智能体终端」双线作战,以及海外的 API/语音商业化。
- 对「是否要在 vLLM/SGLang 里优先适配 Step」这类工程决策,应暂时降权;若必须支持,优先走其官方 fork 而非等主干合入。
四、对「社区跟踪」这个系列的定位
本系列(tr)把每日 vLLM / SGLang 上游 commit、模型 cookbook、国产模型适配进度,按「同一天同框 / 谁在掉队」的对照视角做成可读笔记,补足「vLLM 与 SGLang 框架解码手记(fw)」里偏原理、少时效的部分。
- 想看原理主线:回 fw1–fw9(从为什么需要推理引擎 → vLLM/SGLang 原理 → 版本演进 → Wan2.2 双专家 MoE)。
- 想看算子细节:回 op1(MLA 算子)。
- 想看模型侧对照:回 fa1–fa4(Kimi K3 / MiniMax M3 / DeepSeek V4)。
五、今日观察清单(待验证)
- Ling-3.0-flash 在 vLLM 的 MTP 草稿是否进 0.26.x 稳定线,还是仅 main。
- SGLang #33556 的 GB300 实测是否引申出新的吞吐基线(vs vLLM 同模型)。
- Step 战略拆分后,是否会有新的开源动作(如智能体终端侧推理框架)。
数据来源:GitHub vLLM / SGLang 仓库 commit 流水(2026-08-05 01:00Z → 08-06 01:00Z);新浪财经/网易/今日头条 08-05 战略线报道。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。