今天的核心词是「解耦」。工程侧出现了一个跨框架的基础设施提案:北大×阶跃的 TensorCast 把 KV 迁移和权重物化从推理引擎里抽出来,做成一层共享的 TaaS,同时接进了 vLLM 和 SGLang。论文侧则是 Meta V-JEPA 2 让「自监督世界模型 + 零样本机器人规划」真正挂上真机——而明天宇树就要在科创板挂牌。
★ 今日最值得关注
TensorCast(北大 × 阶跃,arXiv:2608.06007)——把 KV 迁移 / 权重物化解耦为共享 TaaS 层,高并发多轮 Agent 场景 median TTFT 最多 −93.2%。
为什么这条值得单独拎出来:过去两年 KV cache 的分层、卸载、跨实例复用,几乎每一家推理框架都是各做各的——vLLM 有 NIXL / Mooncake 连接器,SGLang 有 HiCache / Mooncake 传输引擎,LMCache 又是第三套。结果是同一个能力被实现三遍,且彼此的 KV 格式不互通,跨框架混部根本谈不上。
TensorCast 的做法是把这件事下沉:KV 迁移不再由引擎内部的连接器负责,而是交给一层独立的、可被任何引擎调用的 tensor-as-a-service。它同时给出了 vLLM 和 SGLang 的集成,这在社区里是第一次。
−93.2% 这个数字该怎么读:收益集中在「高并发 + 多轮 Agent」这个特定组合上——多轮对话的每一轮都要重放极长的前缀,而并发一高,重放请求就把 prefill 算力吃满,TTFT 直接爆炸。把前缀 KV 从共享层拉回来,省掉的就是这整段重算。反过来说:单轮、短上下文、低并发的负载吃不到这个收益,别拿自己的场景硬套。
需要说明的是,这个数字来自论文与媒体报道,不是社区 CI 的复现结果。但它的架构取向值得关注:当 KV cache 从「引擎内部数据结构」变成「可跨框架寻址的基础设施」,推理引擎之间的竞争焦点就会从「谁的缓存更快」转向「谁的接口更干净」。
一、AI 产业与论文热点
论文:V-JEPA 2(Meta FAIR,1.2B,arXiv:2506.09985)
- 一句话定位:1M 小时视频自监督预训练 + 62 小时 Droid 微调 → Franka 机械臂零样本 pick-and-place 成功率 65~80%。
- 四条核心思想:
- 不重建像素,只预测潜在空间:
z_{t+1} = Predictor(z_{t-k..t}, a_t),损失只在 D 维 L2。这是它和「生成式世界模型」最本质的分野——不去浪费容量建模与决策无关的像素细节。 - EMA 教师编码器提供稳定训练目标(momentum 0.99→0.999)。
- Masked latent prediction(仿 MAE),既省算力又学到更鲁棒的表示。
- 规划头在潜在空间「想象」未来 K 步,用 MPC 选出与目标图像 embedding 最近的动作下发。
- 不重建像素,只预测潜在空间:
- 为什么重要:世界模型第一次从论文走到了可挂真机。与 08-10 的 GR00T-Dreams、08-13 的 Dreamer V3 放在一起看,正好是「自监督」与「RL」两条世界模型路线在工业级同时跑通的对照样本。
算子:HCA(Heavily Compressed Attention)
定位是 DeepSeek V4 三级记忆「远粗—中检索—近全」里的目录层:把 128 个 token 融合成 1 个目录条目(V4 附录 B 的 Manifold-Aware Projection,可逆融合),再对约 8K 条目录做稠密注意力。
| 属性 | 数值 / 结论 |
|---|---|
| 压缩比 | 128:1,省约 128× 算力 |
| 必须 Dense | 8K 条 KV 的 Dense Kernel 更规则、更快,不能做 Sparse |
| 与 CSA 的关系 | 互补:CSA 精确检索,HCA 全局概览 |
| 在用 | DeepSeek V4-Pro / V4-Flash;Qwen3.8-Max 暂未用(主要 SWA+GQA);MiniMax-M1/H3 用 Lightning Attention |
和具身场景的关联很直接:VLA 需要同时处理长视频历史和操作日志,正是 HCA 这种「全局概览 + 精确检索」结构的用武之地。
性能优化:Sequence Parallelism + Ring Attention
长上下文训练/推理的系统级方案,数学上完全等价于全量 attention,但每卡激活内存与序列长度无关。代表工作:Liu et al. ICLR 2024(64 卡 100M token)、DeepSpeed Ulysses(all-to-all 2.5× faster)、OpenRLHF / ring-flash-attention(生产级)。DeepSeek V4 与 Qwen3.8-Max 的 1M context 都依赖这条路。两个实用细节:通信开销可以被 matmul 掩盖;Zig-Zag 切块用来解决因果 mask 下后段卡空转的问题。
产业速递
- 宇树科技 8/19 科创板上市(明日):发行价 150.80 元、估值 610 亿、8288 倍超额认购,募资中 20.22 亿投向具身大模型——首次超过本体研发投入,这是今天最值得记的一条:公司自己也在押注「大脑」而不是「身体」。
- 梅卡曼德通过港交所聆讯:「具身眼脑手第一股」,2025 收入 3.89 亿元、3D 视觉全球份额 22.1%、毛利率 64.6%。
- 原力无限 A/A+ 轮近 10 亿元:因果世界模型 AtomBrain 已落地 30 余城 100+ 场景,累计订单 5 亿(单笔 2.6 亿)——与今天的 V-JEPA 2 主题直接共振。
- 北大 × 智源 × 智元灵巧手自主发球(8/13):首次打通「全身移动 + 灵巧手精细操纵」全自主闭环,20kHz 脉冲视觉响应快 10×。
- Omdia 数据:2026 H1 中国产量 4 万台、全球出货 1.91 万台(+272% YoY)、中国厂商占 97%;摩根士丹利年内第二次上调中国人形机器人出货预测至 5 万台。
- 模型侧:Qwen3.8-27B 48 小时破百万下载,Qwen 衍生模型 15.1 万个(Meta 的 2.6×);DeepSeek V4-Pro 正式版 8/13 发布,Agent 能力跃升,1M Token 上下文、输出定价 0.87 美元/百万 Token。
二、vLLM & SGLang 社区跟踪
两个框架本周期都处于「高频提交、无新 tag」状态:vLLM 稳定线 v0.27.1(08-11,79 commits),SGLang v0.5.17(08-08,100 commits)。
vLLM
- #52188:让 Kimi-K3 的 DCP 与 DSpark 首次共存。此前两者互斥,K3 用户不得不在并行策略与投机解码之间二选一。
- #49793:融合「MTP 每步末尾 all-reduce」与「草稿 token 生成」,本地 argmax 出草稿省掉一次 D2H。并发 64 时输出吞吐 +13.6%,低并发 ±3%。
- #50493:DCP 前缀部分命中。#52084:DSV4 稀疏 top-k 预填。#43107:CI 增加 GPU↔CPU 同步检测门禁。#51538:DSV4 稀疏 MLA 三模式端到端。
SGLang
- #35070:PD 分离生产环境 A/B 实测 +17.98% TPS/User。这是本周期最有说服力的数字——PD 分离终于有了生产口径的收益证据,而不只是 benchmark。
- #34801:HiCache 撤回以保住解码侧 KV。#34793:HiCache L2 扁平化。
- #35022–35028:config bags 重构,收敛
ServerArgs全局态——典型的「为后续可维护性还债」类提交。 - #34696:DSpark 支持 logprobs。
原理解读:vLLM #49793 的收益到底来自哪
MTP 投机解码的每一步末尾都要做一次 all-reduce 来同步各 TP rank 的结果,然后再生成草稿 token。这两件事原本是串行的两趟,中间还夹着一次 device-to-host 拷贝(为了在 host 侧做 argmax 取草稿)。
PR 的做法是把 all-reduce 与草稿 token 生成融合,并且改成在 GPU 上本地 argmax 出草稿,直接省掉那次 D2H。
关键在于它为什么只在并发 64 时明显(+13.6%),低并发只有 ±3%:那次同步在低并发时本来就被 GPU 空闲时间吸收了,不构成气泡;并发一上来,所有请求的这个固定开销叠加起来,就变成关键路径上一段可被观测到的气泡。融合掉它,等于把这段气泡填上。
方法论价值:按 acceptance-length 归一化后可以发现,收益确实来自通信消除,而不是「多算了几个验证 token」。这类「先归一化再归因」的做法,是判断一个性能 PR 到底改对了地方的低成本检查。
常驻专题:Step 适配
本周期出现了外部贡献者的 Step 崩溃修复 PR(vLLM #52115 / SGLang #35206),但阶跃官方仓仍停 06-01 / 04-03。有意思的对照:今天 ★ 里的 TensorCast 正是北大 × 阶跃 的工作——学术产出在上,上游工程合入在下,Step 的投入重心并不在开源推理栈的一侧。
三、一句话结论
今天最有价值的不是某个百分比,而是一个架构信号:TensorCast 试图把 KV 迁移从「各框架私有连接器」提升为「跨框架共享层」——如果这条路走通,vLLM 与 SGLang 在缓存层的差距会被抹平,竞争将回到调度器与内核本身;而在那之前,你能立刻拿到手的是 vLLM #49793(并发 64 +13.6%)和 SGLang #35070 的生产 A/B(+17.98% TPS/User)这两笔已经落地的收益。
信息来源:vLLM PR #52188 / #49793 / #50493 / #52084 / #43107 / #51538 / #52115;SGLang PR #35070 / #34801 / #35022 / #34696 / #35206;TensorCast arXiv:2608.06007 及 news.qq.com / pith.science 报道。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。