系列:每日AI热点

每日AI热点 · 2026-08-18:TensorCast 把 KV 迁移做成共享层,多轮 Agent median TTFT 最多砍 93.2%

今天的核心词是「解耦」。工程侧出现了一个跨框架的基础设施提案:北大×阶跃的 TensorCast 把 KV 迁移和权重物化从推理引擎里抽出来,做成一层共享的 TaaS,同时接进了 vLLM 和 SGLang。论文侧则是 Meta V-JEPA 2 让「自监督世界模型 + 零样本机器人规划」真正挂上真机——而明天宇树就要在科创板挂牌。

★ 今日最值得关注

TensorCast(北大 × 阶跃,arXiv:2608.06007)——把 KV 迁移 / 权重物化解耦为共享 TaaS 层,高并发多轮 Agent 场景 median TTFT 最多 −93.2%。

为什么这条值得单独拎出来:过去两年 KV cache 的分层、卸载、跨实例复用,几乎每一家推理框架都是各做各的——vLLM 有 NIXL / Mooncake 连接器,SGLang 有 HiCache / Mooncake 传输引擎,LMCache 又是第三套。结果是同一个能力被实现三遍,且彼此的 KV 格式不互通,跨框架混部根本谈不上。

TensorCast 的做法是把这件事下沉:KV 迁移不再由引擎内部的连接器负责,而是交给一层独立的、可被任何引擎调用的 tensor-as-a-service。它同时给出了 vLLM 和 SGLang 的集成,这在社区里是第一次。

−93.2% 这个数字该怎么读:收益集中在「高并发 + 多轮 Agent」这个特定组合上——多轮对话的每一轮都要重放极长的前缀,而并发一高,重放请求就把 prefill 算力吃满,TTFT 直接爆炸。把前缀 KV 从共享层拉回来,省掉的就是这整段重算。反过来说:单轮、短上下文、低并发的负载吃不到这个收益,别拿自己的场景硬套。

需要说明的是,这个数字来自论文与媒体报道,不是社区 CI 的复现结果。但它的架构取向值得关注:当 KV cache 从「引擎内部数据结构」变成「可跨框架寻址的基础设施」,推理引擎之间的竞争焦点就会从「谁的缓存更快」转向「谁的接口更干净」。

一、AI 产业与论文热点

论文:V-JEPA 2(Meta FAIR,1.2B,arXiv:2506.09985)

算子:HCA(Heavily Compressed Attention)

定位是 DeepSeek V4 三级记忆「远粗—中检索—近全」里的目录层:把 128 个 token 融合成 1 个目录条目(V4 附录 B 的 Manifold-Aware Projection,可逆融合),再对约 8K 条目录做稠密注意力。

属性数值 / 结论
压缩比128:1,省约 128× 算力
必须 Dense8K 条 KV 的 Dense Kernel 更规则、更快,不能做 Sparse
与 CSA 的关系互补:CSA 精确检索,HCA 全局概览
在用DeepSeek V4-Pro / V4-Flash;Qwen3.8-Max 暂未用(主要 SWA+GQA);MiniMax-M1/H3 用 Lightning Attention

和具身场景的关联很直接:VLA 需要同时处理长视频历史和操作日志,正是 HCA 这种「全局概览 + 精确检索」结构的用武之地。

性能优化:Sequence Parallelism + Ring Attention

长上下文训练/推理的系统级方案,数学上完全等价于全量 attention,但每卡激活内存与序列长度无关。代表工作:Liu et al. ICLR 2024(64 卡 100M token)、DeepSpeed Ulysses(all-to-all 2.5× faster)、OpenRLHF / ring-flash-attention(生产级)。DeepSeek V4 与 Qwen3.8-Max 的 1M context 都依赖这条路。两个实用细节:通信开销可以被 matmul 掩盖;Zig-Zag 切块用来解决因果 mask 下后段卡空转的问题。

产业速递

二、vLLM & SGLang 社区跟踪

两个框架本周期都处于「高频提交、无新 tag」状态:vLLM 稳定线 v0.27.1(08-11,79 commits),SGLang v0.5.17(08-08,100 commits)。

vLLM

SGLang

原理解读:vLLM #49793 的收益到底来自哪

MTP 投机解码的每一步末尾都要做一次 all-reduce 来同步各 TP rank 的结果,然后再生成草稿 token。这两件事原本是串行的两趟,中间还夹着一次 device-to-host 拷贝(为了在 host 侧做 argmax 取草稿)。

PR 的做法是把 all-reduce 与草稿 token 生成融合,并且改成在 GPU 上本地 argmax 出草稿,直接省掉那次 D2H。

关键在于它为什么只在并发 64 时明显(+13.6%),低并发只有 ±3%:那次同步在低并发时本来就被 GPU 空闲时间吸收了,不构成气泡;并发一上来,所有请求的这个固定开销叠加起来,就变成关键路径上一段可被观测到的气泡。融合掉它,等于把这段气泡填上。

方法论价值:按 acceptance-length 归一化后可以发现,收益确实来自通信消除,而不是「多算了几个验证 token」。这类「先归一化再归因」的做法,是判断一个性能 PR 到底改对了地方的低成本检查。

常驻专题:Step 适配

本周期出现了外部贡献者的 Step 崩溃修复 PR(vLLM #52115 / SGLang #35206),但阶跃官方仓仍停 06-01 / 04-03。有意思的对照:今天 ★ 里的 TensorCast 正是北大 × 阶跃 的工作——学术产出在上,上游工程合入在下,Step 的投入重心并不在开源推理栈的一侧。

三、一句话结论

今天最有价值的不是某个百分比,而是一个架构信号:TensorCast 试图把 KV 迁移从「各框架私有连接器」提升为「跨框架共享层」——如果这条路走通,vLLM 与 SGLang 在缓存层的差距会被抹平,竞争将回到调度器与内核本身;而在那之前,你能立刻拿到手的是 vLLM #49793(并发 64 +13.6%)和 SGLang #35070 的生产 A/B(+17.98% TPS/User)这两笔已经落地的收益。


信息来源:vLLM PR #52188 / #49793 / #50493 / #52084 / #43107 / #51538 / #52115;SGLang PR #35070 / #34801 / #35022 / #34696 / #35206;TensorCast arXiv:2608.06007 及 news.qq.com / pith.science 报道。

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。