大模型技术notes
记录大模型技术、多模态的实战知识笔记。本站以中文为主;十二大系列(推测解码手记、多模态解码手记、VLA 解码手记、vLLM 与 SGLang 框架解码手记、前沿架构解码手记、推理系统基础设施手记、强化学习训练手记、智能体手记、算子讲解手记、论文科普手记、社区跟踪手记、每日AI热点)持续更新,多数篇目提供中英对照。
推测解码手记
系列 · 共 8 篇,循序渐进:从基础原理 → 自回归草稿的天花板 → DFlash / DSpark 深度解析 → 二者同台对比 → EAGLE-3(feature 约束的 scaling 枷锁)→ MTP 与置信度头(三条自草稿路线串链)→ DFlash 2 升级与"为何框架不直接组合"的元问题。每篇附英文对照。
- 推测解码:让大模型“一次生成多个 token”的无损加速2026-07-31
- 自回归草稿模型的天花板:为什么卡在 2–3×2026-07-31
- DFlash 深度解析:块扩散起草 + KV 注入 + 无空转流水线2026-07-31
- DSpark 深度解析:半自回归起草 + 马尔可夫头 + 置信度调度2026-07-31
- 同台对比:DFlash 与 DSpark 到底差在哪2026-07-31
- EAGLE-3 深度解析:扔掉 feature 约束,让草稿模型第一次"吃数据"变快2026-08-04
- MTP Head 与置信度头:把推测解码三条自草稿路线串成一条链2026-08-19
- DFlash 2 与"组合之问":块扩散升级,但为何框架不直接叠 DSpark 调度2026-09-09
多模态解码手记
系列 · 共 5 篇,循序渐进:从基础与对齐范式 → 视觉语言模型(VLM)演进 → 生成模型(扩散/GAN)→ 视觉-语言-动作(VLA)与世界模型 → 高效系统与前沿推理。把多模态常用的模型、结构、原理与优化手段串成一条学习主线,每篇附英文对照。
- (一)基础与对齐范式:从"会写"到"会看会动"2026-07-31
- (二)视觉语言模型演进:ViT → CLIP → LLaVA2026-07-31
- (三)生成模型:扩散与对抗(Stable Diffusion & GAN)2026-07-31
- (四)从 VLA 到世界模型:RT-2 → π0.7 → HiF-VLA2026-07-31
- (五)高效系统与前沿推理:注意力 / 推理优化 / 端侧 / RL2026-07-31
vLLM 与 SGLang 框架解码手记
系列 · 共 9 篇,循序渐进:从为什么需要推理引擎 → vLLM 原理 → SGLang 原理 → 共同前沿(同步停顿/投机解码/PD 分离/低比特量化)→ 2026 年 7 月版本演进 → 支持的模型与选型指南 → 图模式(CUDA Graph)→ vLLM-Kunlun 落点 → Wan2.2 双专家 MoE 与 vllm-omni 引擎剖析。把 vLLM/SGLang 每日跟踪的内容整合进一条主线,并配自绘 SVG 架构图,每篇附英文对照。
- (一)为什么需要推理引擎:朴素推理的三道墙2026-08-01
- (二)vLLM 原理:从分页 KV 到 Model Runner V22026-08-01
- (三)SGLang 原理:前缀复用与前沿吞吐优化2026-08-01
- (四)共同前沿:同步停顿、投机解码、PD 分离、低比特量化2026-08-01
- (五)版本演进时间线:2026 年 7 月的两轮换代2026-08-01
- (六)支持的模型与选型指南:什么场景该选谁2026-08-01
- (七)图模式:CUDA Graph 原理与 vLLM / SGLang 的实现2026-08-04
- (八)vLLM 0.25.1 的两层 V1/V2 与 vLLM-Kunlun 的落点2026-08-05
- (九)Wan2.2-I2V/T2V-A14B:双专家 MoE 视频模型与 vllm-omni 引擎剖析2026-08-11
推理系统基础设施手记
系列 · 共 11 篇(英文对照持续补齐中),循序渐进:从 P900 + HiCache 的 NUMA × PCIe × NIC 数据链路 → Sequence Parallelism + Ring Attention 把 1M+ Token 训成常态 → MSA / CSA / HCA 三种注意力改造路线 → 知识蒸馏的暗知识传递 → 从 MHA 到 HiCache 的 KV Cache 压缩演进全景 → HiSparse 分层 KV 缓存(把 HBM 当缓存、拆掉长上下文容量墙)→ DCP 解码上下文并行(KV 沿序列维度分片、用 Scratch Buffer 复用通信)→ 并行切分策略全景与 PD 分离(TP/PP/EP/SP/CP 五把刀怎么切、怎么组合,以及 prefill:decode 实例配比的算法)→ KV Cache 全景(为什么能缓存、到底多大、三层优化分类与五个可量化旋钮)→ KV Cache 工程实现(SGLang 两级内存池与 HiCache、vLLM 分页 Block 管理与跨层统一布局、AttentionStore 在昆仑芯 P800 上的实测)→ SGLang HiCache L2 在昆仑芯 P800/P900 上的适配与调优实战(分层架构与净收益公式 → 布局选择 page_first_direct → layer_first 与 DMA 段数 → 异步搬运、NUMA 亲和、透明大页、PCIe IDO 保序 → 写入策略语义修复与 Ghost List、TP 组共享 Host KV → 端到端 TTFT 从 28.83s 降到 18.45s)。回答的是「模型算完之后,系统层还要解决什么」,与「前沿架构解码手记」的模型侧改造互为表里。
- (一)P900 + HiCache 下的 NUMA × PCIe × NIC 数据链路2026-08-26
- (二)Sequence Parallelism + Ring Attention——把 1M+ Token 训成常态2026-08-26
- (三)MSA / CSA / HCA —— 三种注意力改造路线一张图看清2026-08-26
- (四)知识蒸馏 —— 把大模型的「暗知识」传给小模型2026-08-26
- (五)从 MHA 到 HiCache——KV Cache 压缩方向的演进全景2026-08-26
- (六)HiSparse —— 把 HBM 当缓存用,长上下文服务的容量墙怎么拆2026-09-07
- (七)DCP —— 解码上下文并行,把 KV 缓存沿序列维度分片(冗余复制→Scratch Buffer 通信)2026-09-08
- (八)并行切分策略全景与 PD 分离——TP/PP/EP/SP/CP 怎么切,PD 实例怎么配比2026-09-08
- (九)KV Cache 全景——它为什么同时决定你的吞吐、延迟和能开多少并发2026-09-09
- (十)KV Cache 工程实现——SGLang 两级内存池、vLLM Block 管理与 AttentionStore 多级缓存2026-09-09
- (十一)SGLang HiCache L2 在昆仑芯 P800/P900 上的适配与调优实战2026-09-15
智能体手记
系列 · 共 1 篇(开篇,持续更新)。把散落在每日追踪里的 Agent 知识串成体系:能力栈(模型 / 规划 / 工具 / 记忆)→ 工具调用与 MCP → 上下文工程(1M-token 目录注意力)→ 执行范式与编排(Orchestrator + 执行者)→ Agentic 负载如何把 KV Cache 从显存问题变成调度问题。核心结论是 Agent 定义了「变长 / 分叉 / 多轮」的负载形态,击穿了推理引擎的静态调度假设,从而与「推理系统基础设施手记」的 HiCache / HiSparse / DCP / KV 量化串成一条完整闭环,每篇附英文对照。
VLA 解码手记
系列 · 共 9 篇,循序渐进:从"看懂"到"动手"(VLA 是什么)→ 动作生成的发动机(Diffusion Policy / Flow Matching / Action Chunking / 低延迟)→ π 系列演进(π0→π0.7)→ 国内重点玩家(蚂蚁灵波 / 小米 / 腾讯)→ 世界模型与落地(数据飞轮 / scaling 瓶颈 / 投资视角)→ RT-1 离散动作路线(TokenLearner / 因果掩码 / 交叉熵)→ V-JEPA 2 视频自监督世界模型 → Dreamer V3 世界模型 RL → Octo(27M 通用机器人策略,把"可微调到新本体"做成工程问题)。把"多模态解码手记(二)的 LLaVA"自然延伸为机器人的"动手"能力,每篇附英文对照。
- (一)从「看懂」到「动手」:什么是视觉-语言-动作模型2026-08-04
- (二)动作生成的发动机:Diffusion Policy、Flow Matching 与低延迟2026-08-04
- (三)π 系列演进:Physical Intelligence 的 VLA 路线2026-08-04
- (四)国内重点玩家:蚂蚁灵波、小米、腾讯2026-08-04
- (五)世界模型与落地:VLA 的下一站2026-08-04
- (六)RT-1 的离散动作路线:TokenLearner、因果掩码与交叉熵2026-08-07
- (七)V-JEPA 2:视频自监督世界模型与零样本机器人规划2026-08-26
- (八)Dreamer V3:一套超参横扫 50+ 域的世界模型 RL2026-08-26
- (九)Octo:27M 参数的通用机器人策略,以及「能微调」这件事2026-09-11
前沿架构解码手记
系列 · 共 8 篇(持续更新),循序渐进:从 2026 前沿大模型总览(长上下文 × 效率 × 规模化的不可能三角)→ Kimi K3(重设计注意力 KDA + Gated MLA 3:1 + Stable LatentMoE + 原生视觉)→ MiniMax M2.7→M3(稀疏注意力 MSA 把 1M 上下文算力压到 1/20)→ DeepSeek V4(压缩注意力 CSA+HCA + Muon 优化器 + OPD 蒸馏,KV 压到 ~10%)→ Mamba 混合状态 + PD 分离(Jamba 式混合架构要跨节点搬的 KV + SSM 递归状态怎么处理、为什么 Mamba 状态缺 token-id 寻址键会「静默命中错位」)→ Gated DeltaNet(Conv1D 先抓局部、Gated Delta Rule 再压全局的线性注意力层)→ Qwen3.8 双 checkpoint 对比(稠密 27B vs 稀疏 Flash-Next,360GB 权重只为换 6B 激活)→ Qwen3.8 三版本同框(2.4T-A95B 旗舰 / Flash 服务版 / Flash-Next 架构预览,125B MoE + 51B N-gram 每激活 6B)。把"改注意力 / 改权重组织"的对照实验串成一条主线:稠密注意力 → 稀疏注意力 → 压缩注意力 → 线性注意力与混合状态 → 稀疏 MoE 大容量,每篇附英文对照。
- (一)2026 前沿大模型总览:长上下文 × 效率 × 规模化 的不可能三角2026-08-06
- (二)Kimi K3:注意力与 MoE 的双重进化2026-08-06
- (三)MiniMax M2.7 → M3:稀疏注意力的跨越2026-08-06
- (四)DeepSeek V4:极致压缩与高效训练2026-08-06
- (五)Mamba 混合状态 + PD 分离——缓存正确性为何要避免「静默命中错位」2026-08-10
- (六)Gated DeltaNet——Conv1D 先抓局部、Gated Delta Rule 再压全局的线性注意力层2026-08-26
- (七)Qwen3.8 双 checkpoint 对比:稠密 27B vs 稀疏 Flash-Next(360GB 权重只为换 6B 激活)2026-08-28
- (八)Qwen3.8 三版本同框:2.4T 旗舰、Flash 服务版与 Flash-Next 架构预览2026-09-09
算子讲解手记
系列 · 共 2 篇(持续更新)。把前沿架构里常被一笔带过的算子写成可照着实现的逐行伪代码:首篇 MLA 多头潜在注意力的 c_kv / W_DKV / W_UK / W_UV 算子与缓存压缩量级,第二篇模型量化部署(FP8/INT4/AWQ·GPTQ/FP4 QAT/KV Cache 量化),后续覆盖 GQA / MQA、归一化、路由等算子。每篇附英文对照。
- (一)MLA 多头潜在注意力的算子级实现:c_kv / W_DKV / W_UK / W_UV 逐行伪代码2026-08-07
- (二)模型量化部署——从 FP16 到 FP4 的精度压缩谱系(FP8/INT4/AWQ·GPTQ/FP4 QAT/KV Cache 量化)2026-09-08
论文科普手记
系列 · 共 2 篇(开篇)。把大模型时代绕不开的「经典论文」写成可读笔记:从定义注意力的 Transformer(2017)→ 把扩散去噪范式搬进机器人动作生成的 Diffusion Policy(2023)。与「VLA 解码手记」的动作生成发动机、本博客各工程系列互为补充,每篇附英文对照。
- (一)Transformer 精读:用「注意力」取代循环,把序列建模变成可并行计算2026-08-12
- (二)Diffusion Policy 精读:把 Stable Diffusion 的「去噪」范式搬去生成机器人动作2026-08-12
社区跟踪手记
系列 · 共 3 篇。把每日 vLLM / SGLang 上游 commit、模型 cookbook、国产模型适配进度,按「同一天同框 / 谁在掉队」的对照视角做成可读笔记,补足框架解码手记里偏原理、少时效的部分,每篇附英文对照。
- vLLM & SGLang 社区跟踪 · 2026-08-06:双框架同日落地 Ling-3.0-flash,阶跃 Step 适配停滞2026-08-12
- vLLM & SGLang 社区跟踪 · 2026-08-07:KV 缓存复用进入「组合正确性」阶段(HiCache / Mooncake 原理与架构)2026-08-12
- vLLM & SGLang 社区跟踪 · 2026-08-11:vLLM v0.27.0 一次性交付、SGLang 统一内存池三连修与 PD 分离打通2026-08-12
强化学习训练手记
系列 · 共 1 篇(开篇,持续更新)。补上站内此前缺失的一块:大模型与机器人共用的「训练侧」基础设施。开篇讲分布式 RL 训练——为什么 RLHF 不能单进程一锅炖(rollout 占一个 PPO step 约 80% 时间)、Actor / Critic / Reference / Reward 四角色怎么解耦到独立 GPU 池、vLLM 或 SGLang 如何充当 Rollout Engine、PPO 与 GRPO 的损失公式与「去掉 Critic」的代价、Weight Sync 的 Ray Object Store 与 NCCL 两条路径,以及它如何同时服务文本 RLHF 与机器人 VLA 的 RLAIF。与「推理系统基础设施手记」的推理侧优化互为表里,每篇附英文对照。
- (一)分布式 RL 训练——PPO / GRPO 怎么从单卡跑到多机2026-09-11
每日AI热点
系列 · 共 27 篇(持续更新),把每天 vLLM / SGLang 上游、国产模型适配、投机解码与推理优化的一线进展,做成「同一天同框 / 谁在掉队」的时效笔记,补足框架解码手记偏原理、少时效的部分,每篇附英文对照。
- 每日AI热点 · 2026-09-27:周日无新正式版本,SGLang main 收口缓存/路由底座、kv-hints 信封进传输层;DriveVLM 把 VLM 慢思考装进智驾闭环2026-09-27T00:00:00.000Z
觉得这些技术笔记有用?欢迎请作者喝咖啡 ☕️
支付宝
微信