大模型技术notes

今日 · 秋分 · 2026年9月27日星期日

记录大模型技术、多模态的实战知识笔记。本站以中文为主;十二大系列(推测解码手记、多模态解码手记、VLA 解码手记、vLLM 与 SGLang 框架解码手记、前沿架构解码手记、推理系统基础设施手记、强化学习训练手记、智能体手记、算子讲解手记、论文科普手记、社区跟踪手记、每日AI热点)持续更新,多数篇目提供中英对照。

推测解码手记

系列 · 共 8 篇,循序渐进:从基础原理 → 自回归草稿的天花板 → DFlash / DSpark 深度解析 → 二者同台对比 → EAGLE-3(feature 约束的 scaling 枷锁)→ MTP 与置信度头(三条自草稿路线串链)→ DFlash 2 升级与"为何框架不直接组合"的元问题。每篇附英文对照。

多模态解码手记

系列 · 共 5 篇,循序渐进:从基础与对齐范式 → 视觉语言模型(VLM)演进 → 生成模型(扩散/GAN)→ 视觉-语言-动作(VLA)与世界模型 → 高效系统与前沿推理。把多模态常用的模型、结构、原理与优化手段串成一条学习主线,每篇附英文对照。

vLLM 与 SGLang 框架解码手记

系列 · 共 9 篇,循序渐进:从为什么需要推理引擎 → vLLM 原理 → SGLang 原理 → 共同前沿(同步停顿/投机解码/PD 分离/低比特量化)→ 2026 年 7 月版本演进 → 支持的模型与选型指南 → 图模式(CUDA Graph)→ vLLM-Kunlun 落点 → Wan2.2 双专家 MoE 与 vllm-omni 引擎剖析。把 vLLM/SGLang 每日跟踪的内容整合进一条主线,并配自绘 SVG 架构图,每篇附英文对照。

推理系统基础设施手记

系列 · 共 11 篇(英文对照持续补齐中),循序渐进:从 P900 + HiCache 的 NUMA × PCIe × NIC 数据链路 → Sequence Parallelism + Ring Attention 把 1M+ Token 训成常态 → MSA / CSA / HCA 三种注意力改造路线 → 知识蒸馏的暗知识传递 → 从 MHA 到 HiCache 的 KV Cache 压缩演进全景 → HiSparse 分层 KV 缓存(把 HBM 当缓存、拆掉长上下文容量墙)→ DCP 解码上下文并行(KV 沿序列维度分片、用 Scratch Buffer 复用通信)→ 并行切分策略全景与 PD 分离(TP/PP/EP/SP/CP 五把刀怎么切、怎么组合,以及 prefill:decode 实例配比的算法)→ KV Cache 全景(为什么能缓存、到底多大、三层优化分类与五个可量化旋钮)→ KV Cache 工程实现(SGLang 两级内存池与 HiCache、vLLM 分页 Block 管理与跨层统一布局、AttentionStore 在昆仑芯 P800 上的实测)→ SGLang HiCache L2 在昆仑芯 P800/P900 上的适配与调优实战(分层架构与净收益公式 → 布局选择 page_first_direct → layer_first 与 DMA 段数 → 异步搬运、NUMA 亲和、透明大页、PCIe IDO 保序 → 写入策略语义修复与 Ghost List、TP 组共享 Host KV → 端到端 TTFT 从 28.83s 降到 18.45s)。回答的是「模型算完之后,系统层还要解决什么」,与「前沿架构解码手记」的模型侧改造互为表里。

智能体手记

系列 · 共 1 篇(开篇,持续更新)。把散落在每日追踪里的 Agent 知识串成体系:能力栈(模型 / 规划 / 工具 / 记忆)→ 工具调用与 MCP → 上下文工程(1M-token 目录注意力)→ 执行范式与编排(Orchestrator + 执行者)→ Agentic 负载如何把 KV Cache 从显存问题变成调度问题。核心结论是 Agent 定义了「变长 / 分叉 / 多轮」的负载形态,击穿了推理引擎的静态调度假设,从而与「推理系统基础设施手记」的 HiCache / HiSparse / DCP / KV 量化串成一条完整闭环,每篇附英文对照。

VLA 解码手记

系列 · 共 9 篇,循序渐进:从"看懂"到"动手"(VLA 是什么)→ 动作生成的发动机(Diffusion Policy / Flow Matching / Action Chunking / 低延迟)→ π 系列演进(π0→π0.7)→ 国内重点玩家(蚂蚁灵波 / 小米 / 腾讯)→ 世界模型与落地(数据飞轮 / scaling 瓶颈 / 投资视角)→ RT-1 离散动作路线(TokenLearner / 因果掩码 / 交叉熵)→ V-JEPA 2 视频自监督世界模型 → Dreamer V3 世界模型 RL → Octo(27M 通用机器人策略,把"可微调到新本体"做成工程问题)。把"多模态解码手记(二)的 LLaVA"自然延伸为机器人的"动手"能力,每篇附英文对照。

前沿架构解码手记

系列 · 共 8 篇(持续更新),循序渐进:从 2026 前沿大模型总览(长上下文 × 效率 × 规模化的不可能三角)→ Kimi K3(重设计注意力 KDA + Gated MLA 3:1 + Stable LatentMoE + 原生视觉)→ MiniMax M2.7→M3(稀疏注意力 MSA 把 1M 上下文算力压到 1/20)→ DeepSeek V4(压缩注意力 CSA+HCA + Muon 优化器 + OPD 蒸馏,KV 压到 ~10%)→ Mamba 混合状态 + PD 分离(Jamba 式混合架构要跨节点搬的 KV + SSM 递归状态怎么处理、为什么 Mamba 状态缺 token-id 寻址键会「静默命中错位」)→ Gated DeltaNet(Conv1D 先抓局部、Gated Delta Rule 再压全局的线性注意力层)→ Qwen3.8 双 checkpoint 对比(稠密 27B vs 稀疏 Flash-Next,360GB 权重只为换 6B 激活)→ Qwen3.8 三版本同框(2.4T-A95B 旗舰 / Flash 服务版 / Flash-Next 架构预览,125B MoE + 51B N-gram 每激活 6B)。把"改注意力 / 改权重组织"的对照实验串成一条主线:稠密注意力 → 稀疏注意力 → 压缩注意力 → 线性注意力与混合状态 → 稀疏 MoE 大容量,每篇附英文对照。

算子讲解手记

系列 · 共 2 篇(持续更新)。把前沿架构里常被一笔带过的算子写成可照着实现的逐行伪代码:首篇 MLA 多头潜在注意力的 c_kv / W_DKV / W_UK / W_UV 算子与缓存压缩量级,第二篇模型量化部署(FP8/INT4/AWQ·GPTQ/FP4 QAT/KV Cache 量化),后续覆盖 GQA / MQA、归一化、路由等算子。每篇附英文对照。

论文科普手记

系列 · 共 2 篇(开篇)。把大模型时代绕不开的「经典论文」写成可读笔记:从定义注意力的 Transformer(2017)→ 把扩散去噪范式搬进机器人动作生成的 Diffusion Policy(2023)。与「VLA 解码手记」的动作生成发动机、本博客各工程系列互为补充,每篇附英文对照。

社区跟踪手记

系列 · 共 3 篇。把每日 vLLM / SGLang 上游 commit、模型 cookbook、国产模型适配进度,按「同一天同框 / 谁在掉队」的对照视角做成可读笔记,补足框架解码手记里偏原理、少时效的部分,每篇附英文对照。

强化学习训练手记

系列 · 共 1 篇(开篇,持续更新)。补上站内此前缺失的一块:大模型与机器人共用的「训练侧」基础设施。开篇讲分布式 RL 训练——为什么 RLHF 不能单进程一锅炖(rollout 占一个 PPO step 约 80% 时间)、Actor / Critic / Reference / Reward 四角色怎么解耦到独立 GPU 池、vLLM 或 SGLang 如何充当 Rollout Engine、PPO 与 GRPO 的损失公式与「去掉 Critic」的代价、Weight Sync 的 Ray Object Store 与 NCCL 两条路径,以及它如何同时服务文本 RLHF 与机器人 VLA 的 RLAIF。与「推理系统基础设施手记」的推理侧优化互为表里,每篇附英文对照。

每日AI热点

系列 · 共 27 篇(持续更新),把每天 vLLM / SGLang 上游、国产模型适配、投机解码与推理优化的一线进展,做成「同一天同框 / 谁在掉队」的时效笔记,补足框架解码手记偏原理、少时效的部分,每篇附英文对照。

查看全部 27 期 →

觉得这些技术笔记有用?欢迎请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信