前置知识:KDA算法公式、triton、cuda、c++
仓库链接:MoonshotAI/FlashKDA: FlashKDA: high-performance Kimi Delta Attention kernels
公式回顾
kernel 1 代码
代码链接:FlashKDA/csrc/smxx/fwd_kernel1.cuh at master · Moonsho...
前置知识:KDA算法公式、triton、cuda、c++
0 公式回顾
1 整体梳理
代码链接:flash-linear-attention/fla/ops/kda/chunk_fwd.py at main · fla-org/flash-linear-attention
12345678910111213141516171819202122232425262728293...
前置知识:KDA算法公式、triton、cuda、c++
从 FLA(flash-linear-attention)仓库的代码入手
仓库链接:fla-org/flash-linear-attention: 🚀 Efficient implementations for emerging model architectures
0 公式回顾
1 Naive
代码链接:fl...
1 Delta Net
论文链接:[2406.06484] Parallelizing Linear Transformers with the Delta Rule over Sequence Length
1.1
Delta Net的更新公式
开始推导
展开递推式
1.2
定义如下变量
开始推导
1.3
引入变化
...
本文记录本博客(Hexo + Redefine 主题)的环境、配置与常用操作,方便日后维护。
技术栈
组件
版本 / 说明
Hexo
8.x
主题
Redefine 2.9
Markdown 渲染
hexo-renderer-markdown-it-plus
数学公式
hexo-filter-mathjax(构建时预渲染为 SVG)
部署
GitHub Pag...
本文详细解析 SGLang 中 MambaRadixCache 的内存空间布局、KV Cache 与 SSM Cache 的缓存机制原理、Prefill 和 Decode 的完整流程,并通过端到端的例子串联所有概念。
1. 内存空间布局
1.1 三大内存池
MambaRadixCache 管理三块独立的 GPU 显存池:每 256 token 做一次 track(不是为了 tree 缓存...
本文档详细解析 SGLang 的 KV Cache 内存池机制,包括核心数据结构、分配流程,以及 KDA(Kimi Delta Attention)线性注意力的缓存机制。
一、整体架构概览
SGLang 的 KV Cache 内存池分为三层结构(见 python/sglang/srt/mem_cache/memory_pool.py):
1234567891011┌────────────...
论文链接:arxiv.org/pdf/2512.02556
DeepSeek-V3.2 的 DSA(DeepSeek Sparse Attention)详解
面向小白:从「为什么需要 DSA」讲起,结合论文数学公式和 sglang 源码,
最后把 MLA + DSA 串起来,看清 DeepSeek-V3.2 完整的注意力是怎么跑的。
建议先读完同目录的MLA,本文大量复用 MLA 的结论...
论文链接:arxiv.org/pdf/2405.04434
MLA(Multi-head Latent Attention)完整详解
结合 DeepSeek-V2 / V3 论文数学公式、知乎讲解(zhuanlan.zhihu.com/p/16730036197)与 sglang 代码实现(python/sglang/srt/models/deepseek_v2.py、deepseek_...
hgemm_mma_m16n8k16_mma2x4_warp4x4_stages_kernel 详解
仓库链接:xlite-dev/HGEMM at eee72be829545bd6bd115a4b252b5068c9f61597
代码链接:HGEMM/kernels/hgemm/mma/hgemm_mma_stage.cu at eee72be829545bd6bd115a4b252b50...