我要投稿

阿里大模型面试原题：LLM推理为什么用KV Cache

发布日期：2024-08-30 06:23:41 浏览次数： 3677

作者：丁师兄大模型

微信搜一搜，关注“丁师兄大模型”

本篇介绍为什么 LLM 推理加速有 KV Cache 而没有 Q Cache。

简单来说，LLM 在 decoding 阶段的每次推理只会用到当前的 Q，这次用的 Q 下次不会用到，所以不用 Cache Q。

但是每次都要用到当前和过去所有的 KV，这次用到的 KV 下次马上就要再用一次，所以 Cache KV 可以加速推理。

下面说明原因：

观察 Attention 公式，这个 K 和 Q 怎么看都很对称，为什么只 Cache K 而不 Cache Q？

把 KQV 写成分块的形式，像这样：

然后 Q 和 K 转置的矩阵乘就变成了这样：

直到这一步，K 和 Q 看上去都很对称。轮换一下 K 和 Q 对结果没有本质影响。

V 的引入破坏了这一对称性。忽略 ?? 系数，第 i 行的 softmax 简写成 ?? ，attention 操作的结果变成了这样：

这是没有 Causal Mask（因果掩码）的情况。

加入 Causal Mask 会变成这样：

可以写一下结果的通项，没有 Causal Mask：

有 Causal Mask：

无论有没有 Causal Mask，Q 和 K 在结果中都是不对称的。

在序列的 t 位置，Q 只有当前位置的 ??q_t 参与了计算，而 K 和 V 多个位置参与了计算，所以需要 KV Cache，而不需要 Q Cache。

在没有 Causal Mask 时，计算 t 位置的 Attention 需要未来的 KV，这在实际进行自回归推理时无法得到；加上 Causal Mask 之后，只需要 1,2,…,t 位置的 KV 就可以进行推理。

来源：https://www.zhihu.com/question/653658936/answer/3545520807

END

加入学习

✅ 我是丁师兄，专注于智能驾驶大模型，持续分享LLM面试干货。

✅ 大模型1v1辅导，已帮助多名同学成功上岸

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-12-25

背靠通义大模型，这家阿里系公司正在重写体育场馆新的「定价公式」

2025-12-25

上下文缩减新视角-可逆vs不可逆：Manus联合创始人 Peak Ji最新分享①

2025-12-24

Open WebUI：可能是目前最好用的本地大模型 Web 界面

2025-12-24

Claude Agent Skills 深度解析：原理、工作流与最佳实践

2025-12-24

Seed Prover 1.5：全新 Agentic 架构，更强数学推理表现

2025-12-24

MiniMax M2.1 终于上线，咱憋了一肚子话终于能说了。。。。。

2025-12-24

GLM-4.7发布后，n8n就不用学了！搭个AI Skills一键生成工作流

2025-12-24

在引入 AI Agent 之前，企业至少要先想清楚这 5 件事

了解更多

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

马斯克 Grok imagine 完整使用指南：工具、案例、提示词，看这一篇就够了！

2025-10-26

实测 Sora 2 ：AI视频的“ChatGPT时刻”来了？八大场景教你解锁各种玩法（附邀请码）

2025-10-02

RagFLow v0.20.X全面解析！双向MCP、Agentic智能体...这次真的起飞了！（附长图）

2025-09-29

一文速览OpenAI Dev Day 2025，下半年开始大洗牌

2025-10-07

Claude Sonnet4.5发布，号称世界最强模型，超越gpt-5-codex

2025-09-30

我挖到Gemini 3.0 Pro十大隐藏玩法，做网页已经落后N个版本了

2025-11-19

万字长文深度解析最新Deep Research技术：前沿架构、核心技术与未来展望

2025-10-20

深度体验TRAE SOLO 正式版，总结一点技巧(附完整可重现提示词和源码)

2025-11-13

从spec-kit到OpenSpec：规格驱动开发如何解决项目迭代痛点？

2025-10-18

Sora 2带来3个颠覆性创新，这个行业或将被彻底重构

2025-10-02

大家都在问

深度解读DeepMind最新研究：为什么需要像管股市一样去管AI？

2025-12-22

Prompt是与LLM对话的唯一方式：如何给大模型装上能指挥“手脚”的脑子？

2025-12-16

200k Tokens 的上下文真的够用吗？

2025-12-15

巨头翻身！谷歌全新AI浏览器Disco问世，PC版灵光？

2025-12-14

2025年，企业级AI的主战场在哪里？

2025-12-12

GPT 5.2的长上下文厉害了，但是写文真的强吗？

2025-12-12

涌现观点｜AI 开发的"App Store 时刻"：为什么你应该停止构建 Agent？

2025-12-11

Human In the Loop竟然可以是个MCP?

2025-12-09

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI AI知识库开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB Palantir Glean

应聘简历请发送至： [email protected]

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部