🌍 面向海内外学员 · 可远程试听 / 上课(时差可协调)
LLM 应用进阶2026-06-01 更新⚡ 高频考点 · 第 3 期

Transformer & 推理优化

18 课时 9 小时 视频 / 图文

推理优化是 LLM 落地最难也最被低估的方向——面试中「为什么推理比训练贵得多」「怎么让推理跑得更快」是高频压轴题。这门课从 Attention 数学本质出发,系统覆盖 KV Cache、FlashAttention、vLLM / TensorRT-LLM、量化技术,帮你在面试和工作中都讲清楚推理优化的底层逻辑。

学完这门课,你能做到:

  • 从数学层面讲清楚 Attention 计算复杂度与优化动机
  • 理解 KV Cache / PagedAttention / Continuous Batching 原理
  • 掌握 FlashAttention v1/v2/v3 演进与 IO 复杂度分析
  • 掌握 GPTQ / AWQ / GGUF 量化的原理与工程实践
  • 对比 vLLM / TGI / TensorRT-LLM 的适用场景与选型
  • 40 道高频推理优化面试题的标准答案与推导过程
  • Attention 机制数学本质深度拆解
  • KV Cache / PagedAttention 原理
  • FlashAttention 原理与 v1/v2/v3 演进
  • vLLM / TGI / TensorRT-LLM 性能对比
  • 量化技术:GPTQ / AWQ / GGUF
  • Speculative Decoding 等推理加速
课程咨询
小红书咨询报名

📕 私信「兔老板工作室」小红书,立即咨询报名

私信即报 · 无需平台付款 · 长期有效

课程分为 4 大模块,共 18 课时。

01 Attention 机制深度
6 课时 · 3 小时
+
  • Self-Attention 数学本质30 min
  • Multi-Head Attention 的设计动机28 min
  • MQA / GQA / MLA 演进32 min
  • 位置编码演进:正弦 → RoPE → ALiBi30 min
  • 滑动窗口注意力与 Long Context28 min
  • Attention 模块小测:12 道高频面试题28 min
02 KV Cache 与 PagedAttention
4 课时 · 2 小时
+
  • KV Cache 原理与显存分析30 min
  • PagedAttention:虚拟内存思想32 min
  • Continuous Batching 原理28 min
  • KV Cache 模块小测:8 道高频面试题24 min
03 FlashAttention 与量化
4 课时 · 2 小时
+
  • FlashAttention v1/v2/v3 演进32 min
  • IO 复杂度分析与显存优化28 min
  • 量化原理:PTQ vs QAT28 min
  • GPTQ / AWQ / GGUF 对比30 min
04 推理框架与 Speculative Decoding
4 课时 · 2 小时
+
  • vLLM 架构与使用30 min
  • TGI / TensorRT-LLM 对比28 min
  • Speculative Decoding 原理30 min
  • 推理框架模块小测:10 道高频面试题28 min

🎯 适合谁

  • 大厂推理 / 性能优化岗求职者
  • 想深耕 LLM 系统优化的工程师
  • 面试常被问「为什么快」却答不上来的同学
  • 已掌握 LLM 基础,想啃下硬骨头

🚀 学完你能收获

  • 从数学到工程的全链路推理优化知识
  • 主流推理框架的选型决策能力
  • 面试中能讲清楚"为什么这么优化"
  • 性能优化岗位的核心竞争力

📋 前置要求

  • 熟悉 PyTorch 基础
  • 了解 Transformer 架构(建议先看全栈班模块 1)
  • 具备基本的高性能计算概念更佳

学习节奏

  • 总时长 9 小时,建议 2 周完成
  • 每周 8 课时 + 实操演练
  • 报名后立即开通,永久回看
兔老板

博主介绍

中科院博士 · 资深算法工程师 · 长期参与一线招聘面试 · 公众号「兔老板工作室」作者

查看完整博主介绍 →

适合大厂推理/性能优化岗求职者、想深耕 LLM 系统优化的工程师,以及面试常被问「为什么快」却答不上来的同学。前置要求是熟悉 PyTorch 基础、了解 Transformer 架构。
从 Attention 数学本质出发,覆盖 KV Cache/PagedAttention/Continuous Batching 原理、FlashAttention v1/v2/v3 演进与 IO 复杂度分析、vLLM/TensorRT-LLM 框架、GPTQ/AWQ/GGUF 量化原理与工程实践。
总时长 9 小时,建议 2 周完成,每周 8 课时 + 实操演练。报名后立即开通、永久回看,帮你在面试中讲清楚「为什么这么优化」。
自回归生成时,每个新 token 都要和前面所有 token 做 Attention,KV Cache 把算过的 Key/Value 缓存下来避免重复计算,推理速度显著提升;代价是显存随序列变长而增长,这正是 PagedAttention 等技术优化的目标。课程第 3 模块会从显存视角讲透。
核心是 PagedAttention——把 KV Cache 分页管理,像操作系统虚拟内存一样按需分配显存,配合连续批处理和前缀缓存,吞吐与显存利用率远超原生框架。课程第 4 模块会带你实际部署并对比。
FlashAttention 是 IO 感知的精确 Attention:把计算分块(tiling),避免把整个注意力矩阵写回显存(HBM),大幅减少显存读写,长序列下又快又省显存。课程第 2 模块 Attention 机制深度里会完整推导。

啃下大模型推理岗最难的硬骨头

推理优化是性能岗核心,关注小红书「兔老板工作室」立即咨询报名。

🎓 更多系统课程
先试听后报名 · 小红书私信「兔老板工作室」咨询
📘 大模型面试突围·全栈班 🔍 RAG 检索增强实战 🤖 AI Agent 实战班 ⚙️ LLM 微调与对齐 🎯 简历 + 模拟面试 1v1
📚 免费干货 · 站内直接读: 大模型算法岗高频考点清单 · RAG 面试高频问答 · Agent 系统设计 · 大厂头部人才计划 · 大模型微调对齐考点 · 大模型推理优化考点 · 简历与项目避坑指南 · AI Infra 免费刷题题库