给正在准备大模型 / AI 方向算法岗面试的你一份自查地图:从 Transformer 原理,到 LLM 预训练、大模型微调(SFT / RLHF/DPO 对齐)、RAG、Agent、大模型推理优化(KV-Cache 与量化部署)。每一节都能点开对应的系统课程与在线工具。
为什么是 Self-Attention 而不是 RNN/LSTM?
三方面:① 长程依赖——RNN 需按序传递隐状态,距离远时梯度消失;Self-Attention 每个位置直接对所有位置建模,路径为 O(1) 跳数。② 可并行——注意力无时序依赖,可整序列并行训练;RNN 只能逐步串行。③ 表达力——注意力权重由内容相关性动态决定(Content-based),RNN 位置先验固定。
Multi-Head Attention 为什么要多头?
单头注意力的注意力分布被平均,难同时关注不同类型的依赖(语法关系、指代、语义)。多头让每个头在不同子空间投影后各自学一种关系模式,输出拼接再线性变换,拓宽模型关注不同位置子空间信息的能力。
为什么要加位置编码?RoPE 比绝对位置编码好在哪?
注意力本身无序(是集合运算),必须注入位置。绝对位置编码把位置加进 embedding;RoPE 用旋转矩阵把相对位置编码进内积——让注意力分数只依赖相对位移,对长度外推更友好,现已成为 LLaMA/Qwen 等主流选择。
训练时为什么用 teacher forcing / CrossEntropy 而不是直接优化最终答案?
自回归把序列建模分解为逐个 next-token 的最大似然(teacher forcing:每一步用真实上文预测下一个 token),可完全并行且目标稳定;直接对整段输出做判别式优化无法提供逐 token 的监督信号。代价是训练/推理不一致(exposure bias),常用课程学习与解码增强缓解。
SFT 和预训练、指令微调的区别?
预训练学通用语言分布(海量无标注,next-token);SFT 用高质量指令-回答对学"按指令回答"的行为;对齐(RLHF/DPO)进一步对齐人类偏好——分得清"能说"和"该说"。
LoRA / QLoRA 为什么能省显存?
冻结原权重 W,只学低秩增量 ΔW=BA(B∈R^{d×r}, A∈R^{r×k}, r≪d),参与前向/反向的显存和可训练参数量大降。QLoRA 再把底座权重量化到 4bit(NF4)并做双重量化,进一步省显存,微调一个 7B 可在单张消费级显卡完成。
RLHF 的 reward model 和 PPO 大致流程?为什么现在 DPO 更常用?
RLHF:① 训 RM(对同一个 prompt 的多条回答打分,学人类偏好);② 用 PPO 以 RM 为奖励优化策略,同时加 KL 惩罚防止偏离 SFT。RM 标定难、PPO 训练不稳,因此出现 DPO——把偏好直接写成策略的隐式奖励,只用偏好数据做一次分类式训练即可对齐,稳定且省资源。
为什么需要 RAG?什么场景适合?
LLM 知识有截止时间、会幻觉、无法覆盖私有/垂直知识。RAG 用"检索→拼接→生成"把外部知识喂给模型,适合知识更新快、需引用出处、对事实准确性要求高的场景(客服、问答、内部文档)。需要低延迟、强推理、无需外部资料的场景则未必划算。
RAG 效果差通常差在哪几个环节?
主要在检索端:切块不合理、embedding 与领域不匹配、Top-K 取到不相关片段、重排缺失;生成端:上下文过长稀释注意力、模型被不相关片段误导。工程上先做离线评测(召回率/命中率/答案正确率)定位是 recall 问题还是 generation 问题再对症下药。
Agent 的核心能力是什么?与单纯调用 LLM 的区别?
Agent = 大模型 + 工具调用 + 规划 + 记忆 + 执行闭环:模型决定"下一步调用哪个工具/给什么参数",根据工具返回再决定后续,从而能完成多步真实任务。单纯 chat 只做"一段文本→一段文本",无法操作外部系统。
常见的 Agent 范式有哪些?
ReAct(思考-行动-观察交替)、Function Calling / Tool Calling(结构化工具接口)、LangGraph 式的图/状态机编排、多 Agent 协作(规划者-执行者-评审者)。面试常考:多步任务的错误恢复、工具参数幻觉、Agent 循环失控的护栏设计。
KV-Cache 是什么?显存和算力各省了什么?
自回归解码每步只需新 token 的 Q,与历史 K/V 算注意力。把已算过的 K/V 缓存复用,避免每步重算全部历史,算力大省。代价是显存随上下文增长(每 token 约 2×层×头维×精度 bytes),因此有 PagedAttention/vLLM 的 KV 管理优化。
Prefill 和 Decode 阶段的瓶颈有何不同?
Prefill 是 compute-bound(大量矩阵乘并行);Decode 是 memory-bound(每步只算一个 token,带宽受限)。所以优化手段不同:prefill 靠算子/张量并行,decode 靠 KV-Cache、批处理(continuous batching)、量化降带宽、投机解码(Speculative Decoding)减少串行步数。
FlashAttention / GPTQ / AWQ 各自解决什么问题?
FlashAttention:用 IO-aware 分块避免写回 HBM 的整矩阵,省显存且加速注意力。GPTQ/AWQ:都是权重量化到 4bit 来降显存与带宽;GPTQ 基于二阶信息做逐层误差补偿,AWQ 按激活敏感度保护重要通道,推理无需反量化回高精度。
覆盖大模型算法岗 / 应用工程师 / 推理优化岗的共面考点。偏 Agent/RAG 应用方向重点看三、四节;偏训练对齐看二节;偏部署看五节;目标算法岗建议按全栈班逐方向系统过。
清单帮你自查"漏了哪些考点",但面试要的是"答得深 + 项目讲得清"。课程配 200+ 真题精讲、手推练习(Attention 推导、复杂度)和全真模拟面试,把清单变成面试现场的发挥。
关注小红书「兔老板工作室」,私信「资料」即可免费领取大厂面试真题精选 PDF,永久免费、无套路、不用留手机号。
2 次 30 分钟简历深度优化 + 1 次 60 分钟全真模拟面试,面试后 24 小时交付书面反馈(逐题评分 + 可复用话术)。微信约定时间即可,见「简历 + 模拟面试 1v1」。
考点不分地域通用。两条路看目标:打算回国投国内大厂 → 按国内秋招/春招时间线倒排,分模块过完并练中文技术表达;打算留当地(北美/新加坡/日本等)→ 底层 LLM/Agent/RAG 知识通用,额外把项目经历准备成能用英文(或当地语言)流利讲的口径。考前冲刺可约 1v1 模拟面试,微信远程约时间即可。
📚 免费系列长文:大模型算法岗高频考点清单 · RAG 面试 10 问 · Agent 系统设计思路 · 大模型微调对齐考点 · 大模型推理优化考点 · 大厂头部人才计划对比 · 简历与项目避坑指南 · 美国留学华人AI求职 · AI Infra 免费刷题题库