2026 Agent 岗面试基本绕不开这几板斧:先讲清"Agent 到底是什么、和 chat 差在哪",再拆范式(ReAct / Function Calling / LangGraph / MCP),最后是拉开差距的 Agent 系统设计手撕题——本文把每层的高频问法 + 答题骨架给你列出来。
Agent 和普通 LLM 应用的本质区别?必答
普通 LLM 应用是"一段输入→一段输出",模型不对外部世界负责。Agent 是"感知(读状态)→决策(规划下一步)→行动(调用工具/改状态)→再感知"的闭环:模型反复输出工具调用并消费工具返回,直到完成任务。核心增量是 工具调用 + 循环执行 + 状态管理,而不是模型本身。
LLM 在 Agent 里扮演什么角色?Agent 一定需要很强的模型吗?必答
模型是"决策大脑":负责意图理解、规划、生成工具参数、解读结果。任务难度决定模型下限——写一句文案小模型够用,但多步推理、长任务纠错、复杂工具参数合成需要大模型。工程上常"大模型做规划和判断 + 小模型/规则做高频重复步骤"来控成本。
ReAct 是什么?为什么"思考-行动-观察"循环有用?必答
ReAct(Reasoning + Acting)让模型交替输出 Thought / Action / Observation:Thought 决定要查什么、Action 调用工具、Observation 看返回,形成可纠错的轨迹。相比"一步到底",它把推理和工具使用揉进同一轨迹,遇到错误能从 Observation 里修正下一步,行为可解释、易追责。
Function Calling / Tool Calling 和 ReAct 的关系?必答
Tool Calling 是把工具以 JSON Schema 形式注册给模型、模型返回结构化调用(工具名+参数)的接口能力;ReAct 是"用不用工具、怎么循环"的宏观范式。两者配合:Tool Calling 提供稳定参数格式,ReAct 决定调用节奏。要答出的坑是工具参数幻觉——模型可能编造参数,需要 schema 约束 + 枚举校验 + 调用结果回填。
LangGraph / 图式编排解决了什么?MCP 协议解决什么?进阶
LangGraph 把 Agent 建模成状态机/图:节点=某一步(LLM/工具/人工审批),边=条件转移,适合需要"人工确认、循环上限、分支恢复"的生产流程,比纯自由循环可控。MCP 是把"工具怎么暴露给模型"标准化(类似 USB-C 接口:一次接入处处可用),解决工具生态碎片化——服务方提供 MCP server,Agent 客户端直接发现并调用。
Agent 的"记忆"分哪几层?分别存在哪?进阶
三层:① 上下文/工作记忆——当前轮对话与中间结果,放 prompt 窗口;② 会话记忆——多轮历史,可做摘要压缩防超窗;③ 长期记忆——跨会话的用户画像/任务档案,常用向量库存并检索。面试要点是讲清"什么该进窗口、什么该落库、什么时候检索",以及防止记忆污染(过期/矛盾信息进上下文)。
长任务(几十步)最容易在哪些环节崩?怎么兜底?进阶
最容易:上下文无限膨胀(中间产物堆满窗口)、错误累积(一步错后面全错)、循环卡死(反复做同一件事)、外部依赖失败(接口超时/格式变)。兜底手段:中间结果落盘+只带摘要进窗口、每步设最大尝试次数与超时、检测"动作不再改变状态"就中断、失败降级(重试→简化→人工接管)。
什么时候需要多 Agent,而不是一个 Agent + 一堆工具?进阶
单一 Agent 任务过长会上下文爆炸、prompt 互相干扰。拆多 Agent 的价值是隔离上下文与职责:规划者拆解任务、执行者各干一段、评审者挑错,各自窗口干净、可独立评测。代价是编排复杂度和成本上升。判断标准:单 Agent 的上下文里是否混入了太多本不需要"互相看见"的信息——是,才拆。
多 Agent 怎么协作?怎么防止失控?进阶
常见拓扑:管道式(A→B→C)、规划-执行式(planner 出计划、executor 执行、critic 验收回炉)、层级式(主 Agent 带子 Agent)。护栏:全局限流与循环上限、每步输出过 schema 校验、敏感操作必须人工确认、成本/次数预算控制。"让 Agent 自己自由对话"在生产里几乎是灾难,可控 > 炫技。
"设计一个客服 Agent"——你从哪几层答?加分
按"输入→理解→检索→行动→回复→护栏"铺:① 知识/意图:先 RAG 查 FAQ 与订单库,意图路由决定走自助还是转人工;② 工具:查订单/改地址/退款申请等,用 Tool Calling + 参数校验 + 幂等;③ 记忆:会话摘要 + 用户档案(会员等级/历史订单);④ 护栏:涉及金钱/隐私的操作一律先给结论再人工确认,退款走审批;⑤ 评测:意图命中率、工具成功率、转人工率、满意度,配 bad case 回流。
"代码 Agent 会写出不可靠的代码"怎么防?加分
代码类 Agent 的核心是把"生成"和"验证"分开:生成后必须在沙箱里跑测试/静态检查,失败信息回喂让模型修(self-repair 循环,设最大次数);约束改动范围(只改指定函数)、不允许逃逸沙箱执行任意命令;用"测试通过率 + 人类 review 抽样"做评测,而不是肉眼觉得代码像样。
Agent 上线怎么评测?和普通 RAG/chat 评测有何不同?加分
Agent 是多步交互,单轮指标不够。要评:任务成功率(端到端有没有完成目标)、工具调用正确率与参数错误率、平均步数与成本、循环失控率、以及过程可控性(有没有触发护栏/需要人工介入的次数)。轨迹级评测常"先自动打分(LLM-as-Judge + 规则校验)再人工抽样确认",本站在线即有 Agent 评测岗学习材料可体验这套口径。
面向 AI 应用工程师 / Agent 工程师 / 大模型应用岗。偏算法岗则在此基础上叠加模型侧知识(见「大模型算法岗面试高频考点清单」)。
按本文自查概念,再挑一个真实任务(如自动写文案/查资料汇总)用 LangGraph 或裸 Tool Calling 搭一遍,跑通"工具→循环→护栏→评测",面试用你自己的实现和踩坑讲,比背名词有说服力。
关注小红书「兔老板工作室」,私信「资料」免费领真题 PDF;在线可体验「AI 短剧工坊」(多步 Agent 流水线)与「Agent 评测岗学习材料」(轨迹评测)。
没有国内实习不影响:Agent 岗面试更看重你自己跑通的项目。挑一个真实任务(自动写文案/资料汇总/评测脚本),用 LangGraph 或裸 Tool Calling 搭完整链路并量化效果,面试就把这条链路讲成「从 0 到 1 做过」的硬项目;能用中英双语讲更稳。需要系统带练的可微信远程约课。
📚 免费系列长文:大模型算法岗高频考点清单 · RAG 面试 10 问 · 大模型微调对齐考点 · 大模型推理优化考点 · 大厂头部人才计划对比 · 简历与项目避坑指南 · 美国留学华人AI求职 · AI Infra 免费刷题题库