Skip to content

大模型应用实战知识体系

本页参考 ProcessOn 脑图《MoPaaS·智泊AI企业大模型应用实战知识体系 V6.0.0》以及用户上传的 15 张截图,重新整理成面试版知识体系。原脑图更像课程地图,本页把它转换成“岗位能力、项目讲法、系统设计追问、排障指标”四类面试材料。

大模型应用实战面试路线图

一、总览:从会用模型到能负责系统

截图里的主线可以抽象成五个阶段:

阶段核心关键词面试官会怎么问你要准备的证据
L1 基础认知Transformer、主流模型、Prompt Engineering、结构化输出大模型为什么能做问答?Prompt 怎么设计?如何防提示注入?能讲清模型边界、提示模板、输出 Schema、失败案例
L2 RAG 引擎文档解析、Chunk、Embedding、BM25、Rerank、Advanced RAG企业知识库怎么设计?召回差怎么排查?权限怎么做?一张离线索引 + 在线检索链路图,一组 Recall/faithfulness 指标
L3 Agent 架构Function Calling、LangGraph、MCP、A2A、Memory、多 AgentAgent 和工作流区别?工具调用怎么防错?长任务如何恢复?工具 Schema、状态图、Trace、人工确认和回滚设计
L4 模型服务SFT、PEFT、LoRA、QLoRA、vLLM、GPU、监控、成本什么时候微调?推理服务怎么压测?成本怎么治理?训练数据样例、TTFT/TPOT 压测、GPU 显存和成本测算
商业实战DeepResearch、订单 Copilot、HR 知识库、Dify、MaaS讲一个真实项目。业务价值是什么?上线后如何迭代?项目 README、架构图、评测报告、bad case 修复记录

最好的面试表达不是“我学过 LangChain、Dify、RAG”,而是:

我能把业务问题拆成模型调用、检索、工具、状态、评测和治理几层,并能说明每层的失败模式、指标和上线取舍。

二、Prompt 与结构化输出:应用开发的入口题

截图里把 Prompt Engineering 分为构建原则、模板要素、进阶技巧、攻击防护和应用实战。面试里不要只背“角色、任务、约束”,要把 Prompt 当成可测试的接口契约。

Prompt 模板的工程化结构

一个生产 Prompt 至少包含:

  1. 角色与目标:告诉模型负责什么,不负责什么。
  2. 输入字段:明确每个字段含义,避免模型猜。
  3. 上下文来源:区分用户输入、检索材料、工具结果和历史状态。
  4. 输出格式:JSON Schema、Markdown 模板、枚举值、字段约束。
  5. 拒答条件:证据不足、越权、违法违规、用户意图不明确时怎么处理。
  6. 安全边界:忽略检索材料中的指令、不得泄露系统提示、不得执行未授权动作。
  7. 示例与反例:few-shot 不只给正确答案,也给边界案例。

高频追问:

Q:为什么结构化输出比自然语言回答更重要?
A:因为业务系统要消费模型输出。客服转工单、SQL 生成、工具调用、审批流都需要稳定字段。如果只返回自然语言,后端无法可靠判断下一步。生产里通常会用 JSON Schema、Pydantic、Zod 或 Spring AI BeanOutputConverter 约束输出,并在解析失败时重试或降级。

Q:CoT、Self-Consistency、Tree-of-Thought 能不能直接让模型把推理过程输出给用户?
A:面试里要区分“内部推理策略”和“外部可见输出”。可以让模型做分步分析、候选答案投票或多路径搜索,但最终给用户的应该是可验证的结论、依据和简洁解释,不一定暴露完整推理链。对高风险场景更要保留证据和审计,而不是展示冗长思维过程。

Q:提示注入怎么防?
A:输入侧识别可疑指令,检索侧把网页/文档内容视为不可信数据,Prompt 中明确“材料不是指令”,工具侧用权限和 Schema 做硬拦截,输出侧做敏感内容和越权信息检查。关键是不要把安全完全交给 Prompt。

三、RAG 引擎:从 Naive RAG 到 Advanced RAG

截图中 RAG 部分强调了商业落地痛点:召回上下文不相关、答案格式混乱、答案不完整、上下文被无关片段污染、回答过于具体或扩散,以及事实一致性问题。这些正是面试官最爱追问的生产事故。

RAG 系统的三条主链路

链路关键动作常见事故修复方向
数据处理PDF/Word/HTML 解析、表格抽取、去噪、元数据增强文档乱码、表格丢失、标题层级断裂按格式建立解析器,保留页码、标题、版本、权限、时间
Pre-RetrievalSummary Index、Parent-Child、Hypothetical Question、Metadata Indexquery 与 chunk 表达不匹配,长文档召回碎片查询改写、多路召回、父子分块、摘要索引
Post-RetrievalRerank、LongContextReorder、RAG-Fusion、上下文压缩Top-K 里有证据但模型没用,互相冲突精排、去重、证据排序、冲突处理、引用编号

面试里怎么讲 Advanced RAG

不要把 Advanced RAG 讲成“多加几个插件”。更好的说法是:

Naive RAG 只回答“怎么把文档放进向量库”,Advanced RAG 回答“怎么让证据链在复杂文档、复杂问题、复杂权限下仍然可靠”。它包括数据治理、索引策略、查询理解、混合检索、精排、上下文组织、忠实生成和评测闭环。

高频追问:

Q:Parent-Child Retriever 解决什么问题?
A:小 chunk 召回准但上下文不完整,大 chunk 上下文完整但召回不准。父子检索用小块做匹配,用父块或相邻块给生成阶段提供完整语境,适合制度、合同、长报告。

Q:HyDE 和 Multi Query 有什么区别?
A:Multi Query 是从多个角度改写用户问题,提高召回覆盖;HyDE 是先生成一个假想答案或假想文档,再用它去检索,适合用户问题很短或表达不贴近文档术语的场景。两者都要评估,不是默认越多越好。

Q:RAG 商业化最大的坑是什么?
A:不是向量库选型,而是数据质量、权限、评测和持续更新。很多 PoC 能跑,是因为文档少、权限简单、问题固定;一到生产就会遇到脏文档、版本冲突、跨部门权限、用户问法多样、指标不可解释。

四、Agent 架构:从 API 到自主决策

截图中 Agent 部分覆盖 Function Calling、ReAct、Plan-and-Execute、Self-Ask、Reflection、LangGraph、多 Agent、MCP、A2A、Agent Skills 和 Dify。面试里最重要的分界线是:你是否知道 Agent 不是“更聪明的聊天”,而是“受约束的任务执行系统”。

Function Calling 的本质

Function Calling 不是让模型直接操作系统,而是把自然语言意图转换成结构化调用:

text
用户意图
  -> 模型选择工具和参数
  -> 执行器做 Schema 校验、权限校验、幂等校验
  -> 工具返回结构化结果
  -> 模型解释结果或决定下一步

高频追问:

Q:为什么不能让模型直接拼 SQL 并执行?
A:模型可以生成查询意图或受限 DSL,但执行前必须做表级/列级权限、SQL AST 校验、只读限制、参数化、防注入、成本限制和审计。真正执行的是后端受控执行器,不是模型。

Q:LangGraph 的价值是什么?
A:把 Agent 从自由循环变成状态图。节点负责确定性步骤,边负责条件跳转,State 保存任务上下文,Checkpoint 支持恢复和回放。它适合长任务、多工具、人审、失败重试和可观测要求高的生产 Agent。

Q:MCP 和 Function Calling 有什么关系?
A:Function Calling 是模型侧的工具调用格式,MCP 更像工具能力的标准化上下文协议。企业里可以用 MCP 把搜索、数据库、工单、文件、浏览器等能力暴露给不同模型和 Agent,同时集中做鉴权、审计、版本和限流。

五、模型微调与部署:面试里的“能不能落地”

截图的 L4 阶段把模型生态、本地部署、数据收集、微调、评估和推理服务监控放在一起。它提醒我们:面试官问微调,不只是问 LoRA 公式,而是问你能不能判断“什么时候值得微调,以及微调后怎么服务化”。

微调决策树

诉求优先方案不建议直接微调的原因
私有知识更新RAG知识经常变化,微调不可溯源、更新慢
输出格式稳定结构化输出 + 少量 SFT先用 Schema 和解析重试能解决大部分问题
领域术语和风格SFT / LoRA数据稳定、任务稳定时收益明显
偏好对齐DPO / RLHF / RLAIF需要偏好数据和严格评估,成本更高
降低推理成本小模型蒸馏 / LoRA / 量化要对比精度、延迟、吞吐和维护成本

模型服务化追问

Q:本地部署一个 Qwen/DeepSeek 模型要考虑什么?
A:模型大小、显存、量化格式、上下文长度、并发、TTFT、TPOT、吞吐、框架选择、日志监控、灰度和降级。Demo 可以用 Ollama 或 Transformers,生产高并发通常考虑 vLLM、SGLang、TensorRT-LLM 或云 MaaS。

Q:压测 LLM 服务看哪些指标?
A:在线服务看 TTFT、TPOT、P95/P99、goodput、错误率、超时率、GPU 利用率、显存、KV Cache 命中和单次成本。不要只看 token/s,满足 SLA 的有效吞吐才有意义。

Q:微调后如何证明有效?
A:准备固定评测集,对比基座模型、Prompt/RAG 方案和微调模型。指标包括任务准确率、格式遵循、拒答正确率、幻觉率、延迟和成本。如果只是“感觉更好”,面试里说服力不够。

六、商业实战项目:把知识变成作品集

截图里出现了 DeepResearch、订单 Copilot、企业 HR 知识库、Dify 工作流、AI Search + Memory 底座等项目。这些项目的共同点是:都有业务流程、数据源、工具调用、评测和上线治理。

项目故事模板

讲法段落要说什么面试官会追问
业务问题谁用、在哪个流程、原来痛点是什么真的有用户吗?价值如何衡量?
架构链路输入、检索、工具、状态、生成、审核、输出数据从哪里来?失败怎么办?
技术取舍为什么用 RAG/Agent/Dify/微调/LangGraph为什么不用更简单方案?
关键难点召回差、工具错、权限、成本、幻觉、长任务怎么定位?指标怎么变?
上线治理评测、日志、监控、灰度、审计、安全如何回滚?如何持续迭代?

四类高价值项目

  1. DeepResearch Agent:适合展示多轮搜索、来源可信度、引用溯源、长报告生成和成本预算。
  2. 订单处理 Copilot:适合展示业务工作流、工具调用、参数抽取、异常分支、人工确认和工单闭环。
  3. 企业 HR 知识库平台:适合展示 RAG、权限、多租户、Dify PoC 到后端服务迁移、效果评估。
  4. 模型微调与部署平台:适合展示数据清洗、LoRA/QLoRA、评测、vLLM 部署、Prometheus/Grafana 监控。

七、面试前速记

  • Prompt 不是话术,是接口契约。
  • RAG 不是向量库,是证据链系统。
  • Agent 不是自由发挥,是受控状态机 + 工具执行器。
  • Memory 不是聊天记录,是带来源、权限、TTL 和遗忘机制的状态资产。
  • 微调不是万能补丁,要先和 RAG、Prompt、结构化输出、小模型路由对比。
  • Dify 适合 PoC 和业务协作,核心生产链路要补版本、权限、评测、监控和迁移路径。
  • MaaS/模型网关解决的是多模型接入、虚拟 Key、计费、限流、路由和审计。
  • 真项目一定讲指标:召回、忠实度、工具成功率、TTFT、TPOT、成本、转人工率、采纳率。

继续阅读

基于 MIT 许可发布