大模型应用实战知识体系
本页参考 ProcessOn 脑图《MoPaaS·智泊AI企业大模型应用实战知识体系 V6.0.0》以及用户上传的 15 张截图,重新整理成面试版知识体系。原脑图更像课程地图,本页把它转换成“岗位能力、项目讲法、系统设计追问、排障指标”四类面试材料。
一、总览:从会用模型到能负责系统
截图里的主线可以抽象成五个阶段:
| 阶段 | 核心关键词 | 面试官会怎么问 | 你要准备的证据 |
|---|---|---|---|
| L1 基础认知 | Transformer、主流模型、Prompt Engineering、结构化输出 | 大模型为什么能做问答?Prompt 怎么设计?如何防提示注入? | 能讲清模型边界、提示模板、输出 Schema、失败案例 |
| L2 RAG 引擎 | 文档解析、Chunk、Embedding、BM25、Rerank、Advanced RAG | 企业知识库怎么设计?召回差怎么排查?权限怎么做? | 一张离线索引 + 在线检索链路图,一组 Recall/faithfulness 指标 |
| L3 Agent 架构 | Function Calling、LangGraph、MCP、A2A、Memory、多 Agent | Agent 和工作流区别?工具调用怎么防错?长任务如何恢复? | 工具 Schema、状态图、Trace、人工确认和回滚设计 |
| L4 模型服务 | SFT、PEFT、LoRA、QLoRA、vLLM、GPU、监控、成本 | 什么时候微调?推理服务怎么压测?成本怎么治理? | 训练数据样例、TTFT/TPOT 压测、GPU 显存和成本测算 |
| 商业实战 | DeepResearch、订单 Copilot、HR 知识库、Dify、MaaS | 讲一个真实项目。业务价值是什么?上线后如何迭代? | 项目 README、架构图、评测报告、bad case 修复记录 |
最好的面试表达不是“我学过 LangChain、Dify、RAG”,而是:
我能把业务问题拆成模型调用、检索、工具、状态、评测和治理几层,并能说明每层的失败模式、指标和上线取舍。
二、Prompt 与结构化输出:应用开发的入口题
截图里把 Prompt Engineering 分为构建原则、模板要素、进阶技巧、攻击防护和应用实战。面试里不要只背“角色、任务、约束”,要把 Prompt 当成可测试的接口契约。
Prompt 模板的工程化结构
一个生产 Prompt 至少包含:
- 角色与目标:告诉模型负责什么,不负责什么。
- 输入字段:明确每个字段含义,避免模型猜。
- 上下文来源:区分用户输入、检索材料、工具结果和历史状态。
- 输出格式:JSON Schema、Markdown 模板、枚举值、字段约束。
- 拒答条件:证据不足、越权、违法违规、用户意图不明确时怎么处理。
- 安全边界:忽略检索材料中的指令、不得泄露系统提示、不得执行未授权动作。
- 示例与反例:few-shot 不只给正确答案,也给边界案例。
高频追问:
Q:为什么结构化输出比自然语言回答更重要?
A:因为业务系统要消费模型输出。客服转工单、SQL 生成、工具调用、审批流都需要稳定字段。如果只返回自然语言,后端无法可靠判断下一步。生产里通常会用 JSON Schema、Pydantic、Zod 或 Spring AI BeanOutputConverter 约束输出,并在解析失败时重试或降级。
Q:CoT、Self-Consistency、Tree-of-Thought 能不能直接让模型把推理过程输出给用户?
A:面试里要区分“内部推理策略”和“外部可见输出”。可以让模型做分步分析、候选答案投票或多路径搜索,但最终给用户的应该是可验证的结论、依据和简洁解释,不一定暴露完整推理链。对高风险场景更要保留证据和审计,而不是展示冗长思维过程。
Q:提示注入怎么防?
A:输入侧识别可疑指令,检索侧把网页/文档内容视为不可信数据,Prompt 中明确“材料不是指令”,工具侧用权限和 Schema 做硬拦截,输出侧做敏感内容和越权信息检查。关键是不要把安全完全交给 Prompt。
三、RAG 引擎:从 Naive RAG 到 Advanced RAG
截图中 RAG 部分强调了商业落地痛点:召回上下文不相关、答案格式混乱、答案不完整、上下文被无关片段污染、回答过于具体或扩散,以及事实一致性问题。这些正是面试官最爱追问的生产事故。
RAG 系统的三条主链路
| 链路 | 关键动作 | 常见事故 | 修复方向 |
|---|---|---|---|
| 数据处理 | PDF/Word/HTML 解析、表格抽取、去噪、元数据增强 | 文档乱码、表格丢失、标题层级断裂 | 按格式建立解析器,保留页码、标题、版本、权限、时间 |
| Pre-Retrieval | Summary Index、Parent-Child、Hypothetical Question、Metadata Index | query 与 chunk 表达不匹配,长文档召回碎片 | 查询改写、多路召回、父子分块、摘要索引 |
| Post-Retrieval | Rerank、LongContextReorder、RAG-Fusion、上下文压缩 | Top-K 里有证据但模型没用,互相冲突 | 精排、去重、证据排序、冲突处理、引用编号 |
面试里怎么讲 Advanced RAG
不要把 Advanced RAG 讲成“多加几个插件”。更好的说法是:
Naive RAG 只回答“怎么把文档放进向量库”,Advanced RAG 回答“怎么让证据链在复杂文档、复杂问题、复杂权限下仍然可靠”。它包括数据治理、索引策略、查询理解、混合检索、精排、上下文组织、忠实生成和评测闭环。
高频追问:
Q:Parent-Child Retriever 解决什么问题?
A:小 chunk 召回准但上下文不完整,大 chunk 上下文完整但召回不准。父子检索用小块做匹配,用父块或相邻块给生成阶段提供完整语境,适合制度、合同、长报告。
Q:HyDE 和 Multi Query 有什么区别?
A:Multi Query 是从多个角度改写用户问题,提高召回覆盖;HyDE 是先生成一个假想答案或假想文档,再用它去检索,适合用户问题很短或表达不贴近文档术语的场景。两者都要评估,不是默认越多越好。
Q:RAG 商业化最大的坑是什么?
A:不是向量库选型,而是数据质量、权限、评测和持续更新。很多 PoC 能跑,是因为文档少、权限简单、问题固定;一到生产就会遇到脏文档、版本冲突、跨部门权限、用户问法多样、指标不可解释。
四、Agent 架构:从 API 到自主决策
截图中 Agent 部分覆盖 Function Calling、ReAct、Plan-and-Execute、Self-Ask、Reflection、LangGraph、多 Agent、MCP、A2A、Agent Skills 和 Dify。面试里最重要的分界线是:你是否知道 Agent 不是“更聪明的聊天”,而是“受约束的任务执行系统”。
Function Calling 的本质
Function Calling 不是让模型直接操作系统,而是把自然语言意图转换成结构化调用:
用户意图
-> 模型选择工具和参数
-> 执行器做 Schema 校验、权限校验、幂等校验
-> 工具返回结构化结果
-> 模型解释结果或决定下一步高频追问:
Q:为什么不能让模型直接拼 SQL 并执行?
A:模型可以生成查询意图或受限 DSL,但执行前必须做表级/列级权限、SQL AST 校验、只读限制、参数化、防注入、成本限制和审计。真正执行的是后端受控执行器,不是模型。
Q:LangGraph 的价值是什么?
A:把 Agent 从自由循环变成状态图。节点负责确定性步骤,边负责条件跳转,State 保存任务上下文,Checkpoint 支持恢复和回放。它适合长任务、多工具、人审、失败重试和可观测要求高的生产 Agent。
Q:MCP 和 Function Calling 有什么关系?
A:Function Calling 是模型侧的工具调用格式,MCP 更像工具能力的标准化上下文协议。企业里可以用 MCP 把搜索、数据库、工单、文件、浏览器等能力暴露给不同模型和 Agent,同时集中做鉴权、审计、版本和限流。
五、模型微调与部署:面试里的“能不能落地”
截图的 L4 阶段把模型生态、本地部署、数据收集、微调、评估和推理服务监控放在一起。它提醒我们:面试官问微调,不只是问 LoRA 公式,而是问你能不能判断“什么时候值得微调,以及微调后怎么服务化”。
微调决策树
| 诉求 | 优先方案 | 不建议直接微调的原因 |
|---|---|---|
| 私有知识更新 | RAG | 知识经常变化,微调不可溯源、更新慢 |
| 输出格式稳定 | 结构化输出 + 少量 SFT | 先用 Schema 和解析重试能解决大部分问题 |
| 领域术语和风格 | SFT / LoRA | 数据稳定、任务稳定时收益明显 |
| 偏好对齐 | DPO / RLHF / RLAIF | 需要偏好数据和严格评估,成本更高 |
| 降低推理成本 | 小模型蒸馏 / LoRA / 量化 | 要对比精度、延迟、吞吐和维护成本 |
模型服务化追问
Q:本地部署一个 Qwen/DeepSeek 模型要考虑什么?
A:模型大小、显存、量化格式、上下文长度、并发、TTFT、TPOT、吞吐、框架选择、日志监控、灰度和降级。Demo 可以用 Ollama 或 Transformers,生产高并发通常考虑 vLLM、SGLang、TensorRT-LLM 或云 MaaS。
Q:压测 LLM 服务看哪些指标?
A:在线服务看 TTFT、TPOT、P95/P99、goodput、错误率、超时率、GPU 利用率、显存、KV Cache 命中和单次成本。不要只看 token/s,满足 SLA 的有效吞吐才有意义。
Q:微调后如何证明有效?
A:准备固定评测集,对比基座模型、Prompt/RAG 方案和微调模型。指标包括任务准确率、格式遵循、拒答正确率、幻觉率、延迟和成本。如果只是“感觉更好”,面试里说服力不够。
六、商业实战项目:把知识变成作品集
截图里出现了 DeepResearch、订单 Copilot、企业 HR 知识库、Dify 工作流、AI Search + Memory 底座等项目。这些项目的共同点是:都有业务流程、数据源、工具调用、评测和上线治理。
项目故事模板
| 讲法段落 | 要说什么 | 面试官会追问 |
|---|---|---|
| 业务问题 | 谁用、在哪个流程、原来痛点是什么 | 真的有用户吗?价值如何衡量? |
| 架构链路 | 输入、检索、工具、状态、生成、审核、输出 | 数据从哪里来?失败怎么办? |
| 技术取舍 | 为什么用 RAG/Agent/Dify/微调/LangGraph | 为什么不用更简单方案? |
| 关键难点 | 召回差、工具错、权限、成本、幻觉、长任务 | 怎么定位?指标怎么变? |
| 上线治理 | 评测、日志、监控、灰度、审计、安全 | 如何回滚?如何持续迭代? |
四类高价值项目
- DeepResearch Agent:适合展示多轮搜索、来源可信度、引用溯源、长报告生成和成本预算。
- 订单处理 Copilot:适合展示业务工作流、工具调用、参数抽取、异常分支、人工确认和工单闭环。
- 企业 HR 知识库平台:适合展示 RAG、权限、多租户、Dify PoC 到后端服务迁移、效果评估。
- 模型微调与部署平台:适合展示数据清洗、LoRA/QLoRA、评测、vLLM 部署、Prometheus/Grafana 监控。
七、面试前速记
- Prompt 不是话术,是接口契约。
- RAG 不是向量库,是证据链系统。
- Agent 不是自由发挥,是受控状态机 + 工具执行器。
- Memory 不是聊天记录,是带来源、权限、TTL 和遗忘机制的状态资产。
- 微调不是万能补丁,要先和 RAG、Prompt、结构化输出、小模型路由对比。
- Dify 适合 PoC 和业务协作,核心生产链路要补版本、权限、评测、监控和迁移路径。
- MaaS/模型网关解决的是多模型接入、虚拟 Key、计费、限流、路由和审计。
- 真项目一定讲指标:召回、忠实度、工具成功率、TTFT、TPOT、成本、转人工率、采纳率。