# FDE W1D3 评测题 · 模型选型与技术边界

> 配套手册：`FDE-W1D3-模型选型与技术边界-学习手册.html`
> 候选人背景：36 岁，Java + 大数据 + 医疗保险行业。场景示例围绕医疗保险 / 特药理赔 / 保险知识库。
> 满分 **117** 分。达标线：**≥ 90 分**（且 L4 场景题两题均不得 0 分）。

---

## L1 基础（Q1–Q3，每题 5 分，共 15 分）

### Q1（5 分）选型杠杆排序
**题目**：请按"改动成本从低到高"列出 FDE 在方案设计时可组合使用的 6 种技术杠杆，并各用一句话说明它解决什么。

- **考察点**：对"分层技术杠杆"的整体认知，是否建立"先轻后重"的选型直觉。
- **评分维度**：
  - 顺序正确（低成本在前）：优化 Prompt → 规则引擎 → RAG → 小模型/本地 → 闭源大模型 → 微调（4 分）
  - 每种一句话说明到位（1 分，答对 5 种即给满）
- <details>
  <summary>参考答案</summary>

  1. **优化 Prompt**（零代码，改输入文本，成本最低）
  2. **规则引擎**（确定性 if-else/正则/查表，零不确定性）
  3. **RAG**（外接知识库，补私有/变动知识）
  4. **小模型/本地模型**（7B~14B 本地推理，省成本保隐私）
  5. **闭源大模型 API**（能力上限高，但贵且出域）
  6. **微调**（改模型权重，固化能力/风格，成本最高）

  关键：六种可叠加成混合栈，不是互斥。
  </details>

### Q2（5 分）决策树第一跳
**题目**：面对一个业务需求，你做选型的"第一判断节点"是什么？请给出该节点的两个分支及各自后续走向。

- **考察点**：决策树的根节点——"要不要模型"。
- **评分维度**：
  - 正确说出根节点是"是否需要模型做语义理解/生成"（2 分）
  - 两个分支：否→规则引擎；是→进入知识/能力/约束判断（3 分）
- <details>
  <summary>参考答案</summary>

  根节点：**这个活要不要模型干（是否需要语义理解/生成/泛化）？**
  - **否** → 规则引擎 / 查表 / 正则（确定性问题，零不确定性）。
  - **是** → 继续问：知识是否私有/常变/需溯源？（是→RAG）→ 是否改固有能力/风格？（是→微调）→ 成本/隐私敏感？（是→小模型/本地）→ 否则闭源大模型+Prompt。
  </details>

### Q3（5 分）维度识别
**题目**：选型时要从 8 个维度打分权衡。请写出这 8 个维度的名称。

- **考察点**：选型维度全景的记忆完整度。
- **评分维度**：写出 6 个得 3 分，8 个全对得 5 分。
- <details>
  <summary>参考答案</summary>

  ① 准确率/效果 ② 延迟 ③ Token 成本 ④ 上下文长度 ⑤ 数据安全 ⑥ 部署复杂度 ⑦ 并发吞吐 ⑧ 多模态。
  </details>

---

## L2 进阶（Q4–Q7，每题 8 分，共 32 分）

### Q4（8 分）RAG vs 微调
**题目**：请用一个表格或对比清单，说清 RAG 与微调在"解决什么、知识更新、数据隐私、成本、幻觉控制"五个维度的差异。

- **考察点**：两个最易混淆方案的本质区别，面试高频。
- **评分维度**：
  - 解决什么：RAG=知识型，微调=能力/风格型（2 分）
  - 知识更新：RAG 改库即可，微调需重训（2 分）
  - 数据隐私：RAG 可控，微调权重可能泄漏需脱敏（1.5 分）
  - 成本：RAG 低，微调高（1 分）
  - 幻觉控制：RAG 可溯源较好，微调更难排查（1.5 分）
- <details>
  <summary>参考答案</summary>

  | 维度 | RAG | 微调 |
  |---|---|---|
  | 解决什么 | 知识型（知道什么） | 能力/风格型（怎么做） |
  | 知识更新 | 改知识库即可 | 需重训，成本高 |
  | 数据隐私 | 知识在库内，可控 | 权重可能"记住"训练数据，需脱敏 |
  | 成本/周期 | 低（只接检索） | 高（标注+训练+评估+维护） |
  | 幻觉控制 | 可溯源，较好 | 仍可能幻觉，更难排查 |

  口诀：**能 RAG 不微调**。RAG 救"不知道"，微调救"不会做/不稳"。
  </details>

### Q5（8 分）规则引擎的定位
**题目**：在保险理赔系统里，规则引擎应该放在什么位置、起什么作用？请结合"前置"和"后置"说明。

- **考察点**：规则引擎不是替代模型，而是模型的护栏。
- **评分维度**：
  - 前置路由/拦截：明显不符资格的请求直接拦掉，省模型成本（4 分）
  - 后置校验：对模型抽取字段做范围/格式/业务合法性校验（4 分）
- <details>
  <summary>参考答案</summary>

  - **前置（路由+拦截）**：对"明显不符合资格""输入可穷举"的请求直接规则处理，不调模型，省钱且确定。
  - **后置（校验护栏）**：模型输出（如抽取的金额、保单号、风险等级）先过规则校验再放行，保证金额计算、资格校验精确不容错。
  - 模型负责"语义理解"，规则负责"精确兜底"。
  </details>

### Q6（8 分）小模型/本地模型适用条件
**题目**：什么情况下应该用小模型或本地部署模型？请说出至少 3 个适用条件，并解释"小模型打底+大模型兜底"的路由架构。

- **考察点**：成本优化与数据合规的杠杆理解。
- **评分维度**：
  - 3 个适用条件（简单任务/高并发低成本/数据不出域/低延迟），每点 1.5 分（共 4.5 分）
  - 路由架构解释：简单请求小模型扛，复杂/低置信路由大模型（3.5 分）
- <details>
  <summary>参考答案</summary>

  适用条件：① 简单任务（分类/抽取/意图识别）；② 高并发低成本（成本可低至大模型 1/50）；③ 数据不可出域（医保/金融强监管）；④ 低延迟/离线（边缘、内网）。
  路由架构：`请求 → 小模型/规则先处理简单 case → 置信度低或复杂 → 路由到大模型 → 大模型结果回填`。用本地小模型扛 80% 简单请求，既省钱又保隐私，只对复杂/高风险请求调闭源大模型。
  </details>

### Q7（8 分）闭源 vs 开源
**题目**：闭源 API 与开源自托管模型，在"能力上限、数据隐私、成本模型、运维"四个维度上各有什么取舍？强监管行业（如医保）通常因此被迫怎么选？

- **考察点**：架构受合规约束倒推的意识。
- **评分维度**：
  - 四维度对比（每点 1.5 分，共 6 分）
  - 强监管结论：被迫开源自托管或闭源+严格脱敏（2 分）
- <details>
  <summary>参考答案</summary>

  | 维度 | 闭源 API | 开源自托管 |
  |---|---|---|
  | 能力上限 | 高 | 中（旗舰级在追赶） |
  | 数据隐私 | 出域风险 | 完全可控 |
  | 成本模型 | 按量付费（规模化贵） | 固定算力（规模化便宜） |
  | 运维 | 零 | 需 GPU/工程团队 |

  强监管（医保/金融）数据不可出域是硬约束，常被迫走**开源自托管**或**闭源 + 严格脱敏 + 合规审查**。"合规红线定架构，能力需求定模型"。
  </details>

---

## L3 深度（Q8–Q11，每 12 分，共 48 分）

### Q8（12 分）完整决策树口述
**题目**：请完整口述"给定一个需求，如何一步步决定用哪种方案"的决策树（含每个判断节点的分支条件与最终落点）。

- **考察点**：达标线①——决策树的完整性与流畅度。
- **评分维度**：
  - 根节点（要不要模型）（2 分）
  - 知识属性判断 → RAG（2 分）
  - 能力属性判断 → 微调（2 分）
  - 约束判断（成本/隐私）→ 小模型/本地（2 分）
  - 否则闭源+Prompt（1 分）
  - 收尾：混合栈 + "能不调模型就不调，能 RAG 不微调"（3 分）
- <details>
  <summary>参考答案</summary>

  1. 要不要模型做语义理解？**否→规则引擎**。
  2. **是**→ 知识是否私有/常变/需溯源？**是→RAG**。
  3. 否→ 是否要改变模型固有行为/风格且 Prompt 已穷尽？**是→微调**。
  4. 否→ 成本/延迟/隐私敏感？**是→小模型/本地模型**。
  5. 否则→ **闭源大模型 + 优化 Prompt**。
  6. 收尾：真实系统是混合栈（规则+RAG+大模型+小模型+转人工），FDE 要阻止过度工程——**能不调模型就不调，能 Prompt 不 RAG，能 RAG 不微调**。
  </details>

### Q9（12 分）RAG 的局限与命门
**题目**：有人说"上了 RAG 就解决了幻觉"。请批判这个观点，说清 RAG 的三个局限，并解释为什么"检索质量决定 RAG 的上限"。

- **考察点**：对 RAG 不盲目崇拜，理解其真实边界。
- **评分维度**：
  - 批判"RAG 解决一切幻觉"的错误（2 分）
  - 局限1：检索质量决定上限，召回错更危险（4 分）
  - 局限2：不补推理能力（2 分）
  - 局限3：索引需随数据同步更新（2 分）
  - 总结：RAG 补知识不补能力（2 分）
- <details>
  <summary>参考答案</summary>

  错误：RAG 只缓解"知识型幻觉"，不解决"能力型错误"，且引入检索链路本身有风险。
  三个局限：
  1. **检索质量决定上限**——召回噪声比没有检索更危险，因为模型被错误文档"带偏"还显得"有依据"。需重视切片策略、混合检索、重排。
  2. **不补推理能力**——复杂多跳推理仍需模型能力或 Agent 编排。
  3. **索引需同步更新**——数据变了索引不变，检索到旧知识。
  结论：RAG 补"知识"不补"能力"，其天花板由检索质量决定。
  </details>

### Q10（12 分）微调的坑与适用边界
**题目**：列举微调（Fine-tuning）至少 4 个风险/坑，并说清"什么情况下才该考虑微调"以及"微调与 RAG 如何互补而非替代"。

- **考察点**：对微调的审慎态度与互补架构理解。
- **评分维度**：
  - 4 个坑（灾难性遗忘/数据质量>数量/救不了"不知道"/隐私泄漏/维护成本高，每点 1.5 分，共 6 分）
  - 适用边界：改能力/风格且 Prompt 穷尽、数据充足、长期复用（3 分）
  - 互补：RAG 补知识 + 微调固能力（3 分）
- <details>
  <summary>参考答案</summary>

  4 个坑：
  1. **灾难性遗忘**——可能把通用能力搞退化。
  2. **数据质量 >> 数量**——脏数据会固化坏行为。
  3. **救不了"不知道"**——只救"不会做/不稳"，知识型问题它无能为力。
  4. **隐私泄漏**——训练数据可能进权重，需脱敏。
  5. （补充）维护成本高，模型升级要重训。
  适用边界：需要模型稳定学会某种输出格式/语气/领域推理路径，且 Prompt 已穷尽、数据充足、长期高频复用。
  互补：RAG 补知识 + 微调固能力，二者可叠加而非替代。
  </details>

### Q11（12 分）混合栈架构设计
**题目**：为一个"医疗保险智能客服 + 理赔初审"系统设计技术混合栈，要求覆盖：身份校验、政策问答、材料抽取、复杂申诉判定、转人工。请画出分层架构并解释每层选型理由。

- **考察点**：把 8 维度 + 决策树落到真实系统的综合能力。
- **评分维度**：
  - 分层合理（规则前置/路由、RAG 政策问答、大模型抽取、复杂判定、转人工）（6 分）
  - 每层选型理由（数据安全、成本、准确率权衡）（4 分）
  - 点出混合栈与红线优先（2 分）
- <details>
  <summary>参考答案</summary>

  ```
  用户请求
   → [规则引擎] 身份/资格前置校验（确定逻辑，省钱）
   → [RAG] 医保政策问答（知识私有常变，需溯源）
   → [本地小模型] 材料字段抽取（简单、数据不出域）
   → [大模型] 复杂申诉/拒付判定（附引用，低 T 结构化）
   → [规则引擎] 金额/边界后置校验（精确兜底）
   → 存疑/低置信 → 转人工
  ```
  理由：身份/金额用规则保证精确与合规；政策用 RAG 保证时效与可溯源；抽取用小模型保隐私降成本；复杂判定才用大模型；数据不出域贯穿（本地/脱敏）。红线（合规、精确）优先，能力需求决定模型。
  </details>

---

## L4 场景（Q12–Q13，每 11 分，共 22 分）

### Q12（11 分）【场景】特药理赔为什么选 RAG 而非微调
**题目**：某医保公司要做"特药理赔审核"，特药目录和报销政策每月更新、需向监管溯源、含患者健康隐私。请论证：为什么这个场景选 RAG 而不是微调？请从至少 4 个角度展开。

- **考察点**：达标线②——知识型问题选型的实战论证。
- **评分维度**：
  - 知识性质（知识型非能力型）（3 分）
  - 更新频率（每月变，RAG 改库即可）（3 分）
  - 数据隐私（知识留库内，微调有泄漏风险）（2 分）
  - 可溯源（RAG 附引用合规，微调难溯源）（2 分）
  - 成本（RAG 免训练）（1 分）
- <details>
  <summary>参考答案</summary>

  1. **知识性质**：目录/政策是"知识"不是"能力"，RAG 补知识正合适；微调解决能力，解决不了"知不知道最新目录"。
  2. **更新频率**：每月变，RAG 改知识库即可、模型不动；微调需重训，更新成本极高。
  3. **数据隐私**：知识留在库内可控；微调把数据进权重，有泄漏患者信息风险。
  4. **可溯源**：RAG 每条结论可附政策原文引用，合规友好；微调后知识"内化"难溯源。
  5. **成本**：RAG 接检索即可，无需标注训练。
  若还需"稳定用某种医学判定风格"，才在 RAG 之上叠加微调专用小模型，二者互补。
  </details>

### Q13（11 分）【场景】选型误判复盘
**题目**：团队最初决定"用微调让模型学会本公司所有理赔条款"，三个月后发现效果差、更新贵。请你以 FDE 身份复盘：他们犯了什么错？正确的选型路径应该是什么？

- **考察点**：识别过度工程 + 给出正确决策路径，考察实战纠偏能力。
- **评分维度**：
  - 识别错误：把"知识型问题"误当"能力型问题"去微调（4 分）
  - 指出微调的代价（更新贵、难溯源、隐私）（3 分）
  - 正确路径：先用 Prompt → 知识私有常变→RAG → 仅当格式/风格不稳才叠加微调（4 分）
- <details>
  <summary>参考答案</summary>

  犯的错：
  1. **需求错判**——"知道公司条款"是知识型问题，本该 RAG，却当成能力型去微调。
  2. **过度工程**——没先试成本最低的 Prompt 优化，直接上最重的微调。
  3. **付出不必要代价**——条款每月变却要重训；难向监管溯源；训练数据含隐私有泄漏风险。

  正确路径（按决策树）：
  1. 先优化 Prompt（角色+示例+格式约束），看是否够用。
  2. 知识私有/常变/需溯源 → **RAG**（知识库存条款，更新便宜、可溯源）。
  3. 仅当"抽取/判定格式与风格"用 Prompt 无法稳定固化、且数据充足时，才在 RAG 之上叠加微调一个专用小模型。
  </details>

---

## 评分汇总表（满分 117）

| 级别 | 题号 | 单题分 | 小计 |
|---|---|---|---|
| L1 基础 | Q1–Q3 | 5×3 | 15 |
| L2 进阶 | Q4–Q7 | 8×4 | 32 |
| L3 深度 | Q8–Q11 | 12×4 | 48 |
| L4 场景 | Q12–Q13 | 11×2 | 22 |
| **合计** | | | **117** |

### 达标线
- **达标（推荐录用底线）**：≥ 90 分，且 **L4 两题均不得 0 分**（场景题反映真实业务落地能力，一票否决）。
- **优秀（senior 水平）**：≥ 105 分，且能流畅口述决策树（Q8）与特药理赔论证（Q12），并主动说出"混合栈 + 阻止过度工程"。
- **不达标**：< 90 分，或 L4 任一题 0 分——说明选型框架未建立，无法独立承担方案设计。

### 评分说明
- L1/L2 看"记忆与理解"，按点给分，答出核心关键词即可。
- L3/L4 看"结构化表达 + 业务贴合度"，需结合医疗保险场景举例方可得满分；纯背概念缺场景扣 30%。
- 鼓励候选人在任何一题补充"混合栈/成本/合规"视角，酌情 +1~2 分（不超单题上限）。
