# FDE W3D6 评测题 · 作品一打磨（A 级）

>  candidate: 36 岁，Java + 大数据 + 医疗保险背景，目标 FDE。
>  场景统一用「医疗保险 / 特药理赔 / 企业保险知识库」。
>  评分维度通用：①结构完整 ②决策有理 ③细节真实 ④量化价值。每题满分 5 分。

---

## L1 基础（交付物认知）

### Q1. 作品一（企业保险知识库 RAG）的核心能力应该包含哪些？为什么"答得准"还不够？
- **考察点**：作品定位与核心能力边界。
- **评分维度**：能否列出检索/生成/引用/拒答/ACL；能否说明"可追溯、防越权"才是企业级。
<details>
<summary>参考答案</summary>

核心能力：准确检索、忠实生成、引用溯源、无答案拒答、角色级 ACL。企业级场景下"答得准"不够——保险涉及合规与责任，必须能审计（每句有来源）、该拒就拒（不硬编）、防越权（不同角色看不到不该看的），否则生产不可用。候选人的 Java+大数据背景应强调工程落地与可观测。

</details>

### Q2. README 应该包含哪些部分？顶部最该放什么抓住面试官？
- **考察点**：README 结构设计。
- **评分维度**：结构完整（定位/特性/架构图/效果/快速开始/目录/限制）；能否说清顶部放架构缩略图+指标对比表。
<details>
<summary>参考答案</summary>

结构：一句话定位+业务背景、核心特性、架构图+快速开始、效果数据、目录说明、已知限制+Roadmap。顶部最抓人的是「架构缩略图」+「优化前 vs 优化后指标对比表」，让面试官 3 分钟判断是否深挖。避免写成流水账教程，要突出业务价值和量化效果。

</details>

### Q3. 什么是 NFR？作品一为什么要建 NFR 基线表？
- **考察点**：非功能需求认知。
- **评分维度**：能否列出 6+ 维度（延迟/准确率/拒答/引用/可用性/成本/合规）；能否联系"区分 demo 与生产"。
<details>
<summary>参考答案</summary>

NFR=非功能需求，把"好用"量化。作品一基线：延迟 P95≤3s、Faithfulness≥0.92、拒答 F1≥0.90、引用准确率≥0.95、可用性 99.5%、并发≥50QPS、单问答成本上限、ACL 拦截率 100%。有基线表说明按生产标准做，且要和评测闭环联动防"为提准确率把成本打爆"。

</details>

---

## L2 进阶（架构与数据流）

### Q4. 请描述作品一的架构图应怎么分层，哪些点必须画出来？
- **考察点**：架构图设计能力。
- **评分维度**：分层（接入/索引/检索/生成/评测）；在线离线分开；标降级点与 Trace 落点。
<details>
<summary>参考答案</summary>

分层：接入层（文档解析）→ 索引层（ES+向量双写）→ 检索层（Query优化+混合检索+Rerank）→ 生成层（引用/拒答/ACL 校验）→ 评测层（数据集+指标+Trace）。必须画：在线链路与离线/评测链路分开；每个环节的降级点（如 Rerank 挂降级纯向量）；Trace 落点（全链路记录可反查）。图须与代码一致，否则被深挖会穿。

</details>

### Q5. 数据流图里"可追溯"是怎么实现的？请走一遍一次问答。
- **考察点**：端到端数据流与可追溯。
- **评分维度**：能否走通请求→ACL→Query优化→检索(记来源)→生成(引用/拒答)→后校验→落Trace。
<details>
<summary>参考答案</summary>

一次问答：①请求带角色/权限上下文；②ACL 前置校验越权直接拒；③Query 优化（Rewrite/多查询/分解）；④混合检索+ Rerank，记录每个 chunk 的 doc_id/chunk_id/分数；⑤生成输出答案+citations+should_refuse；⑥后校验（引用校验、拒答校验、越权校验）；⑦落 Trace 全链路记录。可追溯来自"每个 chunk 带来源标记"且"Trace 能反查用了哪些 chunk、为何拒答"，保险出事可定责。

</details>

### Q6. Dify、RAGFlow、自研三者怎么选？作品一你怎么借力开源又保可控？
- **考察点**：技术选型对比与权衡。
- **评分维度**：三者优劣清晰；能给出"RAGFlow 做解析+自研做编排/ACL/评测"的务实方案。
<details>
<summary>参考答案</summary>

Dify 低代码快但深度可控差、定制 Query 优化/ACL 受限；RAGFlow 深度文档解析强（表格/扫描件）适合保险条款；自研完全可控但成本高。作品一务实方案：用 RAGFlow 承担深度文档解析，自研 Java 编排层负责检索融合、ACL、Query 优化、评测闭环，Dify 仅作 POC 对比。借力开源解析、核心合规/可控自己握。提这些要真用过、能讲细节。

</details>

---

## L3 深度（ADR 与失败案例）

### Q7. 请写一条"检索方案选型"的 ADR（背景/候选/维度/决策/后果）。
- **考察点**：ADR 写作与决策思维。
- **评分维度**：五要素齐全；决策与保险业务约束挂钩；写清放弃的备选与后果。
<details>
<summary>参考答案</summary>

背景：保险条款含大量精确条款号/病名/药品编码，需高准确召回。候选：纯向量 / 纯 ES / 混合（ES+向量）。评估维度：准确率、可控性、成本、合规、团队 Java 栈。决策：混合（ES 保精确术语命中，向量补语义）。后果/权衡：召回更稳、相似条款不易混淆；代价是多维护一个索引、Rerank 复杂度上升——可接受。避免只列优点，必须写放弃的备选与后果。

</details>

### Q8. 请讲一个作品一的"真实失败案例"，按 现象→根因→修复→验证 展开。
- **考察点**：失败案例的真实性与闭环。
- **评分维度**：细节具体（药名/指标）；根因定位到具体层；修复对症；有回归验证。
<details>
<summary>参考答案</summary>

现象：用户问"奥希替尼报销比例"，答案给成 CAR-T 的 80%，实际 60% 且引用错误 chunk。根因：①纯向量把相似药条款排前；②生成无引用校验"凑引用"；③多路召回丢来源标记。修复：Ⅰ检索改混合（ES 精确命中病名/编码）；Ⅱ加 Rerank 按来源加权；Ⅲ生成后引用校验（二次判定 chunk 是否支持 claim）；Ⅳ多路合并强制保留 chunk_id。验证：标为回归 case，引用准确率 0.86→0.97，同类全过。细节真实、有闭环。

</details>

### Q9. 3 分钟演示你怎么排节奏？为什么先讲价值后讲细节？
- **考察点**：演示设计与表达策略。
- **评分维度**：节奏分配合理（痛点/跑通/硬核/价值）；能解释"先价值后细节"抓注意力。
<details>
<summary>参考答案</summary>

0:00-0:30 痛点（误答风险高、人工成本高）；0:30-1:30 跑通（现场问特药问题，展示答案+引用可点开+拒答）；1:30-2:30 硬核（架构图一笔带过，放评测对比表+失败修复前后）；2:30-3:00 收尾（NFR 基线与落地价值）。先价值后细节：面试官注意力前段最高，先让他相信"有用"，再给硬核证据，避免一上来陷代码。

</details>

---

## L4 场景（医疗保险实战）

### Q10. 场景：面试官让你现场画架构图讲"企业保险知识库"，你会怎么讲 3 分钟？
- **考察点**：架构讲解的综合表达。
- **评分维度**：分层清晰、突出可靠性（降级/ACL/可追溯）、结合保险合规。
<details>
<summary>参考答案</summary>

①定调：企业级保险 RAG，核心不是能答而是答得准/可追溯/该拒拒/防越权。②走图：文档解析（RAGFlow 深度解析表格/扫描件）→双写 ES+向量→Query 优化→混合检索+Rerank→生成（引用/拒答/ACL）→评测闭环。③亮可靠性：标降级点（Rerank 挂降级纯向量、Query 优化挂降级原 query）、ACL 前置防越权、Trace 全链路可追溯供审计。④收尾：用 NFR 基线和评测指标证明生产级。结合 Java 栈讲编排可控。

</details>

### Q11. 场景：你的作品一被指出"像培训班 demo"，你怎么回应并证明是生产级？
- **考察点**：区分 demo 与生产的能力证明。
- **评分维度**：能否用降级/ACL/评测闭环/NFR/失败修复等生产要素反击。
<details>
<summary>参考答案</summary>

回应要点：①有降级与容错（检索/生成各自降级，不卡死）；②有角色级 ACL 防越权（保险合规硬要求）；③有评测闭环（50 条测试集、分层指标、bad case 回流、基线 vs 优化对比）；④有 NFR 基线（延迟/准确率/成本/可用性量化）；⑤有真实失败案例与回归验证；⑥有 Trace 全链路可审计。这些生产要素是 demo 没有的，能用数字和架构图逐项举证。

</details>

### Q12. 场景：简历里作品一怎么写，才能既量化又不显得吹？
- **考察点**：简历呈现与可信度。
- **评分维度**：一句话成果+关键词+量化价值+明确个人模块；不夸大、可深挖。
<details>
<summary>参考答案</summary>

一句话成果：主导搭建企业保险知识库 RAG，特药理赔问答 Faithfulness 0.94、拒答 F1 0.91、引用准确率 0.97。技术关键词：ES+向量混合检索、Rerank、Query 优化、引用溯源、角色 ACL、评测闭环（RAGAS/LangSmith）。量化价值：误答率降 X%、人工咨询成本降 Y%、合规审计通过。明确负责模块（如检索编排/评测/拒答与 ACL），不写"参与"模糊，也不全揽——每个数字都要能当场解释口径。

</details>

### Q13. 场景：如果让你重做作品一，你会改哪三件事？
- **考察点**：复盘与改进思维。
- **评分维度**：改进点具体、有优先级、呼应前文坑点。
<details>
<summary>参考答案</summary>

①更早建评测闭环——初期靠拍脑袋调参浪费时间，应第一天就有 50 条测试集看分层指标；②检索一开始上混合而非纯向量，避免"相似条款混淆"类 bad case 后期返工；③把 ACL 与引用校验做成标准化中间件而非散落逻辑，提升可维护与可审计。体现"踩过坑、有复盘、能排优先级"的工程成熟度。

</details>

---

## 评分汇总表

| 题号 | 层级 | 主题 | 满分 | 候选得分 | 备注 |
|------|------|------|------|----------|------|
| Q1 | L1 | 核心能力定位 | 5 | | |
| Q2 | L1 | README 结构 | 5 | | |
| Q3 | L1 | NFR 基线 | 5 | | |
| Q4 | L2 | 架构图分层 | 5 | | |
| Q5 | L2 | 数据流可追溯 | 5 | | |
| Q6 | L2 | 选型对比 | 5 | | |
| Q7 | L3 | ADR 写作 | 5 | | |
| Q8 | L3 | 失败案例 | 5 | | |
| Q9 | L3 | 演示节奏 | 5 | | |
| Q10 | L4 | 架构讲解 | 5 | | |
| Q11 | L4 | 证明生产级 | 5 | | |
| Q12 | L4 | 简历呈现 | 5 | | |
| Q13 | L4 | 复盘改进 | 5 | | |
| **合计** | | | **65** | | |

### 达标线
- **L1+L2 全对（基础达标）**：能讲清作品一核心能力与交付物（README/架构图/NFR），能描述架构分层与数据流可追溯。
- **L3 两题以上达标（进阶达标）**：能写一条完整 ADR、讲一个真实失败案例（现象→根因→修复→验证）、设计演示节奏。
- **L4 两题以上达标（实战达标 / 面试通过线）**：能现场讲架构并证明生产级、用数字写简历、有复盘改进思维。
- **总分建议**：≥52/65（80%）为"熟练"；40~52 为"基本掌握需补强"；<40 为"不达标，重学手册"。

---

> 配套学习手册：`FDE-W3D6-作品一打磨-学习手册.html`
