# FDE W2D2 评测题 · 医疗 OCR Tool 与 Document AI

> 候选人背景：36 岁，Java + 大数据 + 医疗保险方向。示例围绕医疗保险 / 特药理赔 / 发票病历识别。
> 共 13 题，分 L1 基础（3）、L2 进阶（4）、L3 深度（4）、L4 场景（2）。
> 每题含「考察点」「评分维度」「折叠参考答案」。末尾有评分汇总表与达标线。

---

## L1 基础（概念辨析）

### Q1. OCR 的基本流程是什么？在保险理赔里它的定位是什么？
- **考察点**：OCR 原理（检测→识别→版面）与场景定位。
- **评分维度**：
  - 三段流程：检测、识别、版面分析。（4 分）
  - 定位：把图片/PDF 非结构化材料变成下游可用字段。（3 分）
  - 点出它是理赔自动化的"入口工具"，不直接决策。（3 分）
<details>
<summary>参考答案</summary>

流程：图像预处理（去噪/纠偏）→ 文本检测（定位文字框）→ 文本识别（像素转字符）→ 版面分析（理解标题/表格/段落关系）。在保险理赔里，OCR/Document AI 是入口工具：把用户拍的发票、病历、诊断证明变成结构化字段，供规则引擎、数据库、LLM 消费。它不直接做决策，只是把"看不懂的图片"变成"下游能用的数据"。

</details>

### Q2. OCR 返回的 bbox 坐标有什么用？
- **考察点**：坐标返回与版面分析的价值。
- **评分维度**：
  - 字段定位（知道字在哪）。（3 分）
  - 版面还原（拼行/列/表格）。（3 分）
  - 人工复核高亮、可追溯可解释。（4 分）
<details>
<summary>参考答案</summary>

坐标是连接"识别结果"和"原图"的桥梁：① 字段定位——知道"金额"在图哪块；② 版面还原——用坐标把零散词拼回行/列/表格；③ 校验——相邻字段相对位置辅助判断是否抽错；④ 人工复核时高亮模型抽的是哪块、向用户/监管证明"这笔金额来自发票这行"。没有坐标就无法做截图高亮和溯源。

</details>

### Q3. 什么是字符级置信度和字段级置信度？为什么字段级更重要？
- **考察点**：置信度两层概念。
- **评分维度**：
  - 字符级：每个识别字符的概率。（3 分）
  - 字段级：每个业务字段的可信度（综合字符+版面+语义）。（4 分）
  - 字段级更贴近业务（金额字段比整图平均更有意义）。（3 分）
<details>
<summary>参考答案</summary>

字符级：OCR 对每个识别出的字符给 0~1 概率。字段级：对"抽出的某个业务字段"给的置信度，常综合字符分 + 版面位置分 + 语义合理性。字段级更重要，因为一张发票整体识别率 99%，但"金额"那个字恰好模糊，字段置信度就低——而金额是理赔最敏感的字段，所以按字段而非整图评估更有业务意义。

</details>

---

## L2 进阶（链路与抽取）

### Q4. 请完整描述 OCR → 字段抽取 → 置信度 → 人工复核 的链路。
- **考察点**：达标线①——完整链路（核心考点）。
- **评分维度**：
  - 图片上传→预处理→OCR 出字+坐标。（2 分）
  - 字段结构化抽取（正则/KIE/多模态）。（3 分）
  - 计算字段级置信度。（2 分）
  - 高置信自动过、低置信转人工高亮。（2 分）
  - 人工修改反哺评测、坐标绑定可追溯。（1 分）
<details>
<summary>参考答案</summary>

1) 图片上传→预处理（纠偏/放大）→OCR 识别文字 + bbox 坐标；2) 字段结构化抽取（正则/键值对模型/多模态 LLM），统一结构化输出；3) 对每个字段算字段级置信度（综合字符分+版面+语义）；4) 分流——高置信自动过，低置信（按字段敏感度设阈值）转人工复核并高亮原图 bbox；5) 人工确认/修改，记录反哺评测（人工修改率），与原图坐标绑定保证可追溯。关键是用字段级置信度做自动/人工分流阀。

</details>

### Q5. 字段抽取有哪几种方式？各有什么优劣？
- **考察点**：字段结构化抽取的三种方式。
- **评分维度**：
  - 正则：快可控但模板一变就崩。（3 分）
  - KIE 模型：固定版式准、泛化一般。（3 分）
  - 多模态 LLM：泛化好省规则、成本较高、可能编造。（4 分）
<details>
<summary>参考答案</summary>

三种：① 规则/正则——按"价税合计：xxx"模板匹配，快且可控，但发票版式一变就崩；② 键值对模型（KIE）——专门训练"字段-值"定位，对固定版式发票准，泛化一般；③ 多模态 LLM——把图片+prompt 直接抽 JSON，泛化好、省规则，但成本较高，且可能"编造"图上没有的值，必须配坐标/原文回溯校验。实战：固定版式发票用正则+坐标，版式多变的病历/处方用多模态 LLM。

</details>

### Q6. 低置信度人工复核怎么设计？阈值怎么定？
- **考察点**：低置信度人工复核策略。
- **评分维度**：
  - 阈值分级（如 ≥0.95 过、0.8~0.95 关注、<0.8 转人工）。（4 分）
  - 复核体验：高亮原图、预填、记录修改。（3 分）
  - 阈值按字段敏感度调（金额更高）。（3 分）
<details>
<summary>参考答案</summary>

阈值分级：≥0.95 自动通过进流程；0.80~0.95 自动通过但打标"需关注"留痕；<0.80 转人工复核（高亮该字段原图位置）。体验设计：把低置信字段在原图 bbox 高亮让审核员一眼看到、预填 OCR 结果只需确认/修改、记录"改了哪些字段"反哺评测。阈值不是固定的，按字段敏感度调——金额阈值应比"医院名"高。转人工必须保留原图证据。

</details>

### Q7. 页面原图与字段坐标关联（截图高亮）怎么实现？价值是什么？
- **考察点**：坐标关联的落地与价值。
- **评分维度**：
  - 实现：坐标归一化转像素、PIL 裁剪。（4 分）
  - 价值：可追溯、可复核、可解释。（4 分）
  - 监管/客诉视角。（2 分）
<details>
<summary>参考答案</summary>

实现：OCR 返回 bbox（通常相对坐标 0~1），乘以原图尺寸转像素坐标，用 PIL 等库按 bbox 从原图裁剪出字段截图，用于前端高亮和复核展示。价值：① 可追溯——点字段跳原图对应区域；② 可复核——人工审核高亮机器抽的是哪块；③ 可解释——向用户/监管证明"这笔金额来自发票这行"。这是 OCR 结果可信任的工程细节，也是监管看重的。

</details>

---

## L3 深度（评测与复杂场景）

### Q8. 请写出字符准确率、字段 Precision/Recall/F1、人工修改率的定义与公式。
- **考察点**：达标线②——四类评测指标（核心考点）。
- **评分维度**：
  - 字符准确率 = 认对字符 / 总字符。（2 分）
  - 字段 P = 抽对/抽出，R = 抽对/应抽，F1 = 2PR/(P+R)。（4 分）
  - 人工修改率 = 被改字段 / 总字段。（2 分）
  - 点出各指标衡量什么、局限。（2 分）
<details>
<summary>参考答案</summary>

- 字符准确率 = 识别正确的字符数 / 标准答案字符总数（也可用 1 - 编辑距离/长度）。衡量"字认对没"，但只看字不看语义。
- 字段 Precision = 抽对字段 / 抽出字段；Recall = 抽对字段 / 标准答案字段总数；F1 = 2·P·R/(P+R)。衡量"业务字段抽得准不准"，要分字段评估。
- 人工修改率 = 被人工修改/补录的字段数 / 总字段数。生产真实数据上最诚实的指标，反映真实运营成本。
三者都要看：字符准确率看字、字段 F1 看业务、人工修改率看成本。

</details>

### Q9. 字段 F1 里，Precision 低和 Recall 低哪个更危险？为什么？
- **考察点**：字段指标的业务含义（保险视角）。
- **评分维度**：
  - Recall 低 = 漏抽，金额漏了直接少赔，更危险。（5 分）
  - Precision 低 = 抽错，多赔/欺诈风险。（3 分）
  - 强调分字段、金额权重最高。（2 分）
<details>
<summary>参考答案</summary>

Recall 低更危险——代表漏抽，金额字段没抽到直接"少赔"，客户受损、投诉、合规风险。Precision 低是抽错（把 A 药认成 B 药），导致多赔或欺诈风险。两者都坏，但要分字段看：金额字段的 F1 比医院名字段重要得多，金额错一分都是赔错钱。所以不能只看平均 F1。

</details>

### Q10. 人工修改率越低越好吗？它和置信度阈值是什么关系？
- **考察点**：人工修改率与阈值的博弈。
- **考察点**：达标线②延伸。
- **评分维度**：
  - 指出"越低越好"是误区。（3 分）
  - 阈值高→多转人工→修改率高成本高。（3 分）
  - 阈值低→错流入下游更危险。（2 分）
  - 理想：低修改率 + 低漏错率，靠高置信自动过。（2 分）
<details>
<summary>参考答案</summary>

不是越低越好。阈值设太高→太多字段转人工→修改率高、运营成本高；阈值设太低→错误字段自动过→修改率低但错误流入下游（赔错钱）更危险。理想状态是在"可接受错误率"下把修改率压到最低——靠"高置信自动过 + 真低置信才转人工"实现。这是产品化思维：平衡准确率与成本。

</details>

### Q11. 跨页字段、复杂表格、手写体三类复杂场景，你打算怎么设计（只设计不跑通）？
- **考察点**：复杂场景设计能力（B 级）。
- **评分维度**：
  - 跨页：文档 ID 聚合多页、页间坐标映射、合计在末页。（3 分）
  - 复杂表格：表格识别模型、行列建模、单元格坐标。（4 分）
  - 手写体：识别率骤降、默认转人工、关键字段强制复核。（3 分）
<details>
<summary>参考答案</summary>

- 跨页字段：按文档 ID 聚合多页识别结果；处理跨页截断（如"合计"在末页）；做页间坐标映射保证字段能定位到原页。
- 复杂表格：用表格识别（PaddleOCR PP-Structure / 多模态大模型），建模行列关系，支持单元格级坐标，费用清单多行多列、合并单元格都能处理。
- 手写体：医生手写处方识别率骤降，默认转人工，药名/剂量等关键字段强制复核，不硬撑自动。设计原则：识别不了的就诚实地转人工，知道边界在哪、怎么兜底。

</details>

---

## L4 场景（医疗保险综合）

### Q12. 场景题：用户上传一张增值税电子普通发票，要报销特药"奥希替尼"费用。请描述 OCR Tool 的完整处理链路，并指出哪一步最容易出错、怎么兜底。
- **考察点**：综合应用 OCR 链路于发票报销场景。
- **评分维度**：
  - 链路完整：上传→OCR→抽字段→置信度→分流。（4 分）
  - 指出金额字段最易错、最敏感。（3 分）
  - 兜底：低置信转人工高亮、交叉验证（大写金额）。（3 分）
<details>
<summary>参考答案</summary>

链路：用户上传发票→预处理（纠偏/放大）→PaddleOCR 识别文字+坐标→正则+坐标抽字段（发票代码、金额、医院、项目明细、日期）→算字段置信度。最容易出错且最敏感的是"金额"字段（发票章、浅色小字、折叠阴影易错，错一字赔错钱）。兜底：金额字段置信度阈值设更高（如 <0.95 即转人工）；用"价税合计"与"金额大写"交叉验证；低置信时高亮原图金额区域转人工复核，人工改完记录反哺评测。

</details>

### Q13. 场景题：上线后发现某批发票"人工修改率"突然从 8% 升到 35%，你怎么定位和解决？
- **考察点**：评测指标驱动的问题排查（达标线②应用）。
- **评分维度**：
  - 排查维度：版式变化、阈值、OCR 版本、字段定义。（4 分）
  - 数据驱动：分字段看 F1、看哪些字段被改最多。（3 分）
  - 解决：调阈值/补模板/转人工/回滚模型。（3 分）
<details>
<summary>参考答案</summary>

先分字段看修改率（不是只看总），定位是"金额"还是"医院名"被改最多——若集中某字段，多半是版式变化或字段定义偏差。排查：① 这批发票是否换了版式（税务局新模板）；② 置信度阈值是否被误调低；③ OCR 模型是否刚升级引入回归；④ 字段抽取正则是否覆盖新格式。解决：补模板/调正则、临时调高阈值转人工、必要时回滚 OCR 版本，并把新样本加入评测集。人工修改率是生产最诚实的告警信号，要建监控。

</details>

---

## 评分汇总表

| 题号 | 层级 | 考察点 | 满分 | 建议权重 |
|------|------|--------|------|----------|
| Q1 | L1 | OCR 流程与定位 | 10 | 基础 |
| Q2 | L1 | bbox 坐标价值 | 10 | 基础 |
| Q3 | L1 | 两层置信度 | 10 | 基础 |
| Q4 | L2 | 完整链路（达标线①） | 10 | **核心** |
| Q5 | L2 | 字段抽取方式 | 10 | 进阶 |
| Q6 | L2 | 低置信复核设计 | 10 | 进阶 |
| Q7 | L2 | 坐标关联实现 | 10 | 进阶 |
| Q8 | L3 | 四类评测指标（达标线②） | 10 | **核心** |
| Q9 | L3 | P/R 业务含义 | 10 | 深度 |
| Q10 | L3 | 修改率与阈值博弈 | 10 | 深度 |
| Q11 | L3 | 复杂场景设计 | 10 | 深度（B） |
| Q12 | L4 | 发票报销链路 | 10 | 场景 |
| Q13 | L4 | 修改率异常排查 | 10 | 场景 |

**总分 130 分**（每题满分 10，按维度给分）。

## 达标线

- **L1 基础达标**：Q1~Q3 总分 ≥ 24/30，能说清 OCR 三段流程、坐标用途、两层置信度。
- **达标线①（完整链路）**：Q4 ≥ 9/10，能完整讲清"OCR→抽字段→置信度→分流复核"，并点出字段级置信度做分流阀。
- **达标线②（评测指标）**：Q8 ≥ 9/10，能写出字符准确率、字段 P/R/F1、人工修改率四类公式，并说明为何需要低置信复核。
- **综合达标（可进下一阶段）**：总分 ≥ 100/130，且 Q4、Q8 均达标，且 L4 两题均 ≥ 7/10（能落地到医疗保险场景）。
- **高风险失分项**：认为"OCR 100% 准确不用复核"、混淆字符准确率与字段 F1、把修改率当越低越好、复杂场景硬撑全自动——任一出现且不能自圆其说，建议补学 W2D2 后再面。
