# FDE W8D5 评测题 · POC到生产·ROI·成本安全治理

> 配套手册：`FDE-W8D5-POC到生产-ROI-成本安全治理-学习手册.html`
> 适用岗位：高级工程师 / 架构师 / 技术负责人（冲刺岗）
> 候选人背景：36 岁，Java + 大数据 + 医疗保险理赔领域
> 题型：13 题，分 L1 基础 / L2 进阶 / L3 深度 / L4 场景
> 用法：口述或写要点，展开参考答案自检；评分按"评分维度"逐项打钩。

---

## L1 基础（概念清晰即可，3 题）

### Q1. POC 和生产的核心区别是什么？为什么很多大模型项目"POC 很美、上线就死"？
- **考察点**：理解 LLM 工程"死亡之谷"的本质，区分技术可行性与生产可用性。
- **评分维度**：① 是否点出 POC 是"精选样本/人为闭环" vs 生产是"真实流量/真实约束"；② 是否列出至少 2 类系统性落差（数据/评测/监控/成本）；③ 是否说明"死因"通常不在模型能力而在工程能力缺失。
<details>
<summary>参考答案</summary>

POC 目标是证明"技术上可行"，常用精选小样本、人为构造链路跑通 demo；生产要求"在真实流量、真实数据、真实约束下稳定、可控、可运营"。两者落差来自：数据（脏/漂移/长尾）、评测（只看 demo 无系统指标）、监控（基本没有）、成本（不计较）。项目"死"在 POC 后没补齐这四类工程能力，而非模型不行。
</details>

### Q2. 大模型应用的成本主要由什么构成？常被低估的"隐性成本"有哪些？
- **考察点**：成本意识，能否把成本拆成可量化因子。
- **评分维度**：① 写出成本 ≈ f(调用量, 单次 token, 单价)；② 列出 ≥3 项隐性成本（重复计算/重试/上下文膨胀/运营维护）；③ 提到成本监控必要性。
<details>
<summary>参考答案</summary>

成本 ≈ 日请求数 ×(输入 token×输入单价 + 输出 token×输出单价)。隐性成本：重复计算（相同问题反复调、长 system prompt 每次重发）、校验失败重试、上下文膨胀（RAG 召回过多/历史全塞）、知识库维护与持续评测人力。不做成本监控，业务量一放大账单会爆。
</details>

### Q3. 医疗理赔场景的合规三件套是什么？请各说一句工程做法。
- **考察点**：安全合规底线认知（呼应 W6 私有化）。
- **评分维度**：① 说出 PII / 租户隔离 / 审计三件；② 每项给一句工程做法；③ 点出"合规是架构内建"。
<details>
<summary>参考答案</summary>

PII 防护：输入脱敏（姓名/证件打码）+ 输出过滤；租户隔离：向量检索按 tenant_id 过滤、不串库；审计：全链路留痕（谁/何时/用哪份知识/回了什么）。合规要架构一开始就内建，不是上线后补。
</details>

---

## L2 进阶（能展开讲方法，4 题）

### Q4. 生产级评测为什么要"多维度"？列出你会在评测集里监控的指标族。
- **考察点**：评测体系设计能力，能否超越单点准确率。
- **评分维度**：① 指出单点准确率掩盖拒答/解析/合规问题；② 列出 ≥5 个指标维度（任务准确/拒答准确/可解析/安全合规/鲁棒/成本延迟）；③ 提到评测要"可回归、bad case 闭环"。
<details>
<summary>参考答案</summary>

只看准确率会漏掉拒答失败、格式不可解析、合规越权、鲁棒性差等致命问题。应监控：任务准确率、拒答准确率、格式/可解析率、安全合规率、鲁棒性、成本与延迟。评测集要版本化、随线上分布演进，每次变更跑回归，bad case 入池归因闭环。
</details>

### Q5. 控制大模型推理成本，你有哪些"组合拳"手段？
- **考察点**：成本治理的系统性思路（缓存/批处理/小模型降级/路由/私有化）。
- **评分维度**：① 说出 API vs 私有化拐点决策；② 缓存（语义缓存+前缀缓存）与批处理；③ 小模型路由降级；④ 强调组合而非单招。
<details>
<summary>参考答案</summary>

四招组合：① 路由——简单问题分小模型/规则，难样本才调旗舰；② 缓存——语义缓存吃重复查询、前缀缓存复用长上下文（防脏缓存需失效机制）；③ 批处理——离线任务走 batch 省约半价；④ 私有化——量大且强合规（如医疗）时，月调用量×API单价 > 私有化月摊成本即划算。
</details>

### Q6. 规则 / RAG / Agent / 人工，你怎么决定一个任务用哪种方案？
- **考察点**：技术边界判断力，避免"什么都上 Agent"。
- **评分维度**：① 给出清晰决策原则（能规则就别 RAG、能 RAG 就别 Agent）；② 按确定性/成本/风险分级；③ 强调"AI 做初筛、人做决策、每环能转人工"。
<details>
<summary>参考答案</summary>
固定强校验（算保费）→ 规则引擎（确定/零成本）；已知文档问答 → RAG（可控/中成本）；多步调工具 → Agent（灵活但贵有风险）；高风险/模型不确定 → 人工兜底。原则：越往右越贵越不可控，能左就别右。AI 负责初筛+建议，人负责决策，每个 AI 环节都要能转人工。
</details>

### Q7. 推进大模型项目时，你用什么机制控制"不要盲目上线"？
- **考察点**：项目节奏与风险管理（门禁思维）。
- **评分维度**：① 提到分阶段（POC→试点→灰度→生产）；② 每阶段设量化放行"门禁"；③ 强调降级预案与业务方共担目标。
<details>
<summary>参考答案</summary>

用"门禁"控制每阶段放行：POC 看是否达业务阈值；试点看真实用户采纳率与 bad case 收敛；灰度看核心指标无回退、无安全事件；全量看监控告警与降级就绪。门禁指标与业务方共同定义，且每阶段都要有"退回到上一阶段/转人工"的降级路径。
</details>

---

## L3 深度（有框架、有数字、能扛追问，4 题）

### Q8. 请你现场算一笔账：一个特药理赔初审 AI 项目，ROI 怎么算？收益和成本分别怎么量化才不虚？
- **考察点**：ROI 建模与商业表达（达标线②核心）。
- **评分维度**：① 写出 ROI=(年化收益−年化成本)/年化成本；② 收益拆人力/时效/风险下降/增收并给出量化思路；③ 成本含推理费+工程人力+知识库运营+试错，且用对照基线防过度归因；④ 提到回收期更直观。
<details>
<summary>参考答案</summary>

年化收益 = 人力节省（原 N 人天×人力成本×自动化比例）+ 时效价值（处理时长下降折算）+ 风险下降（错误率降带来的赔付/罚款减少）+ 增收（需 A/B 归因）。年化成本 = 推理费 + GPU 折旧/电费（若私有化）+ 工程人力 + 知识库维护评测 + 试错。用"上线前 vs 后"或 A/B 对照，避免把转化提升全算给模型。回收期 = 投入/月净收益，比单看 ROI 更直观。
</details>

### Q9. 如果业务方说"你们模型准确率 92%，但我看不出有什么用"，你怎么回应？
- **考察点**：价值翻译能力（向业务方证明价值，不空谈准确率）。
- **评分维度**：① 先对齐业务痛点而非甩指标；② 用对照基线 + 场景化业务结果（钱/时间/风险）；③ 持续汇报建立信任；④ 不夸大、可归因。
<details>
<summary>参考答案</summary>

先问业务最痛的点（初审慢？差错高？客户等久？），再用对照基线讲场景化收益，例如"特药理赔初审从 2 小时压到 8 分钟，初审员人均日处理量翻 3 倍，相当于释放 5 个初审人力做高价值核赔"。按月汇报采纳率、成本、bad case 收敛曲线，建立信任。准确率只是内部质量信号，业务方要的是结果指标。
</details>

### Q10. 大模型应用上线后，你监控什么？为什么传统"服务可用性监控"不够？
- **考察点**：可观测性设计，LLM 概率系统的特殊性。
- **评分维度**：① 列出质量/成本/延迟/安全四类信号；② 指出返回 200 也可能答非所问；③ 提到全链路 Trace（输入/参数/输出/token/耗时/评测分）用于定位回放；④ 结合大数据背景讲"日志当 pipeline"。
<details>
<summary>参考答案</summary>

监控四类信号：质量（抽样评测、赞踩、bad case 聚类）、成本（日 token、人均成本、尖峰）、延迟（P50/P95/P99）、安全（PII 命中、越权）。传统只看 HTTP 200 不够——200 也可能答非所问。需落全链路 Trace，每条请求记录输入/模型/参数/输出/token/耗时/评测分，既排障又离线回放评测。
</details>

### Q11. 数据层面的坑会让 POC 效果"虚高"，你如何在生产中规避分布漂移和样本偏差？
- **考察点**：数据治理与评测集演进。
- **评分维度**：① 点出分布漂移（新药品/新政策）、脏数据、标注噪声、样本偏差；② 线上埋点回收真实 query 更新评测集；③ 评测集按真实分布抽样含拒答 case；④ 双标仲裁降标注噪声。
<details>
<summary>参考答案</summary>

数据坑：分布漂移（知识库过期致答错）、脏数据（乱码超长致解析失败）、标注噪声（评测不可信）、样本偏差（只看能答的忽略应拒答的）。应对：线上埋点回收真实 query 定期重训评测集、输入预处理+边界校验+失败降级、评测集双标仲裁、按真实分布抽样并保留 should_refuse case。
</details>

---

## L4 场景（综合实战，结合特药理赔 Agent / 企业 Agent 平台，2 题）

### Q12. 你负责"特药理赔 Agent"从 POC 到生产的推进。请设计一份推进计划，并指出每个阶段最该防的坑。
- **考察点**：综合应用（达标线①），把路径/坑/节奏串成可执行计划。
- **评分维度**：① 四阶段（POC→试点→灰度→生产）清晰；② 每阶段核心交付 + 最该防的坑；③ 提到合规（PII/租户隔离）与降级（转人工）；④ 体现成本与监控闭环。
<details>
<summary>参考答案</summary>

- **POC（2-4 周）**：在代表性理赔材料上验证抽取/初审效果达阈值。防坑：数据被美化、只看 demo。
- **试点（1-2 月）**：小范围真实理赔员使用，回收采纳率与 bad case。防坑：无真实反馈、样本偏差（漏拒答 case）。
- **灰度**：按比例放量，监控质量/成本/延迟/安全。防坑：没降级预案就放量。
- **生产**：全链路监控+成本看板+审计留痕+转人工兜底。防坑：只监控可用性、无 Trace。
全程内建 PII 脱敏、租户隔离，模型只给初审建议、最终赔付由人定。
</details>

### Q13. 公司要建"企业 Agent 平台"对外赋能多个业务线（含医疗理赔）。作为技术负责人，你怎么在保证 ROI 的同时控制成本与安全？请结合路由、缓存、私有化、合规作答。
- **考察点**：架构负责人视角的综合权衡（成本+安全+ROI）。
- **评分维度**：① 路由降本（简单走小模型/规则）；② 缓存（语义/前缀）吃重复；③ 私有化决策（量大合规）；④ 合规三件套（PII/隔离/审计）；⑤ 把成本与合规作为 ROI 的一部分讲清。
<details>
<summary>参考答案</summary>

架构上用路由器把简单查询（如"某药报销比例"）分小模型/规则，难样本才调大模型；语义缓存+前缀缓存吃掉跨租户重复问题；医疗线量大且强合规，走私有化（数据不出域）并设 API/私有拐点评估。安全上 PII 脱敏、按 tenant 隔离检索、全链路审计。成本与合规都计入 ROI：先算清平台摊薄后的单位请求成本与合规风险下降价值，再用对照基线向各业务线证明"用了比不用省"。
</details>

---

## 评分汇总表

| 题号 | 层级 | 主题 | 权重 | 自评(0-5) |
|------|------|------|------|-----------|
| Q1 | L1 | POC vs 生产 | 1 | |
| Q2 | L1 | 成本构成 | 1 | |
| Q3 | L1 | 合规三件套 | 1 | |
| Q4 | L2 | 多维评测 | 2 | |
| Q5 | L2 | 成本组合拳 | 2 | |
| Q6 | L2 | 边界划分 | 2 | |
| Q7 | L2 | 推进门禁 | 2 | |
| Q8 | L3 | ROI 建模 | 3 | |
| Q9 | L3 | 价值翻译 | 3 | |
| Q10 | L3 | 可观测性 | 3 | |
| Q11 | L3 | 数据治理 | 3 | |
| Q12 | L4 | 特药理赔推进 | 4 | |
| Q13 | L4 | 企业 Agent 平台 | 4 | |

**计分**：加权总分 = Σ(自评 × 权重)，满分 = 5 × Σ权重 = 5×33 = **165**。
- ≥ 140（≈85%）：达标，具备高级/架构岗该主题面试能力。
- 110–139：基本达标，重点补 L3 深度题（ROI/价值翻译/可观测性）。
- < 110：未达标，重读手册 s1–s14，并把 Q8/Q9/Q12 练到能脱稿讲。

## 达标线（本日两条，必须都能讲清）

- **达标线①**：能讲清从 POC 到生产的路径（POC→试点→灰度→生产）和常见坑（数据/评测/监控/成本），以及每阶段门禁与降级预案。
- **达标线②**：能讲清怎么向业务方证明大模型项目的 ROI（不空谈准确率）——对齐痛点、设对照基线、量化收益扣全成本、算回收期、持续汇报。

> 自测建议：用通义 / DeepSeek 当面试官，把 Q8、Q9、Q12 作为口试题录音复盘，对照"评分维度"逐项补缺口。
