# FDE W1D6 评测题 · 本地模型体验 [B]

> 配套手册：《FDE-W1D6-本地模型体验-学习手册.html》
> 候选人背景：36 岁，Java + 大数据 + 医疗保险行业。场景默认围绕医疗保险 / 特药理赔 / 保险知识库。
> 满分约 117 分。达标线：L1+L2 全对（基础必过）；总分 ≥ 85 为「面试达标」；≥ 100 为「优秀」。

---

## L1 基础（Q1–Q3，每题 6 分，共 18 分）

### Q1. Ollama 的基本用法
**考察点**：能否说清 Ollama 是什么、怎么拉起/调用本地模型。
**评分维度**：
- 2 分：说清 Ollama 是本地运行开源大模型的工具，自动处理下载/量化/本地 HTTP 接口。
- 2 分：能写出 `ollama run qwen3:8b` 之类拉取运行命令。
- 2 分：知道本地接口（如 `http://localhost:11434/api/generate`）可被代码调用。
<details>
<summary>参考答案</summary>

Ollama 是本地运行开源大模型的最简工具：一行命令安装，一行 `ollama run 模型名` 拉取并启动，自动处理权重下载、量化加载，并暴露本地 HTTP 接口（`/api/generate`）。体验本地模型首选，不用自己配 CUDA。代码可通过 `requests.post("http://localhost:11434/api/generate", ...)` 调用。
</details>

### Q2. 量化的三个级别
**考察点**：int4 / int8 / fp16 的含义与比特差异。
**评分维度**：
- 2 分：fp16 = 16 bit/参数，基准精度最占显存。
- 2 分：int8 = 8 bit，体积减半，精度损失小。
- 2 分：int4 = 4 bit，体积降至 1/4，部分任务有损。
<details>
<summary>参考答案</summary>

量化是用更少比特表示权重，本质有损压缩：fp16（16bit）基准、最占显存；int8（8bit）体积减半、几乎不掉点；int4（4bit）体积降到 1/4、显存大降但部分任务可感知损失；更小（int2/3）损失明显，生产极少用。
</details>

### Q3. 显存粗算
**考察点**：能否估算模型显存占用。
**评分维度**：
- 3 分：给出公式「参数量 × 比特数 ÷ 8 ＋ KV Cache 开销」。
- 3 分：算对示例（如 8B fp16 ≈ 16GB）。
<details>
<summary>参考答案</summary>

推理显存 ≈ 参数量 × 每参数比特数 ÷ 8 ＋ 上下文/KV Cache 开销。例：8B 模型 fp16 ≈ 8×10⁹ × 16 ÷ 8 ≈ 16 GB；int4 ≈ 4 GB。实际启动还要加 KV Cache 与框架开销，所以 8B int4 常说"6GB 能跑"而非理论 4GB。
</details>

---

## L2 进阶（Q4–Q7，每题 8 分，共 32 分）

### Q4. 为什么量化会掉效果、哪些任务最敏感
**考察点**：量化的代价与边界。
**评分维度**：
- 3 分：说清量化是低位宽装不下原始浮点精度，权重被近似（有损）。
- 3 分：指出数值敏感任务（金额计算、精确抽取）和长链推理（CoT）损失更明显。
- 2 分：能举例（如理赔金额计算怕精度损失，应优先 int8 以上）。
<details>
<summary>参考答案</summary>

量化是有损压缩：低位宽装不下原始精度，权重被近似。对数值敏感的任务是（精确金额计算、字段抽取）和需要长链推理的任务损失更明显。如特药理赔金额计算，应优先 int8 以上以保精度；纯分类/摘要可放心 int4。
</details>

### Q5. 量化选型决策
**考察点**：能否给出可落地的选型方法。
**评分维度**：
- 3 分：给出"先 int8 起步 → 试 int4 → fp16 作基线"的路线。
- 3 分：强调用同一评测集量化对比，而不是凭感觉。
- 2 分：结合约束（显存紧→int4；数值敏感→int8）给具体建议。
<details>
<summary>参考答案</summary>

选型三步：① int8 起步（省一半显存几乎不掉点，性价比王）；② 试 int4，在同任务评测集（如 50 条特药理赔判定）上对比 int8，掉点在可接受范围（准确率降 <2%）就留 int4；③ fp16 仅作对比基线确认"量化到底掉了没"。显存紧果断 int4，数值敏感任务尽量 int8。关键是用同一评测集对照，而非拍脑袋。
</details>

### Q6. 本地模型上下文短的问题与对策
**考察点**：上下文长度、lost in the middle、RAG 切片。
**评分维度**：
- 3 分：说清本地模型默认上下文短，长文档会截断。
- 3 分：指出"中间遗忘（lost in the middle）"——长上下文中段表现差。
- 2 分：给出对策（RAG 切片检索、关键指令放首尾、用 num_ctx 显式控制）。
<details>
<summary>参考答案</summary>

本地模型默认上下文（如 2048/4096）比 API 短得多，长文档会被截断；且存在 lost in the middle——关键信息放中段时模型表现明显变差（需实测，不是看参数表）。对策：① 长文档先切片+向量检索（RAG）再喂，不整篇塞；② 关键指令放首尾；③ 用 num_ctx 显式控制，调大注意 KV Cache 显存暴涨可能 OOM。
</details>

### Q7. 本地 vs API：五个维度对比
**考察点**：延迟/成本/效果/数据合规/可控性的系统对比。
**评分维度**：
- 每维度 1.6 分（满分 8）：延迟（本地首 token 慢/无网络往返 vs API 快/受网络排队）、成本（本地边际≈0 vs API 按 token 付费）、效果（本地小模型上限低 vs API 大模型上限高）、数据（本地不出域 vs 上云）、可控性（本地可换量化/上下文 vs 厂商决定版本）。
<details>
<summary>参考答案</summary>

| 维度 | 本地（Qwen3 8B int4） | API（大模型） |
|---|---|---|
| 延迟 | 首 token 慢、吞吐低（CPU 更甚）；无网络往返 | 首 token 快、吞吐高；受网络与排队影响 |
| 成本 | 一次性硬件+电费，边际≈0 | 按 token 持续付费，量越大越贵 |
| 效果 | 小模型上限低，复杂/长上下文弱 | 大模型上限高，复杂更稳 |
| 数据 | 不出域，合规友好 | 上云，需隐私评估 |
| 可控 | 可换量化/上下文/自托管 | 厂商决定版本与策略 |
</details>

---

## L3 深度（Q8–Q11，每题 12 分，共 48 分）

### Q8. 实验设计：只变一个变量
**考察点**：可复现测试规范，避免对照污染。
**评分维度**：
- 4 分：指出对比实验最忌"换模型又换题又换参数"，必须只变一个变量（如只变量化）。
- 4 分：列出必须记录的字段（硬件、模型+量化、num_ctx、temperature、题目集、指标）。
- 4 分：给出量化对比示例结论（int8 显存省一半、准确率仅降 1pt 最优；q4 再省但掉 5pt 仅在显存受限用）。
<details>
<summary>参考答案</summary>

规范：① 只变一个变量——比如只变量化级别（fp16/int8/int4），模型、题目、温度全固定，否则得不出结论。② 必记字段：硬件（Mac M2 16GB / RTX3060 12GB）、模型+量化（qwen3:8b-q4_K_M）、上下文（num_ctx）、温度、题目集（50 条特药理赔判定）、指标（显存峰值/延迟/准确率）。③ 示例结论：int8 显存省一半准确率仅降 1pt，性价比最优；q4 再省但掉 5pt，仅在显存受限时用。结果必须可复现。
</details>

### Q9. vLLM 概念（了解层）
**考察点**：PagedAttention、连续批处理、与 Ollama 的定位差异。
**评分维度**：
- 3 分：说清 vLLM 解决"生产级高吞吐/低延迟推理"，Ollama 适合体验。
- 5 分：PagedAttention（KV Cache 分页，像操作系统内存分页，降碎片提并发）+ 连续批处理（token 级动态拼批，提 GPU 利用率）。
- 4 分：补充（量化支持、OpenAI 兼容接口）加分。
<details>
<summary>参考答案</summary>

Ollama = 单机体验神器；vLLM = 生产级推理引擎，核心是 PagedAttention（像操作系统分页管理 KV Cache，把显存碎片降到最低，提高并发、降显存浪费）+ Continuous Batching 连续批处理（不同请求在 token 级动态拼批，不用等长凑批，大幅提升 GPU 利用率）。还支持 AWQ/GPTQ 量化、OpenAI 兼容接口。FDE 面试能讲清这两点即达标。
</details>

### Q10. 蒸馏模型是什么
**考察点**：Distilled 模型的定义与在本地体验中的意义。
**评分维度**：
- 4 分：说清蒸馏 = 用大模型（教师）监督小模型（学生）训练，迁移能力。
- 4 分：能结合 DeepSeek-R1 蒸馏 7B：把大模型推理行为迁移到小模型。
- 4 分：指出它不是原版 671B，但比同尺寸普通模型更会"一步步想"，适合本地体验。
<details>
<summary>参考答案</summary>

蒸馏（Distilled）= 用大模型（教师）教小模型（学生），把"推理能力"迁移到 7B/8B 上。DeepSeek-R1 蒸馏版不是原版 671B，但比同尺寸普通模型更会一步步推理（CoT）。本地体验选它，能在消费级显卡上感受接近大模型的推理行为，是"小模型体验推理"的性价比选择。
</details>

### Q11. 本地模型在医疗/保险场景的适用边界
**考察点**：合规与责任的现实约束，而非纯技术。
**评分维度**：
- 4 分：适合本地的（内网知识库问答、高频简单抽取/匹配、离线边缘录入）——数据不出域、成本可控。
- 4 分：不适合本地小模型的（复杂特药适应症推理、需最新医保目录、高风险拒付决策）——要 API+人审。
- 4 分：能讲出"本地预处理 + 云端精算/复核"的混合链路，点出合规与责任是核心。
<details>
<summary>参考答案</summary>

保险业"能不能用本地"常是合规/责任问题而非纯技术：适合本地的——内网保险知识库 RAG、高频简单任务（保单要素抽取、条款关键词匹配）、医院内网离线辅助录入，价值是"数据不出域+成本可控"；不适合本地小模型的——复杂特药适应症推理、需联网取最新医保目录、零容忍高风险拒付决策，应走 API 大模型+人工复核。形成"本地预处理 + 云端精算复核"的混合链路。
</details>

---

## L4 场景（Q12–Q13，每题 9.5 分，共 19 分）

### Q12. 场景选型：特药理赔初审为什么用本地还是 API
**考察点**：把"本地 vs API"落到具体场景，给出约束分析 + 混合方案。
**评分维度**：
- 3 分：约束分析（理赔材料含隐私/医保数据→数据合规不出域；每天数万单→量大成本敏感；初审是结构化抽取不需复杂推理）。
- 3 分：选型（本地 8B int8 做材料结构化+简单条款匹配，边际成本≈0）。
- 3.5 分：兜底（置信度低/复杂适应症判断→路由 API 大模型+人审；用 W1D4 Adapter 做路由）。
<details>
<summary>参考答案</summary>

约束分析：特药理赔材料含患者隐私+医保数据→合规要求数据不出域；每天数万单→量大、成本敏感；初审是结构化抽取、不需复杂推理。选型：本地 8B（int8）做材料结构化抽取+简单条款匹配，数据不出内网、边际成本≈0。兜底：抽取置信度低或复杂适应症判断，路由到 API 大模型+人工复核。不是"本地替代 API"，而是"本地高频敏感预处理 + API 复杂精算"，用 W1D4 的 Adapter 做模型路由。
</details>

### Q13. 场景落地：没有 GPU 也要跑通本地模型
**考察点**：资源受限下的实操方案与诚实记录。
**评分维度**：
- 3 分：指出无独显也能跑——CPU + int4 量化，靠内存带宽。
- 3 分：能给出体验命令（如 `ollama run qwen3:8b-q4_K_M`）并说明会慢。
- 3.5 分：强调记录"CPU 上 8B 出 100 字要 X 秒"这类真实延迟，作为对比基线，避免把 int4 结果和 API fp16 不公平比较。
<details>
<summary>参考答案</summary>

无独显也可跑：用 CPU + int4 量化版（如 `ollama run qwen3:8b-q4_K_M`），靠内存带宽驱动，但速度慢，体验时要如实记录"在 CPU 上 8B 模型出 100 字约 X 秒"作为延迟基线。关键：不要用 int4 本地结果去和 API 的 fp16/更大模型比"效果"——这是不公平对照；应同量化级别或明确标注约束后对比。生产高并发则上 vLLM 而非 Ollama。
</details>

---

## 评分汇总表

| 级别 | 题号 | 单题分 | 小计 | 重点 |
|---|---|---|---|---|
| L1 基础 | Q1–Q3 | 6 | 18 | Ollama 用法、量化级别、显存粗算 |
| L2 进阶 | Q4–Q7 | 8 | 32 | 量化代价、选型、上下文、对比维度 |
| L3 深度 | Q8–Q11 | 12 | 48 | 实验规范、vLLM、蒸馏、场景边界 |
| L4 场景 | Q12–Q13 | 9.5 | 19 | 特药理赔选型、无 GPU 落地 |
| **合计** | | | **117** | |

**达标线**：
- 基础必过：L1 + L2（共 50 分）须全对，否则基础不牢。
- 面试达标：总分 ≥ 85（约 73%）。
- 优秀：总分 ≥ 100（约 85%）。

**对应手册达标线**：
- 达标线①（量化本质与选型）→ 主要考核 Q2、Q3、Q4、Q5。
- 达标线②（本地 vs API 场景化决策）→ 主要考核 Q7、Q12、Q13。
