# FDE W8D2 评测题 · 容量规划与成本估算

> 配套手册：《FDE-W8D2-容量与成本-学习手册.html》
> 候选人背景：36 岁，Java + 大数据 + 医疗保险；冲刺高级 / 架构 / 负责人岗。
> 共 13 题，分 L1 基础 / L2 进阶 / L3 深度 / L4 场景。每题含考察点、评分维度、折叠参考答案。
> 场景默认结合：特药理赔 Agent、企业 Agent 平台。

---

## L1 基础（概念清楚即可）

### 1. API 按 token 计费与私有按 GPU 时租，本质区别是什么？
- **考察点**：两类成本模式的根本差异。
- **评分维度**：是否点出"边际成本线性 vs 固定成本"；是否提到闲置也计费。
<details>
<summary>参考答案</summary>

API 按 token 计费，边际成本随调用量线性增长，零固定成本、弹性高；私有按 GPU 时租+电费+运维计费，属固定成本，卡空跑也计费、闲置即浪费。选型核心是"量大稳定→私有摊薄更省；量小波动→API 更省"的交叉点。

</details>

### 2. 私有部署的月成本由哪些部分构成？
- **考察点**：TCO 意识。
- **评分维度**：是否含时租/折旧、电费、运维、存储网络；是否强调"卡空跑也计费"。
<details>
<summary>参考答案</summary>

月成本 ≈ 卡数×时租×720h + 电费 + 运维人力 + 存储网络。关键是固定成本属性——低利用率时单位 token 成本反而远高于 API，所以利用率是省钱关键。

</details>

### 3. 为什么 RAG 用 API 模式可能很快变得很贵？
- **考察点**：长上下文成本陷阱。
- **评分维度**：是否指出每次把长文档塞进 prompt 使输入 token 线性增长；是否联系缓存/私有化拐点。
<details>
<summary>参考答案</summary>

RAG 每请求把长文档/条款/病历塞入 prompt，输入 token 随知识库长度线性增长，而输入单价虽低于输出但仍累积，导致成本失控。这正是推动"前缀缓存"或"私有部署"的拐点之一。

</details>

---

## L2 进阶（能算、能权衡）

### 4. 估算 Qwen2.5-32B 在 fp16 与 int4 下的权重显存，并说明 MoE 模型怎么估。
- **考察点**：显存估算（呼应 Day1）。
- **评分维度**：fp16≈64G、int4≈16G 是否正确；是否指出 MoE 按激活参估算。
<details>
<summary>参考答案</summary>

fp16 权重 ≈ 32e9×2B ≈ 64GB；int4 ≈ 32e9×0.5B ≈ 16GB。但 DeepSeek 等 MoE 模型总参大、激活参小，显存应按激活参数量估算，不能简单用"总参×2B"，否则严重高估。

</details>

### 5. 单卡能扛多少并发？给出公式并说明杠杆。
- **考察点**：KV Cache 与并发关系。
- **评分维度**：最大并发 ≈ 可用KV显存 ÷ 单请求KV峰值；是否列出降长度/量化/前缀缓存三个杠杆。
<details>
<summary>参考答案</summary>

最大并发 ≈ 可用 KV 显存 ÷ 单请求 KV 峰值（KV ≈ 2×层数×隐维×序列长×字节）。降低 max_model_len、量化、开启 prefix caching 都能释放 KV、提升并发。这正是 Day1 指标与 Day2 成本的桥梁。

</details>

### 6. 副本数怎么定？为什么要留缓冲？
- **考察点**：容量与副本推导。
- **评分维度**：N ≈ 峰值QPS ÷ 单实例QPS(SLA内)；缓冲防突发；结合自动伸缩。
<details>
<summary>参考答案</summary>

副本 N ≈ 峰值 QPS ÷ 单实例在 SLA 内可承载 QPS。留 20-30% 缓冲应对突发与冷启动；用 GPU 利用率触发自动伸缩平衡成本与体验。多副本需网关路由避免请求扎堆。

</details>

### 7. 成本优化三板斧是什么？各自的风险？
- **考察点**：降本手段及风险意识。
- **评分维度**：缓存/批处理/小模型降级；对应风险（缓存失效、降级误判、批处理延迟）。
<details>
<summary>参考答案</summary>

缓存（相同/相似请求不进模型）、批处理（离线合并拿折扣）、小模型降级（简单 7B、复杂 32B）。风险：结果缓存需防"语义同但答案过时"（TTL/失效）；降级需升级触发条件防漏审；批处理只适合非实时。

</details>

---

## L3 深度（能推导、能辨析）

### 8. 给一个"成本交叉点"的完整推导，并说明合规如何改变结论。
- **考察点**：交叉点建模 + 合规约束。
- **评分维度**：能否列出量纲并分别算 API/私有月成本找交点；是否说明合规硬约束可让私有优先级上调。
<details>
<summary>参考答案</summary>

设日均调用、平均 token、API 单价、私有硬件时租，分别算出 API 月成本（随量线性）与私有月成本（近似固定）。令二者相等得交叉点调用量。医疗/保险若要求数据不出域，则合规优先级高于纯成本，即使未到交叉点也可选私有，交叉点右移仍可接受。

</details>

### 9. 容量规划四步法是什么？哪一步最容易被糊弄？
- **考察点**：规划方法论。
- **评分维度**：SLA→实测单实例→副本→成本 四步；指出"单实例容量必须用真实 benchmark 测"而非套别人数字。
<details>
<summary>参考答案</summary>

四步：定 SLA → 用 Day1 benchmark_serving 实测单实例容量 → 副本数（留缓冲）→ 月成本。最易糊弄的是第二步：单实例容量严重依赖卡型/量化/长度，套用他人数字会失真，必须用自己目标环境实测。

</details>

### 10. 有人说"私有部署一定比 API 便宜"，怎么反驳？
- **考察点**：破除误区、商业视角。
- **评分维度**：是否从利用率、量纲、弹性、合规多维度反驳；是否给出混合架构作为更优解。
<details>
<summary>参考答案</summary>

仅在"量大且稳定、利用率高"时成立。低利用率时卡空跑，单位成本反超 API；突发峰值私有受卡数限制不如 API 弹性；且上线速度、定制性各异。最优通常是混合：稳态/合规私有，峰值 API 兜底。

</details>

### 11. 私有部署的"闲置损耗"为什么是最大浪费？怎么量化？
- **考察点**：利用率思维。
- **评分维度**：是否指出固定成本在闲置时无法摊薄；能否用"利用率 = 有效GPU·时 ÷ 租用时"量化。
<details>
<summary>参考答案</summary>

私有是固定成本，卡空跑仍计费。若利用率仅 30%，则 70% 租金被浪费，单位 token 成本约为满载的 3 倍。量化：利用率 = 有效推理 GPU·时 ÷ 租用 GPU·时；低于阈值（如 50%）应考虑缩容、调度合并或切 API。

</details>

---

## L4 场景（结合实际业务设计/判断）

### 12. 场景：特药理赔 Agent 当前用 API，月调用 150 万次（输入1800+输出500 token/次），你判断要不要转私有？请做成本测算并给决策建议，且诚实标注数据来源。
- **考察点**：综合成本测算 + 诚实标注。
- **评分维度**：能套公式算 API 与私有月成本、找交叉点；说明合规硬约束；标注"示意/估算"不伪造；给出混合建议。
<details>
<summary>参考答案</summary>

测算（示意单价）：API 月 ≈ (1800/1e6×1 + 500/1e6×3)×150万 ≈ ¥4950；私有（2×A100 ¥20/h 跑 32B-int4）≈ 20×720×2 + 电费600 + 运维3000 ≈ ¥31,800。当前量纲 API 更省。

建议：① 标注上述为"示意单价与估算"，真实需合同价+实测吞吐；② 若预测调用量×8 出现交叉点则转私有；③ 医疗合规若要求不出域，私有优先级上调；④ 最优为混合——高频固定问答走私有/缓存，长尾走 API。绝不可把示意数字当实测结论汇报。

</details>

### 13. 场景：企业 Agent 平台要支撑 10 个租户，SLA 要求 P99 TTFT≤2s。你如何做容量规划与多租户成本隔离？
- **考察点**：容量规划 + 多租户架构思维。
- **评分维度**：四步法落地；副本/负载均衡；多租户隔离（独立副本 vs 共享+配额）；降级与扩缩容策略。
<details>
<summary>参考答案</summary>

规划：① 定 SLA（P99 TTFT≤2s）；② 在目标卡/量化下用 benchmark_serving 实测单实例满足 SLA 的 QPS；③ 副本 N=总峰值QPS÷单实例QPS×1.3 缓冲，前面网关做负载均衡；④ 算月成本。

多租户隔离：合规/大客户可独立副本（强隔离），中小租户共享池+配额限流（省成本）。热点租户自动扩容独立副本。超阈值降级到小模型/缓存/转人工。全部基于 Day1 实测指标与 Day2 成本模型闭环。

</details>

---

## 评分汇总表

| 层级 | 题号 | 主题 | 达标要求 |
|------|------|------|----------|
| L1 基础 | 1-3 | 模式/成本结构/长上下文 | 概念准确 |
| L2 进阶 | 4-7 | 显存/KV/副本/优化 | 能算、能权衡 |
| L3 深度 | 8-11 | 交叉点/规划/误区/闲置 | 能推导、能辨析 |
| L4 场景 | 12-13 | 理赔 Agent / 企业平台 | 综合测算 + 诚实标注 |

### 计分
- 每题按"概念准确度 / 完整性 / 业务结合度"三档：✅ 到位 / ⚠️ 部分 / ❌ 缺失。
- **达标线①（私有部署成本估算）**：L1(2) + L2(4,5,6) + L3(9) 全 ✅，能从"装得下→并发→副本→月成本"完整推一遍。
- **达标线②（API vs 私有选型）**：L1(1) + L2(7) + L3(8,10) + L4(12,13) 全 ✅，能讲清成本/延迟/合规/弹性权衡与交叉点，且场景题诚实标注数据来源。
- 任一达标线出现 ❌ 即未达标，需回看对应手册章节重做自测清单。
