AI / LLM 功能 Spec Review — 幻覺 / 評估 / 成本 / 法遵 8 個必問
AI 功能 spec review 完整指南。LLM 不確定性處理、評估指標、Prompt versioning、成本控制、安全護欄、法遵(EU AI Act / GDPR)、Fallback、人工 review 流程。
💡 本文原刊於 qa.9niche.com,2026-08 併入 9niche.com 懶人包,內容照原文完整搬遷。
目錄
1. 前言
「PM 寫『加 AI 助手』 — 你看完只想笑哭」。AI 功能 spec 95% 都漏掉關鍵維度。這篇給你 8 個必問問題 + 完整 review framework。
2. AI 功能 spec 跟一般 spec 最大差異
核心:AI spec 不能寫「正確」、要寫「成功率達到 X%、失敗時 Y」。
3. 8 個必問問題
4. 必問 1: 評估指標
Spec 該寫:
Eval set 大小: 200 個範例
Pass 條件: ≥ 90% 通過 LLM-as-judge
Human review: 每月抽 50 個、QA 評分
Regression: 改 prompt 後 eval set 跑、不能降 > 2%
不能寫的爛 spec
❌ 「AI 要回答正確」 ❌ 「AI 不能說錯話」
該寫的具體 spec
✅ 「Eval set 200 個典型 QA 對、新 prompt 通過 ≥ 90% 才能上線」 ✅ 「每月人工抽 50 個、品質分 ≥ 4/5」
5. 必問 2: 失敗 Fallback
Spec 該寫:
LLM call timeout (15s): 自動 retry 1 次
全部失敗: 回「目前無法回答、請聯絡客服」+ 記 log
明確錯誤: 顯示「我不確定、建議問人類」
高風險問題(健康/法律/金融): 直接 escalate 人工
6. 必問 3: 幻覺處理
幻覺 = LLM 編造事實。100% 不可能消除、只能降低 + 偵測。
Spec 該寫:
RAG 模式: 每個事實聲明必須 cite source、無 source 不回
Fact check: 含日期 / 數字 / 名稱的回應要對知識庫驗
UI 警告: 「AI 生成、可能有誤」一律顯示
高風險 domain: 必須 cite + 人工 review
7. 必問 4: Prompt 管理
Spec 該寫:
Prompt 存 Git: 每次改有 commit + reviewer
Prompt version: 帶在每次 LLM call、log 記版本
A/B test: 新 prompt 先 5% 流量、看 7 天 metric
Rollback: 一鍵切舊 prompt、< 30 秒
8. 必問 5: 模型選擇
| 維度 | 該問 |
|---|---|
| Primary | 哪個 model(GPT-4 / Claude Sonnet / Gemini 2)? |
| Backup | Primary 掛了用哪個? |
| Cost limit | 每次 call 預算上限 |
| Latency | p95 要求? |
| 升級策略 | 新版 model 出來、A/B test 流程 |
9. 必問 6: 成本控制
Spec 該寫:
Per-user rate limit: 100 calls/day(free) / 1000 calls/day(paid)
Cache: 完全相同問題 24h 內回 cache
Cost alert: 整體每日支出 > $X 自動 throttle
Prompt 大小: 上限 4K token、超過砍掉 history
10. 必問 7: 護欄 Guardrails
Spec 該寫:
禁忌主題: 醫療診斷 / 法律建議 / 投資建議 → 拒絕並建議找專業人
Prompt injection: 偵測 "ignore previous instructions" 模式、拒絕
個資輸出: 偵測 email / 電話 / 信用卡、mask 後回
冒充: 不能聲稱自己是「真人」、必須說 AI
11. 必問 8: 法遵
Spec 該寫:
AI 用途分類: 是否屬 EU AI Act「高風險」?
Audit log: 保留 user / prompt / response / decision、3 年
Right to explain: 使用者可問「為什麼這結果」
資料保留: LLM provider 是否會 train 我們資料?合約有規範嗎?
被遺忘權: 使用者刪帳號、AI 訓練資料怎處理?
12. 完整 review 範例
Spec 原文(典型 PM 寫法)
新增 AI 客服助手
- 使用者問問題、AI 回答
- 整合 OpenAI GPT-4
- 期望 80% 問題自動回答
Review 提的 24 個問題
光是 8 必問 × 3 個延伸 = 24 個。例如:
1. 評估: 80% 怎麼量?哪 200 個 eval question?
2. Fallback: 答不出來怎處理?
3. 幻覺: 客戶問退款政策、AI 編造怎辦?
4. Prompt: 改一次 prompt 怎麼測影響?
5. 模型: GPT-4 掛了用什麼?
6. 成本: 每個使用者一個月平均花多少?
7. 護欄: 使用者罵髒話 / 問醫療問題怎處理?
8. 法遵: 對話 log 存多久? 客戶可以要求刪除嗎?
PM 多半答不出來 → spec 退回。
13. QA 該堅持的 DoR
6 項全達標才能進 sprint。
14. 反模式
15. 給 QA 的 5 句
- AI 功能 spec 不能寫「正確」、要寫成功率
- 沒 eval set 等於沒 spec
- Prompt 改動 = code 改動、要走 review
- Fallback 比 happy path 重要 10 倍
- 法遵問題 spec 沒寫 = 公司賠錢
16. 最後
AI 功能 spec review 是 2026 後 QA 最稀缺的技能。一般 spec checklist 救不了你 — 必須有 AI 專用 framework。從這 8 必問開始、每個 AI 功能 spec 至少問 3 倍的問題、上線後 incident 砍 70%。
延伸:
相關連結
把 Spec review checklist 工具化。用 Claude / ChatGPT 兩段式 prompt 先列「需澄清」、再列「邊界與漏洞」,配合人工判讀流程。
QA 工程師的完整 AI 工具地圖。Coding Copilot、LLM Chat、AI 視覺迴歸、AI debugger、自動 PR review 各自適合什麼。實戰 workflow + 限制 + 紅線。
一份能在會議前用 15 分鐘掃完整份 spec 的 checklist。從前置條件、邊界、錯誤處理、狀態機到資料一致性,附使用範例。
相關懶人包
2026 QA 趨勢實戰:我看到的 5 個轉變(AI、Shift-Left、Observability)
從手動 QA 到 AI 輔助、從測試金字塔到測試獎盃。這篇分享我這 10+ 年看 QA 從「測完才知道」到「shift-left + AI」的真實觀察。
2026 QA 面試的 AI 題 — 12 題 + 答題框架(面試官想聽什麼)
2026 QA 面試新增一整類「你怎麼用 AI」的問題。這篇整理 12 個高頻 AI 面試題、每題附面試官真正想聽的點與答題框架,從「你用過哪些 AI 工具」到「AI 生的 test 怎麼信任」。
AI Agent 系統測試 — 自主執行 / 工具呼叫 / 多步推理的 QA 策略
測試 AI Agent 完整方法。Tool calling 驗證、Trajectory 評估、Failure mode 分類、無限迴圈防止、成本上限、安全 sandbox、Multi-agent 協作測試。
一般聲明
本站提供之資訊僅供參考,不保證其完整性與正確性。使用者應自行判斷資訊之適用性。