AI 共存的 QA 工具箱 — Copilot / Claude / ChatGPT 怎麼用、什麼不該用
QA 工程師的完整 AI 工具地圖。Coding Copilot、LLM Chat、AI 視覺迴歸、AI debugger、自動 PR review 各自適合什麼。實戰 workflow + 限制 + 紅線。
💡 本文原刊於 qa.9niche.com,2026-08 併入 9niche.com 懶人包,內容照原文完整搬遷。
目錄
1. 前言
「AI 工具一堆、不知道哪個適合 QA」是我最常被問的問題。不是工具越多越好、是用對位置才有用。這篇給你 QA 角度的完整工具地圖 + 實戰 workflow。
2. QA 一天能用 AI 的 10 個時機
每個都對應不同 AI 工具,下面分類講。
3. 5 種 AI 工具地圖
4. 1. Coding Copilot — 寫 code 時的副駕
推薦:Cursor 或 Continue(vs Copilot)
| 工具 | 強在 | 月費 |
|---|---|---|
| GitHub Copilot | 整合 GitHub、最普及 | $10 |
| Cursor | Chat + Edit + Agent 一體、UX 最好 | $20 |
| Continue | Open source、可接 local model | 免費 |
| Codeium | 免費版功能多 | 免費 |
| Cline / Roo Code | VS Code agent、自主執行 | 免費(自帶 API key) |
QA 用 Coding Copilot 的 5 個場景
// 場景 1: 寫 Page Object 框架
// 你打:"class LoginPage" + Tab
// AI 補全完整 POM 結構
// 場景 2: 補 selector
// 你打:"// click login button"
// AI 補:await page.getByRole('button', { name: 'Login' }).click();
// 場景 3: 補 edge case
// 你打:
test('login with valid credentials', () => { ... });
// 在這個 test 下按 Tab
// AI 自動生:
test('login with invalid password', ...);
test('login with empty fields', ...);
test('login with SQL injection attempt', ...);
// 場景 4: 重構
// 選取一段 spaghetti test、Cursor 按 Ctrl+K
// 寫 "refactor to use Page Object Model"
// 場景 5: 寫 jsdoc / docstring
// 寫完函式、Tab 自動補 documentation
不該用 Copilot 的時候
- 🚫 業務邏輯判斷(沒上下文會錯)
- 🚫 Domain-specific 規則(稅法 / 醫療 / 金融)
- 🚫 Security-critical code(容易產生 vulnerability)
5. 2. Chat LLM — 對話寫東西
模型選擇對照
我的個人配置
| 工具 | 用途 | 為什麼 |
|---|---|---|
| Claude | Spec review、寫文章、deep think | 寫作好、思考鏈長 |
| ChatGPT | code、快速答 | 寬廣、便宜 |
| Perplexity | 找資料、找 reference | 即時 web search |
| Gemini | Google Workspace 整合 | 連 Gmail / Docs |
QA 用 Chat 的高 ROI 場景
延伸:Prompt 範本庫 含 14 個直接 copy 的 prompt。
反模式:什麼不該丟給 Chat
- 🚫 公司機密 / 客戶資料 — 內容會被 train
- 🚫 完整 source code — 同上
- 🚫 個資 / PII — 法遵風險
- 🚫 「請告訴我正確答案」 — LLM 會編造、要自己驗
安全做法:
- 用企業版(Anthropic for Work / ChatGPT Enterprise)— 不訓練
- 自架 LLM(Llama / Mistral)跑 sensitive 資料
- 把資料 anonymize 再丟
6. 3. Code Reviewer — PR 自動 review
工具比較
| 工具 | 強項 | 弱項 |
|---|---|---|
| CodeRabbit | PR review 完整、補 test 建議好 | $15/month |
| Codium PR-Agent | Open source、self-host 可 | 設定複雜 |
| Greptile | 跨 repo 理解 | 貴 |
| Sweep | 自動寫 fix code | Beta、不穩 |
QA 怎麼用 AI Reviewer
- 加 CodeRabbit 到團隊 GitHub repo
- PR 進來 → AI 自動留 review comment
- QA 看 AI 抓出來的點、決定要不要深入
- AI 留 100 個 comment、QA 抓出 5 個關鍵
節省 QA review 時間 50%。
7. 4. 視覺 / 介面 AI
自動視覺迴歸
工具
| 工具 | 強項 | 月費(起跳) |
|---|---|---|
| Percy | BrowserStack 整合 | $39 |
| Applitools | AI 強、跨平台 | $1,500(企業) |
| Chromatic | Storybook 友善 | $149 |
| Playwright screenshot | 內建免費 | $0 |
新團隊:先用 Playwright snapshot(免費)、長大再 Percy。
8. 5. Agent / Auto-fix — 自主完成任務
工具
- Devin(Cognition Labs)— 號稱自主 SWE、貴
- Cline(VS Code)— 在你電腦自主跑
- Aider(Terminal)— git-aware
- OpenHands — Open source
QA 怎麼用 Agent
還不建議完全交給 agent。但可用:
- 跑 Cline 寫 boilerplate(POM 框架、fixture 設定)
- 跑 Aider 改大規模重構(rename、migration)
- NOT 用 agent 寫 production code
Agent 是 prototype 工具、不是 production 工具(目前)。
9. QA 一天的 AI 共存 workflow 範例
結果:以前 8 小時做的事、現在 5 小時做完、多 3 小時做探索性測試 + spec review 深入。
10. AI 增益的 5 個量化指標(建議追蹤)
1. Test case 寫作時間(從 spec → ready)
AI 前: 平均 3 hr / story
AI 後: 平均 1.5 hr / story
省時 50%
2. Spec review 問題數
AI 前: 平均 4 個
AI 後: 平均 12 個(質也高)
增加 3x
3. PR review 漏看率
AI 前: 8%
AI 後: 3%
降 5%
4. Flaky test 修復時間
AI 前: 平均 6 hr
AI 後: 平均 2 hr
省時 67%
5. 文件 / Email 寫作時間
AI 前: 1.5 hr / day
AI 後: 0.5 hr / day
省時 67%
每月省 30+ 小時、相當於多一個半天。
11. 反模式:AI 共存的 7 個地雷
1. 完全交給 AI
❌ 「Claude 寫完我就 push、反正 CI 會抓」
✅ 「Claude 出草稿、我 review、加 domain knowledge、push」
2. 丟公司機密
❌ 把 source code 整份貼 ChatGPT
✅ 用企業版 / self-host / 把 sensitive 部分抽掉
3. 不刪 AI 廢話
❌ AI 生 30 個 case 全部丟 testRail
✅ AI 生 30 個、刪 18 個重複、補 5 個 domain case = 17 個高品質 case
4. 拒絕用、覺得作弊
這是這時代最大的競爭劣勢。同事用、你不用 = 一天差 3 小時 = 一年差 750 小時。
5. 只用一個工具
錯:「我只用 Copilot」 對:Spec → Claude、Code → Cursor、PR review → CodeRabbit、查資料 → Perplexity
6. 不更新 prompt
LLM 升級快、舊 prompt 出來效果差。每月 review 一次自己常用的 prompt。
7. 出錯就放棄
❌ 「Claude 上次寫錯 endpoint、我以後不用 AI 了」
✅ 「我發現 prompt 該補 'don't hallucinate API endpoints'、調整後 OK」
12. 給 QA 學 AI 工具的順序
每個月加一個工具、不要一次塞 5 個。
13. 紅線:絕對不能交給 AI 的 5 件事
- 判斷 release 該不該上 — 商業風險
- Customer support escalation — 同理心
- Bug 的 severity / priority 最終決定 — 業務優先級
- 跟同事 1-on-1 — 人類關係
- 法遵 / 法律相關判斷 — 責任歸屬
14. 給 QA 的 5 句
- AI 是放大器、不是替代品
- 越會 review AI 輸出、越值錢
- 每月固定試 1 個新工具
- Prompt 寫得好、output 強 3 倍
- 判斷力是你最後堡壘 — 永遠不交給 AI
15. 最後
QA 用 AI 不是「會用就贏」、是「用對位置才贏」。亂用 → 出包;完全不用 → 落後。從今天起每天強制留 30 分鐘試 AI 工具、3 個月後你會發現「沒 AI 我寫不下去了」 — 那是好事。判斷力留給你、執行力交給工具。
延伸:
- Prompt 範本庫
- 用 LLM 生 Test Case
- 用 LLM 跑 Spec Review
相關連結
把 Claude / ChatGPT 變成測試案例產生器。從 spec 到 test case 的 prompt 範本、輸出品質檢核、什麼能交給 AI、什麼不能。
把 Spec review checklist 工具化。用 Claude / ChatGPT 兩段式 prompt 先列「需澄清」、再列「邊界與漏洞」,配合人工判讀流程。
給 QA 工程師的 LLM 工具完整對比。Claude vs ChatGPT vs Gemini vs Copilot vs Cursor 在 spec review / test case / code / debug 各場景實測、月費 vs 產出對比、安全紅線、組合配置建議。
相關懶人包
2026 QA 趨勢實戰:我看到的 5 個轉變(AI、Shift-Left、Observability)
從手動 QA 到 AI 輔助、從測試金字塔到測試獎盃。這篇分享我這 10+ 年看 QA 從「測完才知道」到「shift-left + AI」的真實觀察。
2026 QA 面試的 AI 題 — 12 題 + 答題框架(面試官想聽什麼)
2026 QA 面試新增一整類「你怎麼用 AI」的問題。這篇整理 12 個高頻 AI 面試題、每題附面試官真正想聽的點與答題框架,從「你用過哪些 AI 工具」到「AI 生的 test 怎麼信任」。
AI / LLM 功能 Spec Review — 幻覺 / 評估 / 成本 / 法遵 8 個必問
AI 功能 spec review 完整指南。LLM 不確定性處理、評估指標、Prompt versioning、成本控制、安全護欄、法遵(EU AI Act / GDPR)、Fallback、人工 review 流程。
一般聲明
本站提供之資訊僅供參考,不保證其完整性與正確性。使用者應自行判斷資訊之適用性。