ChatGPT vs Claude vs Gemini vs Copilot for QA — 2026 實戰選擇指南
給 QA 工程師的 LLM 工具完整對比。Claude vs ChatGPT vs Gemini vs Copilot vs Cursor 在 spec review / test case / code / debug 各場景實測、月費 vs 產出對比、安全紅線、組合配置建議。
💡 本文原刊於 qa.9niche.com,2026-08 併入 9niche.com 懶人包,內容照原文完整搬遷。
目錄
1. 前言
「LLM 工具一堆、QA 該用哪個」每週被問。不同工具各有強項、選錯一年浪費幾千美金 + 沒效率。這篇給你 QA 角度的實戰對照。
2. 一張圖選 model
3. 完整對照表
| 維度 | Claude | ChatGPT | Gemini | Cursor | Copilot |
|---|---|---|---|---|---|
| 寫作能力 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | N/A | N/A |
| 思考鏈 / 推理 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | 用 model | 用 model |
| Code 生成 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 誠實度(少幻覺) | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ | 同 model | 同 |
| Context 長度 | 1M (Sonnet 4.7) | 128K (GPT-4o) | 1M (2.0) | 視 model | 視 |
| 多模態(圖) | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | N/A | N/A |
| 語音對話 | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | N/A | N/A |
| Code interpreter | ❌ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | 不需要 | N/A |
| IDE 整合 | ⭐⭐⭐ (Claude Code) | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 價格 (個人月費) | $20 | $20 | $20 | $20 | $10 |
| 企業版 | $30/user | $60/user | $30/user | $40/user | $20/user |
| API 便宜度 | 中 | 中 | 便宜 | 看 model | 用 GH |
4. QA 場景實測對比
場景 1:Spec Review(兩段式 prompt)
測試方法:餵 1200 字 PRD、跑兩段式 prompt
評分:列出問題的 relevance + completeness
| Model | 問題數 | 品質 | 編造率 |
|---|---|---|---|
| Claude Sonnet 4.7 | 18 | ⭐⭐⭐⭐⭐ | 5% |
| GPT-4o | 14 | ⭐⭐⭐⭐ | 12% |
| Gemini 2.0 | 11 | ⭐⭐⭐ | 18% |
Claude 大勝。長文 + 結構化思考是它強項。
場景 2:Test Case 生成
餵 user story、要 12 個 case(happy/邊界/異常/安全)
| Model | 完整度 | 邊界 case 比例 | 重複率 |
|---|---|---|---|
| Claude | 12/12 | 33% | 8% |
| GPT-4o | 11/12 | 25% | 15% |
| Gemini | 10/12 | 20% | 25% |
Claude / GPT-4o 接近、Gemini 多重複。
場景 3:寫 Playwright code
要求:寫一個 login E2E + POM 結構
| Model | 跑得起來 | Best practice | Selector 品質 |
|---|---|---|---|
| Cursor (Claude) | ✓ | ⭐⭐⭐⭐⭐ | getByRole 為主 |
| Cursor (GPT-4) | ✓ | ⭐⭐⭐⭐⭐ | getByRole 為主 |
| GitHub Copilot | ✓ | ⭐⭐⭐⭐ | 偶用 CSS |
| Claude (chat) | ✓ | ⭐⭐⭐⭐⭐ | 教科書級 |
| ChatGPT (chat) | ✓ | ⭐⭐⭐⭐ | 偶用過時 API |
場景 4:Debug stack trace
餵 100 行 Java stack trace、要找 root cause
| Model | Root cause 對 | 建議實用 |
|---|---|---|
| Claude | ✓ | ⭐⭐⭐⭐⭐ |
| GPT-4o | ✓ | ⭐⭐⭐⭐ |
| Gemini | 7/10 | ⭐⭐⭐ |
場景 5:寫 PR description / 文件
| Model | 結構 | 簡潔 | 中英混排 |
|---|---|---|---|
| Claude | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| GPT-4o | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| Gemini | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ |
5. 推薦組合配置
配置 A: 預算充足($60/月)— ⭐ 推薦
✓ Claude Pro $20 → spec / 寫作 / debug 主力
✓ Cursor Pro $20 → 寫 code 主力(裡面用 Claude)
✓ Perplexity Pro $20 → 找資料 / 比較工具
配置 B: 中等預算($30-40/月)
✓ Claude Pro $20 → 主要對話
✓ GitHub Copilot $10 → IDE 補位
+ Gemini Free / Perplexity Free
配置 C: 預算緊($0/月)
✓ Claude Free + ChatGPT Free + Gemini Free(輪流用)
✓ Cursor Free tier(限量但夠用)
+ DeepSeek / Qwen 自架 Ollama(無限免費)
6. 安全:哪些不能用線上 LLM
7. 本地 LLM 設置
# 1. 裝 Ollama
brew install ollama # macOS
# 2. 拉 model
ollama pull llama3.1:70b
ollama pull qwen2.5:32b # 中文強
ollama pull deepseek-coder:33b # code 強
# 3. 跑
ollama run llama3.1:70b
# 4. 接 Cursor / Continue
# Settings → Local model → http://localhost:11434
無限免費、完全離線、敏感資料安全。70B model 需要 64GB RAM、跑起來慢、但能用。
8. 一年成本對比
| 方案 | 月 | 年 | 適合 |
|---|---|---|---|
| 全免費(輪流 + Ollama) | $0 | $0 | 學生 / 自學 |
| 配置 C | $10 | $120 | Junior |
| 配置 B | $30 | $360 | Mid |
| 配置 A | $60 | $720 | Senior+ |
| 企業版(公司付) | $100+ | $1200+ | 公司付帳 |
9. 反模式
10. 給 QA 的 5 句
- 單選 → Claude;多選 → Claude + Cursor + Perplexity
- Spec / 寫作用 Claude、不要省
- 寫 code 用 Cursor(裡面切 Claude)勝過 chat 介面
- 公司 code 不丟線上、用 Ollama
- 每月試一個新工具、市場變太快
11. 最後
QA 用 AI 不是「裝越多越強」、是「用對工具配對工作」。從 Claude Pro + Cursor Pro 兩個起跳、$40/月、覆蓋 90% QA 工作。剩下 10% 用免費版 + Ollama 補。
延伸:
相關連結
QA 工程師的完整 AI 工具地圖。Coding Copilot、LLM Chat、AI 視覺迴歸、AI debugger、自動 PR review 各自適合什麼。實戰 workflow + 限制 + 紅線。
給 QA 工程師的 AI 工具實戰 daily routine。從晨間 stand-up 到下班 PR review、9 個關鍵時機用對 AI、實測每天省 3-4 小時、保留判斷力給高價值工作。
GitHub Copilot / Cursor / Claude Code 等 AI 工具產出的 code 風險與測試策略。Hallucination 模式、Security 漏洞、Edge case 漏洞、隱藏的相依性、QA 的新角色。
相關懶人包
2026 QA 趨勢實戰:我看到的 5 個轉變(AI、Shift-Left、Observability)
從手動 QA 到 AI 輔助、從測試金字塔到測試獎盃。這篇分享我這 10+ 年看 QA 從「測完才知道」到「shift-left + AI」的真實觀察。
2026 QA 面試的 AI 題 — 12 題 + 答題框架(面試官想聽什麼)
2026 QA 面試新增一整類「你怎麼用 AI」的問題。這篇整理 12 個高頻 AI 面試題、每題附面試官真正想聽的點與答題框架,從「你用過哪些 AI 工具」到「AI 生的 test 怎麼信任」。
AI / LLM 功能 Spec Review — 幻覺 / 評估 / 成本 / 法遵 8 個必問
AI 功能 spec review 完整指南。LLM 不確定性處理、評估指標、Prompt versioning、成本控制、安全護欄、法遵(EU AI Act / GDPR)、Fallback、人工 review 流程。
一般聲明
本站提供之資訊僅供參考,不保證其完整性與正確性。使用者應自行判斷資訊之適用性。