> 九號工具站
返回列表

AI QA / LLM QA Engineer 轉職指南 — 這職位在做什麼、怎麼轉、薪資多少

AI QA / LLM QA Engineer 是 2026 最熱的新興 QA 職位。這篇拆解它到底在測什麼、跟一般 QA 差在哪、該補哪些技能、薪資範圍、以及一條從現職 QA 轉過去的實戰路線。

QA ai-qa-engineer llm-qa career-transition new-role qa-salary
· 最後更新 2026-06-26 · 最後審閱 2026-08-30

💡 本文原刊於 qa.9niche.com,2026-08 併入 9niche.com 懶人包,內容照原文完整搬遷。

1. 前言

2026 最熱的 QA 新職位是 AI QA / LLM QA Engineer。需求暴增、供給稀缺、薪資溢價。但很多人不知道它到底在做什麼、也不知道自己能不能轉。這篇講清楚。

還在判斷 AI 對 QA 是危機還是機會?先看 AI 時代 QA 還有未來嗎

2. 一般 QA vs AI QA — 測的東西本質不同

關鍵差異:一般功能你能寫死 expected value;AI 輸出是機率性的、沒有單一正確答案、要評估「夠不夠好」。這就是為什麼需要一個專門角色。

flowchart TB subgraph Normal["一般 QA · 確定性"] N1["輸入 A → 一定得 B"] N2["pass / fail 二元"] N3["測功能正確性"] end subgraph AIQA["AI QA · 機率性"] A1["同 prompt → 每次答不同"] A2["品質分數 / 信心區間"] A3["測幻覺·安全·偏見·一致性"] end style Normal fill:#06b6d4,color:#fff style AIQA fill:#a855f7,color:#fff

3. AI QA 到底測什麼

測試類型在測什麼站上深入文章
LLM Evaluation輸出品質量化LLM Evaluation Testing
RAG 測試檢索 + 生成品質RAG 系統測試
Agent 測試多步驟決策AI Agent 系統測試
紅隊測試找安全漏洞LLM Red Teaming
多模態圖/音/影測試Multi-modal AI Testing
mindmap root((AI QA 測試範圍)) LLM 輸出品質 正確性 eval 幻覺率 一致性 RAG 系統 檢索準不準 引用對不對 AI Agent 多步驟對不對 工具呼叫正確性 安全與紅隊 jailbreak prompt injection 偏見與合規 公平性 敏感內容

4. 該補的技能(3 層)

最該先練的是「eval 設計」 — 怎麼把模糊的「這答案還不錯」變成可重複、可比較的分數。這是 AI QA 的命根、也是多數人卡住的地方。

flowchart LR L1["第 1 層 · 基礎<br>LLM API · temperature<br>token · prompt 結構"] --> L2["第 2 層 · 核心<br>eval 設計<br>怎麼量化『好不好』"] L2 --> L3["第 3 層 · 進階<br>RAG / agent / 紅隊<br>AI 系統測試"] style L1 fill:#06b6d4,color:#fff style L2 fill:#a855f7,color:#fff style L3 fill:#10b981,color:#fff

5. 從現職 QA 轉過去的路線

沒有公司 AI 功能可測?用 side project — 接一個 LLM API、做一個小 RAG、自己寫 eval。有實作經驗比證照值錢

完整轉型節奏可參考 手動 QA 轉型 AI-Augmented QA 90 天;技能取捨看 AI 取代不了的 QA 技能

flowchart TB S1["先測公司現有 AI 功能<br>(有就從這開始)"] --> S2["學會用 LLM API<br>寫第一個 eval script"] S2 --> S3["挑一類深入<br>RAG 或 agent 或紅隊"] S3 --> S4["做出成果<br>建 eval pipeline / 抓到 AI bug"] S4 --> S5["對外輸出<br>履歷 + 面試講 AI QA 經驗"] style S1 fill:#06b6d4,color:#fff style S5 fill:#10b981,color:#fff

6. 薪資與市場

面向現況
薪資溢價比同年資一般 QA 高約 15-30%
供需需求 >> 供給(會測 AI 的人稀缺)
競爭者多數 QA 不懂 eval、多數 ML 不懂測試、卡交集者吃香
風險領域新、標準還在變、要持續學

稀缺的原因:它卡在「測試思維 × AI 理解」的交集。傳統 QA 補 AI 比 ML 工程師補測試容易 — 這是你的機會。

7. 反模式

flowchart TD Anti[轉 AI QA 反模式] --> A1["以為要先會訓練模型"] Anti --> A2["只考證照不做實作"] Anti --> A3["用測功能的方式測 AI<br>(寫死 expected)"] Anti --> A4["只為薪資轉、不喜歡不確定性"] Anti --> A5["不學 eval、只會手動試 prompt"] style A1 fill:#ef4444,color:#fff style A2 fill:#ef4444,color:#fff style A3 fill:#ef4444,color:#fff style A4 fill:#ef4444,color:#fff style A5 fill:#ef4444,color:#fff

8. 給 QA 的 5 句

  1. AI QA 測的是機率性輸出、不是確定性功能
  2. 不用會訓練模型、要會測模型行為
  3. eval 設計是命根、先練它
  4. 有實作經驗比證照值錢
  5. 卡在「測試 × AI」交集的人最稀缺

9. 最後

AI QA 不是另一個職業、是 QA 的進化版。你既有的測試思維是最難補的部分、AI 知識反而好補。從測公司現有的 AI 功能、或一個 side project 的 eval 開始 — 半年後你就站在這個稀缺交集裡。

延伸閱讀:

ℹ️

一般聲明

本站提供之資訊僅供參考,不保證其完整性與正確性。使用者應自行判斷資訊之適用性。

意見反饋