前言

如果你最近打開搜尋引擎打「怎麼學 AI」,大概會在十分鐘內看到三種建議:先把微積分和線性代數讀完、去買一張 RTX 4090、或是先啃完 Transformer 那篇論文再說。這三個建議沒有一個是錯的,但擺在一起、擺在最前面,會產生一個很實際的後果:你連第一步都還沒踏出去,就已經覺得這件事不是自己能碰的。更常見的情況是,真的照著做了,三個月後數學筆記寫了一堆、顯卡也買了,卻還是做不出一個能用的東西,然後就放棄了。

這個系列不是教科書,是導航。教科書的責任是把一個主題教到完整、教到精確;導航的責任不一樣——它只回答「這一站要學什麼、去哪裡學、學到什麼程度算夠、可以往下一站走了」。這一篇是整個系列的起點,會先把全局地圖攤開,並拆掉三個最容易讓人一開始就走錯方向的迷思。

① 這一站要解決什麼問題

先說清楚一件事:如果你有後端開發經驗,你在學 AI 這條路上真正的障礙,通常不是「學不會」。你會寫程式、會抽象、會除錯,這些能力在 AI 系統裡完全用得上。真正的障礙是沒有地圖——不知道這個領域有哪些站、站與站之間的先後順序是什麼、每一站該停留多久才算「夠用」。沒有地圖的後果就是亂序學習:可能一開始就跳去讀論文,或是一頭栽進某個框架的原始碼,結果學了很多片段,卻拼不出一張完整的圖。

這一篇的任務只有兩件事:第一,把整條路線的全貌畫出來,讓你知道自己現在在哪、接下來要往哪走;第二,先拆掉三個最容易讓初學者卡在起點的迷思,因為這三個迷思如果不拆掉,你可能連地圖都還沒看到就已經放棄了。

② 核心概念:三個迷思與一條依賴鏈

迷思一:學 AI 等於訓練模型

大部分人對「學 AI」的第一印象,來自於媒體報導的模型訓練——幾千張 GPU、天價電費、動輒數億美元的訓練成本。這個印象沒有錯,但它描述的是一小群公司在做的事。今天 AI 工程師的主流工作內容,其實是用既有的、別人已經訓練好的模型,去建構應用系統:設計檢索邏輯、串接工具呼叫、處理錯誤重試、控制成本與延遲。訓練前沿模型(frontier model)這件事,已經高度工業化、資本密集,集中在極少數擁有龐大算力的公司手上,不是個人或一般團隊的必經之路。換句話說,你不需要先成為模型訓練專家,才能開始做 AI 系統開發。

迷思二:一定要先買顯卡

這是最常見、也最容易讓人打退堂鼓的迷思。要拆解它,得先理解一個關鍵技術:RAG(Retrieval-Augmented Generation,檢索增強生成)。

RAG 最好的比喻是「開書考試」。一般人以為做 AI 系統要「教模型新知識」,就像關起門來讓學生死背整本書;但 RAG 做的事情完全不同——它讓模型帶著資料去考試,考試當下才翻書、找到相關那幾頁,然後照著回答。模型本身的知識(也就是權重)完全沒有被改動過,被處理的只有「書」,也就是你的語料。

這個「翻書」的過程,實際上拆成兩個階段。第一個階段是把語料準備好、建立索引:

flowchart LR
    A[語料] --> B[切塊 Chunking]
    B --> C[轉成向量 Embedding]
    C --> D[(向量索引)]

第二個階段才是回答問題:使用者丟出問題,系統去索引裡面搜尋相關片段,把片段和問題一起組成 Prompt,交給 LLM 生成答案:

flowchart LR
    Q[使用者問題] --> R[到索引中檢索]
    D[(向量索引)] --> R
    R --> S[取出相關片段]
    S --> P[片段 + 問題組成 Prompt]
    P --> M[LLM 生成答案]

把這兩張圖放在一起看,結論就很清楚了:建立索引和查詢索引這兩個階段,全程都沒有梯度計算、沒有反向傳播、沒有權重更新。這些是「訓練」才會出現的東西,而 RAG 從頭到尾都不涉及訓練。既然不訓練,也就不需要訓練模型才需要的那種顯卡。你當然可以用顯卡加速某些本地運算(例如自己跑 embedding 模型),但那是選配,不是「必須先買」的門檻。

迷思三:必須先把數學讀完

數學在 AI 領域確實有用,但它是按需補的東西,不是入門的先決條件。這個系列每一站都會明確標出「學到哪裡就該停」,數學也一樣——你只需要在真正卡住的那個點,補足那個點需要的數學,而不是預先把整套機器學習數學修完才敢開始動手。離散數學、線性代數、機率論確實會在某些主題(例如評估指標、向量相似度)用得上,但它們不是這條路的入場券。

依賴鏈與全系列地圖

拆完三個迷思之後,接下來要回答的問題是:如果不是「訓練模型」,那這條路到底該怎麼走、先後順序是什麼?下面這張圖畫出整個系列的知識依賴關係:

flowchart TD
    IR[資訊檢索 IR] --> RAG
    RAG --> EVAL[評估 Evaluation]
    EVAL --> AGENT[Agent]
    AGENT --> REL[Reliability]
    AGENT --> INFRA[Application Infra]
    AGENT --> SEC[Security]

這條鏈不是隨意排的,每一層都依賴前一層打下的基礎:

  • 先懂資訊檢索(IR),才能懂 RAG:RAG 的核心動作就是「檢索」。如果你不理解檢索指標(例如什麼叫做召回率、什麼叫排序品質),當 RAG 系統回答得不好時,你根本無從判斷問題出在「找錯片段」還是「片段找對了但生成錯了」。
  • 先懂評估,才能懂 Agent 好不好:Agent 會做出一連串決策——呼叫哪個工具、要不要重試、什麼時候該停下來問人。沒有評估方法,你改動了 Agent 的邏輯之後,完全不知道這次改動是讓系統變好還是變差,只能憑感覺猜。
  • Agent 之後才分岔到 Reliability、Application Infra、Security:這三者是 Agent 進入生產環境後才會冒出來的問題,也是這個系列標題強調「可靠」的原因。

最後這一點特別值得展開講:這條路跟你原本的後端開發經驗是互補的,不是取代關係。一旦 Agent 系統要上線,你會發現熟悉的問題全部回來了——誰有權限呼叫哪個工具、同一個操作重複執行會不會出錯(冪等性)、失敗了要怎麼重試、每一步決策要不要留稽核記錄、系統出問題時能不能被監控到(可觀測性)。這些正是後端工程師的核心能力,AI 只是換了一種需要被治理的元件。

③ 去哪學

這一篇的定位是地圖,所以「去哪學」主要指向的是這個系列接下來的文章,而不是外部資源。下面是全系列 22 篇的分部總表,讓你知道每個階段大致對應到哪些篇章:

階段 大致涵蓋主題
第 0 部 出發前(第 1-3 篇) 學習地圖、方向選擇、學習方法
第 1 部 數學站(第 4-7 篇) 數學需要多少、機率統計、線性代數、微積分
第 2 部 語言與工具(第 8-9 篇) Python/Go/Node 分工、資料處理工具
第 3 部 模型直覺(第 10-11 篇) 傳統機器學習、神經網路與 Transformer
第 4 部 主戰場(第 12-18 篇) 資訊檢索與 RAG、評估、Agent 基礎與可靠性、應用基礎設施、AI 安全
第 5 部 落地(第 19-22 篇) 貫穿專案、讀論文、職涯、總結

至於外部資源,這一篇只推薦一個,而且推薦的目的很單純:不是拿來學技術細節,而是拿來建立對整個產業現況的整體感。

  • Stanford HAI AI Index Report——推薦理由是它能讓你直接看到「模型訓練高度集中在少數業界公司、而推論成本正快速下降」這個產業事實的第一手資料,而不是透過網路上二手轉述或行銷話術去理解。它的資料來源公開透明、每年更新一次,而且不隸屬於任何廠商,不會為了推銷特定產品而誇大或簡化事實。這一點很重要,因為 AI 領域的資訊雜訊很多,找一份不賣東西給你的年度報告,比找十篇部落格文章更值得信任。

④ 學到哪裡就該停

這一站的停損線很明確、可以自我檢查:

你能用自己的話回答以下三個問題,這一站就算結束,可以往下一篇走了:

  1. RAG 有沒有在訓練模型?
  2. 我需要買顯卡嗎?為什麼?
  3. 為什麼要先學檢索,而不是先學 Agent?

如果這三題你都能不看文章、憑自己的理解講出來,就代表這一站的目標已經達成,不需要再往下鑽。

同樣重要的是反過來列出現在不需要理解的東西,因為零基礎學習者最容易犯的錯,就是看到一個新名詞就想弄懂它的底層原理:

  • Embedding 具體是怎麼算出來的(背後的模型結構與訓練方式)
  • Attention 機制的數學推導
  • 向量資料庫內部索引結構是怎麼實作的(例如 HNSW 演算法細節)

這些東西未來會不會用到?會。但不是現在。現在需要的只是知道「有這個東西存在、它大概做什麼用」,細節留到真正需要動手調整效能或除錯時再補。

⑤ 怎麼驗證你學會了

以下三題可以幫你確認這一篇的內容真的內化了,每題附上參考答案要點:

第一題:用一句話解釋 RAG 與 fine-tuning 的差別。
參考要點:RAG 是「查詢時檢索外部資料、模型權重不變」;fine-tuning 是「用訓練資料重新調整模型權重」。一個是考試時翻書,一個是考前重新讀書並且改變大腦裡的知識。

第二題:有人說「你要學 AI 就得先買顯卡」,你怎麼回應?
參考要點:先問清楚對方指的是「訓練模型」還是「建構應用系統」。如果是後者(絕大多數 AI 工程工作屬於這一類),RAG 的索引建立與查詢階段都不涉及梯度計算與權重更新,因此不強制需要顯卡;顯卡只在你想本地加速某些運算(例如自架 embedding 服務)時才是選配。

第三題:在這條路上,你的既有後端經驗最可能在哪一站派上用場?
參考要點:Agent 進入生產環境之後的 Reliability、Application Infra、Security 這幾站——權限控管、冪等性設計、重試邏輯、稽核記錄、可觀測性,這些都是後端工程師原本就熟悉的問題域,只是換了一個要被治理的新元件。

⑥ 常見的坑與迷思

最後整理幾個零基礎學習者常踩、而且會浪費大量時間的坑:

  • 第一天就去裝 LangChain 之類的框架:框架會幫你把檢索、Prompt 組裝、評估這些步驟全部包裝起來,好處是快速看到一個 Demo 能跑,壞處是等系統真的出問題時,你完全不知道是哪一層壞掉——是檢索沒找對片段、Prompt 組裝錯了,還是模型本身理解錯誤。建議先搞懂每一層在做什麼,框架留到後面站再引入。
  • 一開始就想做 fine-tuning:這條路會被 CUDA 環境設定、顯存不足、訓練資料格式整理這些工程雜務吃掉大量時間,走到最後往往還是說不清楚「為什麼這個模型現在會這樣回答」。對大多數應用場景來說,RAG 加上好的 Prompt 設計就已經足夠,fine-tuning 應該是後段才考慮的選項。
  • 想先把數學讀完再開始動手:這是最常見的放棄原因。數學是按需補的工具,不是入場券;預先讀完一整套機器學習數學,往往在讀到一半就失去動力,永遠沒機會走到「動手做系統」這一步。

這一篇把地圖攤開了,也把最容易卡住的三個迷思拆掉了。下一篇要做的事,是在這張地圖上幫你選方向——AI 領域底下還分成好幾條路線,哪些適合從後端背景切入、哪些現階段不必碰,會在下一篇具體說明。先確認方向,再上路。


系列導覽

本文是「從零打造可靠 AI 系統」系列第 1 篇,共 22 篇。