- 這幾天拆了一堆零件(LLM 本質、tool use、選型、微調)——這篇用一個比喻(LLM = 一顆腦)把它們接成一張地圖。
- 五塊拼圖:腦是什麼(LLM)→ 腦跑在哪(平台)→ 腦怎麼做事(工具/Agent)→ 怎麼挑腦(選型)→ 養自己的腦(微調/RAG/資產)。
- 一句話串起來:挑一顆對的腦 → 放對平台 → 讓它透過工具做事 → 需要專屬就養自己的 → 落地成公司資產。
- 每塊都連到當天的深入文章;文末有「你是哪種人」的閱讀路徑。
這幾天寫了好幾篇,各自很深:選副手、tool use 機制、模型全掃、微調實戰……但很多人(包括我自己一開始)會卡在——這些到底怎麼拼成一個完整的東西?這篇不再講細節,而是把它們接成一張地圖,讓你看懂 LLM、平台、工具、Agent、微調彼此的關係。用一個貫穿的比喻:LLM 就是一顆腦。
LLM 本質
平台
工具/Agent
選型
微調/RAG/資產
① 腦是什麼:LLM 就是一顆會「預測下一個字」的腦
最底層,LLM 只做一件事:看目前的文字,預測下一個 token(字)。你透過 API 跟它互動,本質是POST 一段 JSON、拿回一段 JSON,而且伺服器無狀態——它不記得你上一句,是你的程式每次把完整對話重送。
- 你付的是 token:輸入(prompt)+ 輸出(completion)都算錢。
- 無狀態 → 長對話越來越貴(歷史每次重送),也有 context 上限。
- reasoning 模型會先「想」(燒看不見的思考 token)再答。
- 連「工具呼叫」也只是它吐出一段特定格式的文字,不是它真的有手。
② 腦跑在哪:同一顆腦,平台不同差很多
同一顆腦,跑在不同平台/硬體上,好不好用天差地遠。這是最多人忽略的一層——以為選好模型就結束了,其實「哪個平台上的哪個模型」才是關鍵。
| 平台這一層決定 | 實例 |
|---|---|
| context 上限 | 同一個 GLM 在 8K context 被推理鏈餓死吐不出答案、在 203K 就 10/10 |
| 量化(塞不塞得下) | 參數×bit÷8≈GB;20B Q4 約 16GB,決定你的機器跑不跑得動 |
| 硬體正確性 | 不合的 GPU(AMD iGPU Vulkan)會算錯、吐亂碼——先確認「算得對」再談快 |
| 限流 / 隱私 | 免費層有限流;免費雲資料多半會被拿去訓練(公司內容不能上) |
③ 腦怎麼「做事」:工具往返,Agent 是這個 loop 跑很多輪
腦沒有手——它不能真的查天氣、讀檔、跑指令。它靠一套工具往返協議:你給它工具清單,它回一張「請你幫我呼叫 X」的單子,你的程式去執行,把結果送回,它才產生最終答案。
- 一次工具呼叫 = 至少兩發 API 請求(要它決定 → 給它結果)。
- Agent(如 Claude Code)就是把這個往返自動跑很多輪,直到不再要工具。
- MCP 是 host 端「工具從哪來、怎麼執行」的插座;A2A 是「腦對腦」委派——三者是同一個骨架(宣告能力→結構化請求→結構化結果)的三個層級。
④ 怎麼挑對的腦:不只看幾 B,看五張獨立成績單
「幾 B、塞不塞得下」只是入場券。真正決定好不好用的是五張彼此獨立、不能互推的成績單——實測打過臉:寫程式滿分的模型,當 agent 卻寫出空檔案。
| 成績單 | 一句話 |
|---|---|
| 規模 × 平台 context | 同模型跨平台差巨大 |
| 寫程式(codegen) | 一次過 + 遵不遵守隱形契約 + 不作弊 |
| 工具/agent | 最被忽略、卻最決定能不能當副手;要用真實多步任務測 |
| coder vs reasoning | 吃碼力選 coder、吃推理選 reasoning |
| 格式/免費真實性/隱私 | OpenAI 相容?原廠免費?會被訓練? |
全掃 89 個免費模型還發現:參數量與 agent 好用脫鉤甚至反相關——20B 小鋼炮穩過、某些大模型反而繞圈栽(偏科)。挑模型要看對的 benchmark(agent→BFCL/τ-bench;寫碼→SWE-bench),不用每個都自己測。
⑤ 養一顆自己的腦:微調 + RAG,變成公司資產
挑好的通用腦不夠時,你可以養一顆自己的。這裡有個一定要先分清楚的岔路:
| 你要 | 該用 |
|---|---|
| 它知道公司文件/規章(問答) | RAG(外掛知識庫) |
| 它用固定格式/語氣/流程回答 | fine-tune(微調行為) |
| 兩個都要 | fine-tune 定行為 + RAG 定知識 |
微調出來的東西是你擁有的資產(開源底模 + 你的 LoRA adapter),可以複製落地到每個廠區——各廠一台能跑推理的伺服器,掛上這顆腦就離線私密地做事。租 API 是費用,養模型是資產。
全景:一句話把五塊串起來
挑一顆對的腦(④選型)→ 放對平台讓它算得對跑得動(②平台)→ 理解它只會預測下一個字、靠工具往返做事(①LLM + ③Agent)→ 需要專屬能力就養自己的(⑤微調/RAG)→ 落地成公司資產。
反過來看也通:你看到 Claude Code 自己讀檔改程式(③)= 一顆腦(①)在某平台上(②)、透過工具 loop 做事;你嫌它貴想換便宜副手(④)、或想要它更懂你公司(⑤)——每個念頭都對應地圖上的一塊。
你是哪種人?三條閱讀路徑
| 你的目標 | 先讀 | 再讀 |
|---|---|---|
| 想省 AI 成本、用便宜模型當副手 | 選型框架 + 89 模型全掃 | 挑到的模型,用真實任務自測 1–2 個 |
| 想真懂底層(Agent/tool use/格式) | Request/Response 與 Tool Use 拆解 | 回頭看選型會更有感 |
| 想做公司專屬腦 | gpt-oss-20b 微調實戰 | 先確認該 RAG 還 FT,再備資料 |
這五塊拼起來,就是從「LLM 是什麼」到「把 AI 變成公司握在手裡的能力」的完整地圖。哪一塊想深入,點進當天那篇即可。
發佈留言