從一顆腦到公司 Agent:LLM 全景地圖

重點摘要(TL;DR)
  • 這幾天拆了一堆零件(LLM 本質、tool use、選型、微調)——這篇用一個比喻(LLM = 一顆腦)把它們接成一張地圖。
  • 五塊拼圖:腦是什麼(LLM)→ 腦跑在哪(平台)→ 腦怎麼做事(工具/Agent)→ 怎麼挑腦(選型)→ 養自己的腦(微調/RAG/資產)
  • 一句話串起來:挑一顆對的腦 → 放對平台 → 讓它透過工具做事 → 需要專屬就養自己的 → 落地成公司資產。
  • 每塊都連到當天的深入文章;文末有「你是哪種人」的閱讀路徑。

這幾天寫了好幾篇,各自很深:選副手、tool use 機制、模型全掃、微調實戰……但很多人(包括我自己一開始)會卡在——這些到底怎麼拼成一個完整的東西?這篇不再講細節,而是把它們接成一張地圖,讓你看懂 LLM、平台、工具、Agent、微調彼此的關係。用一個貫穿的比喻:LLM 就是一顆腦。

①腦是什麼
LLM 本質
②腦跑在哪
平台
③腦怎麼做事
工具/Agent
④怎麼挑腦
選型
⑤養自己的腦
微調/RAG/資產
🧭 本文導覽(五塊拼圖 + 全景)
Part 一 — 腦是什麼(LLM)
Part 二 — 腦跑在哪(平台)
Part 三 — 腦怎麼做事(工具/Agent)
Part 四 — 怎麼挑腦(選型)
Part 五 — 養自己的腦(微調/RAG)
Part 六 — 全景 + 閱讀路徑
Part 一 — 腦是什麼(LLM)

① 腦是什麼:LLM 就是一顆會「預測下一個字」的腦

最底層,LLM 只做一件事:看目前的文字,預測下一個 token(字)。你透過 API 跟它互動,本質是POST 一段 JSON、拿回一段 JSON,而且伺服器無狀態——它不記得你上一句,是你的程式每次把完整對話重送。

  • 你付的是 token:輸入(prompt)+ 輸出(completion)都算錢。
  • 無狀態 → 長對話越來越貴(歷史每次重送),也有 context 上限
  • reasoning 模型會先「想」(燒看不見的思考 token)再答。
  • 連「工具呼叫」也只是它吐出一段特定格式的文字,不是它真的有手。
🔬 深入這篇
LLM Request/Response 與 Tool Use 完整拆解(OpenAI vs Anthropic、tool use 機制、全參數)
Part 二 — 腦跑在哪(平台)

② 腦跑在哪:同一顆腦,平台不同差很多

同一顆腦,跑在不同平台/硬體上,好不好用天差地遠。這是最多人忽略的一層——以為選好模型就結束了,其實「哪個平台上的哪個模型」才是關鍵。

平台這一層決定實例
context 上限同一個 GLM 在 8K context 被推理鏈餓死吐不出答案、在 203K 就 10/10
量化(塞不塞得下)參數×bit÷8≈GB;20B Q4 約 16GB,決定你的機器跑不跑得動
硬體正確性不合的 GPU(AMD iGPU Vulkan)會算錯、吐亂碼——先確認「算得對」再談快
限流 / 隱私免費層有限流;免費雲資料多半會被拿去訓練(公司內容不能上)
🔬 深入這篇
副手選型框架 + 89 模型全掃(含平台、量化、免費層真相)
🔬 深入這篇
Gemma 在 AMD iGPU Vulkan 吐亂碼的完整排查(硬體正確性)
Part 三 — 腦怎麼做事(工具/Agent)

③ 腦怎麼「做事」:工具往返,Agent 是這個 loop 跑很多輪

腦沒有手——它不能真的查天氣、讀檔、跑指令。它靠一套工具往返協議:你給它工具清單,它回一張「請你幫我呼叫 X」的單子,你的程式去執行,把結果送回,它才產生最終答案。

  • 一次工具呼叫 = 至少兩發 API 請求(要它決定 → 給它結果)。
  • Agent(如 Claude Code)就是把這個往返自動跑很多輪,直到不再要工具。
  • MCP 是 host 端「工具從哪來、怎麼執行」的插座;A2A 是「腦對腦」委派——三者是同一個骨架(宣告能力→結構化請求→結構化結果)的三個層級。
🔬 深入這篇
Tool Use 完整往返 + MCP/A2A 同骨架三層 + Claude Code 為什麼只吃 Claude
Part 四 — 怎麼挑腦(選型)

④ 怎麼挑對的腦:不只看幾 B,看五張獨立成績單

「幾 B、塞不塞得下」只是入場券。真正決定好不好用的是五張彼此獨立、不能互推的成績單——實測打過臉:寫程式滿分的模型,當 agent 卻寫出空檔案。

成績單一句話
規模 × 平台 context同模型跨平台差巨大
寫程式(codegen)一次過 + 遵不遵守隱形契約 + 不作弊
工具/agent最被忽略、卻最決定能不能當副手;要用真實多步任務測
coder vs reasoning吃碼力選 coder、吃推理選 reasoning
格式/免費真實性/隱私OpenAI 相容?原廠免費?會被訓練?

全掃 89 個免費模型還發現:參數量與 agent 好用脫鉤甚至反相關——20B 小鋼炮穩過、某些大模型反而繞圈栽(偏科)。挑模型要看對的 benchmark(agent→BFCL/τ-bench;寫碼→SWE-bench),不用每個都自己測。

🔬 深入這篇
五張成績單選型框架 + 89 模型分級(偏科/小鋼炮/大巨獸)+ 怎麼看公開 benchmark
Part 五 — 養自己的腦(微調/RAG)

⑤ 養一顆自己的腦:微調 + RAG,變成公司資產

挑好的通用腦不夠時,你可以養一顆自己的。這裡有個一定要先分清楚的岔路:

你要該用
知道公司文件/規章(問答)RAG(外掛知識庫)
用固定格式/語氣/流程回答fine-tune(微調行為)
兩個都要fine-tune 定行為 + RAG 定知識

微調出來的東西是你擁有的資產(開源底模 + 你的 LoRA adapter),可以複製落地到每個廠區——各廠一台能跑推理的伺服器,掛上這顆腦就離線私密地做事。租 API 是費用,養模型是資產。

🔬 深入這篇
gpt-oss-20b 微調實戰:RAG vs FT、資料準備、逐格說明、資產化落地
Part 六 — 全景 + 閱讀路徑

全景:一句話把五塊串起來

一句話心智地圖
挑一顆對的腦(④選型)→ 放對平台讓它算得對跑得動(②平台)→ 理解它只會預測下一個字、靠工具往返做事(①LLM + ③Agent)→ 需要專屬能力就養自己的(⑤微調/RAG)→ 落地成公司資產。

反過來看也通:你看到 Claude Code 自己讀檔改程式(③)= 一顆腦(①)在某平台上(②)、透過工具 loop 做事;你嫌它貴想換便宜副手(④)、或想要它更懂你公司(⑤)——每個念頭都對應地圖上的一塊。

你是哪種人?三條閱讀路徑

你的目標先讀再讀
省 AI 成本、用便宜模型當副手選型框架 + 89 模型全掃挑到的模型,用真實任務自測 1–2 個
真懂底層(Agent/tool use/格式)Request/Response 與 Tool Use 拆解回頭看選型會更有感
做公司專屬腦gpt-oss-20b 微調實戰先確認該 RAG 還 FT,再備資料

這五塊拼起來,就是從「LLM 是什麼」到「把 AI 變成公司握在手裡的能力」的完整地圖。哪一塊想深入,點進當天那篇即可。

留言

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *