你每天聊天的那個 AI,
其實是一台文字接龍怪獸
一小時,搞懂 LLM 到底是什麼。上完這堂課,你寫 prompt、蓋 agent 的時候, 終於知道自己在跟「什麼東西」講話——而不是對著黑盒子燒香拜拜。
第 1 章 · 開場暴擊先說結論:它不會思考,它在賭博
來,做好心理準備。今天這堂課的第一句話就要毀掉你對 AI 的浪漫想像:
骨子裡只會做一件事——
「猜下一個字是什麼」。
對,就這樣。沒有靈魂,沒有意識,沒有一個小人坐在伺服器裡面看你的訊息。 LLM(Large Language Model,大型語言模型)是一台被練到走火入魔的「下一個字預測機」。 你丟一段文字給它,它回答一個問題:「照統計來看,接下來最可能出現什麼字?」 然後把那個字吐出來。再猜下一個。再吐。再猜。再吐。
它寫出莎士比亞等級的情書?一個字一個字賭出來的。 它幫你 debug 三百行程式?一個字一個字賭出來的。 它跟你說「我理解你的感受」?它連「感受」兩個字是怎麼從它嘴裡出來的都不知道,因為它根本沒有嘴,也沒有「知道」這回事。
因為當一台機器把「猜下一個字」這件事練到宇宙級別的準, 產出的效果就跟「會思考」幾乎沒兩樣。要精準猜出「醫生看了 X 光片後說:___」的下一句, 它就不得不在訓練過程中壓縮進大量醫學、語言、人情世故的模式。 聰明是「猜得準」的副作用。這不是貶低它——這件事本身就夠嚇人了。
整堂課你只要抓住這一句:「LLM = 練到走火入魔的文字接龍機」。 後面每一章都是在這句話上面蓋房子。
第 2 章 · 核心比喻一本吃掉整個網際網路的巨大字典
比喻一:你手機鍵盤上的自動選字,吃了類固醇
打開你的手機,隨便打「今天天氣」四個字。鍵盤上方是不是跳出「很好」「不錯」「如何」幾個候選詞? 恭喜,你手上已經有一個迷你 LLM 了。它看你打過的字,猜你下一個要打什麼。
現在,我們來把這個小東西餵大:
- 手機選字看過的文字量:大概是你自己打過的訊息。
- LLM 看過的文字量:幾乎整個網際網路——維基百科、幾百萬本書、GitHub 上的程式碼、論壇上的吵架文、食譜、法律條文、你八百年前寫的部落格。
- 手機選字一次猜 1~3 個候選詞。
- LLM 每猜一個字,都在十幾萬個候選字裡面排名,而且它連你前面講的好幾萬字都一起納入考量。
把你的手機選字餵到吞掉整個地球的文字產出、練出幾千億個調節旋鈕(參數), 它就會從「幫你補『很好』」進化成「幫你寫出一整套 React 專案」。 本質沒變,只是規模大到產生了魔法的錯覺。
比喻二:讀過所有書、卻完全失憶的圖書館員
想像一位很離奇的圖書館員:
- 📚 他讀過人類寫過的每一本書。每一本。連你不想承認存在的那些同人文都讀過。
- 🧠 但他完全沒有記憶力。你上一秒跟他說的話,下一秒就忘了。每次見面都是初次見面。
- 🗣️ 而且他只會回答一種問題:「這段話的下一個字,最可能是什麼?」
- 🙅 他不能查資料、不能上網、不能打電話、不能幫你訂便當。他唯一的能力就是那股「讀遍天下」練出來的語感。
這位圖書館員就是裸的 LLM(raw model)。 「咦?可是 ChatGPT 明明記得我上一句話啊?」——好問題!先把疑惑收進口袋, 第 4 章會揭曉這個魔術的機關,保證你會「哦~~」出聲。
比喻三:宇宙第一天才鸚鵡
鸚鵡學人講話,是因為牠抓到了聲音的模式,不是因為牠懂「你吃飽沒」的哲學意涵。 LLM 是一隻聽過全人類所有對話的鸚鵡——牠模仿模式的能力強到, 講出來的話比大部分人類還有條理。但請記住牠的本質: 牠在重組模式,不是在「查證事實」。 這就是為什麼它會一本正經地胡說八道(術語叫「幻覺」,第 5 章細講)。
LLM = 手機自動選字(規模) × 失憶圖書館員(無記憶、無手腳) × 天才鸚鵡(模式而非事實)。
接下來整堂課,我們會一直回來摸這三隻吉祥物。
第 3 章 · 體內解剖你按下 Enter 之後,體內發生的 7 件事
現在我們把一句話丟進 LLM,全程跟拍。實驗白老鼠是這句樸實無華的話:
「今天天氣很___」
按「下一步」跟著走完整條生產線。不用怕,全程沒有數學,只有比喻和彩色方塊。
上面的 token 切法、編號、機率數字都是示意用的教學版,不是某個真實模型的實際輸出。 真實世界裡,中文常被切得更碎(有時一個字被拆成好幾塊),編號和機率每個模型都不同——但流程順序是真的,一步都沒少。
🎮 換你當 LLM:猜下一個 token
理解「預測下一個字」最快的方法,就是自己當一次模型。 下面給你一句沒講完的話,憑語感選一個你覺得最可能接上的詞, 然後看看一個典型 LLM 心裡的機率表長什麼樣。
※ 機率為教學示意,非即時查詢真實模型。
1️⃣ 沒有「唯一正解」,只有機率排行榜。「好」和「熱」都合理,只是機率不同。
2️⃣ 抽籤(sampling)讓答案每次不一樣。模型不一定選第一名——溫度(temperature)調高,就更常抽到黑馬。這就是同一個問題問兩次、答案不同的原因。
3️⃣ 「香菜」機率不是 0。再離譜的字都有一絲絲機率。大部分時候這沒事,但偶爾模型抽到一連串「聽起來很順的錯誤」,就變成幻覺。
第 4 章 · 世紀大誤會ChatGPT 不是 LLM,就像汽車不是引擎
來破解一個 90% 新手都有的誤會:很多人以為「ChatGPT = 那個 AI 模型本人」。 錯。你在 chatgpt.com 或 Claude app 裡聊天的那個東西,是一台整車; LLM 只是引擎室裡那顆引擎。
引擎本身只會做一件事:進油、爆炸、輸出動力。它沒有方向盤、沒有座椅、沒有安全氣囊、 沒有冷氣。你不會直接騎在引擎上出門(會很燙)。同理—— 裸的 LLM 只會「文字進、下一個字出」。ChatGPT 和 Claude 這些產品, 是在引擎外面裝了一整套車體:
🪄 揭曉第 2 章的魔術:「它明明記得我上一句話啊!」
還記得那位完全失憶的圖書館員嗎?他真的什麼都不記得。 那 ChatGPT 為什麼「記得」你叫什麼名字?機關在車體層:
每次你送出新訊息,App 會把整段對話歷史從頭到尾重新抄一遍, 連同你的新訊息一起,「啪」一整包塞給失憶的圖書館員。 他看完這疊紙,覺得「哦,照這個劇本,下一句應該是……」然後接下去。
不是模型記得你,是 App 每次都幫模型重新惡補整段劇情。 像陪一位失憶症朋友看連續劇,每一集開播前都要幫他從第一集講到現在。 而那疊紙有厚度上限——這個上限就叫 context window(上下文窗口),第 5 章它會變成你的宿敵。
同一顆引擎,可以裝很多種車
| 層 | 它是什麼 | 類比 |
|---|---|---|
| 裸模型 API | GPT、Claude 系列模型本體,文字進字出 | 引擎 |
| ChatGPT / Claude App | 模型 + 系統提示詞 + 記憶管理 + 工具 + 介面 | 整台市售車 |
| 你未來寫的 Agent | 模型 + 你設計的提示詞 + 你接的工具 | 你自己改裝的賽車 🏎️ |
這就是為什麼你要上這堂課:做 Agent,就是自己造車體。 OpenAI 和 Anthropic 把引擎用 API 租給你,車體——系統提示詞、記憶、工具——全部由你來裝。 不懂引擎特性的人造出來的車,轉彎會解體。
第 5 章 · 學以致用懂了這些,你的 Agent 才不是玄學
前面 40 分鐘不是聽故事。「文字接龍怪獸」這個模型,會直接解釋你未來做 Agent 時 遇到的每一個詭異現象。以下五條,條條是你之後會親身撞上的牆。
① Prompt 不是「命令」,是「幫接龍開頭」
很多新手把 prompt 當成對僕人下指令。錯誤心智模型。 正確畫面是:你在幫一台自動完成機器鋪開頭,讓「順著接下去」的路正好通往你要的答案。
🎤 把 LLM 想成一台卡拉 OK 伴唱機:你點什麼歌、起什麼調,它就順著接下去唱。
- Prompt 寫「你是一位資深 Python 工程師,用繁體中文回答」→ 你把接龍的開頭鋪在「專業工程對話」的軌道上,後面的字自然往那邊滾。
- Prompt 亂寫、前後矛盾 → 接龍不知道往哪滾,輸出就飄。
- 所謂 prompt engineering,白話翻譯就是:「鋪軌道的手藝」。不是咒語,不是儀式,是統計上的導向。
② Context window 是你的宿敵兼房租
還記得「每次都要把整疊劇本塞回去」嗎?那疊紙的上限(context window)帶來三個殘酷現實:
- 塞爆了就會忘。對話太長、文件太厚,最早的內容會被擠出窗外——你的 Agent「忘記」使用者半小時前的設定,不是 bug,是物理。
- 每個 token 都是錢。API 按 token 計費,而且是每一次呼叫都重算整疊劇本。無腦把所有歷史塞回去 = 錢包燃燒。
- 所以才有那些技術。摘要壓縮舊對話、RAG(只撈相關片段塞進去)、記憶檔案——全部都是在跟「那疊紙的厚度上限」搏鬥。懂了這點,那些名詞瞬間不玄了。
③ Agent 需要工具,因為模型沒有手
失憶圖書館員不能幫你訂便當——他只會講話。LLM 也一樣: 它不能上網、查資料庫、寄 email、跑程式。它只能輸出文字。
機關又在車體層:你跟模型約好一個暗號——「當你想查天氣,就輸出
{"tool": "get_weather", "city": "台北"} 這種格式的文字」。
模型輸出這串字(記住,它仍然只是在接龍!),你的程式碼看到暗號,
真的去呼叫天氣 API,把結果塞回劇本,讓模型繼續接龍。
所謂 tool calling / function calling,拆穿了就是:模型負責喊「我想用鎚子!」,你的程式負責真的拿鎚子去敲。 模型從頭到尾沒有離開過「輸出文字」這件事。
④ 幻覺不是故障,是本性
你的 Agent 總有一天會一本正經地告訴使用者一個不存在的 API、瞎掰的法條、幽靈餐廳的電話。 為什麼?回到根本:模型不是在「查資料」,它在生成「統計上看起來很像正確答案的文字」。
- 「聽起來對」和「真的對」在它眼裡是同一件事——它只有語感,沒有事實查核器。
- 它給錯誤答案時的自信程度,和給正確答案時一模一樣。因為兩者對它來說都只是「機率很高的接龍」。
- 對策從來不是「拜託它不要唬爛」(prompt 只能降低機率),而是車體層工程:接搜尋/資料庫工具讓它引用真資料(RAG)、要求附來源、對關鍵輸出做程式驗證。
⑤ 溫度、隨機性與「為什麼 demo 的時候好好的」
每個字都是抽籤抽出來的,代表你的 Agent 天生就是不確定性機器。 Demo 跑十次都對,第十一次在客戶面前爆炸——正常,骰子而已。所以工程上你會學到: 需要穩定格式的場景把 temperature 調低、用結構化輸出(JSON schema)綁住它、 對重要流程寫驗證與重試。把它當成「很有才華但會抽風的實習生」來設計系統,你就贏過八成的人了。
「Agent 忘東忘西」→ context window 有限 → 摘要 / RAG / 記憶檔案。
「Agent 不會執行動作」→ 模型只會輸出文字 → 接工具,程式碼代勞。
「Agent 講幹話」→ 接龍不查證 → 餵真資料 + 驗證輸出。
「Agent 時好時壞」→ 抽籤本性 → 降溫度、綁格式、寫重試。
「Prompt 沒效果」→ 軌道沒鋪好 → 給角色、給範例、給明確格式。
第 6 章 · 結業考畢業前,四題定生死
全對的人,正式脫離「對 AI 燒香拜拜」階段。答錯也沒關係,解釋就在下面。
🎓 帶走這 5 句話(其他都可以忘)
- LLM 是一台練到走火入魔的文字接龍機——一次猜一個字,猜到講完。
- 它是失憶的:所謂記憶,是 App 每次把整段歷史重新塞回去。
- ChatGPT / Claude 是車體,模型是引擎;做 Agent = 自己造車體。
- 它沒有手:所有「動作」都是你的程式碼看懂暗號後代勞的。
- 幻覺是本性不是故障:它輸出「像對的」,不保證「是對的」——驗證是你的工作。
你可以微笑著說:
「一隻讀過整個網際網路、嚴重失憶、
手氣很好的接龍鸚鵡。」