技術小故事

AI 家族城市的六層地圖

用一座六層樓的城市走完 AI 知識體系:理論基礎、學習方法、模型架構、鑑別式與生成式應用,以及撐起一切的負責任 AI 地基。

2026-07-18 · 8 min read
AI 機器學習 深度學習 LLM

這座城叫 AI 城,蓋了六層。頂樓住著理論家,底樓坐著監察官;中間四層,是學派、工匠、偵探與創作者的地盤。這篇故事帶你從頂樓一路走到底樓,把整張 AI 知識體系圖走過一遍——每個房間的門牌都是真實的技術名詞,每個角色的脾氣都忠於它的技術本性。

第一幕・頂樓:理論基礎——AI 家族的族譜

城主叫 AI,年紀最大、野心也最大——他的夢想寫在城徽上:「讓機器做到需要智慧才能做到的事」。

AI 有個最出色的兒子,叫 機器學習(Machine Learning)。這孩子的信條與父親不同:

「別把規則一條條寫死給我,給我資料,我自己從裡面學出規則。」

機器學習又生了個更執著的兒子,叫 深度學習(Deep Learning)。他把「學」這件事推到極致:用一層又一層堆疊的神經網路,自動從原始資料裡萃取特徵——別人要人類先告訴他「該看什麼特徵」,他不用。

而整個家族的血脈裡流的,是 演算法(Algorithm)——族譜上每一個人,行事都靠這套一步一步、明確可執行的辦事章程驅動。

第二幕・五樓:學習方法——四大學派的教室

深度學習小時候上學,這層樓有四間教室,各是一個學派:

  • 監督式學習(Supervised Learning) 的老師最嚴格:每份練習題都附標準答案(label),學生寫完就對答案、修正自己。「看一萬張標了『貓』的照片,你就會認貓。」
  • 非監督式學習(Unsupervised Learning) 的教室根本沒有老師:一堆沒有答案的資料丟進來,學生自己找規律、自己分群。「這一堆長得像,先歸成一疊再說。」
  • 增強式學習(Reinforcement Learning) 的教室像遊戲場:沒人給答案,只有獎勵與懲罰。做對加分、做錯扣分,學生在一次次試錯中摸出最佳策略——AlphaGo 就是這間教室的傳奇校友。
  • 神經網路(Neural Network) 的實作工坊在最裡面:仿照生物神經元,一層層節點加權、加總、活化,訊號往前傳、誤差往回傳(backpropagation)。這間工坊,是整個模型架構樓層的地基。

工坊後來還發展出一種奇特的訓練法叫對抗訓練:讓兩個學生互相較勁——這就孕育了下一層樓那對著名的雙胞胎 GAN。

第三幕・四樓:模型架構——工匠街

CNN(Convolutional Neural Network) 是街口的眼科醫生,看東西的方式很特別:不一次看整張圖,而是拿著一片小小的濾鏡(convolution kernel)在圖上滑動,先看出邊緣,再拼出形狀,最後認出整隻貓。視覺相關的活,街坊都找他。

RNN(Recurrent Neural Network) 是位說書人,專門處理有先後順序的東西——句子、語音、時間序列。他的絕活是「記得前面說過什麼」:每讀一個字,都把記憶往下傳。可惜他有個老毛病:話一長就忘了開頭(梯度消失)。

於是街上來了 RNN 的改良版親戚 LSTM(長短期記憶網路)——隨身帶著一本記事本,配三道閘門(輸入門、遺忘門、輸出門),重要的記下來、不重要的劃掉,長句子也記得住開頭。

但真正翻轉整條街的,是 2017 年搬來的新工匠 Transformer。他看了 RNN 一眼,說出那句名言:

「Attention is all you need——你不必一個字一個字排隊讀,讓句子裡每個字同時看見其他所有字(self-attention),誰跟誰有關係,一眼便知。」

不用排隊,就能整批平行處理,訓練速度天差地遠。這間工作室,後來成了 LLM 的奠基石。

街尾還有那對雙胞胎 GAN(生成對抗網路):哥哥是偽造師(Generator),拚命畫假畫;弟弟是鑑定師(Discriminator),拚命抓假貨。兩人天天互相較勁,結果哥哥的假畫越畫越逼真——這就是對抗訓練的威力。

街中央最大的那棟,住著 LLM(大型語言模型)——Transformer 的集大成者,讀遍了全城藏書的預言家。你給他半句話,他預測下一個字該是什麼,一個字一個字接龍,就接出了對話、文章與程式碼。

街的盡頭立著兩塊路標:一塊指向遠方雲霧裡的 AGI(通用人工智慧)——能跨領域學習類推、與人類比肩的強 AI,至今仍是理論上的目的地;另一塊寫著 ANI(弱人工智慧)——「本城現有居民,包含 LLM 在內,全數屬之」。

模型架構演進年代圖
各架構從問世到今日的活躍期:RNN 的序列霸主地位在 2017 年被 Transformer 終結,此後 LLM 時代開啟。

第四、五幕・三樓與二樓:鑑別式 vs 生成式——偵探社與創作坊

這兩層樓住著性格相反的兩兄弟,也是全城最常被搞混的一對。

三樓的 鑑別式 AI(Discriminative AI) 開偵探社。他的世界觀是「劃界線」:給我一個輸入 x,我直接告訴你它屬於哪一類 y——用行話說,他建模的是條件機率 P(y|x)。他不關心資料是怎麼來的,只關心「這是貓還是狗」的那條分界線。

偵探社的王牌部門是 電腦視覺(Computer Vision),底下三個小組各司其職:影像分類(整張圖是什麼)、物件偵測(圖裡有哪些東西、各在哪)、OCR(把圖片裡的字讀出來)。偵探社的情報也支援全城的推薦系統、異常偵測與語音辨識——這些服務全靠資料驅動。

二樓的 生成式 AI(Generative AI) 開創作坊。他的世界觀完全相反:「我不只劃界線,我要學會資料本身的分布 P(x,y)P(x)——學會了,我就能『生』出以假亂真的新樣本。」文字、圖像、語音,都能從他手裡憑空長出來。創作坊的核心語言部門是 NLP(自然語言處理),延伸出文字與語音的各種本事。

創作坊近年出了兩位明星店員:ChatGPTGemini,都是 LLM 血統的代表產品。而 LLM 還在進修新技能——多模態(Multimodal):一雙眼睛同時看得懂文字、圖片、聲音。

多模態再往前一步,就是全城最新的職位:AI Agent(AI 代理)。他不只回答問題,還拿著工具箱自主辦事——拆解任務、呼叫工具、查資料、執行、檢查結果,一路做到完成為止。城主 AI 望著他,彷彿看見了通往 AGI 那條路標的方向。

第六幕・一樓:治理規範——市政監察院

城越蓋越高,一樓的 負責任 AI(Responsible AI) 監察院也越來越忙。監察官桌上攤著八份卷宗,每份都是這座城的隱患:

  • 偏見(Bias):訓練資料歪了,判決就歪了——鑑別式與生成式兩家都逃不掉。
  • 公平性(Fairness):不同族群得到的對待是否一致。
  • 可解釋性(Explainability):模型為什麼這樣判?黑盒子必須能開箱說明。
  • 隱私(Privacy):訓練資料裡的個資不能被吐出來。
  • 資安(Security):模型本身也會被攻擊——投毒、越獄、提示注入。
  • 高風險 AI:醫療、司法、金融這些領域的 AI,要用更嚴的法規盯著。
  • 幻覺(Hallucination):LLM 那位預言家的老毛病——不知道答案時,會一本正經地編一個。這是生成式應用最典型的風險。
  • 透明度(Transparency):告訴大家這是 AI 做的、用什麼資料訓練的。
監察官在卷宗末頁寫下結語:「這座城能蓋多高,不取決於工匠街的手藝,而取決於這一樓的地基打得多穩。」

技術摘要

主題關鍵事實
層級關係AI ⊃ 機器學習 ⊃ 深度學習;神經網路是深度學習核心結構,全體由演算法驅動
三大學習方法監督式(有標籤)、非監督式(無標籤找規律)、增強式(獎懲試錯);對抗訓練衍生 GAN
架構演進CNN 主攻視覺 → RNN 主攻序列(長序列梯度消失)→ LSTM 三道閘門解決長期記憶 → Transformer(2017,arXiv:1706.03762)以 self-attention 取代 recurrence、可平行化,成為 LLM 基礎
鑑別式 vs 生成式鑑別式建模 P(y|x) 學決策邊界;生成式建模 P(x,y) / P(x),因此能生成新樣本
ANI / AGI現有所有 AI(含 ChatGPT、Gemini)皆屬 ANI;AGI 尚未實現——業界主流共識
AI AgentLLM + 多模態的應用延伸:任務拆解、工具呼叫、自主執行、迭代修正
負責任 AI八大議題:偏見、公平性、可解釋性、隱私、資安、高風險 AI、幻覺、透明度

SourcesVaswani et al., Attention Is All You Need(arXiv:1706.03762,NeurIPS 2017)Stanford CS231n 2025 Lecture 13IBM: Types of Artificial Intelligence