AI 工具

Chapter 3 理解AI的本質,才能正確使用AI

同一套文字接龍機制,為何有時精準、有時一本正經地編造答案

2026-08-26 · 4 min read
AILLM提示詞

大型語言模型的本質:一場高度複雜的文字接龍

大型語言模型看似聰明,本質上卻像是一場高度複雜的「文字接龍」。理解它如何產生回答,你就會知道它為什麼能寫文章、整理資料與回答問題,也會明白它為什麼有時會一本正經地答錯。

同一套機制,為什麼一個能答對、一個會答錯

模型只有一套運作機制——根據前文預測「接下來最合理的字」,但這套機制在不同問題上會產生截然不同的結果:

  • 為什麼常常能答對:訓練資料裡有大量重複的正確模式。「文字接龍」接的不是隨機字詞,而是根據海量文本統計出「接下來最合理的字」。當一個問題的知識、邏輯、寫作模式在訓練資料中大量且一致地出現(例如常見的程式語法、通用的公文格式),統計上最合理的接續,剛好就是正確答案。
  • 為什麼會一本正經答錯:它沒有「我不知道」這個選項。當問題在訓練資料中少見、模糊、或本身沒有標準答案時,模型仍然只會做同一件事——選出統計上「聽起來最合理」的下一個字接下去。它不會停下來說不知道,只會用同樣流暢、同樣自信的語氣,把缺口用「聽起來很對」的內容填滿,這就是幻覺(hallucination)。
正確與編造,用的是同一套「接龍」機制、同一種自信的語氣——這正是為什麼你無法單靠「聽起來有沒有道理」來判斷 AI 有沒有說謊。

量化證據:AI 編造的東西,講得很有自信

USENIX Security 2025 的一篇研究針對 AI 生成程式碼中引用的套件做了大規模分析,結果顯示這種「一本正經編造」不是零星意外,而是一種穩定、可重現的現象:

  • 19.7% —— 223 萬次 AI 生成的套件引用中,指向根本不存在的套件
  • 43% —— 同一提問重跑 10 次,幻覺套件名稱每次都重複出現

這證明 AI 編造的東西表現得「很一致很自信」,不是隨機亂猜——統計上看起來合理的字詞會被穩定地選中,這正是「文字接龍」的本質。後來還衍生出真實攻擊手法「slopsquatting」:有人把 AI 幻覺出的套件名稱搶注上架,變成供應鏈攻擊。

來源:USENIX Security 2025, "We Have a Package for You!"

案例:AI 會一本正經地說出不存在的防火牆指令

同樣的現象也出現在網路設備的操作指令上。PacketPassers 部落格的《ChatGPT and the Network Engineer – Part 2》一文中,作者針對同一個問題連續詢問 ChatGPT,得到的答案卻是三個完全不存在的 PAN-OS 指令——每一個看起來都語法正確、格式標準,卻沒有一個真的能在防火牆上執行。

PacketPassers 部落格《ChatGPT and the Network Engineer – Part 2》——ChatGPT 對同一問題編出三個不存在的 PAN-OS 指令 · packetpassers.com/chatgpt-network-engineer-part-2

這個案例提醒我們:AI 產出的技術指令,尤其是要直接套用在正式設備上的指令,務必先經過查證,不能只憑「看起來很正確」就直接執行。

AI 的能力不是一堵牆,是鋸齒狀的斷崖

了解 AI 會編造內容之後,下一個更重要的問題是:AI 到底在哪些任務上可靠、哪些任務上不可靠?哈佛商學院(HBS)與 BCG 找了 758 位顧問做對照實驗,得到一個違反直覺的結論。

AI 在某些任務讓表現大幅提升,在「看起來難度差不多」的任務上卻沒幫助、甚至幫倒忙——而且人憑直覺分不出哪個任務屬於哪一種。研究者把這條高低起伏的能力邊界叫做「鋸齒狀前沿」(jagged frontier)。

  • 通常很行:草稿、摘要、翻譯、改寫、解釋觀念、整理格式
  • 常常翻車:算術、最新資訊、精確引用出處、長文件裡的小細節
不是所有任務交付給 AI 都能做得很好——關鍵不是全盤否定或全盤相信,而是知道它的長處與短處,揚長避短:把它擅長的部分交給它,把它常翻車的部分留給人工把關。碰到新類型的任務,先小規模試一次,再交付重活。

來源:Dell'Acqua et al., "Navigating the Jagged Technological Frontier", HBS Working Paper(2023,2026 年正式刊於 Organization Science)