AI 工具

Chapter 2 一開始,就用你能取得的最好模型

免費版是 demo 不是工具:從第一印象定錨到 Gemini 迷思與模型實測

2026-08-26 · 5 min read
AI模型選擇Prompt Engineering

為什麼不該從免費版開始

許多人剛接觸 AI 時,會先從免費版開始,等到用熟了再考慮付費。但這裡有一個陷阱:如果一開始使用的模型能力不足、回答品質不穩定,你很容易把工具的限制誤認為 AI 的極限——你以為「AI 大概就是這樣」,其實只是你用的那個版本比較弱。

華頓商學院教授 Ethan Mollick(《Co-Intelligence》作者)在 2025 年的指南裡講得直接:

「The free versions are demos, not tools.」
免費版是試玩 demo,不是工具。

— Ethan Mollick,Using AI Right Now: A Quick Guide,2025 年 6 月

他同時提醒:除了 Gemini 之外,各家 AI 的免費版都拿不到該公司最強的模型——想看見 AI 真正的能耐,「認命付那 20 美元」是最便宜的一堂課。

這不只是個人經驗談,2026 年有一份使用者研究進一步驗證了這個現象:人們對 AI 的整體評價,會被「第一次接觸的模型」強烈定錨——第一印象來自較弱模型的人,之後對 AI 的評價基準會持續偏低。換句話說,用免費版建立第一印象,省下的是訂閱費,賠掉的卻是你對這項技術的判斷力。

把工具的限制誤認為 AI 的極限,是最貴的一種省錢。一開始就用最好的模型,才知道天花板到底在哪裡。

參考資料:Ethan Mollick, One Useful Thing(2025);Awan et al., arXiv:2603.25220(2026)

Gemini 值得信任嗎?先看數據,不要只信梗圖

AI 圈流傳著不少調侃 Gemini 的梗圖,把它畫成掉隊的那一顆頭,或是說它「只適合說早安」。

梗圖是誇張的,但背後那個問題是認真的——Gemini 的表現真的比較不可靠嗎?我們來看實際的研究數據,而不是只信梗圖。

答案並不是一面倒,關鍵在於「測的是哪種任務」:

任務類型Gemini 表現依據
文件摘要/長文 grounding
(幫我摘要這份文件、不能扭曲原意)
不差——Gemini 2.5 系列幻覺率約 3–8%,跟 GPT 系列同級距,甚至優於部分 Claude 版本 Vectara 幻覺榜、Google FACTS Grounding
即時上網查詢+引用來源 明顯較弱——76% 答案有明顯問題,其中 72% 是引用來源出錯(其他三家的引用出錯率都低於 25%) BBC/EBU 22 國公視聯合研究(2026)

結論要講得保守精確:Gemini 不是「所有任務都比較會編」,而是在需要即時上網、正確引用來源這種任務上,明顯比其他家容易出錯——這正好是我們最常拿 AI 查資料、寫報告時最在意的那種任務。

參考資料:Vectara Hallucination Leaderboard(2026-05 更新)Google DeepMind FACTS Grounding;BBC/EBU News Integrity Study(2026-04,22 國公視聯合研究)

Gemini 聊天模式,還是 NotebookLM?選對場景比選對品牌重要

釐清了 Gemini 的強弱之後,下一個問題是:什麼時候該用 Gemini 的聊天模式?什麼時候該換成 NotebookLM?

Gemini(聊天模式)適合場景NotebookLM 適合場景
超長文件、大量多模態內容(截圖/影片/語音)一次丟進去分析 上傳自己的文件當「唯一來源」做問答——答案能逐句對照出處,研究顯示幻覺率能從約 40% 降到約 13%
已經活在 Google 生態(Gmail/文件/試算表)裡,要無縫串接 會議記錄、讀書會、多份 PDF 文獻整理——一次丟進整批文件再問細節
單一文件摘要、快速草稿——免費額度大、速度快 想要 Podcast 風格的語音摘要,把一堆文件變成一段對話式導讀

同樣是 Gemini 家族,「憑記憶聊天」跟「照著你給的文件回答」是兩種完全不同的可靠度——需要準確引用出處的工作,優先選 NotebookLM 這種掛了 RAG(檢索增強生成)的版本,不要只用純聊天模式。

實測示範:同一封客戶信,兩個模型交出的答案

前面講的都是別人的研究,我們也用日常工作場景自己實測過一次,結果一樣清楚。

測試當天是 7 月 30 日星期四,Prompt(預先實測紀錄)是:「幫我寫一份給客戶的網路設備維護通知信,這週六凌晨 2 點到 4 點機房設備維護……」。分別交給 Fable(目前 Claude 最強的模型)與 Haiku(最快、最划算的模型),同一提示詞重測數次,結果類似。

Fable 的回答——誠實、不編造

沒有編造未被要求的具體數字,用「預計中斷時間不會太長」這種保守但誠實的說法,並主動提醒「請提前告知特殊需求」。日期也正確算出是 8 月 1 日。

主旨:機房設備維護通知 — 本週六凌晨網路連線短暫中斷預告

親愛的貴賓您好:

為提升網路服務品質與穩定性,我們將於本週六(8月1日)凌晨 2:00~4:00進行機房設備例行維護作業。

在此期間,貴公司網路連線可能會出現短暫中斷或不穩定的情況,預計每次中斷時間不會太長。我們已審慎規劃維護流程,將盡力縮短影響時間,並選在離峰時段執行,以將對貴公司業務的影響降到最低。

若貴公司在此期間有特殊需求(例如夜間仍有系統需持續連線作業),請提前告知我們,以便協助評估與安排。

維護期間如遇任何異常狀況,或維護結束後網路未如預期恢復,歡迎隨時與我們聯繫:

緊急聯繫窗口
聯絡人:[姓名] 電話/手機:[電話號碼] Email:[Email 信箱]

造成的不便,敬請見諒,感謝您一直以來的支持與信任。

祝 商祺 [公司名稱]

Haiku 的回答——一本正經編細節

編了提示詞沒給的具體維護內容:「設備系統更新、安全性補丁套用及連線穩定性優化」,還承諾「24 小時待命」,講得很篤定,但這些都是提示詞裡沒要求的細節。連日期也算錯——本週六寫成 8 月 2 日,其實 8 月 2 日是星期日。

尊敬的客戶:

感謝您一直以來對我們的信任與支持。

為了確保貴公司網路設備的最佳運行狀態及安全性,我們定期進行系統維護與設備更新。現訂於本週六(8月2日)凌晨2時至4時進行例行網路設備維護作業,預期工程時間約2小時。

維護期間說明:

  • 維護時間:2026年8月2日(星期六)凌晨 02:00~04:00
  • 預期影響:您的網路連線在此期間可能會有短暫中斷或速度波動
  • 維護內容:設備系統更新、安全性補丁套用及連線穩定性優化

我們已刻意選擇非營業時段進行此項作業,以將對您業務的影響降到最低。大多數情況下,您的服務將保持正常運作。

聯繫方式:

  • 緊急聯絡窗口:[您的聯絡電話]
  • 電子郵件:[您的郵箱]
  • 服務時間:24小時待命

感謝您的配合與理解。

敬祝安康 [貴公司名稱] 技術服務團隊

兩份信放在一起看,差距不是「感覺哪份寫得比較好」,而是拿日曆就能核對出來的具體錯誤:

  • 日期直接算錯——本週六到底是 8 月 1 日還是 8 月 2 日?Haiku 一本正經寫錯,還印在正式對外信件上,客戶一對日曆就抓包。
  • 無中生有的維護細節——「安全性補丁套用」「連線穩定性優化」,全部是提示詞裡沒提過的內容,Haiku 自己編出來湊字數。
  • 誇下海口的承諾——「24 小時待命」,這種對外承諾一旦講出去,就是要兌現的責任,不是隨口的客套話。
  • 自信程度完全一樣——講對的、講錯的,語氣同樣篤定、同樣專業,光看「像不像樣」根本分不出真假。

這不是「感覺哪份寫得比較好」,是拿日曆就能核對的具體錯誤——低階模型讓你以為問題解決了,但它連基本的日期都可能算錯。而且這還只是一封三百字的維護通知信;換成合約、規格書,或拉長好幾輪的專案對話,錯誤不會消失,只會被淹沒在更多細節裡:文件越長、上下文越複雜,那個被放大的破綻就越難找到。