Chapter 2 一開始,就用你能取得的最好模型
免費版是 demo 不是工具:從第一印象定錨到 Gemini 迷思與模型實測
為什麼不該從免費版開始
許多人剛接觸 AI 時,會先從免費版開始,等到用熟了再考慮付費。但這裡有一個陷阱:如果一開始使用的模型能力不足、回答品質不穩定,你很容易把工具的限制誤認為 AI 的極限——你以為「AI 大概就是這樣」,其實只是你用的那個版本比較弱。
華頓商學院教授 Ethan Mollick(《Co-Intelligence》作者)在 2025 年的指南裡講得直接:
「The free versions are demos, not tools.」
免費版是試玩 demo,不是工具。— Ethan Mollick,Using AI Right Now: A Quick Guide,2025 年 6 月
他同時提醒:除了 Gemini 之外,各家 AI 的免費版都拿不到該公司最強的模型——想看見 AI 真正的能耐,「認命付那 20 美元」是最便宜的一堂課。
這不只是個人經驗談,2026 年有一份使用者研究進一步驗證了這個現象:人們對 AI 的整體評價,會被「第一次接觸的模型」強烈定錨——第一印象來自較弱模型的人,之後對 AI 的評價基準會持續偏低。換句話說,用免費版建立第一印象,省下的是訂閱費,賠掉的卻是你對這項技術的判斷力。
把工具的限制誤認為 AI 的極限,是最貴的一種省錢。一開始就用最好的模型,才知道天花板到底在哪裡。
參考資料:Ethan Mollick, One Useful Thing(2025);Awan et al., arXiv:2603.25220(2026)
Gemini 值得信任嗎?先看數據,不要只信梗圖
AI 圈流傳著不少調侃 Gemini 的梗圖,把它畫成掉隊的那一顆頭,或是說它「只適合說早安」。
梗圖是誇張的,但背後那個問題是認真的——Gemini 的表現真的比較不可靠嗎?我們來看實際的研究數據,而不是只信梗圖。
答案並不是一面倒,關鍵在於「測的是哪種任務」:
| 任務類型 | Gemini 表現 | 依據 |
|---|---|---|
| 文件摘要/長文 grounding (幫我摘要這份文件、不能扭曲原意) |
不差——Gemini 2.5 系列幻覺率約 3–8%,跟 GPT 系列同級距,甚至優於部分 Claude 版本 | Vectara 幻覺榜、Google FACTS Grounding |
| 即時上網查詢+引用來源 | 明顯較弱——76% 答案有明顯問題,其中 72% 是引用來源出錯(其他三家的引用出錯率都低於 25%) | BBC/EBU 22 國公視聯合研究(2026) |
結論要講得保守精確:Gemini 不是「所有任務都比較會編」,而是在需要即時上網、正確引用來源這種任務上,明顯比其他家容易出錯——這正好是我們最常拿 AI 查資料、寫報告時最在意的那種任務。
參考資料:Vectara Hallucination Leaderboard(2026-05 更新);Google DeepMind FACTS Grounding;BBC/EBU News Integrity Study(2026-04,22 國公視聯合研究)
Gemini 聊天模式,還是 NotebookLM?選對場景比選對品牌重要
釐清了 Gemini 的強弱之後,下一個問題是:什麼時候該用 Gemini 的聊天模式?什麼時候該換成 NotebookLM?
| Gemini(聊天模式)適合場景 | NotebookLM 適合場景 |
|---|---|
| 超長文件、大量多模態內容(截圖/影片/語音)一次丟進去分析 | 上傳自己的文件當「唯一來源」做問答——答案能逐句對照出處,研究顯示幻覺率能從約 40% 降到約 13% |
| 已經活在 Google 生態(Gmail/文件/試算表)裡,要無縫串接 | 會議記錄、讀書會、多份 PDF 文獻整理——一次丟進整批文件再問細節 |
| 單一文件摘要、快速草稿——免費額度大、速度快 | 想要 Podcast 風格的語音摘要,把一堆文件變成一段對話式導讀 |
同樣是 Gemini 家族,「憑記憶聊天」跟「照著你給的文件回答」是兩種完全不同的可靠度——需要準確引用出處的工作,優先選 NotebookLM 這種掛了 RAG(檢索增強生成)的版本,不要只用純聊天模式。
實測示範:同一封客戶信,兩個模型交出的答案
前面講的都是別人的研究,我們也用日常工作場景自己實測過一次,結果一樣清楚。
測試當天是 7 月 30 日星期四,Prompt(預先實測紀錄)是:「幫我寫一份給客戶的網路設備維護通知信,這週六凌晨 2 點到 4 點機房設備維護……」。分別交給 Fable(目前 Claude 最強的模型)與 Haiku(最快、最划算的模型),同一提示詞重測數次,結果類似。
Fable 的回答——誠實、不編造
沒有編造未被要求的具體數字,用「預計中斷時間不會太長」這種保守但誠實的說法,並主動提醒「請提前告知特殊需求」。日期也正確算出是 8 月 1 日。
主旨:機房設備維護通知 — 本週六凌晨網路連線短暫中斷預告
親愛的貴賓您好:
為提升網路服務品質與穩定性,我們將於本週六(8月1日)凌晨 2:00~4:00進行機房設備例行維護作業。
在此期間,貴公司網路連線可能會出現短暫中斷或不穩定的情況,預計每次中斷時間不會太長。我們已審慎規劃維護流程,將盡力縮短影響時間,並選在離峰時段執行,以將對貴公司業務的影響降到最低。
若貴公司在此期間有特殊需求(例如夜間仍有系統需持續連線作業),請提前告知我們,以便協助評估與安排。
維護期間如遇任何異常狀況,或維護結束後網路未如預期恢復,歡迎隨時與我們聯繫:
緊急聯繫窗口
聯絡人:[姓名] 電話/手機:[電話號碼] Email:[Email 信箱]造成的不便,敬請見諒,感謝您一直以來的支持與信任。
祝 商祺 [公司名稱]
Haiku 的回答——一本正經編細節
編了提示詞沒給的具體維護內容:「設備系統更新、安全性補丁套用及連線穩定性優化」,還承諾「24 小時待命」,講得很篤定,但這些都是提示詞裡沒要求的細節。連日期也算錯——本週六寫成 8 月 2 日,其實 8 月 2 日是星期日。
尊敬的客戶:
感謝您一直以來對我們的信任與支持。
為了確保貴公司網路設備的最佳運行狀態及安全性,我們定期進行系統維護與設備更新。現訂於本週六(8月2日)凌晨2時至4時進行例行網路設備維護作業,預期工程時間約2小時。
維護期間說明:
- 維護時間:2026年8月2日(星期六)凌晨 02:00~04:00
- 預期影響:您的網路連線在此期間可能會有短暫中斷或速度波動
- 維護內容:設備系統更新、安全性補丁套用及連線穩定性優化
我們已刻意選擇非營業時段進行此項作業,以將對您業務的影響降到最低。大多數情況下,您的服務將保持正常運作。
聯繫方式:
- 緊急聯絡窗口:[您的聯絡電話]
- 電子郵件:[您的郵箱]
- 服務時間:24小時待命
感謝您的配合與理解。
敬祝安康 [貴公司名稱] 技術服務團隊
兩份信放在一起看,差距不是「感覺哪份寫得比較好」,而是拿日曆就能核對出來的具體錯誤:
- 日期直接算錯——本週六到底是 8 月 1 日還是 8 月 2 日?Haiku 一本正經寫錯,還印在正式對外信件上,客戶一對日曆就抓包。
- 無中生有的維護細節——「安全性補丁套用」「連線穩定性優化」,全部是提示詞裡沒提過的內容,Haiku 自己編出來湊字數。
- 誇下海口的承諾——「24 小時待命」,這種對外承諾一旦講出去,就是要兌現的責任,不是隨口的客套話。
- 自信程度完全一樣——講對的、講錯的,語氣同樣篤定、同樣專業,光看「像不像樣」根本分不出真假。
這不是「感覺哪份寫得比較好」,是拿日曆就能核對的具體錯誤——低階模型讓你以為問題解決了,但它連基本的日期都可能算錯。而且這還只是一封三百字的維護通知信;換成合約、規格書,或拉長好幾輪的專案對話,錯誤不會消失,只會被淹沒在更多細節裡:文件越長、上下文越複雜,那個被放大的破綻就越難找到。