AI OverviewsAI 可見度AEOGEOGoogle 搜尋研究解讀

AI 摘要引用了你,不代表它說的是你說的:一份 98,020 句的研究怎麼量

· 12 分鐘閱讀
目錄
  1. 研究是誰做的、怎麼做的
  2. 數字
  3. 11% 不等於 11% 是錯的
  4. 那個 60% 是另一件事
  5. 不只 Google
  6. 對網站主的意思
  7. 限制
  8. 資料來源

先講結論:AI 摘要引用了你的頁面,不代表摘要裡那句話是你寫的。一份逐句比對的研究量到,大約每九句就有一句在它引用的頁面上找不到支撐。但這個數字很容易被講過頭,它的方法和限制要一起看。

這篇也順便拆一件事:這份研究在網路上流傳時,常常跟另一個「AI 摘要出現在 60% 搜尋」的數字放在同一行。那是兩個不同的研究,分母完全不同。

研究是誰做的、怎麼做的

《Measuring Google AI Overviews: Activation, Source Quality, Claim Fidelity, and Publisher Impact》,作者是華盛頓大學聖路易分校的 Haofei Xu、Umar Iqbal、Jacob M. Montgomery,2026 年 5 月 13 日提交到 arXiv,目前標註「審查中」,還沒經過同儕審查

做法:

  • 查詢:每 24 小時從美國在地化的 Google Trends 抓 19 個類別的熱門查詢,2026 年 3 月 13 日到 4 月 21 日,40 天共 55,393 個。
  • 環境:美國維吉尼亞北部的伺服器,每次用全新、沒有 cookie 的瀏覽器。
  • 樣本:抓到 7,583 則 AI 摘要,其中 7,491 則可以驗證。
  • 拆句:把摘要拆成「一句一個事實」,把代名詞換回完整名稱,讓每句不用上下文也看得懂,去掉標題與重複,得到 98,020 句。
  • 判定:每句拿去比對摘要自己引用的頁面,分成五類。判定由模型(Grok 4.1 Fast Reasoning)做,研究另外抽 100 句做人工雙標註,模型跟人工在 98 句上一致,整體準確率 95.6%。

數字

類別 定義 比例
明確支撐 引用頁直接、明確寫了 84.6%
大致支撐 引用頁有,但說得比較籠統 4.4%
前後矛盾 引用頁不同段落說法衝突 1.4%
被反駁 引用頁的內容跟這句相反 2.7%
沒提到 引用頁找不到這句 7.0%

後三類合計 11.0%,論文稱為「不一致」。以單則摘要看,中位數是 93.33% 的句子有支撐;7,491 則裡有 41.9% 是每一句都有支撐。

論文自己的一句話結論是:AI 摘要引用的來源可信,但將近九句就有一句沒被支撐。

11% 不等於 11% 是錯的

這是最容易被講過頭的地方。作者自己列了幾個限制,每一個都會讓數字往下修:

  • 真正被反駁的只有 2.7%。最大宗的 7.0% 是「研究抓得到的引用頁內容裡找不到」,不是「引用頁說了相反的話」。
  • 社群平台被排除。研究沒有抓 Facebook、Instagram、Reddit、YouTube 這類頁面。作者估計在最寬鬆的假設下,不一致率會從 11.0% 降到大約 5.3%。
  • 付費牆。藏在付費牆後的內容,研究抓不到,會被判成沒支撐。
  • 即時數據的時間差。天氣這類數值,研究去抓引用頁的時間晚於摘要生成,數字變了就被判不一致。氣候類的一致率只有 48.23%,作者直接稱之為量測假象。
  • 只有一個快照。40 天、美國、熱門查詢,沒有量不同地區、個人化狀態、也沒有量 AI Mode。

作者的建議是把 9.64%(沒提到加被反駁)當成上限,不是精確估計。

反過來也有一個方向的雜訊:研究另外驗證了拆句這一步,召回率是 83.23%,也就是原本存在的事實約有一成七沒被拆出來。量測誤差不只往一個方向。

所以比較準的說法是:在美國熱門查詢上,AI 摘要大約每九句有一句在引用頁上對不上,其中真正說反的是少數。 這已經足夠構成一個問題,不需要把它講成「AI 摘要一成是錯的」。

那個 60% 是另一件事

網路上常見的寫法是:「AI 摘要已經出現在六成美國搜尋,其中 11% 的說法沒有依據。」

這句把兩個研究接在一起了:

60.32% 13.7%
誰量的 SEO 工具商 Advanced Web Ranking 上面那份學術研究
查詢怎麼來 工具商自選的關鍵字追蹤集(二手文章說是 8,000 個) Google Trends 熱門查詢 55,393 個
方法文件 工具頁上沒有寫 論文完整寫出
時間 2025 年 11 月 2026 年 3 到 4 月

同一份學術研究裡,問句型查詢的觸發率是 64.7%、非問句只有 9.5%;按類別從美妝時尚的 3.5% 到休閒嗜好的 46.1%。觸發率高度取決於你挑什麼查詢,所以「AI 摘要出現在幾成搜尋」沒有單一答案。兩個分母不同的數字不能相乘,也不能寫成「六成裡的一成一」。

同一家工具商自己也示範了這件事。Advanced Web Ranking 在 2024 年 7 月發過一份有寫方法的研究:16 個產業各 500 個、共 8,000 個關鍵字,美國桌機,當時只有 12.4% 出現 AI 摘要。工具頁的 60.32% 是否用同一組關鍵字,工具頁沒有說。同一家、隔一年多,從一成二到六成,換的是時間,也可能換了查詢集。

我們會特別拆這件事,是因為自己也踩過同類的坑:AI 可見度工具那篇在回源時,發現一個常被轉述的「AI Visibility Score」說法,其實不在原作者自己的文章裡。數字被轉述三次,就會長出原作者沒說過的意思。

不只 Google

其他一手研究量到的方向一致,但範圍各不相同,不能混著比:

  • 醫療問題:史丹佛團隊刊在 Nature Communications(2025)的研究,800 題醫療問題、58,000 組陳述與來源配對,發現即使是有網路搜尋的 GPT-4o,也有大約 30% 的單句陳述沒被它引用的來源支撐。
  • 新聞出處:哥倫比亞大學 Tow Center(2025)用 1,600 個查詢測 8 款 AI 搜尋工具找新聞原文出處,合計超過 60% 答錯。它量的是「找對出處」,不是「陳述有沒有被支撐」。
  • 辯論題:Salesforce 研究團隊的 DeepTRACE(預印本)測了多款生成式搜尋與深度研究工具,引用準確率落在 40% 到 80%。

Google 的官方說法是:AI 摘要只顯示有頂尖網頁結果支撐的資訊,因此一般不會像其他語言模型那樣幻覺(2024 年官方部落格2025 年官方說明文件)。Google 沒有公布引用支撐率的具體數字。

對網站主的意思

以前擔心的是「AI 不引用我」。這份研究指出另一個風險:AI 引用了你,但把你沒說的話掛在你的網址下面。 讀者看到的是你的品牌名和連結,旁邊那句話卻不是你寫的。

我們能做的有限,但有五件事有用:

  1. 把重要陳述寫成完整句子。 代名詞換回名稱、每句不用上下文也看得懂。理由是直覺:斷在半句、指代不清的內容,機器摘要本來就難完整轉述。這是常識判斷,這份研究沒有直接驗證這一點。
  2. 日期和數字寫在同一句。 研究裡被誤判最多的是時效型數值。「本季營收成長」不如「2026 年第三季營收比前一季成長 12%」。
  3. 不要把關鍵事實藏在付費牆後面。 AI 抓不到的內容,它不會因此不講,而是從別處湊。
  4. 定期手動問一次。 挑你最在意的幾個問題,問 AI 怎麼描述你的頁面,看它說的是不是你寫的。Google 的 API 量不到這件事,這在付費引用那篇寫過實測。
  5. 分清楚技術分數量的是什麼。 我們的 AVS 量的是網站讀不讀得懂,跟被正確轉述是兩件事。分數高能讓 AI 比較容易讀到你,但保證不了它把你的話講對。

限制

這篇是研究解讀,不是我們自己的實驗。我們沒有重跑這份研究,也沒有量過繁體中文查詢或台灣的 AI 摘要;研究本身只涵蓋美國熱門查詢,結果不能直接套到台灣。研究還在審查中,數字之後可能修正。

這是實驗室週記,不是產品承諾。

資料來源

  • Xu、Iqbal、Montgomery,Measuring Google AI Overviews,arXiv 2605.14021,2026-05-13(審查中)
  • Advanced Web Ranking,Google AI Overview 追蹤工具頁(60.32% 依二手引述為 2025-11);AI Overview Study,2024-07-01
  • Wu 等,Nature Communications,2025,doi:10.1038/s41467-025-58551-6
  • Jaźwińska、Chandrasekar,Tow Center for Digital Journalism,2025-03-06
  • Venkit 等,DeepTRACE,arXiv 2509.04499
  • Google,AI Overviews: About last week(現頁面標題為 What happened with AI Overviews and next steps),2024-05-30;AI Overviews and AI Mode in Search,2025-05

常見問題

Google AI 摘要引用的頁面,真的支撐摘要的說法嗎?

多數有,但不是全部。華盛頓大學聖路易分校一篇 2026 年 5 月的預印本,把 7,491 則可驗證的 AI 摘要拆成 98,020 句逐一比對引用頁:84.6% 明確被支撐、4.4% 大致被支撐,11.0% 不一致。不一致裡 7.0% 是引用頁沒提到、2.7% 被引用頁反駁、1.4% 引用頁前後矛盾。這份研究還在審查,範圍是美國熱門查詢。

11% 是不是代表 AI 摘要有 11% 是錯的?

不是。論文的分類是「不被引用頁支撐」,其中真正被引用頁反駁的只有 2.7%。另外 7.0% 是在研究能抓到的引用頁內容裡找不到,可能是付費牆、即時數據時間差、或社群平台被排除造成的。作者自己說,扣掉社群平台的影響,下限可能約 5.3%,並建議把數字當成上限看。

AI 摘要出現在 60% 的搜尋裡嗎?

那是另一個數字。60.32% 來自 SEO 工具商 Advanced Web Ranking 追蹤的美國關鍵字集,工具頁上沒有寫方法。上面那份學術研究自己量到的整體觸發率是 13.7%,查詢來源是 Google Trends 熱門查詢;問句型查詢是 64.7%、非問句 9.5%。兩個數字分母不同,不能放在一起算。

Google 自己怎麼說?

Google 的官方說法是 AI 摘要只顯示有頂尖網頁結果支撐的資訊,因此一般不會像其他語言模型那樣「幻覺」。Google 沒有公布引用支撐率的具體數字。

網站主能做什麼?

把重要陳述寫成不用上下文也看得懂的完整句子、把日期和數字明寫在同一句、不要把關鍵事實藏在付費牆後、定期手動問 AI 怎麼描述你的頁面。技術可見度分數(例如 AVS)量的是網站讀不讀得懂,量不到 AI 有沒有把你的話轉述對。

每週 AI 自動化實戰筆記

不廢話,只有能直接用的東西。Prompt 模板、自動化 SOP、技術拆解。

加入一人公司實驗室

免費資源包、每日建造日誌、可以對話的 AI Agent。一群用 AI 武裝自己的獨立開發者社群。

想自己動手試試?

UltraProbe 免費、免註冊,掃一次網站就知道 Google 與 AI 找不找得到你。