GeoCheck GEO(生成式引擎優化)產品與方法論白皮書

從黑盒猜測走向可觀測證據:AI 信任值、量測架構與透明度指南

GeoCheck AI Search Visibility Platform Architecture
核心量測算式(AI 信任值)
AI 信任值 = 65% 可見答案採用率 + 35% 經核實第一方來源證據率

以客觀可觀測的公開 AI 輸出為基礎,結合「行為端回答採用」與「結構端官方引用」,拒絕黑盒盲猜與虛假排名承諾。

重要聲明與研究邊界

  1. 非商業成效保證:GeoCheck 量測的是特定條件下「可觀測的搜尋與引用證據」,絕不承諾或保證任何搜尋引擎或 AI 平台的特定排名、推薦率、點擊流量、獲客量或營收轉換。
  2. 非模型內部認知:產品指標「AI 信任值」(AI Trust Index)為系統量測「AI 在公開回答中採用品牌」與「引用第一方官方來源」之客觀證據率,不代表大型語言模型(LLM)內部神經網路的實際信念或真實偏好。
  3. 未知不等於零:平台服務中斷、網路逾時、API 拒答或無法解析之回答,均歸類為「未知(unknown)」,一律排除於計分分母之外,絕不假定為「表現為 0 分」。

1. 緒論:為什麼需要可觀測的 GEO 方法論?

1.1 從傳統 SEO 到 GEO(生成式引擎優化)

傳統搜尋引擎(如 Google、Bing)的核心是「排序藍色連結(Ranked Blue Links)」,其評估體系以關鍵字排名、展示次數(Impressions)與點擊率(CTR)為中心。

生成式 AI 搜尋(如 Perplexity、ChatGPT Search、Google AI Overviews)改變了答案的呈現方式:AI 直接生成綜合解答,而非僅列出網頁清單。

在生成式對話情境中,品牌面臨全新的曝光型態:

1.2 當前市場痛點:黑盒巫術與過度承諾

當前市場對 GEO 充滿焦慮與投機,常見問題包括:

  1. 虛假因果承諾:宣稱「填寫特定 Schema 標籤或改寫內容,即可 100% 登上 AI 推薦第一名」。事實上,生成式引擎具備隨機取樣(Temperature > 0)與即時 RAG 動態重排序特性,不存在確定性的排名保證。
  2. 混淆指標與構念:將網站內部的技術分數(例如 HTML 結構、結構化資料完整度)直接混充為「AI 已經喜愛並推薦你的網站」。
  3. 無效填補與偏誤:測試 API 一旦拒答或連線失敗,許多工具直接把該次查詢記為 0 分,等於把「沒拿到資料」誤判成「品牌表現為零」。

2. 量測架構:三權分立的指標體系

為避免單一綜合分數遮蔽事實,GeoCheck 確立了「三權分立」的架構原則:

GeoCheck 三權分立量測架構
面向一 · 產品核心指標

1. 產品核心指標:AI 信任值

對齊商業曝光與官方背書
  • 答案採用率 (65%)
  • 官網引用率 (35%)
  • 有效查詢數不足封頂 (69分)
  • 排除未回應題目 (標記為未知)
面向二 · 研究基石層

2. 研究基石層:GEO Core

可審計原始觀測紀錄 · 跨樣本對齊基準
  • 原始 Query-Run 執行次數紀錄
  • 完整 Prompt 與 Answer 生成存檔
  • 第一方來源 URL 與網域判定
  • 實體對齊路徑與拒答紀錄
面向三 · 輔助技術診斷 獨立診斷 · 不計入總分

3. 輔助技術診斷:網站技術準備度

Site Tech Readiness · 機器可檢索性與結構化標準
HTTP 狀態與存取性

200 / 301 重定向與伺服器回傳

Robots.txt / Sitemap

搜尋與 AI 爬蟲存取規則

JSON-LD 結構化資料

Organization / Schema 實體對齊

內容字數與標題層級

H1–H3 階層與可閱讀內文深度

3. 單站產品檢測流程:動態發現與即時分析

單站檢測適用於一般使用者在首頁輸入單一網址後的即時檢測。核心流程包括:

  1. 多重抓取彈性保障:優先以輕量 HTTP 抓取目標頁面 HTML;遇客戶端渲染自動退回 Headless 瀏覽器渲染模式。
  2. 非品牌題目生成與防呆:使用結構化 LLM(現行主力:deepseek-v4-flash)依頁面證據產出 5~8 個候選題,並以確定性正規表示式嚴格剔除包含受測品牌的題目。若兩輪無法湊齊可選出 4 題的合規非品牌題,系統主動停止搜尋並標示 unknown
  3. 實體查詢隔離:額外執行 1 次帶品牌名稱的實體查詢(Direct Entity Query),但僅用於綁定官方別名與網域,不併入非品牌發現的評分分母中。

4. 白皮書研究批次流程:凍結題組與嚴謹母體

當進行跨品牌、跨產業的基準調查或研究白皮書時,嚴禁使用單站檢測的動態題目。批次研究恪守以下原則:

5. 指標解讀:AI 信任值與評分規則

在經審定的非品牌發現查詢集中,針對所有取得有效且可見回答的執行次數(\(N_{\text{valid}}\)),「AI 信任值」定義如下:

$$\text{AI Trust Index} = 100 \times \left( 0.65 \times \text{答案採用率} + 0.35 \times \text{來源證據率} \right)$$
$$\text{答案採用率} = \frac{\sum \text{提及已對齊品牌之有效查詢數}}{N_{\text{valid}}}$$
$$\text{來源證據率} = \frac{\sum \text{引用經核實第一方官方 URL 之有效查詢數}}{N_{\text{valid}}}$$

樣本不足封頂防呆(Coverage Cap at 69 分):單次偶發的成功無法代表穩定的市場能見度。若受測網站有效查詢次數 \(N_{\text{valid}} < 2\),前端產品顯示分數嚴格封頂於 69 分,防止單一題目偶然被提及時產生虛假的滿分誤導。

6. 證據判定:答案採用 vs. 來源證據四象限

GeoCheck 將 AI 的輸出嚴格拆解為兩個獨立維度:答案層是否提及品牌(65%)、來源層是否引用官方網域(35%)。

AI 信任值:答案採用 vs. 來源證據判定四象限 X 軸為第一方官網引用率,權重 35%;Y 軸為可見答案採用率,權重 65%。 四象限依序為完全採信、二次提及、未可觀測與背景引用。 AI 信任值:答案採用 vs. 來源證據判定四象限 二次提及 AI 提及品牌 但引用第三方部落格 完全採信 AI 提及品牌+引用官網 最佳實證 未可觀測 品牌未出現於回答 或任何第一方引用 背景引用 AI 參考了官網 但內文未主動推薦 0% 50% 100% 0% 50% 100% 第一方官網引用率 權重 35% 可見答案採用率 權重 65%

7. 網站技術準備度:基礎建設與非因果限制

網站技術準備度量測網站的機器可讀性(HTTP 存取性、Robots、Sitemap、Schema.org JSON-LD 與內容密度)。

非因果架構原則
技術準備度 100 分 ≠ AI 一定會推薦你

結構化資料與機器存取性是 AI 能順暢檢索網頁的「必要條件(Prerequisite)」,但絕非「充分保證(Guarantee)」。技術準備度獨立診斷,不計入 AI 信任值總分。

8. 研究限制與治理規範

  1. 時間波動性(Temporal Drift):生成式搜尋每週微調模型或更新索引。量測結果代表特定時點的可觀測狀態,不代表永久排名。
  2. 單一引擎限制:本系統搜尋觀測主力為 Perplexity Sonar 系列,不可直接外推至所有 AI 模型。
  3. 探索性相關分析:若探討 AI 信任值與客流量關係,嚴格定性為探索性相關,嚴禁宣稱因果關係。
  4. L2 可複現性承諾:演算法全公開、資料集計算 SHA-256 雜湊值防竄改、完整揭露 Unknown 與失敗記錄。