home / notes / comparing across a ruler change
Note
換了尺之後,前後的數字還能比嗎?
我換掉了量測用的模型。我自己站上的數字前後一樣。這件事比數字變動更容易讓人誤判。
情況
前一篇寫到我的探測有一個平台整批失敗,原因是所用的模型退役了。修復方式是換成另一個模型。
換完之後我做的第一件事,是去看數字有沒有跳動。
| 日期 | OpenAI 側使用的模型 | 提及品牌 | 引用官網 |
|---|---|---|---|
| 2026-08-12 | gpt-4o-mini-search-preview | 4 / 22 | 3 / 22 |
| 2026-08-17 | gpt-4o-mini-search-preview | 4 / 22 | 3 / 22 |
| 2026-08-24 | (整批失敗) | — | — |
| 2026-08-31 | gpt-5-search-api | 4 / 22 | 3 / 22 |
| 2026-09-07 | gpt-5-search-api | 4 / 22 | 3 / 22 |
一模一樣。換尺前後,我的網站在這組題目上的表現完全沒有變動。我第一個念頭是「太好了,可比性沒問題,趨勢線可以接起來」。
然後我去看了是哪 4 題
這一步本來應該在下結論之前做。我做的時候已經打算寫「量測可比」了。
| 問題類型 | 題數 | 提及品牌 | 引用官網 |
|---|---|---|---|
| 問句裡含品牌名 「ShellFans 是什麼公司?」之類 | 4 | 4 / 4 | 2–3 / 4 |
| 問句裡不含品牌名 「台灣做 AEO 的公司推薦」之類 | 18 | 0 / 18 | 0 / 18 |
命中的永遠是同樣那 4 題,而那 4 題的共同點是問句裡已經寫出了我的名字。
為什麼這不代表兩把尺一樣
一、這個指標對我想量的東西沒有解析度
我想知道的是「AI 在不被提示的情況下會不會講到我」。而我的 22 題裡有 4 題直接把答案寫在問題裡,18 題的結果全部是 0。
一個永遠回傳 4 的量測,跟兩把尺等不等價無關——它對兩把尺都不敏感。穩定不是精確,可能只是遲鈍。
二、真正該看的數字是 0 / 18
把品牌題拿掉之後,兩個平台、兩個模型、五次執行,非品牌題的提及率與引用率都是 0。這個 0 才是有資訊量的:它說明在「台灣做 AEO 的公司推薦」這類問題上,AI 完全不會想到我。
而 0 也有 0 的問題——它同樣沒有解析度。從 0 到 0,我看不出任何進展,直到某一次跳成 1。在那之前,所有努力在這個指標上都長得一模一樣。
三、同一時期我還改了別的東西
題組數量在這段期間調整過,網站內容也在改。就算數字有變動,我也無法把變動歸因到單一原因。這是自己既是實驗者又是被量測對象時的固有問題。
我實際採取的做法
- 在資料裡標記換尺的時間點,而不是只寫在筆記裡。任何跨越 2026-08-27 的比較,都要顯示這條線。
- 不把跨越換尺點的兩段畫成同一條趨勢線。畫成兩段,中間斷開。這在視覺上很醜,但醜是正確的——它們本來就不是同一個量測。
- 把「換了什麼」寫進每一筆觀測,而不是依賴事後回憶或設定檔的歷史版本。
這件事的一般形式
任何自動化量測都會遇到換尺的問題,只是 AI 相關的量測遇到得特別頻繁——模型改版、退役、行為調整的節奏比傳統 API 快得多。
我現在的預設立場是:只要量測條件變過,就假設前後不可比,除非我能說出為什麼可比。反過來的預設(假設可比,除非證明不可比)會讓錯誤的趨勢線活很久,因為沒有人會去挑戰一條看起來很順的線。
但這次真正的收穫不是換尺。是我在檢查可比性的時候,意外發現那個指標本來就沒在量我以為它在量的東西。如果那天數字有跳動,我大概會忙著解釋跳動的原因,而不會去拆開看那 4 題是哪 4 題。