前兩篇講了它是怎麼運作的。這篇講反面:這份數字不能拿來做什麼。
寫限制不是為了謙虛,是為了避免誤用。一個社群聲量指標最容易被拿去做的三件事——宣稱哪個模型最強、當成購買建議、拿相鄰兩名的分差論高下——這三件它都做不了,而且失敗得很安靜:數字看起來一樣嚴謹,所以你不會警覺自己搞錯了。
限制一:30 天窗口=當下聲量
窗口只有 30 天,所以榜單量的是「最近社群怎麼談」,不是「這個模型好不好」。直接後果:
- 新模型天然吃紅利。 剛發布就有一堆人寫初評、寫測試,聲量集中在幾天內,分數容易衝高。
- 舊模型會被淡忘。 一個穩定好用、各社群都在用的老模型,如果最近沒什麼新聞,這個月可能只有零星幾則提及,樣本變薄、分數被收縮往 50 拉。它掉出名次不代表它變差,只代表這個月安靜。
- 榜單名次會大起大落。 話題一換,排名就換。這不是系統壞了,是它照實反映「這一個月的聲量」。
結論:適合看「現在大家在談什麼、聲量往哪偏」,不適合看長期實力排名。要看長期,該看的是有固定題目、可重跑的 benchmark——那是完全不同類型的工具,這份榜單的 kind 欄位寫的就是 community-sentiment,不是 benchmark。
限制二:聲量 ≠ 能力,而且會系統性偏袒吵的模型
正面率是「被談到的貼文裡,正面的比例」。分母是聲量,不是模型數量。 這帶來幾個結構性的偏差:
- 樣本多的模型比較容易排前面。 一個被大量討論的模型,它的正面率估計得比較穩;一個只有零星幾則的模型,分數幾乎是雜訊。排名因此不自覺地獎勵「熱門」。
- 同一則爆紅貼文會放大聲量。 就算做了跨來源去重(正規化後取雜湊值,重貼只算一次),一篇被轉載的長文仍然會讓那個方向的分數偏重。這是社群指標的宿命,不是實作瑕疵。
- 沒有討論過的面向不是 50 分,是「沒資料」。 社群不常聊 CP 值,所以 CP 值那欄常常是「資料不足」;而總分會把這些面向剔除後重歸一。結果是不同模型的總分可能建立在不同數量的面向上,這是這份設計裡最容易被誤讀的一點。
- 權重是人的判斷。 品質 0.5、CP 值 0.2、兩個 Token 面向各 0.05——這些權重反映的是「社群通常在乎什麼」的假設,不是客觀真理。
限制三:這批樣本很薄,信任度普遍偏低
這一版資料池 216 則、分給 8 個模型,每個模型 19~35 則,而且只有完成評分的會算進樣本數。套用 Wilson 95% 下界之後,8 個模型的樣本信任度全部落在「低」到「中」,最高的也只有 30% 出頭。
意思是:榜單的相對位置還值得看(誰比較常被正面談),但絕對數值不要當真。相鄰兩名差幾分,多半在雜訊範圍內,不構成「A 勝過 B」的證據。這也是為什麼分數只有一位小數、為什麼每列都附著樣本數與信任度——那些欄位不是裝飾,是防誤讀的。
面向層級更薄。每一個面向的「有表態樣本數」幾乎都低於門檻:智能面向最多也只有 12 則,Token 效率只有 1~2 則,「Token 用量」有 3 個模型是資料不足、其餘 1~3 則。收縮公式於是把這些低樣本分數往 50 拉——Token 用量有資料的五個落在 41.7~61.5。看懂這一點,就不會把「Token 用量 45.5」誤讀成「它在 Token 用量上表現差」:那一格背後只有一則有表態的貼文。
限制四:來源與語言有偏
只收 Hacker News、Reddit、X,且只收英文(拉丁字母比例門檻把非英文貼文濾掉)。這代表它系統性地漏掉:
- 非英語社群的評價。 中文、日文、歐洲其他語言的討論完全沒進來。
- 封閉或登入牆後的討論。 拿不到 Discord、Slack、付費社群的內容。
- 某些技術向社群。 只抓得到公開可搜尋的貼文。
X 那一欄的取得還依賴登入憑證,缺憑證時會優雅降級(其餘來源照收),所以涵蓋來源會隨環境變動——榜上標示的涵蓋來源是當次實際收進來的。跨時間比較之前,先確認涵蓋有沒有變。
另外,HN 的語氣本來就偏挑剔,Reddit 的討論比較長、比較細,不同來源的「中性」其實不是同一個中性。這個落差在評分時是混在一起的,沒有分來源校準。
限制五:評審團自己也是模型
評審團由四個 LLM 組成,它們的判斷有自身的偏差與盲點。設計上已經做了兩件事降低這類風險:
- 多數決。 單一模型的怪癖會被 3/4 壓過去。
- 平手就放棄。 2/4 拿不下來就記「沒有結果」,不硬猜。
但這不等於「客觀」。評審團成員是刻意挑選的、來自不同廠商,但它們對什麼算「正面」的判讀標準,终究是模型的判讀。校準流程(見〈分數怎麼算〉)就是拿來量這件事的,但校準門檻的現況還在對齊中,在對齊之前不要把評審團當成絕對可靠的標尺。
那它還能用來做什麼?
用它原本設計要回答的那個問題,就很合理:
- 「最近社群對這幾個模型的情緒偏正面還是偏負面?」——這是它擅長的。
- 「哪個面向是社群現在的爭論焦點?」——看哪一欄有大量討論、哪一欄大量「資料不足」就曉得。
- 「把某個分數追回原始貼文查核。」——這是它比多數排行榜強的地方:每個數字都攤得開。
- 「搭配其他來源交叉比對。」——它是社群側的訊號,不是唯一訊號。
不適合的用法,直接列成一張否定清單:
| 想這樣用 | 為什麼不行 |
|---|---|
| 選出「最強的模型」 | 量的不是能力,是聲量與態度 |
| 當成選購/採購依據 | 缺價格敏感度、缺自己用例的資訊 |
| 拿相鄰兩名的分差論勝負 | 差異多在統計雜訊內 |
| 當成長期排名追蹤 | 30 天窗口,會被話題冷熱綁架 |
| 引用當「客觀評測」 | 沒有受測題目、沒有固定 rubric |
一句話總結
Lab Arena 是一社群聲量的代理指標,不是一個 benchmark。 它誠實地把「最近大家怎麼談這些模型」攤成可查核的數字,價值在於透明與可回溯,不在於它能給出一個權威的勝負。拿它當訊號,別拿它當結論。
延伸閱讀:〈Lab Arena 是什麼〉|〈分數怎麼算〉|回到排行榜。