Lab Arena 是一個 LLM 社群評價排行榜。它做的事只有一件:把近一個月社群上談論各大模型時的態度,壓成一個 0~100 的分數。
聽起來很簡單,但那句「壓成分數」藏了整個設計的重量。這篇先講清楚它在做什麼、量到的是什麼、怎麼讀;分數的數學留給〈分數怎麼算〉,局限留給〈這個排行榜的限制〉。
它量的是聲量與態度,不是能力
這是整個章節最重要的一句話,也是頁面上一直掛著的那句聲明:
社群聲量代理指標,非 benchmark。
這不是謙辭,是技術定義。整份資料的 kind 欄位就鎖死在 community-sentiment,意思是「社群情感」。它不是 benchmark,因為 benchmark 有一組固定的題目、固定的評分規則,跑一次分數就代表模型在那些題上的能力;而這裡沒有任何受測題目——它讀的是「人們在 Reddit、Hacker News、X 上怎麼談這些模型」,把它統計成一個數字。
所以:
- 它量得到:社群當下偏向正面還是負面、哪些面向被討論、討論得多不多。
- 它量不到:模型在真實任務上到底做得多好、多快、多便宜。
看榜單時把這句話放在第一位。分數高的模型,是「最近社群比較喜歡談的模型」,不是「最強的模型」。
資料從哪來:一條能重跑的管線
分數不是任何模型直接吐出來的一個數字。背後是一條獨立於網站的資料管線,跑完產出一份資料產物(scores.json),網站只是把這份產物讀進來、靜態輸出成頁面。這條管線的每個環節都做過判斷,過程與取捨寫在專案的文件裡;這裡只點出跟「你在看這張榜」最相關的三件事:
- 只收近 30 天的討論。 窗口很短,這讓榜單反映「當下聲量」,但也意味著榜單會跟著話題冷熱大起大落(見〈限制〉)。
- 逐則貼文判斷,再聚合成分數。 每一則貼文先交給一個 LLM 評審團,對「總評」和五個面向各自判斷態度;分數是這些判定照公式算出來的,不是模型直接給的。分數可以手算回推、可以攤開引用查核。
- 原始證據全部留著。 榜上每一列都能展開「引用來源」,看到是哪幾則貼文、評審團怎麼判、原文連結在哪。分數不是黑箱。
分數怎麼解讀
榜單上除了分數,還有幾個欄位——它們不是裝飾,是判讀分數的必需品。
| 欄位 | 它是什麼 | 怎麼用 |
|---|---|---|
| 總分 | 五個面向依權重加權、重歸一後的綜合分 | 看「社群在乎的面向」整體偏向。品質權重最高,所以總分含蓋「好不好用」的主觀感受 |
| 各面向分數 | 智能/速度/Token 效率/Token 用量/CP 值 | 切換面向看那個面向誰領先;某面向顯示「資料不足」代表社群根本沒談那件事 |
| 樣本數 N | 這個模型被收進資料池的貼文筆數 | N 越小,數字越容易是雜訊。N < 20 會標「僅供參考」 |
| 樣本信任度 | 正面率的 Wilson 95% 下界 | 這個下界是「就算往壞處估,還有多少把握」。信任度低就別太認真那個分數 |
| 引用來源 | 逐則貼文+原文連結 | 想追一個分數從哪來,展開看得到 |
有兩個細節值得先記住,因為它們最容易被誤讀:
- 「資料不足」不等於 50 分。 某個面向如果完全沒被討論過,那格是「資料不足」,不是中間分。把它當 50 會假裝社群給了中立評價,但它其實是「沒人聊」。
- 總分會因為剔除資料不足的面向而重歸一。 所以兩個模型的總分嚴格來說不是同一組面向加權起來的。比較時要同時看面向分與樣本數。
這個章節怎麼讀
Lab Arena 不是只有這張表。這個章節=工具本體(排行榜)+ 配套技術文章(就是你在看的這幾篇)。表格給你看結果,文章把結果背後的假設與代價攤開。
固定立場,再說一次:這是社群聲量的代理指標。 用它看「社群當下怎麼談這些模型」,沒問題;用它宣稱「哪個模型最強」,那是誤用。