跳到主要內容
Jason Lab

01.1

Lab Arena 是什麼

這張排行榜在做什麼、資料從哪來、分數怎麼解讀。一篇講清楚這個章節的定位與邊界。

arena/posts/what-is-lab-arena.md約 4 分鐘

Lab Arena 是一個 LLM 社群評價排行榜。它做的事只有一件:把近一個月社群上談論各大模型時的態度,壓成一個 0~100 的分數。

聽起來很簡單,但那句「壓成分數」藏了整個設計的重量。這篇先講清楚它在做什麼、量到的是什麼、怎麼讀;分數的數學留給〈分數怎麼算〉,局限留給〈這個排行榜的限制〉。

它量的是聲量與態度,不是能力

這是整個章節最重要的一句話,也是頁面上一直掛著的那句聲明:

社群聲量代理指標,非 benchmark。

這不是謙辭,是技術定義。整份資料的 kind 欄位就鎖死在 community-sentiment,意思是「社群情感」。它不是 benchmark,因為 benchmark 有一組固定的題目、固定的評分規則,跑一次分數就代表模型在那些題上的能力;而這裡沒有任何受測題目——它讀的是「人們在 Reddit、Hacker News、X 上怎麼談這些模型」,把它統計成一個數字。

所以:

看榜單時把這句話放在第一位。分數高的模型,是「最近社群比較喜歡談的模型」,不是「最強的模型」。

資料從哪來:一條能重跑的管線

分數不是任何模型直接吐出來的一個數字。背後是一條獨立於網站的資料管線,跑完產出一份資料產物(scores.json),網站只是把這份產物讀進來、靜態輸出成頁面。這條管線的每個環節都做過判斷,過程與取捨寫在專案的文件裡;這裡只點出跟「你在看這張榜」最相關的三件事:

  1. 只收近 30 天的討論。 窗口很短,這讓榜單反映「當下聲量」,但也意味著榜單會跟著話題冷熱大起大落(見〈限制〉)。
  2. 逐則貼文判斷,再聚合成分數。 每一則貼文先交給一個 LLM 評審團,對「總評」和五個面向各自判斷態度;分數是這些判定照公式算出來的,不是模型直接給的。分數可以手算回推、可以攤開引用查核。
  3. 原始證據全部留著。 榜上每一列都能展開「引用來源」,看到是哪幾則貼文、評審團怎麼判、原文連結在哪。分數不是黑箱。

分數怎麼解讀

榜單上除了分數,還有幾個欄位——它們不是裝飾,是判讀分數的必需品。

欄位 它是什麼 怎麼用
總分 五個面向依權重加權、重歸一後的綜合分 看「社群在乎的面向」整體偏向。品質權重最高,所以總分含蓋「好不好用」的主觀感受
各面向分數 智能/速度/Token 效率/Token 用量/CP 值 切換面向看那個面向誰領先;某面向顯示「資料不足」代表社群根本沒談那件事
樣本數 N 這個模型被收進資料池的貼文筆數 N 越小,數字越容易是雜訊。N < 20 會標「僅供參考」
樣本信任度 正面率的 Wilson 95% 下界 這個下界是「就算往壞處估,還有多少把握」。信任度低就別太認真那個分數
引用來源 逐則貼文+原文連結 想追一個分數從哪來,展開看得到

有兩個細節值得先記住,因為它們最容易被誤讀:

這個章節怎麼讀

Lab Arena 不是只有這張表。這個章節=工具本體(排行榜)+ 配套技術文章(就是你在看的這幾篇)。表格給你看結果,文章把結果背後的假設與代價攤開。

固定立場,再說一次:這是社群聲量的代理指標。 用它看「社群當下怎麼談這些模型」,沒問題;用它宣稱「哪個模型最強」,那是誤用。