這篇解什麼問題
這週要用五題自製基準幫四支本地 LLM 排名,但「贏了幾分」這種說法本身可能是騙人的指標——除非先搞清楚評測方法論本身也在演化,而且一代比一代更懷疑「一個分數能不能代表模型好壞」這件事。
我怎麼做
把三個世代的代表論文都找出來,逐一確認真的存在、標題與年份沒有抄錯(過程中修正了兩處常見的二手引用錯誤)。
- 一代|MMLU(Hendrycks et al., "Measuring Massive Multitask Language Understanding," arXiv:2009.03300, 2020-09):57 個學科的選擇題,數學、史學、法律都有,是「用一個分數總結模型知識廣度」的代表作。
- 二代|HELM(Liang et al., "Holistic Evaluation of Language Models," arXiv:2211.09110, 2022-11):42 個 benchmark × 30 個模型 × 多維度指標(準確率、穩健性、偏見、毒性、效率),把 MMLU 那種單一數字的評測,擴展成多面向的評估表格。
- 三代|Chatbot Arena / LLM-as-Judge(Zheng et al., "Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena," arXiv:2306.05685, 2023-06):群眾對戰 + GPT-4 當裁判,同時揭露了 position bias、verbosity bias、self-enhancement bias 這些「連裁判都會犯的錯」。
額外兩個關鍵補充:LiveBench(White et al., arXiv:2406.19314, 2024)強調 contamination-resistant——避免題目早被訓練資料看過;TMMLU+(Tam et al., arXiv:2403.01858, 2024)是目前繁體中文評測的 SOTA,22,690 題涵蓋 66 個科目,這是本週唯一能拿來對照本地模型繁中能力的公開標準。
結果與數據
三代演化的共同軌跡:從「一個分數」到「多維度表格」,再到「連裁判本身的偏見都要揭露」。每一代都不是推翻前一代,而是承認前一代的盲點——MMLU 選擇題測不出生成品質,HELM 的多維度指標測不出「人類實際偏好哪個回答」,Chatbot Arena 的裁判偏見則提醒我們連「用 LLM 評 LLM」都不是絕對客觀。
一句話結論
這週要用的五題自製基準,方法論等級介於「MMLU 式的小規模選擇題」和「完全沒有外部驗證」之間——這也是為什麼週三揭曉結果時,我會同時老實承認這五題規模太小、無法回答「哪支模型真的比較強」,只能回答「這五題誰答得比較好」。