Resonance Lab · W03 Preview

零樣本能打贏檢索增強嗎?拿一場 2023 年的 Kaggle 科學考試賭一把

上週靠公開 benchmark 交叉驗證找出真正的贏家;這週換一個問題——檢索增強是不是打 LLM 科學選擇題的必需品,直接用一場真實的 Kaggle 比賽賭一把。

本週要驗證什麼假設

這場「LLM Science Exam」是 2023 年上線的 code competition:題目由 GPT-3.5 讀 Wikipedia STEM 段落出的 5 選 1 科學選擇題,指標是 MAP@3(每題最多預測 3 個答案字母,依信心排序)。核心問題很直白:不給模型任何外部資料,純靠參數內知識回答,跟真的去檢索相關段落幫忙作答,差距有多大?

實驗設計

三條路線:

  • Route A(零樣本,無檢索):完全不給模型任何外部知識,用上週橫評冠軍 qwen3-8b(Qwen3-8B-GGUF,本地跑),純靠參數內記憶回答。這是 code competition,本地跑的東西沒有排行榜分數可比——只能在 200 筆有解答的 train.csv 上算本地 MAP@3 當地板參考,這是結構性限制,不是遺漏。
  • Route B(TF-IDF RAG baseline):檢索公開的 270K 篇 Wikipedia STEM 語料庫,用純 TF-IDF 相似度(不訓練 reader、不微調任何模型)幫 5 個選項打分排序,取前三高當預測。刻意選最簡單的檢索方法——CPU 就能跑,不需要 GPU,也不需要 kernel 內連網路。
  • Route C(stretch):時間夠才做的 dense retrieval 對照組,不夠就明確延到下週。

隨機猜測基準(5 選 1,隨機猜 3 個不重複字母排序)理論值是 11/30 ≈ 0.367,我用 20 萬次蒙地卡羅模擬驗證得到 0.36596——兩者吻合。這是接下來所有路線的比較地板:任何分數低於這個數字,代表方法本身在幫倒忙。

我的預測與理由

我賭 Route B 會大幅打敗 Route A。 這場考試的題目本質上是「檢索增強才有解」的設計——GPT-3.5 是讀著特定 Wikipedia 段落出題的,沒有檢索的話,模型只能靠參數內記憶硬猜選項裡哪個聽起來最合理。真正的懸念是:TF-IDF 這麼簡單粗暴的檢索方法,能把分數拉到多高?我賭它會顯著贏過隨機猜測地板,但離頂尖方案(fine-tuned reader + dense retrieval + reranking)還有不小差距。

明天先講清楚 MAP@3 這個指標是怎麼算的、蒙地卡羅模擬怎麼驗證隨機地板,週三揭曉兩條路線的真實分數——以及這個「檢索增強才有解」的預測,到底站不站得住腳。