Resonance Lab · W01 Lab Note

三週前的懸案,回頭用本週的方法論查了——Route E 到底背了答案沒有?

三週前 w01 的 Route E 留了一個懸案沒解——這週用另一個實驗建立的方法論,回頭把它補上了。

這篇解什麼問題

Route E 用 NVIDIA NIM 的 nemotron-3-embed-1b(凍結 embedding + LogisticRegression 分類頭)零本地訓練拿下 public LB 0.83113,幾乎打平微調的 DistilBERT(0.83052)。當時就懷疑:nlp-getting-started(Disaster Tweets)是 Kaggle 最知名的入門教學題目之一,數千份公開 notebook 貼過完整的推文/標籤對照,這個分數會不會只是背過答案?當時沒有工具查證,只能誠實揭露這個可能性,給不出答案。

我怎麼做

w03 那週為了查另一個模型是否背過答案,設計了一套「原文 vs 手寫改寫版配對比較」的方法論——但那套技術(逐字接龍、perplexity)是針對有生成能力、有 token logprobs 的模型設計的。nemotron-3-embed-1b 是純 embedding API,沒有生成、沒有 logprobs,同一套技術用不上,得換一個訊號,但保留同一套邏輯。

改成比較 LogisticRegression 分類頭對「原文推文」與「手寫同義改寫版」預測正確標籤的信心差距。固定 seed=42,從當初 80/20 split 的驗證集(分類頭從沒訓練過這些推文)分層抽 30 則,手寫 30 則意思不變、用字不同的改寫版,重新訓練同參數分類頭,30 對「原文信心 − 改寫版信心」跑配對 t 檢定。判定門檻在跑之前先訂好:p<0.05 且原文顯著較高才算污染證據。

結果與數據

配對 t 檢定:t=-0.889,單尾 p=0.80935,mean_diff=-0.02113,Cohen's d=-0.162。p 值遠高於 0.05 的門檻,方向甚至跟污染假說相反——改寫版的分類信心平均還略高於原文。沒有污染證據

一句話結論

0.83113 更可能是 nemotron-3-embed-1b 對「這是不是在講災難」這件事的真實語意理解,不是背過這份公開資料集的具體字面——三週前留下的但書,現在可以拿掉了。