這篇解什麼問題
Route E 用 NVIDIA NIM 的 nemotron-3-embed-1b(凍結 embedding + LogisticRegression 分類頭)零本地訓練拿下 public LB 0.83113,幾乎打平微調的 DistilBERT(0.83052)。當時就懷疑:nlp-getting-started(Disaster Tweets)是 Kaggle 最知名的入門教學題目之一,數千份公開 notebook 貼過完整的推文/標籤對照,這個分數會不會只是背過答案?當時沒有工具查證,只能誠實揭露這個可能性,給不出答案。
我怎麼做
w03 那週為了查另一個模型是否背過答案,設計了一套「原文 vs 手寫改寫版配對比較」的方法論——但那套技術(逐字接龍、perplexity)是針對有生成能力、有 token logprobs 的模型設計的。nemotron-3-embed-1b 是純 embedding API,沒有生成、沒有 logprobs,同一套技術用不上,得換一個訊號,但保留同一套邏輯。
改成比較 LogisticRegression 分類頭對「原文推文」與「手寫同義改寫版」預測正確標籤的信心差距。固定 seed=42,從當初 80/20 split 的驗證集(分類頭從沒訓練過這些推文)分層抽 30 則,手寫 30 則意思不變、用字不同的改寫版,重新訓練同參數分類頭,30 對「原文信心 − 改寫版信心」跑配對 t 檢定。判定門檻在跑之前先訂好:p<0.05 且原文顯著較高才算污染證據。
結果與數據
配對 t 檢定:t=-0.889,單尾 p=0.80935,mean_diff=-0.02113,Cohen's d=-0.162。p 值遠高於 0.05 的門檻,方向甚至跟污染假說相反——改寫版的分類信心平均還略高於原文。沒有污染證據。
一句話結論
0.83113 更可能是 nemotron-3-embed-1b 對「這是不是在講災難」這件事的真實語意理解,不是背過這份公開資料集的具體字面——三週前留下的但書,現在可以拿掉了。