W03 · Preview
共振實驗室.
Resonance Lab · 週一假設 → 週三結果每週一個公開實驗:立假設、跑三條路線、貼出全部數字——猜錯也照發。
W03
W03 · Main Report
賭檢索增強會完勝,結果自己打臉:Qwen3-8B 零樣本以 0.885 血洗 TF-IDF 的 0.5325
W03 · Lab Note
MAP@3 到底怎麼算?用 20 萬次蒙地卡羅模擬釘住隨機猜測的地板
W03 · Lab Note
懷疑模型背過答案?我設計了兩個獨立訊號去查證
W03 · Lab Note
想幫 Route A 也拿 Kaggle 排行榜分數,結果一頭撞進 GGUF 記憶體崩潰
W03 · Lab Note
用 AI 查文獻,再用 AI 查核 AI——本週四個發現在文獻上站不站得住腳
W02
W02 · Preview
三年前的 MacBook 能跑贏雲端嗎?我讓四個本地 LLM 打一場有文獻背書的擂台
W02 · Main Report
文獻預測的冠軍最後一名:4 模型 Ollama 橫評的三個反轉
W02 · Lab Note
LLM 評測方法論走到第幾代了?從 MMLU 到 Chatbot Arena
W02 · Lab Note
量化甜蜜點:Q8_0 多吃 52% 磁碟,分數卻反而更低
W02 · Lab Note
同一個模型、同一個量化等級,換個 backend 就能讓程式碼從全對變成只過三分之一
W01
W01 · Preview
五路大亂鬥:從 TF-IDF、微調 BERT 到雲端 Embedding,誰能分辨真假災難推文?
W01 · Main Report
五路大亂鬥結果:BERTweet 奪冠,但 Embedding 才是真正的效能怪物
W01 · Lab Note
TF-IDF 拆解:0.5 秒訓練完,Kaggle 公開分數 0.80
W01 · Lab Note
DistilBERT 拆解:三次 push,兩個環境坑,才拿到 0.83
W01 · Lab Note
零樣本 Gemma 拆解:不訓練,公開分數還是打到 0.78
W01 · Lab Note
加碼對決:雲端 LLM 慘遭滑鐵盧,Embedding 模型與 Ensemble 的逆襲
W01 · Lab Note