你的嘗試次數,從來不等於回測引擎跑過的次數。帳面上的 N 是 1,真實的 N 經常是三位數。
這篇要拆的就是這個落差。過度優化隱形機制的核心不在參數掃描,掃描至少留得下紀錄;真正查不到的部分,藏在你不覺得自己做了選擇的地方。調參迴圈裡的機制,過度優化:量化交易策略的隱形殺手那篇拆過三個:每一步局部合理、獎勵即時而帳單延遲、嘗試免費而統計成本照算。本文往下挖一層,處理那些從頭到尾沒有進過任何紀錄的優化。
具體來說是四條通道:研究者自由度、隱性多重測試、資料集老化、敘事合理化。每一條都會給機制、可辨認的樣態,和對應的堵法。讀完你大概會重新估一次自己的 N,而新的估計值不會讓你舒服。
過度優化隱形機制的共同結構:優化不發生在你記帳的地方
先把操作型定義說清楚。任何拿同一份歷史資料篩選過的決策,都是優化的一部分,無論它有沒有經過回測引擎。用這個定義去看,參數掃描只是冰山浮出水面的那一截,因為它剛好是唯一會留下報表的環節。
四條通道的共同點是:篩選發生了,紀錄沒有。
| 通道 | 發生在哪裡 | 為什麼查不到 |
|---|---|---|
| 研究者自由度 | 每個看似中性的研究決定 | 一條路徑走到底,沒有「第二次嘗試」可記 |
| 隱性多重測試 | 腦內回測與早夭的想法 | 篩選發生在寫程式之前 |
| 資料集老化 | 研究者自己的記憶 | 歷史只有一份,你已經看過答案 |
| 敘事合理化 | 結果出來之後補的理由 | 故事讓雜訊峰看起來像假設 |
下面逐條拆。
通道一:研究者自由度,分岔走過就不見
統計學把這個問題叫分岔路徑花園。Gelman 與 Loken 在 The Garden of Forking Paths 裡講的重點很反直覺:你不需要偷跑很多次測試才會過擬合。只要每個分析決定是看了資料之後才做的,就算整個研究只做了一次正式檢定,那次檢定也承載了整棵決策樹的假陽性率。
量級有人算過。Simmons、Nelson 與 Simonsohn 在 False-Positive Psychology 裡示範,只要四個常見的研究者自由度同時開放,名目上 5% 的假陽性率實際可以被推到 60.7%。他們談的是心理學實驗,但機制對量化研究完全通用。
翻譯成回測語言,這些決定全部是自由度:資料起訖點、標的選擇、K 線週期、指標用 EMA 還是 SMA、插針刪不刪、成本抓多少。每一個都能講出中性的理由,每一個都是看著資料做的。
小威的第一支策略是乾淨的樣本。2026 年 3 月他寫了一支突破策略,資料起點選 2023 年 1 月,理由是 FTX 之後市場結構才算正常;週期選四小時,因為日線樣本太少、一小時太吵;通道用 EMA 包絡不用固定區間,因為圖上貼得比較順;2024 年 8 月那根插針刪掉了,標記為異常事件。回測只跑一次,Sharpe 1.9,他認為自己零優化。半年實盤下來,績效是負的。
問題不在他跑了幾次回測。五個決策節點、每個節點三個選項,是 243 條路徑;他挑的那條,是記憶裡風景最好的一條。他不是選了一條路,是在已經看過終點的地圖上畫路線。這就是分岔路徑的完整代價:每個岔口都在後台計費,就算帳面上只走了一條。
通道二:隱性多重測試,被丟掉的嘗試不會自己記帳
就算你認真記錄 trial,帳本通常也只記「跑過回測引擎的」。有三類嘗試從來不進帳。
第一類是腦內回測。你盯著圖說「這裡進場會賺」,這句話就是一次回測,眼睛是引擎,只是沒有輸出報表。第二類是早夭的想法,寫到一半覺得不對就刪掉的 notebook,沒有人替它們立墓碑。第三類是別人的嘗試:你讀到的每一篇策略貼文,都是別人篩選過的倖存者,把它拿來改良,等於繼承了它背後整個看不見的嘗試分佈。
講一段我自己的帳。上一季我大概翻了兩個月的圖,先後動過十四、五個 setup 的念頭,多數在腦內就被否決,理由清一色是「這在 2024 年那段會被巴」。最後只有一個想法寫成程式,回測一次就很漂亮,帳上記 N 等於 1。實際上那是第十五次測試,前十四次的測試設備是眼睛,測試資料是同一份歷史。它漂亮的原因,有一半只是因為它是十五個裡活下來的那個。
嘗試次數怎麼把假陽性機率灌大,選擇偏誤與多重測試拆過完整機制。這裡要補的是更難堪的那一半:多數嘗試根本沒進你的計數,所以你以為的 N 和真實的 N 差的不是幾筆,是數量級。
通道三:資料集老化,你就是被歷史訓練過的優化器
所有統計檢定都建立在一個前提上:假設和資料互相獨立。第一次拿這份資料檢驗假設,p 值是誠實的。你對這份資料越熟,這個前提就越不成立。
這件事有正式的理論框架。Dwork 等人在 Science 的 The Reusable Holdout 證明,同一份保留資料每被查看一次,它能提供的統計保證就衰減一分;查看次數夠多之後,holdout 和訓練集在統計上沒有差別。這種反覆查看同一份資料、讓假設不再獨立的行為,統計學上也叫資料窺探(data snooping)。層次要分開:White’s Reality Check 那類資料窺探檢定處理的是下游校正,本文講的是更上游的汙染源,研究者自己的記憶。
Dwork 等人處理的是機器學習競賽的排行榜,但加密研究的處境更難堪:全市場共用同一份歷史,而且只有十幾年。
2020 年 3 月的瀑布、2021 年 5 月的槓桿清洗、2022 年 11 月的 FTX。你不只看過,你背得出來。任何你認為「事前」寫下的假設,都已經先過了這份記憶的濾網。你本人就是一個在 BTC 歷史上訓練了好幾年的模型,而模型沒有辦法對自己的訓練集做樣本外測試。
lockbox 只有一發子彈的深層原因在這裡。那不是流程潔癖,是資訊理論:看過一次,那段資料對你的假設就永遠不再是樣本外,而大腦沒有刪除鍵。
通道四:敘事合理化,每個雜訊峰都配得到一個故事
研究圈把這個行為叫 HARKing,看到結果之後才生出假設。它隱形的原因很簡單:人腦替任何峰值生成經濟故事的能力是無限的。回看期 34 天可以講成機構月度再平衡,21 天可以講成選擇權到期週期,13 天可以講成資金費率的半月結構。故事的供給無限,所以故事的存在本身不構成任何證據。
阿倫的例子把這件事量化了。他掃出一支動能策略,回看期 34 天是全域最佳,他的解釋是機構月度再平衡疊加期貨結算的錯位,聽起來相當完整。我請他做一個測試:如果這個機制為真,同樣的峰值應該出現在 ETH 和黃金期貨上,因為月度再平衡不挑資產。掃出來,ETH 的峰在 19,黃金在 55。
那個故事是替 34 客製的,不是 34 的成因。判別法就這一條:真實的機制會在它該出現的其他地方留下痕跡,事後編的故事只在被擬合的那個點上成立。事前寫下假設的價值在這裡第二次出現,時間戳是唯一能區分「預測」和「合理化」的東西。
二階效應:隱形自由度會讓修正工具跟著失真
四條通道的輸出是同一個數字被系統性低估:N,你的有效嘗試次數。這件事的殺傷力在下游才爆發。
Deflated Sharpe Ratio 和 PBO 這一類修正工具,輸入端都需要一個誠實的 N。餵進去的 N 低估十倍,折算出來的顯著性就虛高,策略帶著「通過統計修正」的認證上線。這比完全不做修正更危險:多了一層假信心,部位通常也下得更大。
換句話說,隱形機制汙染的不只是回測本身,還包括你用來修正回測的整套工具。修正框架的品質上限,就是 N 的誠實程度。
對策:讓隱形自由度現形的四個習慣
對應四條通道,各有一個成本很低的堵法。
決策日誌,不只是回測日誌。 記錄的單位是決定,不是回測:為什麼是這個起點、這個週期、這個指標形式,當時還考慮過哪些選項。寫的對象是三個月後要查帳的你自己。
想法也記帳。 腦內否決的 setup,一行就夠,日期加一句話。月底盤點那個數字,才是你的 N 的真實量級。記帳原則是寧可高估:漏記的誤差永遠對你有利,所以要往反方向偏。
冷資料優先。 驗證盡量往你沒看爛的資料移:新上市的標的、另一個資產類別、往前走的 paper trading。時間前進產生的資料,是唯一保證你沒看過的資料。
給故事找第二個案發現場。 任何事後解釋,先推導它在其他資產、其他週期上應該留下什麼痕跡,測到了才升格為假設,測不到就承認那是合理化。
這四個習慣我們在 Lab 社群裡有拿成員的實際研究流程逐步跑過,包括決策日誌的模板和想法帳的記法,想把自己的流程攤開來查帳的,那裡是合適的地方。
這套對策擋不住什麼
邊界要說誠實,三條。
自我記帳永遠低估。你不可能記得所有分岔,這套習慣的目標是把 N 的低估從百倍縮到十倍,不是歸零。折算顯著性時,就用這個帶著不確定性的 N,並且記得誤差方向對你不利。
社群層的汙染無法自查。你讀過的研究背後有多少次失敗嘗試,你永遠不會知道。能做的只有對任何「別人分享的完美策略」保持基礎折扣,倖存者偏誤在內容平台上沒有例外。
資料集老化只能減緩,不能逆轉。你對這份歷史的熟悉是單向累積的,唯一真正的新資料來自時間本身。所以最終仲裁者還是小額實盤:往前走的每一天,都是你唯一買得到的乾淨樣本外。
回測層還有五個可以直接量化的體檢項目,鄰域衰減比、WFE 分佈這些,過度優化的五個可觀測警訊整理過量表和門檻。那一層查的是策略,本文這一層查的是研究者,兩層都過,數字才值得信。
結論:先查研究者,再查策略
把過度優化隱形機制的四條通道收攏成五句話。
- 過度優化的主體不在參數掃描,在沒被記帳的自由度。有紀錄的優化只是冰山露出的那一截。
- 研究決定本身就是優化。看著資料做的每個中性選擇都在消耗自由度,四個自由度就足以把假陽性率推過六成。
- 腦內回測也是回測。你的 N 至少要包含被眼睛否決的那些想法,而且寧可高估。
- 歷史只有一份,你已經看過答案。lockbox 一發子彈是資訊理論的結果,不是規則潔癖。
- 故事供給無限,證據才稀缺。事後解釋要先在第二個案發現場成立,才有資格叫機制。
這五件事沒有一件能靠工具自動解決,它們全部指向研究流程,而流程是你自己設計的。這是壞消息,也是好消息:不用買任何新東西,今天就能開始記那本帳。
我每週會把這類研究紀律與實際市場數據的交叉檢驗寫進電子報,包括流動性、衍生品結構與鏈上籌碼的例行審視。想讓自己的研究流程多一層濾網的,可以訂閱追蹤。




