換一個樣本期,一半的策略當場死掉:我們公開自己 68 個實驗的成績單
換一個樣本期,一半的策略當場死掉:我們公開自己 68 個實驗的成績單
網路上流傳的策略回測圖,幾乎沒有一張是難看的。
原因很簡單。難看的那些,作者自己就先刪掉了。
我們做的是波動率預測研究,測試了幾百個想法。這篇文章要做的事情不太尋常:把我們自己的失敗率完整攤開來,包括那些跑完只能寫下「沒用」兩個字的實驗。
68 次嘗試,15 次真的有效
2026 年 3 月,我們把連續編號的 68 個實驗全部重新分類統計。這 68 個實驗每一個都是認真的嘗試:某個指標能不能預測波動、某個模型改良有沒有用、某個訊號能不能拿來下單。
分類完的成績單長這樣。
| 結果類型 | 白話說明 | 實驗數 |
|---|---|---|
| null | 完全沒效果 | 24 |
| informative | 沒賺到錢,但學到市場的某個性質 | 21 |
| positive | 明確有效 | 15 |
| partial | 部分條件下有效 | 6 |
| meta | 回顧整理 | 1 |
| correction | 更正先前的錯誤 | 1 |
明確有效的比例是 22.1%。完全沒效果的比例是 35.3%。

換算成一個更直接的數字:平均每 8.5 個實驗,才換得到一個站得住腳的發現。
這個比例對做研究的人來說不算意外。對只看過網路貼文的投資人來說,落差可能很大。你在社群上看到的成功案例,背後大概也有這樣一堆屍體,只是沒人貼出來。
真正殘忍的那一關
上面的失敗率還算溫和的。真正砍人的關卡在後面。
我們的流程裡有一道「跨樣本期驗證」:一個想法在某段歷史資料上表現不錯之後,換一段完全不同的期間,用同樣的參數再測一次。參數不准調,模型不准改,就是換資料重跑。
68 個實驗裡有 18 個走到了這一關,其中 17 個有明確的存活或陣亡判定。
結果是 8 個存活,9 個陣亡。陣亡率 52.9%。

| 階段 | 通過數 | 對照 |
|---|---|---|
| 單一樣本期看起來有效 | 17 | 100% |
| 換一個樣本期後仍有效 | 8 | 47.1% |
| 換樣本期後失效 | 9 | 52.9% |
陣亡的那九個、存活的那八個,編號逐一列在原始結果檔裡,任何人都可以自己去對。
每一個陣亡的實驗,在第一段樣本期都拿出過看起來漂亮的成績。如果我們當時停手發文,會有九篇讀起來很有說服力、但其實禁不起換期考驗的文章。
擲硬幣的存活率是 50%。我們這 17 個候選的存活率是 47.1%。
學界早就算過這筆帳
這個現象在學術界有名字,也有人算過代價。
嚴格統計、Liu 與 Zhu 在 2016 年發表於 Review of Financial Studies 的研究中,檢視了財務學文獻累積提出的數百個「能預測報酬的因子」。他們的論點是:當一整個領域在同一批歷史資料上反覆測試上百個想法,光靠傳統的顯著性門檻篩選,必然會放進大量純屬運氣的發現。
他們建議把門檻大幅拉高。我們自己的 52.9% 陣亡率,可以當成這個論點的一份小型佐證。
差別在於,他們檢視的是整個學界的公開發表結果,而發表本身就有篩選偏誤,失敗的研究通常不會出現在期刊上。我們手上這 68 筆是完整紀錄,跑完就記,沒有中途丟棄。
我們把流程改成什麼樣
發現這件事之後,我們改了三個地方。
第一,跨樣本期驗證從最後一關往前挪。過去是先把一個方向的各種變體都試過,最後才驗一次;現在核心想法一有初步結果就先換期重測。省下來的算力可觀,更重要的是省下對假發現的感情投入。
第二,同一個方向連續兩次沒效果就停手,不再繼續往下挖。
第三,每累積約 20 個實驗就做一次整體回顧。這篇文章的來源就是這種回顧,它改變研究方向的效率比再多跑十個實驗高。
順帶一提,前一次同類型回顧涵蓋 35 個實驗,當時的無效率是 48.6%;這次涵蓋 68 個,降到 35.3%。流程調整有反映在數字上。
至於通過所有關卡的東西長什麼樣:我們目前最穩的一個發現,是把恐慌指數 VIX 加進波動率模型。它在五段互相獨立的樣本期裡全部勝出,平均把預測誤差壓低 17.4%。五段全過,才叫可以拿來用。
陣亡名單裡還藏著另一個教訓。其中有三個實驗,測的都是同一件事:把一個預測得還不錯的模型,接上實際的下單規則。
三個全部失敗。模型把明天的波動猜得比對照組準,換算成部位調整、扣掉交易成本之後,績效優勢就消失了。
猜得準跟賺得到,中間隔著一道我們原本低估的距離。看到一張漂亮的預測準確度圖表時,這道距離通常沒有被畫出來。
你可以怎麼用這件事
看到別人貼回測績效時,有幾個問題值得先問出口。
這條策略在哪一段期間測的?換另外一段還成立嗎?參數是怎麼定下來的,有沒有在同一批資料上反覆調整過?測試過程中,總共試了多少個沒被貼出來的版本?
最後一個問題最關鍵,也最難得到答案。試了 100 個想法挑出最好的那個拿來炫耀,跟只試了一個就成功,看起來完全一樣,實質差很遠。
我們自己的紀錄是:試了 68 個,其中 15 個明確有效;再拿去換期重測的 17 個候選裡,活下來 8 個。
這個成績不好看。但沒有一張隱藏的成績單,是比它更好看的。
資料來源:experiments/k492/k492_research_efficiency_results.json(研究效率回顧,統計時間 2026-03-26,涵蓋連續編號的 68 筆結果檔,實驗編號逐筆列在該檔內)。文中結果分佈、無效率 35.3%、有效率 22.1%、跨樣本期存活 8 與陣亡 9、陣亡率 52.9%、平均 8.5 個實驗換一個驗證發現,均直接取自該檔。
外部參照:嚴格統計, C. R., Liu, Y., & Zhu, H. (2016). "…and the Cross-Section of Expected Returns." Review of Financial Studies, 29(1), 5–68.
免責聲明:本文為研究方法與教育用途,呈現的是我們內部研究流程的歷史統計,不構成任何投資建議。投資請自行判斷並承擔風險。
懶人包圖組


