← 研究動態
一般讀者2026/07/22 上午08:070 次瀏覽

換一個樣本期,一半的策略當場死掉:我們公開自己 68 個實驗的成績單

回測研究方法樣本外驗證過度配適自我揭露

讀者互動

0 次瀏覽,登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

換一個樣本期,一半的策略當場死掉:我們公開自己 68 個實驗的成績單

網路上流傳的策略回測圖,幾乎沒有一張是難看的。

原因很簡單。難看的那些,作者自己就先刪掉了。

我們做的是波動率預測研究,測試了幾百個想法。這篇文章要做的事情不太尋常:把我們自己的失敗率完整攤開來,包括那些跑完只能寫下「沒用」兩個字的實驗。

68 次嘗試,15 次真的有效

2026 年 3 月,我們把連續編號的 68 個實驗全部重新分類統計。這 68 個實驗每一個都是認真的嘗試:某個指標能不能預測波動、某個模型改良有沒有用、某個訊號能不能拿來下單。

分類完的成績單長這樣。

結果類型白話說明實驗數
null完全沒效果24
informative沒賺到錢,但學到市場的某個性質21
positive明確有效15
partial部分條件下有效6
meta回顧整理1
correction更正先前的錯誤1

明確有效的比例是 22.1%。完全沒效果的比例是 35.3%。

68 個實驗的結果分佈,沒效果佔 35.3%、明確有效佔 22.1%

換算成一個更直接的數字:平均每 8.5 個實驗,才換得到一個站得住腳的發現。

這個比例對做研究的人來說不算意外。對只看過網路貼文的投資人來說,落差可能很大。你在社群上看到的成功案例,背後大概也有這樣一堆屍體,只是沒人貼出來。

真正殘忍的那一關

上面的失敗率還算溫和的。真正砍人的關卡在後面。

我們的流程裡有一道「跨樣本期驗證」:一個想法在某段歷史資料上表現不錯之後,換一段完全不同的期間,用同樣的參數再測一次。參數不准調,模型不准改,就是換資料重跑。

68 個實驗裡有 18 個走到了這一關,其中 17 個有明確的存活或陣亡判定。

結果是 8 個存活,9 個陣亡。陣亡率 52.9%。

單期看起來有效的 17 個候選,換一個樣本期重測後只有 8 個存活

階段通過數對照
單一樣本期看起來有效17100%
換一個樣本期後仍有效847.1%
換樣本期後失效952.9%

陣亡的那九個、存活的那八個,編號逐一列在原始結果檔裡,任何人都可以自己去對。

每一個陣亡的實驗,在第一段樣本期都拿出過看起來漂亮的成績。如果我們當時停手發文,會有九篇讀起來很有說服力、但其實禁不起換期考驗的文章。

擲硬幣的存活率是 50%。我們這 17 個候選的存活率是 47.1%。

學界早就算過這筆帳

這個現象在學術界有名字,也有人算過代價。

嚴格統計、Liu 與 Zhu 在 2016 年發表於 Review of Financial Studies 的研究中,檢視了財務學文獻累積提出的數百個「能預測報酬的因子」。他們的論點是:當一整個領域在同一批歷史資料上反覆測試上百個想法,光靠傳統的顯著性門檻篩選,必然會放進大量純屬運氣的發現。

他們建議把門檻大幅拉高。我們自己的 52.9% 陣亡率,可以當成這個論點的一份小型佐證。

差別在於,他們檢視的是整個學界的公開發表結果,而發表本身就有篩選偏誤,失敗的研究通常不會出現在期刊上。我們手上這 68 筆是完整紀錄,跑完就記,沒有中途丟棄。

我們把流程改成什麼樣

發現這件事之後,我們改了三個地方。

第一,跨樣本期驗證從最後一關往前挪。過去是先把一個方向的各種變體都試過,最後才驗一次;現在核心想法一有初步結果就先換期重測。省下來的算力可觀,更重要的是省下對假發現的感情投入。

第二,同一個方向連續兩次沒效果就停手,不再繼續往下挖。

第三,每累積約 20 個實驗就做一次整體回顧。這篇文章的來源就是這種回顧,它改變研究方向的效率比再多跑十個實驗高。

順帶一提,前一次同類型回顧涵蓋 35 個實驗,當時的無效率是 48.6%;這次涵蓋 68 個,降到 35.3%。流程調整有反映在數字上。

至於通過所有關卡的東西長什麼樣:我們目前最穩的一個發現,是把恐慌指數 VIX 加進波動率模型。它在五段互相獨立的樣本期裡全部勝出,平均把預測誤差壓低 17.4%。五段全過,才叫可以拿來用。

陣亡名單裡還藏著另一個教訓。其中有三個實驗,測的都是同一件事:把一個預測得還不錯的模型,接上實際的下單規則。

三個全部失敗。模型把明天的波動猜得比對照組準,換算成部位調整、扣掉交易成本之後,績效優勢就消失了。

猜得準跟賺得到,中間隔著一道我們原本低估的距離。看到一張漂亮的預測準確度圖表時,這道距離通常沒有被畫出來。

你可以怎麼用這件事

看到別人貼回測績效時,有幾個問題值得先問出口。

這條策略在哪一段期間測的?換另外一段還成立嗎?參數是怎麼定下來的,有沒有在同一批資料上反覆調整過?測試過程中,總共試了多少個沒被貼出來的版本?

最後一個問題最關鍵,也最難得到答案。試了 100 個想法挑出最好的那個拿來炫耀,跟只試了一個就成功,看起來完全一樣,實質差很遠。

我們自己的紀錄是:試了 68 個,其中 15 個明確有效;再拿去換期重測的 17 個候選裡,活下來 8 個。

這個成績不好看。但沒有一張隱藏的成績單,是比它更好看的。


資料來源:experiments/k492/k492_research_efficiency_results.json(研究效率回顧,統計時間 2026-03-26,涵蓋連續編號的 68 筆結果檔,實驗編號逐筆列在該檔內)。文中結果分佈、無效率 35.3%、有效率 22.1%、跨樣本期存活 8 與陣亡 9、陣亡率 52.9%、平均 8.5 個實驗換一個驗證發現,均直接取自該檔。

外部參照:嚴格統計, C. R., Liu, Y., & Zhu, H. (2016). "…and the Cross-Section of Expected Returns." Review of Financial Studies, 29(1), 5–68.

免責聲明:本文為研究方法與教育用途,呈現的是我們內部研究流程的歷史統計,不構成任何投資建議。投資請自行判斷並承擔風險。

懶人包圖組

概念說明:單期回測有效與跨樣本期仍有效是兩件事

實驗結果分佈:完全沒效果、明確有效的比例,以及平均幾個實驗換一個驗證發現

走到跨樣本期驗證的實驗中,超過一半在換樣本期後失效

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
VIX 掉到 17.05、財報週安安靜靜:加碼之前,先用「換件測試」拆一次你手上那張績效表
最近這幾天的盤面很無聊。2026 年 7 月 21 日美股收盤,恐慌指數 VIX 收在 17.05,前一個交易日還有 18.65,落在系統定義的「正常」區間中段;SPY 收在 748.28 美元,當天漲 0.83%;用波動率模型算出來的下一日年化波動率預估是 12.7%(以上取自 7 月 22 日的[每日策略建議](https://volpred.zeabur.app/v3/reports/mil...
📄
一個 +5.06 的漂亮勝利,只要改掉「你幾點做預測」就沒了
先說結論的形狀,這樣你讀下去才知道我在追什麼。 我們手上有一個波動率模型,在招牌成績單上以 DM 統計量 +5.06 贏過業界標準的 GJR 模型。統計上這叫壓倒性,一般門檻大概 2 就算過關,嚴格一點的學界標準抓 3。+5.06 是那種不用細看、直接寫進投影片第一頁的數字。 我們沒有換模型,沒有換資料,也沒有換損失函數。只改了一件聽起來像行政細節的事:規定所有預測都必須在「前一天收盤那一刻」...
📄
恐慌指數該多久看一次?一週一次,而且只在兩種時候看
# 恐慌指數該多久看一次?一週一次,而且只在兩種時候看 很多人把恐慌指數(VIX)的報價釘在螢幕角落,一天瞄個八次。這個習慣值多少錢,可以量出來。 我們拿美股大盤指數基金 SPY 從 2016 到 2025 的十年資料(來源 yfinance),問了兩個很土的問題:把恐慌指數加進來以後,對未來震盪幅度的預測會變準多少?在哪些狀況下會變準? 答案分成兩半。一半是好消息,另一半比較難看。 先講...