我讓五個波動率模型跑同一場 4590 天的考試,2025 年的新模型考了最後一名
讀者互動
0 次瀏覽,登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
先看成績單,再聽故事。
我把五個預測「明天股價會晃多大」的模型放進同一條跑道,資料是 SPY 的每日收盤(來自 yfinance),期間從 2007-12-31 到 2026-03-30,一共 4590 個交易日的預測都被記分。
排在最後一名的,是 2025 年一篇論文提出的新版本。排在第一名的,是 2006 年就有的老模型。
這場考試怎麼考
每個模型每天只能用「當天以前」的資料,猜隔天的波動幅度。猜完,隔天真實數字揭曉,記一次分。
模型的參數不是一次算完就放著。初始用 500 個交易日訓練,之後每 50 天重新校準一次,訓練資料隨時間往後長。所以這 4590 天全部是模型沒見過的日子。
評分規則對「低估」特別嚴格,把明天說得比實際平靜,扣分會比說得比實際激烈更重。這對風險管理的人來說是合理的偏好:低估波動的代價,通常比高估大。
分數越低代表越準。以下是五個模型的最終成績。
| 名次 | 模型 | 出身 | 平均誤差分數 | 與冠軍差距 |
|---|---|---|---|---|
| 1 | AMEM | Engle & Gallo, 2006 | 0.4721 | — |
| 2 | GJR 不對稱模型 | 1993 年的經典設定 | 0.4836 | +2.4% |
| 3 | HAR | Corsi, 2009 | 0.5017 | +6.3% |
| 4 | 指數加權移動平均 | 教科書等級的陽春做法 | 0.5041 | +6.8% |
| 5 | HAR + 路徑特徵 | arXiv:2503.00851, 2025 | 0.5118 | +8.4% |

新模型到底加了什麼
第五名的作法很直觀:拿第三名的 HAR 當底,再餵它四個描述「市場最近走過什麼路」的欄位。
四個欄位分別是短期均線相對長期均線的方向、兩條均線的乖離幅度、過去 22 天的累積報酬,以及過去 22 天的最大回落。想法是市場剛從高點掉下來,跟市場在慢慢爬升,即使當下的波動水準一樣,隔天的行為也不該一樣。
加完之後,分數從 0.5017 變成 0.5118,退步 2.03%。
這裡要說清楚:這個 2.03% 的差距,小到跟雜訊分不開。我用標準的預測比較檢定跑過,結果沒有跨過我們自己設的門檻。誠實的說法是「這四個欄位沒幫上忙」,而不是「加了會害你」。
真正拉開距離的地方
同一份資料、同一個評分,AMEM 比 HAR 好 5.90%,GJR 好 3.61%。這兩個差距的統計強度都遠遠超過門檻,大到幾乎不可能是運氣。
換個講法:把 HAR 換成 AMEM,帶來的改善是「加四個路徑特徵」那個實驗幅度的三倍左右,而且方向相反。從最後一名的 HAR + 路徑特徵算到第一名的 AMEM,總共差 7.77%。
所以這批實驗真正的訊息,跟「該不該加特徵」關係不大。它更像在說:你先挑對模型家族,剩下的調整才有意義。
為什麼舊模型會贏
我去翻了全樣本估出來的參數,答案有點好笑。
AMEM 的對稱衝擊係數被估成 0,全部的反應權重都跑到「下跌日」那一項(0.1816)。GJR 也一樣偏心:上漲的係數 0.0101,下跌額外加的係數 0.1276,差了十二倍以上。
兩個贏家的共同點,是它們都把「跌」和「漲」當成兩件事。HAR 這一家用的是報酬的絕對值,1% 的漲跟 1% 的跌被算成同一件事。在一個下跌才會引爆恐慌的市場裡,這個簡化要付出代價。
而 2025 年那四個路徑特徵,加的是「最近走勢的形狀」,沒有補上「漲跌不對稱」這一塊。它補的東西,剛好不是模型缺的東西。
把 4590 天切成兩半
只看一個總平均容易被少數幾天綁架,所以我按當期波動水準把樣本切成兩半:波動大的 2284 天,相對平靜的 2285 天。

AMEM 在兩半都是第一(0.4602 與 0.4855),GJR 在兩半都是第二。冠亞軍沒有換人,這條排名不是某一段市況撐出來的。
有意思的是第五名。在平靜的那一半,HAR + 路徑特徵拿 0.5118,反而小勝純 HAR 的 0.5150,名次從第五爬到第三。在波動大的那一半,它掉到 0.5138,輸給純 HAR 的 0.4898,差距 4.89%。
它的總排名墊底,幾乎全部由高波動那一半貢獻。市場一激動,那四個描述近期路徑的欄位就開始把預測往錯的方向拉,而高波動的日子,正是預測誤差本來就大、最需要模型撐住的時候。
我原本猜錯了
開跑之前,我預期的順序是 HAR + 路徑特徵領先、HAR 次之、那兩個 1990 到 2000 年代的舊模型墊底。理由很單純:後來的模型看過前面的模型,資訊集也更大。
結果剛好倒過來。這件事對我的工作流程有實際影響:以後拿到一篇「在既有模型上加 N 個特徵」的論文,我會先花力氣確認底層那個模型是不是這個資料上最好的選擇,再去驗那 N 個特徵值不值得。底選錯了,特徵做得再細也是在補一個歪掉的地基。
別把結論拉得太遠
這是一個標的(SPY)、一種資料頻率(日)、一套評分規則的結果。換成台股、換成 5 分鐘資料、換成別的評分方式,排名有可能重排。
而且第一名跟第三名的差距是 5.90%,不是 59%。這不是「舊模型碾壓新模型」的故事,是同一群還算堪用的工具之間,有一個穩定但不誇張的高下之分。
如果只帶走一句:先確認你的模型有沒有把「跌」和「漲」分開處理,那件事在這份資料上的效果,大過再加四個聰明特徵。
資料來源 :yfinance SPY 日收盤,2007-12-31 至 2026-03-30,4590 個樣本外交易日。模型設定與原始結果檔見本文 frontmatter。
懶人包圖組




相關文章
先讀正式關聯,若無則使用標籤與主題相似度補齊