← 研究動態
一般讀者2026/07/30 上午03:000 次瀏覽

我讓五個波動率模型跑同一場 4590 天的考試,2025 年的新模型考了最後一名

SPY波動率模型比較預測量化研究不對稱風險

讀者互動

0 次瀏覽,登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

先看成績單,再聽故事。

我把五個預測「明天股價會晃多大」的模型放進同一條跑道,資料是 SPY 的每日收盤(來自 yfinance),期間從 2007-12-31 到 2026-03-30,一共 4590 個交易日的預測都被記分。

排在最後一名的,是 2025 年一篇論文提出的新版本。排在第一名的,是 2006 年就有的老模型。

這場考試怎麼考

每個模型每天只能用「當天以前」的資料,猜隔天的波動幅度。猜完,隔天真實數字揭曉,記一次分。

模型的參數不是一次算完就放著。初始用 500 個交易日訓練,之後每 50 天重新校準一次,訓練資料隨時間往後長。所以這 4590 天全部是模型沒見過的日子。

評分規則對「低估」特別嚴格,把明天說得比實際平靜,扣分會比說得比實際激烈更重。這對風險管理的人來說是合理的偏好:低估波動的代價,通常比高估大。

分數越低代表越準。以下是五個模型的最終成績。

名次模型出身平均誤差分數與冠軍差距
1AMEMEngle & Gallo, 20060.4721
2GJR 不對稱模型1993 年的經典設定0.4836+2.4%
3HARCorsi, 20090.5017+6.3%
4指數加權移動平均教科書等級的陽春做法0.5041+6.8%
5HAR + 路徑特徵arXiv:2503.00851, 20250.5118+8.4%

五個模型在 4590 個交易日上的平均誤差分數,AMEM 最低、HAR 加路徑特徵最高

新模型到底加了什麼

第五名的作法很直觀:拿第三名的 HAR 當底,再餵它四個描述「市場最近走過什麼路」的欄位。

四個欄位分別是短期均線相對長期均線的方向、兩條均線的乖離幅度、過去 22 天的累積報酬,以及過去 22 天的最大回落。想法是市場剛從高點掉下來,跟市場在慢慢爬升,即使當下的波動水準一樣,隔天的行為也不該一樣。

加完之後,分數從 0.5017 變成 0.5118,退步 2.03%。

這裡要說清楚:這個 2.03% 的差距,小到跟雜訊分不開。我用標準的預測比較檢定跑過,結果沒有跨過我們自己設的門檻。誠實的說法是「這四個欄位沒幫上忙」,而不是「加了會害你」。

真正拉開距離的地方

同一份資料、同一個評分,AMEM 比 HAR 好 5.90%,GJR 好 3.61%。這兩個差距的統計強度都遠遠超過門檻,大到幾乎不可能是運氣。

換個講法:把 HAR 換成 AMEM,帶來的改善是「加四個路徑特徵」那個實驗幅度的三倍左右,而且方向相反。從最後一名的 HAR + 路徑特徵算到第一名的 AMEM,總共差 7.77%。

所以這批實驗真正的訊息,跟「該不該加特徵」關係不大。它更像在說:你先挑對模型家族,剩下的調整才有意義。

為什麼舊模型會贏

我去翻了全樣本估出來的參數,答案有點好笑。

AMEM 的對稱衝擊係數被估成 0,全部的反應權重都跑到「下跌日」那一項(0.1816)。GJR 也一樣偏心:上漲的係數 0.0101,下跌額外加的係數 0.1276,差了十二倍以上。

兩個贏家的共同點,是它們都把「跌」和「漲」當成兩件事。HAR 這一家用的是報酬的絕對值,1% 的漲跟 1% 的跌被算成同一件事。在一個下跌才會引爆恐慌的市場裡,這個簡化要付出代價。

而 2025 年那四個路徑特徵,加的是「最近走勢的形狀」,沒有補上「漲跌不對稱」這一塊。它補的東西,剛好不是模型缺的東西。

把 4590 天切成兩半

只看一個總平均容易被少數幾天綁架,所以我按當期波動水準把樣本切成兩半:波動大的 2284 天,相對平靜的 2285 天。

把樣本按波動高低切成兩半後的分數,AMEM 在兩半都是第一,HAR 加路徑特徵在平靜段排名往前跳

AMEM 在兩半都是第一(0.4602 與 0.4855),GJR 在兩半都是第二。冠亞軍沒有換人,這條排名不是某一段市況撐出來的。

有意思的是第五名。在平靜的那一半,HAR + 路徑特徵拿 0.5118,反而小勝純 HAR 的 0.5150,名次從第五爬到第三。在波動大的那一半,它掉到 0.5138,輸給純 HAR 的 0.4898,差距 4.89%。

它的總排名墊底,幾乎全部由高波動那一半貢獻。市場一激動,那四個描述近期路徑的欄位就開始把預測往錯的方向拉,而高波動的日子,正是預測誤差本來就大、最需要模型撐住的時候。

我原本猜錯了

開跑之前,我預期的順序是 HAR + 路徑特徵領先、HAR 次之、那兩個 1990 到 2000 年代的舊模型墊底。理由很單純:後來的模型看過前面的模型,資訊集也更大。

結果剛好倒過來。這件事對我的工作流程有實際影響:以後拿到一篇「在既有模型上加 N 個特徵」的論文,我會先花力氣確認底層那個模型是不是這個資料上最好的選擇,再去驗那 N 個特徵值不值得。底選錯了,特徵做得再細也是在補一個歪掉的地基。

別把結論拉得太遠

這是一個標的(SPY)、一種資料頻率(日)、一套評分規則的結果。換成台股、換成 5 分鐘資料、換成別的評分方式,排名有可能重排。

而且第一名跟第三名的差距是 5.90%,不是 59%。這不是「舊模型碾壓新模型」的故事,是同一群還算堪用的工具之間,有一個穩定但不誇張的高下之分。

如果只帶走一句:先確認你的模型有沒有把「跌」和「漲」分開處理,那件事在這份資料上的效果,大過再加四個聰明特徵。

 資料來源 :yfinance SPY 日收盤,2007-12-31 至 2026-03-30,4590 個樣本外交易日。模型設定與原始結果檔見本文 frontmatter。

懶人包圖組

問題面板:五個預測隔天股價波動幅度的模型,跑同一份美股大盤指數股票型基金的日收盤資料、同一套評分規則。每個模型每天只能用當天以前的資料作答,參數隨時間定期重新校準,因此記分的每一天都是模型沒見過的日子。面板列出樣本外評分天數與資料期間兩個數字。

方法面板:最新那個版本的作法,是拿既有的日內波動迴歸模型當底本,再多餵四個描述市場最近走過什麼路的欄位,包含短期均線相對長期均線的方向、兩條均線的乖離幅度、過去一個月的累積報酬,以及過去一個月的最大回落。面板並列底本的分數、加上四個欄位之後的分數,以及兩者的退步幅度,並註明這個差距在統計上分不出勝負。

結果面板:全期成績單上分數最低(最準)的兩名,都是把下跌和上漲分開處理的舊模型;底本加了四個新欄位的版本反而全期墊底。面板同時列出把樣本按當期波動高低切成兩半之後,波動大的那一半裡新版本的分數,顯示它的墊底幾乎全部來自激動的市況;平靜的那一半它反而小勝底本。贏過底本的那兩個舊模型,統計強度遠超門檻。

帶走一句面板:翻全樣本估出來的參數可以看到,冠軍模型分配給「漲跌一視同仁」那一項的權重被估成零,反應全部集中在下跌那一項;亞軍模型也一樣偏心,下跌額外加的係數遠大於上漲的係數。兩個贏家的共同點是把跌和漲當成兩件事,而新加的四個欄位補的是最近走勢的形狀,剛好不是模型缺的那一塊。面板也提醒這是單一標的、單一資料頻率、單一評分規則的結果。

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
我幫波動預測模型多裝了兩個零件,跑完 4090 天:它追平冠軍,就是超不過去
# 我幫波動預測模型多裝了兩個零件,跑完 4090 天:它追平冠軍,就是超不過去 賣選擇權的人每天早上要回答一個很窄的問題:今天這檔標的大概會晃多大。 晃得比預估的大,賣出去的保險會賠;晃得比預估的小,買進來的保險就白花錢。保證金、避險頻率、部位大小,整條估值鏈往下走全都掛在這個數字上。 回答這個問題最老的一套工具已經三十幾歲。它的規則短到一句話講得完:今天的震盪幅度看昨天的震盪幅度推,而且...
📄
經濟學家吵得越兇,市場越危險?資料給的答案是反的,而且連反的都站不住
# 經濟學家吵得越兇,市場越危險?資料給的答案是反的,而且連反的都站不住 有個直覺聽起來幾乎不用驗證。 當專業預測者對明年的經濟看法分歧很大,有人說軟著陸,有人說衰退,喊出來的數字差一大截,那代表前景不明朗。前景不明朗,市場應該會比較不安分。 反過來,當大家的預測擠成一團,代表局勢清楚,市場應該相對平靜。 這個直覺很好,好到值得拿資料打一次。因為「分歧」這件事,剛好有人幫我們量了六十年。 ...
📄
同一批預測,換一把尺量,冠軍就換人——我們撤回了自己兩個結論
# 同一批預測,換一把尺量,冠軍就換人,我們撤回了自己兩個結論 市場的波動有記憶。這件事講了三十年:今天劇烈震盪,效應不會隔天就散掉,會拖上好幾個月,慢慢淡出。畫成圖就是一條衰減得異常慢的尾巴。 但這條尾巴有兩種讀法。 一種是它真的有記憶,波動本身帶著某種長程結構。另一種比較掃興:市場其實沒什麼記憶,只是它的「正常水位」偶爾會整段跳一次。金融海嘯跳一次、疫情跳一次、升息循環又跳一次。你把幾段...