← 研究動態
一般讀者2026/06/05 下午06:0735 次瀏覽

更正:拿掉疫情後,複雜模型的優勢沒有消失

COVID波動率模型比較美股研究誠實

讀者互動

35 次瀏覽,登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

更正:拿掉疫情後,複雜模型的優勢沒有消失

 更正說明(2026-07-15) :這篇文章的舊版結論是錯的。舊計算把預測損失公式的 分子分母放反,統計比較漏掉時間相依性,也讓同一模型在估計與預測時用了不一致的尺度。 我們已用固定、無重複日期的資料重新估計全部 1,854 個樣本外預測。新結果推翻舊文所稱 「拿掉疫情後,複雜模型仍未翻身」。下文已完整改寫,保留這段更正而不掩蓋錯誤。

[提出: Codex, 執行: Codex]

想像你拿一把刻度印反的尺量桌子。讀數看似精確,甚至可以算到小數點後三位,但「精確」 沒有意義,因為尺本身錯了。這次的模型比較就是同一種問題:不是多跑一次就好,而是要先把 尺修正,再從原始預測一路重算。

修正後的答案很清楚:把 2020 年 3 月到 2021 年 6 月這段廣義疫情窗口拿掉,會參考前一天 恐慌指標的模型,預測損失仍比傳統模型低約 4.9%,而且差異通過嚴格統計檢驗。它的優勢並 不是靠疫情那一段歷史撐起來。

這次到底在比什麼

兩個模型都在猜「明天市場會有多大波動」,不是猜股價漲跌,也不是比較投資報酬。

傳統模型主要看過去的價格震盪;較複雜的模型還會讀取前一天的 VIX。可以把 VIX 想成市場 每天更新的恐懼溫度計:它不只記錄價格剛剛震了多大,也濃縮了選擇權市場對未來風險的定價。

每一天的預測都只能使用前一天已知的報酬與 VIX,再拿隔天實際發生的平方報酬評分。分數越 低越好。整個樣本外期間從 2019-01-02 到 2026-05-18,共有 1,854 個預測日;扣除兩個平方 報酬接近零、無法安全計分的日期後,兩個模型在完全相同的 1,852 天上比較。

五段資料給出的答案

評分區間有效天數恐慌指標模型傳統模型前者損失降低嚴格檢驗
全期間1,8521.4001.4805.4%通過(強度 4.37)
疫情前2921.5081.5774.4%未過嚴格門檻(2.64)
廣義疫情窗口3371.3621.4747.6%未達顯著(1.34)
疫情後1,2231.3841.4585.0%通過(強度 4.92)
排除疫情窗口1,5151.4081.4814.9%通過(強度 5.60)

最重要的是最後一列。拿掉廣義疫情窗口後,差距沒有消失,統計證據反而更穩。舊文把這一列 寫成「複雜模型沒有翻身」,如今必須明確撤回。

另一個反直覺細節是:COVID 那一列的平均差距最大,卻沒有通過檢驗。原因不是數字互相矛盾, 而是疫情期間每天的誤差差異也特別劇烈。平均領先很多,不等於我們能可靠地排除「只是高噪音 下的偶然」。相反地,疫情後的平均改善只有約 5.0%,但 1,223 天累積出的證據更穩定。

這正是為什麼不能只看柱子長短。效果有多大,和效果有多可靠,是兩個問題。

為什麼疫情外仍可能有幫助

一個合理但尚未被因果識別的解釋是:VIX 不只是危機警報器。即使市場沒有崩盤,選擇權價格 仍持續反映避險需求、事件風險與風險承擔意願。把這個每天變動的市場狀態放進波動模型,可能 比單看歷史報酬多一層資訊。

不過,這次實驗只能說「使用前一天 VIX 的模型在這段固定樣本裡預測損失較低」,不能說 VIX 造成了改善,也不能直接推導成可交易策略。波動預測較準,和扣除成本後能否賺錢,仍是兩件事。

舊版為什麼會得出相反答案

這次不是一般的數字更新,而是四個方法問題疊在一起:

  1. 預測損失本應以「實際值除以預測值」計算,舊版卻反過來。
  2. 舊統計程式在一天期預測時,沒有真正處理連續日期之間的相依性。
  3. 恐慌指標模型在估計與樣本外預測時,對同一個當日尺度用了不同時點。
  4. 舊資料檔後來出現重複日期,卻沒有內容雜湊與唯一日期檢查來阻止漂移。

新版把資料內容鎖定,固定分析終點,並要求每次最佳化、每一筆預測、每一個輸出檔都通過完整 檢查才落盤。五段結果全部從新產生的逐日損失重新計算,沒有沿用另一個實驗的數字。

讀者真正可以帶走什麼

第一,看到「某模型只在危機有用」或「某模型全靠危機撐場」時,最好的檢查不是爭辯,而是把 危機窗口拿掉後,用相同預測、相同評分規則重算。這次重算後,優勢仍在。

第二,平均差距和統計可靠度要分開看。COVID 段的平均改善最大,卻最不穩;疫情後的改善較小, 反而最可靠。只挑最好看的百分比,很容易寫出過度自信的故事。

第三,更正研究結果不能只在角落補一句。只要公式、資料或推論方法改變了結論,公開文章、圖表 和知識紀錄就都應同步修正。保留更正軌跡,比假裝舊版沒有存在過更重要。

局限

這仍是 SPY 的單一資料版本、單一模型對與一個預先指定的廣義疫情窗口。實際波動看不見,我們 用每日平方報酬做代理,因此單日噪音很高。排除疫情也只發生在最後評分:疫情後重新估計模型時, 過去的疫情資料仍可能留在 2,000 日滾動視窗裡。所以這不是「假設疫情從未發生」的反事實實驗。

懶人包圖組

第一張圖顯示 63 日平均損失差。0 以下代表恐慌指標模型的平均預測損失較低;粉紅底是本次排除 的廣義疫情窗口。曲線不是每天都在同一邊,但多數較長區段落在 0 以下。

修正後的 63 日平均相對預測損失

第二張圖列出五段平均差。每根柱子都在 0 以下,代表點估計方向一致;是否可靠仍須搭配上表的 嚴格檢驗,不應只看柱高。

修正後五個評分區間的平均預測損失差

資料來源與重現

  • 本文所有數字只來自修正後的 experiments/k1378/k1378_results.json
  • 計算入口:experiments/k1378/k1378.py;圖表入口:experiments/k1378/k1378_plot.py
  • 資料來源:獨立下載並鎖定內容雜湊的 SPY 與 VIX 日資料快照;分析期至 2026-05-18。
  • 方法脈絡可參考 experiments/k1379/;Paper 9 的不同窄疫情窗口則由 experiments/k1393/ 維持。兩者沒有提供本文數字,也沒有被移植進本次結果。

一句話帶走:拿掉疫情後,恐慌指標模型的優勢沒有消失;真正被拿掉的,是舊計算錯誤造成的 相反故事。

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
市場走得很毛躁,不代表複雜模型比較準:1,097 次隔日預測的教訓
# 市場走得很毛躁,不代表複雜模型比較準:1,097 次隔日預測的教訓 [提出:用戶;實驗與一般讀者改寫:Codex] 一條山路可以很顛簸,但避震器零件越多,不一定坐得越穩。市場波動也有類似情況:路徑看起來急促反轉,確實帶有研究者所說的「粗糙」特徵;這個特徵卻不保證更複雜的模型能把明天猜得更準。 K1386 用 SPY 當預測目標,並加入 QQQ 與黃金 ETF GLD 的歷史資訊。清理資料...
📄
冠軍換了十六次,統計上一個都沒贏
假設你手上有 16 個波動率模型。過去七年,你每個月幫它們重排一次名次,冠軍換了 16 次。看起來像一場競爭激烈的比賽。 這次實驗把同樣這 16 個模型丟進正式的統計檢定。結果是:一個都淘汰不掉。 標的是 SPY,樣本外期間 2019-01-02 到 2026-05-20,共 1,849 個交易日。評分用的是預測誤差指標,把模型押的波動率跟當天實際發生的波動比對,差得越遠扣越多分(採 Patt...
📄
季末 ETF 大調倉那幾天,成交量跳起來了,股價卻比平常安靜
每年三月、六月、九月、十二月的最後幾個交易日,美股大型 ETF 的成交量會出現一個小凸起。這不是市場情緒,是基金公司在做帳。 我原本以為這幾天股價會比平常晃得更凶。跑完十二年多的日資料以後,結論跟我猜的相反。 ## 先講季末那幾天,ETF 到底在忙什麼 一般人買 ETF 是在市場上跟別人交易。但 ETF 本身要增減規模的時候,走的是另一條路:跟少數幾家大券商用「一籃子股票」換 ETF 份額,...