AI 圈的「時序基礎模型」搬進波動率擂台:老公式 HAR 沒被打下來
讀者互動
0 次瀏覽,登入會員可按讚與收藏。
AI 圈的「時序基礎模型」搬進波動率擂台:老公式 HAR 沒被打下來
先講結論
Google 的 TimesFM、IBM 的 TTM 是這一兩年最熱的「時序基礎模型」(time-series foundation model,簡稱 TSFM)。它們主打的賣點跟 ChatGPT 很像:不用替你的資料重新訓練,把一段歷史丟進去,它就直接吐出未來的預測。我們把這套東西搬到波動率預測,跟一個用了十幾年的老公式 HAR 放在同一張評分表上,跨美股(SPY)、台股(0050)、台指期(TX)三個市場、近十年、超過七千個逐日預測,得到三個乾淨的結果:
- 直接裸用的 TSFM 全數落後 。不做任何調整,TimesFM 和 TTM 在三個市場的預測誤差都明顯輸給 HAR。
- 簡單校準或跟 HAR 組隊之後,它們追得上、但沒有超前 。經過一道事後校準,或跟 HAR 的預測做加權組合,這些含 AI 成分的模型在統計上就跟最佳模型分不出高下了。可是每個市場、以及三市場合起來,預測誤差最低的仍舊是老牌的 HAR-A。
- 加了 AI 之後,唯一被改寫的是 SPY,方向還是「弱一點的 HAR 重新入列」,而不是 AI 把 HAR 擠掉 。
一句話:時序基礎模型不是不能用,但它在波動率上的正確用法是「校準後當隊友」,裸著上場只會拖後腿;而且就算校準好了,它也還沒有給你比 HAR 更準的預測。
我們到底測了什麼
市面上大多數「AI 打敗傳統模型」的說法,做的是一場賽馬:找一個指標,看誰的數字最小,然後宣布冠軍。這種比法有個老問題,波動率預測的評分本身帶雜訊,今天贏 0.3% 的模型,換一段樣本可能就反超回去,冠軍頭銜站不住。
我們換了一個更嚴的問法。把候選模型全部丟進一個池子:老公式這邊有 HAR、HAR-A(多了一個非對稱項,讓大跌後的波動反應更快),AI 這邊有裸用的 TimesFM、TTM,還有它們校準後的版本、以及跟 HAR 做組合的版本。接著跑一個叫「模型信心集合」的程序,問的是: 哪些模型可以被統計證據排除掉? 留在集合裡的模型,意思是「沒有足夠證據說它比最佳的差」,落選的則是「有證據判定它確實比較差」。
這個框架的好處是它誠實。留在集合裡不等於贏,只等於「還沒被淘汰」;集合裡可能同時有好幾個模型,代表以現有樣本量根本分不出它們誰高誰低。把 AI 模型丟進來,我們真正想看的是兩件事:AI 進得了這個集合嗎?原本 HAR 家族的集合,會因為 AI 的加入而變動嗎?
結果一:裸用的 AI,輸在起跑線
先看最直接的數字。評分用的是波動率預測的標準誤差分數,數字越低代表預測越準。三個市場的一步預測結果如下(誤差分數,越低越好):
| 市場 | 最佳模型 HAR-A | TimesFM 裸用 | TimesFM 校準後 |
|---|---|---|---|
| SPY(美股,n=2,519) | 0.3693 | 0.4798 | 0.3837 |
| 0050(台股,n=2,426) | 0.3581 | 0.4351 | 0.3625 |
| 台指期 TX(n=2,438) | 0.1600 | 0.1861 | 0.1654 |
裸用 TimesFM 那一欄,每個市場都比 HAR-A 高出一截。這不是四捨五入的差距,是實打實的落後。下面這張圖把三個市場、五個模型比 HAR-A 高出多少畫在一起,紅色和橘色(裸用的 TimesFM、TTM)在每一組都戳得老高,綠色和紫色(校準後、跟 HAR 組合)則貼著地板。

裸用會輸,原因不難理解。基礎模型是拿海量、五花八門的時間序列預訓練出來的通才,它沒見過「波動率」這個特定物種的脾氣。波動率有幾個很硬的結構特徵:它的水準會隨市場體制整段整段地跳、它高度持續、大跌之後會噴出。HAR 這條老公式用昨天、上週、上月的已實現波動率做加權,剛好把持續性抓得死死的。通才模型直接套上來,水準和尺度都對不準,誤差自然大。
結果二:校準能救,但只救到「追平」
有意思的地方在後半段。我們對 AI 的原始預測做了一道很輕的手術:Mincer–Zarnowitz 校準,白話說就是用一條迴歸,把它系統性高估或低估的偏誤修掉。以 SPY 為例,TimesFM 的誤差分數從裸用的 0.4798 降到校準後的 0.3837,幾乎貼平 HAR 的 0.3840;台股和台指期也是同一個走勢。跟 HAR 直接做加權組合,效果類似。
校準後的模型,能不能進「信心集合」?答案是進得去。下面這張圖把九個模型在四欄(三個市場加上跨市場合併)的存活狀況攤開,綠色是留在集合裡,灰色是被淘汰:

裸用的 TimesFM、TTM 那兩列,四欄全灰,一個都沒活。校準版和組合版則大片轉綠。這代表加了校準或組隊之後,AI 成分的模型確實躋身「統計上分不出比最佳差」的行列。
問題是,進了集合不等於贏。把三個市場按日期先平均、再跑一次跨市場的信心集合(2,344 個共同交易日),存活下來的只剩兩個模型:HAR-A(誤差分數 0.2955)和 AI+HAR 的校準組合(0.3003)。兩者並存在集合裡,意思是分不出高下;而數字最小的那個,還是純血的 HAR-A。整份實驗跑下來,沒有任何一個含 AI 的模型,在任何一個市場,拿到「顯著比 HAR 更準」的成績。
加了 AI,HAR 的地盤動了嗎
最後一個問題,是把 AI 加進池子後,原本 base 模型的信心集合會不會改變。三個市場加跨市場,總共四個場景,只有 SPY 變了:SPY 原本單獨比較時,集合裡只有 HAR-A;加入 AI 候選後,集合擴成 HAR 和 HAR-A 兩個。
值得細看的是變動的方向。集合變大,是因為比較弱的那個 HAR 重新被納入,而不是 AI 把 HAR 踢出去。換句話說,AI 候選的加入,連讓評分程序更果斷都沒做到,反而讓判斷更保守了一點點。其餘三個場景,集合原封不動。
誠實的但書
這份結果有幾個限制,講清楚才對得起讀者。
第一,這是回溯式的模擬樣本外測試,不是真正的即時預測。TimesFM 和 TTM 都是後來才發布的模型,它們預訓練吃過的資料,是否包含了評估期裡等價的歷史模式,我們沒辦法完全稽核。輸入端沒有偷看未來,但權重裡記了什麼,是個黑盒。所以這個窗口只能叫「回溯式的模擬樣本外」,不能宣稱是即時實戰。
第二,信心集合是一個「未被拒絕」的集合,不是「證明相等」的集合。集合大小會受評分方式、波動率代理、重抽樣設定影響。留在裡面,永遠只代表現有樣本量還排除不掉它,不代表它跟最佳一樣好。
第三,SPY 和 0050 用的是日 OHLC 算出來的 Garman–Klass 波動代理,只有台指期 TX 用本機 5 分鐘高頻資料算的已實現波動。跨市場的量測品質本來就不一致。
帶走三句話
- 時序基礎模型號稱免訓練即插即用,但在波動率上裸著用,三個市場全部輸給老公式 HAR。
- 一道輕校準或跟 HAR 組隊,就能讓它們追平、擠進統計上分不出高下的信心集合,可是追平不是超前,誤差最低的仍是 HAR-A。
- 「AI 一定比較強」在波動率這題上要打個問號。這批模型要派上用場,關鍵動作是先校準、再跟 HAR 這類對的老公式組隊;原封不動丟上場,只會比老方法更差。
數據與方法 :市場 SPY、0050.TW、台指期 TX,評分期間 2016-07 至 2026-07,逐資產樣本 2,426 至 2,519 筆,跨市場共同交易日 2,344 筆。波動代理方面,SPY 與 0050 用 yfinance 日 OHLC 的 Garman–Klass variance,TX 用 TAIFEX 5 分鐘已實現波動。時序基礎模型的 checkpoint 為 google/timesfm-2.5-200m-pytorch(TimesFM 2.5, 200M)與 ibm-granite/granite-timeseries-ttm-r2(TTM),context=512。評分採 Patton (2011) 提出的標準波動率誤差分數,一步預測(隔日)。模型信心集合用 Hansen–Lunde–Nason(2011)的程序,重抽樣 5,000 次,顯著水準 0.10,隨機種子固定。
延伸閱讀 :本平台先前的相關實驗已建立模型信心集合這套評分基礎設施,並多次顯示在公平資訊集下,複雜的機器學習模型通常難以顯著勝過 HAR 家族;本文把這條結論延伸到最新的基礎模型。跨市場推論則遵循「先按日期把同日多市場聚合、再做檢定」的正確做法,不把同一天的多個市場當成互相獨立的樣本。
可復現 :完整程式、結果檔與圖表都存在平台的實驗資料夾,本文所有圖表數字均由結果檔直接讀值繪製,未經二次加工。
懶人包圖組




相關文章
先讀正式關聯,若無則使用標籤與主題相似度補齊