← 研究動態
一般讀者2026/07/27 下午02:000 次瀏覽

AI 圈的「時序基礎模型」搬進波動率擂台:老公式 HAR 沒被打下來

讀者互動

0 次瀏覽,登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

AI 圈的「時序基礎模型」搬進波動率擂台:老公式 HAR 沒被打下來

先講結論

Google 的 TimesFM、IBM 的 TTM 是這一兩年最熱的「時序基礎模型」(time-series foundation model,簡稱 TSFM)。它們主打的賣點跟 ChatGPT 很像:不用替你的資料重新訓練,把一段歷史丟進去,它就直接吐出未來的預測。我們把這套東西搬到波動率預測,跟一個用了十幾年的老公式 HAR 放在同一張評分表上,跨美股(SPY)、台股(0050)、台指期(TX)三個市場、近十年、超過七千個逐日預測,得到三個乾淨的結果:

  1.  直接裸用的 TSFM 全數落後 。不做任何調整,TimesFM 和 TTM 在三個市場的預測誤差都明顯輸給 HAR。
  2.  簡單校準或跟 HAR 組隊之後,它們追得上、但沒有超前 。經過一道事後校準,或跟 HAR 的預測做加權組合,這些含 AI 成分的模型在統計上就跟最佳模型分不出高下了。可是每個市場、以及三市場合起來,預測誤差最低的仍舊是老牌的 HAR-A。
  3.  加了 AI 之後,唯一被改寫的是 SPY,方向還是「弱一點的 HAR 重新入列」,而不是 AI 把 HAR 擠掉 。

一句話:時序基礎模型不是不能用,但它在波動率上的正確用法是「校準後當隊友」,裸著上場只會拖後腿;而且就算校準好了,它也還沒有給你比 HAR 更準的預測。

我們到底測了什麼

市面上大多數「AI 打敗傳統模型」的說法,做的是一場賽馬:找一個指標,看誰的數字最小,然後宣布冠軍。這種比法有個老問題,波動率預測的評分本身帶雜訊,今天贏 0.3% 的模型,換一段樣本可能就反超回去,冠軍頭銜站不住。

我們換了一個更嚴的問法。把候選模型全部丟進一個池子:老公式這邊有 HAR、HAR-A(多了一個非對稱項,讓大跌後的波動反應更快),AI 這邊有裸用的 TimesFM、TTM,還有它們校準後的版本、以及跟 HAR 做組合的版本。接著跑一個叫「模型信心集合」的程序,問的是: 哪些模型可以被統計證據排除掉?  留在集合裡的模型,意思是「沒有足夠證據說它比最佳的差」,落選的則是「有證據判定它確實比較差」。

這個框架的好處是它誠實。留在集合裡不等於贏,只等於「還沒被淘汰」;集合裡可能同時有好幾個模型,代表以現有樣本量根本分不出它們誰高誰低。把 AI 模型丟進來,我們真正想看的是兩件事:AI 進得了這個集合嗎?原本 HAR 家族的集合,會因為 AI 的加入而變動嗎?

結果一:裸用的 AI,輸在起跑線

先看最直接的數字。評分用的是波動率預測的標準誤差分數,數字越低代表預測越準。三個市場的一步預測結果如下(誤差分數,越低越好):

市場最佳模型 HAR-ATimesFM 裸用TimesFM 校準後
SPY(美股,n=2,519)0.36930.47980.3837
0050(台股,n=2,426)0.35810.43510.3625
台指期 TX(n=2,438)0.16000.18610.1654

裸用 TimesFM 那一欄,每個市場都比 HAR-A 高出一截。這不是四捨五入的差距,是實打實的落後。下面這張圖把三個市場、五個模型比 HAR-A 高出多少畫在一起,紅色和橘色(裸用的 TimesFM、TTM)在每一組都戳得老高,綠色和紫色(校準後、跟 HAR 組合)則貼著地板。

各模型誤差分數比最佳模型 HAR-A 高多少

裸用會輸,原因不難理解。基礎模型是拿海量、五花八門的時間序列預訓練出來的通才,它沒見過「波動率」這個特定物種的脾氣。波動率有幾個很硬的結構特徵:它的水準會隨市場體制整段整段地跳、它高度持續、大跌之後會噴出。HAR 這條老公式用昨天、上週、上月的已實現波動率做加權,剛好把持續性抓得死死的。通才模型直接套上來,水準和尺度都對不準,誤差自然大。

結果二:校準能救,但只救到「追平」

有意思的地方在後半段。我們對 AI 的原始預測做了一道很輕的手術:Mincer–Zarnowitz 校準,白話說就是用一條迴歸,把它系統性高估或低估的偏誤修掉。以 SPY 為例,TimesFM 的誤差分數從裸用的 0.4798 降到校準後的 0.3837,幾乎貼平 HAR 的 0.3840;台股和台指期也是同一個走勢。跟 HAR 直接做加權組合,效果類似。

校準後的模型,能不能進「信心集合」?答案是進得去。下面這張圖把九個模型在四欄(三個市場加上跨市場合併)的存活狀況攤開,綠色是留在集合裡,灰色是被淘汰:

哪些模型進了信心集合

裸用的 TimesFM、TTM 那兩列,四欄全灰,一個都沒活。校準版和組合版則大片轉綠。這代表加了校準或組隊之後,AI 成分的模型確實躋身「統計上分不出比最佳差」的行列。

問題是,進了集合不等於贏。把三個市場按日期先平均、再跑一次跨市場的信心集合(2,344 個共同交易日),存活下來的只剩兩個模型:HAR-A(誤差分數 0.2955)和 AI+HAR 的校準組合(0.3003)。兩者並存在集合裡,意思是分不出高下;而數字最小的那個,還是純血的 HAR-A。整份實驗跑下來,沒有任何一個含 AI 的模型,在任何一個市場,拿到「顯著比 HAR 更準」的成績。

加了 AI,HAR 的地盤動了嗎

最後一個問題,是把 AI 加進池子後,原本 base 模型的信心集合會不會改變。三個市場加跨市場,總共四個場景,只有 SPY 變了:SPY 原本單獨比較時,集合裡只有 HAR-A;加入 AI 候選後,集合擴成 HAR 和 HAR-A 兩個。

值得細看的是變動的方向。集合變大,是因為比較弱的那個 HAR 重新被納入,而不是 AI 把 HAR 踢出去。換句話說,AI 候選的加入,連讓評分程序更果斷都沒做到,反而讓判斷更保守了一點點。其餘三個場景,集合原封不動。

誠實的但書

這份結果有幾個限制,講清楚才對得起讀者。

第一,這是回溯式的模擬樣本外測試,不是真正的即時預測。TimesFM 和 TTM 都是後來才發布的模型,它們預訓練吃過的資料,是否包含了評估期裡等價的歷史模式,我們沒辦法完全稽核。輸入端沒有偷看未來,但權重裡記了什麼,是個黑盒。所以這個窗口只能叫「回溯式的模擬樣本外」,不能宣稱是即時實戰。

第二,信心集合是一個「未被拒絕」的集合,不是「證明相等」的集合。集合大小會受評分方式、波動率代理、重抽樣設定影響。留在裡面,永遠只代表現有樣本量還排除不掉它,不代表它跟最佳一樣好。

第三,SPY 和 0050 用的是日 OHLC 算出來的 Garman–Klass 波動代理,只有台指期 TX 用本機 5 分鐘高頻資料算的已實現波動。跨市場的量測品質本來就不一致。

帶走三句話

  • 時序基礎模型號稱免訓練即插即用,但在波動率上裸著用,三個市場全部輸給老公式 HAR。
  • 一道輕校準或跟 HAR 組隊,就能讓它們追平、擠進統計上分不出高下的信心集合,可是追平不是超前,誤差最低的仍是 HAR-A。
  • 「AI 一定比較強」在波動率這題上要打個問號。這批模型要派上用場,關鍵動作是先校準、再跟 HAR 這類對的老公式組隊;原封不動丟上場,只會比老方法更差。

 數據與方法 :市場 SPY、0050.TW、台指期 TX,評分期間 2016-07 至 2026-07,逐資產樣本 2,426 至 2,519 筆,跨市場共同交易日 2,344 筆。波動代理方面,SPY 與 0050 用 yfinance 日 OHLC 的 Garman–Klass variance,TX 用 TAIFEX 5 分鐘已實現波動。時序基礎模型的 checkpoint 為 google/timesfm-2.5-200m-pytorch(TimesFM 2.5, 200M)與 ibm-granite/granite-timeseries-ttm-r2(TTM),context=512。評分採 Patton (2011) 提出的標準波動率誤差分數,一步預測(隔日)。模型信心集合用 Hansen–Lunde–Nason(2011)的程序,重抽樣 5,000 次,顯著水準 0.10,隨機種子固定。

 延伸閱讀 :本平台先前的相關實驗已建立模型信心集合這套評分基礎設施,並多次顯示在公平資訊集下,複雜的機器學習模型通常難以顯著勝過 HAR 家族;本文把這條結論延伸到最新的基礎模型。跨市場推論則遵循「先按日期把同日多市場聚合、再做檢定」的正確做法,不把同一天的多個市場當成互相獨立的樣本。

 可復現 :完整程式、結果檔與圖表都存在平台的實驗資料夾,本文所有圖表數字均由結果檔直接讀值繪製,未經二次加工。

懶人包圖組

把時序基礎模型和老公式 HAR 放進同一個候選池,問誰會被統計程序淘汰

老公式 HAR 對上 AI 模型的裸用、校準與組合版,用 QLIKE 和信心集合評分

SPY 上 TimesFM 裸用明顯落後,校準後幾乎追平 HAR,最佳仍是 HAR-A

三市場合併後信心集合只剩 HAR-A 和 AI 加 HAR 組合,最低誤差仍是 HAR-A

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
AI 資料中心改用借的蓋:四巨頭一年多背了 1772 億美元債
BlackRock 正在為 Meta 在德州艾爾帕索的資料中心主導一筆規模至少 120 億美元的債務融資。 這則消息裡,120 億這個數字最不重要。重要的是它的形式:一筆**債**。 過去十年,超大型科技公司蓋機房花的是自己賺來的錢。廣告費、雲端訂閱、軟體授權進來,扣掉營運成本,剩下的拿去買地買電買晶片。買完還有剩,剩的拿去買回自家股票。 這個模式在最近四個季度出現了明顯的變化。而變化的位置...
📄
後天就開會:市場最愛的幾個「Fed 波動率前哨」,哪些是真哨兵、哪些只是安慰劑
星期三(7 月 29 日)聯準會就要拍板利率,距離現在剩兩個交易日。每逢這種時刻,各種「Fed 前哨波動率指標」會被重新翻出來:有人盯著信用債 ETF 的壓力、有人盯著 MOVE(債市恐慌指數)、有人盯著對沖基金在國債期貨的擁擠度,甚至有人數起監管機關每天發幾份文件。講法都很動聽:只要某個東西先亮燈,就能在會議前替你預告接下來的震盪,讓你提早避險。 問題是,這些前哨裡面,哪幾個真能提前示警,哪幾...
📄
科技股的恐懼溢價「創22年新高」?我把 CBOE 的原始數字翻出來,故事沒那麼嚇人
最近有一句話在財經圈傳得很開:科技股的「恐懼指數」相對大盤,已經衝到網路泡沫破裂以來最高。 聽起來像是要出事了。 我沒有反駁的意思,因為這句話字面上是對的。 但一個數字被講成標題之後,通常會掉兩塊東西。一是它到底站在歷史的哪個位置,二是它跟股價真正在做的事到底合不合。這兩塊,剛好是這篇要補回來的。 我把 CBOE 兩個指數的每日收盤,從 2001 年一路拉到 2026 年 7 月 24 日...