← 研究動態
一般讀者2026/07/22 上午04:070 次瀏覽

一個 +5.06 的漂亮勝利,只要改掉「你幾點做預測」就沒了

研究誠實波動率模型空結果預測時點前視偏誤

讀者互動

0 次瀏覽,登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

先說結論的形狀,這樣你讀下去才知道我在追什麼。

我們手上有一個波動率模型,在招牌成績單上以 DM 統計量 +5.06 贏過業界標準的 GJR 模型。統計上這叫壓倒性,一般門檻大概 2 就算過關,嚴格一點的學界標準抓 3。+5.06 是那種不用細看、直接寫進投影片第一頁的數字。

我們沒有換模型,沒有換資料,也沒有換損失函數。只改了一件聽起來像行政細節的事:規定所有預測都必須在「前一天收盤那一刻」發出。

六個市場重跑,DM 統計量落在 −0.54 到 +2.28 之間。零勝六。

「幾點做預測」為什麼會是個問題

波動率模型要預測的是「明天這一整天會震多大」。一整天可以拆兩段:晚上休市到隔天開盤的跳空,加上開盤到收盤的盤中震盪。

那個拿到 +5.06 的模型,賣點就是把這兩段分開建模。理論上很合理,隔夜和盤中的行為本來就不一樣。

問題出在它預測時手上握著什麼。原本的做法在算「今天全日波動」時,用到了今天早上已經發生的跳空幅度。等於中午才預報今天下不下雨,而你早上已經淋過了。

實務上沒有人能這樣操作。你若是每天收盤後要決定明天曝險部位的人,你在按下按鈕的當下,明天早上的跳空還不存在。

所以 K1699 把口徑釘死:預測發出的時點是 t−1 收盤,模型只能看到那一刻之前的資訊,隔夜衝擊用模型自己的期望值填補,不准回頭偷看。GJR 和 HAR 兩個對照組本來就是這樣跑的,現在三個模型站在同一條起跑線上。

六個市場,沒有一個跨得過門檻

K1699 六市場嚴格 close-time 口徑結果

上圖上半部是預測誤差分數(越低越準),下半部是 DM 統計量,兩條虛線是嚴格門檻,統計強度 3。藍柱是新模型對 GJR 的較量,六根全部縮在中間那條窄帶裡。

單獨把 DM 這一欄放大,看得更清楚:

六市場比較檢定的統計強度,全部落在嚴格門檻內

離門檻最近的那根是那斯達克的 +2.28,離 3 還有一段;其餘五個市場連 1 都沒摸到。圖上的正負只代表哪一邊損失較低,不代表誰贏 —— 六根都在門檻內,這張圖的意思就是統計上分不出勝負。

把數字攤開看:

市場隔夜佔全日變異數DM t(新模型 vs GJR)跨過嚴格門檻?
台指期 TAIFEX60.99%−0.49
黃金 GLD53.09%−0.44
新興市場 EEM52.61%−0.54
台灣 005046.15%−0.32
標普 SPY34.47%+0.74
那斯達克 QQQ27.86%+2.28

負值偏向新模型,正值偏向 GJR,絕對值要超過 3 才算真的分出高下。整張表最極端的一格是 QQQ 的 +2.28,方向還是站在老模型那邊。

樣本不算小。六個市場的樣本外交易日從台指期的 843 天到那斯達克的 1,981 天,合計九千兩百多個交易日,期間橫跨 2020 年的疫情崩盤與 2022 年的空頭,該有的極端行情都在裡面。

最該讓它發光的市場,也沒有發光

這裡是我覺得最硬的一層證據。

新模型的整套故事建立在「隔夜跳空很重要」上面。照這個邏輯,隔夜佔比越高的市場,拆時段建模的紅利應該越大。這是可以直接拿數字檢驗的預測。

台指期的隔夜佔了全日變異數的 60.99%,超過六成的波動發生在你睡覺的時候。這是六個市場裡的極端值,也是新模型的絕對主場。它拿到的 DM t 是 −0.49。

黃金 53.09%,t = −0.44。新興市場 52.61%,t = −0.54。

把六個市場的隔夜佔比從 27.86% 排到 60.99%,跨越一倍多的差距,DM 統計量卻沒有跟著爬。主場優勢在資料上看不到影子。

檢定本身是有力氣的

看到滿桌不顯著,合理的懷疑是:會不會樣本太小,這個檢定根本什麼都測不出來?

同一批資料、同一個 DM 檢定、同樣的嚴格門檻,拿去比 GJR 和 HAR,在標普上吐出 −6.88。六個市場裡有五個給出明確的顯著差距。

同一把尺,量得出 HAR 那邊的差距,量不出新模型這邊的差距。所以桌上這排接近零的數字,是「真的沒差」,而非「量不準」。

順帶一提,HAR 在這一題全面落後,並不代表它是壞工具。它只是不適合被拿來預測「全日變異數」這個特定目標。

三件我要老實講的事

第一,這批結果經得起重跑。K1699 的自動複現檢查把 537 個純量逐一比對,537 個全中,零筆不符。文章裡每個數字都能追回 experiments/k1699/k1699_results.json

第二,比賽場地有一點不平。GJR 和 HAR 每 63 個交易日重新估一次參數,新模型的重估週期是 126 到 252 天。理論上重估越頻繁越占便宜,所以老模型在這裡是稍微被優待的一方。要說死這件事完全不影響結論,我沒有那個底氣,只能說 t 值離門檻的距離遠到不像是靠重估頻率就能補回來。

第三,我只敢主張這張 DM 表的不顯著性。其他看起來像勝負的排名,在這個量級的差距上不夠穩健,我把它們留在實驗檔裡,不寫進正文當賣點。

為什麼一個 null 值得單獨寫一篇

研究線走到這裡,誠實的收尾就是一句「在嚴格的收盤時點口徑下,這個模型沒有贏」。

+5.06 那個數字沒有造假,它只是回答了一個沒人能實際操作的問題。混合時點的口徑允許模型握著一部分未來,於是它表現得像是能預測未來。

模型評比裡最容易被忽略的變數,往往不寫在方法論那一節,而是藏在「你到底幾點按下預測鍵」這種看起來只是流程設定的地方。K1699 的價值就在把那顆按鈕的時間釘死,然後接受它給出的答案。

給要拿這類研究做決策的人一句實用的話:下次看到某個模型宣稱大勝,先問它的預測是幾點發出的,以及那個時點的資訊集合裡有沒有混進當天才知道的東西。這一題問下去,很多漂亮的統計量會安靜下來。至少在這六個市場上,收盤時點要用的模型,一個老實的 GJR 就夠了。


資料來源:yfinance(SPY / QQQ / GLD / EEM / 0050.TW)、TAIFEX 逐筆 tick(台指期)。實驗代號 K1699,程式 experiments/k1699/k1699.py,結果 experiments/k1699/k1699_results.json,複現報告 experiments/k1699/reproduce_report.json(537/537 純量比對相符)。DM 檢定採 Newey-West HAC 修正,顯著門檻為統計強度 3.0,採小樣本修正後的嚴格標準(完整方法學引用見研究版)。圖檔 experiments/k1699/fig_k1699_close_convention.png

懶人包圖組

說明研究只更動預測發出的時點,模型、資料與損失函數都沒有變動

六個市場的比較檢定統計量全部落在嚴格門檻之內,統計上分不出勝負

隔夜變異數佔比從最低到最高跨越一倍以上,比較檢定統計量並未隨之上升

同一套檢定用在另一組模型比較上,給出遠超門檻的統計量,顯示檢定本身有辨識力

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
大片上映那一週,市場真的比較亢奮嗎?1,098 個週末、24 次檢定,全部落空
學術界有一條頗迷人的線索:電影票房會透露大眾情緒,而大眾情緒會流進股市。 《Review of Finance》2025 年的 Hong and Wei 就做過這件事,題目叫「Blockbuster or Bust?」。Edmans、Garcia 與 Norli 在 2007 年也用世界盃輸球檢定過類似的心情通道。方向都指向同一個猜想:人開心的時候比較敢冒險,人分心的時候比較不看盤。 我想知道...
📄
冠軍換了十六次,統計上一個都沒贏
假設你手上有 16 個波動率模型。過去七年,你每個月幫它們重排一次名次,冠軍換了 16 次。看起來像一場競爭激烈的比賽。 這次實驗把同樣這 16 個模型丟進正式的統計檢定。結果是:一個都淘汰不掉。 標的是 SPY,樣本外期間 2019-01-02 到 2026-05-20,共 1,849 個交易日。評分用的是預測誤差指標,把模型押的波動率跟當天實際發生的波動比對,差得越遠扣越多分(採 Patt...
📄
VIX 掉到 17.05、財報週安安靜靜:加碼之前,先用「換件測試」拆一次你手上那張績效表
最近這幾天的盤面很無聊。2026 年 7 月 21 日美股收盤,恐慌指數 VIX 收在 17.05,前一個交易日還有 18.65,落在系統定義的「正常」區間中段;SPY 收在 748.28 美元,當天漲 0.83%;用波動率模型算出來的下一日年化波動率預估是 12.7%(以上取自 7 月 22 日的[每日策略建議](https://volpred.zeabur.app/v3/reports/mil...