同一批預測,換一把尺量,冠軍就換人——我們撤回了自己兩個結論
讀者互動
0 次瀏覽,登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
同一批預測,換一把尺量,冠軍就換人,我們撤回了自己兩個結論
市場的波動有記憶。這件事講了三十年:今天劇烈震盪,效應不會隔天就散掉,會拖上好幾個月,慢慢淡出。畫成圖就是一條衰減得異常慢的尾巴。
但這條尾巴有兩種讀法。
一種是它真的有記憶,波動本身帶著某種長程結構。另一種比較掃興:市場其實沒什麼記憶,只是它的「正常水位」偶爾會整段跳一次。金融海嘯跳一次、疫情跳一次、升息循環又跳一次。你把幾段水位不同的平靜期硬接成一條線去量,量出來當然像是有長記憶,記憶是接縫造成的錯覺。
這兩種讀法在數學上長得很像,在實務上卻差很多。真記憶代表過去的資訊還有用;假記憶代表你在對著接縫算命。
我們拿五個市場來分:VIX、標普 500、那斯達克、台灣 50、日經。時間從 2008 年拉到今年。
然後結論被我們自己推翻了兩次。這篇要講的就是推翻的過程,因為那比原本的結論有意思。
第一版說了兩件事,兩件都撤回
第一版跑完,我們寫下兩句話。
第一句:把水位跳動的部分抓出來扣掉之後,長記憶的成分還在,所以「純粹是接縫錯覺」這個說法可以排除。
第二句:不過這個記憶沒有交易價值。
第二句先講,因為它錯得比較單純,那句話底下沒有任何計算。我們從頭到尾沒有跑過一次策略、沒算過一毛手續費、沒做過任何報酬測試。「沒有交易價值」是順手寫下去的修辭,不是結果。一個沒做過的測試,不能有結論。撤回。
第一句錯得比較隱晦,也比較值得講。
我們扣掉的水位跳動,是用演算法在資料裡找出來的少數幾個明確斷點,最多五個。扣完,長記憶的痕跡確實還在。
問題是「接縫錯覺」那套說法,講的從來不是五個明確的斷點。它講的是一個水位隨時可能微微移動、次數可以很多、位置無法事先知道的過程。你拿掉五個最明顯的接縫,剩下的殘留當然還會有慢衰減的樣子,那正是這套說法會預測的結果。
換句話說,我們做的檢驗,對想否定的對象沒有鑑別力。扣完還有殘留,這句陳述是對的;但它撐不起「所以錯覺說被排除了」這個推論。降級成描述,撤回推論。
真正有意思的東西,藏在被漏掉的那把尺裡
回頭補做的時候,發現第一版還有個更根本的缺口:預測準不準,我們只用一把尺量過。
量預測誤差可以有很多把尺,最常見的是兩種。
一種在意「差幾成」。你預測波動是 10、實際是 12,差兩成;預測 100、實際 120,也是差兩成。兩者一樣糟。這把尺對平靜期的小數字很敏感。
另一種在意「差多少」。10 猜成 12 差 2,100 猜成 120 差 20,後者嚴重十倍。這把尺幾乎只在乎那幾天暴漲的大數字有沒有接住。
兩把尺都合理,看你在乎什麼。第一版只用了前面那把。
我們把完全一樣的預測,同一份程式、同一批模型、同一段測試期,五個市場各 749 個交易日,原封不動拿出來,用第二把尺重量一次。
結果翻了。

用「差幾成」量,樸素的老模型在五個市場贏四個。用「差多少」量,長記憶模型在五個市場贏四個,而且誤差低了一到一成六。
五個市場裡有三個,標普、台灣 50、那斯達克,冠軍直接對調。台灣 50 最誇張:換把尺量,長記憶模型的誤差從高出老模型近四個百分點,變成低了一成六。
同一批預測。沒有重跑、沒有換樣本、沒有調參數。只是換了評分方式。
所以哪個才對?都不對
到這裡最容易犯的錯,是挑一個自己喜歡的答案。
如果我們只報第一把尺,這篇會寫成「長記憶模型沒用,老方法更好」。如果只報第二把,會寫成「長記憶模型在四個市場勝出,幅度上看一成六」。兩個標題都寫得出來,兩個都有數字撐,兩個都是同一批預測。
這正是問題所在。
而且還有第三層。我們一共跑了 40 組模型對比。跑得夠多,總會有幾組看起來像回事,這跟丟銅板丟四十次,總會出現一串連續正面是同一件事。所以要扣掉這種運氣。

用「差幾成」那把尺,20 組裡有 8 組單看像有勝負,扣掉運氣後還剩 7 組。但那 7 組贏的對象,多半是我們故意放進去墊底的陽春基準,不是真正的對手。
用「差多少」那把尺,2 組單看像有勝負,扣掉運氣後剩 0 組。
而我們真正想回答的那組對比,長記憶模型對上樸素老模型——40 組裡只有一組單看像有勝負,扣掉運氣之後,一組都不剩。
所以「老模型比較好」不成立,「長記憶模型比較好」也不成立。撐得住的只剩一句: 這批資料分不出高下;只報一把尺的話,你可以讓它看起來分得出來,方向還隨你挑。
順便量了一下「我們有多不確定」
還有一件事值得補。
研究論文報告估計值的時候,通常會附一個誤差範圍。那個範圍是用公式算的,公式的前提是樣本無限大、模型設定完全正確。
我們用模擬檢查了這個前提:造五百組已知答案的假資料,跑同一套流程,看估計值實際散開多寬,再跟公式給的範圍比。
實際的散佈是公式值的 1.21 到 1.33 倍。
意思是那個誤差範圍偏窄了兩到三成。不算災難,但方向是一致的:你以為的精確度,比真實的精確度高一點。所有靠這種範圍做的判斷,都該連帶打個折。
模擬也有限。五百組不足以拆清楚偏差究竟來自哪一個環節,我們沒有硬猜。
那到底該信什麼
三句話。
波動有慢衰減的尾巴,這是穩固的觀察,扣掉明顯的水位跳動後依然存在。
但「這條尾巴是真記憶而不是接縫錯覺」,我們沒有證明。原本說證明了,撤回。
而「這條尾巴能不能賺錢」,我們連測都沒測。原本說不能,撤回。
剩下最紮實的收穫反而不是關於波動的,是關於方法的: 當一個結論會因為換一把尺就翻面,那個結論量到的是尺,不是市場。
下次看到「某模型誤差降低一成六」這種說法,值得先問一句:用哪把尺量的,另一把尺量起來又是什麼樣子。
如果對方只報了一把,那條資訊還不完整。
測試期為各資產最後 749 個交易日,資料截至 2026-07-17。台灣 50 的歷史資料在期間經上游修訂,該檔為近似重現而非逐點重跑,已在原始紀錄中揭露。
懶人包圖組



相關文章
先讀正式關聯,若無則使用標籤與主題相似度補齊