大片上映那一週,市場真的比較亢奮嗎?1,098 個週末、24 次檢定,全部落空
讀者互動
1 次瀏覽,登入會員可按讚與收藏。
學術界有一條頗迷人的線索:電影票房會透露大眾情緒,而大眾情緒會流進股市。
《Review of Finance》2025 年的 Hong and Wei 就做過這件事,題目叫「Blockbuster or Bust?」。Edmans、Garcia 與 Norli 在 2007 年也用世界盃輸球檢定過類似的心情通道。方向都指向同一個猜想:人開心的時候比較敢冒險,人分心的時候比較不看盤。
我想知道的是另一件更土的事:如果我手上只有免費的公開資料,我能把這條線索抓出來嗎?
我用什麼資料,怎麼定義「大片」
票房來源是維基百科每年那張表,「List of YYYY box office number-one films in the United States」,抓 2005 到 2026,一共 1,098 個週末。市場價格走 yfinance 日調整收盤。
「大片衝擊」的定義寫死成一條規則,避免事後挑數字:把當週冠軍片的週末票房取對數,跟前 52 週的分布比,算出 z 分數;z ≥ 1.5 就標記成一次 attention shock。前 52 週的平均與標準差都先 shift 一格,確保計算當下用不到未來資訊。
1,098 個週末裡有 1,072 個累積夠長的歷史可以算 z,其中 96 個被標成大片衝擊。約每 11 個週末出現一次。
被檢定的資產有 8 個:SPY、QQQ、IWM、XLY 四個大盤與消費類 ETF,加上 DIS、NFLX、AMC 與一個娛樂股等權籃子。輸出變數有 3 個:接下來五個交易日的累積報酬、5 日已實現波動度相對前 20 日的對數比、以及 5 日年化下跌半變異數。
8 × 3 = 24 組檢定。控制變數放了 SPY 前 5 日動能、前 20 日 RV、落後一期的 VIX 收盤、假期週旗標、月固定效果與幾個總經公布日的日曆 proxy。推論用 Newey-West HAC(落後四期)修正,另外跑一次以年份分群的重抽樣差異檢定,5,000 次重抽,種子 42。
結果:24 組全部沒過
| 資產 | 5日報酬 t | RV 比 t | 下跌半變異 t |
|---|---|---|---|
| SPY | −0.90 | +0.03 | +0.16 |
| QQQ | +0.24 | −0.15 | +0.05 |
| IWM | −0.84 | −0.28 | +0.16 |
| XLY | −0.80 | +0.68 | +0.88 |
| DIS | −1.40 | −0.48 | −0.35 |
| NFLX | −0.28 | +1.19 | +0.23 |
| AMC | +0.91 | +1.78 | +0.10 |
| 娛樂股籃子 | +0.54 | +0.70 | −0.19 |
(HAC 修正後的 t 值,來源:experiments/k1608/k1608_results.json)
主要標的 SPY 的次週報酬係數是 −0.0020,t = −0.90。波動度那一欄更乾淨:對數 RV 比的係數 +0.0017,t = +0.03,幾乎是把估計值釘在零上。
整張表最大的 統計強度 是 AMC 的 RV 比,1.78,接近顯著水準(顯著性 0.074)。以名目 5% 標準看,24 組沒有任何一組達標。而 24 組隨機檢定本來就該期待出現 1 組左右的假陽性,結果我們連那 1 組都沒撈到。

圖上每根長條是係數點估計,黑線是 HAC 修正後的 95% 信心水準的合理範圍。左圖報酬、右圖 RV 比,五個主要標的的區間全部橫跨零線。
不做任何回歸、直接把樣本切兩半看原始平均,長相也一樣:

兩組的差距,以年份分群重抽 5,000 次來看:SPY 次週報酬差 −0.085 個百分點,95% 區間 [−0.53%, +0.35%],符號檢定 未達顯著水準(顯著性 0.68);對數 RV 比差 +0.0039,區間 [−0.115, +0.132],未達顯著水準(顯著性 0.95)。報酬那項的方向甚至跟「大片讓人更敢冒險」相反。控制變數還沒進場,訊號就已經不在了。
「測不到」跟「不存在」是兩件事
到這裡最容易犯的錯,是把結論寫成「電影對股市沒有影響」。這張表撐不起那句話。
看 SPY 報酬那組的 95% 信心水準的合理範圍:[−0.64%, +0.24%]。區間下緣的 −0.64% 是五個交易日的量級,換算年化超過 30%。任何一個對沖基金看到這種效果都會立刻建倉。
也就是說,資料完全容得下一個經濟上很大的效果,我只是沒有精度把它跟零分開。
這個實驗的過關門檻設在 HAC 統計強度 ≥ 3,比慣例的 1.96 嚴格得多,理由是 24 組多重檢定需要更高的證據門檻。代價是 power 掉得很兇。SPY 報酬係數的標準誤是 0.224%,要讓 統計強度 摸到 3,效果得大到 5 日 0.67%。
真實世界的心情效應如果只有 0.1% 到 0.2%,這個設計根本沒有能力看見它。96 次事件的樣本量在週頻資料裡並不算多。
所以正確的敘述是 failure to detect,不是 absence of effect。這兩者在英文文獻裡分得很開,中文財經報導卻常常混成一句「研究證實沒有關係」。
一個必須先講清楚的時間差
還有一層限制,我認為比統計功效更該被寫在前面。
維基百科那張表記的多半是週一公布的實際票房,不是週日就能拿到的預估數字。而我的輸出變數是從週一開始起算的 5 個交易日。
換句話說,這個設計檢定的是「週末票房規模與接下來一週市場行為的統計關聯」,它並沒有回答「週日晚上能不能靠票房數字下單」。要驗證後者,得換成上映前的排片數、預售票或搜尋熱度,時間戳才對得上。
Da、Engelberg 與 Gao 在 2011 年的 Journal of Finance 用 Google 搜尋量做注意力代理,時間解析度就細得多。我這次沒用,理由很現實:pytrends 的非官方介面在我們的執行環境常被限流,會讓結果無法重跑。可重現性我看得比覆蓋度重。
我從這個 null 學到什麼
第一,免費公開代理變數有精度天花板。維基百科只給每週冠軍片一個數字,Box Office Mojo 的 release-level 微觀資料能給整個票房分布、上映廳數、首週跌幅。粒度差一階,雜訊就差一階,t 值自然被稀釋。這次 null 更像是在量測代理變數的解析度,而非在推翻文獻。
第二,null 值得被寫出來。研究圈的檔案抽屜問題就是這樣長出來的:跑出漂亮結果的實驗被發表,跑出零的被塞回抽屜,於是外界看到的證據永遠偏向「有效」。我們把 24 組全部列出來,包含那個 接近顯著水準(顯著性 0.074) 的 AMC,讀者才有辦法自己判斷這條線索的強度。
第三,如果哪天有人拿類似設計告訴你某個另類資料能預測市場,先問三個問題:樣本裡有幾次事件、信賴區間多寬、訊號的時間戳是不是真的早於交易時點。這三題答不好的策略,回測再漂亮我也不會下注。
這條線索我沒有關掉。換成上映前排片資料、換成日頻事件窗、把樣本擴到跨國票房,都還有得做。只是目前這份公開資料,還沒能力給出答案。
資料來源 :Wikipedia 年度票房冠軍表(2005-2026)、yfinance 日調整收盤、CBOE ^VIX
完整結果 :experiments/k1608/k1608_results.json
實驗代號 :K1608,執行時間 2026-07-02,種子 42
懶人包圖組



相關文章
先讀正式關聯,若無則使用標籤與主題相似度補齊