資料研究 · 專題解讀
足球資料漂移怎麼查?把來源缺漏、口徑改變與模型失準分開
資料量或欄位變了,不代表模型已經失準。用完整度、規則版本和事後結果,分三層查明變化。

先不要把所有變化都叫作模型失準
資料漂移是輸入資料的分布發生變化;資料格式或定義改變,則還可能是處理流程不一致。真正要判定預測品質是否下降,需要等待可核對的實際結果,並使用相同的評估方法。
Google 的機器學習監控文件區分資料結構與特徵處理的不一致,提醒訓練時只能使用預測當下能取得的資訊。以下將這個原則整理為足球資料檢查流程,不是對任何球隊的預測。
第一層:先查原始資料有沒有少
假設本週應有 20 場賽事紀錄,但其中 4 場缺少射門資料,缺漏比例就是 4 ÷ 20 = 20%。這個數字只描述資料完整度,不能被解讀成模型錯誤率或比賽勝率。
若前一週資料完整,本週缺值增加,先檢查來源供應、欄位名稱和抓取時間。不要直接把缺值補成零,因為「沒拿到射門資料」和「射門次數為零」不是同一件事。
✦今日新客方案✦完整活動規則✦目前適用資格✦每日好康更新✦正式註冊入口
合作推薦・百萬迎新先看起來
熱門新會員好康,重點都放在這裡
把見面禮、加碼回饋與每日活動集中整理;開啟正式註冊頁即可確認目前方案與完整領取條件。
今日新客方案完整活動規則目前適用資格活動每日更新
新朋友入口直達開啟註冊入口實際內容、金額與參加資格以正式註冊頁為準。
第二層:查定義與版本是否改變
| 檢查對象 | 應保存的證據 | 不能直接推論 |
|---|---|---|
| 資料來源 | 欄位定義、擷取時間、原始值 | 兩個供應商的同名指標必然相同 |
| 比賽規則 | 賽事版本、適用日期、規則文件 | 規則變了就一定增加進球 |
| 處理程式 | 公式版本、缺值策略、單位 | 程式更新後的新舊數字仍能直接合併 |
一旦定義不同,先分組保留,不把改版前後的數值接成一條看似連續的趨勢線。
第三層:有結果後,再查模型表現
將事前保存的預測和實際結果配對,使用同一口徑比較不同期間。既要看整體,也要檢查聯賽、主客場等子群;若子群樣本太少,就記錄數量與限制,不任意宣布結論。
「長期數字 52、目前數字 48」本身無法推出 48–52 是統計信賴區間。區間估計需要明確的方法、資料與假設;缺少這些時,應分別報告兩個觀測值。這也是本次修正舊版通用示例的原因。
用一筆變更紀錄串起查核
可使用:比賽 ID、預測時間、原始資料時間、來源版本、處理版本、預測值、實際結果、缺值與異常註記。保留事前版本,新增事後結果,不覆寫原判斷。如此才能區分資料問題、方法問題與尚未足以判定的短期變化。