模型考古·专题篇:第7篇《 真,但没用:观众、裁判、星期几》

编号:SP07


真,但没用:观众、裁判、星期几

有一次我跟人聊起"主场气氛能不能加成",对方说得很肯定:观众越多,主队踢得越猛,这是常识。

我拿一份 K 联赛的数据去验——2255 场,十二年。结果有点意外:这个效应是真的,但你拿它一点用都没有。

这篇讲的是一类很容易被误判的发现:统计上确实存在,实用上等于零。

一、观众人数:方向会翻转

先直接算观众人数与主队净胜球的相关:

原始相关:r = +0.0803

回归 t 值:3.66(远超 2.0,非常显著)

看起来确实有。观众越多,主队赢得越多。

但这里有个漏洞:观众多,往往是因为来的对手强。强队来访,球场坐得满;这时候主队本来就更可能输。

所以我做了两件事。

第一件:队内归一化

不看绝对观众数,只看"这场比这支球队平时的上座高多少"。剔除掉球队本身的差异之后:

相关系数从 +0.0803 变成 −0.0019。几乎正好是零,而且符号翻了。

观众比平时多的时候,主队并没有打得更好,反而差了一点点——虽然这一点点完全在噪声里。

第二件:控制实力

用两队赛前的滚动场均得分差作为实力代理(严格只用这一场之前的信息),再看观众数的额外解释力。t 值从 3.66 降到 2.40。

2.40 仍然超过 2.0,还是"显著"。所以严格说,我不能断言观众效应完全不存在。

但关键问题在后面。

二、真正的判决:样本外

显著性是在同一份数据上算出来的。真正要问的是:用前半段数据训练出来的关系,拿到后半段还灵吗?

我把 2255 场按时间对半切,用前半段建模、后半段检验,看加入观众数之后预测误差改善了多少:

原始观众数:+0.133%

队内归一化版:+0.160%

千分之一点几。

这就是"真但无用"的完整形态:它在统计上存在(t=2.40),但你没法用它改善任何预测。

三、同样的故事,还有两个

图 1:五个维度的显著性与样本外改善对比(裁判用标准化卡方)

裁判尺度

我筛出执裁 40 场以上的裁判,共 14 位。控制赛季之后做卡方检验:

卡方值:26.84

临界值(α=0.05):22.35

超过了。说明裁判之间的尺度差异是真实存在的,不是抽样噪声。

再看一下幅度:这 14 位裁判的场均总进球实际标准差,是纯抽样噪声的 1.376 倍。确实有额外结构。

然后做样本外检验——加入裁判先验之后,预测误差改善 +0.04%。

比观众那一项还小。

赛季轮次

这个是三个里面统计上最强的:

赛季早期场均总进球:2.4461

赛季后期场均总进球:2.6882

差 +0.2421 球,t = −2.85,p = 0.0044

p 值不到千分之五,非常显著。而且轮次是赛前已知的,不存在"用了未来信息"的问题。

样本外改善:+0.024%。

三个维度,三个都显著,三个的样本外改善都在千分之零点几的量级。

四、星期几:一个反面教材

前面三个至少是真的。星期几这个连真都谈不上。

全局平局率是 28.55%。逐天看:

周一:40.00%(n=15,z=+0.98)

周四:46.15%(n=13,z=+1.41)

周三:24.93%(n=341,z=−1.48)

周六:29.23%(n=886,z=+0.45)

周日:29.58%(n=791,z=+0.64)

图 2:七天平局率与样本量,红色为样本不足 60 场

七天里 没有一天达到显著(|z|>1.96)。

但请注意周四那一行:46.15%,比全局高了 17.6 个百分点。这个数字看着非常吓人——只有 13 场。

小样本里随便一晃就是十几个百分点。这类数字被记住、被编成顺口溜、然后永远流传下去。而样本量大的周六和周日(886 场、791 场),平局率都贴着基线。

球场也类似:t = 1.41,p = 0.176,不显著。

五、为什么"显著"和"有用"会分家

这三者之间的差距,来自三件事。

第一,效应太小。 裁判尺度差异是真的,但它相对于单场比赛的巨大随机性,占比太小了。你确实测量到了一个真实的东西,只是它淹没在噪声里。

第二,显著性的门槛太低。 t>2.0 只说明"这个效应不太可能完全是偶然",没说明"它大到值得用"。样本量越大,越小的效应也能变得显著——我这次用 2255 场,比之前 380 场时多检出好几个"显著"。

第三,估计本身有误差。 你用前半段估出来的裁判尺度,本身就不准;拿这个不准的估计去预测后半段,误差抵消掉了它带来的那点信息。

六、我现在的判断标准

经过这几轮,我把判断顺序改了。显著性不是终点,是起点。

第一步:统计检验——有没有效应(t / 卡方)

第二步:样本外检验——这个效应能不能改善预测

第三步:看改善的量级——如果只有千分之几,直接放弃

真正花时间的是第二步。第一步的门槛太低了,它只负责把"纯属偶然"的东西筛掉,筛完之后剩下的绝大多数,还是不够格进模型。

回到开头那个问题:主场气氛有没有加成?我的答案是——有一点点,但这一点点小到你永远用不上。

本篇数据说明

K 联赛 2255 场,跨 12 个赛季

实力代理为赛前滚动场均得分差,严格仅使用该场之前的信息

裁判筛取执裁 40 场以上者,共 14 位

样本外检验均按日期前后对半切分

本系列为数据统计与概率知识科普,所有数据来自公开比赛结果的统计,不构成任何投注建议。

展开阅读全文

更新时间:2026-10-05

标签:游戏   裁判   模型   没用   观众   星期   专题   样本   效应   主队   赛季   误差   噪声   尺度   后半段

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top