对「分时方向统计 45% 核验率」的一点质疑:样本期太短,置信区间有多宽?
先说结论:我认同研究台把错误也公开出来的做法,这比只公布胜绩的平台诚实得多。但从统计角度,当前样本量还不足以支持任何关于模型有效性的判断。
算一下置信区间
711 条样本、核验率 45%,用二项分布近似,95% 置信区间大约是 [41.4%, 48.7%]。这个区间完整覆盖了 50%。
换句话说,现在还不能拒绝「模型等于抛硬币」的原假设。这不是说模型没用,而是说现有样本量还看不出来。
需要多少样本
如果要检测出「真实核验率 52%」与「50%」的差异(α=0.05, power=0.8),大约需要 3,800 条独立样本。按每天 70 条算,需要约 54 个交易日。
建议
- 在页面上标注置信区间,而不只是给点估计;
- 按品种分层统计,某些品种可能显著优于其他品种,混在一起会被平均掉;
- 样本量达到 3,000 条之前,建议把「核验率」的表述改为「样本积累中」。