小样本过拟合:4 次交易 75% 胜率凭什么不能信
本文最后更新于 2026年7月25日 上午
前几天,一个朋友发来一张截图。
是他刚写的一个交易策略回测。4 次交易,3 次盈利,胜率 75%。他挺兴奋,问我能不能上实盘。
我看了看,只说了一句:再跑跑吧。
不是泼冷水。4 次交易的 75%,和 400 次交易的 75%,完全是两回事。
1. 先说一个心理陷阱
人天生喜欢找规律。看到连续几次成功,就觉得找到了圣杯。
但样本太小的时候,看到的规律很可能是噪声。
假设这个策略的真实胜率其实只有 50%,和抛硬币一样。那么在 4 次独立交易中,盈利 3 次及以上的概率是多少?
用二项分布算一下:
[
P(X \ge 3) = \binom{4}{3}0.5^4 + \binom{4}{4}0.5^4 = 0.25 + 0.0625 = 0.3125
]
大约 31%。
也就是说,一个完全无效的策略,也有将近三分之一的机会在 4 次里拿到 75% 以上的胜率。
为了更直观,下面这张图把”无效策略(真实胜率 50%)在不同样本量下跑出 ≥75% 胜率”的概率列了出来:

样本量越大,运气成分越稀释。4 次交易里的 75% 几乎全靠运气,100 次交易里的 75% 才开始像那么回事。
你愿意拿这个概率押上实盘吗?
2. 置信区间告诉你真相
统计上有一个概念叫置信区间。它告诉你,给定样本数据,真实参数大概落在哪个范围。
对胜率这种比例来说,样本越小,区间越宽。我们用 Wilson 置信区间 算算 4 次交易 75% 胜率的 95% 置信区间。
下面是 Python 代码:
1 | |
输出大概是 (0.251, 0.987)。
区间从 25% 到 99%,几乎横跨整个可能范围。这意味着你对真实胜率几乎一无所知。
对比一下:如果交易次数增加到 100 次,胜率还是 75%,置信区间会缩到大约 (0.65, 0.83)。那时候才能说策略可能比随机好。
3. 样本量要到多少才够
统计学里有一个公式可以估算最小样本量:
[
n = \frac{z^2 \cdot p(1-p)}{E^2}
]
其中 (z) 是置信水平对应的值(95% 用 1.96),(p) 是预期胜率(最保守取 0.5),(E) 是允许的误差。
如果希望误差在 ±10% 以内:
1 | |
需要至少 97 笔交易。如果误差要求 ±5%,则需要:
1 | |
385 笔。4 次交易,误差超过 ±40%,根本谈不上可靠估计。
4. 小样本更容易过拟合
过拟合是指模型把噪声当成了信号,在样本内表现好,样本外一塌糊涂。
参数越多,样本越少,过拟合越严重。4 次交易里跑出 75% 胜率,很可能只是恰好匹配了那几天的市场噪声。
举个例子:假设你有 100 个随机生成的策略,每个都测试 4 次。按照概率,大约有 31 个策略会获得 75% 以上的胜率。但它们只是运气好,并非真的有效。
这就是幸存者偏差。
5. 实盘之前可以怎么做
第一,增加样本量。至少 50 到 100 次交易,才能对胜率有一个基本靠谱的估计。
第二,做样本外测试。把数据分成训练集和验证集,看看策略在验证集上是否依然有效。如果掉得厉害,多半是过拟合。
第三,控制参数数量。逻辑越简单,过拟合风险越低。
第四,不要只看胜率,要结合盈亏比看期望收益。
1 | |
胜率 75%,但平均盈利 1%,平均亏损 10%,期望收益是负的 1.75%。胜率高不一定赚钱。
6. 说到底,统计是一门关于不确定性的语言
4 次交易 75% 胜率,数字本身没错。但背后的不确定性太大。
在统计上,我们永远无法通过少量样本证明一个策略有效。只能逐步积累证据,让置信区间收窄。
所以下一次有人给你看一个「高胜率」策略,先别急着问赚多少。先问一句:样本量有多少?
以上就是我对小样本过拟合的一点思考,希望对大家有帮助。
参考文献