一个交易系统需要回测多少笔才算有效:公式 n ≥ (1.96σ/E)²,附四档期望值对照表
本文目录(9 节)
「我回测了一百笔,胜率 55%,这套系统能用。」这句话里唯一确定的信息是笔数,而一百笔在交易这种噪声水平下,几乎什么都证明不了。所需样本量不是拍出来的经验值,它有一个可以直接算的公式,只依赖两个数:单笔期望值和单笔收益的标准差。这篇把公式、算法和四档期望值下的对照表全部给出来。
先给结论,方便直接抄走:一套胜率 40%、赢 2R 输 1R 的系统(期望值 0.2R),需要大约 208 笔才能在 95% 置信水平上确认它的期望值真的大于零。 如果你一年做 100 笔,这意味着两年。
一、公式和它的来源
所需样本量的公式是:
n ≥ (1.96 × σ / E)²
n = 所需交易笔数
σ = 单笔收益的标准差(以 R 为单位)
E = 单笔期望值(以 R 为单位)
1.96 = 95% 置信水平对应的 z 值
它的来源是均值的置信区间。n 笔交易的平均收益,其标准误是 σ/√n。要让「平均收益大于零」这个结论在 95% 置信水平上成立,需要满足:
E > 1.96 × σ / √n
两边移项并平方,就得到上面那个式子。整个推导只用了一个假设:单笔收益之间相互独立。 这个假设在交易里不完全成立(连续加仓、同向持仓会引入相关性),所以实际所需笔数只会比公式算出来的更多,不会更少。
R 是这里的关键单位。一笔交易赚了多少 R,等于它的盈亏除以这一笔的初始风险金额。 止损 100 点、最后赚了 200 点,就是 +2R。用 R 而不是用金额,是为了让不同仓位大小的交易可以放在同一个分布里统计。仓位怎么算见一笔交易该用多少仓位。
二、标准差怎么算
多数人卡在这一步,因为 σ 不是直接给出的数字,要从胜率和盈亏比推。
对一个「赢就赚 W 个 R,输就亏 L 个 R」的简化模型,胜率为 p 时:
E = p × W − (1 − p) × L
E²ₓ = p × W² + (1 − p) × L²
σ = √(E²ₓ − E²)
代入胜率 40%、赢 2R、输 1R:
E = 0.40 × 2 − 0.60 × 1 = 0.20 R
E²ₓ = 0.40 × 4 + 0.60 × 1 = 2.20
σ = √(2.20 − 0.04) = √2.16 = 1.4697 R
这个 1.47 就是交易的噪声水平。 它比期望值 0.20 大了七倍多。一套优秀系统的信号强度只有噪声的七分之一,这是所有样本量问题的根源。
如果你已经有实盘记录,不需要用这个模型,直接对每笔的 R 值求标准差即可,Excel 里用 STDEV.S 一步算完,表格公式见Excel交易统计公式。用真实分布算出来的 σ 通常比模型算出来的更大,因为真实交易里有滑点、有部分止盈、有超出止损的跳空。
三、四档期望值对照表
下面这张表是核心。假定赢 2R 输 1R 的盈亏结构,反推每档期望值对应的胜率,再算所需笔数。
| 单笔期望值 E | 对应胜率(赢2R输1R) | 单笔标准差 σ | 所需笔数 n | 每年100笔需要 |
|---|---|---|---|---|
| 0.10 R | 36.67% | 1.446 R | 803 笔 | 8.0 年 |
| 0.20 R | 40.00% | 1.470 R | 208 笔 | 2.1 年 |
| 0.30 R | 43.33% | 1.487 R | 95 笔 | 1.0 年 |
| 0.50 R | 50.00% | 1.500 R | 35 笔 | 0.4 年 |
读这张表的正确方式不是「找到自己那一行」,而是看四行之间的落差:期望值从 0.3R 掉到 0.1R,只差 0.2R,所需样本量却从 95 笔涨到 803 笔,差了八倍多。

四、核心洞察:这是一个平方关系
公式里 E 在分母上,而且整体被平方。这意味着:
期望值降一半,所需样本量变成四倍。
固定 σ = 1.47R,只改变 E:
| 单笔期望值 E | 所需笔数 n | 相对上一行 |
|---|---|---|
| 0.40 R | 52 笔 | 基准 |
| 0.20 R | 208 笔 | ×4 |
| 0.10 R | 830 笔 | ×4 |
| 0.05 R | 3320 笔 | ×4 |
这个平方关系有三条很实际的推论。
推论一:微弱优势在实践中不可验证。 期望值 0.05R 的系统理论上是赚钱的,但你需要 3320 笔才能确认它不是随机的。一年 100 笔的话是 33 年,而市场结构在 33 年里早就变了。在人的一生尺度上,太弱的优势等于没有优势。
推论二:提高期望值比增加样本便宜得多。 想让验证周期缩短一半,你有两个选择:交易频率翻倍(成本翻倍、精力翻倍、质量下降),或者把期望值提高 41%(1.41² ≈ 2)。后者通常更容易,因为期望值的改进空间往往在出场和仓位上,不在入场信号上。改哪里更有效的分析见为什么胜率高还是亏钱。
推论三:连亏一段完全不能说明问题。 期望值 0.2R 的系统,跑到 50 笔时的 t 值只有 0.96,远达不到显著。50 笔的结果是正是负,基本上是掷硬币。 用 50 笔的结果去改规则,改的是噪声。要不要因为连亏换系统,判据见连亏之后要不要换系统。
五、换一个置信水平,数字会变多少
1.96 对应双侧 95%,这是学术界的默认值,对交易者未必是最合适的。
| 置信口径 | z 值 | E=0.1R | E=0.2R | E=0.3R | E=0.5R |
|---|---|---|---|---|---|
| 单侧 95% | 1.645 | 585 笔 | 147 笔 | 65 笔 | 24 笔 |
| 双侧 95% | 1.960 | 830 笔 | 208 笔 | 93 笔 | 34 笔 |
| 双侧 99% | 2.576 | 1434 笔 | 359 笔 | 160 笔 | 58 笔 |
交易者用单侧 95% 是有道理的,因为你关心的问题是单向的:「期望值是不是大于零」,而不是「期望值是不是不等于零」。用单侧口径,E=0.2R 的系统 147 笔就够,比双侧少了近三成。
但不要为了让数字好看而一路放宽口径。放宽到 80% 置信,意味着每五套通过检验的系统里有一套其实是无效的,而你会把真金白银押上去。
六、样本量够了,还有四个条件
笔数达标只是必要条件,下面四条同时满足,回测结论才成立。
条件一:样本必须覆盖至少两种市场环境。 208 笔全部来自同一段单边行情,等于只测了一种情况。一个粗略的检验方法是把样本按时间切成三段,看三段的期望值符号是否一致。分环境表现的检验方法在交易系统是不是真的有效里有更细的做法。
条件二:参数不能是在同一批数据上调出来的。 用同一批数据调参数再用它验证,是在用答案检验答案。正确做法是留出最后 30% 的数据完全不看,参数定死之后再在这段上跑一遍。参数敏感度怎么测见怎么评估一套策略。
条件三:每笔的风险必须大致相等。 R 这个单位成立的前提是每笔的初始风险一致。如果你有些笔重仓有些笔轻仓,那么这批样本的分布是混合的,标准差会被严重低估,算出来的样本量偏小。
条件四:回测里的成本必须按实际填。 手续费、点差、滑点全部计入。这三样合起来经常吃掉 0.05R 到 0.1R,正好是一套弱系统的全部期望值。

七、样本不够的时候该怎么办
现实是多数人手上只有几十笔。这时候有三条可行的路,都不包括「先上仓位试试」。
第一条:先看执行率,不看盈亏。 50 笔判断不了系统好坏,但足以判断你的执行情况。执行率低于 90% 的话,盈亏数据本身就不是这套系统的表现,是你和系统的混合表现,谈有效性没有意义。
第二条:降低单笔风险,把笔数跑出来。 用四分之一的仓位跑到 200 笔,代价是这段时间的收益很小,收获是一个可以下结论的样本。这比用满仓跑 50 笔然后猜要划算得多。什么时候可以把资金加回来,门槛见什么条件下可以加大交易资金。
第三条:换更细粒度的指标。 期望值收敛得很慢,但有些中间量收敛得快很多。比如「入场后 5 根 K 线内的平均浮盈」这类指标,方差比最终盈亏小,几十笔就能看出趋势。它不能替代期望值检验,但可以早期给出方向性的提示。
八、三个常见误区
误区一:用回测的总收益率下结论。 总收益率把笔数、仓位、复利三件事混在一起,不同笔数之间无法比较。一切结论都要落到单笔 R 的分布上。
误区二:把优化次数当成免费的。 在同一批数据上试了 50 组参数,选出最好的那组,这组的表现天然被高估。粗略修正方法是把置信要求提高:试了 k 组参数,就把 z 值按 k 组独立检验来收紧,试 20 组的话 z 从 1.96 升到约 3.0,所需样本量会翻倍还多。
误区三:觉得日内高频可以绕过样本量问题。 高频确实能快速积累笔数,但高频的单笔期望值通常也小得多(扣掉成本后经常在 0.05R 量级),而所需样本量按平方放大,两边基本抵消。没有免费的样本。
写在最后
这个公式最有价值的地方不是让你算出 208 这个数字,是让你接受一件事:交易信号的强度只有噪声的七分之一,所以任何短期结果都不携带信息。
理解了这一点,很多困扰会自动消失。连亏五笔要不要改规则,不用纠结,样本量不够,不改。这个月赚了 30% 说明系统很好吗,不说明,样本量不够。
系统评估的完整指标清单见怎么评估一套策略,这些指标各自的及格线在夏普比率多少算好里。而所有这些指标的前提,都是先有足够的样本。
3秒免费测一下你的”管不住手指数”:journal.xtradingtime.com(记住 3316,就能找到我们)
本文内容仅供教育和参考用途,不构成任何投资建议。文中的统计方法基于单笔收益独立同分布的简化假设,实际交易中相关性会使所需样本量进一步增大。交易有风险,入市须谨慎。
在微信里搜「Tom讲交易」即可关注,每周更新交易教学
推荐课程
合约陪跑实战训练营
不只教方法,更带你实盘执行。从仓位管理到止损止盈,手把手纠正你的交易习惯,建立可复制的盈利系统。
相关图解
一张图看完这件事,适合存下来随时翻
相关文章
交易系统是不是真的有效:六个硬指标和它们的及格线
赚钱不等于系统有效,亏钱也不等于系统无效,因为交易样本的噪声大得超出直觉。这篇给出六个必须算清楚的硬指标和各自的及格线:样本量是否达到统计要求、期望值的 t 值是否过 1.96、盈亏比对应的盈亏平衡胜率、最大回撤和水下时间、执行率、以及分环境后的表现是否稳定。每个指标都给了公式和一张对照表。
交易系统亏钱是方法不对还是执行不对:五步算出答案的自查流程
方法问题和执行问题的处理方式完全相反,一个要换系统,一个要动人。搞混了会越修越糟。这篇给出五步可计算的自查流程:先算执行率,再把交易拆成合规单和情绪单分别算期望值,然后用样本量公式判断结论算不算数,最后用一张二乘二矩阵定位问题。文中所有阈值都给了推导过程,读者可以用自己的数据复算。
交易系统三年赚一段亏回去:三个卡点的识别方法,每个配一个自查动作
做了三年总是赚一段亏回去,数学上等于每笔期望值接近零。而期望接近零通常不是没有优势,是优势被三个卡点抵消掉了:盈利期和亏损期的仓位不对称、盈亏比被提前止盈吃掉、样本被自己反复切碎。这三个卡点都能从交易记录里查出具体数字,一个胜率 40% 盈亏比 2 的系统,只要盈利时仓位 0.7 倍、亏损时 1.4 倍,期望值就会从 +0.2R 掉到 −0.28R。
量化交易回测的 7 个致命陷阱:为什么回测好的策略实盘亏钱
回测是量化交易最重要的环节,也是最容易被自己骗的环节。90% 的散户量化策略“回测亮眼实盘亏损”,原因都在这 7 个回测陷阱里:过拟合、生存偏差、前视偏差、数据窥探、不真实的执行、忽略成本、样本不足。本文逐一拆透每个陷阱的本质 + 散户能用的检测方法。读完你会成为“会看回测”的少数人。
风险管理为什么我的胜率高但还是亏钱:一个公式定位问题,四种典型病症
胜率70%还在亏钱,问题一定出在期望值这个公式的另外三个变量上。这篇先用期望值公式定位你属于哪一种情况,再给出四种典型病症的具体表现和改法:赢小亏大、扛单摊平、手续费吃掉利润、以及重仓那笔恰好亏损。附一份可以直接算的自查表。
交易系统模拟盘转实盘的四个硬指标:样本量、执行率、期望值、最大回撤,每个都能算出来
模拟盘做到什么程度才算可以上实盘,凭感觉答不了。这篇给四个能算出数字的硬指标:样本量至少 100 笔(附统计推导,30 笔时胜率的标准误是 9.1 个百分点,100 笔降到 5.0)、计划执行率不低于 90%、期望值不低于 0.2R 且 t 值大于 2、最大回撤以 R 计不超过 20R。每个指标都给出计算方法、达标线和阈值是怎么定出来的,并说明三种典型的假达标。
觉得有用?关注公众号
扫码或在微信里搜「Tom讲交易」,每周更新交易教学文章