FX Pricing提供支持

1000FTAD 标志——每日1000笔精彩交易——作为标语

回测:导致80%的交易策略变得毫无价值的7个致命错误

230万欧元的幻象

2019年,一家德国家族办公室开发了一种“革命性”的欧元兑美元策略。历时5年的回测显示出了令人印象深刻的业绩:

  • 夏普比率:2.8
  • 胜率:73%
  • 最大回撤:8.2%
  • 年化收益率:34%

Quant团队对此感到非常兴奋。管理层批准了1000万欧元的启动资金。该策略于2020年1月正式上线。

18个月后:亏损230万欧元。

到底发生了什么?那次回测不过是场幻象。七个根本性错误导致了结果失真:

  1. 过拟合:该策略是针对历史上的偶然现象进行优化的,而非针对真实的市场模式
  2. 幸存者偏差:仅对盈利的方案进行了测试,而失败的方案则被剔除
  3. 前瞻性偏差:该系统使用了在决策时本无法获得的数据
  4. 不切实际的成本:交易成本被设定为0.5点——实际为1.8点
  5. 测试期过短:5年期间仅出现一种市场格局(低利率趋势市场)
  6. 未进行样本外测试:整个历史数据都被用于优化
  7. 对疫情走势的忽视:该检测未能捕捉到2020年新冠疫情的波动性

这并非个例。研究表明:80%的回测都会产生具有误导性的结果。

通过本文,您将了解机构资产管理公司如何进行回测,必须避免哪些错误,以及面向资产管理公司的专业外汇软件如何系统地规避这些陷阱。

图片上显示了几座高耸的摩天大楼。

错误1——过拟合:算法交易中最危险的自我欺骗

什么是过拟合?

定义:一种策略经过如此强烈的历史数据优化,以至于它与过去的数据完美吻合——但在未来却会失效。

类比:你制作了一套完全合身于某人的西装——包括其所有不对称之处、疤痕和独特特征。这套西装只适合这一人,绝不会适合其他人。这就是过拟合。

过拟合是如何产生的

外汇交易中的典型情景:

一支量化团队正在为欧元兑美元开发一种均值回归策略:

版本 1:“当价格跌至 200 天移动平均线以下 2% 时买入”

  • 回测收益率:12%/年
  • 夏普:1.2

版本 2:“当价格跌至低于 200 天移动平均线 2.3% 且 RSI 低于 32 时买入”

  • 回测收益率:年化18%
  • 夏普系数:1.6

版本 3:“当价格跌至低于 200 日移动平均线 2.3% 且 RSI 低于 32 且当天为周一或周四且波动率高于 0.8% 时买入”

  • 回测收益率:年化34%
  • 夏普:2.4

这里发生了什么?

每增加一条规则,策略似乎就更好了——在回测中。但每一条规则都只是对历史随机现象的调整,而非对真实市场逻辑的适应。

现实情况是:

第1版在实际运行中同样有效(年化收益率为12%)。第3版则会立即崩盘(年化收益率为-8%)。

如何避免过拟合

规则1:经济合理性优先

在添加一条规则之前,请先自问:“这为什么会起作用?”

反面例子:“如果我们只在周四交易,该策略的表现会更好。”为什么是反面例子?因为没有经济上的理由说明周四会更好。

一个很好的例子:“在NFP数据发布后的前30分钟内,我们不进行交易。”为什么说这是个好例子?因为此时流动性低、点差大、滑点高——这符合明确的经济逻辑。

规则 2:参数敏感性测试

面向资产管理者的专业外汇交易软件不仅会测试“最优”参数,还会测试整个参数范围。

示例:

移动平均线

返回

夏普

180天

11,2%

1,18

200天

12,8%

1,24

220天

11,8%

1,21

分析:该策略稳健。业绩表现仅在最优值附近略有波动。

与过拟合相比:

移动平均线

返回

夏普

198天

8,2%

0,92

200天

34,1%

2,87

202天

9,1%

0,98

警告信号:参数稍作调整,性能便急剧下降。这是过拟合。

规则 3:最大复杂度限制

摩根大通有一条规定:每项策略最多包含5个条件。

为什么?因为每一个额外的条件都会使过拟合的概率呈指数级增长。

适用于自动化外汇交易策略:

简单胜于复杂。最赚钱的策略通常只有3到4条明确的规则,而不是15条。

错误2——幸存者偏差:那些隐形的失败者

选择性观察的问题

当您仅测试成功的策略/资产,而忽略那些失败的策略/资产时,就会产生“幸存者偏差”。

现实案例:

一位资产管理人制定了20种不同的外汇交易策略。他对这20种策略全部进行了回测。

结果:

  • 3种策略:夏普比率 >2.0
  • 8种策略:夏普比率1.0-2.0
  • 9 Strategien: Sharpe <1,0 (einige sogar negativ)

他在做什么?

它选入了表现最好的3只股票。其余17只则被“剔除”。

问题在于:

在20种随机策略中,从统计学角度看会有2到3种表现良好——这纯粹是偶然。他只挑选“赢家”,其实是在依赖运气,而非优势。

机构背景下的幸存者偏差

历史资产数据:

许多回测都使用历史指数数据(例如标普500指数)。但这些指数中只包含那些存活下来的成分股。

以标普500指数为例:

在1990年标普500指数的500家企业中,到2021年仅剩86家仍留在该指数中。其余414家已被替换——主要是因为它们倒闭或被收购。

如果您的回测仅使用2021年的组合:

您是在“获利组合”上测试策略。实际上,该组合中也会包含那414只亏损的股票。

结果:回测显示年化收益率为18%。若为实际收益,则年化收益率为11%。

在家族办公室的外汇交易中:

这方面的问题较小,因为货币不像股票那样会“消失”。但需注意:投资新兴市场货币时要谨慎。历史上许多新兴市场货币现已不复存在(如阿根廷澳元、巴西克鲁泽罗)。

如何避免幸存者偏差

  1. 对特定时间点数据的测试:

请使用反映交易发生时状态的数据集,而非当前状态。

  1. 采用统计校正的多策略测试:

如果您测试20种策略,预计会出现1-2个假阳性结果(置信水平为95%)。

解决方案:采用邦费罗尼校正或其他针对多重检验的统计调整方法。

关于邦费罗尼校正:

什么是
是一种统计方法,用于在同时检验多个假设时调整显著性水平。

为什么?
每次检验都存在一定的错误概率。如果进行大量检验,随机获得“显著”结果的概率就会大幅增加。邦费罗尼校正可以限制这种总体风险。

Beispiel:
Sie testen 10 Handelsindikatoren jeweils auf Signifikanz bei α = 5 %.
Ohne Korrektur wären einzelne Ergebnisse schon bei p < 0,05 „signifikant“.
Mit Bonferroni gilt:
• Neues Signifikanzniveau: 0,05 / 10 = 0,005
• Nur Tests mit p < 0,005 gelten als signifikant

解释:
原本看似“显著”的结果,在进行校正后,从统计学角度来看可能不再具有可靠性。但与此同时,误报的风险也会显著降低。

为什么这很重要(例如在量化交易中):
如果不进行校正,您可能会发现一些看似有效的信号,但实际上只是偶然现象。邦费罗尼校正可以防止过拟合,但其标准是刻意设得比较严格的。

适用于专业分析和交易系统:
邦费罗尼法(或其弱化版本)是一种标准工具,用于将稳健信号与随机信号区分开来,并客观评估模型风险。

面向资产管理者的外汇算法:

高端系统会实现自动的多重检验校正,并在可能存在选择偏倚时发出警告。

错误3——前瞻性偏差:时间旅行的陷阱

最隐蔽、最危险的陷阱

前瞻性偏差:您的策略利用了在决策时点尚未可得的资讯。

经典例子:

交易策略规则:“当欧元兑美元(EUR/USD)的日收盘价高于当日最高价时,买入。”

问题:您要等到收盘后才能知道当日最高价。但您的“买入”决策必须在盘中做出。

在回测中:效果极佳(毕竟您“知道”当日最高价)

在实盘交易中:无法实现

“前瞻性偏见”的微妙表现形式

  1. 未来版本中的数据窥探功能:

经济数据经常会被修正。首份GDP报告显示增长率为+2.1%。三个月后,该数据被修正为+1.8%。

回测陷阱:

如果您在历史分析中使用了最终(修订后)的数据,就会产生“前瞻性偏差”。实际上,您本应根据最初的数据(+2.1%)进行交易。

  1. 无预告的公司行为:

外汇交易示例:

2015年,瑞士国家银行(SNB)出人意料地取消了欧元兑瑞士法郎(EUR/CHF)的汇率下限。瑞士法郎汇率在几分钟内飙升30%。

回测陷阱:

如果您的系统“知道”2015年1月15日下限将被取消,并在此之前平仓了所有瑞士法郎头寸,那么您就存在“前瞻性偏差”。

事实上:事先没人知道这一点。

  1. 以“收盘价”成交的订单:

简单回测:

“收盘时买入,下个收盘时卖出”——使用精确的收盘价。

问题:您无法以收盘价买入。您必须提前决定。实际上,您是通过市价单买入的 → 会出现滑点。

避免前瞻性偏差

最佳实践 1:逐段仿真

面向机构外汇交易的专业软件可逐根K线模拟交易:

  • Bar N 已关闭 → 现有数据截至 Bar N
  • 已决定采用N+1现金结算方式
  • N+1期现货开仓的成交情况(包含实际滑点)

最佳实践 2:采用“截至某日数据”而非“最新数据”

利用带有特定时间点快照的数据库。例如,彭博终端提供“截至特定时间的数据源”。

最佳实践 3:延迟指标规则

如果您使用的指标需要“滞后”数据(例如日收盘价),请设置1根K线延迟。

示例:

错误:if close[0] > high[0]: buy正确:if close[1] > high[1]: buy at open[0]

错误 4——不切实际的交易成本:性能杀手

H3:为什么大多数回测都会低估成本

典型的业余回测:

“我交易欧元/美元时采用1点点差。这很现实。”

机构投资者的现实情况:

成本类别

零售

机构层面

影响

买入价-卖出价差

0.8-1.5点

0.2-0.5点

Pro Trade

滑点

0.5-2点

0.1-0.5点

Pro Trade

委员会

0

0-0.2点

Pro Trade

掉期/展期

每晚-2至+1点

-0.5 至 +0.3 点/夜

按扣留日计算

总计(往返,1天)

2-5点

0.5-1.2 点

 

关键点:在短期策略(日内交易、超短线交易)中,成本往往高于收益优势。

现实世界影响示例

日内交易策略的回测:

  • 每笔交易的平均盈利:8点
  • 每笔交易的平均亏损:6点
  • 胜率:55%
  • 每周交易次数:15

0点差交易表现:

期望值 = (0.55 × 8) – (0.45 × 6) = 每笔交易 1.7 点 → 每周 25.5 点 × 50 周 = 每年 1,275 点

每2点成本下的收益表现(现实情况):

期望值 = (0.55 × 6) – (0.45 × 8) = 每笔交易-0.3点 →该策略无法盈利

差异在于:从+1,275点到-225点——仅仅是因为考虑了实际成本。

如何正确核算成本

  1. 最坏情况模拟:

请不要使用“平均”点差,而应采用最坏情况(例如第95百分位数)。

  1. 流动性调整:

点差会根据一天中的不同时段而有所变化:

  • 伦敦/纽约交易时段重叠期(14:00-17:00 中欧时间):0.3 点
  • 亚洲交易时段(00:00-06:00 中欧时间):1.2 点

您的回测必须模拟随时间变化的点差。

  1. 滑移建模:

对于市价单:20%的交易会出现0.5-1点滑点,尤其是在市场波动较大时。

关于高端外汇软件:

专业系统会导入历史的买入-卖出价差数据,并根据波动率模式模拟滑点。

错误 5 和 6——测试周期过短且缺乏样本外测试

错误5:时间跨度错觉

问题:为期2-3年的回测往往仅涵盖一种市场状态。

市场的现实:

  • 2003-2007年:低波动率趋势市场(VIX平均值为12)
  • 2008-2009年:高波动性危机(VIX指数一度升至80)
  • 2010-2019年:低利率牛市
  • 2020年:新冠冲击
  • 2021:再通胀交易

如果您的策略仅在2017年至2019年期间经过测试:

该设备仅在低电压趋势工况下进行了测试。2020年(高电压工况)下,它很可能无法正常工作。

面向经验丰富投资者的外汇交易最低标准:

  • 绝对最低年限:10年
  • 专业经验:15-20年
  • 业界翘楚:20余年,跨越至少2个完整的经济周期

错误 6:样本内与样本外

回测领域最大的“罪行”:

他们利用所有历史数据进行优化。随后,他们又基于同一组数据进行测试。

为什么这会成为一个问题:

他们优化了该策略,使其能完美契合这些特定数据。当然,这项“测试”看起来很不错——但这并非真正的测试,而是一种自我肯定。

解决方案:样本内/样本外划分

标准方法:

  • 样本内(70%):2000-2013 → 用于优化
  • 样本外数据(30%):2014-2020 → 用于真实测试

重要提示:绝不能将样本外数据用于优化。

进阶:前向分析

周期

样本内(优化)

样本外(测试)

第一轮

2000-2004

2005

第二轮

2000-2007

2008

第3轮

2000-2010

2011

第4轮

2000-2013

2014-2016

优点:您可针对“未见”的数据进行持续测试——从而实现更贴近现实的模拟。

适用于符合高安全标准的外汇交易:

前瞻回测是行业标准。面向首席执行官的自动化外汇交易策略应至少经过5个前瞻回测周期。

错误7——对投资策略的无知:为何“平均表现”具有误导性

政权问题

市场有其运行机制:

  • 趋势行情与区间震荡
  • 高波动性与低波动性
  • 风险偏好与风险规避
  • 通货膨胀型与通货紧缩型

她的策略可能只在某些政权下才有效。

外汇交易中趋势跟踪的示例:

政权

返回

2003-2007(热门)

+28%/年

2008-2010(波动/剧烈波动)

-12%/年

2011-2015(趋势)

+22%/年

2016-2019(巡逻)

-5%/年

17年平均收益率:+8.3%/年

问题:这一平均值具有误导性。实际上,您会经历较长时间的表现不佳期。

回测中的趋势模式识别

方法 1:波动率模式

根据ATR(平均真实波动幅度)或VIX等效指标对历史数据进行分类。

以欧元兑美元为例:

  • Low-Vol-Regime: ATR < 60 Pips
  • 中等波动区间:ATR 60-100 点
  • 高成交量模式:ATR > 100 点

然后在每种模式下分别测试该策略:

政权

% 时间

返回

夏普

低音量

45%

+18%

1,8

中度丰盈

40%

+12%

1,2

High-Vol

15%

-8%

-0,4

结论:在高波动期,该策略行不通。解决方案:在高波动期,将仓位规模缩减50%,或完全暂停交易。

方法 2:市场走势(趋势与区间)

使用ADX(平均方向指数)进行分类:

  • ADX > 25:趋势市场
  • ADX < 25: Ranging-Markt

单独测试:

趋势跟踪策略在趋势行情中应表现出色,而在震荡行情中则表现不佳(均值回归策略则恰恰相反)。

适用于高端交易软件:

模式识别应实现自动化。独家外汇交易策略会根据检测到的模式自动调整仓位规模和参数。

最佳实践:机构交易员如何进行专业的回测

10点回测框架

  1. 经济依据:为什么这一策略会奏效?(而非“历史上它曾奏效”)
  2. 最低数据覆盖期:15年以上,至少涵盖2个经济周期
  3. 样本内/样本外划分:70/30 或前瞻性分析
  4. 实际成本:最坏情况下的点差 + 滑点 + 隔夜利息
  5. 参数敏感性:测试参数范围,而不仅仅是最佳值
  6. 市场状况分析:按市场状况分类的单独业绩统计数据
  7. 蒙特卡洛模拟:1,000+条模拟路径用于鲁棒性检查
  8. 最大回撤分析:不仅看平均值,还要看第95百分位数
  9. 多重检验校正:当测试20种策略时,需调整显著性水平
  10. 正式交易前的模拟测试:使用实时数据进行至少3至6个月的模拟交易

蒙特卡洛模拟解析

这是什么?

您将历史交易记录取出,并像洗牌一样随机“混合”它们。

为什么?

历史序列仅仅是一种可能的排序方式。蒙特卡洛模拟表明:“如果交易按其他顺序进行,会怎样?”

示例:

该策略的历史最大回撤为12%。

蒙特卡洛模拟(1,000次)表明:

  • 第5百分位:最大回撤8%
  • 中位数:最大回撤 12%
  • 第95百分位:最大回撤22%

解读:在5%的可能情景中,您会经历22%的回撤——尽管从历史数据来看,这一比例仅为12%。

这对外汇交易中的资金管理至关重要:

您必须针对最坏情况制定计划,而不是针对平均情况。

如需量身定制的外汇交易解决方案:

蒙特卡洛模拟是标准功能。它会显示所有关键指标的置信区间。

七宗罪及其避免之道

错误 1——过拟合:

  • 症状:参数稍作更改,性能便会急剧下降
  • 解决方案:经济依据 + 参数敏感性测试 + 复杂性限制

错误 2——幸存者偏差:

  • 症状:仅对“获利”策略/资产进行测试
  • 解决方案:特定时间点数据 + 多重检验校正

错误 3 – 前瞻性偏差:

  • 症状:策略使用了实际上并不存在的信息
  • 解决方案:逐根柱线模拟 + 截至数据日 + 滞后指标

错误 4——不切实际的成本:

  • 症状:实盘交易的表现比回测结果差50%至100%
  • 解决方案:最坏情况点差 + 滑点建模 + 时间相关成本

错误 5——测试周期过短:

  • 症状:一旦市场格局发生变化,策略就会失效
  • 解决方案:至少15年 + 2个经济周期

错误 6——缺乏样本外检验:

  • 症状:回测业绩无法复现
  • 解决方案:70/30分割法或前向分析法

错误7——对体制的无知:

  • 症状:尽管平均回报率良好,但仍存在长期表现不佳的阶段
  • 解决方案:市场环境分类 + 针对每个市场环境分别进行业绩分析

核心真相:专业的回测绝非一蹴而就。在信誉良好的交易公司中,对一项新的外汇策略进行全面验证通常需要3至6个月的时间。但这一投入能避免数百万的损失。

避免7个致命的回测错误——采用经过专业验证的策略

我们的自动化外汇交易策略需经过一套严格的6个月验证流程——该流程基于17年的机构交易经验而开发。

您将获得:

✓ 经过全面回测的交易策略
✓ 经多种市场环境的前瞻验证
✓ 经过蒙特卡洛测试(1,000多次模拟)
✓ 包含滑点在内的真实交易成本
✓ 面向资产管理者的外汇软件,配备机构级回测引擎
✓ 附带市场环境分析的透明业绩报告

1000FTAD 代表着受控且以技术为驱动的外汇交易——注重实质、纪律和长期资产稳定性。

关于首次咨询和策略验证:

📧info@1000ftad.com
📞 +41 71 588 03 40

专为家族办公室、资产管理公司及机构投资者提供,最低资产要求为1000万欧元

常见问题解答:常见问题

问:一次专业的回测应该持续多长时间?

A:长期的数据历史记录通常极具价值,但关键不仅在于年数,更在于所测试市场条件的数据质量和代表性。10至20年的传统回测虽能提供参考,但其结果始终取决于数据质量和基础假设。
因此,我们专注于在真实市场条件下进行接近实盘的测试:我们的策略是在使用实时市场数据的模拟账户中进行测试,其中包含真实的点差、成本、费用和隔夜利息。通过这种方式,我们确保能够真实地反映不同的波动率和市场阶段——不是理论上的,而是在尽可能接近未来实盘交易的条件下进行的。

问:我能相信回测软件吗?

A:回测软件的可靠性取决于其所依据的数据和假设。尤其是高分辨率的 tick 数据,虽然通常被认为非常精确,但在实际应用中却常常存在不一致、不完整或受经纪商影响等问题,从而可能给人一种虚假的精确感。
我们刻意选择 MT4/MT5,因为这些平台在实盘交易中已稳定运行多年。 我们不依赖理论上的 tick 数据重建,而是利用模拟环境中的实时数据对策略进行测试,这些测试会考虑实际点差、成本和隔夜利息。我们有意排除滑点因素,以便单独评估策略的信号质量。这种方法减少了模型假设,并提高了结果在实际交易中的可迁移性。

问:在回测中,什么样的夏普比率才算“理想”?

A: Abhängig von Strategie-Typ, aber generell: Sharpe >1,5 ist solid, >2,0 ist excellent. ABER: Im Live-Trading erwarten Sie 20-30% niedrigere Sharpe als im Backtest (Degradation durch Execution-Imperfektionen). Wenn Backtest Sharpe 2,5 zeigt, erwarten Sie live 1,8-2,0. Wenn Backtest <1,5 zeigt, wird live wahrscheinlich <1,0 sein – nicht akzeptabel.

问:如何识别其他策略中的过拟合?

A:风险警示:(1) 参数/规则过多(>7-8),(2) 胜率极高(>70%),(3) 参数变动时业绩骤降,(4) 策略逻辑无法直观解释。 请务必要求提供样本外结果和参数敏感性分析。面向资产管理者的外汇算法应默认提供这些文档。

问:进行专业的回测是否需要昂贵的彭博终端?

A:并非绝对必要,但高质量的数据至关重要。彭博(Bloomberg)/路透(Reuters)提供特定时间点数据和截至特定时刻的快照——这对避免前瞻性偏差至关重要。替代方案:Refinitiv Eikon、Quandl(适用于部分数据集)、以及Dukascopy等专业外汇数据库(免费,但功能有限)。 对于面向企业家的专业外汇解决方案:请投资于高质量的数据——这比因回测质量差而造成的数百万损失要划算得多。

问:在正式投入交易前,我应该先进行模拟交易吗?

A:绝对是。至少需要3到6个月。模拟交易(使用真实的实时数据,而非回测模拟)能揭示回测永远无法显示的问题:API延迟、经纪商特有的订单拒收、意外的滑点模式,以及特定时段的流动性问题。 面向专业人士的外汇软件应能实现从回测→模拟交易→实盘交易的无缝过渡。

版权所有 © 2025 1000FTAD AG – 保留所有权利

注:本文不构成投资建议。本文仅为面向专业投资者的市场评估。

立即了解更多:www.1000ftad.ch📩 联系方式:https://1000ftad.ch/kontakt/

风险提示:1000FTAD的产品仅适合专业投资者和合格投资者。更多信息:https://1000ftad.ch/rechtlicher-hinweis/

图片展示了1000FTAD的标志。1000FTAD代表“每天1000笔精彩交易”。

让您的资本发挥效用的技术

图中展示了一辆印有1000FTAD标志的一级方程式赛车的模型。1000FTAD采用的一级方程式主题设计,生动地说明了1000FTAD的软件运行速度可达毫秒级。

千万不要错过交易的未来!

立即订阅电子报,获取独家资讯。