工程领域笔记。 在四周内,我们收到了七个交易想法——其中大部分来自量化研究员 弗拉迪斯拉夫·弗雷丁。我们构建了每一个,用相同的故障关闭协议进行测试,并记录了结果。 没有一个产生了经过验证的优势。 这份笔记是记分牌,因为有趣的部分不是结论——而是每一次失败都留下了一个永久性的工具,而这些工具现在使得下一次测试变得廉价。

每个想法都要遵守的协议

一个想法不会仅凭一次回测就得到结论。它要经过一系列关卡,每个关卡至少扼杀了下面七个想法中的一个。顺序很重要:廉价、残酷的关卡先来。

GATE 它问什么 STOPPED 1 · 样本量 是否有足够的交易来得出任何结论? deda3 2 · 噪声基底 它是否优于 N 次随机尝试中的最佳结果? deda5 3 · 样本外 它是否能在搜索从未见过的数据中存活? deda7 4 · 被动基准 它是否优于简单地持有相同的敞口? deda9 5 · 空值控制 它是否优于一个用抛硬币代替信号的双胞胎? deda6 6 · 广度 它是否适用于未拟合过的工具? deda9 7 · 前瞻模拟 它是否在尚不存在的数据上仍然有效? 未达到
系列中没有想法达到第 7 关。两个想法作为假设停留在第 6 关。

记分牌

七个实验,四周,一个协议。最后一列是结束每个实验的数字。

EXPERIMENT 想法 VERDICT 结束它的数字
Pine 平价
7月4日 · FVB 指标
叠加四个市场状态过滤器;仅当所有过滤器一致时交易 空结果 复合过滤器与单一过滤器,样本外: 平均 −27%,在 5 个币种中的 1 个上有效
三引擎层级
7月8日 · deda3
先结构,再相对强弱,然后宏观层叠加 未就绪 0 个 策略-时间框架单元格通过关卡;约 4,900 次试验
重新优化节奏
7月13日 · deda5
市场是准平稳的,因此每周重新拟合设置 低于噪声 夏普比率 2.38 相对于 24 次最佳噪声基底 3.57;47 笔交易 vs 交易者自己的最低 100 笔
平均阶梯
7月16日 · deda7
在入场价下方添加两个限价单,一个共享止损 非生产 在 172,224 个组合中, 0–16% 在快速框架上样本外为正;网格平均 −48% 至 −90%
市场范围否决
7月16日 · deda6
不要对抗市场:仅当资产和主要货币一致时交易 仅限特定市场状态 最佳单元格被一个 无信息双胞胎匹配;硬版本损失了 −28 个阿尔法点
状态切换机器学习
7月26日 · deda8
让梯度提升选择哪个策略适合当前状态 REFUTED 0 个 符号显示出预测提升;模型在每个切片和折叠中都比常数更差
通道突破加振荡器
7月27日 · deda9
在资产和主要货币同时转向时突破波动率通道 无广度 转移到其他 29 个币种,它通过了 1 其中仅凭运气就能得到 0.55;中位数阿尔法 −0.25%

三个值得研究的失败

1. 稀疏性错觉

第一个活动产生了一个标题: 样本外 +14.52% 在一个单元格上。它毫无价值,原因是策略研究中最常见的陷阱:收益是币种的中位数,而几乎所有贡献的币种只有一到三笔交易。正确衡量——有多少币种在样本外具有实际样本量且盈利——同一个单元格得分为 0 个.

标题所说 +14.52% 中位数收益,样本外 广度所说 0 / 19 具有实际样本量的盈利币种 中位数如何夸大 有 2 笔幸运交易的币种——计数一次 有 1 笔交易的币种——计数一次 有 40 笔交易的币种——也计数一次 在阅读之前先读广度 回报。

同一个活动在几小时内就上了第二课。第一波中的明星单元——20个币种中有13个在快速框架上盈利——当我们用几年的历史数据替换30天的历史数据后,它就消失了。在深度数据上,该框架上的每个设置都是负的,从-9.2%到-41.5%。修复弱结果的方法是更多的历史数据,而不是更多的调优。

2. 无信息孪生

一个跳过交易的过滤器几乎总是会提高你的胜率,因为它移除了交易。那不是优势,而是算术。区分两者的唯一方法是构建一个孪生过滤器,它使用 完全没有信息 ——一种机械的每隔一个信号否决——并与之比较。

我们这样做了,针对市场范围的否决想法。在日线框架上,真实过滤器看起来很好。无信息孪生看起来略好。在四小时框架上,孪生主动伤害,而真实过滤器有帮助。同样的想法,同样的代码,相反的结论——如果没有孪生,我们就会发布日线版本。

净结果变化,百分点 +12.7 +12.5 日线框架 孪生匹配——伪影 +4.6 −4.4 四小时框架 孪生伤害——真实信号 真实过滤器 无信息双胞胎
孪生现在在实验室中对每个过滤器假设都是强制性的。

3. 当模型输给常数时

最雄心勃勃的想法是让梯度提升读取市场状态——美元指数、资金费率、未平仓合约、成交量增量、结构突破、相关性、情绪——并决定现在哪个策略系列适合。我们将其构建为现有门控内的候选排名器,而不是预言机,并在整个宇宙中运行它。

169个符号中的0个 显示出预测提升。模型在八个市场切片和所有四个折叠中的每一个都得分低于常数预测。添加情绪特征使其更差,而不是更好。但同一次运行产生了整个系列中最有用的输出:简单地 拒绝交易 当期望值为负时,它进行了零交易,返回零,并击败了每个模型。不交易是一流的答案,它赢了。

失败构建了什么

这是复合的部分。每个实验都在管道中留下了一个工具,管道现在足够严格,最后一个想法在一天内而不是一周内就被证伪了。

广度优先于回报

结果被解读为“这个工具在多少个工具上成立”,而不是中位数回报。杀死了三个看起来有利可图的想法。

无信息孪生

每个过滤器都与一个使用无信息来稀释样本的孪生进行比较。自否决研究以来强制要求。

噪声底

搜索5,000个参数集,最好的一个看起来很棒是构造上的。底是根据实际尝试的次数计算的,候选必须清除它。

被动基准,按方向

一个在下跌93%的资产上的空头策略通过不做任何聪明的事情赚钱。Alpha是在减去匹配的被动头寸后测量的——多头策略用多头基准,双边策略用两者中较好的一个。

清除、禁运的折叠

训练数据在每个测试窗口周围被切断,因为在窗口之前打开的头寸可能仍在窗口内打开。间隙根据测量的持有时间确定大小,运行在间隙太小时报告,而不是发布泄漏的数字。

保质期

每次重新拟合后,我们测量结果在向前增加距离上的表现。它回答了多久重新优化一次——并揭示了何时从未有过衰减。

对抗性代码审查

审查者寻找不会崩溃的错误数字,然后第二遍尝试反驳每个发现。它捕获了一个静默禁用的指标、一个现有测试断言为正确的透视泄漏,以及一个与错误方向比较的基准。

不交易作为输出

弃权是一个有效的答案,有自己的门。在机器学习运行中,它超越了每个模型。

最后一个实验在全部开启时的样子

最近的想法——在资产和主要货币都转向时突破波动率通道——遇到了完成的管道。它很好地展示了公平测试现在运行得多快,以及策略有多少种不同的方式可以被发现不足。

  • 搜索: 三个时间框架上的913个参数集,呈现为权衡前沿而不是一个赢家。样本内最佳结果:+12.2%。
  • 保留: 在30个最强候选中,一个通过了每个门——它击败了仅仅持有相同空头头寸 0.01个百分点 在14笔交易上。
  • 广度: 不变地转移到29个其他币种,它在1个上通过,而偶然预测0.55。每个币种单独重新搜索,它在25个中的1个上通过,而偶然预测1.25——低于运气。
  • 跨资产: 在50个非加密工具上,它几乎不触发——41个没有产生交易,因为百分比宽度通道是加密波动率构造。不适用而不是无利可图,值得准确地说。
  • 保质期: 仅在每次重新拟合后的第一段为正,在500美元的书上每十天约值65美分。没有衰减。
重新拟合后每段的平均结果 +0.25% 0 −0.25% −0.50% 10天2131 425262 重新拟合后的距离 41次重新拟合,重叠窗口 7次重新拟合,独立窗口
两种采样方案在形状上一致:只有重新拟合后的第一段为正。独立方案噪声更大,因为数量更少——这就是为什么两者都显示。

关于测试他人策略的两件值得知道的事

将图表脚本移植到可测试引擎中是安静错误所在。本系列中的两个例子,都改变了答案:

  • 一个什么都不做的控制。 在最新的脚本中,交易者调优了数周的移动平均块——时间框架、周期、移位——只在图表上绘制。它从不进入入场条件。这些输入不能改变任何一笔交易,优化它们也不会有什么影响。
  • 一个未武装的止损。 同一个脚本在头寸仍为空时从平均入场价计算止损,所以平台静默丢弃括号。因此,第一个头寸在没有保护的情况下运行,直到第二次入场武装一个。以直观方式而不是真实方式建模,将回测从-2.00美元翻转为+15.90美元——符号,而不是幅度。

两者都不是对交易者的批评。两者都是策略必须重新实现并与原始报告进行差异比较而不是信任的原因,也是我们发布差异的原因。

第八个想法,以及方法的来源

该系列有第八个条目,不在记分牌上,因为它不是策略。2026年7月,Vladislav发布了 搜索边缘:一种市场制度感知的算法加密交易决策引擎 ——一种架构而不是规则集,值得用他自己的话而不是我们的总结来阅读。

我们无法测试它,因为里面没有可执行的东西。我们能做的是检查它的提议与我们已测量的内容,并采取我们缺少的部分:

  • 它的核心我们已经被驳斥了。 梯度提升选择器与上面的机器学习实验是相同的假设,它在169个符号上失败了。这不是对架构的反驳——而是测试它的结果,这是更有用的事情。
  • 它的验证部分我们采用了。 清除和禁运的交叉验证是我们管道中唯一真正的差距,现在已实现,包括根据测量的持有时间确定大小的孔,以及拒绝发布泄漏数字的自检。权衡前沿上的风险调整轴和保质期测量也是如此。
  • 它的最强点我们独立确认了。 不交易作为一流决策是整个系列中唯一可测量获胜的事情。

什么会改变裁决

这些想法中没有一个是永久关闭的。每个都有一个明确的条件可以重新开启,并且这些条件故意设计为可证伪:

  • 宏观层变得可测试,当历史覆盖了多个宏观制度,而不仅仅是一个时;
  • 市场范围的否决变得可交付,当它在未经调整的制度中仍然有效时;
  • 平均阶梯变得有趣,当它的结果在整个网格中广泛分布,而不是右尾分布时;
  • 通道突破变得有趣,如果它在从未拟合过的工具上仍然有效时;
  • 机器学习核心变得有趣,当使用不同的目标定义,而不是更多特征时。

在这些情况之一发生之前,诚实的输出是上面的记分板和下面的工具。我们宁愿发布七个负面结果和一个可用的测试台,也不愿发布一条只存在于过去的曲线。