工程领域笔记。 我们正在探索一个系统,它回答的问题比“价格会走向何方?”更狭窄、更有用: 哪种策略(如果有的话)当前足够适合市场状态,值得进行纸面测试?

概念来源: 搜索边缘 由量化研究员 弗拉迪斯拉夫·弗雷丁撰写。本说明是我们对该架构的工程解读及我们自己的测试结果,并非他的文章——他的文章值得先读。我们在构建过程中测量的内容见 实验记分牌.

区别很重要。市场是非平稳的。趋势系统可能在扩张期有效,在震荡期失效;网格系统则可能相反。制度切换引擎的目标不是选出一个永久的赢家。而是结合市场证据,估计几个策略家族的条件下质量,并在证据不足时,将 不交易 作为一级决策。

为什么静态交易系统会衰减

固定的规则集假设其输入与结果之间的关系将保持稳定。真实市场并不保证这一假设。流动性变化、波动率聚集、参与者行为适应,以及宏观或微观结构冲击都会改变数据生成过程本身。

这并不意味着每个策略都必须每周重建。而是系统必须衡量策略的历史背景何时不再与当前背景相似。因此,一个有用的选择器需要具备三种能力:

  • 用因果的、时点性的特征描述当前市场状态;
  • 估计每个合格策略和方向的预期净结果;
  • 当预测过时、未校准、无支持或成本后经济性为负时,放弃交易。

特征引擎先于模型

提升模型无法挽救泄漏或对齐不良的数据集。特征引擎才是真正的基础。候选输入跨越多个时钟和数据源:

特征家族示例主要风险
宏观与结构DXY 偏差、市场状态、结构突破、特征变化、BTC/ETH相关性发布时间和修订数据
衍生品资金费率、未平仓合约、OI变化及比率与更快K线对齐的八小时观察
成交量与波动率CVD、VWAP、锚定VWAP、ATR、成交量分布交易所覆盖范围和成交量定义不一致
策略背景趋势、震荡、压缩、扩张和恐慌状态事后制度标签泄漏未来信息

每个特征行必须仅使用决策时间戳观察到的信息即可重现。实际上,这意味着as-of连接、显式源延迟、新鲜度限制,以及一个改变未来数据并证明历史特征前缀保持不变的因果性测试。

为什么选择梯度提升树

XGBoost, LightGBMCatBoost 结合许多浅层决策树。每棵新树专注于现有集成留下的残差误差。对于嘈杂的表格市场数据,这一家族提供了几个实际优势:

  • 无需深度神经架构即可实现非线性交互;
  • L1/L2正则化和受限树深度;
  • 原生处理缺失值,同时仍需要显式的新鲜度规则;
  • 特征归因工具用于调查,而非替代验证。

模型不是自主交易者。它是更大证据管道中的一个候选组件。有用的输出是定义动作的校准概率,例如锁定趋势策略在下一根K线开多并在固定退出和成本合约下最终净收益为正的概率。

决策合约

每个训练行应绑定时间戳、符号、候选策略、方向、因果特征、入场规则、退出障碍和成本假设。标签是该特定假设交易的实际净结果。 不交易不是超时标签。 它是当没有候选具有正期望值和充分证据时产生的决策。

features at time t
 candidate strategy + direction
 next-open entry
 ATR-scaled TP / SL / time barrier
 fees + slippage + funding
 matured outcome
-------------------------------
 calibrated P(net-positive)

固定的概率阈值(如0.65)可以是研究假设,但不是普遍法则。经济阈值取决于风险回报比、成本、校准误差和容量。我们更倾向于在开发数据内锁定预期净价值规则,然后在开发数据外进行评判。

诚实的验证路径

随机k折验证不适用于重叠的金融标签。我们提出的路径故意更严格:

  1. 外部锚定前向验证: 训练随时间扩展;每个后续测试窗口保持未触及。
  2. 净化和隔离: 交易视野可能跨越边界的训练标签被移除。
  3. 嵌套开发: 早停、特征选择、校准、超参数和决策阈值仅在外部训练窗口内拟合。
  4. 匹配的零假设臂: 块置换标签和暴露匹配的随机信号测试管道是否从噪声中制造边缘。
  5. 密封保留集: 研究协议冻结后,锁箱只打开一次。
  6. 前向纸面账簿: 每个预测、模型版本、结果、费用假设和漂移状态都追加到不可变记录中。

负面结果是有效的工程输出。如果候选在成本后未击败其零假设臂,则记录在案且不晋升。

重要的指标

仅准确率掩盖了类别不平衡,且未说明决策的经济性。模型质量应包括对数损失、Brier分数、期望校准误差、PR-AUC、样本量和覆盖率。财务评估仍然独立:净期望、利润因子、夏普和索提诺比率、最大回撤、恢复、换手率以及相对于简单基线的表现。

公共接口绝不应将所有内容简化为一个绿色百分比。概率必须伴随校准状态、证据年龄、模型版本、前向观察以及明确的纸面或不交易状态。

概念漂移是一种运行状态

即使通过历史检验的模型也可能退化。我们监控特征分布变化、缺失和过时的来源,以及标签成熟后的滚动概率损失。生产安全状态机是保守的:

HEALTHY → WARNING → DEGRADED
                    ↓
                 NO TRADE

恢复需要足够的新证据和新的锁定评估。重新训练不会静默晋升替代模型;它会创建一个具有新版本和前向开始日期的新挑战者。

从研究核心到可用产品

有用的界面不是模型诊断的墙。交易者应看到最受支持的策略拟合、方向、校准概率范围、成本后预期结果、证据状态以及系统选择弃权的原因。更深的层次可以向研究人员展示前向验证折、零假设比较、特征归因、前向历史和漂移。

同一个决策对象可以为优化器、纸质书籍、教育性解释器、警报和公共证据页面提供支持。实时执行仍然是一项独立的许可能力,且绝不因研究结论而隐含。

与我们共同构建

这项工作涉及多个学科。我们期待与以下领域的人士交流:

  • 量化机器学习工程师 从事时间验证、校准、提升和模型监控工作;
  • 数据工程师 构建用于资金、未平仓合约、市场结构和宏观数据的即时管道;
  • 量化研究员 形式化标签、零假设、多重检验控制和风险调整评估;
  • 交易基础设施工程师 专注于纸质账本、成本感知模拟、模型注册和安全执行边界。

如果这是您的领域, 请联系工程团队。如果您想先检查当前的研究表面,请打开 策略优化器、公共 Edge活动以及 FinEdg方法论.