工程领域笔记。 我们正在探索一个系统,它回答的问题比“价格会走向何方?”更狭窄、更有用: 哪种策略(如果有的话)当前足够适合市场状态,值得进行纸面测试?
概念来源: 搜索边缘 由量化研究员 弗拉迪斯拉夫·弗雷丁撰写。本说明是我们对该架构的工程解读及我们自己的测试结果,并非他的文章——他的文章值得先读。我们在构建过程中测量的内容见 实验记分牌.
区别很重要。市场是非平稳的。趋势系统可能在扩张期有效,在震荡期失效;网格系统则可能相反。制度切换引擎的目标不是选出一个永久的赢家。而是结合市场证据,估计几个策略家族的条件下质量,并在证据不足时,将 不交易 作为一级决策。
为什么静态交易系统会衰减
固定的规则集假设其输入与结果之间的关系将保持稳定。真实市场并不保证这一假设。流动性变化、波动率聚集、参与者行为适应,以及宏观或微观结构冲击都会改变数据生成过程本身。
这并不意味着每个策略都必须每周重建。而是系统必须衡量策略的历史背景何时不再与当前背景相似。因此,一个有用的选择器需要具备三种能力:
- 用因果的、时点性的特征描述当前市场状态;
- 估计每个合格策略和方向的预期净结果;
- 当预测过时、未校准、无支持或成本后经济性为负时,放弃交易。
特征引擎先于模型
提升模型无法挽救泄漏或对齐不良的数据集。特征引擎才是真正的基础。候选输入跨越多个时钟和数据源:
| 特征家族 | 示例 | 主要风险 |
|---|---|---|
| 宏观与结构 | DXY 偏差、市场状态、结构突破、特征变化、BTC/ETH相关性 | 发布时间和修订数据 |
| 衍生品 | 资金费率、未平仓合约、OI变化及比率 | 与更快K线对齐的八小时观察 |
| 成交量与波动率 | CVD、VWAP、锚定VWAP、ATR、成交量分布 | 交易所覆盖范围和成交量定义不一致 |
| 策略背景 | 趋势、震荡、压缩、扩张和恐慌状态 | 事后制度标签泄漏未来信息 |
每个特征行必须仅使用决策时间戳观察到的信息即可重现。实际上,这意味着as-of连接、显式源延迟、新鲜度限制,以及一个改变未来数据并证明历史特征前缀保持不变的因果性测试。
为什么选择梯度提升树
XGBoost, LightGBM和 CatBoost 结合许多浅层决策树。每棵新树专注于现有集成留下的残差误差。对于嘈杂的表格市场数据,这一家族提供了几个实际优势:
- 无需深度神经架构即可实现非线性交互;
- L1/L2正则化和受限树深度;
- 原生处理缺失值,同时仍需要显式的新鲜度规则;
- 特征归因工具用于调查,而非替代验证。
模型不是自主交易者。它是更大证据管道中的一个候选组件。有用的输出是定义动作的校准概率,例如锁定趋势策略在下一根K线开多并在固定退出和成本合约下最终净收益为正的概率。
决策合约
每个训练行应绑定时间戳、符号、候选策略、方向、因果特征、入场规则、退出障碍和成本假设。标签是该特定假设交易的实际净结果。 不交易不是超时标签。 它是当没有候选具有正期望值和充分证据时产生的决策。
features at time t
candidate strategy + direction
next-open entry
ATR-scaled TP / SL / time barrier
fees + slippage + funding
matured outcome
-------------------------------
calibrated P(net-positive)
固定的概率阈值(如0.65)可以是研究假设,但不是普遍法则。经济阈值取决于风险回报比、成本、校准误差和容量。我们更倾向于在开发数据内锁定预期净价值规则,然后在开发数据外进行评判。
诚实的验证路径
随机k折验证不适用于重叠的金融标签。我们提出的路径故意更严格:
- 外部锚定前向验证: 训练随时间扩展;每个后续测试窗口保持未触及。
- 净化和隔离: 交易视野可能跨越边界的训练标签被移除。
- 嵌套开发: 早停、特征选择、校准、超参数和决策阈值仅在外部训练窗口内拟合。
- 匹配的零假设臂: 块置换标签和暴露匹配的随机信号测试管道是否从噪声中制造边缘。
- 密封保留集: 研究协议冻结后,锁箱只打开一次。
- 前向纸面账簿: 每个预测、模型版本、结果、费用假设和漂移状态都追加到不可变记录中。
负面结果是有效的工程输出。如果候选在成本后未击败其零假设臂,则记录在案且不晋升。
重要的指标
仅准确率掩盖了类别不平衡,且未说明决策的经济性。模型质量应包括对数损失、Brier分数、期望校准误差、PR-AUC、样本量和覆盖率。财务评估仍然独立:净期望、利润因子、夏普和索提诺比率、最大回撤、恢复、换手率以及相对于简单基线的表现。
公共接口绝不应将所有内容简化为一个绿色百分比。概率必须伴随校准状态、证据年龄、模型版本、前向观察以及明确的纸面或不交易状态。
概念漂移是一种运行状态
即使通过历史检验的模型也可能退化。我们监控特征分布变化、缺失和过时的来源,以及标签成熟后的滚动概率损失。生产安全状态机是保守的:
HEALTHY → WARNING → DEGRADED
↓
NO TRADE
恢复需要足够的新证据和新的锁定评估。重新训练不会静默晋升替代模型;它会创建一个具有新版本和前向开始日期的新挑战者。
从研究核心到可用产品
有用的界面不是模型诊断的墙。交易者应看到最受支持的策略拟合、方向、校准概率范围、成本后预期结果、证据状态以及系统选择弃权的原因。更深的层次可以向研究人员展示前向验证折、零假设比较、特征归因、前向历史和漂移。
同一个决策对象可以为优化器、纸质书籍、教育性解释器、警报和公共证据页面提供支持。实时执行仍然是一项独立的许可能力,且绝不因研究结论而隐含。
与我们共同构建
这项工作涉及多个学科。我们期待与以下领域的人士交流:
- 量化机器学习工程师 从事时间验证、校准、提升和模型监控工作;
- 数据工程师 构建用于资金、未平仓合约、市场结构和宏观数据的即时管道;
- 量化研究员 形式化标签、零假设、多重检验控制和风险调整评估;
- 交易基础设施工程师 专注于纸质账本、成本感知模拟、模型注册和安全执行边界。
如果这是您的领域, 请联系工程团队。如果您想先检查当前的研究表面,请打开 策略优化器、公共 Edge活动以及 FinEdg方法论.