엔지니어링 현장 노트. 우리는 "가격이 어디로 갈 것인가?"보다 더 좁고 유용한 질문에 답하는 시스템을 탐구하고 있습니다: 현재 시장 상태에 충분히 잘 맞아서 종이 테스트를 받을 만한 전략이 있다면, 그것은 무엇인가?
개념의 기원: 검색 엣지 퀀트 리서처 블라디슬라프 프레이딘. 이 노트는 그 아키텍처에 대한 우리의 엔지니어링 해석과 우리 자신의 테스트 결과이며, 그의 글은 아닙니다 — 그의 글을 먼저 읽을 가치가 있습니다. 우리가 그것을 구축하면서 측정한 것은 실험 점수판.
구별이 중요합니다. 시장은 비정상적입니다. 추세 시스템은 확장 기간에는 작동하고 레인지에서는 실패할 수 있습니다; 그리드는 그 반대일 수 있습니다. 레짐 스위칭 엔진의 목표는 하나의 영구적인 승자를 선정하는 것이 아닙니다. 그것은 시장 증거를 결합하고, 여러 전략 패밀리의 조건부 품질을 추정하며, 증거가 약할 때 거래 없음 를 일급 결정으로 만드는 것입니다.
정적 거래 시스템이 붕괴하는 이유
고정된 규칙 세트는 입력과 결과 사이의 관계가 안정적으로 유지될 것이라고 가정합니다. 실제 시장은 그 가정을 허용하지 않습니다. 유동성 변화, 변동성 클러스터, 참가자 행동 적응, 그리고 매크로 또는 미시구조 충격이 데이터 생성 프로세스 자체를 이동시킵니다.
그렇다고 모든 전략을 매주 재구축해야 한다는 뜻은 아닙니다. 시스템이 전략의 과거 컨텍스트가 더 이상 현재와 유사하지 않을 때를 측정해야 한다는 뜻입니다. 따라서 유용한 선택기는 세 가지 능력이 필요합니다:
- 인과적이고 시점 특정적인 특징으로 현재 시장 상태를 설명합니다;
- 각 적격 전략과 방향의 기대 순 결과를 추정합니다;
- 예측이 오래되었거나, 보정되지 않았거나, 지지되지 않거나, 비용 후 경제적으로 부정적일 때 기권합니다.
특징 엔진은 모델보다 먼저 옵니다
부스팅 모델은 누출되거나 잘못 정렬된 데이터 세트를 구할 수 없습니다. 특징 엔진이 진정한 기반입니다. 후보 입력은 여러 시계와 데이터 소스에 걸쳐 있습니다:
| 특징 패밀리 | 예시 | 주요 위험 |
|---|---|---|
| 매크로 및 구조 | DXY 바이어스, 시장 상태, 구조 붕괴, 성격 변화, BTC/ETH 상관관계 | 발표 타이밍 및 수정된 데이터 |
| 파생상품 | 펀딩, 미결제약정, OI 변화 및 비율 | 더 빠른 캔들에 정렬된 8시간 관찰 |
| 거래량 및 변동성 | CVD, VWAP, 앵커 VWAP, ATR, 거래량 프로파일 | 거래소 커버리지 및 일관되지 않은 거래량 정의 |
| 전략 컨텍스트 | 추세, 레인지, 압축, 확장 및 패닉 상태 | 사후 레짐 라벨이 미래 정보를 누출 |
모든 특징 행은 결정 타임스탬프에서 관찰된 정보만 사용하여 재현 가능해야 합니다. 실제로는 as-of 조인, 명시적 소스 지연, 신선도 제한, 그리고 미래 데이터를 변경하고 과거 특징 접두사가 동일하게 유지됨을 증명하는 인과성 테스트를 의미합니다.
그래디언트 부스팅 트리를 선택하는 이유
XGBoost, LightGBM, 그리고 CatBoost 여러 개의 얕은 결정 트리를 결합합니다. 각 새 트리는 기존 앙상블이 남긴 잔여 오류에 집중합니다. 노이즈가 많은 표 형식 시장 데이터의 경우, 이 패밀리는 몇 가지 실용적인 이점을 제공합니다:
- 깊은 신경 아키텍처를 요구하지 않는 비선형 상호작용;
- L1/L2 정규화 및 제한된 트리 깊이;
- 누락 값의 기본 처리, 여전히 명시적 신선도 규칙 필요;
- 검증의 대체가 아닌 조사를 위한 특징 기여 도구.
모델은 자율 트레이더가 아닙니다. 그것은 더 큰 증거 파이프라인 내의 하나의 후보 구성 요소입니다. 유용한 출력은 정의된 행동에 대한 보정된 확률입니다. 예를 들어, 잠긴 추세 전략이 다음 바에서 롱으로 열렸을 때 고정된 청산 및 비용 계약 하에서 순이익으로 끝날 확률입니다.
결정 계약
각 훈련 행은 타임스탬프, 심볼, 후보 전략, 방향, 인과적 특징, 진입 규칙, 청산 장벽, 비용 가정을 함께 묶어야 합니다. 라벨은 해당 가상 거래의 실현된 순 결과입니다. 무거래는 타임아웃 라벨이 아닙니다. 이는 충분한 증거와 함께 긍정적인 기대 가치를 가진 후보가 없을 때 생성되는 결정입니다.
features at time t
candidate strategy + direction
next-open entry
ATR-scaled TP / SL / time barrier
fees + slippage + funding
matured outcome
-------------------------------
calibrated P(net-positive)
0.65와 같은 고정 확률 임계값은 연구 가설이 될 수 있지만 보편적인 법칙은 아닙니다. 경제적 임계값은 보상-위험 비율, 비용, 보정 오류, 용량에 따라 달라집니다. 우리는 개발 데이터 내에서 선택된 고정된 기대 순 가치 규칙을 선호하며, 이후 외부 데이터에서 평가합니다.
정직한 검증 경로
무작위 k-겹 검증은 중첩되는 금융 라벨에 부적절합니다. 우리가 제안하는 경로는 의도적으로 더 어렵습니다:
- 외부 고정 워크포워드: 훈련은 시간이 지남에 따라 확장되며, 각 후속 테스트 창은 변경되지 않은 상태로 유지됩니다.
- 정화 및 금지: 거래 기간이 경계를 넘을 수 있는 훈련 라벨은 제거됩니다.
- 중첩 개발: 조기 중단, 특징 선택, 보정, 하이퍼파라미터, 결정 임계값은 외부 훈련 창 내에서만 적합됩니다.
- 일치하는 무효 팔: 블록 순열 라벨과 노출 일치 무작위 신호는 파이프라인이 노이즈에서 엣지를 만드는지 테스트합니다.
- 봉인된 홀드아웃: 연구 프로토콜이 동결된 후, 잠금 상자는 한 번 열립니다.
- 포워드 페이퍼 북: 모든 예측, 모델 버전, 결과, 수수료 가정, 드리프트 상태는 불변 기록에 추가됩니다.
부정적인 결과는 유효한 엔지니어링 출력입니다. 후보가 비용 후 무효 팔을 이기지 못하면 문서화되고 승격되지 않습니다.
중요한 지표
정확도만으로는 클래스 불균형을 숨기고 결정의 경제성에 대해 아무것도 말하지 않습니다. 모델 품질에는 로그 손실, 브라이어 점수, 예상 보정 오류, PR-AUC, 표본 크기, 적용 범위가 포함되어야 합니다. 금융 평가는 별도로 유지됩니다: 순 기대값, 이익 요인, 샤프 및 소르티노 비율, 최대 낙폭, 회복, 회전율, 단순 기준선 대비 성과.
공개 인터페이스는 이 모든 것을 단일 녹색 백분율로 축소해서는 안 됩니다. 확률은 보정 상태, 증거 연령, 모델 버전, 포워드 관찰, 명확한 페이퍼 또는 무거래 상태와 함께 이동해야 합니다.
개념 드리프트는 운영 상태입니다
역사적 검사를 통과한 모델도 저하될 수 있습니다. 우리는 특징 분포 변화, 누락 및 오래된 소스, 라벨 성숙 후 롤링 확률 손실을 모니터링합니다. 프로덕션 안전 상태 머신은 보수적입니다:
HEALTHY → WARNING → DEGRADED
↓
NO TRADE
복구는 충분한 새로운 증거와 새로운 잠금 평가를 요구합니다. 재훈련은 대체 모델을 조용히 승격시키지 않습니다. 새로운 버전과 포워드 시작 날짜를 가진 새로운 도전자를 생성합니다.
연구 코어에서 사용 가능한 제품으로
유용한 인터페이스는 모델 진단 벽이 아닙니다. 트레이더는 가장 잘 지원되는 전략 적합, 방향, 보정된 확률 범위, 비용 후 기대 결과, 증거 상태, 시스템이 기권을 선택한 이유를 볼 수 있어야 합니다. 더 깊은 레이어는 워크포워드 폴드, 무효 비교, 특징 기여, 포워드 기록, 드리프트를 연구자에게 노출할 수 있습니다.
동일한 결정 객체는 최적화 프로그램, 페이퍼 북, 교육용 설명, 알림, 공개 증거 페이지를 지원할 수 있습니다. 실시간 실행은 별도의 권한 있는 기능으로 유지되며 연구 판결에 의해 암시되지 않습니다.
우리와 함께 구축하기
이 작업은 여러 분야에 걸쳐 있습니다. 우리는 다음과 같은 대화에 관심이 있습니다:
- 퀀트 ML 엔지니어 시간적 검증, 보정, 부스팅, 모델 모니터링 작업;
- 데이터 엔지니어 펀딩, 미결제약정, 시장 구조, 매크로 데이터에 대한 시점 파이프라인 구축;
- 퀀트 연구원 라벨, 귀무 가설, 다중 테스트 제어, 위험 조정 평가 공식화;
- 트레이딩 인프라 엔지니어 페이퍼 원장, 비용 인식 시뮬레이션, 모델 레지스트리, 안전한 실행 경계에 초점.
이것이 당신의 분야라면 엔지니어링 팀에 문의하세요. 현재 연구 표면을 먼저 검사하려면 전략 최적화 프로그램, 공개 엣지 캠페인, 그리고 FinEdg 방법론.