इंजीनियरिंग फील्ड नोट। हम एक ऐसी प्रणाली की खोज कर रहे हैं जो "कीमत कहाँ जाएगी?" से अधिक संकीर्ण और उपयोगी प्रश्न का उत्तर देती है: वर्तमान में बाजार की स्थिति में कौन सी रणनीति, यदि कोई हो, इतनी अच्छी तरह फिट बैठती है कि पेपर टेस्ट के योग्य है?

अवधारणा की उत्पत्ति: सर्च एज मात्रात्मक शोधकर्ता द्वारा व्लादिस्लाव फ्रीडिन। यह नोट उस आर्किटेक्चर की हमारी इंजीनियरिंग रीडिंग और हमारे अपने परीक्षण परिणाम हैं, न कि उनका लेखन — उनका लेखन पहले पढ़ने लायक है। इसे बनाते समय हमने जो मापा वह प्रयोग स्कोरबोर्ड.

पर है। यह अंतर मायने रखता है। बाजार गैर-स्थिर हैं। एक ट्रेंड सिस्टम विस्तार के दौरान काम कर सकता है और रेंज में विफल हो सकता है; एक ग्रिड इसके विपरीत कर सकता है। रेजिम स्विचिंग इंजन का लक्ष्य एक स्थायी विजेता ताज पहनाना नहीं है। यह बाजार के सबूतों को संयोजित करना, कई रणनीति परिवारों की सशर्त गुणवत्ता का अनुमान लगाना और जब सबूत कमजोर हों तो नो ट्रेड को प्रथम श्रेणी का निर्णय बनाना है।

स्थिर ट्रेडिंग सिस्टम क्यों क्षय होते हैं

एक निश्चित नियम सेट मानता है कि इसके इनपुट और परिणामों के बीच संबंध स्थिर रहेगा। वास्तविक बाजार यह धारणा नहीं देते। तरलता बदलती है, अस्थिरता क्लस्टर होती है, प्रतिभागी व्यवहार अनुकूलित होता है, और मैक्रो या माइक्रोस्ट्रक्चर झटके डेटा-जनरेटिंग प्रक्रिया को ही बदल देते हैं।

इसका मतलब यह नहीं है कि हर रणनीति को हर हफ्ते फिर से बनाया जाना चाहिए। इसका मतलब है कि सिस्टम को यह मापना चाहिए कि किसी रणनीति का ऐतिहासिक संदर्भ अब वर्तमान से मेल नहीं खाता। इसलिए एक उपयोगी चयनकर्ता को तीन क्षमताओं की आवश्यकता होती है:

  • वर्तमान बाजार स्थिति को कारणात्मक, बिंदु-समय सुविधाओं के साथ वर्णित करें;
  • प्रत्येक पात्र रणनीति और दिशा के अपेक्षित शुद्ध परिणाम का अनुमान लगाएं;
  • जब भविष्यवाणी पुरानी, अंशांकित नहीं, समर्थित नहीं, या लागत के बाद आर्थिक रूप से नकारात्मक हो तो परहेज करें।

फीचर इंजन मॉडल से पहले आता है

एक बूस्टिंग मॉडल लीक या खराब संरेखित डेटासेट को बचा नहीं सकता। फीचर इंजन ही असली नींव है। उम्मीदवार इनपुट कई क्लॉक और डेटा स्रोतों तक फैले हुए हैं:

फीचर परिवारउदाहरणप्राथमिक जोखिम
मैक्रो और संरचनाDXY पूर्वाग्रह, बाजार की स्थिति, संरचना का टूटना, चरित्र में बदलाव, BTC/ETH सहसंबंधप्रकाशन समय और संशोधित डेटा
डेरिवेटिवफंडिंग, ओपन इंटरेस्ट, OI परिवर्तन और अनुपातआठ घंटे के अवलोकन तेज मोमबत्तियों के साथ संरेखित
वॉल्यूम और अस्थिरताCVD, VWAP, एंकर्ड VWAP, ATR, वॉल्यूम प्रोफाइलवेन्यू कवरेज और असंगत वॉल्यूम परिभाषाएं
रणनीति संदर्भट्रेंड, रेंज, संपीड़न, विस्तार और घबराहट की स्थितिपोस्ट-हॉक रेजिम लेबल भविष्य की जानकारी लीक कर रहे हैं

प्रत्येक फीचर पंक्ति केवल निर्णय टाइमस्टैम्प द्वारा देखी गई जानकारी का उपयोग करके पुन: प्रस्तुत करने योग्य होनी चाहिए। व्यवहार में इसका अर्थ है एक एज़-ऑफ जॉइन, स्पष्ट स्रोत विलंबता, ताजगी सीमाएं, और एक कार्य-कारण परीक्षण जो भविष्य के डेटा को बदलता है और साबित करता है कि ऐतिहासिक फीचर उपसर्ग समान रहता है।

ग्रेडिएंट-बूस्टेड ट्री क्यों

XGBoost, LightGBM, और CatBoost कई उथले निर्णय वृक्षों को जोड़ता है। प्रत्येक नया पेड़ मौजूदा एन्सेम्बल द्वारा छोड़ी गई अवशिष्ट त्रुटियों पर ध्यान केंद्रित करता है। शोरगुल वाले सारणीबद्ध बाजार डेटा के लिए, यह परिवार कई व्यावहारिक लाभ प्रदान करता है:

  • गहरी तंत्रिका वास्तुकला की आवश्यकता के बिना गैर-रैखिक अंतःक्रियाएं;
  • L1/L2 नियमितीकरण और सीमित पेड़ गहराई;
  • लापता मानों का मूल संचालन, जबकि अभी भी स्पष्ट ताजगी नियमों की आवश्यकता है;
  • जांच के लिए फीचर एट्रिब्यूशन उपकरण, सत्यापन के विकल्प के रूप में नहीं।

मॉडल एक स्वायत्त व्यापारी नहीं है। यह एक बड़ी साक्ष्य पाइपलाइन के अंदर एक उम्मीदवार घटक है। एक उपयोगी आउटपुट एक परिभाषित कार्रवाई के लिए एक कैलिब्रेटेड संभावना है, जैसे कि संभावना है कि एक लॉक की गई ट्रेंड रणनीति अगले बार पर लॉन्ग खोलने पर एक निश्चित निकास और लागत अनुबंध के तहत शुद्ध-सकारात्मक समाप्त होगी।

निर्णय अनुबंध

प्रत्येक प्रशिक्षण पंक्ति में टाइमस्टैम्प, प्रतीक, उम्मीदवार रणनीति, दिशा, कारणात्मक विशेषताएं, प्रवेश नियम, निकास बाधाएं और लागत धारणाएं एक साथ बंधी होनी चाहिए। लेबल उस विशिष्ट काल्पनिक व्यापार का वास्तविक शुद्ध परिणाम है। नो ट्रेड एक टाइमआउट लेबल नहीं है। यह वह निर्णय है जो तब उत्पन्न होता है जब किसी भी उम्मीदवार के पास पर्याप्त साक्ष्य के साथ सकारात्मक अपेक्षित मूल्य नहीं होता है।

features at time t
 candidate strategy + direction
 next-open entry
 ATR-scaled TP / SL / time barrier
 fees + slippage + funding
 matured outcome
-------------------------------
 calibrated P(net-positive)

0.65 जैसी एक निश्चित संभाव्यता सीमा एक शोध परिकल्पना हो सकती है, लेकिन यह एक सार्वभौमिक नियम नहीं है। आर्थिक सीमा पुरस्कार-से-जोखिम, लागत, अंशांकन त्रुटि और क्षमता पर निर्भर करती है। हम विकास डेटा के अंदर चयनित एक लॉक किए गए अपेक्षित-शुद्ध-मूल्य नियम को पसंद करते हैं, फिर इसका मूल्यांकन बाहर किया जाता है।

ईमानदार सत्यापन पथ

यादृच्छिक k-फोल्ड सत्यापन ओवरलैपिंग वित्तीय लेबल के लिए अनुपयुक्त है। हमारा प्रस्तावित पथ जानबूझकर कठिन है:

  1. बाहरी एंकर वॉक-फॉरवर्ड: प्रशिक्षण समय के साथ विस्तारित होता है; प्रत्येक अगली परीक्षण विंडो अछूती रहती है।
  2. शुद्धि और प्रतिबंध: प्रशिक्षण लेबल जिनका व्यापार क्षितिज सीमा पार कर सकता है, हटा दिए जाते हैं।
  3. नेस्टेड विकास: जल्दी रोक, सुविधा चयन, अंशांकन, हाइपरपैरामीटर और निर्णय सीमा केवल बाहरी प्रशिक्षण विंडो के अंदर फिट किए जाते हैं।
  4. मिलान किए गए शून्य हथियार: ब्लॉक-परिवर्तित लेबल और एक्सपोजर-मिलान वाले यादृच्छिक संकेत परीक्षण करते हैं कि क्या पाइपलाइन शोर से लाभ उत्पन्न करती है।
  5. सीलबंद होल्डआउट: शोध प्रोटोकॉल के जमने के बाद, लॉकबॉक्स एक बार खोला जाता है।
  6. फॉरवर्ड पेपर बुक: हर भविष्यवाणी, मॉडल संस्करण, परिणाम, शुल्क धारणा और बहाव स्थिति एक अपरिवर्तनीय रिकॉर्ड में जोड़ दी जाती है।

एक नकारात्मक परिणाम मान्य इंजीनियरिंग आउटपुट है। यदि उम्मीदवार लागत के बाद अपने शून्य हथियारों को नहीं हराता है, तो इसे दस्तावेज किया जाता है और प्रचारित नहीं किया जाता है।

महत्वपूर्ण मीट्रिक्स

सटीकता अकेले वर्ग असंतुलन को छिपाती है और निर्णय की अर्थशास्त्र के बारे में कुछ नहीं कहती है। मॉडल गुणवत्ता में लॉग लॉस, ब्रायर स्कोर, अपेक्षित अंशांकन त्रुटि, PR-AUC, नमूना आकार और कवरेज शामिल होना चाहिए। वित्तीय मूल्यांकन अलग रहता है: शुद्ध अपेक्षा, लाभ कारक, शार्प और सॉर्टिनो अनुपात, अधिकतम ड्रॉडाउन, रिकवरी, टर्नओवर और सरल आधार रेखाओं के विरुद्ध प्रदर्शन।

सार्वजनिक इंटरफ़ेस को कभी भी उस सबको एक हरे प्रतिशत में संक्षिप्त नहीं करना चाहिए। संभाव्यता को अंशांकन स्थिति, साक्ष्य आयु, मॉडल संस्करण, आगे के अवलोकन और एक स्पष्ट पेपर या नो-ट्रेड स्थिति के साथ यात्रा करनी चाहिए।

अवधारणा बहाव एक संचालन स्थिति है

यहां तक कि एक मॉडल जो अपनी ऐतिहासिक परीक्षा पास करता है, वह खराब हो सकता है। हम सुविधा वितरण बदलाव, लापता और पुराने स्रोतों, और लेबल परिपक्व होने के बाद रोलिंग संभाव्य हानि की निगरानी करते हैं। एक उत्पादन-सुरक्षित राज्य मशीन रूढ़िवादी है:

HEALTHY → WARNING → DEGRADED
                    ↓
                 NO TRADE

रिकवरी के लिए पर्याप्त ताजा साक्ष्य और एक नया लॉक किया गया मूल्यांकन आवश्यक है। पुनर्प्रशिक्षण चुपचाप एक प्रतिस्थापन मॉडल को बढ़ावा नहीं देता है; यह एक नए संस्करण और आगे की शुरुआत तिथि के साथ एक नया चैलेंजर बनाता है।

शोध कोर से एक उपयोगी उत्पाद तक

उपयोगी इंटरफ़ेस मॉडल डायग्नोस्टिक्स की दीवार नहीं है। एक व्यापारी को सबसे अच्छी तरह से समर्थित रणनीति फिट, दिशा, कैलिब्रेटेड संभाव्यता सीमा, लागत के बाद अपेक्षित परिणाम, साक्ष्य स्थिति और सिस्टम द्वारा परहेज करने का कारण देखना चाहिए। गहरी परतें वॉक-फॉरवर्ड फोल्ड, शून्य तुलना, सुविधा आरोपण, आगे का इतिहास और शोधकर्ताओं को बहाव को उजागर कर सकती हैं।

वही निर्णय वस्तु ऑप्टिमाइज़र, एक पेपर बुक, शैक्षिक व्याख्याकार, अलर्ट और सार्वजनिक साक्ष्य पृष्ठों को शक्ति प्रदान कर सकती है। लाइव निष्पादन एक अलग अनुमति प्राप्त क्षमता बनी हुई है और कभी भी शोध निर्णय से निहित नहीं है।

हमारे साथ इसे बनाना

यह कार्य कई विषयों में फैला हुआ है। हम निम्नलिखित के साथ बातचीत में रुचि रखते हैं:

  • क्वांट एमएल इंजीनियर अस्थायी सत्यापन, अंशांकन, बूस्टिंग और मॉडल निगरानी पर काम कर रहे हैं;
  • डेटा इंजीनियर फंडिंग, ओपन इंटरेस्ट, मार्केट स्ट्रक्चर और मैक्रो डेटा के लिए पॉइंट-इन-टाइम पाइपलाइन बना रहे हैं;
  • क्वांट शोधकर्ता लेबल, शून्य परिकल्पना, बहु-परीक्षण नियंत्रण और जोखिम-समायोजित मूल्यांकन को औपचारिक रूप दे रहे हैं;
  • ट्रेडिंग इंफ्रास्ट्रक्चर इंजीनियर पेपर लेजर, लागत-जागरूक सिमुलेशन, मॉडल रजिस्ट्री और सुरक्षित निष्पादन सीमाओं पर केंद्रित हैं।

यदि यह आपका क्षेत्र है, इंजीनियरिंग टीम से संपर्क करें. यदि आप पहले वर्तमान शोध सतह का निरीक्षण करना चाहते हैं, तो खोलें स्ट्रैटेजी ऑप्टिमाइज़र, सार्वजनिक एज अभियान, और फिनएड्ज पद्धति.