इंजीनियरिंग फील्ड नोट। हम एक ऐसी प्रणाली की खोज कर रहे हैं जो "कीमत कहाँ जाएगी?" से अधिक संकीर्ण और उपयोगी प्रश्न का उत्तर देती है: वर्तमान में बाजार की स्थिति में कौन सी रणनीति, यदि कोई हो, इतनी अच्छी तरह फिट बैठती है कि पेपर टेस्ट के योग्य है?
अवधारणा की उत्पत्ति: सर्च एज मात्रात्मक शोधकर्ता द्वारा व्लादिस्लाव फ्रीडिन। यह नोट उस आर्किटेक्चर की हमारी इंजीनियरिंग रीडिंग और हमारे अपने परीक्षण परिणाम हैं, न कि उनका लेखन — उनका लेखन पहले पढ़ने लायक है। इसे बनाते समय हमने जो मापा वह प्रयोग स्कोरबोर्ड.
पर है। यह अंतर मायने रखता है। बाजार गैर-स्थिर हैं। एक ट्रेंड सिस्टम विस्तार के दौरान काम कर सकता है और रेंज में विफल हो सकता है; एक ग्रिड इसके विपरीत कर सकता है। रेजिम स्विचिंग इंजन का लक्ष्य एक स्थायी विजेता ताज पहनाना नहीं है। यह बाजार के सबूतों को संयोजित करना, कई रणनीति परिवारों की सशर्त गुणवत्ता का अनुमान लगाना और जब सबूत कमजोर हों तो नो ट्रेड को प्रथम श्रेणी का निर्णय बनाना है।
स्थिर ट्रेडिंग सिस्टम क्यों क्षय होते हैं
एक निश्चित नियम सेट मानता है कि इसके इनपुट और परिणामों के बीच संबंध स्थिर रहेगा। वास्तविक बाजार यह धारणा नहीं देते। तरलता बदलती है, अस्थिरता क्लस्टर होती है, प्रतिभागी व्यवहार अनुकूलित होता है, और मैक्रो या माइक्रोस्ट्रक्चर झटके डेटा-जनरेटिंग प्रक्रिया को ही बदल देते हैं।
इसका मतलब यह नहीं है कि हर रणनीति को हर हफ्ते फिर से बनाया जाना चाहिए। इसका मतलब है कि सिस्टम को यह मापना चाहिए कि किसी रणनीति का ऐतिहासिक संदर्भ अब वर्तमान से मेल नहीं खाता। इसलिए एक उपयोगी चयनकर्ता को तीन क्षमताओं की आवश्यकता होती है:
- वर्तमान बाजार स्थिति को कारणात्मक, बिंदु-समय सुविधाओं के साथ वर्णित करें;
- प्रत्येक पात्र रणनीति और दिशा के अपेक्षित शुद्ध परिणाम का अनुमान लगाएं;
- जब भविष्यवाणी पुरानी, अंशांकित नहीं, समर्थित नहीं, या लागत के बाद आर्थिक रूप से नकारात्मक हो तो परहेज करें।
फीचर इंजन मॉडल से पहले आता है
एक बूस्टिंग मॉडल लीक या खराब संरेखित डेटासेट को बचा नहीं सकता। फीचर इंजन ही असली नींव है। उम्मीदवार इनपुट कई क्लॉक और डेटा स्रोतों तक फैले हुए हैं:
| फीचर परिवार | उदाहरण | प्राथमिक जोखिम |
|---|---|---|
| मैक्रो और संरचना | DXY पूर्वाग्रह, बाजार की स्थिति, संरचना का टूटना, चरित्र में बदलाव, BTC/ETH सहसंबंध | प्रकाशन समय और संशोधित डेटा |
| डेरिवेटिव | फंडिंग, ओपन इंटरेस्ट, OI परिवर्तन और अनुपात | आठ घंटे के अवलोकन तेज मोमबत्तियों के साथ संरेखित |
| वॉल्यूम और अस्थिरता | CVD, VWAP, एंकर्ड VWAP, ATR, वॉल्यूम प्रोफाइल | वेन्यू कवरेज और असंगत वॉल्यूम परिभाषाएं |
| रणनीति संदर्भ | ट्रेंड, रेंज, संपीड़न, विस्तार और घबराहट की स्थिति | पोस्ट-हॉक रेजिम लेबल भविष्य की जानकारी लीक कर रहे हैं |
प्रत्येक फीचर पंक्ति केवल निर्णय टाइमस्टैम्प द्वारा देखी गई जानकारी का उपयोग करके पुन: प्रस्तुत करने योग्य होनी चाहिए। व्यवहार में इसका अर्थ है एक एज़-ऑफ जॉइन, स्पष्ट स्रोत विलंबता, ताजगी सीमाएं, और एक कार्य-कारण परीक्षण जो भविष्य के डेटा को बदलता है और साबित करता है कि ऐतिहासिक फीचर उपसर्ग समान रहता है।
ग्रेडिएंट-बूस्टेड ट्री क्यों
XGBoost, LightGBM, और CatBoost कई उथले निर्णय वृक्षों को जोड़ता है। प्रत्येक नया पेड़ मौजूदा एन्सेम्बल द्वारा छोड़ी गई अवशिष्ट त्रुटियों पर ध्यान केंद्रित करता है। शोरगुल वाले सारणीबद्ध बाजार डेटा के लिए, यह परिवार कई व्यावहारिक लाभ प्रदान करता है:
- गहरी तंत्रिका वास्तुकला की आवश्यकता के बिना गैर-रैखिक अंतःक्रियाएं;
- L1/L2 नियमितीकरण और सीमित पेड़ गहराई;
- लापता मानों का मूल संचालन, जबकि अभी भी स्पष्ट ताजगी नियमों की आवश्यकता है;
- जांच के लिए फीचर एट्रिब्यूशन उपकरण, सत्यापन के विकल्प के रूप में नहीं।
मॉडल एक स्वायत्त व्यापारी नहीं है। यह एक बड़ी साक्ष्य पाइपलाइन के अंदर एक उम्मीदवार घटक है। एक उपयोगी आउटपुट एक परिभाषित कार्रवाई के लिए एक कैलिब्रेटेड संभावना है, जैसे कि संभावना है कि एक लॉक की गई ट्रेंड रणनीति अगले बार पर लॉन्ग खोलने पर एक निश्चित निकास और लागत अनुबंध के तहत शुद्ध-सकारात्मक समाप्त होगी।
निर्णय अनुबंध
प्रत्येक प्रशिक्षण पंक्ति में टाइमस्टैम्प, प्रतीक, उम्मीदवार रणनीति, दिशा, कारणात्मक विशेषताएं, प्रवेश नियम, निकास बाधाएं और लागत धारणाएं एक साथ बंधी होनी चाहिए। लेबल उस विशिष्ट काल्पनिक व्यापार का वास्तविक शुद्ध परिणाम है। नो ट्रेड एक टाइमआउट लेबल नहीं है। यह वह निर्णय है जो तब उत्पन्न होता है जब किसी भी उम्मीदवार के पास पर्याप्त साक्ष्य के साथ सकारात्मक अपेक्षित मूल्य नहीं होता है।
features at time t
candidate strategy + direction
next-open entry
ATR-scaled TP / SL / time barrier
fees + slippage + funding
matured outcome
-------------------------------
calibrated P(net-positive)
0.65 जैसी एक निश्चित संभाव्यता सीमा एक शोध परिकल्पना हो सकती है, लेकिन यह एक सार्वभौमिक नियम नहीं है। आर्थिक सीमा पुरस्कार-से-जोखिम, लागत, अंशांकन त्रुटि और क्षमता पर निर्भर करती है। हम विकास डेटा के अंदर चयनित एक लॉक किए गए अपेक्षित-शुद्ध-मूल्य नियम को पसंद करते हैं, फिर इसका मूल्यांकन बाहर किया जाता है।
ईमानदार सत्यापन पथ
यादृच्छिक k-फोल्ड सत्यापन ओवरलैपिंग वित्तीय लेबल के लिए अनुपयुक्त है। हमारा प्रस्तावित पथ जानबूझकर कठिन है:
- बाहरी एंकर वॉक-फॉरवर्ड: प्रशिक्षण समय के साथ विस्तारित होता है; प्रत्येक अगली परीक्षण विंडो अछूती रहती है।
- शुद्धि और प्रतिबंध: प्रशिक्षण लेबल जिनका व्यापार क्षितिज सीमा पार कर सकता है, हटा दिए जाते हैं।
- नेस्टेड विकास: जल्दी रोक, सुविधा चयन, अंशांकन, हाइपरपैरामीटर और निर्णय सीमा केवल बाहरी प्रशिक्षण विंडो के अंदर फिट किए जाते हैं।
- मिलान किए गए शून्य हथियार: ब्लॉक-परिवर्तित लेबल और एक्सपोजर-मिलान वाले यादृच्छिक संकेत परीक्षण करते हैं कि क्या पाइपलाइन शोर से लाभ उत्पन्न करती है।
- सीलबंद होल्डआउट: शोध प्रोटोकॉल के जमने के बाद, लॉकबॉक्स एक बार खोला जाता है।
- फॉरवर्ड पेपर बुक: हर भविष्यवाणी, मॉडल संस्करण, परिणाम, शुल्क धारणा और बहाव स्थिति एक अपरिवर्तनीय रिकॉर्ड में जोड़ दी जाती है।
एक नकारात्मक परिणाम मान्य इंजीनियरिंग आउटपुट है। यदि उम्मीदवार लागत के बाद अपने शून्य हथियारों को नहीं हराता है, तो इसे दस्तावेज किया जाता है और प्रचारित नहीं किया जाता है।
महत्वपूर्ण मीट्रिक्स
सटीकता अकेले वर्ग असंतुलन को छिपाती है और निर्णय की अर्थशास्त्र के बारे में कुछ नहीं कहती है। मॉडल गुणवत्ता में लॉग लॉस, ब्रायर स्कोर, अपेक्षित अंशांकन त्रुटि, PR-AUC, नमूना आकार और कवरेज शामिल होना चाहिए। वित्तीय मूल्यांकन अलग रहता है: शुद्ध अपेक्षा, लाभ कारक, शार्प और सॉर्टिनो अनुपात, अधिकतम ड्रॉडाउन, रिकवरी, टर्नओवर और सरल आधार रेखाओं के विरुद्ध प्रदर्शन।
सार्वजनिक इंटरफ़ेस को कभी भी उस सबको एक हरे प्रतिशत में संक्षिप्त नहीं करना चाहिए। संभाव्यता को अंशांकन स्थिति, साक्ष्य आयु, मॉडल संस्करण, आगे के अवलोकन और एक स्पष्ट पेपर या नो-ट्रेड स्थिति के साथ यात्रा करनी चाहिए।
अवधारणा बहाव एक संचालन स्थिति है
यहां तक कि एक मॉडल जो अपनी ऐतिहासिक परीक्षा पास करता है, वह खराब हो सकता है। हम सुविधा वितरण बदलाव, लापता और पुराने स्रोतों, और लेबल परिपक्व होने के बाद रोलिंग संभाव्य हानि की निगरानी करते हैं। एक उत्पादन-सुरक्षित राज्य मशीन रूढ़िवादी है:
HEALTHY → WARNING → DEGRADED
↓
NO TRADE
रिकवरी के लिए पर्याप्त ताजा साक्ष्य और एक नया लॉक किया गया मूल्यांकन आवश्यक है। पुनर्प्रशिक्षण चुपचाप एक प्रतिस्थापन मॉडल को बढ़ावा नहीं देता है; यह एक नए संस्करण और आगे की शुरुआत तिथि के साथ एक नया चैलेंजर बनाता है।
शोध कोर से एक उपयोगी उत्पाद तक
उपयोगी इंटरफ़ेस मॉडल डायग्नोस्टिक्स की दीवार नहीं है। एक व्यापारी को सबसे अच्छी तरह से समर्थित रणनीति फिट, दिशा, कैलिब्रेटेड संभाव्यता सीमा, लागत के बाद अपेक्षित परिणाम, साक्ष्य स्थिति और सिस्टम द्वारा परहेज करने का कारण देखना चाहिए। गहरी परतें वॉक-फॉरवर्ड फोल्ड, शून्य तुलना, सुविधा आरोपण, आगे का इतिहास और शोधकर्ताओं को बहाव को उजागर कर सकती हैं।
वही निर्णय वस्तु ऑप्टिमाइज़र, एक पेपर बुक, शैक्षिक व्याख्याकार, अलर्ट और सार्वजनिक साक्ष्य पृष्ठों को शक्ति प्रदान कर सकती है। लाइव निष्पादन एक अलग अनुमति प्राप्त क्षमता बनी हुई है और कभी भी शोध निर्णय से निहित नहीं है।
हमारे साथ इसे बनाना
यह कार्य कई विषयों में फैला हुआ है। हम निम्नलिखित के साथ बातचीत में रुचि रखते हैं:
- क्वांट एमएल इंजीनियर अस्थायी सत्यापन, अंशांकन, बूस्टिंग और मॉडल निगरानी पर काम कर रहे हैं;
- डेटा इंजीनियर फंडिंग, ओपन इंटरेस्ट, मार्केट स्ट्रक्चर और मैक्रो डेटा के लिए पॉइंट-इन-टाइम पाइपलाइन बना रहे हैं;
- क्वांट शोधकर्ता लेबल, शून्य परिकल्पना, बहु-परीक्षण नियंत्रण और जोखिम-समायोजित मूल्यांकन को औपचारिक रूप दे रहे हैं;
- ट्रेडिंग इंफ्रास्ट्रक्चर इंजीनियर पेपर लेजर, लागत-जागरूक सिमुलेशन, मॉडल रजिस्ट्री और सुरक्षित निष्पादन सीमाओं पर केंद्रित हैं।
यदि यह आपका क्षेत्र है, इंजीनियरिंग टीम से संपर्क करें. यदि आप पहले वर्तमान शोध सतह का निरीक्षण करना चाहते हैं, तो खोलें स्ट्रैटेजी ऑप्टिमाइज़र, सार्वजनिक एज अभियान, और फिनएड्ज पद्धति.