Інженерна польова нотатка. Over four weeks we were handed seven trading ideas — most of them from quantitative researcher Владислава Фрейдина. We built each one, tested it against the same fail-closed protocol, and wrote down what happened. None of them produced a proven edge. This note is the scoreboard, because the interesting part is not the verdicts — it is that every failure left a permanent instrument behind, and the instruments are now what makes the next test cheap.

The protocol every idea meets

An idea does not get a verdict from one backtest. It walks a ladder of gates, each of which has killed at least one of the seven ideas below. The order matters: the cheap, brutal gates come first.

GATE WHAT IT ASKS STOPPED 1 · Sample size Are there enough trades to say anything at all? deda3 2 · Noise floor Does it beat the best of N random tries? deda5 3 · Out of sample Does it survive data the search never saw? deda7 4 · Passive benchmark Does it beat simply holding the same exposure? deda9 5 · Null control Does it beat a twin with the signal replaced by coin flips? deda6 6 · Breadth Does it hold on instruments it was not fitted to? deda9 7 · Forward paper Does it still work on data that did not exist yet? not reached
Nothing in the series reached gate 7. Two ideas are parked at gate 6 as hypotheses.

The scoreboard

Seven experiments, four weeks, one protocol. The last column is the number that ended each one.

EXPERIMENT THE IDEA VERDICT THE NUMBER THAT ENDED IT
Pine parity
04 Jul · FVB indicators
Stack four market-state filters; trade only when all agree NULL RESULT Composite vs single filter, out of sample: mean −27%, helped on 1 of 5 coins
Three-engine hierarchy
08 Jul · deda3
Structure, then relative strength, then a macro layer on top НЕ ГОТОВА 0 of 10 strategy-timeframe cells cleared the gate; ~4,900 trials
Re-optimisation cadence
13 Jul · deda5
Markets are quasi-stationary, so re-fit the setup every week BELOW NOISE Шарп 2.38 against a best-of-24 noise floor of 3.57; 47 trades vs the trader's own 100 minimum
Averaging ladder
16 Jul · deda7
Add two limit orders below entry, one shared stop NOT PRODUCTION Of 172,224 combinations, 0–16% were positive out of sample on the fast frame; grid average −48% to −90%
Market-wide veto
16 Jul · deda6
Do not fight the market: trade only when the asset and the majors agree REGIME ONLY The best-looking cell was matched by an information-free twin; the hard version cost −28 points of alpha
Regime-switching ML
26 Jul · deda8
Let gradient boosting pick which strategy fits the current state REFUTED 0 of 169 symbols showed predictive lift; the model was worse than a constant in every slice and fold
Channel break plus oscillator
27 Jul · deda9
Break a volatility channel while the asset and the majors both turn NO BREADTH Transferred to 29 other coins it passed 1 where luck alone gives 0.55; median alpha −0.25%

Three failures worth studying

1. The sparsity illusion

The first campaign produced a headline of +14.52% out of sample on one cell. It was worthless, and the reason is the most common trap in strategy research: the return was a median over coins, and almost every coin contributing to it had one to three trades. Measured properly — how many coins were profitable out of sample with a real sample size — the same cell scored 0 of 19.

WHAT THE HEADLINE SAID +14.52% median return, out of sample WHAT THE BREADTH SAID 0 / 19 coins profitable with a real sample HOW A MEDIAN INFLATES coin with 2 lucky trades — counted once coin with 1 trade — counted once coin with 40 trades — also counted once Read breadth before you read the return.

The same campaign taught a second lesson within hours. The star cell of the first wave — 13 of 20 coins profitable on the fast frame — evaporated when we replaced 30 days of history with several years. On deep data every setup on that frame was negative, from −9.2% to −41.5%. The fix for a weak result is more history, not more tuning.

2. The information-free twin

A filter that skips trades will almost always improve your win rate, because it removes trades. That is not edge, it is arithmetic. The only way to tell the difference is to build a twin filter that thins the sample by the same amount using no information at all — механічне вето через один сигнал — і порівняти з ним.

Ми зробили це з ідеєю загальноринкового вето. На денному таймфреймі реальний фільтр виглядав чудово. Інформаційно порожній двійник виглядав трохи краще. На чотиригодинному таймфреймі двійник активно шкодив, тоді як реальний фільтр допомагав. Та сама ідея, той самий код, протилежні висновки — і без двійника ми б випустили денну версію.

ЗМІНА ЧИСТОГО РЕЗУЛЬТАТУ, ВІДСОТКОВІ ПУНКТИ +12.7 +12.5 Денний таймфрейм двійник збігається — артефакт +4.6 −4.4 Чотиригодинний таймфрейм двійник шкодить — реальний сигнал реальний фільтр information-free twin
Тепер двійник є обов'язковим для кожної гіпотези фільтра в лабораторії.

3. Коли модель програє константі

Найамбітнішою ідеєю було дозволити градієнтному бустингу читати стан ринку — індекс долара, фінансування, відкритий інтерес, дельту обсягу, структурні розриви, кореляцію, настрої — і вирішувати, яка родина стратегій підходить зараз. Ми побудували його як ранжувальник кандидатів у межах наявних воріт, а не як оракула, і запустили по всьому універсуму.

0 із 169 символів показали передбачувальний приріст. Модель показала гірший результат, ніж постійне передбачення, у кожному з восьми зрізів ринку та у всіх чотирьох фолдах. Додавання ознаки настроїв погіршило результат, а не покращило. Але той самий запуск дав найкорисніший результат усієї серії: конфігурація, яка просто відмовилася торгувати коли очікувана вартість була негативною, зробила нуль угод, повернула нуль і перевершила всі моделі. No Trade — це повноцінна відповідь, і вона перемогла.

Що побудували невдачі

Це частина, яка накопичується. Кожен експеримент залишав інструмент у конвеєрі, і тепер конвеєр настільки суворий, що останню ідею було спростовано за один день, а не за тиждень.

Широта перед прибутковістю

Результат читається як «на скількох інструментах це тримається», а не як медіанна прибутковість. Це вбило три ідеї, які виглядали прибутковими.

Інформаційно порожній двійник

Кожен фільтр порівнюється з двійником, який проріджує вибірку без використання інформації. Обов'язково з часів дослідження вето.

Шумова підлога

Пошук 5000 наборів параметрів — і найкращий виглядає блискучим за конструкцією. Підлога обчислюється з фактичної кількості спроб, і кандидат має її перевершити.

Пасивний бенчмарк за напрямком

Коротка стратегія на активі, який впав на 93%, заробляє гроші, не роблячи нічого розумного. Альфа вимірюється після віднімання відповідної пасивної позиції — довгий бенчмарк для довгих стратегій, і кращий з двох для двосторонніх.

Очищені, з ембарго фолди

Навчальні дані вирізаються навколо кожного тестового вікна, оскільки позиція, відкрита до вікна, може все ще бути відкритою всередині нього. Розрив розмірюється за виміряним часом утримання, і запуск повідомляє, коли він занадто малий, замість публікації витоку.

Термін придатності

Після кожного перенавчання ми вимірюємо результат на зростаючих відстанях у майбутнє. Це відповідає, як часто переоптимізовувати — і виявляє, коли ніколи не було чого розпадатися.

Адверсаріальний код-рев'ю

Рев'юери шукають неправильні числа, які не викликають збоїв, а потім другий прохід намагається спростувати кожну знахідку. Це виявило тихо вимкнений індикатор, витік погляду в майбутнє, який існуючий тест стверджував як правильний, і бенчмарк, порівняний з неправильним напрямком.

No Trade як результат

Утримання — це дійсна відповідь з власними воротами. У запуску машинного навчання воно перевершило всі моделі.

Як виглядав останній експеримент з усім увімкненим

Остання ідея — пробити волатильний канал, коли актив і мажори обидва розвертаються — зустріла готовий конвеєр. Це корисна демонстрація того, як швидко тепер працює чесний тест, і скількома різними способами стратегія може бути визнана недостатньою.

  • Пошук: 913 наборів параметрів на трьох таймфреймах, представлених як фронтір компромісів, а не один переможець. Найкращий внутрішньовибірковий результат: +12,2%.
  • Холдаут: з 30 найсильніших кандидатів один пройшов усі ворота — і він перевершив просте утримання тієї ж короткої позиції на 0,01 відсоткового пункту на 14 угодах.
  • Широта: перенесено без змін на 29 інших монет, де він пройшов на 1, тоді як випадковість передбачає 0,55. При окремому пошуку по кожній монеті він пройшов на 1 з 25, де випадковість передбачає 1,25 — нижче удачі.
  • Міжактивний: на 50 не-крипто інструментах він майже не спрацьовував — 41 не дали жодної угоди, оскільки канал у відсотках ширини — це конструкція крипто-волатильності. Не застосовно, а не збитково, і варто сказати це точно.
  • Термін придатності: позитивний лише в перший відрізок після кожного переналаштування, приблизно 65 центів за десять днів на рахунку 500 доларів. Нічого, що згасає.
СЕРЕДНІЙ РЕЗУЛЬТАТ КОЖНОГО ВІДРІЗКА ПІСЛЯ ПЕРЕНАЛАШТУВАННЯ +0.25% 0 −0.25% −0.50% 10 днів2131 425262 ВІДСТАНЬ ПІСЛЯ ПЕРЕНАЛАШТУВАННЯ 41 переналаштування, перекривні вікна 7 переналаштувань, незалежні вікна
Обидві схеми вибірки згодні щодо форми: лише перший відрізок після переналаштування є позитивним. Незалежна схема більш зашумлена, оскільки їх менше — тому показані обидві.

Дві речі, які варто знати про тестування чужої стратегії

Перенесення скрипта з графіка в тестований рушій — це місце, де живуть тихі помилки. Два приклади з цієї серії, обидва змінили відповідь:

  • Контроль, який нічого не робить. В останньому скрипті блок ковзної середньої, який трейдер налаштовував тижнями — таймфрейм, період, зсув — лише малюється на графіку. Він ніколи не входить в умову входу. Ці вхідні дані не можуть змінити жодної угоди, і жодна їх оптимізація не мала б значення.
  • Стоп, який не активований. Той самий скрипт обчислює свій стоп із середньої ціни входу в момент, коли позиція ще порожня, тому платформа мовчки відкидає брекет. Перша позиція тому працює без захисту, поки другий вхід не активує один. Моделювання інтуїтивним способом замість реального перевернуло бектест з −2.00 до +15.90 доларів — знак, а не величину.

Жодне з цього не є критикою трейдера. Обидва є причиною того, що стратегію потрібно переімплементувати та порівняти з оригінальним звітом, а не довіряти, і причиною, чому ми публікуємо різницю.

Восьма ідея та звідки походить метод

Серія має восьмий запис, якого немає на табло, оскільки це не стратегія. У липні 2026 Владислав опублікував Search Edge: A Market Regime-Aware Decision Engine for Algorithmic Crypto Trading — архітектуру, а не набір правил, і варто прочитати її його власними словами, а не нашим резюме.

Ми не могли її протестувати, оскільки в ній немає нічого, що можна виконати. Що ми могли зробити — це перевірити її пропозиції проти того, що вже виміряли, і взяти частини, яких нам бракувало:

  • Її ядро ми вже спростували. Градієнтний буст-селектор — це та сама гіпотеза, що й експеримент з машинним навчанням вище, і він провалився на 169 символах. Це не спростування архітектури — це результат її тестування, що є кориснішою річчю.
  • Її розділ валідації ми прийняли. Очищена та ембаргована крос-валідація була єдиним справжнім прогалиною в нашому конвеєрі, і тепер вона реалізована, включаючи отвір, розмір якого виміряно з часу утримання, та самоперевірку, яка відмовляється публікувати витікаюче число. Також осі з урахуванням ризику на межі компромісів та вимірювання терміну придатності.
  • Її найсильніший пункт ми підтвердили незалежно. No Trade як рішення першого класу — це єдине в усій серії, що вимірно виграло.

Що змінило б вердикт

Жодна з цих ідей не закрита назавжди. Кожна має заявлену умову, яка б її відкрила, і умови навмисно спростовні:

  • макрорівень стає тестованим, коли історія охоплює кілька макрорежимів, а не один;
  • загальноринкове вето стає готовим до випуску, коли воно тримається через режим, на якому не налаштовувалося;
  • усереднювальна драбина стає цікавою, коли її результат широкий по сітці, а не правий хвіст;
  • прорив каналу стає цікавим, якщо він виживає на інструментах, на яких ніколи не підганявся;
  • ядро машинного навчання стає цікавим з іншим визначенням цілі, а не з більшою кількістю ознак.

Поки жодне з цього не станеться, чесний результат — це табло вище та інструменти нижче. Ми краще опублікуємо сім негативів і робочий тестовий стенд, ніж одну криву, яка існує лише в минулому.