La lotería de las variantes: el Sharpe deflactado explicado sin fórmulas
El torneo de 2.255 estrategias probó tantas combinaciones que necesitaba un listón que subiera con el tamaño de la búsqueda, no uno fijo. La única superviviente se quedó a −0,525 de superarlo, y la prueba decisiva llegó después: pasó de batir a comprar-y-mantener en 3 de 4 activos en validación a 0 de 4 en el test.
Compra suficientes boletos de lotería y alguno tocará. Eso no dice nada sobre la calidad de ese boleto en particular: dice algo sobre cuántos se compraron. El torneo de estrategias de trading que venimos contando en esta serie probó 2.255 variantes distintas, y antes de fiarse del mejor resultado tuvo que responder una pregunta incómoda: ¿ese resultado es mejor que el mejor billete que produciría el puro azar, probando el mismo número de veces? Este artículo explica cómo se responde esa pregunta, sin necesidad de la fórmula para entenderla.
Por qué probar más siempre encuentra algo que brilla
El listón que sube con la búsqueda
El experimento calculó ese umbral con una fórmula estándar en gestión cuantitativa (el máximo esperado bajo la hipótesis de puro azar, de Bailey y López de Prado), que depende de cuántas variantes se probaron y de cuánto varía el resultado entre ellas. Con las 2.250 variantes individuales del torneo, y usando solo las 1.750 que tenían un resultado definido en las cuatro categorías de activo (las otras 500 quedaron excluidas por falta de datos suficientes, nunca sustituidas por un cero), el listón quedó en 0,9718 de Sharpe medio. Con las 2.255 (sumando las 5 combinaciones de estrategias), prácticamente el mismo número: 0,9720.
El número: 0,4467 contra un listón de 0,9718
La única estrategia que sobrevivió al filtro de robustez llegó a este punto con un Sharpe medio de 0,4467. Un margen de −0,525 frente al listón: ni la mitad de lo exigido. La mejor combinación de estrategias (una cartera de las dos más prometedoras) llegó algo más lejos, 0,549, pero también se quedó corta, con un margen de −0,423. Ninguna de las 2.255 variantes, individuales o combinadas, superó su propio listón.
La confirmación fuera de muestra
El número del Sharpe deflactado por sí solo ya habría bastado para no declarar victoria, pero el torneo tenía una prueba adicional, y resultó ser la más contundente de todas. La misma estrategia que en la validación (la partición donde ocurrió toda la búsqueda) batía a comprar-y-mantener en 3 de los 4 activos, pasó a 0 de 4 en el test, la partición que nadie había tocado antes de ese disparo único. Es exactamente el comportamiento que predice un resultado que no se distingue del mejor billete de una lotería: brilla donde se buscó, y desaparece donde no se había buscado todavía.
Monte Carlo y bootstrap: dos formas más de no engañarse
El torneo añadió dos comprobaciones más sobre la partición de test, cada una desde un ángulo distinto. La simulación de Monte Carlo compara el Sharpe real de cada campeona con el que produciría una estrategia sin ninguna habilidad real, aplicada al mismo histórico: ninguna de las 6 superó el percentil 95 de esa distribución nula, ni siquiera la más cercana (0,614 frente a un umbral de 0,821). Y los intervalos de confianza del Sharpe por bootstrap, calculados activo por activo, cruzan el cero en casi todos los casos — salvo, con matices, en el promedio agregado entre los cuatro activos de las dos mejores candidatas, donde el intervalo se queda por encima de cero sin llegar a cruzarlo. Ni siquiera esa excepción bastó: entre el listón del Sharpe deflactado, la caída en el test y el veredicto de Monte Carlo, ninguna candidata reunió los tres a la vez.
Qué significa esto para cualquier resultado que veas en internet
La próxima vez que un backtest presuma de un resultado espectacular, la pregunta que de verdad importa no es "¿es bueno el número?". Es "¿cuántas variantes se probaron antes de enseñarme esta?". Casi ningún backtest que circula por internet responde esa pregunta, y muchos ni siquiera la registran. El torneo la fijó por escrito antes de calcular nada, la aplicó con el mismo rigor a su propia mejor candidata, y publicó el resultado negativo con el mismo detalle que habría publicado uno positivo — que es, en el fondo, la explicación de por qué esta serie existe.
Nada de este artículo es una recomendación de inversión, y nada en NodeWitness lo es. Puedes leer el veredicto completo del torneo, por qué la pata corta pierde incluso cobrando el funding, o seguir el Score de ciclo en vivo de NodeWitness, con la misma disciplina de publicar también lo que no funciona.
Última actualización: 24 de agosto de 2026