Validación independiente de research cuantitativo

Research cuantitativo que resiste una auditoría.

Valido de forma independiente estrategias cuantitativas, backtests y modelos financieros para comprobar su validez estadística, relevancia económica, ejecución realista y reproducibilidad.

Un backtest rentable no es evidencia suficiente.

Los resultados pueden desaparecer al corregir el momento de ejecución, los costes, el benchmark, el data leakage, el turnover o el sesgo del investigador.

Qué se valida

  • Metodología

    Causalidad, labels, divisiones de validación, benchmarks y diseño experimental.

  • Economía

    Comisiones y tasas modeladas con su fuente y su fecha, y sensibilidad del resultado al coste y a la rotación. Spreads, slippage, capacidad y latencia se revisan como supuestos declarados: si faltan o no son razonables, se dice en el informe.

  • Estadística

    Incertidumbre, estabilidad, sensibilidad, múltiples pruebas y valor incremental.

  • Implementación

    Código, contabilidad financiera, integridad de datos, tests y reproducibilidad.

Servicios

El precio depende de una sola cosa: qué me mandas. Cuanto más preparado llegue el material, menos cuesta.

  • Análisis de sesgos

    90 €

    Bias analysis

    Me mandas: Tu código.

    Busco look-ahead, fuga de etiquetas y sesgo de supervivencia. Combino un escáner automático con revisión manual de los patrones que el escáner no cubre.

    Recibes: Informe de hallazgos con severidad, ubicación exacta en tu código y qué corregir.

    Un resultado limpio reduce el riesgo, no lo elimina: el análisis estático no prueba ausencia de sesgo.

  • Validación de resultados

    desde 150 €

    Results validation

    Me mandas: Un CSV con dos columnas: fecha y retorno del periodo.

    Recalculo tus métricas desde la serie, las contrasto con lo que declaraste antes de empezar, y firmo el informe.

    Recibes: Informe firmado con métricas recalculadas, gráficos y comparación frente a tu benchmark.

    Este nivel cubre una serie de retornos. Reproducir tu código es el nivel siguiente.

  • Reproducción de estrategia

    desde 490 €

    Strategy reproduction

    Me mandas: Código que ya se puede ejecutar, o un notebook sencillo.

    Lo ejecuto en un entorno aislado, reproduzco tus resultados y los desafío: costes, robustez, subperiodos y significación estadística.

    Recibes: Todo lo anterior, más la reproducción exacta con hashes y el veredicto GO / NO-GO explicado por método.

    Si el código no arranca tal como está, sube al nivel siguiente. Te lo digo antes de empezar, no después.

  • Validación completa

    desde 1.500 €

    Full validation

    Me mandas: Un notebook o un repositorio que hay que reconstruir.

    Incluye el trabajo de adaptación, walk-forward anidado y revisión del código que iría a producción.

    Recibes: Todo lo anterior, más correcciones priorizadas y las condiciones para revalidar.

    El plazo depende del tamaño del repositorio y de si los datos están disponibles.

Un NO-GO significa una de dos cosas, y siempre te digo cuál: que la estrategia falló una prueba concreta, o que la evidencia disponible no permite concluir. No son lo mismo.

Metodología

  1. Alcance

    Definir la hipótesis, el benchmark, la evidencia y los criterios de éxito.

  2. Reproducción

    Ejecutar o reconstruir el resultado sin cambiar silenciosamente la afirmación original.

  3. Revisión adversarial

    Comprobar causalidad, costes, robustez, controles e implementación.

  4. Veredicto

    Entregar una decisión clara, limitaciones y correcciones priorizadas.

Con qué se hace

Tres cosas que casi nadie hace, y que son la diferencia entre una opinión y una comprobación.

  • Escáner de sesgos

    Lee tu código y busca el futuro donde no debería estar.

    Un analizador recorre la estructura de tu código, no su texto. Eso importa: los patrones por los que el futuro se cuela en el pasado casi nunca se escriben igual dos veces, y un buscador de texto se los pierde. Está construido asumiendo que nadie los escribe de forma evidente — resuelve alias, expresiones calculadas y variantes que se leen distinto pero hacen lo mismo.

    Es un filtro, no un certificado. Un resultado limpio reduce el riesgo; no prueba que no haya sesgo.

  • Walk-forward anidado

    Los parámetros se eligen sin ver jamás los datos con los que se juzgan.

    Dos bucles. El interno prueba las configuraciones sobre datos que ya pasaron; el externo evalúa la elegida sobre datos que ese bucle nunca vio. Entre ambos hay un hueco purgado del tamaño del horizonte de la etiqueta, para que ninguna etiqueta de entrenamiento se resuelva dentro del periodo evaluado.

    Verificado por perturbación exhaustiva: alterar cualquier dato futuro no cambia ni una sola decisión anterior.

  • Holdout prospectivo sellado

    El criterio se congela antes de que exista la primera observación.

    El calendario exacto, el benchmark, el modelo de costes y la regla de decisión se fijan y se sellan por hash antes de empezar. Cada observación se añade a un registro encadenado y firmado, en orden, sin poder editar lo anterior. El veredicto se calcula contra esa regla congelada, no contra una elegida después.

    Es la única prueba que no admite reinterpretación a posteriori. También la más lenta: el tiempo tiene que pasar de verdad.

Cada encargo termina en uno de dos veredictos formales

  • GO – Shadowing
  • NO-GO
  • GO – Shadowing: no encontré ningún motivo para descartar la estrategia una vez comprobados el benchmark, los costes y la estabilidad en el tiempo. Significa "pruébala primero en paralelo". Nunca es una autorización para pasar a producción ni para operar con capital real.
  • Un GO – Shadowing puede llevar limitaciones. Solo se admiten si son concretas, están escritas en el informe y no impiden esa fase de prueba en paralelo.
  • NO-GO por fallo real: la estrategia no superó una de las comprobaciones obligatorias. Sabemos qué falló y por qué.
  • NO-GO por evidencia insuficiente: nada falló de forma clara, pero los datos no dan para concluir. No es lo mismo que la anterior, y siempre te digo cuál de las dos te ha tocado.
  • Si la estrategia está lista para producción es una cuestión aparte, se informa por separado y no cambia el veredicto.

Informe de ejemplo

No puedo enseñarte el informe de un cliente. Así que apliqué el proceso a una estrategia mía, publicada en abierto, y el veredicto fue que no funciona. Todas las cifras de abajo salen de esa validación y cualquiera puede clonar el repositorio y comprobarlas.

VALIDATION REPORT

EWMA63-CURRENT200

VALIDACIÓN REAL SOBRE UN REPOSITORIO PÚBLICO — COMPROBABLE POR CUALQUIERA

Resumen ejecutivo

La estrategia recorta exposición cuando detecta estrés de mercado y, al recortar, reduce más las acciones de beta alta. La comparación decisiva no es contra comprar y mantener: es contra una cartera que recorta exactamente la misma exposición sin mirar la beta. Solo así una diferencia puede atribuirse a la capa evaluada.

Estrategia evaluada

CAGR
22.77%
Sharpe
1.343
Caída máxima
-21.82%

Control de exposición igualada

CAGR
22.70%
Sharpe
1.324
Caída máxima
-23.46%

Aportación de la capa

Retorno activo anual
+0.02%
Information ratio
0.025
IC bootstrap 95%
[-0.31%, +0.38%]

Por método

  • CausalPASS WITH LIMITATIONS
  • EstadísticoPASS WITH LIMITATIONS
  • EconómicoFAIL
  • RobustezFAIL

Gates

GateQué compruebaUmbralObservadoResultado
Evidencia absolutaSi la estrategia bate al mercado con significatividadHAC t >= 1.963.518PASS
Control emparejadoSi la capa aporta algo sobre el control de exposición igualadaHAC t >= 1.960.118FAIL
Estrés de costesSi esa aportación sobrevive a un coste de ejecución de 100 pb>= 0% at 100 bps-0.043%FAIL
Estabilidad cronológicaSi al menos dos de tres subperiodos son positivos>= 66.67%33.3%FAIL

Trazabilidad

Control emparejado: FAIL conduce a Económico: FAIL conduce a NO-GO por fallo real

Limitaciones

  • Los parámetros se eligieron después de ver el histórico sobre el que se prueban, así que no existe un periodo futuro intacto.
  • El universo de 200 nombres son empresas que cotizan hoy, lo que infla por construcción la referencia de comprar y mantener.
  • El histórico de precios contiene distorsiones por operaciones societarias que están documentadas pero no rastreadas hasta la fuente.
  • La simulación no modela retorno de la liquidez, impacto de mercado, mínimos de orden ni capacidad.

Condiciones para revalidar

  1. Congelar la especificación actual y recoger un periodo prospectivo real, sin reajustar nada durante ese periodo.
  2. Reconstruir el universo con identificadores de emisor y constituyentes point-in-time.
  3. Evaluar por separado la puerta de exposición sola, que es la que produce casi toda la mejora.
  4. Añadir un modelo de ejecución con costes reales de la cartera y límites de capacidad.
DespliegueINCONCLUSIVE

INCONCLUSIVE: sin periodo prospectivo ni modelo de ejecución ligado a capacidad no puede concluirse nada sobre el despliegue. Se informa por separado del veredicto formal.

Veredicto formal

NO-GO

Motivo: fallo económico real — la capa no aporta valor medible frente al control de exposición igualada

El informe completo

Este resumen es una vista de la página. El documento que recibe un cliente es más largo: explica qué hace la estrategia, con qué se compara y por qué, y qué queda fuera del alcance. Descárgalo y júzgalo tú.

Descargar el informe (PDF)3 páginas · PDF

Ver el repositorio en GitHub

Y un anexo de evidencia

Junto al informe va un anexo con las series, las métricas y las figuras que respaldan cada número: curva de capital, caídas con su duración, métricas móviles, distribución de retornos y las huellas de integridad de los datos de entrada. El informe es lo que se lee para decidir; el anexo es lo que aguanta cuando alguien discute una cifra.

Fragmento del anexo de evidencia que acompaña al informe.
Fragmento del anexo de evidencia que acompaña al informe.

Casos públicos

  • RF100Veredicto: NO-GO

    RF100 — ¿Puede un Random Forest superar al momentum simple?

    Un Random Forest cross-sectional y causal encontró estructura predictiva estadísticamente positiva, pero no consiguió superar un benchmark simple de momentum bajo supuestos de ejecución equivalentes.

    Idea principalLa estructura predictiva no equivale a alpha incremental y monetizable.

  • EWMA_63_StratVeredicto: NO-GO

    EWMA63 — ¿La selección por beta añade valor más allá de reducir exposición?

    La auditoría mostró que la mayor parte de la mejora histórica de Sharpe y drawdown procedía de una menor exposición al mercado, mientras que el valor incremental de la capa EWMA63 era aproximadamente cero.

    Idea principalEl control correcto puede invalidar una estrategia aparentemente exitosa.

  • F2-ANTICIPATOR-V2Veredicto: NO-GO

    F2 Anticipator V2 — ¿Una señal tardía del libro anticipa mercados BTC Up/Down de 5 minutos?

    Un modelo causal basado exclusivamente en el libro de órdenes estimaba la probabilidad final de Up y operaba únicamente cuando el edge esperado superaba los costes. El OOS temporal mostró que el edge previsto no persistía bajo supuestos de ejecución realistas.

    Idea principalEl edge previsto no es alpha monetizable si no calibra, no persiste y se deteriora después del freeze del modelo.

  • Simple-StrategyEJEMPLO PÚBLICO DE RESEARCH

    Estrategia de estructura temporal de volatilidad

    Un ejemplo transparente de asignación sobre SPY que combina un filtro de estructura temporal de VIX con lag, un objetivo de volatilidad realizada, límites de apalancamiento y costes explícitos de turnover.

    Idea principalUna menor volatilidad y un menor drawdown no implican automáticamente superar al benchmark ni generar alpha.

Sobre mí

Soy Nicolae Filip Stanciu, profesional de las finanzas cuantitativas e investigador independiente, graduado en Finanzas, Banca y Seguros y con un máster en Finanzas Cuantitativas.

Mis proyectos cuantitativos se centran en el comportamiento del mercado a partir de datos de precio, volumen y OHLC, especialmente en la volatilidad, el riesgo bajista y los cambios de régimen. He construido y probado estimadores de volatilidad realizada basados en OHLC, modelos de las familias HAR y GARCH, detección de regímenes mediante HMM, VaR, CVaR y CDaR, junto con métodos de construcción de carteras como Markowitz, HRP, risk parity y MST.

Utilizo Python para desarrollar y someter a revisión independiente estrategias y backtests, prestando especial atención al look-ahead bias, el momento de ejecución, los costes de transacción, la elección del benchmark, la validación walk-forward y la reproducibilidad.

Contacto

¿Tienes una estrategia, un backtest o un modelo que necesita una revisión independiente?

La información que envíes se utilizará para evaluar tu solicitud. Consulta la política de privacidad.