Ejemplo público de research — demostración interna

F2 Anticipator V2 — ¿Una señal tardía del libro anticipa mercados BTC Up/Down de 5 minutos?

Veredicto formal: NO-GO

Un modelo causal basado exclusivamente en el libro de órdenes estimaba la probabilidad final de Up y operaba únicamente cuando el edge esperado superaba los costes. El OOS temporal mostró que el edge previsto no persistía bajo supuestos de ejecución realistas.

Esto no es un encargo de cliente. Es un ejemplo público de research de Strateva — una estrategia congelada llevada a través del mismo protocolo interno de validación que se usa en las auditorías de clientes, para demostrar la metodología. No es un sistema de trading validado ni evidencia de rentabilidad futura.

Ver el repositorio en GitHub (se abre en una pestaña nueva)

Resumen de la estrategia

F2 Anticipator V2 opera en los mercados BTC Up/Down de 5 minutos de Polymarket. En T+150 segundos, estima la probabilidad de que Up liquide.

Esa estimación se construye exclusivamente a partir de observaciones causales del libro de órdenes capturadas en T+90, T+120, T+135 y T+150: precio, spread, profundidad visible e imbalance del libro para ambos lados.

Compra el lado con el mayor valor estimado, y solo cuando el edge esperado es de al menos 2 centavos por share después de las comisiones taker.

El modelo, sus features y el umbral de 2 centavos se congelaron antes de que comenzara la ventana de evaluación estrictamente posterior al freeze.

Esto es una repetición de research sobre snapshots históricos del libro de órdenes de PMData, no un bot de trading en vivo: no envía órdenes.

Hipótesis económica

La hipótesis congelada: entre T+90 y T+150, los cambios en el libro binario de BTC podrían contener suficiente información para estimar la probabilidad de liquidación antes del punto de entrada convencional del mercado en T+180. Un modelo logístico deliberadamente de baja capacidad debería poder explotar un mispricing temporal — pero solo cuando su valor estimado supera el ask visible más la comisión taker dinámica.

Antes de cualquier evaluación OOS, se congelaron seis criterios de supervivencia que debían cumplirse todos: al menos 300 señales en al menos 15 días cualificados; EV promedio positivo; un límite inferior del bootstrap diario al 95% por encima de cero; EV positivo en ambas mitades temporales de la muestra; EV positivo bajo un estrés de ejecución de 1 centavo; y un Brier score del modelo por debajo del Brier score del propio libro de órdenes.

Reajustar el modelo, las features o el umbral sobre la misma muestra OOS tras ver estos resultados crearía una nueva hipótesis contaminada — la hipótesis V2 congelada se considera cerrada sobre esta muestra, independientemente del resultado.

Señal y convención de timing

La convención causal de timing es explícita y se verifica mediante el self-test de integridad del modelo en el repositorio:

  • Se capturan snapshots bilaterales del libro en T+90, T+120, T+135 y T+150 — estrictamente antes de la decisión de trading, nunca después.
  • El artefacto logístico congelado estima P(gana Up) directamente a partir de esos snapshots causales.
  • El edge neto se calcula para Up y para Down usando un modelo dinámico de comisión taker.
  • La estrategia opera el lado mejor solo cuando el edge es de al menos 2 centavos, la suma de asks está entre 0,98 y 1,04, el precio de entrada está entre 0,05 y 0,90, y la profundidad visible del ask es de al menos cinco shares.
p_up = modelo(book_90, book_120, book_135, book_150)
fee(p) = 0.07 * p * (1 - p)
edge_up   = p_up       - ask_up   - fee(p_up)
edge_down = (1 - p_up) - ask_down - fee(1 - p_up)
lado a operar = argmax(edge_up, edge_down)
entrar solo si max(edge_up, edge_down) >= 0.02

Protocolo OOS temporal

  • Periodo de evaluación: 7 de junio de 2026 a 10 de julio de 2026 — 34 días naturales.
  • 29 días de trading completos y cualificados de esos 34.
  • 8.352 mercados en la ventana de evaluación; 8.177 filas de features válidas superaron los controles causales de antigüedad del libro.
  • 2.007 señales a nivel de cotización cumplieron las condiciones de edge, banda de precio y profundidad.
  • Los intervalos de confianza usan un bootstrap diario con 10.000 remuestreos.
  • No se acepta ningún snapshot del libro con más de 2 segundos de antigüedad en ningún timestamp de decisión.
  • El modelo de comisión taker es 0,07 × p × (1 − p), aplicado dinámicamente a la propia probabilidad estimada por el modelo.
  • Un test de persistencia de cotización exige que la misma cotización ejecutable, o una mejor, siga disponible un segundo después.
  • Los datos brutos con licencia de PMData quedan excluidos de este repositorio y de esta página; solo se publican salidas agregadas y no propietarias.

Resultados

MuestraEjecuciónnEV neto/shareIC 95% bootstrap diarioEstrés +1c
OOS temporal mensualCotización en T+150,42.007+0,04c[-1,86c, +1,97c]-0,93c
OOS temporal mensualCotización persiste 1 segundo1.129-0,74c[-3,35c, +1,94c]-1,71c
Estrictamente post-freezeCotización en T+150,4807-1,50c[-4,39c, +1,47c]-2,47c
Estrictamente post-freezeCotización persiste 1 segundo437-3,69c[-8,30c, +0,97c]-4,66c
  • El edge previsto promedio fue de +3,31c, pero el EV realizado a nivel de cotización fue de solo +0,04c.
  • El Brier score del modelo fue 0,165898, frente a 0,165569 del libro de órdenes en bruto — el modelo no mejoró la calibración de probabilidad respecto al mercado.
  • Los cuartiles de mayor edge previsto no produjeron mayor EV realizado.
  • La persistencia de cotización se deterioró entre las señales supuestamente más fuertes.
  • La segunda mitad de la muestra mensual y la muestra estrictamente post-freeze fueron ambas negativas.

Gráficos

Gráfico de dos paneles del OOS temporal diario de F2 Anticipator V2: el panel superior muestra el EV neto diario en centavos por share para los supuestos de ejecución de cotización y de persistencia de un segundo, alternando días positivos y negativos; el panel inferior muestra el P&L acumulado en dólares para 5 shares por señal, que sube hasta un máximo a finales de junio antes de caer durante los primeros días de julio, terminando cerca de cero para la cotización y en negativo para la persistencia.
EV diario y P&L acumulado durante el OOS temporal.
Gráfico de barras y líneas que compara el edge previsto con el EV realizado en cuatro cuartiles de edge previsto: el edge previsto aumenta de forma constante de unos 2,2 a 4,8 centavos por share de Q1 a Q4, mientras que el EV realizado para las ejecuciones de cotización y de persistencia de un segundo alcanza su máximo en Q2 y se vuelve negativo en Q3 y Q4 — las señales con mayor edge previsto no produjeron los mayores retornos realizados.
Edge previsto frente a EV realizado por cuartil de señal.

Por qué falló la estrategia

Un NO-GO aquí es un resultado de validación exitoso, no un motivo de vergüenza: el protocolo hizo exactamente lo que estaba diseñado para hacer — rechazar un edge de apariencia plausible que no sobrevive a un escrutinio realista.

  • El edge aparente del modelo no estaba calibrado frente a los resultados realizados.
  • El resultado fue muy sensible a la persistencia de cotización y al estrés de ejecución.
  • El rendimiento se deterioró después del freeze del modelo.
  • Las señales previstas más fuertes no produjeron los retornos realizados más fuertes.
  • Una estimación principal marginalmente positiva con un intervalo de confianza que cruza el cero resultó insuficiente.
  • Los resultados con persistencia y estrictamente post-freeze fueron negativos.

Qué demuestra este caso

  • El edge previsto debe contrastarse frente a un benchmark de resultados realizados, como el Brier score relativo al libro, antes de tratarlo como informativo.
  • Un test de persistencia de cotización y de estrés de ejecución puede invalidar un resultado de EV promedio que parece aceptable sobre el papel.
  • Una ventana de evaluación estrictamente post-freeze es un control adicional relevante más allá de un OOS temporal mensual.
  • Segmentar por cuartil de edge previsto puede revelar que las señales más confiadas de un modelo son las más débiles, no las más fuertes.
  • Congelar de antemano el modelo, las features y el umbral es lo que convierte un NO-GO en un resultado real y no contaminado, en lugar de una invitación a seguir reajustando.

Reproducibilidad

  • Artefacto de modelo logístico congelado con un manifiesto SHA-256 que vincula el modelo a su especificación.
  • La lista exacta de features, el modelo de comisiones y el contrato de ejecución están versionados en el repositorio.
  • Un script de replay causal y reanudable de PMData verifica el hash del modelo congelado antes de puntuar.
  • Los resultados agregados, machine-readable, en JSON y CSV, se versionan junto con el código.
  • Un script reproducible de generación de gráficos regenera ambos gráficos versionados a partir de los resultados agregados.
  • Tests unitarios y un self-test de integridad del modelo verifican el artefacto congelado antes de cada replay.
  • Los archivos brutos de PMData y las filas derivadas a nivel de mercado se excluyen intencionadamente: el dataset de origen tiene licencia y no puede redistribuirse.

Ver el código fuente en GitHub (se abre en una pestaña nueva)

Limitaciones

  • Solo había 29 días completos y cualificados disponibles en la ventana OOS principal.
  • El bloque de 34 días era OOS temporal respecto al entrenamiento, pero cuatro días de junio ya se habían examinado durante el desarrollo de V2.
  • La muestra estrictamente post-freeze es más limpia, pero solo contiene 12 días completos.
  • Los intervalos de confianza siguen siendo amplios en relación con el tamaño del efecto estimado.
  • La persistencia de cotización es solo un proxy de la posibilidad de ejecución, no un modelo completo de posición en cola o de impacto de mercado.
  • Los resultados aplican a la muestra de Polymarket BTC de 5 minutos analizada, no necesariamente a otros mercados o marcos temporales.
  • Los archivos brutos con licencia de PMData no pueden redistribuirse de forma independiente, lo que limita la re-verificación por terceros a las salidas agregadas publicadas aquí.
  • Esto es research histórico, no asesoramiento de inversión ni una previsión.

Veredicto formal

Resumen de validación formal

MétodoResultado
Timing causalPASS
Integridad del modelo y reproducibilidadPASS
Calibración de probabilidad / información incrementalFAIL
Viabilidad económica bajo ejecución realistaFAIL
Estabilidad temporal tras el freeze del modeloFAIL

Deployment: NOT TESTED

Un PASS en timing causal o reproducibilidad solo significa que el experimento se construyó correctamente — no es evidencia de que la estrategia sea rentable. Una implementación correcta no puede rescatar un claim que falla en calibración y viabilidad económica.

Veredicto formal: NO-GO

NO-GO por fallo económico y de estabilidad temporal. La señal no demostró edge incremental y monetizable bajo persistencia de cotización, estrés de ejecución y evaluación estrictamente posterior al freeze. No se recomienda avanzar a shadowing sin formular una hipótesis nueva y realizar una validación completamente independiente.