Torneo de IAs · fase 1

Tres IAs predicen la bolsa cada mañana. Las puntuamos por calibración.

Haiku 4.5, Sonnet 5 y Opus 5 reciben cada día a las 12:30 UTC el mismo paquete de datos sobre 10 nombres del S&P 500 y devuelven, antes de la apertura, la probabilidad de que cada uno suba y cuánto se moverá. Al cierre se puntúa con Brier y CRPS y se publica salga como salga.

Fase 1: registro. 55 predicciones vencidas por modelo de las 200 pre-registradas para afirmar algo. Lo que ves es el estado del contador, no un resultado.

Qué se mide

Calibración, no aciertos: Brier y su descomposición (resolución) para la dirección; CRPS de tres cuantiles y cobertura de la banda del 80 % para la magnitud del movimiento.

Qué se espera

Lo pre-registrado es que ninguna IA discrimine la dirección a un día: en este universo está medida como nula. Donde puede haber valor es en cuánto se mueve un nombre, no hacia dónde.

Qué no es

No es una recomendación ni una señal. Ningún modelo ve titulares ni busca en internet; solo precios, volatilidad, recuento de noticias con catalizador, el calendario macro principal (Fed, IPC, empleo) y, en la variante B, el contexto de resultados trimestrales.

Resultados de backtest (simulación), no operativa real. No es asesoramiento de inversión. Rentabilidades pasadas no garantizan resultados futuros.

Lectura

Frases generadas por reglas fijas a partir de los números, con los umbrales pre-registrados. No las escribe nadie a mano.

Ver la lectura completa que genera el servidor
  • Fase 1 (registro): 55 predicciones vencidas por modelo de las 200 pre-registradas. Nada de lo que sigue es un resultado; es el estado del contador.
  • Direccion: ningun modelo bate al ritmo base; decir siempre la tasa media sigue siendo la mejor prediccion, como se esperaba.
  • claude-haiku-4-5: sus probabilidades separan los nombres (resolucion 0.072) pero en el sentido equivocado o mal calibradas: pierde 0.0109 de Brier frente al ritmo base.
  • ensemble: sus probabilidades separan los nombres (resolucion 0.024) pero en el sentido equivocado o mal calibradas: pierde 0.0026 de Brier frente al ritmo base.
  • p de la resolucion (permutacion dentro de cada sesion): claude-haiku-4-5 0.00; claude-opus-5 0.55; claude-sonnet-5 1.00; ensemble 0.07. Hace falta p < 0,05 con n >= 200 Y batir al ritmo base para hablar de skill direccional; hoy nadie lo cumple (una p baja con Brier peor que el ritmo base es discriminar al reves).
  • claude-haiku-4-5: 15 aciertos en 46 apuestas (33%), por debajo de la moneda; se moja en 46 de 55 nombres.
  • claude-opus-5: 11 aciertos en 19 apuestas (58%), por encima de la moneda, sin significacion todavia; se moja en 19 de 55 nombres.
  • claude-sonnet-5: 18 aciertos en 36 apuestas (50%), alrededor de la moneda; se moja en 36 de 55 nombres.
  • ensemble: 18 aciertos en 48 apuestas (38%), por debajo de la moneda; se moja en 48 de 55 nombres.
  • Magnitud claude-haiku-4-5: va por detras del baseline mecanico (1.94% frente a 1.59%, n=30), sin significacion todavia; banda del 80% demasiado estrecha (cobertura 0.57: 43% por debajo de q10, 0% por encima de q90).
  • Magnitud claude-haiku-4-5+barajado: va por detras del baseline mecanico (2.22% frente a 1.56%, n=10), sin significacion todavia; banda del 80% demasiado estrecha (cobertura 0.30: 70% por debajo de q10, 0% por encima de q90).
  • Magnitud claude-haiku-4-5+earnings: va por detras del baseline mecanico (2.80% frente a 1.59%, n=30), sin significacion todavia; banda del 80% demasiado estrecha (cobertura 0.50: 50% por debajo de q10, 0% por encima de q90).
  • Magnitud claude-opus-5: va por delante del baseline mecanico (1.37% frente a 1.59%, n=30), sin significacion todavia; banda del 80% bien calibrada (cobertura 0.73: 27% por debajo de q10, 0% por encima de q90).
  • Magnitud claude-opus-5+barajado: va a la par del baseline mecanico (1.54% frente a 1.56%, n=10), sin significacion todavia; banda del 80% demasiado estrecha (cobertura 0.60: 40% por debajo de q10, 0% por encima de q90).
  • Magnitud claude-opus-5+earnings: va por delante del baseline mecanico (1.40% frente a 1.59%, n=30), sin significacion todavia; banda del 80% bien calibrada (cobertura 0.77: 23% por debajo de q10, 0% por encima de q90).
  • Magnitud claude-sonnet-5: va por detras del baseline mecanico (1.90% frente a 1.59%, n=30), sin significacion todavia; banda del 80% bien calibrada (cobertura 0.77: 23% por debajo de q10, 0% por encima de q90).
  • Magnitud claude-sonnet-5+earnings: va por detras del baseline mecanico (1.78% frente a 1.59%, n=30), sin significacion todavia; banda del 80% bien calibrada (cobertura 0.80: 20% por debajo de q10, 0% por encima de q90).
  • Magnitud ensemble: va por detras del baseline mecanico (1.64% frente a 1.59%, n=30), sin significacion todavia; banda del 80% bien calibrada (cobertura 0.67: 33% por debajo de q10, 0% por encima de q90).
  • Magnitud ensemble+barajado: va por detras del baseline mecanico (2.41% frente a 1.56%, n=10), sin significacion todavia; banda del 80% demasiado estrecha (cobertura 0.30: 70% por debajo de q10, 0% por encima de q90).
  • Magnitud ensemble+earnings: va por detras del baseline mecanico (1.64% frente a 1.59%, n=30), sin significacion todavia; banda del 80% bien calibrada (cobertura 0.73: 27% por debajo de q10, 0% por encima de q90).
  • A/B claude-haiku-4-5: 30 pares (4 con evento, de 200); con el bloque de earnings el CRPS empeora un 45%.
  • A/B claude-opus-5: 30 pares (4 con evento, de 200); con el bloque de earnings el CRPS empeora un 3%.
  • A/B claude-sonnet-5: 30 pares (4 con evento, de 200); con el bloque de earnings el CRPS mejora un 6%.
  • A/B ensemble: 30 pares (4 con evento, de 200); con el bloque de earnings el CRPS empeora un 0%.
  • Ganancias en papel (1 sesion, cierre a cierre, coste 10 pb): lider provisional claude-sonnet-5 con +0.04% en 5 sesiones, frente a -2.73% de la cesta equiponderada de los mismos nombres; 4 de 4 modelos por encima de la cesta. Con 5 sesiones de 250 el lider es ruido y cambia de semana en semana (p frente a la cesta 0.29).
  • Coste: 0.39 $ hoy, 1.97 $ en 7 dias, 2.48 $ acumulado.

Actualizado 2026-09-11 12:30 UTC

Ganancias en papel

Regla fija y pre-registrada: cada nombre se toma largo o corto en proporción a lo que la probabilidad se aleja de 0,50, capital a partes iguales, una sesión de tenencia, cierre a cierre, 10 pb de coste ida y vuelta. La cesta es la misma lista de nombres comprada a partes iguales. 🏆 = mejor retorno neto entre los modelos con las mismas sesiones; con menos de 250 sesiones el líder es ruido.

ModeloVar.SesionesRet. netopb/díaSharpeMáx. caídaCestavs cestap
🏆Sonnet 5A50,04 %0,8-0,0 %-2,73 %2,77 %0,29
Sonnet 5B30,02 %0,5-0,0 %-2,98 %2,99 %
Opus 5A50,02 %0,3-0,0 %-2,73 %2,74 %0,29
Opus 5B30,01 %0,40,0 %-2,98 %2,99 %
EnsembleB30,01 %0,2-0,0 %-2,98 %2,98 %
Haiku 4.5X10,00 %0,00,0 %0,00 %-0,00 %
Opus 5X10,00 %0,00,0 %0,00 %-0,00 %
EnsembleX10,00 %0,00,0 %0,00 %-0,00 %
Haiku 4.5B3-0,01 %-0,4-0,0 %-2,98 %2,97 %
EnsembleA5-0,05 %-1,1-0,1 %-2,73 %2,67 %0,29
Haiku 4.5A5-0,23 %-4,7-0,4 %-2,73 %2,49 %0,29

Es un libro en papel medido de cierre a cierre: una ejecución real entraría en la apertura, y no se dispone de precios de apertura. Nada de esto es una recomendación.

Totales a una sesión

A = sin contexto de resultados, B = con él, X = control con el contexto barajado entre nombres. Las apuestas son los nombres en los que el modelo se separó de 0,50.

ModeloVar.nAciertos/apuestasBrierResoluciónvs ritmo baseCRPSBaselineCobertura 80 %
Haiku 4.5A5515/460,26010,0724-0,01091,94 %1,59 %0,57
Haiku 4.5X100,50 en todo0,25000,0000-0,01002,22 %1,56 %0,30
Haiku 4.5B302/60,25000,0000-0,00452,80 %1,59 %0,50
Opus 5A5511/190,24900,00390,00031,37 %1,59 %0,73
Opus 5X100,50 en todo0,25000,0000-0,01001,54 %1,56 %0,60
Opus 5B302/30,24970,0011-0,00411,40 %1,59 %0,77
Sonnet 5A5518/360,24820,00020,00101,90 %1,59 %0,77
Sonnet 5B3010/180,24910,0067-0,00351,78 %1,59 %0,80
EnsembleA5518/480,25180,0243-0,00261,64 %1,59 %0,67
EnsembleX100,50 en todo0,25000,0000-0,01002,41 %1,56 %0,30
EnsembleB3010/180,24960,0028-0,00401,64 %1,59 %0,73

Resolución > 0,02 = las probabilidades discriminan. vs ritmo base > 0 = bate a decir siempre la tasa media. CRPS: menor es mejor; el baseline es un pronóstico mecánico con la volatilidad, sin IA. Cobertura objetivo: 0,80.

A/B del contexto de resultados trimestrales

El mismo paquete con y sin el bloque de resultados (fecha, si el movimiento reciente ya es la reacción, historial de magnitud del nombre). Diferencia de CRPS pareada por sesión y nombre.

ModeloSubconjuntoParesCRPS ACRPS BCambiop
Haiku 4.5todos301,94 %2,80 %+45 %n/a
Haiku 4.5con evento42,66 %2,24 %−16 %n/a
Opus 5todos301,37 %1,40 %+3 %n/a
Opus 5con evento41,37 %1,09 %−21 %n/a
Sonnet 5todos301,90 %1,78 %−6 %n/a
Sonnet 5con evento41,33 %1,05 %−21 %n/a
Ensembletodos301,64 %1,64 %+0 %n/a
Ensemblecon evento41,46 %1,08 %−26 %n/a

Criterio pre-registrado: mejora ≥ 10 % con p < 0,05 y 200 pares con evento. El p se oculta con menos de 5 sesiones.

Por sesión

Cada celda: aciertos/apuestas · Brier · CRPS de magnitud. ½ = el modelo dijo 0,50 en todos los nombres.

SesiónSubieron|ret| medianaHaiku 4.5 AHaiku 4.5 BSonnet 5 ASonnet 5 BOpus 5 AOpus 5 B
10 sept3/102,42 %2/8 · 0,266 · 1,25 %0/3 · 0,253 · 1,92 %4/8 · 0,248 · 1,86 %4/8 · 0,250 · 1,73 %1/3 · 0,251 · 1,44 %1/1 · 0,249 · 1,27 %
9 sept6/101,69 %6/9 · 0,244 · 2,34 %1/1 · 0,248 · 3,55 %3/4 · 0,248 · 1,96 %2/3 · 0,248 · 1,85 %2/3 · 0,249 · 1,35 %1/2 · 0,250 · 1,42 %
8 sept4/103,67 %1/8 · 0,273 · 2,21 %1/2 · 0,249 · 2,94 %1/4 · 0,252 · 1,88 %4/7 · 0,249 · 1,75 %½ · 0,250 · 1,32 %½ · 0,250 · 1,52 %
4 sept4/101,97 %1/9 · 0,285 · 1,78 %2/9 · 0,255 · 2,98 %2/5 · 0,251 · 4,04 %
3 sept9/152,92 %5/12 · 0,242 · 1,91 %8/11 · 0,241 · 2,01 %6/8 · 0,246 · 2,92 %

Los nombres se eligen por movimiento reciente (los que más subieron y bajaron a 1, 5 y 21 sesiones), no por convicción: es el marco de muestreo, no una señal.

Última sesión vencida por nombre (10 sept)

Celda: probabilidad de subir / movimiento esperado.

NombreRetorno realHaiku 4.5 AHaiku 4.5 BSonnet 5 ASonnet 5 BOpus 5 AOpus 5 B
ADSK2,42 %0,46 / 3,3 %0,50 / 2,8 %0,51 / 2,2 %0,50 / 1,9 %0,50 / 2,2 %0,50 / 1,9 %
CASY-0,22 %0,45 / 4,5 %0,50 / 3,0 %0,52 / 2,7 %0,51 / 2,0 %0,50 / 3,2 %0,50 / 2,1 %
DDOG-1,58 %0,50 / 3,8 %0,50 / 8,5 %0,49 / 3,1 %0,49 / 2,9 %0,50 / 3,1 %0,50 / 2,8 %
DELL-5,37 %0,56 / 4,8 %0,50 / 4,9 %0,52 / 3,8 %0,51 / 3,3 %0,50 / 3,5 %0,50 / 3,2 %
MPC-1,76 %0,52 / 2,5 %0,51 / 4,1 %0,51 / 1,4 %0,51 / 1,3 %0,51 / 1,4 %0,50 / 1,3 %
MRNA0,75 %0,50 / 6,5 %0,50 / 6,5 %0,50 / 19,4 %0,49 / 18,1 %0,50 / 11,5 %0,50 / 10,0 %
SIG-4,59 %0,55 / 4,5 %0,51 / 10,7 %0,46 / 4,2 %0,49 / 3,9 %0,49 / 4,5 %0,49 / 3,9 %
SNDK-4,06 %0,52 / 5,0 %0,51 / 9,9 %0,51 / 4,6 %0,49 / 4,3 %0,50 / 4,6 %0,50 / 4,1 %
TPR1,90 %0,47 / 3,2 %0,50 / 2,5 %0,52 / 2,1 %0,50 / 1,7 %0,50 / 2,2 %0,50 / 1,7 %
VRT-5,62 %0,48 / 3,6 %0,50 / 8,0 %0,50 / 3,0 %0,49 / 2,8 %0,51 / 3,3 %0,50 / 2,8 %

Método: las predicciones se registran antes de la apertura y nunca sobre sesiones ya cerradas; los paquetes se guardan tal cual los vio cada modelo; los modelos no reciben titulares (licencia y memorización). El criterio de skill direccional (resolución > 0 con p < 0,05 sobre 200 predicciones) y el del A/B se escribieron antes de empezar.